August 1st, 2025
Здесь мы представляем пошаговый визуальный рабочий процесс для анализа набора данных транскриптомики временного хода одной клетки заживления ран на коже мышей с помощью R. Протокол включает в себя стандартный конвейер для загрузки наборов данных, контроля качества, визуализации и аннотаций типов клеток с помощью Seurat, а также анализ межклеточного взаимодействия с помощью CellChat.
В нашей лаборатории мы используем новые инструменты, такие как одноклеточная и пространственная транскриптомика, с подходами системной биологии и биоинформатики для исследования пространственно-временной клеточной динамики дифференциальных результатов заживления. В последние годы мы наблюдаем быстрое внедрение транскриптомики одиночных клеток для изучения заживления ран у людей и у модельных организмов, таких как мыши. Полный анализ наборов данных об отдельных клетках является непосильным для лабораторных ученых, не имеющих практически никакого опыта в биоинформатике. Это означает, что слишком часто наборы данных об отдельных клетках недостаточно используются учеными в области заживления ран. Это первый комплексный протокол, который не предполагает предварительного опыта работы с биоинформатикой, который проходит весь путь от загрузки набора данных до вывода соответствующих анализов в контексте исследований заживления ран. Наш протокол должен служить шаблоном для исследователей заживления ран, чтобы они могли более полно анализировать свои собственные наборы данных об отдельных клетках и иметь возможность извлекать новые идеи из общедоступных наборов данных.
[Шалин] Для начала перейдите к файлам наборов данных из омнибусного репозитория экспрессии генов, используя номер доступа GSE204777. Нажмите на первый набор данных под названием GSM6190913. Прокрутите страницу GSM6190913 вниз и загрузите три перечисленных файла, используя FTP или HTML ссылки. С помощью проводника компьютера переместите загруженные файлы в каталог с именем b1, убедившись, что он находится в рабочем каталоге. Получите сведения о пути к каталогу для загруженных файлов секвенирования отдельных ячеек. Теперь загрузите файлы секвенирования отдельных ячеек в рабочую среду. Затем отделите данные экспрессии генов и мультиплексирования HTO от рабочего набора данных. Создайте объект Сёра, используя данные об экспрессии генов, отфильтровав гены, обнаруженные менее чем в пяти клетках, и клетки с менее чем 200 генами. Для наборов данных, в которых отсутствуют данные HTO, создайте объект Seura с теми же параметрами фильтрации и переключитесь на анализ экспрессии генов. Рассчитайте процент митохондриальных генов в каждой клетке и присвойте это значение в качестве переменной метаданных. Визуализируйте распределение количества генов, общей РНК и процентного соотношения митохондриальных генов во всех клетках. Удалите клетки с содержанием митохондрий, превышающим 25%, используя пороговое значение, и визуализируйте обновленные распределения после фильтрации этих клеток низкого качества. Выявляйте вероятные дублеты с помощью метода искателя дублетов SC. Запустите конвейер поиска дублетов SC с помощью команд и назначьте полученные оценки дублета в качестве новой переменной метаданных. Теперь визуализируйте распределение дуплетов по всем ячейкам. Удалите все ячейки с оценкой дублета выше 0,25 и сохраните очищенный объект Seura в виде файла RDS в рабочем каталоге. Выполняйте нормализацию данных, масштабирование и анализ главных компонент. Визуализируйте вклад вариации по первым 50 основным компонентам. Кластеризуйте ячейки, используя первые 13 основных компонент и разрешение кластеризации 0,1. Выполните равномерную аппроксимацию и проекцию многообразия, или уменьшение UMAP в анализе соседей, используя первые 13 основных компонент, и установите начальное число равным 123. Теперь визуализируйте кластеризацию ячеек на графике UMAP, за которой следуют аннотации времени и пространства намотки на графике UMAP. Затем сгенерируйте таблицу, связывающую кластеры клеток с аннотациями времени и пространства намотки. Определение идентичности основных типов клеток после вычисления дифференциально экспрессируемых генов между всеми кластерами и присвоение полученных списков DEG переменной перед их сохранением в виде текстового файла с разделителями в рабочем каталоге. Теперь откройте файл маркеров кластера наборов данных в приложении для работы с электронными таблицами. Используйте мастер импорта текста, чтобы установить запятую в качестве разделителя и отформатировать столбцы имен генов в виде текста, чтобы предотвратить автоматическое преобразование имен генов в даты. В электронной таблице ранжируйте среднее значение столбца log two FC от большего к меньшему, чтобы упорядочить строки, уменьшив значения изменения log в два раза, за которым следует столбец кластера от наименьшего к большему. Чтобы упорядочить строки путем увеличения номеров кластеров Сёра, отфильтруйте среднее значение столбца FC log two так, чтобы в него были включены только значения, превышающие или равные 2,5, а затем отфильтруйте столбец PCT 1, включив в него значения больше или равные 0,4. Затем отфильтруйте столбец PCT 2, включив в него значения, меньшие или равные 0,2. Наконец, отфильтруйте скорректированный столбец P-значения, включив в него значения, меньшие или равные 0,01. Теперь откройте веб-инструмент анализа обогащения Enrichr. Для каждого кластера скопируйте список дифференциально экспрессируемых генов в отдельное окно Enrichr и нажмите кнопку Анализировать. Затем перейдите на вкладку «Типы ячеек» над выходными данными анализа и сосредоточьтесь на пяти основных обогащениях в трех курируемых базах данных маркеров клеток. Основываясь на максимальных обогащениях из анализа Enrichr, присвойте вероятным идентичностям восемь кластеров. Объедините второй и шестой кластеры в одну аннотацию, помеченную фибробластами, и назначьте эти аннотации в качестве новой переменной метаданных с именем «Типы клеток». Затем визуализируйте аннотированные типы клеток на графике UMAP и отобразите локализацию выделенных жирным шрифтом генов маркеров верхнего кластера на серии графиков UMAP. Визуализируйте гены верхнего кластерного маркера, дифференциально экспрессирующиеся на точечной диаграмме, сгруппированной по исходным номерам кластеров, а затем снова гены верхних маркеров на точечной диаграмме, на этот раз сгруппированные по аннотированным типам клеток. Чтобы подготовиться к анализу временных рядов, удалите пространственные аннотации и упростите набор данных. Переназначьте метаданные о времени и пространстве ранения в новую переменную DPW для дней после ранения. Визуализируйте новые группировки временных курсов DPW на графике UMAP и сгенерируйте таблицы, показывающие количество ячеек каждого типа в каждой группе DPW. Затем преобразуйте количество клеток в пропорции, чтобы оценить относительные изменения в составе типов клеток во время заживления и визуализировать долю каждой категории DPW в каждом типе клеток. Наконец, визуализируйте пропорции каждого типа ячеек в каждой группе DPW и сохраните окончательный объект Seurat, содержащий все аннотации и фильтры, в виде файла RDS в рабочем каталоге. Все ячейки в наборе данных четко сгруппированы в основные типы клеток с цветовой кодировкой на графике UMAP, что подтверждает успешное аннотирование на основе обогащенных сигнатур типов клеток. Высокая экспрессия генов топовых кластерных маркеров была локализована в соответствующих кластерах типов клеток на графиках UMAP. Визуализация точечной диаграммы подтвердила, что самые высокие уровни экспрессии генов кластерных маркеров были ограничены их аннотированными основными типами клеток. Диаграмма показала, что нейтрофилы и макрофаги доминировали в первый день после ранения, в то время как фибробласты, эпителиальные и эндотелиальные клетки стали более распространенными в более поздние моменты времени, отражая известный клеточный каскад заживления ран.
Эта статья представляет полный протокол для анализа одноклеточных транскриптомных данных временных рядов, связанных с заживлением кожи мыши, с использованием R. Рабочий процесс проводит исследователей через загрузку набора данных, контроль качества, визуализацию и аннотацию типов клеток.
Single-cell transcriptomics enables high-resolution mapping of cellular heterogeneity and dynamic cell-cell interactions during tissue repair, directly informing target validation and mechanistic de-risking in regenerative medicine. This protocol operationalizes robust, reproducible workflows for analyzing wound healing datasets, lowering barriers for cross-functional teams to extract actionable insights from complex single-cell data. By standardizing quality control, annotation, and interaction analysis, the workflow enhances predictive confidence and supports risk-adjusted portfolio decisions in early discovery and translational research.
This workflow bridges early discovery, screening, and translational research by enabling standardized single-cell analysis from dataset acquisition to cell-cell interaction mapping.