Пространственная транскриптомика (ST) представляет собой группу инновационных технологий, позволяющих измерять экспрессию генов во всем геноме, сохраняя при этом пространственные координаты молекул матричной РНК (mRNA) в срезах тканей. Методы ST включают подходы на основе секвенирования с использованием массивов с позиционным баркодингом и методы визуализации in situ, которые картируют транскрипционные сигналы внутри неповрежденных микроокружений ткани1,2. Благодаря сохранению пространственного контекста, ST позволяет анализировать архитектуру ткани, организацию клеточного соседства, межклеточную коммуникацию и связанные с микроокружением биологические процессы, которые невозможно полностью изучить после диссоциации ткани3.
Стремительный рост публичных репозиториев данных ST создал беспрецедентные возможности для вторичного анализа и разработки новых методов3. Такие ресурсы, как база данных CROST, аккумулируют сотни наборов данных пространственной транскриптомики для различных видов и технологических платформ, в то время как специализированные коллекции, такие как STOmicsDB, сосредоточены на конкретных методологиях, например Stereo-seq4,5. Несмотря на изобилие данных, вычислительный анализ остается сложной задачей из-за сложности структур пространственных данных, разнообразия аналитических инструментов и технических препятствий при внедрении воспроизводимых рабочих процессов6,7,8,9,10,11.
Для преодоления ограничений, связанных с использованием одной программной среды, в данной работе представлен интегрированный вычислительный рабочий процесс, использующий взаимодополняющие аналитические инструменты. Существующие комплексные экосистемы для анализа ST включают преимущественно Seurat, Giotto и фреймворки на базе Python, такие как Squidpy6,7,12. Хотя инструменты на базе Python, такие как Squidpy, предоставляют широкие возможности для анализа пространственных графов, объединение основного вычислительного конвейера в рамках одного языка программирования минимизирует технические сложности при взаимодействии между разными языками. Следовательно, основной конвейер реализован преимущественно на языке R для снижения этих технических трудностей. В данном рабочем процессе на базе R пакет Seurat используется для загрузки данных, контроля качества, нормализации, снижения размерности, визуализации и интеграции нескольких образцов, что отражает его широкое применение в рабочих процессах секвенирования единичных клеток и пространственной транскриптомики. Затем Giotto применяется для построения пространственных сетей и анализа межклеточных взаимодействий на основе лиганд-рецепторных пар. Таким образом, данный конвейер объединяет предварительную обработку и интеграцию на базе Seurat с пространственным анализом на базе Giotto, обеспечивая при этом явный и воспроизводимый перенос данных между двумя наборами инструментов.
В рамках данного подхода реализованы две взаимодополняющие стратегии деконволюции: SPOTlight — метод с использованием референса, который применяет данные scRNA-seq для оценки пропорций типов клеток, и STdeconvolve — метод обучения без учителя на основе тематического моделирования, который выявляет латентные транскрипционные паттерны8,11. Результаты этих методов предоставляют взаимодополняющие представления о пространственной клеточной гетерогенности, однако они не рассматриваются как количественная перекрестная проверка, если пользователь не выполняет дополнительный анализ конкордантности, описанный в протоколе. Для интерактивной аннотации областей интереса (ROI) интегрировано специализированное приложение на Python Dash под названием Select Spatial Spots, которое экспортирует стандартные файлы аннотаций на основе координат, пригодные для последующего анализа.
Что касается практической применимости, данный рабочий процесс предназначен прежде всего для стандартных данных ST на основе массивов (например, Visium с разрешением 55 µm) и может быть адаптирован для других типов тканей после оценки параметров. Перед началом анализа следует учитывать основные ограничения. Во-первых, модуль деконволюции с использованием референса зависит от наличия высококачественного scRNA-seq референса, соответствующего типу ткани. Во-вторых, платформы с субклеточным разрешением или разрешением, близким к одноклеточному, могут потребовать модифицированной предварительной обработки, агрегации пространственных бинов или сегментации клеток на основе изображений перед интеграцией2. Репрезентативный набор данных толстой кишки мыши используется в качестве демонстрационного примера, чтобы показать, как данный рабочий процесс может оценивать пространственные домены и организацию тканей, определяемую маркерами, а не как доказательство универсальной совместимости платформы.