$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Этот рабочий процесс был разработан для управления обработкой замороженных образцов IMAT человека для получения профилей экспрессии генов с разрешением одного ядра, что позволяет идентифицировать тип клеток. Здесь представлена одна репрезентативная выборка IMAT от участника исследования SOMMA.
Первым шагом любого анализа данных snRNA-seq является оценка качества данных для выявления ядер низкого качества, которые потенциально должны быть удалены из набора данных. Важно отметить, что шаги фильтрации и пороговые значения должны быть определены для конкретного типа образца и набора данных, которые у вас есть, поскольку обычно оцениваемые метрики могут отличаться в зависимости от тканей и типов клеток22,23. На рисунке 4A представлены некоторые ключевые метрики, используемые для оценки качества сгенерированных данных snRNA-seq. Количество генов, обнаруженных на ядро, зависит от глубины секвенирования и типа клетки, но ожидается, что оно будет выше 200 для ядерхорошего качества 18,23. Было обнаружено, что данные, полученные с использованием этого протокола, находятся в пределах ожидаемого диапазона со средним значением 1134 гена на ядро из общего числа 4662 ядер.
Процент митохондриальных прочтений оценивается, поскольку высокая степень загрязнения митохондрий может возникать из-за повреждения ядер или прикрепления к ядрам РНК окружающей среды, что указывает на некачественные ядра. В представленном здесь наборе данных средний процент чтения митохондрий составил 2,65, что значительно ниже порога в 5-20%, обычно используемого в литературе 24,25,26. Процент рибосомных прочтений различается в зависимости от типа клеток и тканей. Однако, поскольку большие доли рибосомных генов могут влиять на кластеризацию данных, рекомендуется проверить процент чтения рибосомных генов и потенциально удалить рибосомные гены или ядра с высоким уровнем рибосомных генов из набора данных перед кластеризацией. Данные, сгенерированные с помощью этого протокола, показали низкий уровень рибосомных прочтений с медианой 2,46% и максимумом 16,5%, поэтому мы не фильтровали на основе этой метрики. Наконец, оценка сложности клеток была рассчитана на основе log(10) числа обнаруженных генов, разделенного на log(10) количество обнаруженных прочтений. Ожидается, что ядра хорошего качества будут выше 0,8, а медиана 0,92 была получена в выборке, использованной в этом исследовании. На основе этих метрик контроля качества можно решить, какие ядра следует отфильтровать из набора данных. Для анализа мы решили отфильтровать ядра с менее чем 200 или более 10 000 генов на ядро, более 10% митохондриальных прочтений и оценкой сложности ниже 0,8.
После начальной оценки качества и фильтрации может быть сгенерирован UMAP для визуализации кластеризации ядер. Кластеризация проводилась на основе 2000 наиболее вариабельных генов с использованием SCT-трансформации. Начальные этапы кластеризации могут быть использованы для проверки того, кластеризуются ли вместе какие-либо функции контроля качества, например, ядра с высоким уровнем митохондриального чтения. Кроме того, информация о кластеризации требуется для некоторых методов обнаружения дублетов, в том числе для DoubletFinder20, который использовался в этом протоколе. DoubletFinder использовался с ожидаемой скоростью мультиплета, установленной на уровне 4,8%, как предлагали поставщики платформы, основанной на дроплетах. После удаления дублета оценивали уровень контаминации РНК в окружающей среде, который особенно характерен для одноядерных препаратов, поскольку РНК высвобождается из цитоплазмы при лизисе клетки и диспонируется в гелевые бусины в эмульсии (GEMs) и амплифицируется на следующих этапах подготовки библиотеки. Следовательно, было разработано несколько инструментов для коррекции внутренней проблемы загрязнения окружающей среды РНК (см. Таблицу 3). Мы использовали R-пакет decontX21, в котором исходная фоновая матрица (включающая только пустые капли) используется для настройки матрицы экспрессии генов, усиливая реальную сигнатуру экспрессии генов.
Кластеризация и способность обнаруживать малораспространенные типы клеток зависят от количества ядер. В этом исследовании были обнаружены все ожидаемые основные типы клеток в IMAT (рис. 4B) из 3817 ядер после фильтрации QC, удаления дублетов и настройки РНК окружающей среды. К ним относятся стволовые клетки, фиброадипогенные предшественники (FAP) и зрелые адипоциты, а также перициты, гладкомышечные клетки, иммунные клетки, мышечные клетки-предшественники и мионудры из загрязненных скелетных мышечных клеток.
В целом, мы продемонстрировали, что этот протокол позволяет получать данные об отдельных ядрах с высоким разрешением, что позволяет обнаруживать аннотации типов клеток, важных для разгадки биологии и клеточного происхождения IMAT.

Рисунок 4: Оценка качества, кластеризация и аннотация типов клеток данных секвенирования. (A) Графики Скрипки с основными метриками для оценки выборки и производительности секвенирования, включая количество обнаруженных генов на ядро, процент митохондриальных прочтений, процент рибосомных прочтений и сложность клетки, измеренные путем деления числа обнаруженных генов log(10) на количество обнаруженных прочтений log(10). Медианные значения для каждой метрики приведены в закрытых полях. Общее количество ядер: 4662. (B) UMAP отображает кластеризацию отдельных ядер и соответствующую диаграмму DotPlot, показывающую относительную экспрессию генов маркеров клеточного типа для каждого кластера после фильтрации. Количество ядер: 3817. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Дополнительный файл 1: Код для контроля качества и кластерного анализа. Пожалуйста, нажмите здесь, чтобы загрузить этот файл.