Niniejszy schemat pracy został opracowany w celu przeprowadzenia obróbki zamrożonych próbek ludzkiej tkanki IMAT w celu uzyskania profili ekspresji genów w rozdzielczości pojedynczych jąder, co umożliwia identyfikację typów komórek. W niniejszej procedurze zaprezentowano jedną reprezentatywną próbkę IMAT pochodzącą od uczestnika badania SOMMA.
Pierwszym krokiem każdej analizy danych snRNA-seq jest ocena jakości danych w celu zidentyfikowania jąder o niskiej jakości, które potencjalnie powinny zostać usunięte ze zbioru danych. Co istotne, kroki filtrowania oraz progi powinny zostać określone dla konkretnego rodzaju próbki i posiadanego zbioru danych, ponieważ powszechnie oceniane mierniki mogą różnić się w zależności od tkanek i typów komórek22,23. Rycina 4A przedstawia wizualizację niektórych kluczowych mierników stosowanych do oceny jakości wygenerowanych danych snRNA-seq. Liczba genów wykrytych na jądro zależy od głębokości sekwencjonowania i typu komórki, jednak w przypadku jąder dobrej jakości spodziewana wartość powinna przekraczać 20018,23. Stwierdzono, że dane wygenerowane przy użyciu niniejszego protokołu mieszczą się w oczekiwanym zakresie, z medianą 1134 genów na jądro, przy całkowitej liczbie 4662 jąder.
Ocenia się odsetek odczytów mitochondrialnych, ponieważ wysoki stopień kontaminacji mitochondrialnej może wynikać z uszkodzeń jąder komórkowych lub przyłączenia się zewnętrznego RNA do jąder, co wskazuje na niską jakość tych struktur. W prezentowanym tutaj zestawie danych stwierdzono medianę odsetka odczytów mitochondrialnych na poziomie 2,65, co znajduje się znacznie poniżej progu 5%-20% powszechnie stosowanego w literaturze24,25,26. Odsetek odczytów rybosomalnych różni się w zależności od typu komórek i tkanki. Jednakże, ponieważ duże proporcje genów rybosomalnych mogą wpływać na klasteryzację danych, zaleca się sprawdzenie odsetka odczytów rybosomalnych i ewentualne usunięcie genów rybosomalnych lub jąder z wysokim poziomem genów rybosomalnych z zestawu danych przed przeprowadzeniem klasteryzacji. Dane wygenerowane zgodnie z niniejszym protokołem wykazały niski poziom odczytów rybosomalnych z medianą 2,46% i maksymalną wartością 16,5%, w związku z czym nie zastosowano filtrowania w oparciu o tę metrykę. Na koniec obliczono wskaźnik złożoności komórki na podstawie log(10) liczby wykrytych genów podzielonej przez log(10) liczby wykrytych odczytów. Oczekuje się, że wysokiej jakości jądra będą miały wartość powyżej 0,8; w próbce użytej w niniejszym badaniu uzyskano medianę 0,92. Na podstawie tych metryk kontroli jakości można zdecydować, które jądra należy odfiltrować z zestawu danych. Do analizy zdecydowaliśmy się odfiltrować jądra z mniej niż 200 lub więcej niż 10 000 genów na jądro, odsetkiem odczytów mitochondrialnych przekraczającym 10% oraz wskaźnikiem złożoności poniżej 0,8.
Po wstępnej ocenie jakości i etapie filtrowania można wygenerować wykres UMAP, aby zwizualizować grupowanie jąder. Klasteryzację przeprowadzono w oparciu o 2000 najbardziej zmiennych genów z zastosowaniem transformacji SCT. Wstępne etapy grupowania mogą służyć do sprawdzenia, czy cechy QC grupują się razem, np. jądra z wysoką liczbą odczytów mitochondrialnych. Ponadto informacje o klastrach są wymagane dla niektórych metod detekcji dubletów, w tym DoubletFinder20, który został wykorzystany w niniejszym protokole. DoubletFinder zastosowano z oczekiwaną stopą multipletów ustawioną na 4,8%, zgodnie z sugestią dostawców platformy opartej na kropelkach. Po usunięciu dubletów oszacowano poziom zanieczyszczenia wolnym RNA (ambient RNA), co jest szczególnie powszechne w preparatach pojedynczych jąder, ponieważ RNA uwalnia się z cytoplazmy podczas lizy komórek, przedostaje się do kropelek Gel Beads-in-emulsion (GEMs) i ulega amplifikacji w kolejnych etapach przygotowania biblioteki. W związku z tym opracowano kilka narzędzi do korekty problemu zanieczyszczenia wolnym RNA (patrz Tabela 3). Wykorzystano pakiet R decontX21, w którym surowa macierz tła (zawierająca tylko puste kropelki) służy do skorygowania macierzy ekspresji genów, co wzmacnia rzeczywisty sygnaturę ekspresji genów.
Klastrowanie i zdolność do wykrywania rzadkich typów komórek zależą od liczby jąder. W niniejszym badaniu, po filtracji QC, usunięciu dubletów i korekcie RNA tła, zidentyfikowano wszystkie oczekiwane główne typy komórek w IMAT (Rycina 4B) z łącznej liczby 3817 jąder. Obejmowały one komórki macierzyste, fibro-adipogenne komórki progenitorowe (FAPs) i dojrzałe adipocyty, a także perycyty, komórki mięśni gładkich, komórki układu odpornościowego, komórki progenitorowe mięśni oraz mionukleidy pochodzące z zanieczyszczenia komórkami mięśni szkieletowych.
Podsumowując, wykazaliśmy, że niniejszy protokół pozwala na uzyskanie danych o pojedynczych jądrach o wysokiej rozdzielczości, co umożliwia adnotację typów komórek istotną dla wyjaśnienia biologii i pochodzenia komórkowego IMAT.

Rysunek 4: Ocena jakości, klastrowanie i adnotacja typów komórek w danych sekwencyjnych. (A) Wykresy skrzypcowe kluczowych parametrów do oceny próbek i wydajności sekwencjonowania, w tym liczby genów wykrytych na jądro, procenta odczytów mitochondrialnych, procenta odczytów rybosomalnych oraz złożoności komórkowej mierzonej jako log(10) liczby wykrytych genów podzielone przez log(10) liczby wykrytych odczytów. Wartości mediany dla każdego parametru przedstawiono w zamkniętych polach. Całkowita liczba jąder: 4662. (B) Wykres UMAP przedstawiający klastrowanie poszczególnych jąder oraz odpowiadający mu wykres DotPlot ukazujący względną ekspresję genów markerowych dla typów komórek w każdym klastrze po filtrowaniu. Liczba jąder: 3817. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Plik uzupełniający 1: Kod do analizy QC i klastrowania. Kliknij tutaj, aby pobrać ten plik.