$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Ten przepływ pracy został zaprojektowany, aby kierować przetwarzaniem zamrożonych próbek IMAT człowieka w celu uzyskania profili ekspresji genów w rozdzielczości pojedynczych jąder, umożliwiając identyfikację typu komórki. W tym miejscu przedstawiono jedną reprezentatywną próbkę IMAT od uczestnika badania SOMMA.
Pierwszym krokiem każdej analizy danych sekwencyjnych snRNA jest ocena jakości danych w celu zidentyfikowania jąder niskiej jakości, które potencjalnie powinny zostać usunięte ze zbioru danych. Co ważne, kroki i progi filtrowania powinny być określone dla konkretnego typu próbki i zestawu danych, które masz pod ręką, ponieważ powszechnie oceniane wskaźniki mogą się różnić w zależności od typu tkanek i komórek22,23. Rysunek 4A przedstawia wizualizacje niektórych kluczowych wskaźników używanych do oceny jakości generowanych danych sekwencyjnych snRNA. Liczba wykrytych genów w jądrze zależy od głębokości sekwencjonowania i typu komórki, ale oczekuje się, że będzie wyższa niż 200 dla jąder dobrej jakości18,23. Stwierdzono, że dane wygenerowane przy użyciu tego protokołu mieszczą się w oczekiwanym zakresie z medianą 1134 genów na jądro, z łącznej liczby 4662 jąder.
Procent odczytów mitochondriów jest oceniany, ponieważ wysoki stopień zanieczyszczenia mitochondriów może wynikać z uszkodzonych jąder lub otaczającego RNA przyczepiającego się do jąder, co wskazuje na niską jakość jąder. W przedstawionym tutaj zestawie danych stwierdzono medianę procentu odczytu mitochondriów wynoszącą 2,65, czyli znacznie poniżej progu 5%-20% powszechnie stosowanego w literaturze24,25,26. Odsetek odczytów rybosomalnych różni się w zależności od typu komórek i tkanek. Ponieważ jednak duże proporcje genów rybosomalnych mogą wpływać na grupowanie danych, zaleca się sprawdzenie procentu odczytu rybosomalnego i potencjalne usunięcie genów rybosomalnych lub jąder z wysokim poziomem genów rybosomalnych ze zbioru danych przed grupowaniem. Dane wygenerowane za pomocą tego protokołu wykazały niski poziom odczytów rybosomalnych z medianą 2,46% i maksimum 16,5%, dlatego nie filtrowaliśmy na podstawie tej metryki. Na koniec obliczono wynik złożoności komórki na podstawie logarytmu (10) liczby wykrytych genów podzielonej przez logarytm (10) liczby wykrytych odczytów. Oczekuje się, że dobrej jakości jądra będą powyżej 0,8, a medianę 0,92 uzyskano w próbce użytej w tym badaniu. Na podstawie tych wskaźników kontroli jakości można zdecydować, które jądra odfiltrować ze zbioru danych. Do analizy zdecydowaliśmy się odfiltrować jądra z mniej niż 200 lub więcej niż 10 000 genów na jądro, więcej niż 10% odczytów mitochondrialnych i wynikiem złożoności poniżej 0,8.
Po wstępnym etapie oceny jakości i filtrowania, można wygenerować UMAP do wizualizacji grupowania jąder. Grupowanie przeprowadzono w oparciu o 2000 najbardziej zmiennych genów za pomocą transformacji SCT. Początkowe etapy grupowania można wykorzystać do sprawdzenia, czy którakolwiek z cech QC grupuje się razem, np. jądra o wysokich odczytach mitochondrialnych. Co więcej, informacje o grupowaniu są wymagane dla niektórych metod wykrywania dubletów, w tym DoubletFinder20, który był używany w tym protokole. Użyto DoubletFinder z oczekiwaną szybkością wielokrotności ustaloną na 4,8%, zgodnie z sugestią dostawców platformy opartej na kropelkach. Po usunięciu dubletu oszacowano poziom zanieczyszczenia RNA w otoczeniu, co jest szczególnie powszechne w preparatach pojedynczych jąder, ponieważ RNA jest uwalniane z cytoplazmy podczas lizy komórki i jest dozowane do żelowych kulek w emulsji (GEMs) i amplifikowane w następujących etapach przygotowania biblioteki. W związku z tym opracowano kilka narzędzi w celu skorygowania nieodłącznego problemu zanieczyszczenia RNA w otoczeniu (patrz Tabela 3). Użyliśmy pakietu R decontX21, w którym surowa matryca tła (zawierająca tylko puste kropelki) jest używana do dostosowania macierzy ekspresji genów, zwiększając rzeczywistą sygnaturę ekspresji genów.
Grupowanie i zdolność do wykrywania typów komórek o niskiej liczebności zależy od liczby jąder. W tym badaniu wykryto wszystkie oczekiwane główne typy komórek w IMAT (Figura 4B) z łącznej liczby 3817 jąder po filtrowaniu QC, usunięciu dubletu i dostosowaniu otaczającego RNA. Obejmowały one komórki macierzyste, włóknisto-adipogenne komórki progenitorowe (FAP) i dojrzałe adipocyty, a także perycyty, komórki mięśni gładkich, komórki odpornościowe, komórki progenitorowe mięśni i mięśnie po zanieczyszczeniu komórek mięśni szkieletowych.
Ogólnie rzecz biorąc, wykazaliśmy, że ten protokół generuje dane o pojedynczych jądrach o wysokiej rozdzielczości, umożliwiając wykrycie adnotacji typu komórki, ważnej dla rozwikłania biologii i komórkowego pochodzenia IMAT.

Rysunek 4: Ocena jakości, grupowanie i adnotacja typu komórki w danych sekwencjonowania. (A) Wykresy skrzypcowe z podstawowymi wskaźnikami do oceny próbki i wydajności sekwencjonowania, w tym liczbą wykrytych genów w jądrze, procentem odczytów mitochondrialnych, procentem odczytów rybosomalnych i złożonością komórki mierzoną jako log(10) liczba wykrytych genów podzielona przez log(10) liczbę wykrytych odczytów. Mediany wartości dla każdej metryki są podane w zamkniętych polach. Łączna liczba jąder: 4662. (B) UMAP przedstawiający grupowanie pojedynczych jąder i odpowiadający im DotPlot pokazujący względną ekspresję genów markera typu komórki dla każdego klastra po filtrowaniu. Liczba jąder: 3817. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
Plik uzupełniający 1: Kod do analizy QC i klastrów. Kliknij tutaj, aby pobrać ten plik.