$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Postępy w cytometrii przepływowej, jak również pojawienie się cytometrii masowej, pozwoliły klinicystom i naukowcom szybko zidentyfikować i fenotypowo scharakteryzować biologicznie i klinicznie interesujące próbki z nowymi poziomami rozdzielczości, tworząc duże, wysokowymiarowe zestawy danych, które są bogate w informacje1,2,3. Podczas gdy konwencjonalne metody analizy danych cytometrii przepływowej, takie jak bramkowanie ręczne, były prostsze w przypadku eksperymentów, w których jest niewiele markerów, a markery te mają wizualnie rozpoznawalne populacje, podejście to może nie generować powtarzalnych wyników podczas analizowania zestawów danych o wyższych wymiarach lub tych z markerami barwiącymi się w spektrum. Na przykład w badaniu wieloinstytucjonalnym, w którym przeprowadzano testy barwienia wewnątrzkomórkowego (ICS) w celu oceny odtwarzalności ilościowego określania odpowiedzi limfocytów T specyficznych dla antygenu, pomimo dobrej precyzji międzylaboratoryjnej, analiza, w szczególności bramkowania, wprowadziła istotne źródło zmienności4. Co więcej, proces ręcznego bramkowania populacji interesów, oprócz tego, że jest wysoce subiektywny, jest bardzo czasochłonny i pracochłonny. Jednak problem analizowania wielowymiarowych zbiorów danych w sposób solidny, wydajny i terminowy nie jest niczym nowym w naukach badawczych. Badania ekspresji genów często generują niezwykle wielowymiarowe zestawy danych (często rzędu setek genów), podczas gdy ręczne formy analizy byłyby po prostu niewykonalne. Aby poradzić sobie z analizą tych zestawów danych, włożono wiele pracy w opracowanie narzędzi bioinformatycznych do analizowania danych dotyczących ekspresji genów5. Te podejścia algorytmiczne zostały niedawno przyjęte w analizie danych cytometrycznych, ponieważ liczba parametrów wzrosła i okazały się nieocenione w analizie tych wielowymiarowych zestawów danych6,7.
Pomimo generowania i stosowania różnorodnych algorytmów i pakietów oprogramowania, które pozwalają naukowcom na zastosowanie tych wielowymiarowych podejść bioinformatycznych do danych cytometrii przepływowej, te techniki analityczne nadal pozostają w dużej mierze nieużywane. Chociaż może istnieć wiele czynników, które ograniczyły powszechne zastosowanie tych podejść do danych cytometrycznych8, główną przeszkodą, którą podejrzewamy w stosowaniu tych podejść przez naukowców, jest brak wiedzy obliczeniowej. W rzeczywistości wiele z tych pakietów oprogramowania (tj. flowCore, flowMeans i OpenCyto) jest napisanych tak, aby można je było zaimplementować w językach programowania, takich jak R, które nadal wymagają merytorycznej wiedzy programistycznej. Pakiety oprogramowania, takie jak FlowJo, znalazły uznanie wśród naukowców ze względu na prostotę obsługi i charakter "plug-n-play", a także kompatybilność z systemem operacyjnym PC. Aby zapewnić różnorodność akceptowanych i cennych technik analitycznych naukowcom niezaznajomionym z programowaniem, opracowaliśmy ExCYT, graficzny interfejs użytkownika (GUI), który można łatwo zainstalować na komputerze PC/Mac, który wykorzystuje wiele najnowszych technik, w tym redukcję wymiarowości w celu intuicyjnej wizualizacji, różnorodne metody grupowania cytowane w literaturze, wraz z nowatorskimi funkcjami do zbadania wyników tych algorytmów grupowania z mapami cieplnymi i nowatorskimi wielowymiarowymi wykresami przepływu/skrzynkowymi.
ExCYT to graficzny interfejs użytkownika wbudowany w MATLAB, dlatego może być uruchamiany bezpośrednio w MATLAB lub dostarczany jest instalator, który może być użyty do zainstalowania oprogramowania na dowolnym komputerze PC/Mac. Oprogramowanie jest dostępne pod adresem https://github.com/sidhomj/ExCYT. Przedstawiamy szczegółowy protokół importu danych, ich wstępnego przetwarzania, przeprowadzania redukcji wymiarowości t-SNE, danych klastrowych, sortowania i filtrowania klastrów w oparciu o preferencje użytkownika oraz wyświetlania informacji o interesujących klastrach za pomocą map cieplnych i nowatorskich wysokowymiarowych wykresów przepływowych/pudełkowych (Rysunek 1). Osie na wykresach t-SNE są dowolne i w dowolnych jednostkach i jako takie nie zawsze są pokazane na rysunkach dla uproszczenia interfejsu użytkownika. Kolorowanie punktów danych w "mapach cieplnych t-SNE" jest od niebieskiego do żółtego w zależności od sygnału wskazanego znacznika. W rozwiązaniach klastrowych kolor punktu danych jest oparty na dowolnym numerze klastra. Wszystkie części przepływu pracy mogą być realizowane w jednopanelowym graficznym interfejsie użytkownika (Rysunek 2 i Tabela 1)". Na koniec zademonstrujemy zastosowanie ExCYT na wcześniej opublikowanych danych badających krajobraz immunologiczny raka nerkowokomórkowego w literaturze, również analizowanych podobnymi metodami. Przykładowy zestaw danych, którego użyliśmy do stworzenia rysunków w tym manuskrypcie wraz z poniższym protokołem, można znaleźć pod adresem https://premium.cytobank.org/cytobank/projects/875, po zarejestrowaniu konta.