- Aby przedstawić koncepcyjny przegląd analizy wielowymiarowej, możemy wyobrazić sobie bardzo prostą sytuację: hipotetyczny zestaw danych dla 50 uczestników, w którym zmierzono tylko trzy obszary mózgu, oznaczone jako woksele (=trójwymiarowe piksele na Rysunku 1). (Wstaw tutaj Rysunek 1, przeczytaj podpis jako lektor.)
- Ogólnym celem analizy wielowymiarowej jest zidentyfikowanie głównych źródeł wariancji w danych, a następnie opisanie głównych efektów będących przedmiotem zainteresowania w zależności od tych źródeł wariancji. Rysunek 2 przedstawia uproszczony przykład. (Wstaw tutaj Rysunek 2, przeczytaj podpis jako lektor.)
- Przystępujemy teraz do zastosowania analizy jednowymiarowej i wielowymiarowej do klinicznego zestawu danych. Pobraliśmy skany PET z FDG w stanie spoczynku dla 95 pacjentów we wczesnym stadium choroby Alzheimera oraz 102 osób z grupy kontrolnej dopasowanej pod względem wieku ze strony internetowej Alzheimer's Disease Neuroimaging Initiative (http://www.loni.ucla.edu/ADNI/). Losowo wybraliśmy po 20 skanów pacjentów i osób z grupy kontrolnej i wyznaczyliśmy je jako naszą próbę pochodną. Pozostałe odpowiednio 75 i 82 skany stanowią naszą próbę replikacyjną. Teraz w próbie pochodnej zostaną wyznaczone jednowymiarowe i wielowymiarowe markery choroby Alzheimera (AD), a ich skuteczność diagnostyczna zostanie przetestowana w próbie replikacyjnej.
- W przypadku markera jednowymiarowego porównujemy 20 skanów AD z 20 skanami kontrolnymi w próbie pochodnej i wybieramy lokalizację w mózgu, która wykazuje największy spadek sygnału PET u pacjentów z AD, co wykazuje test T. Aby przetestować skuteczność diagnostyczną tego obszaru, sprawdzamy dane w próbie replikacyjnej w tej lokalizacji i wykreślamy sygnał PET jako funkcję stanu choroby.
- W przypadku markera wielowymiarowego najpierw przeprowadzamy PCA na połączonych 40 skanach w próbie pochodnej, a następnie konstruujemy wzorzec kowariancji z pierwszych 5 Głównych Składników, których współczynnik skalowania obiektu wykazuje maksymalną średnią różnicę między pacjentami z AD a zdrową grupą kontrolną. (Szczegóły można znaleźć w tych reprezentatywnych pracach 2.) Uzyskany z próby pochodnej diagnostyczny wzorzec kowariancji jest następnie prospektywnie stosowany do próby replikacyjnej. Wynikowe współczynniki skalowania obiektów są wykreślane jako funkcja stanu choroby.
- Aby zapewnić bardziej ogólne porównanie podejścia jednowymiarowego i wielowymiarowego z kroków 4 i 5, przeprowadzamy symulację z „podziałem próby” i powtarzamy oba kroki 1000 razy na ponownie próbkowanych danych, za każdym razem tworząc od nowa próbę pochodną 20/20 oraz próbę replikacyjną 75/82 pacjentów z AD i zdrowych osób z grupy kontrolnej. Jednowymiarowe i wielowymiarowe markery choroby są obliczane z próby pochodnej, a próg decyzyjny jest ustawiony tak, aby maksymalnie 1 zdrowa osoba z grupy kontrolnej została błędnie sklasyfikowana jako AD (= swoistość 95%). Markery choroby wraz z ich konkretnymi progami decyzyjnymi są następnie prospektywnie stosowane do prób replikacyjnych. Wskaźniki błędów klasyfikacji w próbie replikacyjnej są rejestrowane dla wszystkich iteracji ponownego próbkowania.
Reprezentatywne wyniki
Wydajność jednowymiarowa Szczegółowe wyniki przedstawiono na Rysunku 3. Obszar największego deficytu FDG związanego z AD stwierdzono w zakręcie skroniowym górnym, obszar Brodmanna 38. Osiągnięta powierzchnia pod krzywą ROC wyniosła AUC=0.90. Generalizacja tego kontrastu na próbę replikacyjną była dość dobra, z powierzchnią pod krzywą ROC wynoszącą AUC=0.84.
Wydajność wielowymiarowa Szczegółowe wyniki przedstawiono na Rysunku 4. Obszary z dodatnimi ładunkami, sugerujące względne zachowanie sygnału w obliczu choroby, zlokalizowano w móżdżku, natomiast powiązaną utratę sygnału stwierdzono w obszarach ciemieniowo-skroniowych i czołowych oraz w tylnej części zakrętu obręczy. Powierzchnie pod krzywymi ROC zarówno w próbie pochodnej, jak i replikacyjnej były nieco wyższe niż w przypadku markera jednowymiarowego i wyniosły odpowiednio 0,96 oraz 0,88.
Symulacje na próbkach podzielonych Wyniki można szczegółowo zobaczyć na rysunku 5. Rysunek pokazuje, że marker wielowymiarowy zapewnia lepszą replikację skuteczności diagnostycznej niż marker jednowymiarowy. Średni całkowity wskaźnik błędów dla markera wielowymiarowego wynosi 0,203, natomiast dla markera jednowymiarowego wynosi on 0,307.

Rycina 1. Ta prosta ilustracja opisuje różnicę między jednowymiarowymi a wielowymiarowymi strategiami analitycznymi: przedstawiono na niej hipotetyczny trójwymiarowy zbiór danych. Po lewej stronie nie występuje korelacja między trzema naniesionymi zmiennymi. W przeciwieństwie do tego, po prawej stronie można zauważyć główne źródło wariancji wskazujące na dodatnią korelację między wszystkimi trzema woksalami. Analiza jednowymiarowa, uwzględniająca jedynie wartości średnie w oparciu o poszczególne woksale, nie wykazałaby żadnej różnicy między tymi dwoma scenariuszami. Analiza wielowymiarowa natomiast identyfikuje główne źródła wariancji w danych (czerwona strzałka) przed przystąpieniem do konstruowania wzorców aktywacji neuronalnej na podstawie tych źródeł.

Rycina 2. Ten slajd przedstawia w uproszczonej formie podstawowy cel każdej analizy wielowymiarowej w danych neuroobrazowych. Tablica danych Y(s,x), która zależy od indeksu badanego s oraz indeksu woksela x, wskazującego lokalizację woksela w mózgu, jest rozkładana na sumę kilku składników. Po pierwsze, iloczyn wyniku czynnika zależnego wyłącznie od badanego, ssf(s), oraz wzorca kowariancji zależnego wyłącznie od woksela, v(x). Po drugie, aktywację, której nie można wyjaśnić wzorcem kowariancji, ujmuje składnik szumu zależny od badanego i woksela, e(s,x). Dwie grafiki poniżej równania przedstawiają przykład współczynnika skalowania badanego oraz wzorca kowariancji. Każdy uczestnik wykazuje wzorzec kowariancji, jednak w różnym stopniu, co obrazuje wynik czynnika badanego. Zamiast śledzić osobno zachowanie każdego woksela, wzorzec kowariancji i jego ekspresja u badanego zapewniają oszczędne podsumowanie głównego źródła wariancji. Wraz ze wzrostem wartości współczynnika skalowania badanego, obszary zaznaczone na niebiesko we wzorcu kowariancji wykazują spadek powiązanej z nimi aktywacji, podczas gdy obszary zaznaczone na czerwono jednocześnie wykazują wzrost aktywacji. Wynik czynnika badanego może być korelowany z zewnętrznymi zmiennymi zainteresowania, takimi jak wiek badanego lub wyniki behawioralne w zadaniu poznawczym, przy czym do tej korelacji nie trzeba stosować korekty na wielokrotne porównania.
Istnieje kilka technik takiej dekompozycji, jednak najpowszechniejszą z nich jest analiza głównych składowych (PCA). Jest to technika wybrana przez nas. Należy zauważyć, że czynniki skalowania badanych można uzyskać poprzez rzutowanie wzorca kowariancji na dowolny zbiór danych o tej samej wymiarowości, a nie tylko na zbiór danych, który pierwotnie wygenerował dany wzorzec kowariancji. Dzięki temu wzorce kowariancji nadają się do testowania, czy relacje mózg-zachowanie zaobserwowane w jednym zbiorze danych mogą zostać powtórzone w innym zbiorze danych.

Rycina 3. Na tej rycinie przedstawiono wynik analizy jednowymiarowej. Na dolnym lewym panelu naniesiono wartości sygnału FDG dla obszaru wykazującego największy deficyt związany z AD w próbie pochodnej. Jego współrzędne MNI to X=2 mm ,Y= -48 mm , Z= 30mm (k precedes precuneus/zakręt obręczy, pole Brodmanna 31). Dolny prawy panel przedstawia sygnał FDG w tej samej lokalizacji w próbie replikacyjnej. Można zauważyć, że różnice w poziomie FDG między pacjentami z AD a grupą kontrolną w próbie replikacyjnej, mimo że nadal są istotne statystycznie w ujęciu ogólnym, są mniejsze, a grupy wykazują większe nakładanie się wartości.

Rysunek 4. Na tym rysunku przedstawiono wyniki analizy wielowymiarowej. Na górnym panelu wyświetlone są przekroje osiowe ukazujące obszary o istotnych dodatnich i ujemnych wagach (p<0.001) w wzorcu kowariancji, odpowiednio w kolorze czerwonym i niebieskim. Należy zauważyć, że każdy skan został przeskalowany względem jego globalnej wartości średniej, zatem kolory czerwony i niebieski wskazują na względne, a nie bezwzględne wzrosty i spadki sygnału PET wraz z nasileniem choroby. Obszary czerwone sugerują zatem względne zachowanie tkanek mimo postępu choroby, podczas gdy kolor niebieski wskazuje na utratę sygnału w następstwie choroby. Obszary czerwone występują głównie w móżdżku, natomiast obszary niebieskie pojawiają się w tylnej części zakrętu obręczy oraz w obszarach ciemieniowo-skroniowych i czołowych. Panel dolny lewy: przedstawiono wyniki czynnikowe badanych dla wzorca kowariancji związanego z AD w próbie pochodnej. Wyższe wyniki badanych odnotowano u pacjentów z AD. Panel dolny prawy: przedstawiono wyniki czynnikowe badanych uzyskane w wyniku prospektywnego zastosowania wzorca kowariancji związanego z AD w próbie replikacyjnej. Można zauważyć lekkie pogorszenie kontrastu diagnostycznego z większym nakładaniem się wyników w próbie replikacyjnej, jednak generalizacja skuteczności diagnostycznej jest wyraźnie lepsza niż w przypadku analizy jednowymiarowej.

Rysunek 5. Na tym rysunku przedstawiono wyniki 1 000 symulacji z podziałem próby. Wymieniono średnie i odchylenia standardowe współczynników błędów diagnostycznych dla analizy jednowymiarowej i wielowymiarowej w próbach replikacyjnych. Można zauważyć, że zdolność do generalizacji wyników markera wielowymiarowego jest znacznie lepsza, choć nieco bardziej zmienna niż w przypadku markera jednowymiarowego.