Artykuł metodologiczny

Podstawy analizy wielowymiarowej w danych neuroobrazowych

17.8K wyświetleń

DOI:

10.3791/1988

24 lipca 2010

W tym artykule

Podsumowanie

Niniejszy artykuł opisuje podstawy analizy wielowymiarowej i przeciwstawia ją częściej stosowanej jednowymiarowej analizie wokselowej. Oba rodzaje analizy zostały zastosowane do zbioru danych z zakresu neuronauki klinicznej. Uzupełniające symulacje metodą split-half wykazują lepszą replikowalność wyników wielowymiarowych w niezależnych zbiorach danych.

Streszczenie

Techniki analizy wielowymiarowej w danych neuroobrazowych zyskały w ostatnim czasie coraz większą uwagę, ponieważ posiadają wiele atrakcyjnych cech, których nie można łatwo zrealizować za pomocą powszechniej stosowanych jednowymiarowych technik analizy woxelowej1,5,6,7,8,9Metody wielowymiarowe oceniają korelację/kowariancję aktywacji w różnych obszarach mózgu, zamiast opierać się na analizie w skali pojedynczego woksela. Dzięki temu ich wyniki mogą być łatwiej interpretowane jako sygnatury sieci neuronowych. Z kolei podejścia jednowymiarowe nie pozwalają na bezpośrednie badanie korelacji międzyregionalnych w mózgu. Metody wielowymiarowe mogą również zapewniać większą moc statystyczną w porównaniu z technikami jednowymiarowymi, które wymagają stosowania bardzo rygorystycznych korekt dla wielokrotnych porównań na poziomie wokseli. Ponadto techniki wielowymiarowe znacznie lepiej nadają się do prospektywnego zastosowania wyników analizy jednego zbioru danych do całkowicie nowych zbiorów danych. Metody wielowymiarowe są zatem w stanie dostarczyć informacji o różnicach średnich oraz korelacjach z zachowaniem, podobnie jak podejścia jednowymiarowe, ale potencjalnie z większą mocą statystyczną i lepszą możliwością weryfikacji powtarzalności. Przeciwwagą dla tych zalet jest wysoki próg wejścia w stosowanie metod wielowymiarowych, co zapobiega ich szerszemu zastosowaniu w środowisku naukowym. Dla neurobiologa zapoznającego się z technikami analizy wielowymiarowej, wstępny przegląd dziedziny może ukazać dezorientującą różnorodność podejść, które, choć algorytmicznie podobne, są prezentowane z różnymi akcentami, zazwyczaj przez osoby z wykształceniem matematycznym. Uważamy, że techniki analizy wielowymiarowej mają wystarczający potencjał, aby uzasadnić ich lepsze rozpowszechnianie. Badacze powinni mieć możliwość stosowania ich w sposób świadomy i przystępny. Niniejszy artykuł jest próbą dydaktycznego wprowadzenia nowicjusza w techniki wielowymiarowe. Po wprowadzeniu koncepcyjnym następuje bardzo proste zastosowanie do diagnostycznego zbioru danych z Alzheimer's Disease Neuroimaging Initiative (ADNI), co wyraźnie demonstruje wyższą efektywność podejścia wielowymiarowego.

Protokół

  1. Aby przedstawić koncepcyjny przegląd analizy wielowymiarowej, możemy wyobrazić sobie bardzo prostą sytuację: hipotetyczny zestaw danych dla 50 uczestników, w którym zmierzono tylko trzy obszary mózgu, oznaczone jako woksele (=trójwymiarowe piksele na Rysunku 1). (Wstaw tutaj Rysunek 1, przeczytaj podpis jako lektor.)
  2. Ogólnym celem analizy wielowymiarowej jest zidentyfikowanie głównych źródeł wariancji w danych, a następnie opisanie głównych efektów będących przedmiotem zainteresowania w zależności od tych źródeł wariancji. Rysunek 2 przedstawia uproszczony przykład. (Wstaw tutaj Rysunek 2, przeczytaj podpis jako lektor.)
  3. Przystępujemy teraz do zastosowania analizy jednowymiarowej i wielowymiarowej do klinicznego zestawu danych. Pobraliśmy skany PET z FDG w stanie spoczynku dla 95 pacjentów we wczesnym stadium choroby Alzheimera oraz 102 osób z grupy kontrolnej dopasowanej pod względem wieku ze strony internetowej Alzheimer's Disease Neuroimaging Initiative (http://www.loni.ucla.edu/ADNI/). Losowo wybraliśmy po 20 skanów pacjentów i osób z grupy kontrolnej i wyznaczyliśmy je jako naszą próbę pochodną. Pozostałe odpowiednio 75 i 82 skany stanowią naszą próbę replikacyjną. Teraz w próbie pochodnej zostaną wyznaczone jednowymiarowe i wielowymiarowe markery choroby Alzheimera (AD), a ich skuteczność diagnostyczna zostanie przetestowana w próbie replikacyjnej.
  4. W przypadku markera jednowymiarowego porównujemy 20 skanów AD z 20 skanami kontrolnymi w próbie pochodnej i wybieramy lokalizację w mózgu, która wykazuje największy spadek sygnału PET u pacjentów z AD, co wykazuje test T. Aby przetestować skuteczność diagnostyczną tego obszaru, sprawdzamy dane w próbie replikacyjnej w tej lokalizacji i wykreślamy sygnał PET jako funkcję stanu choroby.
  5. W przypadku markera wielowymiarowego najpierw przeprowadzamy PCA na połączonych 40 skanach w próbie pochodnej, a następnie konstruujemy wzorzec kowariancji z pierwszych 5 Głównych Składników, których współczynnik skalowania obiektu wykazuje maksymalną średnią różnicę między pacjentami z AD a zdrową grupą kontrolną. (Szczegóły można znaleźć w tych reprezentatywnych pracach 2.) Uzyskany z próby pochodnej diagnostyczny wzorzec kowariancji jest następnie prospektywnie stosowany do próby replikacyjnej. Wynikowe współczynniki skalowania obiektów są wykreślane jako funkcja stanu choroby.
  6. Aby zapewnić bardziej ogólne porównanie podejścia jednowymiarowego i wielowymiarowego z kroków 4 i 5, przeprowadzamy symulację z „podziałem próby” i powtarzamy oba kroki 1000 razy na ponownie próbkowanych danych, za każdym razem tworząc od nowa próbę pochodną 20/20 oraz próbę replikacyjną 75/82 pacjentów z AD i zdrowych osób z grupy kontrolnej. Jednowymiarowe i wielowymiarowe markery choroby są obliczane z próby pochodnej, a próg decyzyjny jest ustawiony tak, aby maksymalnie 1 zdrowa osoba z grupy kontrolnej została błędnie sklasyfikowana jako AD (= swoistość 95%). Markery choroby wraz z ich konkretnymi progami decyzyjnymi są następnie prospektywnie stosowane do prób replikacyjnych. Wskaźniki błędów klasyfikacji w próbie replikacyjnej są rejestrowane dla wszystkich iteracji ponownego próbkowania.

Reprezentatywne wyniki

Wydajność jednowymiarowa Szczegółowe wyniki przedstawiono na Rysunku 3. Obszar największego deficytu FDG związanego z AD stwierdzono w zakręcie skroniowym górnym, obszar Brodmanna 38. Osiągnięta powierzchnia pod krzywą ROC wyniosła AUC=0.90. Generalizacja tego kontrastu na próbę replikacyjną była dość dobra, z powierzchnią pod krzywą ROC wynoszącą AUC=0.84.

Wydajność wielowymiarowa Szczegółowe wyniki przedstawiono na Rysunku 4. Obszary z dodatnimi ładunkami, sugerujące względne zachowanie sygnału w obliczu choroby, zlokalizowano w móżdżku, natomiast powiązaną utratę sygnału stwierdzono w obszarach ciemieniowo-skroniowych i czołowych oraz w tylnej części zakrętu obręczy. Powierzchnie pod krzywymi ROC zarówno w próbie pochodnej, jak i replikacyjnej były nieco wyższe niż w przypadku markera jednowymiarowego i wyniosły odpowiednio 0,96 oraz 0,88.

Symulacje na próbkach podzielonych Wyniki można szczegółowo zobaczyć na rysunku 5. Rysunek pokazuje, że marker wielowymiarowy zapewnia lepszą replikację skuteczności diagnostycznej niż marker jednowymiarowy. Średni całkowity wskaźnik błędów dla markera wielowymiarowego wynosi 0,203, natomiast dla markera jednowymiarowego wynosi on 0,307.

Analiza jednowymiarowa a wielowymiarowa; trójwymiarowe wykresy rozrzutu; porównanie statystyczne; wizualizacja danych woxelowych.
Rycina 1. Ta prosta ilustracja opisuje różnicę między jednowymiarowymi a wielowymiarowymi strategiami analitycznymi: przedstawiono na niej hipotetyczny trójwymiarowy zbiór danych. Po lewej stronie nie występuje korelacja między trzema naniesionymi zmiennymi. W przeciwieństwie do tego, po prawej stronie można zauważyć główne źródło wariancji wskazujące na dodatnią korelację między wszystkimi trzema woksalami. Analiza jednowymiarowa, uwzględniająca jedynie wartości średnie w oparciu o poszczególne woksale, nie wykazałaby żadnej różnicy między tymi dwoma scenariuszami. Analiza wielowymiarowa natomiast identyfikuje główne źródła wariancji w danych (czerwona strzałka) przed przystąpieniem do konstruowania wzorców aktywacji neuronalnej na podstawie tych źródeł.

Równanie analizy wielowymiarowej Y(s,x)=ssf(s)v(x)+ε(s,x), wykres oraz schemat MRI mózgu.
Rycina 2. Ten slajd przedstawia w uproszczonej formie podstawowy cel każdej analizy wielowymiarowej w danych neuroobrazowych. Tablica danych Y(s,x), która zależy od indeksu badanego s oraz indeksu woksela x, wskazującego lokalizację woksela w mózgu, jest rozkładana na sumę kilku składników. Po pierwsze, iloczyn wyniku czynnika zależnego wyłącznie od badanego, ssf(s), oraz wzorca kowariancji zależnego wyłącznie od woksela, v(x). Po drugie, aktywację, której nie można wyjaśnić wzorcem kowariancji, ujmuje składnik szumu zależny od badanego i woksela, e(s,x). Dwie grafiki poniżej równania przedstawiają przykład współczynnika skalowania badanego oraz wzorca kowariancji. Każdy uczestnik wykazuje wzorzec kowariancji, jednak w różnym stopniu, co obrazuje wynik czynnika badanego. Zamiast śledzić osobno zachowanie każdego woksela, wzorzec kowariancji i jego ekspresja u badanego zapewniają oszczędne podsumowanie głównego źródła wariancji. Wraz ze wzrostem wartości współczynnika skalowania badanego, obszary zaznaczone na niebiesko we wzorcu kowariancji wykazują spadek powiązanej z nimi aktywacji, podczas gdy obszary zaznaczone na czerwono jednocześnie wykazują wzrost aktywacji. Wynik czynnika badanego może być korelowany z zewnętrznymi zmiennymi zainteresowania, takimi jak wiek badanego lub wyniki behawioralne w zadaniu poznawczym, przy czym do tej korelacji nie trzeba stosować korekty na wielokrotne porównania.

Istnieje kilka technik takiej dekompozycji, jednak najpowszechniejszą z nich jest analiza głównych składowych (PCA). Jest to technika wybrana przez nas. Należy zauważyć, że czynniki skalowania badanych można uzyskać poprzez rzutowanie wzorca kowariancji na dowolny zbiór danych o tej samej wymiarowości, a nie tylko na zbiór danych, który pierwotnie wygenerował dany wzorzec kowariancji. Dzięki temu wzorce kowariancji nadają się do testowania, czy relacje mózg-zachowanie zaobserwowane w jednym zbiorze danych mogą zostać powtórzone w innym zbiorze danych.

MRI mózgu z markerem jednowymiarowym, wykresy kropkowe AD vs HC, replikacja wykazuje istotną różnicę.
Rycina 3. Na tej rycinie przedstawiono wynik analizy jednowymiarowej. Na dolnym lewym panelu naniesiono wartości sygnału FDG dla obszaru wykazującego największy deficyt związany z AD w próbie pochodnej. Jego współrzędne MNI to X=2 mm ,Y= -48 mm , Z= 30mm (k precedes precuneus/zakręt obręczy, pole Brodmanna 31). Dolny prawy panel przedstawia sygnał FDG w tej samej lokalizacji w próbie replikacyjnej. Można zauważyć, że różnice w poziomie FDG między pacjentami z AD a grupą kontrolną w próbie replikacyjnej, mimo że nadal są istotne statystycznie w ujęciu ogólnym, są mniejsze, a grupy wykazują większe nakładanie się wartości.

MRI mózgu z morfometrią opartą na wokselach, wykresy rozrzutu, porównanie choroby Alzheimera z grupą kontrolną, analiza.
Rysunek 4. Na tym rysunku przedstawiono wyniki analizy wielowymiarowej. Na górnym panelu wyświetlone są przekroje osiowe ukazujące obszary o istotnych dodatnich i ujemnych wagach (p<0.001) w wzorcu kowariancji, odpowiednio w kolorze czerwonym i niebieskim. Należy zauważyć, że każdy skan został przeskalowany względem jego globalnej wartości średniej, zatem kolory czerwony i niebieski wskazują na względne, a nie bezwzględne wzrosty i spadki sygnału PET wraz z nasileniem choroby. Obszary czerwone sugerują zatem względne zachowanie tkanek mimo postępu choroby, podczas gdy kolor niebieski wskazuje na utratę sygnału w następstwie choroby. Obszary czerwone występują głównie w móżdżku, natomiast obszary niebieskie pojawiają się w tylnej części zakrętu obręczy oraz w obszarach ciemieniowo-skroniowych i czołowych. Panel dolny lewy: przedstawiono wyniki czynnikowe badanych dla wzorca kowariancji związanego z AD w próbie pochodnej. Wyższe wyniki badanych odnotowano u pacjentów z AD. Panel dolny prawy: przedstawiono wyniki czynnikowe badanych uzyskane w wyniku prospektywnego zastosowania wzorca kowariancji związanego z AD w próbie replikacyjnej. Można zauważyć lekkie pogorszenie kontrastu diagnostycznego z większym nakładaniem się wyników w próbie replikacyjnej, jednak generalizacja skuteczności diagnostycznej jest wyraźnie lepsza niż w przypadku analizy jednowymiarowej.

Wykres porównania współczynników błędów replikacji, analiza jednowymiarowa i wielowymiarowa, punkty danych, średnie błędy.
Rysunek 5. Na tym rysunku przedstawiono wyniki 1 000 symulacji z podziałem próby. Wymieniono średnie i odchylenia standardowe współczynników błędów diagnostycznych dla analizy jednowymiarowej i wielowymiarowej w próbach replikacyjnych. Można zauważyć, że zdolność do generalizacji wyników markera wielowymiarowego jest znacznie lepsza, choć nieco bardziej zmienna niż w przypadku markera jednowymiarowego.

Dyskusja

Mamy nadzieję, że przybliżyliśmy widzowi podstawy analizy wielowymiarowej; zainteresowanych zachęcamy do odwiedzenia naszej strony internetowej. Przy wyborze parametrów analizy wielowymiarowej podjęto kilka decyzji, które mogą być przedmiotem znaczących dyskusji. W niniejszym artykule pominęliśmy omówienie tych kwestii, aby nie odciągać uwagi od głównych zagadnień. Po pierwsze, do stworzenia wzorca kowariancji związanego z AD wybraliśmy pierwsze 6 głównych komponentów. Istnieją teoretyczne przesłanki dla tego wyboru, których tutaj nie omawialiśmy 4. Sam wybór 6 głównych komponentów nie jest jednak kluczowy dla naszej argumentacji: można wybrać liczbę od 2 do 20 PC, a nadal uzyskać lepszą zdolność generalizacji markera wielowymiarowego w symulacjach na próbkach podzielonych. Wyniki są podobnie odporne na wybór liczby badanych w próbkach pochodnych i replikacyjnych. W próbie replikacyjnej wybraliśmy po 20 osób do obu grup, ale wynikało to wyłącznie z wygody matematycznej, aby przyspieszyć obliczenia. Nasze wnioski dotyczące względnych zalet obu technik pozostałyby podobne, gdyby zwiększono liczbę badanych w próbkach pochodnych.

Po drugie, przedstawiliśmy jedynie najbardziej podstawowy rodzaj analizy wielowymiarowej. Możliwe jest znaczne skomplikowanie metod poprzez zastosowanie technik zaczerpniętych z literatury dotyczącej uczenia maszynowego, transformacji liniowych i nieliniowych przed PCA oraz różnych innych modyfikacji, które mogłyby jeszcze bardziej zwiększyć zdolność do generalizacji. Dla uproszczenia nie poruszyliśmy tych możliwości w niniejszym artykule.

Oświadczenia

Nie zgłoszono żadnych konfliktów interesów.

Podziękowania

Autor jest wdzięczny za wsparcie z grantu NIH:

NIH/NIBIB 5R01EB006204-03 Podejścia wielowymiarowe w analizie obrazowania neurologicznego

NIH/NIA 5R01AG026114-02 Wczesne wykrywanie choroby AD za pomocą ASL MRI i analizy kowariancji

ADNI: Dane obrazowe zostały dostarczone przez Alzheimer's Disease Neuroimaging Initiative (ADNI) (NIH U01AG024904). Gromadzenie i udostępnianie danych dla tego projektu zostało sfinansowane przez Alzheimer's Disease Neuroimaging Initiative (ADNI) (National Institutes of Health Grant U01 AG024904). ADNI jest finansowane przez National Institute on Aging, National Institute of Biomedical Imaging and Bioengineering oraz dzięki hojnym darowiznom następujących podmiotów: Abbott, AstraZeneca AB, Bayer Schering Pharma AG, Bristol-Myers Squibb, Eisai Global Clinical Development, Elan Corporation, Genentech, GE Healthcare, GlaxoSmithKline, Innogenetics, Johnson and Johnson, Eli Lilly and Co., Medpace, Inc., Merck and Co., Inc., Novartis AG, Pfizer Inc, F. Hoffman-La Roche, Schering-Plough, Synarc, Inc. oraz Wyeth, a także partnerów non-profit: Alzheimer's Association i Alzheimer's Drug Discovery Foundation, z udziałem U.S. Food and Drug Administration. Wkład sektora prywatnego w ADNI jest koordynowany przez Foundation for the National Institutes of Health (http://www.fnih.org). Organizacją otrzymującą grant jest Northern California Institute for Research and Education, a badaniem kieruje Alzheimer's Disease Cooperative Study na University of California, San Diego. Dane ADNI są rozpowszechniane przez Laboratory for Neuro Imaging na University of California, Los Angeles. Badania te były wspierane również przez granty NIH P30 AG010129, K01 AG030514 oraz Dana Foundation.

Bibliografia

  1. Moeller, J. R., Strother, S. C. A regional covariance approach to the analysis of functional patterns in positron emission tomographic data. J Cereb Blood Flow Metab. 11 (2), A121-A121 (1991).
  2. Scarmeas, N. Covariance PET patterns in early Alzheimer's disease and subjects with cognitive impairment but no dementia: utility in group discrimination and correlations with functional performance. Neuroimage. 23 (1), 35-35 (2004).
  3. Siedlecki, K. L. Examining the multifactorial nature of cognitive aging with covariance analysis of positron emission tomography data. J Int Neuropsychol Soc. 15 (6), 973-973 (2009).
  4. Burnham, K. P., Anderson, D. R. Model selection and multimodel inference a practical information-theoretic approach. , Springer. New York. Volume xxvi (2002).
  5. Moeller, J. R., Strother, S. C., Sidtis, J. J., Rottenberg, D. A. Scaled subprofile model: a statistical approach to the analysis of functional patterns in positron emission tomographic data. J Cereb Blood Flow Metab. 7 (5), 649-649 (1987).
  6. Habeck, C. Multivariate and univariate neuroimaging biomarkers of Alzheimer's disease. Neuroimage. 40 (4), 1503-1503 (2008).
  7. Habeck, C. A new approach to spatial covariance modeling of functional brain imaging data: ordinal trend analysis. Neural Comput. 17 (7), 1602-1602 (2005).
  8. McIntosh, A. R., Bookstein, F. L., Haxby, J. V., Grady, C. L. Spatial pattern analysis of functional brain images using partial least squares. Neuroimage. 3 Pt 1, 143-143 (1996).
  9. McIntosh, A. R., Lobaugh, N. J. Partial least squares analysis of neuroimaging data: applications and advances. Neuroimage. 23, Suppl 1. S250-S250 (2004).

Przedruki i uprawnienia

Tagi

Analiza głównych składowychliniowa analiza dyskryminacyjnaoprogramowanie SPMchoroba Alzheimeraskany FDG PETmarker diagnostycznysymulacja z podziałem próbypole pod krzywą