Artykuł metodologiczny

Podstawy analizy wielowymiarowej w danych neuroobrazowych

DOI:

10.3791/1988

24 lipca 2010

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejszy artykuł opisuje podstawy analizy wielowymiarowej i przeciwstawia ją częściej stosowanej jednowymiarowej analizie wokselowej. Oba rodzaje analizy zostały zastosowane do zbioru danych z zakresu neuronauki klinicznej. Uzupełniające symulacje metodą split-half wykazują lepszą replikowalność wyników wielowymiarowych w niezależnych zbiorach danych.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
Techniki analizy wielowymiarowej w danych neuroobrazowych zyskały w ostatnim czasie coraz większą uwagę, ponieważ posiadają wiele atrakcyjnych cech, których nie można łatwo zrealizować za pomocą powszechniej stosowanych jednowymiarowych technik analizy woxelowej1,5,6,7,8,9Metody wielowymiarowe oceniają korelację/kowariancję aktywacji w różnych obszarach mózgu, zamiast opierać się na analizie w skali pojedynczego woksela. Dzięki temu ich wyniki mogą być łatwiej interpretowane jako sygnatury sieci neuronowych. Z kolei podejścia jednowymiarowe nie pozwalają na bezpośrednie badanie korelacji międzyregionalnych w mózgu. Metody wielowymiarowe mogą również zapewniać większą moc statystyczną w porównaniu z technikami jednowymiarowymi, które wymagają stosowania bardzo rygorystycznych korekt dla wielokrotnych porównań na poziomie wokseli. Ponadto techniki wielowymiarowe znacznie lepiej nadają się do prospektywnego zastosowania wyników analizy jednego zbioru danych do całkowicie nowych zbiorów danych. Metody wielowymiarowe są zatem w stanie dostarczyć informacji o różnicach średnich oraz korelacjach z zachowaniem, podobnie jak podejścia jednowymiarowe, ale potencjalnie z większą mocą statystyczną i lepszą możliwością weryfikacji powtarzalności. Przeciwwagą dla tych zalet jest wysoki próg wejścia w stosowanie metod wielowymiarowych, co zapobiega ich szerszemu zastosowaniu w środowisku naukowym. Dla neurobiologa zapoznającego się z technikami analizy wielowymiarowej, wstępny przegląd dziedziny może ukazać dezorientującą różnorodność podejść, które, choć algorytmicznie podobne, są prezentowane z różnymi akcentami, zazwyczaj przez osoby z wykształceniem matematycznym. Uważamy, że techniki analizy wielowymiarowej mają wystarczający potencjał, aby uzasadnić ich lepsze rozpowszechnianie. Badacze powinni mieć możliwość stosowania ich w sposób świadomy i przystępny. Niniejszy artykuł jest próbą dydaktycznego wprowadzenia nowicjusza w techniki wielowymiarowe. Po wprowadzeniu koncepcyjnym następuje bardzo proste zastosowanie do diagnostycznego zbioru danych z Alzheimer's Disease Neuroimaging Initiative (ADNI), co wyraźnie demonstruje wyższą efektywność podejścia wielowymiarowego.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Aby przedstawić koncepcyjny przegląd analizy wielowymiarowej, możemy wyobrazić sobie bardzo prostą sytuację: hipotetyczny zestaw danych dla 50 uczestników, w którym zmierzono tylko trzy obszary mózgu, oznaczone jako woksle (=trójwymiarowe piksele na rysunku 1). (Wstaw rysunek 1, przeczytaj podpis jako lektora.)
  2. Ogólnym celem analizy wielowymiarowej jest zidentyfikowanie głównych źródeł wariancji w danych, a następnie opisanie głównych efektów będących przedmiotem zainteresowania w kontekście tych źródeł wariancji. Rysunek 2 przedstawia uproszczony przykład. (Wstaw rysunek 2, przeczytaj podpis jako lektora.)
  3. Przystępujemy teraz do zastosowania analizy jednowymiarowej i wielowymiarowej do klinicznego zestawu danych. Pobraliśmy skany spoczynkowe FDG-PET dla 95 pacjentów we wczesnym stadium choroby Alzheimera oraz 102 kontroli dobranych pod względem wieku ze strony internetowej Alzheimer's Disease Neuroimaging Initiative (http://www.loni.ucla.edu/ADNI/). Losowo wybraliśmy 20 skanów pacjentów oraz 20 skanów kontroli i wyznaczyliśmy je jako naszą próbę pochodną. Pozostałe odpowiednio 75 i 82 skany stanowią naszą próbę replikacyjną. Obecnie w próbie pochodnej zostaną opracowane jednowymiarowe i wielowymiarowe markery choroby Alzheimera (AD), a ich skuteczność diagnostyczna zostanie przetestowana w próbie replikacyjnej.
  4. W przypadku markera jednowymiarowego porównujemy 20 skanów AD z 20 skanami kontroli w próbie pochodnej i wybieramy lokalizację w mózgu, która wykazuje największy spadek sygnału PET u pacjentów z AD, co zostaje wykazane za pomocą testu T. Aby przetestować skuteczność diagnostyczną tego obszaru, sprawdzamy dane w próbie replikacyjnej w tej lokalizacji i wykreślamy sygnał PET jako funkcję statusu choroby.
  5. W przypadku markera wielowymiarowego najpierw wykonujemy analizę PCA na połączonych 40 skanach w próbie pochodnej, a następnie konstruujemy wzorzec kowariancji z pierwszych 5 głównych komponentów, których współczynnik skalowania obiektu wykazuje maksymalną różnicę średnich między pacjentami z AD a zdrową grupą kontrolną. (Szczegóły można znaleźć w tych reprezentatywnych publikacjach 2.) Otrzymany z próby pochodnej diagnostyczny wzorzec kowariancji jest następnie prospektywnie stosowany do próby replikacyjnej. Wynikowe współczynniki skalowania obiektów są wykreślane jako funkcja statusu choroby.
  6. Aby przeprowadzić bardziej ogólne porównanie podejść jednowymiarowego i wielowymiarowego z kroków 4 i 5, wykonujemy symulację z „podziałem próby” i powtarzamy oba kroki 1000 razy na danych przepełnionych, za każdym razem tworząc od nowa próbę pochodną 20/20 oraz próbę replikacyjną 75/82 pacjentów z AD i zdrowych kontroli. Jednowymiarowe i wielowymiarowe markery choroby są obliczane z próby pochodnej, a próg decyzji jest ustawiony tak, aby maksymalnie 1 zdrowa osoba z grupy kontrolnej została błędnie sklasyfikowana jako AD (= swoistość 95%). Markery choroby z ich specyficznymi progami decyzji są następnie prospektywnie stosowane do prób replikacyjnych. Wskaźniki błędów klasyfikacji w próbie replikacyjnej są rejestrowane dla wszystkich iteracji ponownego próbkowania.

Reprezentatywne wyniki

Wydajność jednowymiarowa Wyniki można szczegółowo zobaczyć na rysunku 3. Obszar największego deficytu FDG związanego z AD stwierdzono w zakręcie skroniowym górnym, obszarze 38 Brodmanna. Osiągnięta powierzchnia pod krzywą ROC wyniosła AUC=0.90. Generalizacja tego kontrastu na próbę replikacyjną była dość dobra, z powierzchnią pod krzywą ROC wynoszącą AUC=0.84.

Wydajność wielowymiarowa Szczegółowe wyniki przedstawiono na Rysunku 4. Obszary z dodatnimi ładunkami, sugerujące względne zachowanie sygnału w obliczu choroby, zlokalizowano w móżdżku, natomiast powiązaną utratę sygnału stwierdzono w obszarach ciemieniowo-skroniowych i czołowych oraz w tylnej części zakrętu obręczy. Powierzchnie pod krzywymi ROC w próbach pochodnych i replikacyjnych były nieco wyższe niż w przypadku markera jednowymiarowego i wyniosły odpowiednio 0,96 oraz 0,88.

Symulacje z podziałem próby Wyniki można szczegółowo przeanalizować na Rysunku 5. Rysunek ten wykazuje, że marker wielowymiarowy zapewnia lepszą replikację skuteczności diagnostycznej niż marker jednowymiarowy. Średnia całkowita stopa błędów dla markera wielowymiarowego wynosi 0,203, podczas gdy dla markera jednowymiarowego wynosi ona 0,307.

figure-protocol-1
Rysunek 1. Ten prosty schemat przedstawia różnicę między jednowymiarowymi a wielowymiarowymi strategiami analitycznymi: na ilustracji zaprezentowano hipotetyczny 3-wymiarowy zbiór danych. Po lewej stronie nie występuje korelacja między trzema naniesionymi zmiennymi. W przeciwieństwie do tego, po prawej stronie widoczne jest główne źródło wariancji, wskazujące na pozytywną korelację między wszystkimi trzema wokselami. Analiza jednowymiarowa, uwzględniająca jedynie wartości średnie dla każdego woksela z osobna, nie wykazałaby żadnej różnicy między tymi dwoma scenariuszami. Analiza wielowymiarowa natomiast identyfikuje główne źródła wariancji w danych (czerwona strzałka), a następnie konstruuje wzorce aktywacji neuronalnej na podstawie tych źródeł.

figure-protocol-2
Rycina 2. Ten slajd przedstawia w uproszczonej formie podstawowy cel każdej analizy wielowymiarowej w danych neuroobrazowych. Tablica danych Y(s,x), która zależy od indeksu badanego s oraz indeksu woksela x wskazującego lokalizację woksela w mózgu, jest rozkładana na sumę kilku składników. Po pierwsze, produkt czynnika zależnego wyłącznie od badanego, ssf(s), oraz wzorca kowariancji zależnego wyłącznie od woksela, v(x). Po drugie, aktywacja, której nie można wyjaśnić wzorcem kowariancji, jest ujęta w składniku szumu zależnym od badanego i woksela, e(s,x). Dwa wykresy poniżej równania stanowią przykład współczynnika skalowania badanego oraz wzorca kowariancji. Każdy uczestnik wykazuje wzorzec kowariancji, jednak w różnym stopniu, co obrazuje wynik czynnika badanego. Zamiast śledzić oddzielnie zachowanie każdego woksela, wzorzec kowariancji i jego ekspresja u badanego zapewniają oszczędne podsumowanie głównego źródła wariancji. W miarę jak wartość współczynnika skalowania badanego rośnie, obszary zaznaczone na niebiesko we wzorcu kowariancji wykazują spadek powiązanej z nimi aktywacji, podczas gdy obszary zaznaczone na czerwono jednocześnie zwiększają swoją powiązaną aktywację. Wynik czynnika badanego może być korelowany z zewnętrznymi zmiennymi zainteresowania, takimi jak wiek badanego lub wyniki behawioralne w zadaniu poznawczym, przy czym dla tej korelacji nie trzeba stosować korekty na wielokrotne porównania.

Istnieje wiele technik takiej dekompozycji, lecz najpowszechniejszą z nich jest analiza głównych składowych (PCA). Jest to metoda wybrana przez nas. Należy zauważyć, że czynniki skalujące dla badanych można uzyskać poprzez rzutowanie wzorca kowariancji na dowolny zestaw danych o tej samej wymiarowości, a nie tylko na ten zestaw danych, który pierwotnie wygenerował dany wzorzec kowariancji. Dzięki temu wzorce kowariancji nadają się do testowania, czy relacje mózg-zachowanie zaobserwowane w jednym zbiorze danych mogą zostać powtórzone w innym zbiorze danych.

figure-protocol-3
Rysunek 3. Na tym rysunku przedstawiono wynik analizy jednowymiarowej. Na panelu w lewym dolnym rogu naniesiono wartości sygnału FDG dla obszaru, który wykazuje największy deficyt związany z AD w próbie pochodnej. Jego współrzędne MNI to X=2 mm, Y=-48 mm, Z=30mm (k precedes/PCG, obszar Brodmanna 31). Panel w prawym dolnym rogu przedstawia sygnał FDG w tej samej lokalizacji w próbie replikacyjnej. Można zauważyć, że różnice FDG między pacjentami z AD a grupą kontrolną w próbie replikacyjnej, choć nadal istotne statystycznie w ujęciu ogólnym, są mniejsze, z większym nakładaniem się grup.

figure-protocol-4
Rysunek 4. Rysunek przedstawia wyniki analizy wielowymiarowej. Na górnym panelu pokazano kilka przekrojów osiowych, na których zaznaczono obszary o istotnie dodatnich i ujemnych wagach (p<0.001) w wzorcu kowariancji, odpowiednio kolorem czerwonym i niebieskim. Należy zauważyć, że każdy skan został przeskalowany według jego globalnej wartości średniej, zatem kolory czerwony i niebieski wskazują na względne, a nie bezwzględne wzrosty i spadki sygnału PET wraz z ciężkością choroby. Obszary czerwone sugerują zatem względne zachowanie funkcji w obliczu choroby, podczas gdy kolor niebieski wskazuje na utratę sygnału w następstwie choroby. Obszary czerwone występują głównie w móżdżku, natomiast obszary niebieskie pojawiają się w tylnej części zakrętu obręczy oraz w obszarach ciemieniowo-skroniowych i czołowych. Panel w lewym dolnym rogu: przedstawiono wyniki czynnikowe dla badanych w próbce pochodnej dla wzorca kowariancji powiązanego z AD. Wyższe wyniki u badanych odnotowano u pacjentów z AD. Panel w prawym dolnym rogu: przedstawiono wyniki czynnikowe uzyskane w wyniku prospektywnego zastosowania wzorca kowariancji powiązanego z AD w próbie replikacyjnej. Można zauważyć lekkie pogorszenie kontrastu diagnostycznego z większym nakładaniem się wyników w próbie replikacyjnej, jednak generalizacja skuteczności diagnostycznej jest wyraźnie lepsza niż w przypadku analizy jednowymiarowej.

figure-protocol-5
Rysunek 5. Rysunek ten przedstawia wyniki 1 000 symulacji z podziałem próby. Wymieniono średnie i odchylenia standardowe jednowymiarowych i wielowymiarowych wskaźników błędu diagnostycznego w próbach replikacyjnych. Można zauważyć, że generalizacja wyników markera wielowymiarowego jest znacznie lepsza, choć nieco bardziej zmienna niż w przypadku markera jednowymiarowego.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Mamy nadzieję, że przybliżyliśmy widzowi podstawy analizy wielowymiarowej; zainteresowanych zachęcamy do odwiedzenia naszej strony internetowej. Przy wyborze parametrów analizy wielowymiarowej podjęto kilka decyzji, które mogą być przedmiotem znaczących dyskusji. W niniejszym artykule pominęliśmy omówienie tych kwestii, aby nie odciągać uwagi od głównych zagadnień. Po pierwsze, do stworzenia wzorca kowariancji związanego z AD wybraliśmy pierwsze 6 głównych komponentów. Istnieją teoretyczne przesłanki dla tego wyboru, których tutaj nie omawialiśmy 4. Sam wybór 6 głównych komponentów nie jest jednak kluczowy dla naszej argumentacji: można wybrać liczbę od 2 do 20 PC, a nadal uzyskać lepszą zdolność generalizacji markera wielowymiarowego w symulacjach na próbkach podzielonych. Wyniki są podobnie odporne na wybór liczby badanych w próbkach pochodnych i replikacyjnych. W próbie replikacyjnej wybraliśmy po 20 osób do obu grup, ale wynikało to wyłącznie z wygody matematycznej, aby przyspieszyć obliczenia. Nasze wnioski dotyczące względnych zalet obu technik pozostałyby podobne, gdyby zwiększono liczbę badanych w próbkach pochodnych.

Po drugie, przedstawiliśmy jedynie najbardziej podstawowy rodzaj analizy wielowymiarowej. Możliwe jest znaczne skomplikowanie metod poprzez zastosowanie technik zaczerpniętych z literatury dotyczącej uczenia maszynowego, transformacji liniowych i nieliniowych przed PCA oraz różnych innych modyfikacji, które mogłyby jeszcze bardziej zwiększyć zdolność do generalizacji. Dla uproszczenia nie poruszyliśmy tych możliwości w niniejszym artykule.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nie zgłoszono żadnych konfliktów interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autor jest wdzięczny za wsparcie z grantu NIH:

NIH/NIBIB 5R01EB006204-03 Podejścia wielowymiarowe w analizie obrazowania neurologicznego

NIH/NIA 5R01AG026114-02 Wczesne wykrywanie choroby AD za pomocą ASL MRI i analizy kowariancji

ADNI: Dane obrazowe zostały dostarczone przez Alzheimer's Disease Neuroimaging Initiative (ADNI) (NIH U01AG024904). Gromadzenie i udostępnianie danych dla tego projektu zostało sfinansowane przez Alzheimer's Disease Neuroimaging Initiative (ADNI) (National Institutes of Health Grant U01 AG024904). ADNI jest finansowane przez National Institute on Aging, National Institute of Biomedical Imaging and Bioengineering oraz dzięki hojnym darowiznom następujących podmiotów: Abbott, AstraZeneca AB, Bayer Schering Pharma AG, Bristol-Myers Squibb, Eisai Global Clinical Development, Elan Corporation, Genentech, GE Healthcare, GlaxoSmithKline, Innogenetics, Johnson and Johnson, Eli Lilly and Co., Medpace, Inc., Merck and Co., Inc., Novartis AG, Pfizer Inc, F. Hoffman-La Roche, Schering-Plough, Synarc, Inc. oraz Wyeth, a także partnerów non-profit: Alzheimer's Association i Alzheimer's Drug Discovery Foundation, z udziałem U.S. Food and Drug Administration. Wkład sektora prywatnego w ADNI jest koordynowany przez Foundation for the National Institutes of Health (http://www.fnih.org). Organizacją otrzymującą grant jest Northern California Institute for Research and Education, a badaniem kieruje Alzheimer's Disease Cooperative Study na University of California, San Diego. Dane ADNI są rozpowszechniane przez Laboratory for Neuro Imaging na University of California, Los Angeles. Badania te były wspierane również przez granty NIH P30 AG010129, K01 AG030514 oraz Dana Foundation.

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Moeller, J. R., Strother, S. C. A regional covariance approach to the analysis of functional patterns in positron emission tomographic data. J Cereb Blood Flow Metab. 11 (2), A121-A121 (1991).
  2. Scarmeas, N. Covariance PET patterns in early Alzheimer's disease and subjects with cognitive impairment but no dementia: utility in group discrimination and correlations with functional performance. Neuroimage. 23 (1), 35-35 (2004).
  3. Siedlecki, K. L. Examining the multifactorial nature of cognitive aging with covariance analysis of positron emission tomography data. J Int Neuropsychol Soc. 15 (6), 973-973 (2009).
  4. Burnham, K. P., Anderson, D. R. Model selection and multimodel inference a practical information-theoretic approach. , Springer. New York. Volume xxvi (2002).
  5. Moeller, J. R., Strother, S. C., Sidtis, J. J., Rottenberg, D. A. Scaled subprofile model: a statistical approach to the analysis of functional patterns in positron emission tomographic data. J Cereb Blood Flow Metab. 7 (5), 649-649 (1987).
  6. Habeck, C. Multivariate and univariate neuroimaging biomarkers of Alzheimer's disease. Neuroimage. 40 (4), 1503-1503 (2008).
  7. Habeck, C. A new approach to spatial covariance modeling of functional brain imaging data: ordinal trend analysis. Neural Comput. 17 (7), 1602-1602 (2005).
  8. McIntosh, A. R., Bookstein, F. L., Haxby, J. V., Grady, C. L. Spatial pattern analysis of functional brain images using partial least squares. Neuroimage. 3 Pt 1, 143-143 (1996).
  9. McIntosh, A. R., Lobaugh, N. J. Partial least squares analysis of neuroimaging data: applications and advances. Neuroimage. 23, Suppl 1. S250-S250 (2004).

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Analiza g wnych sk adowychliniowa analiza dyskryminacyjnaoprogramowanie SPMchoroba Alzheimeraskany FDG PETmarker diagnostycznysymulacja z podzia em pr bypole pod krzyw

Powiązane artykuły