1. Wstęp
Wielowymiarowa analiza wzorców (MVPA) jest coraz popularniejszą metodą analizy danych z funkcjonalnego rezonansu magnetycznego (fMRI)1-4. Zazwyczaj metoda ta jest wykorzystywana do identyfikacji doświadczeń percepcyjnych badanego na podstawie aktywności neuronalnej w określonych obszarach mózgu. Na przykład stosowano ją do przewidywania orientacji dostrzeganych przez badanego prążków wizualnych na podstawie aktywności w wczesnych korach wzrokowych5 lub analogicznie treści mowy na podstawie aktywności we wczesnych korach słuchowych6. W niniejszym artykule wideo opisujemy nowatorskie zastosowanie MVPA, które wprowadza dodatkowy element do tego podstawowego paradygmatu wewnątrzmodalnego. W tym podejściu bodźce percepcyjne są przewidywane nie w obrębie jednego, lecz pomiędzy różnymi systemami sensorycznymi.
2. Wielowymiarowa analiza wzorców
Chociaż metoda MVPA jest obecnie dobrze ugruntowana w dziedzinie neuroobrazowania, zaczniemy od wskazania kluczowych różnic między MVPA a konwencjonalną, jednowymiarową analizą fMRI. W tym celu rozważmy następujący przykład pokazujący, w jaki sposób obie metody badają aktywność neuronalną w korze wzrokowej podczas prostego zadania wizualnego (Klip wideo 1):
- Badany otrzymuje dwa różne bodźce wizualne, na przykład obraz pomarańczy i obraz jabłka.
- Oba bodźce wywołują specyficzny wzorzec aktywności neuronalnej w pierwotnej korze wzrokowej, symbolizowany tutaj poziomach aktywacji sześciu hipotetycznych wokseli. (Oczywiście wzorce aktywności wywołane pojedynczym pokazaniem obrazu pomarańczy lub jabłka w rzeczywistości byłyby obarczone dużym szumem; przedstawione wzorce należy traktować jako średnie wynikające z dużej liczby prób).
- W konwencjonalnej analizie fMRI istnieją zasadniczo dwa sposoby analizy tych wzorców. Po pierwsze, można skupić się na średnim poziomie aktywności w całym obszarze zainteresowania.
- W podanym przykładzie różnica w średnich poziomach aktywności nie jest istotna, zatem wzorce odpowiadające dwóm bodźcom nie mogą zostać odróżnione z tego punktu widzenia.
- Innym sposobem analizy dwóch wzorców jest ustalenie kontrastu odejmowania między nimi: dla każdego woksela poziom aktywacji w warunku „jabłko” jest odejmowany od poziomu aktywacji w warunku „pomarańcza”. Wynikową różnicę można następnie zwizualizować dla każdego woksela na obrazie kontrastowym całego mózgu.
- Ponownie jednak różnice te mogą być niewielkie i mogą osiągnąć wymagane kryterium statystyczne tylko dla bardzo niewielu wokseli.
- W tym miejscu ujawnia się decydująca przewaga MVPA: jego wyższa moc wynika z faktu, że w przeciwieństwie do jednowymiarowych metod analizy, uwzględnia on poziomy aktywacji wszystkich wokseli jednocześnie, a tym samym jest w stanie wykryć w nich wzorce. Choć, jak wspomniano, tylko nieliczne różnice w aktywacji mogą być istotne, gdy są rozpatrywane w izolacji, dwa wzorce rozpatrywane jako całość mogą być rzeczywiście statystycznie różne.
Istnieje druga główna różnica między konwencjonalną analizą fMRI a MVPA (Klip wideo 2). Pierwsza metoda zazwyczaj stara się wykazać zależność statystyczną między określonymi bodźcami sensorycznymi a określonymi wzorcami aktywności mózgu w „sposób bezpośredni”; innymi słowy, stawia pytanie typu: „Czy dwa różne bodźce wzrokowe, np. obraz twarzy i obraz domu, doprowadzą do różnych poziomów aktywności w konkretnym obszarze zainteresowania, np. w zakręcie wrzecionowatym?”. Z kolei sukces MVPA jest zazwyczaj wyrażany w kategoriach „wnioskowania odwrotnego” lub „dekodowania”; typowe pytanie brzmi: „Na podstawie wzorca aktywności neuronalnej w konkretnym obszarze zainteresowania (np. w pierwotnej korze wzrokowej), czy można przewidzieć, czy badany postrzega bodziec A, np. pomarańczę, czy bodziec B, np. jabłko?”. Należy jednak zauważyć, że kierunek, w którym mapowana jest korelacja między bodźcami percepcyjnymi a aktywnością mózgu, nie ma znaczenia z punktu widzenia statystyki: stwierdzenie, że dwa bodźce prowadzą do odmiennych wzorców aktywności w danym obszarze mózgu, jest równoważne stwierdzeniu, że wzorzec aktywności w tym obszarze pozwala na przewidzenie bodźca indukującego11. Innymi słowy, czułość MVPA jest wyższa niż w przypadku analiz jednowymiarowych, ponieważ uwzględnia ona jednocześnie kilka wokseli, a nie dlatego, że przebiega w odwrotnym kierunku.
Poniższe kroki ilustrują, w jaki sposób typowy paradygmat MVPA odpowiedziałby na pytanie, czy widzenie jabłka indukuje w pierwotnej korze wzrokowej inny wzorzec aktywności neuronalnej niż widzenie pomarańczy (Klip wideo 3):
- Dane fMRI są gromadzone podczas gdy badany ogląda dużą liczbę bodźców przedstawiających jabłka i pomarańcze.
- Pozyskane dane są dzielone na zestaw danych treningowych i zestaw danych testowych. W przeciwieństwie do niniejszego przykładu, zestaw treningowy jest często wybierany tak, aby był większy od zestawu testowego, ponieważ można oczekiwać, że skuteczność klasyfikatora wzrośnie wraz z liczbą prób treningowych.
- Dane z zestawu treningowego są wprowadzane do klasyfikatora wzorców. Wykorzystując jeden z kilku możliwych algorytmów matematycznych, klasyfikator próbuje wykryć w wzorcach neuronalnych cechy, które odróżniają dwa typy bodźców od siebie. Rodzajem klasyfikatora powszechnie stosowanego (również w naszych poprzednich badaniach) są tak zwane maszyny wektorów nośnych (support vector machines); po więcej szczegółów czytelnika odsyłamy do przeglądów literatury wymienionych we wstępie.
- Po przeszkoleniu klasyfikatora na próbach treningowych, dostarcza mu się dane testowe. Poszczególne próby z zestawu danych testowych są nieoznaczone; innymi słowy, klasyfikator nie „wie”, czy wzorzec pochodzi z próby „jabłka”, czy „pomarańczy”.
- W oparciu o spójności, które udało mu się wykryć w zestawie danych treningowych, klasyfikator przypisuje najbardziej prawdopodobną etykietę do każdej z prób testowych.
- Dla każdego wzorca „zgadywanie” klasyfikatora może zostać porównane z poprawną etykietą bodźca.
- Jeśli klasyfikator nie był w stanie wykryć żadnych spójnych różnic między wzorcami wywołanymi przez dwa bodźce, jego skuteczność powinna znajdować się na poziomie przypadkowym; dla dwukierunkowej dyskryminacji przedstawionej w przykładzie odpowiadałoby to 50% poprawnych etykiet. Skuteczność predykcji znacznie powyżej tej wartości wskazuje, że rzeczywiście istnieją spójne różnice między dwoma typami bodźców.
Należy pamiętać, że kluczowe jest, aby zbiory danych treningowych i testowych były od siebie niezależne. Tylko w takim przypadku można wyciągać jakiekolwiek wnioski dotyczące uogólnialności wzorców wyprowadzonych ze zbioru treningowego. Badania MVPA często oceniają wydajność klasyfikatora przy użyciu paradygmatu walidacji krzyżowej (Klip wideo 4). Przyjmijmy, że eksperyment MVPA składa się z ośmiu serii funkcjonalnych. W pierwszym kroku walidacji krzyżowej klasyfikator jest trenowany na danych z serii od 1 do 7 i testowany na danych z serii 8. W drugim kroku klasyfikator jest trenowany na seriach od 1 do 6 oraz na serii 8, a następnie testowany na serii 7. Zgodnie z tym schematem przeprowadza się osiem kroków walidacji krzyżowej, w których każda seria służy jako seria testowa dokładnie raz. Całkowita wydajność klasyfikatora jest obliczana jako średnia z wydajności w poszczególnych krokach walidacji krzyżowej. Chociaż procedura ta gwarantuje niezależne zbiory danych treningowych i testowych na każdym kroku, maksymalizuje ona również całkowitą liczbę prób testowych, co może być korzystne przy ocenie istotności statystycznej wydajności klasyfikatora.
W internecie dostępne są bezpłatne pakiety oprogramowania do przeprowadzania MVPA; dwoma przykładami są PyMVPA12 (oparty na języku Python; http://www.pymvpa.org) oraz zestaw narzędzi oferowany przez Princeton Neuroscience Institute (oparty na Matlab; http://code.google.com/p/princeton-mvpa-toolbox/).
3. Międzymodalna MVPA i koncepcja stref konwergencji i dywergencji
Jak wspomniano we wstępie, paradygmaty eksperymentalne, takie jak ten opisany powyżej, były z sukcesem wykorzystywane do przewidywania bodźców percepcyjnych na podstawie aktywności neuronalnej w odpowiadających im korach sensorycznych; innymi słowy, bodźców wzrokowych na podstawie aktywności w korach wzrokowych oraz bodźców słuchowych na podstawie aktywności w korach słuchowych. Przedstawiamy tutaj rozszerzenie tej podstawowej koncepcji. W szczególności postawiliśmy hipotezę, że możliwe powinno być przewidywanie bodźców percepcyjnych nie tylko w obrębie jednej, ale i pomiędzy różnymi modalnościami. Percepcja sensoryczna jest ściśle powiązana z przywoływaniem wspomnień; na przykład bodziec wzrokowy o silnej implikacji słuchowej, taki jak widok rozbijającego się o ziemię szklanego wazonu, automatycznie wywoła w naszym „wyobrażeniu słuchowym” obrazy wykazujące podobieństwo do obrazów słuchowych, których doświadczyliśmy podczas poprzednich spotkań z tłukącym się szkłem. Zgodnie z modelem wprowadzonym przez Damasio ponad dwie dekady temu9,10, asocjacja pamięciowa między widokiem wazonu a odpowiadającymi mu obrazami dźwiękowymi jest przechowywana w tzw. strefach konwergencji-dywergencji (CDZs; Klip wideo 5). CDZs to zespoły neuronów w korach asocjacyjnych, które otrzymują zbieżne projekcje oddolne (bottom-up) z różnych wczesnych obszarów kory (poprzez kilka poziomów hierarchicznych), a w zamian przesyłają rozbieżne projekcje odgórne (top-down) do tych samych miejsc w korze. Dzięki zbieżnym projekcjom oddolnym CDZs mogą być aktywowane przez reprezentacje percepcyjne w wielu modalnościach – na przykład zarówno przez widok, jak i dźwięk rozbijającego się wazonu; dzięki rozbieżnym projekcjom odgórnym mogą następnie wspomagać rekonstrukcję powiązanych obrazów, przesyłając sygnały zwrotne do wczesnych kor sensorycznych innych modalności. Damasio podkreślił ten drugi punkt: aktywacja CDZs w korach asocjacyjnych nie byłaby wystarczająca do świadomego przywołania obrazu z pamięci; dopiero w momencie, gdy CDZs zrekonstruują jawne reprezentacje neuronalne we wczesnych korach sensorycznych, obraz zostanie świadomie doświadczony. Tym samym model ten przewiduje specyficzną sekwencję przetwarzania neuronalnego w odpowiedzi na (czysto) wzrokowy bodziec, który implikuje dźwięk (Klip wideo 6):
- Bodziec wywołuje najpierw specyficzny wzorzec aktywności neuronalnej (czerwone prostokąty) w wczesnych korach wzrokowych.
- Poprzez zbieżne projekcje typu bottom-up, neurony we wczesnych korach wzrokowych przesyłają sygnały dalej, do pierwszego poziomu CDZ (CDZ1). Zbieżny wzorzec połączeń pozwala jednostkom CDZ1 wykrywać określone wzorce aktywności we wczesnych korach wzrokowych. W zależności od dokładnego wzorca, CDZ może zostać aktywowane lub nie. CDZ działają zatem jako ekstraktory cech. W tym przykładzie aktywowane zostają dwa CDZ1 (co wskazuje czerwony kolor), podczas gdy trzecie nie zostaje uruchomione przez specyficzny wzorzec aktywności w odpowiadającym mu sektorze wczesnych kor wzrokowych.
- Jednostki CDZ1 przesyłają zbieżne projekcje bottom-up do CDZ2; w związku z tym, podobnie jak CDZ1 wykrywały określone wzorce aktywności we wczesnych korach wzrokowych, CDZ2 są w stanie wykrywać wzorce aktywności pomiędzy jednostkami CDZ1. Kilka jednostek CDZ2 może zostać aktywowanych przez specyficzną konfigurację aktywnych CDZ1; dla uproszczenia przedstawiono tutaj tylko jedną jednostkę CDZ2. W tym przykładzie wzorzec aktywności pomiędzy CDZ1 jest wystarczający do aktywacji tej jednostki CDZ2.
- Warto zauważyć, że CDZ1 projektują nie tylko w przód do CDZ2, ale także wstecz do wczesnych kor (niebieskie strzałki). Te sygnały top-down mogą uzupełnić (prawdopodobnie zaszumiony) wzorzec aktywności początkowo wywołany przez bodziec (niebieski prostokąt). Zasadniczo kolor czerwony oznacza aktywacje bottom-up, natomiast kolor niebieski reprezentuje aktywacje top-down.
- Poprzez kilka dodatkowych poziomów CDZ, jednostki CDZ2 projektują w przód do CDZn w korach asocjacyjnych wyższego rzędu (przerywana strzałka). Jedna lub kilka jednostek CDZn może odpowiedzieć na rozważany specyficzny bodziec wzrokowy (przedstawiono tylko jedną).
- Ponownie należy zaznaczyć, że CDZ2 również przesyłają sygnały wstecz do CDZ1, co z kolei może dalej modyfikować wzorzec pierwotnie wywołany we wczesnych korach wzrokowych.
- Jednostki CDZn przesyłają sygnały zwrotne do CDZ2 wszystkich modalności. W korach wzrokowych może to prowadzić do dopełnienia wzorców aktywności w CDZ niższego poziomu. W korach słuchowych zostanie zbudowany wzorzec neuronalny – najpierw na poziomie CDZ2 i CDZ1, a ostatecznie we wczesnych korach słuchowych – co umożliwia świadome doświadczenie obrazu słuchowego powiązanego z bodźcem zaprezentowanym wizualnie. Należy zauważyć, że występuje również sygnalizacja top-down do modalności somatosensorycznej, choć w mniejszym stopniu niż w przypadku modalności słuchowej. Odzwierciedla to fakt, że prawie każdy bodziec wzrokowy ma pewne powiązania dotykowe. Ponieważ jednak przyjmuje się, że bodziec wzrokowy w obecnym przykładzie konkretnie implikuje dźwięk, sygnalizacja top-down do kor słuchowych jest bardziej rozległa.
W oparciu o proponowaną sekwencję przetwarzania neuronalnego, ramy teoretyczne stawiają konkretną prognozę: bodźce wzrokowe zawierające obiekty i zdarzenia silnie sugerujące dźwięk powinny wywoływać aktywność neuronalną we wczesnych korach słuchowych. Co więcej, wzorce aktywności słuchowej powinny być specyficzne dla bodźca; innymi słowy, klip wideo przedstawiający rozbijający się wazon powinien indukować inny wzorzec niż klip z wyjącym psem. Gdyby ta prognoza była słuszna, powinniśmy być w stanie przeprowadzić MVPA w sposób międzymodalny: na przykład powinniśmy móc przewidzieć, wyłącznie na podstawie neuronalnego „odcisku palca” we wczesnych korach słuchowych, czy dana osoba widzi rozbijający się wazon, czy wyjącego psa (Klip wideo 7). Naturalnie, analogiczne paradygmaty wywołujące transfer informacji między innymi modalnościami sensorycznymi również powinny okazać się skuteczne. Na przykład, gdyby klipy wideo prezentowane badanemu sugerowały dotyk zamiast dźwięku, powinniśmy być w stanie zidentyfikować te klipy na podstawie wzorców aktywności, jakie wywołują one we wczesnej korze somatosensorycznej.
4. Bodźce
Ogólny paradygmat badania MVPA opisano w Sekcji 2. Nasze podejście różni się od poprzednich badań tym, że podejmuje próbę przeprowadzenia MVPA pomiędzy systemami sensorycznymi, a zatem wykorzystuje bodźce specjalnie zaprojektowane tak, aby miały znaczenie w innej modalności sensorycznej niż ta, w której są prezentowane. W jednym z poprzednich badań rejestrowaliśmy np. aktywność neuronalną z pierwotnej kory somatosensorycznej, podczas gdy badani oglądali 5-sekundowe klipy wideo przedstawiające manipulowanie codziennymi przedmiotami przez ludzkie dłonie8 (Klip wideo 8 oraz Klip wideo 9). W innym badaniu analizowaliśmy aktywność neuronalną we wczesnych korach słuchowych, podczas gdy badani oglądali klipy wideo przedstawiające obiekty i zdarzenia silnie sugerujące dźwięk7 (Klip wideo 10 oraz Klip wideo 11). Jednak zgodnie z ramami CDZ, bodźce sensoryczne wszystkich modalności mogą potencjalnie zostać zastosowane w tym ogólnym paradygmacie, o ile mają one znaczenie w dodatkowych modalnościach.
5. Obszary zainteresowania
Zazwyczaj obszary zainteresowania w badaniach neuroobrazowych można określić funkcjonalnie lub anatomicznie. Uważamy, że w opisanym tutaj paradygmacie eksperymentalnym bardziej odpowiednie są lokalizatory anatomiczne z dwóch powodów. Po pierwsze, funkcjonalne zdefiniowanie kory pierwotnej lub wczesnej danej modalności sensorycznej (z możliwym wyjątkiem pierwotnej kory wzrokowej) nie jest trywialne, ponieważ przetwarzanie bodźców percepcyjnych prezentowanych badanemu w tej modalności zazwyczaj nie ogranicza się do tych obszarów. Na przykład trudne byłoby zdefiniowanie pierwotnej kory somatosensorycznej poprzez dotykanie dłoni badanego, gdyż aktywność wywołana tą procedurą z dużym prawdopodobieństwem rozprzestrzeniłaby się również na korę asocjacyjną somatosensoryczną. Po drugie, lokalizator funkcjonalny może nie oznaczyć wszystkich wokseli, które potencjalnie mogłyby przyczynić się do skuteczności klasyfikatora: wykazano, że obszary, które nie wykazują wypadkowej aktywacji w odpowiedzi na bodźce sensoryczne w klasycznym sensie (tj. regiony, które nie pojawiają się na obrazie kontrastowym [stymulacja vs. spoczynek]), mogą mimo to zawierać informacje o bodźcach13,14. Z tych dwóch powodów opowiadamy się za stosowaniem anatomicznie zdefiniowanych obszarów zainteresowania wszędzie tam, gdzie pozwalają na to makroskopowe punkty orientacyjne; na przykład ogólna anatomia zakrętu zaśrodkowego reprezentuje rozsądne przybliżenie pierwotnej kory somatosensorycznej i to ją wykorzystaliśmy do zdefiniowania obszaru zainteresowania w naszym badaniu somatosensorycznym8 (Rysunek 1).
6. Uczestnicy
Próbki badawcze w badaniach MVPA mają tendencję do bycia mniejszymi niż w konwencjonalnych badaniach fMRI, ponieważ analizy mogą być przeprowadzane na poziomie pojedynczego uczestnika. Oczywiście nie uniemożliwia to badaczowi późniejszej analizy wyników poszczególnych osób również na poziomie grupowym. W dwóch wspomnianych wcześniej badaniach przeprowadziliśmy na przykład testy t dla wyników poszczególnych uczestników, aby ocenić ich istotność na poziomie grupy. W każdym badaniu wzięło udział ośmiu uczestników; choć taką próbę należy uznać za bardzo małą dla testów parametrycznych, wiele z ocenianych przez nas rozróżnień okazało się istotnych (patrz poniżej).
7. Reprezentatywne wyniki:
Jak wspomniano, w dwóch poprzednich badaniach dążyliśmy do przewidywania klipów wideo sugerujących dźwięk na podstawie aktywności neuronalnej w wczesnych korach słuchowych7 (maskę użytą w tym badaniu przedstawiono na rysunku 2) oraz klipów wideo sugerujących dotyk na podstawie aktywności w pierwotnych korach somatosensorycznych8. Próba ta zakończyła się sukcesem: w obu badaniach klasyfikator MVPA uzyskał wynik powyżej poziomu przypadkowego 50% dla wszystkich możliwych dwukierunkowych rozróżnień między parami bodźców (n = 36 w badaniu słuchowym, przy 9 różnych bodźcach; n = 10 w badaniu somatosensorycznym, przy 5 różnych bodźcach). W badaniu słuchowym 26 z 36 rozróżnień osiągnęło istotność statystyczną; w badaniu somatosensorycznym miało to miejsce w przypadku 8 z 10 rozróżnień (obustronne testy t, n = 8 w obu badaniach; rysunek 3).

Rysunek 1. Zakres anatomicznie zdefiniowanej maski pierwotnej kory somatosensorycznej, stosowanej w pracy Meyera i wsp., 2011. Algorytm klasyfikatora był w stanie przewidzieć klipy wideo sugerujące dotyk na podstawie wzorców aktywności mózgu ograniczonych do wyznaczonego obszaru. Przedrukowano za zgodą Oxford University Press.

Rycina 2. Zakres anatomicznie zdefiniowanej maski wczesnych kory słuchowych, zastosowanej w pracy Meyer i wsp., 2010. Algorytm klasyfikujący był w stanie przewidzieć (wyciszone) klipy wideo sugerujące dźwięk na podstawie wzorców aktywności mózgu ograniczonych do wyznaczonego obszaru. Powtórzone za zgodą Nature Publishing Group.

Rycina 3. Podsumowanie wyników naszych poprzednich międzymodalnych badań MVPA. Klasyfikator został wykorzystany do przewidywania bodźców wzrokowych sugerujących dźwięk lub dotyk na podstawie aktywności odpowiednio w wczesnej korze słuchowej lub pierwotnej korze somatosensorycznej. Panele górne: w obu badaniach wydajność predykcji była powyżej poziomu przypadkowego 0,5 dla wszystkich dyskryminacji dwukierunkowych między parami bodźców. Panele dolne: w badaniu słuchowym wydajność klasyfikatora osiągnęła istotność statystyczną dla 26 z 36 dyskryminacji; w badaniu somatosensorycznym miało to miejsce w 8 z 10 dyskryminacji. Reprodukowano za zgodą Nature Publishing Group oraz Oxford University Press.