Emocje to wielowymiarowy proces psychologiczny i fizjologiczny kształtowany przez bodźce zewnętrzne, wewnętrzną ocenę oraz ciągłą regulację poznawczą, dlatego zajmuje centralne miejsce w interakcji człowiek-komputer oraz naukach kognitywnych1. W miejscach wystaw malarskich emocje pośredniczą także w relacji między dziełami sztuki wizualnej a interpretacją widza. Z tego powodu identyfikacja stanów emocjonalnych widza ma praktyczną wartość dla oceny wystaw, projektowania przestrzennego oraz empirycznych badań doświadczeń estetycznych2. Jednocześnie pomiar emocji w półnaturalnych środowiskach wystawowych pozostaje technicznie trudny, ponieważ reakcje są subtelne, przemijające i wpływają zarówno dzieło sztuki, jak i kontekst oglądania.
Badania nad rozpoznawaniem emocji rozwijały się zazwyczaj w dwóch głównych kierunkach: analizie behawioralnej i analizie fizjologicznej. Podejścia behawioralne, zwłaszcza analiza mimiki twarzy oparta na wizji komputerowej, są szeroko stosowane, ponieważ są nieinwazyjne i stosunkowo łatwe do wdrożenia. Modele głębokiego uczenia, takie jak sieci rezydualne i lekkie sieci splotowe, wykazały się silną wydajnością w podstawowych zadaniach klasyfikacji emocji twarzy4. Jednak zachowanie twarzy podczas oglądania obrazu może być słabe, społecznie umiarkowane lub celowo powstrzymane, co może zmniejszyć korespondencję między wyrazem widzialnym a subiektywnym uczuciem5. Podejścia fizjologiczne, szczególnie oparte na elektroencefalografii (EEG), zapewniają bardziej bezpośredni dostęp do aktywności nerwowej związanej z przetwarzaniem afektywnym6. EEG jest szeroko stosowane w badaniach emocji, ponieważ fluktuacje czasowe sygnałów nerwowych są istotne dla zmian stanu afektywnego, w tym wymiarów związanych z walencją i pobudzeniem7. Mimo to nagrania EEG są wrażliwe na artefakty ruchu, zanieczyszczenia elektromiograficzne i szumy środowiskowe, a samo EEG często dostarcza ograniczonych informacji kontekstowych o tym, na co widz wizualnie reagujena 8.
Te komplementarne mocne i słabe strony zwiększyły zainteresowanie multimodalnym rozpoznawaniem emocji9. Główną zasadą fuzji multimodalnej jest to, że sygnały heterogeniczne mogą dostarczać wzajemnie informacyjnych dowodów i zmniejszać niejednoznaczność powstającą, gdy pojedyncza modalność jest interpretowana w izolacji10. Na przykład w zadaniach związanych z oglądaniem obrazów powściągliwe zachowanie twarzy może nadal pokrywać się z mierzalnymi zmianami neuronowymi związanymi z uwagą lub zaangażowaniem afektywnym. Jednak istniejące systemy multimodalne nie zawsze skutecznie modelują tę relację. Wczesne strategie fuzji oparte na bezpośrednim łączeniu cech mogą zwiększać obciążenie wymiarowe i rozmywać specyficzną dla modalności strukturę czasową11. Późne strategie fuzji oparte na oddzielnych decyzjach są łatwiejsze do wdrożenia, ale mogą pomijać drobnoziarniste interakcje między sygnałami wzrokowymi a fizjologicznymi podczas przetwarzania emocji12. Ponadto wiele modeli multimodalnych wykorzystuje stałe lub słabo adaptacyjne schematy fuzji, które nie są dobrze przystosowane do zmiennych reakcji widzów w sytuacjach przypominających wystawę13.
Aby rozwiązać te ograniczenia, niniejszy protokół opisuje sieć dwugałęziowej cross-attention do multimodalnego rozpoznawania emocji podczas oglądania obrazów. W tym ujęciu cechy EEG są przetwarzane przez konwolucyjną sieć neuronową dwukierunkową długo-krótkotrwałą pamięć (CNN-BiLSTM), który służy do reprezentacji dynamiki nerwowej przestrzenno-czasowej. Cechy wideo twarzy są przetwarzane przez gałąź MobileNetV2 z uwzględnieniem współrzędnych, która służy do rejestrowania sygnałów ekspresji o niskiej intensywności przy zachowaniu efektywności obliczeniowej14. Obie gałęzie są następnie integrowane poprzez wielogłowy mechanizm wzajemnej uwagi, który uczy się istotności między modalnościami, zamiast po prostu łączyć ich wyniki15,16. Projekt ten ma na celu zachowanie struktury specyficznej dla modalności przy jednoczesnym ulepszeniu modelowania interakcji międzymodalnych.
Metoda ta została zaprojektowana przede wszystkim do analizy offline w warunkach kontrolowanego pozyskiwania danych, a nie do bezpośredniego wdrożenia w czasie rzeczywistym w otwartych przestrzeniach wystawienniczych. Niezawodna implementacja wymaga zsynchronizowanego rejestrowania EEG i wideo, stabilnego oświetlenia, kontrolowanego rozmieszczenia kamery, akceptowalnej impedancji elektrod oraz wystarczających zasobów obliczeniowych do trenowania modeli. Wyniki mogą również zależeć od składu próbki, typu bodźca oraz stopnia, w jakim uczestnicy modyfikują zachowanie, ponieważ wiedzą, że są nagrywani. Te ograniczenia operacyjne powinny być brane pod uwagę przy dostosowywaniu protokołu do innych miejsc wystawienniczych lub grup grup.
Przedstawiony tutaj protokół obejmuje pełny proces eksperymentalny, w tym zsynchronizowane pozyskiwanie danych od 327 uczestników, wstępne przetwarzanie danych EEG i wideo twarzy, ekstrakcję cech, fuzję międzymodalną oraz klasyfikację. Celem jest zapewnienie powtarzalnego workflow dla multimodalnego rozpoznawania emocji w badaniach wystaw malarskich. Poza obliczeniami afektywnymi17, protokół może również wspierać badania ilościowe w estetyce empirycznej oraz powiązane badania psychologiczne18.