Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł metodologiczny

Sieć dwubocznej uwagi krzyżowej do elektroencefalografii i multimodalnego rozpoznawania emocji twarzy podczas oglądania obrazu

107 wyświetleń

DOI:

10.3791/70600

12 maja 2026

W tym artykule

Podsumowanie

Protokół ten opisuje zsynchronizowane pozyskiwanie danych elektroencefalograficznych i twarzy w ustawieniach obserwacji obrazów oraz sieć dwugałęziowej cross-attention do multimodalnego rozpoznawania emocji, w tym wstępnego przetwarzania, fuzji cech oraz klasyfikacji czterech stanów emocjonalnych.

Streszczenie

Rozpoznawanie emocji podczas oglądania obrazu pozostaje trudne, ponieważ reakcje estetyczne są dynamiczne, zależne od kontekstu i tylko częściowo obserwowalne przez zachowanie zewnętrzne. Podejścia unimodalne oparte wyłącznie na mimice twarzy lub wyłącznie na sygnałach fizjologicznych często dostarczają niepełnych odwzorowań doświadczenia widza. Niniejszy artykuł opisuje powtarzalną metodę budowy sieci dwugałęziowej cross-sight, która integruje obraz twarzy z danymi elektroencefalograficznymi (EEG) w celu multimodalnego rozpoznawania emocji w kontekście wystawy malarskiej. Protokół rozpoczyna się od ustanowienia zsynchronizowanego środowiska akwizycji z wykorzystaniem 64-kanałowego systemu EEG oraz kamery wysokiej rozdzielczości do jednoczesnego nagrywania podczas oglądania obrazów. Kolejna procedura opisuje wstępne przetwarzanie sygnału, w tym filtrowanie EEG, segmentację oraz ekstrakcję cech różnicowej entropii, a także wykrywanie twarzy, ustawianie i przygotowanie klatki do analizy wideo. Sieć neuronowa zawiera dwie gałęzie specyficzne dla modalności. Gąź EEG wykorzystuje sieć neuronową splotową oraz dwukierunkową sieć pamięci długotrwałej i krótkotrwałej do modelowania cech nerwowych przestrzenno-czasowych, podczas gdy gałąź twarzy wykorzystuje lekką sieć splotową z uwzględnieniem współrzędnych do wydobywania cech ekspresji wzrokowej. Następnie używany jest moduł wielogłowej uwagi krzyżowej do połączenia obu nurtów poprzez naukę intermodalnej istotności. W warunkach eksperymentalnych opisanych tutaj, ramy multimodalne osiągnęły wyższą dokładność klasyfikacji niż modele porównawcze unimodalne w czterokategoriowym rozpoznawaniu emocji. Metoda ta jest najbardziej odpowiednia do analizy offline w kontrolowanych warunkach akwizycji i stanowi praktyczne ramy dla obliczeń afektywnych, estetyki empirycznej oraz badań nad interakcją człowiek-komputer zorientowaną na wystawy.

Wprowadzenie

Emocje to wielowymiarowy proces psychologiczny i fizjologiczny kształtowany przez bodźce zewnętrzne, wewnętrzną ocenę oraz ciągłą regulację poznawczą, dlatego zajmuje centralne miejsce w interakcji człowiek-komputer oraz naukach kognitywnych1. W miejscach wystaw malarskich emocje pośredniczą także w relacji między dziełami sztuki wizualnej a interpretacją widza. Z tego powodu identyfikacja stanów emocjonalnych widza ma praktyczną wartość dla oceny wystaw, projektowania przestrzennego oraz empirycznych badań doświadczeń estetycznych2. Jednocześnie pomiar emocji w półnaturalnych środowiskach wystawowych pozostaje technicznie trudny, ponieważ reakcje są subtelne, przemijające i wpływają zarówno dzieło sztuki, jak i kontekst oglądania.

Badania nad rozpoznawaniem emocji rozwijały się zazwyczaj w dwóch głównych kierunkach: analizie behawioralnej i analizie fizjologicznej. Podejścia behawioralne, zwłaszcza analiza mimiki twarzy oparta na wizji komputerowej, są szeroko stosowane, ponieważ są nieinwazyjne i stosunkowo łatwe do wdrożenia. Modele głębokiego uczenia, takie jak sieci rezydualne i lekkie sieci splotowe, wykazały się silną wydajnością w podstawowych zadaniach klasyfikacji emocji twarzy4. Jednak zachowanie twarzy podczas oglądania obrazu może być słabe, społecznie umiarkowane lub celowo powstrzymane, co może zmniejszyć korespondencję między wyrazem widzialnym a subiektywnym uczuciem5. Podejścia fizjologiczne, szczególnie oparte na elektroencefalografii (EEG), zapewniają bardziej bezpośredni dostęp do aktywności nerwowej związanej z przetwarzaniem afektywnym6. EEG jest szeroko stosowane w badaniach emocji, ponieważ fluktuacje czasowe sygnałów nerwowych są istotne dla zmian stanu afektywnego, w tym wymiarów związanych z walencją i pobudzeniem7. Mimo to nagrania EEG są wrażliwe na artefakty ruchu, zanieczyszczenia elektromiograficzne i szumy środowiskowe, a samo EEG często dostarcza ograniczonych informacji kontekstowych o tym, na co widz wizualnie reagujena 8.

Te komplementarne mocne i słabe strony zwiększyły zainteresowanie multimodalnym rozpoznawaniem emocji9. Główną zasadą fuzji multimodalnej jest to, że sygnały heterogeniczne mogą dostarczać wzajemnie informacyjnych dowodów i zmniejszać niejednoznaczność powstającą, gdy pojedyncza modalność jest interpretowana w izolacji10. Na przykład w zadaniach związanych z oglądaniem obrazów powściągliwe zachowanie twarzy może nadal pokrywać się z mierzalnymi zmianami neuronowymi związanymi z uwagą lub zaangażowaniem afektywnym. Jednak istniejące systemy multimodalne nie zawsze skutecznie modelują tę relację. Wczesne strategie fuzji oparte na bezpośrednim łączeniu cech mogą zwiększać obciążenie wymiarowe i rozmywać specyficzną dla modalności strukturę czasową11. Późne strategie fuzji oparte na oddzielnych decyzjach są łatwiejsze do wdrożenia, ale mogą pomijać drobnoziarniste interakcje między sygnałami wzrokowymi a fizjologicznymi podczas przetwarzania emocji12. Ponadto wiele modeli multimodalnych wykorzystuje stałe lub słabo adaptacyjne schematy fuzji, które nie są dobrze przystosowane do zmiennych reakcji widzów w sytuacjach przypominających wystawę13.

Aby rozwiązać te ograniczenia, niniejszy protokół opisuje sieć dwugałęziowej cross-attention do multimodalnego rozpoznawania emocji podczas oglądania obrazów. W tym ujęciu cechy EEG są przetwarzane przez konwolucyjną sieć neuronową dwukierunkową długo-krótkotrwałą pamięć (CNN-BiLSTM), który służy do reprezentacji dynamiki nerwowej przestrzenno-czasowej. Cechy wideo twarzy są przetwarzane przez gałąź MobileNetV2 z uwzględnieniem współrzędnych, która służy do rejestrowania sygnałów ekspresji o niskiej intensywności przy zachowaniu efektywności obliczeniowej14. Obie gałęzie są następnie integrowane poprzez wielogłowy mechanizm wzajemnej uwagi, który uczy się istotności między modalnościami, zamiast po prostu łączyć ich wyniki15,16. Projekt ten ma na celu zachowanie struktury specyficznej dla modalności przy jednoczesnym ulepszeniu modelowania interakcji międzymodalnych.

Metoda ta została zaprojektowana przede wszystkim do analizy offline w warunkach kontrolowanego pozyskiwania danych, a nie do bezpośredniego wdrożenia w czasie rzeczywistym w otwartych przestrzeniach wystawienniczych. Niezawodna implementacja wymaga zsynchronizowanego rejestrowania EEG i wideo, stabilnego oświetlenia, kontrolowanego rozmieszczenia kamery, akceptowalnej impedancji elektrod oraz wystarczających zasobów obliczeniowych do trenowania modeli. Wyniki mogą również zależeć od składu próbki, typu bodźca oraz stopnia, w jakim uczestnicy modyfikują zachowanie, ponieważ wiedzą, że są nagrywani. Te ograniczenia operacyjne powinny być brane pod uwagę przy dostosowywaniu protokołu do innych miejsc wystawienniczych lub grup grup.

Przedstawiony tutaj protokół obejmuje pełny proces eksperymentalny, w tym zsynchronizowane pozyskiwanie danych od 327 uczestników, wstępne przetwarzanie danych EEG i wideo twarzy, ekstrakcję cech, fuzję międzymodalną oraz klasyfikację. Celem jest zapewnienie powtarzalnego workflow dla multimodalnego rozpoznawania emocji w badaniach wystaw malarskich. Poza obliczeniami afektywnymi17, protokół może również wspierać badania ilościowe w estetyce empirycznej oraz powiązane badania psychologiczne18.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Protokół badania został przeanalizowany i zatwierdzony przez Komitet Etyki ds. Ochrony Badań Ludzkich Uniwersytetu Normalnego Xingyi Minzu (Nr Zatwierdzenia 2600AL0621). Pisemna świadoma zgoda została uzyskana od wszystkich uczestników przed ich włączeniem do badania oraz przed zebraniem danych.

1. Rekrutacja uczestników i etyczna zgodność

  1. Uzyskanie etycznego zatwierdzenia
    1. Przed rozpoczęciem badania przedłóż pełny protokół eksperymentalny, formularz zgody, kartę informacyjną dla uczestników oraz plan ochrony danych do instytucjonalnej komisji przeglądowej (IRB) lub komisji etyki.
    2. Uzyskaj pisemną zgodę i zapisz numer zatwierdzenia w dokumentacji badania.
  2. Rekrutacja uczestników
    1. Rekrutuj zdrowych dorosłych uczestników do multimodalnego przyswajania emocji podczas oglądania obrazów. W tym protokole demonstracyjnym zrekrutuj 327 uczestników.
    2. Stosuj następujące kryteria włączenia: wiek 18–35 lat, prawidłowy lub skorygowany do normalnego wzroku, brak samozgłaszanej historii zaburzeń neurologicznych, brak aktualnego stosowania leków psychoaktywnych oraz chęć poddania się rejestracji elektroencefalografii (EEG) i nagrywaniu twarzy.
    3. Stosuj następujące kryteria wyłączenia: nadmierne uszkodzenia skóry głowy lub schorzenia dermatologiczne uniemożliwiające umieszczenie elektrody, niemożność ukończenia pełnej sesji nagrania, poważne ruchy podczas akwizycji lub niepełna dokumentacja zgody.
    4. Rejestruj cechy uczestników, takie jak wiek, płeć, handee, wcześniejsze doświadczenie w oglądaniu techniki oraz poziom wykształcenia. W tym protokole demonstracyjnym zapisz następującą próbkę KRÓTKIEGO DŁUGIEGO STRESZCZENIA: średni wiek 24,8 ± 3,7 roku, 165 kobiet i 162 mężczyzn, wszyscy uczestnicy praworęczni.
    5. Zdefiniuj balans demograficzny operacyjnie przed rekrutacją. W tym protokole demonstracyjnym używa się tego terminu, aby wskazać w przybliżonym zrównoważonym rozkładzie płci oraz zakres wieku skoncentrowany we wczesnej dorosłości, aby zmniejszyć zmienność reakcji EEG i mimiki związaną z wiekiem.
  3. Uzyskanie świadomej zgody
    1. Zapewnij każdemu uczestnikowi pisemny formularz zgody informowany o rejestracji EEG, nagraniu twarzy, procedurach synchronizacji, anonimizacji, przechowywaniu danych oraz prawie do wycofania się w dowolnym momencie bez kary.
    2. Wyjaśnij, że obrazy twarzy będą używane do wyodrębniania cech, a obszary oczu będą maskowane we wszystkich figurach rękopisu, aby chronić tożsamość uczestników.
    3. Uzyskaj pisemną świadomą zgodę przed rozpoczęciem jakiegokolwiek eksperymentalnego zabiegu.
  4. Przypisywanie identyfikatorów i anonimizacja danych
    1. Przypisz każdemu uczestnikowi unikalny numeryczny identyfikator badania. Przechowuj pliki EEG, wideo i metadane używając wyłącznie identyfikatora badania.
    2. Przechowuj formularze zgody osobno od danych fizjologicznych i obrazowych. Używaj zdezidentyfikowanych ramek twarzy lub wyników pochodzących z charakterystycznych punktów twarzy do wewnętrznego przechowywania analiz, gdy wymaga tego lokalna polityka etyka.

2. Środowisko eksperymentalne i przygotowanie bodźców

  1. Przygotowanie środowiska do oglądania
    1. Przygotuj ciche pomieszczenie wewnętrzne, aby symulować kontrolowane środowisko wystawy malarskiej. Utrzymuj temperaturę otoczenia 22–24 °C oraz wilgotność względną na poziomie 45%–60%. Kontroluj szum tła poniżej 40 dB, gdzie to możliwe.
    2. Usiądź uczestnika na wyprostowanym krześle z podparciem oparcia i ustaw go tak, aby odległość widzenia między uczestnikiem a wyświetlaczem wynosiła 2,0 m.
    3. Polec uczestnikowi, aby podczas prezentacji bodźca pozostawał samotnie w miejscu nagrania. Nie pozwalaj innym uczestnikom lub obserwatorom znajdować się w bezpośrednim polu widzenia podczas pozyskiwania danych.
  2. Konfiguracja oświetlenia
    1. Zainstaluj przed uczestnikiem rozproszone oświetlenie pierścieniowe lub okrągłe, aby zmniejszyć cienienie twarzy. Ustaw oświetlenie na stabilny poziom około 500 luksów na poziomie powierzchni.
    2. Unikaj szybkich zmian światła i bezpośredniego odblasku na oczy, czole lub policzki. Punkt kontrolny wizualny: Potwierdź, że cała twarz, w tym czoło, brwi, oczy, nos, policzki i okolice ust, jest widoczna w podglądzie aparatu bez nadmiernej ekspozycji czy głębokiego cienia.
  3. Konfiguracja prezentacji bodźców wzrokowych
    1. Prezentuj bodźce wizualne na monitorze lub ekranie projekcyjnym. W tym protokole demonstracyjnym używa się 27-calowego monitora ciekłokrystalicznego o rozdzielczości 1 920 x 1 080 pikseli i częstotliwości odświeżania 60 Hz.
    2. Prezentuj bodźce do oglądania obrazu w formacie wideo lub pokazu slajdów zgodnie z projektem badania. Stosuj te same zasady jasności, kontrastu i kolejności prezentacji dla wszystkich uczestników.
    3. Każdy klip z malowaniem prezentuj przez 90–120 sekund. W tym protokole demonstracyjnym używaj 6 klipów, każdy trwający 100 sekund, z 20-sekundowym interbodźcowym odpoczynkiem.
      UWAGA: Uziemić wszystkie urządzenia elektryczne prawidłowo i umieść wzmacniacz EEG oraz kable zasilające z dala od źródeł o wysokim poziomie zakłóceń, aby zmniejszyć szum linii 50/60 Hz.

3. Multimodalne pozyskiwanie danych

  1. Pozyskiwanie nagrań z twarzy
    1. Umieść przemysłową kamerę wysokiej rozdzielczości bezpośrednio przed uczestnikiem, mniej więcej na wysokości oczu. Ustaw odległość kamery do twarzy na 1,2 m.
    2. Użyj aparatu o minimalnej rozdzielczości przejęcia 1 920 x 1 080 pikseli i szybkostrzelności 30 klatek/s.
    3. Ustawiaj ekspozycję ręcznie, aby uniknąć wahań klatka do klatki. W tym protokole demonstracyjnym stosuje się ISO 400, czas naświetlania 1/60 s oraz stały balans bieli.
    4. Zapisz wideo w formacie MP4 lub AVI przy stałej liczbie klatek na sekundę. W tym protokole demonstracyjnym zapisz wideo jako MP4, kodowanie H.264, 30 klatek na godzinę.
    5. Sprawdź, czy cała twarz pozostaje w polu widzenia przez całą sesję nagrania. Punkt kontrolny wizualny: Upewnij się, że brwi i czoło są w pełni widoczne. Natychmiast przesuń aparat, jeśli czoło, okolice brwi lub podbródek są przycięte.
      UWAGA: Używaj 30 klatek/s, ponieważ ta liczba klatek zapewnia odpowiednią rozdzielczość czasową dla dynamiki wyrazu twarzy o niskiej intensywności, jednocześnie utrzymując akceptowalne obciążenie pamięci i przetwarzania w zsynchronizowanym nagrywaniu multimodalnym.
  2. Pozyskiwanie sygnałów EEG
    1. Zmierz obwód głowicy i wybierz odpowiedni rozmiar kondensatora dla uczestnika. Umieść kondensator EEG na 64 kanały zgodnie z międzynarodowym systemem 10–20 lub według specyfikacji producenta 64-kanałowego rozszerzenia.
    2. Ustawij czapkę zgodnie z punktami orientacyjnymi anatomicznymi. Umieść Fpz na linii środkowej powyżej nazionu i zweryfikowaj symetrię na lewej i prawej półkuli.
    3. Rozdziel włosy w każdym miejscu elektrody i nałóż przewodzący żel, aby poprawić kontakt elektrody z skórą głowy.
    4. Delikatnie przygotuj skórę głowy w miejscach o wysokiej impedancji, używając patyczka kosmetycznego lub narzędzia do przygotowania tępych środków. Nie ścieraj skóry zbyt mocno.
    5. Podłącz kondensator do wzmacniacza EEG i wykonaj pomiar impedancji. Zmniejsz impedancję elektrod do poniżej 10 kΩ dla wszystkich kanałów. W tym protokole demonstracyjnym celuj w < 5 kΩ dla elektrod czołowych i centralnych, jeśli to możliwe.
    6. Ustaw częstotliwość próbkowania na 500 Hz. Ustaw odniesienie online zgodnie z konfiguracją wzmacniacza. W tym protokole demonstracyjnym używa się powiązanego odniesienia sutkowego podczas pozyskiwania i wykonuje wspólne średnie ponowne referencje podczas wstępnego przetwarzania.
    7. Umieść elektrodę uziemiającą zgodnie ze specyfikacją wzmacniacza. W tym protokole demonstracyjnym umieść ziemię na AFz. Zapisz co najmniej 60 sekund odpoczynku przed prezentacją bodźca.
    8. Punkt kontrolny wizualny: Przed rozpoczęciem eksperymentu sprawdź na żywo ślady EEG. Potwierdź stabilną aktywność bazową, niski dryf oraz brak trwałych kanałów nasyconych lub istotnych artefaktów ruchowych.
  3. Synchronizacja strumieni EEG i wideo
    1. Podłącz komputer do prezentacji bodźców do wejścia wyzwalacza wzmacniacza EEG za pomocą kabla lub skrzynki wyzwalającej tranzystor-tranzystor (TTL).
    2. Użyj oprogramowania prezentacyjnego, aby wysłać impuls TTL na początku każdego klipu malującego oraz drugi impuls TTL na przesunięciu każdego klipu.
    3. Przypisz unikalne kody wyzwalające do każdego typu zdarzenia. W tym protokole demonstracyjnym używamy 11–16 dla początku klipu i 21–26 dla przesunięcia klipu.
    4. Nagrywaj jednocześnie strumień z kamery i EEG od co najmniej 5 sekund przed pierwszym wyzwalaczem aż do co najmniej 5 sekund po ostatnim wyzwalaczu. Automatycznie zapisz tabelę czasowych znaczników wyzwalacza w oprogramowaniu bodźcowym.
    5. Zweryfikować synchronizację po akwizycji, dopasowując znaczniki czasowe wyzwalania w nagraniu EEG z indeksami klatek wideo z dziennika prezentacji. Punkt kontrolny wizualny: Potwierdź, że średni błąd wyrównania między znacznikami czasowymi EEG a znacznikami klatki wideo wynosi w granicach ±33 ms przy 30 klatkach na sekundę.
      UWAGA: Jeśli nie ma dostępnego sprzętowego interfejsu synchronizacji z dokładnością ramową, eksportuj logi czasowe z obu systemów i wykonuj korektę wyrównania offline za pomocą dopasowania trigger onset.
  4. Rejestruj dane eksperymentalne
    1. Instruuj uczestnika, by naturalnie oglądał obrazy, minimalizując duże ruchy głową, nadmierne mruganie, mówienie i dotykanie twarzy.
    2. Przedstaw wcześniej zdefiniowane klipy malarskie w wybranej kolejności. Nagrywaj zsynchronizowane nagrania EEG i twarzy nieprzerwanie przez cały czas sesji oglądania.
    3. Zatrzymaj eksperyment i ponownie sprawdź elektrody, jeśli więcej niż 5 kanałów przekracza próg impedancji podczas nagrywania. Przerwy w dokumentach, dyskomfort uczestników oraz problemy techniczne w dzienniku sesji.

4. Wstępne przetwarzanie EEG i ekstrakcja cech

  1. Importowanie surowych danych EEG
    1. Zaimportuj surowe nagrania EEG do środowiska analizy. W tym protokole demonstracyjnym używaj MATLAB R2023b z EEGLAB 2024.0 lub Pythona 3.10 z MNE 1.6.
    2. Zaimportuj markery zdarzeń i sprawdź, czy wszystkie wyzwalacze bodźca są obecne.
  2. Zmniejszanie próbki sygnałów EEG
    1. Zredukuj próbkę sygnałów z 500 Hz do 200 Hz i przetworz je wstępnie zgodnie z workflow pokazanym na Rysunku 1.
    2. Stosuj wygładzanie krawędzi podczas ponownego próbkowania zgodnie z domyślnymi lub zdefiniowanymi ustawieniami filtra w oprogramowaniu.
  3. Filtrowanie sygnałów EEG
    1. Zastosuj filtr pasmowy od 0,5 do 45 Hz. Zastosuj filtr z wycięciem na lokalnej częstotliwości mocy, jeśli widoczny szum linii pozostaje. W tym protokole demonstracyjnym zastosowano filtr z wycięciem 50 Hz.
  4. Usuwanie artefaktów
    1. Ręcznie obejrzyj ciągłe EEG i oznaczaj fragmenty artefaktami ruchu grubego.
    2. Przeprowadź niezależną analizę komponentów na filtrowanych danych. Zidentyfikuj elementy związane z mrugnięciami oczu, poziomymi ruchami oczu, napięciem szczęki lub aktywnością mięśni, korzystając z map skóry głowy, biegów czasu i widm mocy.
    3. Usuń zidentyfikowane elementy artefaktowe i odtworz wyczyszczone sygnały EEG. Odrzucić segmenty, które nadal wykazują nadmierne wahania amplitudy po niezależnej korekcji analizy składowej. W tym protokole demonstracyjnym odrzuca się segmenty przekraczające ±100 μV.
  5. Ponowne odniesienie danych
    1. Ponownie odnieś wyczyszczone sygnały EEG do wspólnego średniego punktu odniesienia.
  6. Segmentacja danych EEG
    1. Epoka ciągłego EEG według wyzwalaczy bodźca. Wyodrębniaj segmenty wyrównane ze stymulacją obejmujące pełne okna analizy klipu lub stałe. W tym protokole demonstracyjnym segmentujemy EEG na okna 2,0 s z 50% nakładaniem się. Wyłącz okna z pozostałymi artefaktami po segmentacji.
  7. Obliczanie cech różniczkowej entropii
    1. Rozkładaj każdy segment EEG na następujące pasma częstotliwości: delta (1–4 Hz), theta (4–8 Hz), alfa (8–13 Hz), beta (13–30 Hz) oraz gamma (30–45 Hz).
    2. Oblicz różniczkową entropię każdego pasma częstotliwości dla każdego kanału. Użyj następującego równania dla zmiennej Gaussa:
      DE = 1/2 ln(2πeσ2), gdzie σ2 to wariancja sygnału EEG o ograniczonym paśmie.
    3. Ułóż wartości różniczkowej entropii kanałowej w dwuwymiarową macierz topograficzną lub macierz cech kanałowych dla danych wejściowych do modelu.
    4. W tym protokole demonstracyjnym generuje się mapy cech EEG o rozmiarze wejściowym 128 × 128 x 5 na okno analizy. Punkt kontrolny wizualny: Narysuj reprezentatywne mapy różniczkowej entropii dla każdego pasma i potwierdzi, że brakujące kanały, mapy o stałej wartości lub nieprawidłowe zapadanie pasmowe nie występują.

5. Wstępne przetwarzanie wideo twarzy

  1. Ekstrakcja klatek obrazu
    1. Dekoduj nagrane wideo na klatki obrazowe za pomocą skryptowanego potoku. Ekstrakcja klatki z prędkością 25 klatek/s dla wejścia do modelu, zachowując metadane synchronizacyjne.
  2. Wykrywanie i wyrównywanie ścian
    1. Wykrywaj twarz w każdej klatce za pomocą zweryfikowanego detektora twarzy. Znajdź punkty orientacyjne twarzy i wyrównuj twarz według centrów oczu lub standardowych punktów kotwiczenia. Usuń ramki, w których ściana nie jest wiarygodnie wykrywana.
  3. Przycinanie i zmiana rozmiaru obszaru twarzy
    1. Przytnij ścianę do wykrytego ramki ograniczającej z niewielkim marginesem, aby zachować informacje o konturze. Zmień rozmiar przyciętego obrazu twarzy do 224 x 224 pikseli.
    2. Sprawdź reprezentatywne przycięte próbki twarzy z czterech docelowych kategorii emocji, jak pokazano na Rysunku 2, i potwierdzi, że czoło, brwi, oczy, nos, policzki i usta pozostają widoczne po przycinaniu.
  4. Uzupełnianie obrazów treningowych
    1. Zastosowanie losowego poziomego flippingu z prawdopodobieństwem 0,5 tylko do zbioru treningowego. Stosuj losową rotację tylko w zakresie ±15° do zestawu treningowego.
    2. Nie stosuj augmentacji do walidacji ani testowych obrazów.
  5. Normalizacja bodźców twarzy
    1. Normalizuj wartości pikseli do zakresu [-1, 1] lub konsekwentnie stosuj regułę normalizacji specyficzną dla szkieletu dla wszystkich podziałów.

6. Skonstruuj multimodalną sieć neuronową

  1. Konfiguracja środowiska programowego i sprzętowego
    1. Zaimplementuj model w Pythonie 3.10 używając PyTorch 2.1. Uruchom trening na Ubuntu 22.04 lub innym określonym systemie operacyjnym.
    2. Użyj stacji roboczej z co najmniej 32 GB RAM, jednym procesorem graficznym z co najmniej 12 GB pamięci wideo oraz wystarczającą lokalną pamięcią do synchronizacji danych EEG-wideo. W tym protokole demonstracyjnym użyto procesora graficznego NVIDIA RTX 3080.
    3. Przechowuj skrypt treningowy, plik definicji modelu, skrypt wstępnego przetwarzania oraz plik konfiguracyjny w katalogu projektu kontrolowanym wersjonami.
    4. Zgłoś repozytorium kodu lub zarchiwizowany pakiet skryptów w manuskrypcie, jeśli udostępnianie jest dozwolone.
  2. Budowanie gałęzi twarzy
    1. Skonstruuj ogólny dwuboczny framework multimodalny, jak pokazano na Rysunku 3. Zainicjalizuj szkielet MobileNetV2 dla gałęzi twarzy.
    2. Zmodyfikuj pierwszą warstwę splotu z 32 kanałów na 24. Buduj gałąź wyodrębniania cech twarzy zgodnie ze Rysunkiem 4 i wstaw moduły uwagi współrzędnych po wybranych odwróconych blokach resztkowych, jak pokazano na Rysunku 5.
    3. Zastąpienie wyznaczonych konwolucji standardowych równoległymi głębokościami o rozmiarach jądra 3 x 3 i 5 x 5, aby poprawić wieloskalowe wyodrębnianie cech.
    4. Eksportuj wektor rysów twarzy o stałym wymiarze dla fuzji. W tym protokole demonstracyjnym zastosowano wymiar cech 256.
  3. Budowanie oddziału EEG
    1. Wprowadź funkcję różniczkowej entropii do enkodera sieci neuronowej splotowej. Użyj warstw splotowych do wyodrębniania wzorców przestrzennych z map cech EEG.
    2. Wprowadź konwolucyjną sekwencję wyjściową do dwukierunkowego modułu pamięci długoterminowej, krótkotrwałej, aby przechwycić zależności czasowe między oknami.
    3. Eksportuj wektor cech EEG o stałym wymiarze. W tym protokole demonstracyjnym zastosowano wymiar cech 256.
  4. Budowanie modułu fuzji międzymodalnej
    1. Zaimplementuj moduł interakcji cech multimodalnych pokazany na Rysunku 6. Wprowadź blok z wieloma głowami z 8 głowami.
    2. Użyj sekwencji cech EEG jako zapytania, a sekwencji cech twarzy jako klucza i wartości w jednym strumieniu cross-sight.
    3. Użyj sekwencji cech twarzy jako zapytania, a sekwencji cech EEG jako klucza i wartości w strumieniu wzajemnej uwagi krzyżowej.
    4. Połącz wyniki z obu strumieni wzajemnej uwagi. Przepuszczaj spójną cechę przez warstwę projekcji fuzyjnej.
  5. Dodanie samorezydualnego modułu splotu rozszerzającego
    1. Doprecyzuj zrośniętą reprezentację warstwą konwilacyjną samorezydualną warstwą połączenia splotu widoczną na Rysunku 7.
    2. Skonstruuj warstwę konkatenacji splotu z dylatacją z wykorzystaniem szybkości dylatacji 1, 3, 6 i 12. Łącz wyjścia z czterech gałęzi dylatacji.
    3. Dodaj połączenia rezydualne przeskokowe, aby ustabilizować przepływ gradientowy i zachować informacje na niższym poziomie.
  6. Dodanie klasyfikatora
    1. Spłaszcz lub zgromadzić zrośniętą reprezentację. Dodaj jedną w pełni połączoną warstwę i ostatnią warstwę wyjściową softmax. Ustaw klasy wyjściowe na strach, szczęście, spokój i smutek.
  7. Definiowanie ustawień treningowych
    1. Korzystaj z sieci i ustawień treningowych podsumowanych w Tabeli 1. Cztery klasy emocji (strach, szczęście, spokój i smutek) zostały operacyjnie zdefiniowane za pomocą połączonej procedury etykietowania opartej na projektowaniu bodźców i samoocenie uczestników. Każdy klip z obrazem był wcześniej wybierany, aby wywołać docelową kategorię emocji, a uczestnicy zgłaszali swoje dominujące doświadczenia emocjonalne po seansie. Ostateczne etykiety zostały przypisane poprzez dopasowanie zamierzonej kategorii bodźca do odpowiedzi samoraportowanych, a niespójne próbki zostały wykluczone, aby zapewnić wiarygodność etykietowania.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Wydajność proponowanej sieci dwugałęziowej cross-attention została oceniona na podstawie multimodalnego zbioru danych zebranych od 327 uczestników podczas oglądania obrazów. Głównym rezultatem była czteroklasowa klasyfikacja emocji dla strachu, szczęścia, spokoju i smutku. Dodatkowe analizy analizowały zachowanie modeli unimodalnych, zbieżność multimodalną, wrażliwość na liczbę głowic uwagi, wyniki rozpoznawania porównawczego oraz zachowanie podsieci twarzy i elektroencefalografii. Do tego badania nie uwzględniono oddzie...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Protokół ten rozwiązuje praktyczny problem w obliczeniach afektywnych, mianowicie rozpoznawanie stanów emocjonalnych w miejscach oglądania obrazów, gdzie widoczna ekspresja i reakcja fizjologiczna mogą nie pokrywać się w każdej chwili. W warunkach eksperymentalnych opisanych tutaj, ramy dwugałęziowe osiągnęły wyższą klasyfikację niż modele porównawcze unimodalne, co wspiera wartość łączenia elektroencefalografii i informacji o ekspresji twarzy w środowiskach przypominających wystawy. Wyniki sugerują, że integracja multim...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy deklarują brak konfliktu interesów.

Podziękowania

Składamy szczere podziękowania wolontariuszom z Minzu Normal University of Xingyi oraz Southwest University za udział w eksperymentach. Dziękujemy również personelowi technicznemu Uniwersytetu w Gironie za pomoc przy pozyskiwaniu danych EEG oraz anonimowym recenzentom za ich wnikliwe komentarze.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Ramy Deep LearningPyTorchv2.0 / https://pytorch.orgWykorzystywane do konstrukcji, szkolenia i oceny modeli
System akwizycji EEG (64-kanałowy)Brain Products GmbHactiCHamp Plus / v1.6Wykorzystywany do pozyskiwania sygnału EEG o wysokiej rozdzielczości podczas eksperymentów
Elektrodowa nasadka EEG (10– System 20)Brain Products GmbHActiCap / 64-kanałowyStandardowy międzynarodowy 10– Umieszczenie 20 elektrod
Kamera wysokiej rozdzielczościSony CorporationCzujnik IMX327Wykorzystywane do nagrywania mimiki twarzy (≥ 1080p, 30 fps)

Bibliografia

  1. Yang, Y., et al. A dual-stream regional feature learning and adaptive fusion method for electroencephalogram-based emotion recognition. Eng Appl Artificial Intell. 164, 113250(2026).
  2. Li, C., Pun, S. H., Li, J. W., Chen, F. Eeg-based emotion recognition using graph attention network with dual-branch attention module. 2024 46th Ann Int Conf IEEE Eng Me Biol Soc (EMBC), , 1-4 (2024).
  3. Ubillús, J. A. T., et al. Algorithms used for facial emotion recognition: A systematic review of the literature. EAI Endorsed Transact Pervasive Health Technol. 9, 1-17 (2023).
  4. Xu, Y., Cheng, L. Face emotion recognition based on gabor wavelet and particle swarm optimization algorithm. Multimed Syst. 31 (6), 435(2025).
  5. Dube, D. Y., Sannasi, M. V., Kyritsis, M., Gulliver, S. R. Facial emotion recognition from feature loss media: Human versus machine learning algorithms. Comp Human Behav. 174, 108806(2026).
  6. Manuel, M. T. J., Medina-DeVilliers, S., Clarkson, T., Lerner, M. D., Riccardi, G. Evaluation of interpretability for deep learning algorithms in EEG emotion recognition: A case study in autism. Artif Intell Med. 143, 102545(2023).
  7. Watanabe, A., Yamazaki, T. Representation of the brain network by electroencephalograms during facial expressions. J Neurosci Meth. 357, 109158(2021).
  8. Prakash, A., Poulose, A. Electroencephalogram-based emotion recognition: A comparative analysis of supervised machine learning algorithms. Data Sci Manag. 8 (3), 342-360 (2025).
  9. Sun, Y., Ayaz, H., Akansu, A. N. Multimodal affective state assessment using fnirs + eeg and spontaneous facial expression. Brain Sci. 10 (2), 85(2020).
  10. Huang, Y., Yang, J., Liu, S., Pan, J. Combining facial expressions and electroencephalography to enhance emotion recognition. Future Internet. 11 (5), 105(2019).
  11. Han, Q., et al. A multi-branch electroencephalogram emotion recognition framework based on cross-subject or cross-session multi-perspective representation fusion. Neurocomputing. 658, 131767(2025).
  12. Wang, L., Chang, Y., Wang, K. Dual-branch multimodal fusion network for driver facial emotion recognition. Appl Sci. 14 (20), 9430(2024).
  13. Mutawa, A. M., Hassouneh, A. Multimodal real-time patient emotion recognition system using facial expressions and brain EEG signals based on machine learning and log-sync methods. Biomed Signal Proc Contr. 91, 105942(2024).
  14. Qi, Y., Ibrayim, M., Hamdulla, A. Attention-based dual-branch network for micro-expression recognition with global-local feature fusion. 2024 IEEE Int Joint Conf Biometr (IJCB), , 1-9 (2024).
  15. Li, E. Intervention of art education on college students’ aesthetic mood based on emotion recognition algorithm. Front Art Res. 6 (9), 81-90 (2024).
  16. Liu, Z., Han, M., Wu, B., Rehman, A. Speech emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multi-task learning. Appl Acoustics. 202, 109178(2023).
  17. Xue, P., Wang, S., Bai, J., Qiang, Y. Research on bimodal emotion recognition algorithm based on multi-branch bidirectional multi-scale time perception. J Biome Eng. 42 (3), 528-536 (2025).
  18. Shioiri, S., Nagata, H., Sato, Y., Hatori, Y. Prediction of preference judgments of face images using facial expressions and eeg signals. J Vis. (9), 5063(2023).
  19. Lu, Y., Chen, J. Cross-subject EEG emotion recognition using the SSA-EMS algorithm for feature extraction. Entropy. 27 (9), 986(2025).
  20. Thapa, D., Rai, R. Freq-eer: A novel frequency-driven ensemble framework for emotion recognition and classification of eeg signals. Appl Sci. 15 (19), 10671(2025).
  21. Yang, Y., et al. Investigating of deaf emotion cognition pattern by eeg and facial expression combination. IEEE J Biomed Health Inform. 26 (2), 589-599 (2022).
  22. Tong, L., Yang, L., Wang, X., Liu, L. Self-aware face emotion accelerated recognition algorithm: A novel neural network acceleration algorithm of emotion recognition for international students. PeerJ Comput Sci. 9, e1611(2023).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

Rozpoznawanie emocji na podstawie EEGanaliza wyrazu twarzyentropia różnicowasplotowa sieć neuronowadwukierunkowa sieć LSTMobliczenia afektywneinterakcja człowiek-komputer