Ein Abonnement von JoVE ist erforderlich, um diesen Inhalt anzuzeigen. Melden Sie sich an oder beginnen Sie noch heute mit einer kostenlosen Testphase.

Methodenartikel

Dual-Branch-Cross-Attention-Netzwerk für Elektroenzephalographie und multimodale Gesichtsemotionserkennung während der Malbeobachtung

109 Aufrufe

⸱

DOI:

10.3791/70600

⸱

12. Mai 2026

In diesem Artikel

Zusammenfassung

Dieses Protokoll beschreibt die synchronisierte Erfassung von Elektroenzephalographie und Gesichtsdaten in Malerei-Betrachtungsumgebungen sowie ein zweiteiliges Cross-Attention-Netzwerk für multimodale Emotionserkennung, einschließlich Vorverarbeitung, Merkmalsfusion und Klassifizierung von vier emotionalen Zuständen.

Zusammenfassung

Die Emotionserkennung während der Malerei bleibt schwierig, da ästhetische Reaktionen dynamisch, kontextabhängig und nur teilweise durch äußeres Verhalten beobachtbar sind. Unimodale Ansätze, die ausschließlich auf Gesichtsausdrücken oder nur auf physiologischen Signalen basieren, liefern daher oft unvollständige Darstellungen der Erfahrung des Betrachters. Dieser Artikel beschreibt eine reproduzierbare Methode zum Aufbau eines zweivernetzten Cross-Attention-Netzwerks, das Gesichtsvideo mit Elektroenzephalographie (EEG)-Daten für multimodale Emotionserkennung im Kontext einer Gemäldeausstellung integriert. Das Protokoll beginnt mit der Einrichtung einer synchronisierten Aufnahmeumgebung unter Verwendung eines 64-Kanal-EEG-Systems und einer hochauflösenden Kamera für gleichzeitige Aufnahmen während der Malbeobachtung. Das anschließende Verfahren beschreibt die Signalvorverarbeitung, einschließlich EEG-Filterung, Segmentierung und Extraktion unterschiedlicher Entropiemerkmale sowie Gesichtserkennung, Ausrichtung und Bildvorbereitung für die Videoanalyse. Das neuronale Netzwerk enthält zwei modalitätsspezifische Zweige. Der EEG-Zweig verwendet ein konvolutionales neuronales Netzwerk und ein bidirektionales Langzeitgedächtnisnetzwerk, um räumlich-zeitliche neuronale Merkmale zu modellieren, während der Gesichtszweig ein koordinatiertes, aufmerksamkeitsverstärktes, leichtes Faltungsnetzwerk verwendet, um visuelle Ausdrucksmerkmale zu extrahieren. Ein Multi-Head-Cross-Attention-Modul wird dann verwendet, um die beiden Ströme durch das Erlernen der intermodalen Relevanz zu verbinden. Unter den hier berichteten experimentellen Bedingungen erreichte das multimodale Rahmenwerk eine höhere Klassifikationsgenauigkeit als die unimodalen Vergleichsmodelle bei der Emotionserkennung mit vier Kategorien. Diese Methode eignet sich am besten für Offline-Analysen in kontrollierten Erfassungsumgebungen und bietet einen praktischen Rahmen für affektives Rechnen, empirische Ästhetik und ausstellungsorientierte Mensch-Computer-Interaktionsforschung.

Einleitung

Emotion ist ein multidimensionaler psychologischer und physiologischer Prozess, der durch äußere Reize, innere Einschätzung und fortlaufende kognitive Regulation geprägt wird und daher eine zentrale Rolle in der Mensch-Computer-Interaktion sowie in der Kognitionswissenschafteinnimmt. In Malausstellungen vermittelt Emotion auch die Beziehung zwischen visuellen Kunstwerken und Betrachterinterpretation. Aus diesem Grund hat die Identifikation der Empfangszustände des Betrachters praktischen Wert für die Ausstellungsbewertung, das räumliche Design und empirische Studien ästhetischer Erfahrung2. Gleichzeitig bleibt die Emotionsmessung in halbnatürlichen Ausstellungsumgebungen technisch schwierig, da die Reaktionen subtil, vorübergehend und sowohl vom Kunstwerk als auch vom Betrachtungskontext beeinflusst werden.

Die Forschung zur Emotionserkennung hat sich im Allgemeinen entlang von zwei Hauptlinien entwickelt: der Verhaltensanalyse und der physiologischen Analyse. Verhaltensansätze, insbesondere Gesichtsausdrucksanalyse auf Basis von Computer Vision, werden weit verbreitet eingesetzt, da sie nicht-invasiv und relativ einfach einzusetzensind. Deep-Learning-Modelle wie Residualnetzwerke und leichte Faltungsnetzwerke haben eine starke Leistung bei grundlegenden Aufgaben zur Klassifikation von Gesichtsemotionengezeigt 4. Allerdings kann das Gesichtsverhalten während der Betrachtung des Gemäldes schwach, sozial gemäßigt oder absichtlich zurückhaltend sein, was die Übereinstimmung zwischen sichtbarem Ausdruck und subjektivem Gefühl verringernkann. Physiologische Ansätze, insbesondere solche, die auf Elektroenzephalographie (EEG) basieren, bieten direkteren Zugang zur neuronalen Aktivität im Zusammenhang mit der affektiven Verarbeitung6. EEG wurde in Emotionsstudien weit verbreitet eingesetzt, da zeitliche Schwankungen in neuronalen Signalen Hinweise auf Veränderungen des affektiven Zustands sind, einschließlich Dimensionen im Zusammenhang mit Valenz und Erregung7. Dennoch sind EEG-Aufnahmen empfindlich gegenüber Bewegungsartefakten, elektromyographischer Kontamination und Umgebungsgeräuschen, und das EEG allein liefert oft nur begrenzte kontextuelle Informationen darüber, worauf der Betrachter visuell reagiert.

Diese komplementären Stärken und Schwächen haben das Interesse an multimodaler Emotionserkennung gesteigert9. Die zentrale Prämisse der multimodalen Fusion ist, dass heterogene Signale gegenseitig informative Belege liefern und die Mehrdeutigkeit verringern können, die entsteht, wenn eine einzelne Modalität isoliert interpretiert wird10. Bei Malerei-Betrachtungsaufgaben kann beispielsweise zurückhaltendes Gesichtsverhalten dennoch mit messbaren neuronalen Veränderungen im Zusammenhang mit Aufmerksamkeit oder affektiver Beschäftigung zusammenfallen. Bestehende multimodale Systeme modellieren diese Beziehung jedoch nicht immer effektiv. Frühe Fusionsstrategien, die auf direkter Merkmalsverkettung basieren, können die dimensionale Belastung erhöhen und die modalitätsspezifische zeitliche Struktur11 verwischen. Späte Fusionsstrategien, die auf getrennten Entscheidungen basieren, sind leichter umzusetzen, können aber feinkörnige Wechselwirkungen zwischen visuellen und physiologischen Signalen während der emotionalen Verarbeitungübersehen. Darüber hinaus verwenden viele multimodale Modelle feste oder schwach adaptive Fusionsschemata, die für schwankende Betrachterreaktionen in ausstellungsähnlichenSettings nicht gut geeignet sind.

Um diese Einschränkungen zu beheben, beschreibt das vorliegende Protokoll ein zweigeteiltes Cross-Attention-Netzwerk zur multimodalen Emotionserkennung während der Gemäldebesichtigung. In diesem Rahmen werden EEG-Merkmale von einem konvolutionellen neuronalen Netzwerk-bidirektionalen Langzeitgedächtnismodell (CNN-BiLSTM) verarbeitet, das zur Darstellung räumlich-zeitlicher neuronaler Dynamik verwendet wird. Gesichtsvideo-Merkmale werden von einem koordinaten, aufmerksamkeitsverstärkten MobileNetV2-Zweig verarbeitet, der verwendet wird, um niedrigintensive Expressionshinweise zu erfassen und dabei die Recheneffizienz14 aufrechtzuerhalten. Die beiden Zweige werden dann durch einen Multi-Head-Cross-Attention-Mechanismus integriert, der die Relevanz zwischen den Modalitäten erlernt, anstatt ihre Ausgaben einfach zu verknüpfen15,16. Dieses Design soll modalitätsspezifische Strukturen erhalten und gleichzeitig die Cross-Modal-Interaktionsmodellierung verbessern.

Die Methode ist in erster Linie für die Offline-Analyse unter kontrollierten Datenerfassungsbedingungen konzipiert und nicht für den direkten Echtzeit-Einsatz in offenen öffentlichen Ausstellungsräumen. Eine zuverlässige Implementierung erfordert synchronisierte EEG- und Videoaufnahme, stabile Beleuchtung, kontrollierte Kameraplatzierung, akzeptable Elektrodenimpedanz und ausreichende Rechenressourcen für die Modellbildung. Die Leistung kann auch von der Zusammensetzung der Stichprobe, dem Reiztyp und dem Ausmaß abhängen, in dem die Teilnehmer das Verhalten verändern, weil sie wissen, dass sie aufgezeichnet werden. Diese betrieblichen Einschränkungen sollten bei der Anpassung des Protokolls an andere Ausstellungsumgebungen oder Populationen berücksichtigt werden.

Das hier vorgestellte Protokoll umfasst die gesamte experimentelle Pipeline, einschließlich synchronisierter Erfassung von 327 Teilnehmern, Vorverarbeitung von EEG- und Gesichtsvideodaten, Merkmalextraktion, intermodaler Fusion und Klassifikation. Ziel ist es, einen reproduzierbaren Workflow für multimodale Emotionserkennung in der Gemäldeausstellungsforschung bereitzustellen. Über das affektive Rechnen17 hinaus kann das Protokoll auch quantitative Untersuchungen in empirischer Ästhetik und verwandten psychologischen Studienunterstützen 18.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Das Studienprotokoll wurde vom Ethikausschuss für den Schutz der Humanforschung der Xingyi Minzu Normal University überprüft und genehmigt (Genehmigungsnummer 2600AL0621). Eine schriftliche informierte Zustimmung wurde von allen Teilnehmern vor ihrer Aufnahme in die Studie und vor der Datenerhebung eingeholt.

1. Teilnehmerrekrutierung und ethische Einhaltung

  1. Einholung ethischer Genehmigung
    1. Reichen Sie vor Beginn der Studie das vollständige experimentelle Protokoll, das Einwilligungsformular, das Teilnehmerinformationsblatt und den Datenschutzplan beim institutionellen Überprüfungsausschuss (IRB) oder Ethikausschuss ein.
    2. Holen Sie eine schriftliche Genehmigung ein und tragen Sie die Genehmigungsnummer in die Studienunterlagen ein.
  2. Rekrutierung von Teilnehmern
    1. Rekrutieren Sie gesunde erwachsene Teilnehmer für multimodale Emotionsgewinnung während des Gemäldeschauens. In diesem Demonstrationsprotokoll werden 327 Teilnehmer rekrutiert.
    2. Anwendung der folgenden Einschlusskriterien: Alter 18–35 Jahre, normales oder korrigiertes bis normales Sehvermögen, keine selbstberichtete Vorgeschichte neurologischer Störungen, keine aktuelle Anwendung psychoaktiver Medikamente und Bereitschaft, sich einer EEG-Aufnahme (EEG) und Gesichtsvideoaufnahme zu unterziehen.
    3. Wenden Sie folgende Ausschlusskriterien an: übermäßige Kopfhautverletzungen oder dermatologische Erkrankungen, die das Einsetzen der Elektroden verhindern, Unfähigkeit, die vollständige Aufnahmesitzung abzuschließen, starke Bewegung während der Aufnahme oder unvollständige Einwilligungsdokumentation.
    4. Erfassen Sie die Merkmale der Teilnehmer, darunter Alter, Geschlecht, Händlichkeit, Erfahrung beim Betrachten von bisherigen Kunstwerken und Bildungsniveau. In diesem Demonstrationsprotokoll wird folgende Stichprobe KURZER LANGER ABSTRACT AUFGEZEICHNET: Durchschnittsalter 24,8 ± 3,7 Jahre, 165 Frauen und 162 Männer, alle Teilnehmer rechtshändig.
    5. Definieren Sie das demografische Gleichgewicht operativ vor der Rekrutierung. In diesem Demonstrationsprotokoll wird dieser Begriff verwendet, um eine ungefähr ausgewogene Geschlechtsverteilung und eine Altersspanne im frühen Erwachsenenalter anzugeben, um altersbedingte Varianzen in EEG- und Gesichtsausdrücksreaktionen zu verringern.
  3. Einholung informierter Zustimmung
    1. Stellen Sie jedem Teilnehmer ein schriftliches Formular zur informierten Einwilligung zur Verfügung, das EEG-Aufzeichnung, Gesichtsvideoaufnahme, Synchronisationsverfahren, Anonymisierung, Datenspeicherung und das Recht, jederzeit ohne Strafe zurückzutreten, beschreibt.
    2. Erläutern, dass Gesichtsbilder zur Merkmalsextraktion verwendet werden und dass Augenregionen in allen Manuskriptfiguren maskiert werden, um die Identität der Teilnehmer zu schützen.
    3. Holen Sie vor Beginn eines experimentellen Verfahrens eine schriftliche informierte Zustimmung ein.
  4. Zuweisung von Kennungen und Anonymisierung von Daten
    1. Weisen Sie jedem Teilnehmer eine eindeutige numerische Studien-ID zu. Speichern Sie EEG-Dateien, Videodateien und Metadaten ausschließlich mit der Studien-ID.
    2. Speichern Sie identifizierbare Einwilligungsformulare getrennt von physiologischen und Bilddaten. Verwenden Sie deidentifizierte Gesichtsrahmen oder von Sichtmarken abgeleitete Ausgaben zur internen Analysespeicherung, wenn es die lokale Ethikrichtlinie verlangt.

2. Experimentelle Umgebung und Stimulusaufbau

  1. Vorbereitung der Beobachtungsumgebung
    1. Bereiten Sie einen ruhigen Innenraum vor, um eine kontrollierte Malerei-Ausstellungsumgebung zu simulieren. Halten Sie eine Umgebungstemperatur von 22–24 °C und eine relative Luftfeuchtigkeit von 45%–60%. Kontrolliere Hintergrundgeräusche unter 40 dB, wo möglich.
    2. Setzen Sie den Teilnehmer auf einen aufrechten Stuhl mit Rückenstütze und positionieren Sie den Stuhl so, dass der Sichtabstand zwischen dem Teilnehmer und dem Display 2,0 m beträgt.
    3. Weisen Sie den Teilnehmer an, während der Stimuluspräsentation allein im Aufnahmebereich zu sitzen. Lassen Sie während der Datenerfassung keine anderen Teilnehmer oder Beobachter im unmittelbaren Sichtfeld sein.
  2. Beleuchtungskonfiguration
    1. Installieren Sie diffuse Ring- oder kreisförmige Beleuchtung vor dem Teilnehmer, um Gesichtsschatten zu reduzieren. Stellen Sie die Beleuchtung auf ein stabiles Niveau von etwa 500 Lux auf Frontniveau ein.
    2. Vermeiden Sie schnelle Lichtschwankungen und direkte Blendung auf Augen, Stirn oder Wangen. Visueller Checkpoint: Bestätigen Sie, dass das gesamte Gesicht, einschließlich Stirn, Augenbrauen, Augen, Nase, Wangen und Mundbereich, in der Kameravorschau ohne Überbelichtung oder tiefen Schatten sichtbar ist.
  3. Konfiguration der visuellen Reizpräsentation
    1. Präsentieren Sie die visuellen Reize auf einem Monitor oder einer Projektionsleinwand. In diesem Demonstrationsprotokoll wird ein 27-Zoll-Flüssigkristall-Displaymonitor mit einer Auflösung von 1.920 x 1.080 Pixeln und einer Bildwiederholrate von 60 Hz verwendet.
    2. Zeigen Sie Malerei-Stimuli in Video- oder Diashow-Format entsprechend dem Studiendesign an. Verwenden Sie für alle Teilnehmer dieselben Regeln für Bildschirmhelligkeit, Kontrast und Präsentationsreihenfolge.
    3. Zeigen Sie jeden Gemäldeclip 90–120 Sekunden. In diesem Demonstrationsprotokoll werden 6 Clips verwendet, jeweils von 100 Sekunden Dauer, mit einem Interstimulus-Ruheintervall von 20 Sekunden.
      VORSICHT: Erden Sie alle elektrischen Geräte ordnungsgemäß und legen Sie den EEG-Verstärker sowie die Stromkabel von Hochstörungsquellen fern, um das 50/60-Hz-Leitungsrauschen zu reduzieren.

3. Multimodale Datenerfassung

  1. Erfassung von Gesichtsvideos
    1. Positionieren Sie eine hochauflösende Industriekamera direkt vor dem Teilnehmer auf ungefähr Augenhöhe. Stellen Sie den Abstand zwischen Kamera und Gesicht auf 1,2 m ein.
    2. Verwenden Sie eine Kamera mit einer Mindestaufnahmeauflösung von 1.920 x 1.080 Pixeln und einer Bildrate von 30 Bildern/s.
    3. Stellen Sie die Belichtung manuell ein, um Wechsel von Bild zu Bild zu vermeiden. In diesem Demonstrationsprotokoll verwenden Sie ISO 400, Verschlusszeit 1/60 s und festen Weißabgleich.
    4. Speichere das Video im MP4- oder AVI-Format mit konstanter Bildrate. In diesem Demonstrationsprotokoll speichert man das Video als MP4, H.264-Codierung, 30 Bilder/s.
    5. Stellen Sie sicher, dass das gesamte Gesicht während der gesamten Aufnahmesitzung im Sichtfeld bleibt. Visueller Kontrollpunkt: Überprüfen Sie, dass Augenbrauen und Stirn vollständig sichtbar sind. Positioniere die Kamera sofort neu, wenn Stirn, Brauenregion oder Kinn beschnitten sind.
      HINWEIS: Verwenden Sie 30 Bilder/s, da diese Bildrate eine angemessene zeitliche Auflösung für niedrigintensive Gesichtsausdrucksdynamiken bietet und gleichzeitig eine handhabbare Speicher- und Verarbeitungslast bei synchronisierter multimodaler Aufnahme aufrechterhält.
  2. EEG-Signale aufnehmen
    1. Messen Sie den Kopfumfang und wählen Sie die richtige Kappengröße für den Teilnehmer. Platzieren Sie die 64-Kanal-EEG-Kappe gemäß dem internationalen 10–20-System oder einem herstellerspezifischen 64-Kanal-Erweiterungslayout.
    2. Richten Sie die Kappe anhand anatomischer Orientierungspunkte aus. Positioniere Fpz auf der Mittellinie über der Nasion und verifiziere die Symmetrie über die linke und rechte Hemisphäre.
    3. Teile das Haar an jeder Elektrodenstelle und trage leitfähiges Gel auf, um den Kontakt zwischen Elektrode und Kopfhaut zu verbessern.
    4. Bereiten Sie die Kopfhaut vorsichtig an hochohmigen Stellen mit einem Wattestäbchen oder einem stumpfen Vorbereitungswerkzeug vor. Schleifen Sie die Haut nicht übermäßig ab.
    5. Schließen Sie die Kappe an den EEG-Verstärker an und führen Sie eine Impedanzmessung durch. Reduzieren Sie die Elektrodenimpedanz für alle Kanäle auf unter 10 kΩ. In diesem Demonstrationsprotokoll wird bei möglicher Möglichkeit < 5 kΩ für Frontal- und Zentralelektroden angestrebt.
    6. Stellen Sie die Abtastfrequenz auf 500 Hz ein. Stellen Sie die Online-Referenz entsprechend der Verstärkerkonfiguration ein. In diesem Demonstrationsprotokoll wird während der Aufnahme eine verknüpfte Mastoidreferenz verwendet und während der Vorverarbeitung eine gemeinsame Durchschnitts-Wiederreferenzierung durchgeführt.
    7. Setzen Sie die Masseelektrode gemäß der Verstärkerspezifikation ein. In diesem Demonstrationsprotokoll wird der Boden bei AFz platziert. Mindestens 60 Sekunden Ruhe-Baseline vor der Stimuluspräsentation aufzeichnen.
    8. Visueller Kontrollpunkt: Überprüfen Sie die Live-EEG-Spuren, bevor Sie das Experiment beginnen. Bestätigen Sie stabile Basisaktivität, geringe Drift und das Fehlen persistenter gesättigter Kanäle oder größerer Bewegungsartefakte.
  3. EEG- und Videoströme synchronisieren
    1. Verbinden Sie den Stimuluspräsentationscomputer mit dem EEG-Verstärker-Trigger-Eingang über ein Transistor-Transistor-Logik-(TTL)-Triggerkabel oder eine Triggerbox.
    2. Verwenden Sie die Präsentationssoftware, um einen TTL-Triggerimpuls zu Beginn jedes Gemäldeclips und einen zweiten TTL-Triggerimpuls am Offset jedes Clips zu senden.
    3. Weisen Sie jedem Ereignistyp eindeutige Auslösercodes zu. In diesem Demonstrationsprotokoll verwenden Sie 11–16 für den Clip-Inset und 21–26 für den Clip-Offset.
    4. Nehmen Sie den Kamera-Stream und den EEG-Stream gleichzeitig auf, mindestens 5 Sekunden vor dem ersten Auslöser bis mindestens 5 Sekunden nach dem letzten Auslöser. Protokollieren Sie die Trigger-Zeitstempeltabelle automatisch in der Stimulus-Software.
    5. Validieren Sie die Synchronisation nach der Erfassung, indem Sie Trigger-Zeitstempel in der EEG-Aufnahme mit Videoframe-Indizes aus dem Präsentationsprotokoll abgleichen. Visueller Checkpoint: Bestätigen Sie, dass der mittlere Ausrichtungsfehler zwischen EEG-Trigger-Zeitstempeln und Videoframe-Zeitstempeln bei 30 Bildern pro Sekunde innerhalb von ±33 ms liegt.
      HINWEIS: Wenn keine hardwaregetreue Synchronisationsschnittstelle verfügbar ist, exportieren Sie Zeitstempel-Logs von beiden Systemen und führen Sie eine offline Ausrichtungskorrektur mittels Trigger-Onset-Matching durch.
  4. Erfassen der experimentellen Daten
    1. Weisen Sie den Teilnehmer an, die Gemälde natürlich zu betrachten, während große Kopfbewegungen, übermäßiges Blinzeln, Sprechen und Gesichtsberührungen minimiert werden.
    2. Präsentieren Sie die vordefinierten Malausschnitte in der ausgewählten Reihenfolge. Zeichnen Sie synchronisiertes EEG und Gesichtsaufnahmen während der gesamten Betrachtungssitzung kontinuierlich auf.
    3. Pausieren Sie das Experiment und überprüfen Sie die Elektroden erneut, wenn während der Aufnahme mehr als 5 Kanäle die Impedanzschwelle überschreiten. Dokumentunterbrechungen, Unbehagen der Teilnehmer und technische Probleme im Sitzungsprotokoll.

4. EEG-Vorverarbeitung und Merkmalsextraktion

  1. Import von Roh-EEG-Daten
    1. Importiere die rohen EEG-Aufzeichnungen in die Analyseumgebung. In diesem Demonstrationsprotokoll verwenden Sie entweder MATLAB R2023b mit EEGLAB 2024.0 oder Python 3.10 mit MNE 1.6.
    2. Importieren Sie die Ereignismarker und überprüfen Sie, ob alle Stimulus-Start- und Offset-Trigger vorhanden sind.
  2. Downsampling der EEG-Signale
    1. Reduzieren Sie die Signale von 500 Hz auf 200 Hz und verarbeiten Sie sie gemäß dem in Abbildung 1 gezeigten Arbeitsablauf vor.
    2. Wenden Sie beim Resampling Anti-Aliasing gemäß den Software-Standardeinstellungen oder definierten Filtereinstellungen an.
  3. Filterung der EEG-Signale
    1. Verwenden Sie einen Bandpassfilter von 0,5–45 Hz. Verwenden Sie einen Notch-Filter bei der lokalen Leistungsfrequenz, wenn sichtbares Linienrauschen vorhanden ist. In diesem Demonstrationsprotokoll wenden Sie einen 50-Hz-Notch-Filter an.
  4. Entfernung von Artefakten
    1. Inspizieren Sie das kontinuierliche EEG manuell und markieren Sie Segmente mit groben Bewegungsartefakten.
    2. Führe eine unabhängige Komponentenanalyse an den gefilterten Daten durch. Identifizieren Sie Komponenten, die mit Blinzeln, horizontalen Augenbewegungen, Kieferverspannungen oder Muskelaktivität verbunden sind, anhand von Kopfhautkarten, Zeitverläufen und Leistungsspektren.
    3. Entfernen Sie die identifizierten Artefaktkomponenten und rekonstruieren Sie die gereinigten EEG-Signale. Segmente werden abgelehnt, die nach unabhängiger Komponentenanalyse-Korrektur immer noch übermäßige Amplitudenschwankungen aufweisen. In diesem Demonstrationsprotokoll werden Segmente abgelehnt, die ±100 μV überschreiten.
  5. Neureferenzierung der Daten
    1. Vergleiche die gereinigten EEG-Signale auf die gemeinsame Durchschnittsreferenz.
  6. Segmentierung der EEG-Daten
    1. Epoche das kontinuierliche EEG entsprechend den Auslösern des Reizes. Extrahiere stimulus-ausgerichtete Segmente, die den gesamten Clip oder feste Analysefenster abdecken. In diesem Demonstrationsprotokoll wird das EEG in 2,0-s-Fenster mit 50%iger Überlappung unterteilt. Fenster mit Restartefakten nach der Segmentierung ausschließen.
  7. Berechnung von differentiellen Entropiemerkmalen
    1. Zerlegt jedes EEG-Segment in folgende Frequenzbänder: Delta (1–4 Hz), Theta (4–8 Hz), Alpha (8–13 Hz), Beta (13–30 Hz) und Gamma (30–45 Hz).
    2. Berechnen Sie die differentielle Entropie jedes Frequenzbandes für jeden Kanal. Verwenden Sie folgende Gleichung für eine Gaußsche Variable:
      DE = 1/2 ln(2πeσ2), wobei σ2 die Varianz des bandbegrenzten EEG-Signals ist.
    3. Ordnen Sie die kanalweise differentiellen Entropiewerte in eine zweidimensionale topografische Matrix oder Kanal-Merkmalsmatrix für die Modelleingabe an.
    4. In diesem Demonstrationsprotokoll werden EEG-Feature-Maps mit einer Eingabegröße von 128 × 128 x 5 pro Analysefenster erzeugt. Visueller Kontrollpunkt: Zeichnen Sie repräsentative differentielle Entropiekarten für jedes Band auf und bestätigen, dass fehlende Kanäle, konstante Wertabbildungen oder abnormale bandweise Kollaps nicht vorhanden sind.

5. Gesichtsvideo-Vorverarbeitung

  1. Extraktion von Bildframes
    1. Dekodieren Sie das aufgezeichnete Video in Bildframes mit einer geskripteten Pipeline. Frames mit 25 Bildern/s für die Modelleingabe extrahieren, wobei die Synchronisationsmetadaten erhalten bleiben.
  2. Erkennung und Ausrichtung des Gesichts
    1. Erkennen Sie das Gesicht in jedem Bild mit einem validierten Gesichtsdetektor. Lokalisieren Sie Gesichtsmarkierungen und richten Sie das Gesicht anhand der Augenzentren oder der Standard-Landmark-Anker aus. Verwerfe Frames, in denen das Gesicht nicht zuverlässig erkannt wird.
  3. Beschneiden und Größenanpassung des Gesichtsbereichs
    1. Schneide die Fläche mit einem kleinen Rand auf die erkannte Begrenzungsbox zu, um Konturinformationen zu erhalten. Vergrößern Sie das zugeschnittene Gesichtsbild auf 224 x 224 Pixel.
    2. Untersuchen Sie repräsentative zugeschnittene Gesichtsproben aus den vier Zielemotionskategorien, wie in Abbildung 2 dargestellt, und bestätigen Sie, dass Stirn, Augenbrauen, Augen, Nase, Wangen und Mund nach dem Zuschneiden sichtbar bleiben.
  4. Ergänzung der Trainingsbilder
    1. Wenden Sie zufälliges horizontales Flipping mit Wahrscheinlichkeit 0,5 nur auf das Trainingsset an. Wenden Sie eine zufällige Rotation innerhalb von ±15° auf das Trainingsset an.
    2. Wenden Sie keine Augmentation auf Validierungs- oder Testbilder an.
  5. Normalisierung des Gesichtseingangs
    1. Normalisieren Sie Pixelwerte auf den Bereich [-1, 1] oder verwenden Sie die Backbone-spezifische Normalisierungsregel konsistent über alle Splits.

6. Konstruiert das multimodale neuronale Netzwerk

  1. Konfiguration der Software- und Hardwareumgebung
    1. Implementiere das Modell in Python 3.10 mit PyTorch 2.1. Führe Training auf Ubuntu 22.04 oder einem anderen festgelegten Betriebssystem durch.
    2. Verwenden Sie eine Arbeitsstation mit mindestens 32 GB RAM, einer Grafikeinheit mit mindestens 12 GB Videospeicher und ausreichend lokalem Speicher für synchronisierte EEG-Videodaten. In diesem Demonstrationsprotokoll verwenden Sie eine NVIDIA RTX 3080 Grafikprozessor.
    3. Speichere das Trainingsskript, die Modelldefinitionsdatei, das Preprocessing-Skript und die Konfigurationsdatei in einem versionskontrollierten Projektverzeichnis.
    4. Melde das Code-Repository oder das archivierte Skriptpaket im Manuskript, falls das Teilen erlaubt ist.
  2. Bau des Gesichtszweigs
    1. Konstruiere das gesamte dual-branch-multimodale Rahmenwerk, wie in Abbildung 3 gezeigt. Initialisieren Sie ein MobileNetV2-Backbone für den Gesichtszweig.
    2. Ändern Sie die erste Faltungsschicht von 32 auf 24 Kanäle. Bauen Sie den Gesichtselement-Extraktionszweig gemäß Abbildung 4 und fügen Sie Koordinaten-Aufmerksamkeitsmodule nach den ausgewählten invertierten Restblöcken ein, wie in Abbildung 5 gezeigt.
    3. Ersetzen Sie festgelegte Standard-Faltungen durch parallele Tiefenfaltungen von 3 x 3 und 5 x 5 Kerngrößen, um die Mehrskalen-Feature-Extraktion zu verbessern.
    4. Exportieren Sie einen festdimensionalen Gesichtsmerkmalvektor zur Fusion. In diesem Demonstrationsprotokoll verwenden Sie eine Merkmalsdimension von 256.
  3. Bau des EEG-Zweigs
    1. Geben Sie das differentielle Entropiemerkmal in einen konvolutionellen neuronalen Netzwerkencoder ein. Verwenden Sie die Faltungsschichten, um räumliche Muster aus den EEG-Merkmalskarten zu extrahieren.
    2. Die konvolutionelle Ausgabesequenz wird in ein bidirektionales Langzeitspeichermodul eingespeist, um zeitliche Abhängigkeit über Fenster hinweg zu erfassen.
    3. Exportiere einen festdimensionalen EEG-Merkmalsvektor. In diesem Demonstrationsprotokoll verwenden Sie eine Merkmalsdimension von 256.
  4. Bau des crossmodalen Fusionsmoduls
    1. Implementieren Sie das multimodale Merkmalsinteraktionsmodul, das in Abbildung 6 dargestellt ist. Implementiere einen Mehrkopf-Cross-Attention-Block mit 8 Kopfen.
    2. Verwenden Sie die EEG-Merkmalssequenz als Abfrage und die Gesichtsmerkmale als Schlüssel und Wert in einem Querblicksstrom.
    3. Verwenden Sie die Gesichtsmerkmalesequenz als Abfrage und die EEG-Merkmalssequenz als Schlüssel und Wert im reziproken Cross-Attention-Strom.
    4. Verkette die Ausgaben der beiden Kreuzbeobachtungsströme. Führen Sie das verkettete Merkmal durch eine Fusionsprojektionsschicht.
  5. Hinzufügen des selbstresidual-dilatierten Faltungsmoduls
    1. Verfeinern Sie die fusionierte Darstellung mit der in Abbildung 7 gezeigten selbstrestdilatierten Faltungsverbindungsschicht.
    2. Konstruiere eine dilatierte Faltungskonkatenationsschicht mit Dilatationsraten von 1, 3, 6 und 12. Verkette die Ausgaben der vier Dilatationszweige.
    3. Fügen Sie Rest-Skip-Verbindungen hinzu, um den Gradientenfluss zu stabilisieren und Informationen aus niedrigeren Ebenen zu erhalten.
  6. Hinzufügen des Klassifikators
    1. Platt oder poole die fusionierte Darstellung. Füge eine vollständig verbundene Schicht und eine letzte Softmax-Ausgabeschicht hinzu. Setze die Ausgabeklassen auf Angst, Glück, Ruhe und Traurigkeit.
  7. Definition der Trainingssettings
    1. Verwenden Sie die in Tabelle 1 zusammengefassten Netzwerk- und Trainingseinstellungen. Die vier Emotionsklassen (Angst, Glück, Ruhe und Traurigkeit) wurden operationell mittels eines kombinierten Kennzeichnungsverfahrens definiert, das auf Reizdesign und Selbstberichterstattung des Teilnehmers basierte. Jeder Gemäldeclip wurde vorausgewählt, um eine Zielemotionskategorie hervorzurufen, und die Teilnehmer berichteten nach dem Anschauen von ihrer dominanten emotionalen Erfahrung. Die endgültigen Labels wurden durch Ausrichtung der beabsichtigten Reizkategorie mit selbstberichteten Antworten vergeben, und inkonsistente Stichproben wurden ausgeschlossen, um die Zuverlässigkeit der Kennzeichnung sicherzustellen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Die Leistung des vorgeschlagenen Doppel-Branch-Cross-Attention-Netzwerks wurde anhand des multimodalen Datensatzes bewertet, der während der Malerei von 327 Teilnehmern gesammelt wurde. Das primäre Ergebnis war die vierklassige Emotionsklassifikation für Angst, Glück, Ruhe und Traurigkeit. Weitere Analysen untersuchten das Verhalten unimodaler Modelle, multimodale Konvergenz, die Empfindlichkeit gegenüber der Anzahl der Aufmerksamkeitskopfe, die vergleichende Erkennungsleistung sowie das...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Dieses Protokoll adressiert ein praktisches Problem im affektiven Computing, nämlich wie emotionale Zustände in Malerei-Betrachtungsumgebungen erkannt werden können, in denen sichtbarer Ausdruck und physiologische Reaktion nicht zu jedem Zeitpunkt vollständig übereinstimmen. Unter den hier berichteten experimentellen Bedingungen erzielte das Dual-Branch-Framework eine höhere Klassifikationsleistung als die unimodalen Vergleichsmodelle, was den Wert der Kombination von Elektroenzephalogra...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Die Autoren erklären keine Interessenkonflikte.

Danksagungen

Wir sprechen den Freiwilligen der Minzu Normal University of Xingyi und der Southwest University unseren aufrichtigen Dank für ihre Teilnahme an den Experimenten aus. Wir danken auch dem technischen Personal der Universität Girona für ihre Unterstützung bei der EEG-Datenerfassung und den anonymen Gutachtern für ihre aufschlussreichen Kommentare.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Deep-Learning-FrameworkPyTorchv2.0 / https://pytorch.orgVerwendet für Modellbau, Training und Bewertung
EEG-Erfassungssystem (64-Kanal)Brain Products GmbHactiCHamp Plus / v1.6Verwendet für die hochauflösende EEG-Signalaufnahme während Experimenten
EEG-Elektrodenkappe (10 & Strich; 20-System)Brain Products GmbHActiCap / 64-KanalStandard International 10 & Dash; 20-Elektroden-Platzierung
Hochauflösende KameraSony CorporationIMX327-SensorVerwendet für die Videoaufnahme von Gesichtsausdrücken (≥ 1080p, 30 fps)

Referenzen

  1. Yang, Y., et al. A dual-stream regional feature learning and adaptive fusion method for electroencephalogram-based emotion recognition. Eng Appl Artificial Intell. 164, 113250(2026).
  2. Li, C., Pun, S. H., Li, J. W., Chen, F. Eeg-based emotion recognition using graph attention network with dual-branch attention module. 2024 46th Ann Int Conf IEEE Eng Me Biol Soc (EMBC), , 1-4 (2024).
  3. Ubillús, J. A. T., et al. Algorithms used for facial emotion recognition: A systematic review of the literature. EAI Endorsed Transact Pervasive Health Technol. 9, 1-17 (2023).
  4. Xu, Y., Cheng, L. Face emotion recognition based on gabor wavelet and particle swarm optimization algorithm. Multimed Syst. 31 (6), 435(2025).
  5. Dube, D. Y., Sannasi, M. V., Kyritsis, M., Gulliver, S. R. Facial emotion recognition from feature loss media: Human versus machine learning algorithms. Comp Human Behav. 174, 108806(2026).
  6. Manuel, M. T. J., Medina-DeVilliers, S., Clarkson, T., Lerner, M. D., Riccardi, G. Evaluation of interpretability for deep learning algorithms in EEG emotion recognition: A case study in autism. Artif Intell Med. 143, 102545(2023).
  7. Watanabe, A., Yamazaki, T. Representation of the brain network by electroencephalograms during facial expressions. J Neurosci Meth. 357, 109158(2021).
  8. Prakash, A., Poulose, A. Electroencephalogram-based emotion recognition: A comparative analysis of supervised machine learning algorithms. Data Sci Manag. 8 (3), 342-360 (2025).
  9. Sun, Y., Ayaz, H., Akansu, A. N. Multimodal affective state assessment using fnirs + eeg and spontaneous facial expression. Brain Sci. 10 (2), 85(2020).
  10. Huang, Y., Yang, J., Liu, S., Pan, J. Combining facial expressions and electroencephalography to enhance emotion recognition. Future Internet. 11 (5), 105(2019).
  11. Han, Q., et al. A multi-branch electroencephalogram emotion recognition framework based on cross-subject or cross-session multi-perspective representation fusion. Neurocomputing. 658, 131767(2025).
  12. Wang, L., Chang, Y., Wang, K. Dual-branch multimodal fusion network for driver facial emotion recognition. Appl Sci. 14 (20), 9430(2024).
  13. Mutawa, A. M., Hassouneh, A. Multimodal real-time patient emotion recognition system using facial expressions and brain EEG signals based on machine learning and log-sync methods. Biomed Signal Proc Contr. 91, 105942(2024).
  14. Qi, Y., Ibrayim, M., Hamdulla, A. Attention-based dual-branch network for micro-expression recognition with global-local feature fusion. 2024 IEEE Int Joint Conf Biometr (IJCB), , 1-9 (2024).
  15. Li, E. Intervention of art education on college students’ aesthetic mood based on emotion recognition algorithm. Front Art Res. 6 (9), 81-90 (2024).
  16. Liu, Z., Han, M., Wu, B., Rehman, A. Speech emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multi-task learning. Appl Acoustics. 202, 109178(2023).
  17. Xue, P., Wang, S., Bai, J., Qiang, Y. Research on bimodal emotion recognition algorithm based on multi-branch bidirectional multi-scale time perception. J Biome Eng. 42 (3), 528-536 (2025).
  18. Shioiri, S., Nagata, H., Sato, Y., Hatori, Y. Prediction of preference judgments of face images using facial expressions and eeg signals. J Vis. (9), 5063(2023).
  19. Lu, Y., Chen, J. Cross-subject EEG emotion recognition using the SSA-EMS algorithm for feature extraction. Entropy. 27 (9), 986(2025).
  20. Thapa, D., Rai, R. Freq-eer: A novel frequency-driven ensemble framework for emotion recognition and classification of eeg signals. Appl Sci. 15 (19), 10671(2025).
  21. Yang, Y., et al. Investigating of deaf emotion cognition pattern by eeg and facial expression combination. IEEE J Biomed Health Inform. 26 (2), 589-599 (2022).
  22. Tong, L., Yang, L., Wang, X., Liu, L. Self-aware face emotion accelerated recognition algorithm: A novel neural network acceleration algorithm of emotion recognition for international students. PeerJ Comput Sci. 9, e1611(2023).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Tags

EEG-EmotionserkennungGesichtsausdrucksanalyseDifferentielle EntropieConvolutional Neural Networkbidirektionales LSTMAffective ComputingMensch-Computer-Interaktion