Emotion ist ein multidimensionaler psychologischer und physiologischer Prozess, der durch äußere Reize, innere Einschätzung und fortlaufende kognitive Regulation geprägt wird und daher eine zentrale Rolle in der Mensch-Computer-Interaktion sowie in der Kognitionswissenschafteinnimmt. In Malausstellungen vermittelt Emotion auch die Beziehung zwischen visuellen Kunstwerken und Betrachterinterpretation. Aus diesem Grund hat die Identifikation der Empfangszustände des Betrachters praktischen Wert für die Ausstellungsbewertung, das räumliche Design und empirische Studien ästhetischer Erfahrung2. Gleichzeitig bleibt die Emotionsmessung in halbnatürlichen Ausstellungsumgebungen technisch schwierig, da die Reaktionen subtil, vorübergehend und sowohl vom Kunstwerk als auch vom Betrachtungskontext beeinflusst werden.
Die Forschung zur Emotionserkennung hat sich im Allgemeinen entlang von zwei Hauptlinien entwickelt: der Verhaltensanalyse und der physiologischen Analyse. Verhaltensansätze, insbesondere Gesichtsausdrucksanalyse auf Basis von Computer Vision, werden weit verbreitet eingesetzt, da sie nicht-invasiv und relativ einfach einzusetzensind. Deep-Learning-Modelle wie Residualnetzwerke und leichte Faltungsnetzwerke haben eine starke Leistung bei grundlegenden Aufgaben zur Klassifikation von Gesichtsemotionengezeigt 4. Allerdings kann das Gesichtsverhalten während der Betrachtung des Gemäldes schwach, sozial gemäßigt oder absichtlich zurückhaltend sein, was die Übereinstimmung zwischen sichtbarem Ausdruck und subjektivem Gefühl verringernkann. Physiologische Ansätze, insbesondere solche, die auf Elektroenzephalographie (EEG) basieren, bieten direkteren Zugang zur neuronalen Aktivität im Zusammenhang mit der affektiven Verarbeitung6. EEG wurde in Emotionsstudien weit verbreitet eingesetzt, da zeitliche Schwankungen in neuronalen Signalen Hinweise auf Veränderungen des affektiven Zustands sind, einschließlich Dimensionen im Zusammenhang mit Valenz und Erregung7. Dennoch sind EEG-Aufnahmen empfindlich gegenüber Bewegungsartefakten, elektromyographischer Kontamination und Umgebungsgeräuschen, und das EEG allein liefert oft nur begrenzte kontextuelle Informationen darüber, worauf der Betrachter visuell reagiert.
Diese komplementären Stärken und Schwächen haben das Interesse an multimodaler Emotionserkennung gesteigert9. Die zentrale Prämisse der multimodalen Fusion ist, dass heterogene Signale gegenseitig informative Belege liefern und die Mehrdeutigkeit verringern können, die entsteht, wenn eine einzelne Modalität isoliert interpretiert wird10. Bei Malerei-Betrachtungsaufgaben kann beispielsweise zurückhaltendes Gesichtsverhalten dennoch mit messbaren neuronalen Veränderungen im Zusammenhang mit Aufmerksamkeit oder affektiver Beschäftigung zusammenfallen. Bestehende multimodale Systeme modellieren diese Beziehung jedoch nicht immer effektiv. Frühe Fusionsstrategien, die auf direkter Merkmalsverkettung basieren, können die dimensionale Belastung erhöhen und die modalitätsspezifische zeitliche Struktur11 verwischen. Späte Fusionsstrategien, die auf getrennten Entscheidungen basieren, sind leichter umzusetzen, können aber feinkörnige Wechselwirkungen zwischen visuellen und physiologischen Signalen während der emotionalen Verarbeitungübersehen. Darüber hinaus verwenden viele multimodale Modelle feste oder schwach adaptive Fusionsschemata, die für schwankende Betrachterreaktionen in ausstellungsähnlichenSettings nicht gut geeignet sind.
Um diese Einschränkungen zu beheben, beschreibt das vorliegende Protokoll ein zweigeteiltes Cross-Attention-Netzwerk zur multimodalen Emotionserkennung während der Gemäldebesichtigung. In diesem Rahmen werden EEG-Merkmale von einem konvolutionellen neuronalen Netzwerk-bidirektionalen Langzeitgedächtnismodell (CNN-BiLSTM) verarbeitet, das zur Darstellung räumlich-zeitlicher neuronaler Dynamik verwendet wird. Gesichtsvideo-Merkmale werden von einem koordinaten, aufmerksamkeitsverstärkten MobileNetV2-Zweig verarbeitet, der verwendet wird, um niedrigintensive Expressionshinweise zu erfassen und dabei die Recheneffizienz14 aufrechtzuerhalten. Die beiden Zweige werden dann durch einen Multi-Head-Cross-Attention-Mechanismus integriert, der die Relevanz zwischen den Modalitäten erlernt, anstatt ihre Ausgaben einfach zu verknüpfen15,16. Dieses Design soll modalitätsspezifische Strukturen erhalten und gleichzeitig die Cross-Modal-Interaktionsmodellierung verbessern.
Die Methode ist in erster Linie für die Offline-Analyse unter kontrollierten Datenerfassungsbedingungen konzipiert und nicht für den direkten Echtzeit-Einsatz in offenen öffentlichen Ausstellungsräumen. Eine zuverlässige Implementierung erfordert synchronisierte EEG- und Videoaufnahme, stabile Beleuchtung, kontrollierte Kameraplatzierung, akzeptable Elektrodenimpedanz und ausreichende Rechenressourcen für die Modellbildung. Die Leistung kann auch von der Zusammensetzung der Stichprobe, dem Reiztyp und dem Ausmaß abhängen, in dem die Teilnehmer das Verhalten verändern, weil sie wissen, dass sie aufgezeichnet werden. Diese betrieblichen Einschränkungen sollten bei der Anpassung des Protokolls an andere Ausstellungsumgebungen oder Populationen berücksichtigt werden.
Das hier vorgestellte Protokoll umfasst die gesamte experimentelle Pipeline, einschließlich synchronisierter Erfassung von 327 Teilnehmern, Vorverarbeitung von EEG- und Gesichtsvideodaten, Merkmalextraktion, intermodaler Fusion und Klassifikation. Ziel ist es, einen reproduzierbaren Workflow für multimodale Emotionserkennung in der Gemäldeausstellungsforschung bereitzustellen. Über das affektive Rechnen17 hinaus kann das Protokoll auch quantitative Untersuchungen in empirischer Ästhetik und verwandten psychologischen Studienunterstützen 18.