Emotie is een multidimensionaal psychologisch en fysiologisch proces dat wordt gevormd door externe prikkels, interne beoordeling en voortdurende cognitieve regulatie, en neemt daarom een centrale plaats in in mens-computerinteractie en cognitieve wetenschap1. In schilderijententoonstellingen bemiddelt emotie ook de relatie tussen beeldende kunstwerken en interpretatie door de kijker. Om deze reden heeft de identificatie van emotionele toestanden van de kijker praktische waarde voor tentoonstellingsevaluatie, ruimtelijk ontwerp en empirische studies van esthetische ervaring2. Tegelijkertijd blijft het meten van emoties in semi-natuurlijke tentoonstellingsomgevingen technisch moeilijk omdat de reacties subtiel, vluchtig zijn en beïnvloed worden door zowel het kunstwerk als de kijkcontext.
Onderzoek naar emotieherkenning heeft zich over het algemeen ontwikkeld langs twee hoofdlijnen: gedragsanalyse en fysiologische analyse. Gedragsbenaderingen, met name gezichtsuitdrukkingsanalyse gebaseerd op computer vision, worden veel gebruikt omdat ze niet-invasief zijn en relatief eenvoudig in te zetten3. Deep learning-modellen zoals residuele netwerken en lichtgewicht convolutionele netwerken hebben sterke prestaties getoond in basale taken voor gezichtsemotiesclassificatie 4. Gezichtsgedrag tijdens het schilderen kan echter zwak, sociaal gematigd of opzettelijk ingeperkt zijn, wat de correspondentie tussen zichtbare expressie en subjectiefgevoel kan verminderen. Fysiologische benaderingen, met name die gebaseerd op elektro-encefalografie (EEG), bieden directere toegang tot neurale activiteit die samenhangt met affectieve verwerking6. EEG wordt veel gebruikt in emotiestudies omdat temporele fluctuaties in neurale signalen informatief zijn voor veranderingen in affectieve toestand, inclusief dimensies gerelateerd aan valentie en opwinding7. Toch zijn EEG-opnames gevoelig voor bewegingsartefacten, elektromyografische verontreiniging en omgevingsgeluid, en alleen EEG levert vaak beperkte contextuele informatie over waar de kijker visueel op reageert8.
Deze complementaire sterke en zwakke punten hebben de interesse in multimodale emotieherkenning vergroot9. Het centrale uitgangspunt van multimodale fusie is dat heterogene signalen wederzijds informatief bewijs kunnen leveren en de ambiguïteit kunnen verminderen die ontstaat wanneer een enkele modaliteit geïsoleerd wordt geïnterpreteerd10. Bij schilderij-kijktaken kan bijvoorbeeld terughoudend gezichtsgedrag nog steeds samenvallen met meetbare neurale veranderingen die samenhangen met aandacht of affectieve betrokkenheid. Bestaande multimodale systemen modelleren deze relatie echter niet altijd effectief. Vroege fusiestrategieën gebaseerd op directe feature-concatenatie kunnen de dimensionale last verhogen en de modaliteitsspecifieke temporele structuur vervagen11. Late fusiestrategieën gebaseerd op afzonderlijke beslissingen zijn makkelijker toe te passen, maar ze kunnen fijnkorrelige interacties tussen visuele en fysiologische signalen tijdens emotionele verwerkingover het hoofd zien. Daarnaast gebruiken veel multimodale modellen vaste of zwak adaptieve fusieschema's, die niet goed geschikt zijn voor fluctuerende kijkersreacties in tentoonstellingsachtige omgevingen13.
Om deze beperkingen aan te pakken, beschrijft het huidige protocol een dubbelzijdig cross-attention netwerk voor multimodale emotherkenning tijdens het bekijken van schilderijen. In dit kader worden EEG-kenmerken verwerkt door een convolutioneel neuraal netwerk-bidirectioneel langtijdgeheugenmodel (CNN-BiLSTM), dat wordt gebruikt om ruimtelijk-temporele neurale dynamiek weer te geven. Gezichtsvideo-kenmerken worden verwerkt door een coördinat-aandacht-versterkte MobileNetV2-tak, die wordt gebruikt om expressiesignalen met lage intensiteit vast te leggen terwijl de rekenefficiëntiebehouden blijft. De twee takken worden vervolgens geïntegreerd via een multi-head cross-attention mechanisme dat de relevantie tussen modaliteiten leert in plaats van simpelweg hun output te koppelen15,16. Dit ontwerp is bedoeld om modaliteitsspecifieke structuur te behouden en tegelijkertijd cross-modale interactiemodellering te verbeteren.
De methode is voornamelijk ontworpen voor offline analyse onder gecontroleerde gegevensverwervingsomstandigheden, in plaats van voor directe realtime inzet in open openbare tentoonstellingsruimtes. Betrouwbare implementatie vereist gesynchroniseerde EEG- en video-opname, stabiele belichting, gecontroleerde cameraplaatsing, acceptabele elektrodeimpedantie en voldoende rekenkracht voor modeltraining. Prestaties kunnen ook afhangen van de samenstelling van de steekproef, het type stimulus en de mate waarin deelnemers hun gedrag aanpassen omdat ze weten dat ze worden opgenomen. Deze operationele beperkingen moeten worden meegenomen bij het aanpassen van het protocol aan andere tentoonstellingsomgevingen of populaties.
Het hier gepresenteerde protocol omvat de volledige experimentele pijplijn, inclusief gesynchroniseerde acquisitie van 327 deelnemers, voorverwerking van EEG- en gezichtsvideogegevens, feature-extractie, crossmodale fusie en classificatie. Het doel is om een reproduceerbare workflow te bieden voor multimodale emotieherkenning in schilderijenonderzoek. Naast affectieve computing17 kan het protocol ook kwantitatieve onderzoeken in empirische esthetiek en aanverwante psychologische studiesondersteunen 18.