Een abonnement op JoVE is vereist om deze inhoud te bekijken. Log in of start vandaag met uw gratis proefperiode.

Methodenartikel

Dual-branch Cross-Attention Netwerk voor Elektro-encefalografie en gezichtsmultimodale emotherkenning tijdens schilderbezichtiging

114 weergaven

⸱

DOI:

10.3791/70600

⸱

12 mei 2026

In dit artikel

Samenvatting

Dit protocol beschrijft de gesynchroniseerde acquisitie van elektro-encefalografie en gezichtsgegevens in schilderijen-kijkomgevingen en een dubbel-tak cross-attention netwerk voor multimodale emotieherkenning, inclusief preprocessing, feature-fusie en classificatie van vier emotionele toestanden.

Samenvatting

Emotieherkenning tijdens het bekijken van schilderijen blijft moeilijk omdat esthetische reacties dynamisch, contextafhankelijk zijn en slechts gedeeltelijk waarneembaar zijn via uiterlijk gedrag. Unimodale benaderingen die alleen op gezichtsuitdrukkingen of fysiologische signalen zijn gebaseerd op geven daarom vaak onvolledige weergaven van de ervaring van de kijker. Dit artikel beschrijft een reproduceerbare methode voor het construeren van een dubbelvertakkingskruis-aandacht netwerk dat gezichtsvideo integreert met elektro-encefalografie (EEG) gegevens voor multimodale emotherkenning in een schilderijententoonstellingscontext. Het protocol begint met het opzetten van een gesynchroniseerde opnameomgeving met een 64-kanaals EEG-systeem en een hogeresolutiecamera voor gelijktijdige opname tijdens het schilderbekijken. De daaropvolgende procedure beschrijft signaalvoorbewerking, waaronder EEG-filtering, segmentatie en differentiële entropie-feature-extractie, samen met gezichtsdetectie, uitlijning en framevoorbereiding voor video-analyse. Het neuraal netwerk bevat twee modaliteitsspecifieke takken. De EEG-tak gebruikt een convolutioneel neuraal netwerk en een bidirectioneel langetermijngeheugennetwerk om ruimtelijk-temporele neurale kenmerken te modelleren, terwijl de gezichtstak een coördinat-aandacht versterkt lichtgewicht convolutienetwerk gebruikt om visuele expressiekenmerken te extraheren. Een multi-head cross-attention module wordt vervolgens gebruikt om de twee stromen te combineren door intermodale relevantie te leren. Onder de hier gerapporteerde experimentele omstandigheden behaalde het multimodale kader een hogere classificatienauwkeurigheid dan de unimodale vergelijkingsmodellen in viercategorie emotieherkenning. Deze methode is het meest geschikt voor offline analyse in gecontroleerde acquisitieomgevingen en biedt een praktisch kader voor affectief rekenen, empirische esthetiek en tentoonstellingsgericht mens-computerinteractieonderzoek.

Inleiding

Emotie is een multidimensionaal psychologisch en fysiologisch proces dat wordt gevormd door externe prikkels, interne beoordeling en voortdurende cognitieve regulatie, en neemt daarom een centrale plaats in in mens-computerinteractie en cognitieve wetenschap1. In schilderijententoonstellingen bemiddelt emotie ook de relatie tussen beeldende kunstwerken en interpretatie door de kijker. Om deze reden heeft de identificatie van emotionele toestanden van de kijker praktische waarde voor tentoonstellingsevaluatie, ruimtelijk ontwerp en empirische studies van esthetische ervaring2. Tegelijkertijd blijft het meten van emoties in semi-natuurlijke tentoonstellingsomgevingen technisch moeilijk omdat de reacties subtiel, vluchtig zijn en beïnvloed worden door zowel het kunstwerk als de kijkcontext.

Onderzoek naar emotieherkenning heeft zich over het algemeen ontwikkeld langs twee hoofdlijnen: gedragsanalyse en fysiologische analyse. Gedragsbenaderingen, met name gezichtsuitdrukkingsanalyse gebaseerd op computer vision, worden veel gebruikt omdat ze niet-invasief zijn en relatief eenvoudig in te zetten3. Deep learning-modellen zoals residuele netwerken en lichtgewicht convolutionele netwerken hebben sterke prestaties getoond in basale taken voor gezichtsemotiesclassificatie 4. Gezichtsgedrag tijdens het schilderen kan echter zwak, sociaal gematigd of opzettelijk ingeperkt zijn, wat de correspondentie tussen zichtbare expressie en subjectiefgevoel kan verminderen. Fysiologische benaderingen, met name die gebaseerd op elektro-encefalografie (EEG), bieden directere toegang tot neurale activiteit die samenhangt met affectieve verwerking6. EEG wordt veel gebruikt in emotiestudies omdat temporele fluctuaties in neurale signalen informatief zijn voor veranderingen in affectieve toestand, inclusief dimensies gerelateerd aan valentie en opwinding7. Toch zijn EEG-opnames gevoelig voor bewegingsartefacten, elektromyografische verontreiniging en omgevingsgeluid, en alleen EEG levert vaak beperkte contextuele informatie over waar de kijker visueel op reageert8.

Deze complementaire sterke en zwakke punten hebben de interesse in multimodale emotieherkenning vergroot9. Het centrale uitgangspunt van multimodale fusie is dat heterogene signalen wederzijds informatief bewijs kunnen leveren en de ambiguïteit kunnen verminderen die ontstaat wanneer een enkele modaliteit geïsoleerd wordt geïnterpreteerd10. Bij schilderij-kijktaken kan bijvoorbeeld terughoudend gezichtsgedrag nog steeds samenvallen met meetbare neurale veranderingen die samenhangen met aandacht of affectieve betrokkenheid. Bestaande multimodale systemen modelleren deze relatie echter niet altijd effectief. Vroege fusiestrategieën gebaseerd op directe feature-concatenatie kunnen de dimensionale last verhogen en de modaliteitsspecifieke temporele structuur vervagen11. Late fusiestrategieën gebaseerd op afzonderlijke beslissingen zijn makkelijker toe te passen, maar ze kunnen fijnkorrelige interacties tussen visuele en fysiologische signalen tijdens emotionele verwerkingover het hoofd zien. Daarnaast gebruiken veel multimodale modellen vaste of zwak adaptieve fusieschema's, die niet goed geschikt zijn voor fluctuerende kijkersreacties in tentoonstellingsachtige omgevingen13.

Om deze beperkingen aan te pakken, beschrijft het huidige protocol een dubbelzijdig cross-attention netwerk voor multimodale emotherkenning tijdens het bekijken van schilderijen. In dit kader worden EEG-kenmerken verwerkt door een convolutioneel neuraal netwerk-bidirectioneel langtijdgeheugenmodel (CNN-BiLSTM), dat wordt gebruikt om ruimtelijk-temporele neurale dynamiek weer te geven. Gezichtsvideo-kenmerken worden verwerkt door een coördinat-aandacht-versterkte MobileNetV2-tak, die wordt gebruikt om expressiesignalen met lage intensiteit vast te leggen terwijl de rekenefficiëntiebehouden blijft. De twee takken worden vervolgens geïntegreerd via een multi-head cross-attention mechanisme dat de relevantie tussen modaliteiten leert in plaats van simpelweg hun output te koppelen15,16. Dit ontwerp is bedoeld om modaliteitsspecifieke structuur te behouden en tegelijkertijd cross-modale interactiemodellering te verbeteren.

De methode is voornamelijk ontworpen voor offline analyse onder gecontroleerde gegevensverwervingsomstandigheden, in plaats van voor directe realtime inzet in open openbare tentoonstellingsruimtes. Betrouwbare implementatie vereist gesynchroniseerde EEG- en video-opname, stabiele belichting, gecontroleerde cameraplaatsing, acceptabele elektrodeimpedantie en voldoende rekenkracht voor modeltraining. Prestaties kunnen ook afhangen van de samenstelling van de steekproef, het type stimulus en de mate waarin deelnemers hun gedrag aanpassen omdat ze weten dat ze worden opgenomen. Deze operationele beperkingen moeten worden meegenomen bij het aanpassen van het protocol aan andere tentoonstellingsomgevingen of populaties.

Het hier gepresenteerde protocol omvat de volledige experimentele pijplijn, inclusief gesynchroniseerde acquisitie van 327 deelnemers, voorverwerking van EEG- en gezichtsvideogegevens, feature-extractie, crossmodale fusie en classificatie. Het doel is om een reproduceerbare workflow te bieden voor multimodale emotieherkenning in schilderijenonderzoek. Naast affectieve computing17 kan het protocol ook kwantitatieve onderzoeken in empirische esthetiek en aanverwante psychologische studiesondersteunen 18.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Het studieprotocol werd beoordeeld en goedgekeurd door de Ethische Commissie voor Bescherming van Menselijk Onderzoek van de Xingyi Minzu Normale Universiteit (Goedkeuringsnr. 2600AL0621). Schriftelijke geïnformeerde toestemming werd van alle deelnemers verkregen vóór hun opname in het onderzoek en vóór de gegevensverzameling.

1. Deelname werving en ethische naleving

  1. Het verkrijgen van ethische goedkeuring
    1. Dien het volledige experimentele protocol, toestemmingsformulier, deelnemersinformatieblad en gegevensbeschermingsplan in bij de institutionele beoordelingscommissie (IRB) of ethische commissie voordat u met het onderzoek begint.
    2. Verkrijg schriftelijke goedkeuring en vermeld het goedkeuringsnummer in de onderzoeksdocumentatie.
  2. Werving van deelnemers
    1. Rekruteer gezonde volwassen deelnemers voor multimodale emotieverwerving tijdens het bekijken van schilderijen. In dit demonstratieprotocol rekruteren 327 deelnemers.
    2. Pas de volgende inclusiecriteria toe: leeftijd 18–35 jaar, normaal of gecorrigeerd naar normaal zicht, geen zelfgerapporteerde geschiedenis van neurologische aandoeningen, geen huidig gebruik van psychoactieve medicatie, en bereidheid om elektro-encefalografie (EEG) en gezichtsvideo-opname te ondergaan.
    3. Pas de volgende uitsluitingscriteria toe: overmatige hoofdhuidbeschadiging of dermatologische aandoeningen die het plaatsen van elektroden verhinderen, onvermogen om de volledige opnamesessie te voltooien, ernstige beweging tijdens de verwerving, of onvolledige toestemmingsdocumentatie.
    4. Noteer kenmerken van de deelnemers, waaronder leeftijd, geslacht, handigheid, ervaring met het bekijken van eerdere kunst en opleidingsniveau. In dit demonstratieprotocol wordt het volgende voorbeeld opgenomen KORTE LANGE SAMENVATTING: gemiddelde leeftijd 24,8 ± 3,7 jaar, 165 vrouwen en 162 mannen, alle deelnemers rechtshandig.
    5. Definieer de demografische balans operationeel vóór de werving. In dit demonstratieprotocol wordt deze term gebruikt om een ongeveer evenwichtige geslachtsverdeling aan te geven en een leeftijdsbereik geconcentreerd in de vroege volwassenheid, om leeftijdsgebonden variantie in EEG- en gezichtsuitdrukkingsresponsen te verminderen.
  3. Geïnformeerde toestemming verkrijgen
    1. Geef elke deelnemer een schriftelijk formulier voor geïnformeerde toestemming, waarin EEG-opname, gezichtsvideo-opname, synchronisatieprocedures, anonimisatie, gegevensopslag en het recht om zich op elk moment zonder straf terug te trekken, wordt beschreven.
    2. Leg uit dat gezichtsafbeeldingen zullen worden gebruikt voor het extraheren van kenmerken en dat ooggebieden in alle manuscriptfiguren worden gemaskeerd om de identiteit van de deelnemer te beschermen.
    3. Verkrijg schriftelijke geïnformeerde toestemming voordat een experimentele procedure begint.
  4. Identificaties toewijzen en gegevens anonimiseren
    1. Ken elke deelnemer een uniek numeriek studie-ID toe. Sla EEG-bestanden, videobestanden en metadata op met alleen de studie-ID.
    2. Bewaar identificeerbare toestemmingsformulieren apart van fysiologische en beeldgegevens. Gebruik gedeïdentificeerde gezichtsframes of gezichtsherkenningsgebaseerde outputs voor interne analyseopslag wanneer vereist door het lokale ethische beleid.

2. Experimentele omgeving en stimulusopstelling

  1. Voorbereiding van de kijkomgeving
    1. Bereid een rustige binnenruimte voor om een gecontroleerde schildertentoonstellingsomgeving te simuleren. Houd een omgevingstemperatuur van 22–24 °C en een relatieve luchtvochtigheid van 45%–60%. Beheers waar mogelijk achtergrondgeluid onder de 40 dB.
    2. Plaats de deelnemer in een rechtopstaande stoel met rugsteun en plaats de stoel zo dat de kijkafstand tussen de deelnemer en het display 2,0 m bedraagt.
    3. Geef de deelnemer de instructie om alleen te blijven zitten in het opnamegebied tijdens de stimuluspresentatie. Laat geen andere deelnemers of waarnemers in het directe gezichtsveld zijn tijdens gegevensverzameling.
  2. Configuratie van verlichting
    1. Installeer diffuse ring- of cirkelverlichting voor de deelnemer om schaduwvorming van het gezicht te verminderen. Stel de verlichting in op een stabiel niveau van ongeveer 500 lux op gezichtsniveau.
    2. Vermijd snelle lichtschommelingen en directe schittering op de ogen, het voorhoofd of de wangen. Visuele checkpoint: Controleer of het volledige gezicht, inclusief het voorhoofd, wenkbrauwen, ogen, neus, wangen en mondgebied, zichtbaar is in de camerapreview zonder overbelichting of diepe schaduw.
  3. Configuratie van visuele stimuluspresentatie
    1. Presenteer de visuele prikkels op een monitor of projectiescherm. In dit demonstratieprotocol gebruik je een 27-inch vloeibare-kristal display monitor met een resolutie van 1.920 x 1.080 pixels en een verversingssnelheid van 60 Hz.
    2. Toon schilderstimuli in video- of diavoorstellingsformaat volgens het onderzoeksontwerp. Gebruik voor alle deelnemers dezelfde regels voor schermhelderheid, contrast en presentatievolgorde.
    3. Toon elke schilderclip 90–120 seconden. In dit demonstratieprotocol gebruik je 6 clips, elk van 100 seconden durend, met een interstimulus-rustinterval van 20 seconden.
      VOORZICHTIG: Aard alle elektrische apparatuur correct en plaats de EEG-versterker en stroomkabels weg van hoog-interferentiebronnen om de 50/60 Hz lijnruis te verminderen.

3. Multimodale gegevensverzameling

  1. Gezichtsvideo verkrijgen
    1. Plaats een high-definition industriële camera direct voor de deelnemer op ongeveer ooghoogte. Stel de afstand tussen camera en gezicht in op 1,2 m.
    2. Gebruik een camera met een minimale opnameresolutie van 1.920 x 1.080 pixels en een framerate van 30 frames/s.
    3. Stel de belichting handmatig in om fluctuaties van frame tot frame te voorkomen. Gebruik in dit demonstratieprotocol ISO 400, sluitertijd 1/60 s en vaste witbalans.
    4. Sla de video op in MP4- of AVI-formaat met een constante framerate. In dit demonstratieprotocol slaat je video op als MP4, H.264-codering, 30 frames/s.
    5. Controleer of het volledige gezicht gedurende de opnamesessie binnen het gezichtsveld blijft. Visuele controle: Controleer of de wenkbrauwen en het voorhoofd volledig zichtbaar zijn. Herpositioneer de camera onmiddellijk als het voorhoofd, de wenkbrauwregio of de kin is bijgesneden.
      OPMERKING: Gebruik 30 frames/s omdat deze framerate voldoende temporele resolutie biedt voor laag-intensiteit gezichtsuitdrukkingsdynamiek, terwijl een beheersbare opslag- en verwerkingsbelasting behouden blijft bij gesynchroniseerde multimodale opname.
  2. Het verkrijgen van EEG-signalen
    1. Meet de hoofdomtrek en kies de juiste cap-grootte voor de deelnemer. Plaats de 64-kanaals EEG-condensator volgens het internationale 10–20-systeem of een door de fabrikant gespecificeerde 64-kanaals uitbreidingsopstelling.
    2. Lijn de kap uit met behulp van anatomische herkenningspunten. Plaats Fpz op de middenlijn boven de nasie en controleer symmetrie over de linker- en rechterhersenhelft.
    3. Scheid het haar bij elke elektrodeplaats en breng geleidende gel aan om het contact tussen elektrode en hoofdhuid te verbeteren.
    4. Bereid de hoofdhuid voorzichtig voor op plekken met hoge impedantie met een wattenstaafje of een stomp voorbereidingsinstrument. Schuren de huid niet te veel op.
    5. Sluit de condensator aan op de EEG-versterker en voer impedantiemeting uit. Verlaag de elektrodeimpedantie tot onder de 10 kΩ voor alle kanalen. In dit demonstratieprotocol streef je waar mogelijk naar < 5 kΩ voor frontale en centrale elektroden.
    6. Stel de samplefrequentie in op 500 Hz. Stel de online referentie in volgens de versterkerconfiguratie. In dit demonstratieprotocol wordt een gekoppelde mastoidereferentie gebruikt tijdens de acquisitie en wordt een gemeenschappelijke gemiddelde herreferentie uitgevoerd tijdens de preprocessing.
    7. Plaats de aardelektrode volgens de specificatie van de versterker. In dit demonstratieprotocol plaats je de grond op AFz. Noteer minstens 60 seconden rustbasislijn vóór de stimuluspresentatie.
    8. Visuele controle: Inspecteer de live EEG-sporen voordat je het experiment start. Bevestig stabiele basisactiviteit, lage drift en afwezigheid van persistente verzadigde kanalen of grote bewegingsartefacten.
  3. EEG- en videostromen synchroniseren
    1. Verbind de stimuluspresentatiecomputer met de triggeringang van de EEG-versterker via een transistor-transistor logic (TTL) triggerkabel of triggerbox.
    2. Gebruik de presentatiesoftware om een TTL-triggerpuls te sturen bij het begin van elke schilderclip en een tweede TTL-triggerpuls bij de offset van elke clip.
    3. Wijs unieke triggercodes toe aan elk gebeurtenistype. In dit demonstratieprotocol gebruik je 11–16 voor clip-onset en 21–26 voor clip-offset.
    4. Neem de camerastream en EEG-stream gelijktijdig op vanaf minstens 5 seconden voor de eerste trigger tot minstens 5 seconden na de laatste trigger. Log de trigger-tijdstempeltabel automatisch in de stimulussoftware.
    5. Valideer de synchronisatie na het verwerven door triggertijdstempels in de EEG-opname te vergelijken met videoframe-indices uit het presentatielogboek. Visuele controle: Bevestig dat de gemiddelde uitlijningsfout tussen EEG-triggertijdstempels en videoframe-tijdstempels binnen ±33 ms ligt bij 30 frames/s.
      OPMERKING: Als er geen hardware-frame-accurate synchronisatieinterface beschikbaar is, exporteer dan tijdstempellogs van beide systemen en voer offline uitlijncorrectie uit met behulp van trigger onset matching.
  4. Registreer experimentele gegevens
    1. Geef de deelnemer de opdracht om de schilderijen natuurlijk te bekijken, terwijl grote hoofdbewegingen, overmatig knipperen, spreken en aanrakingen in het gezicht worden geminimaliseerd.
    2. Presenteer de vooraf gedefinieerde schilderclips in de gekozen volgorde. Neem continu gesynchroniseerde EEG- en gezichtsbeelden op tijdens de kijksessie.
    3. Pauzeer het experiment en controleer de elektroden opnieuw als meer dan 5 kanalen de impedantiedrempel overschrijden tijdens de opname. Onderbrekingen van documenten, ongemak van deelnemers en technische problemen in het sessielogboek.

4. EEG-voorverwerking en feature-extractie

  1. Import van ruwe EEG-gegevens
    1. Importeer de ruwe EEG-opnames in de analyseomgeving. In dit demonstratieprotocol gebruik je ofwel MATLAB R2023b met EEGLAB 2024.0 of Python 3.10 met MNE 1.6.
    2. Importeer de gebeurtenismarkers en controleer of alle stimulusstart- en offsettriggers aanwezig zijn.
  2. Het afbouwen van de EEG-signalen
    1. Verlaag de signalen van 500 Hz naar 200 Hz en verwerk ze vooraf volgens de workflow die in Figuur 1 wordt getoond.
    2. Pas anti-aliasing toe tijdens het resamplen volgens de standaardinstellingen of het gedefinieerde filter van de software.
  3. Het filteren van de EEG-signalen
    1. Pas een banddoorlaatfilter toe van 0,5–45 Hz. Pas een notchfilter toe op de lokale vermogensfrequentie als zichtbare lijnruis blijft. In dit demonstratieprotocol pas je een 50 Hz notchfilter toe.
  4. Artefacten verwijderen
    1. Inspecteer de continue EEG handmatig en markeer segmenten met grove bewegingsartefacten.
    2. Voer onafhankelijke componentanalyse uit op de gefilterde data. Identificeer componenten die geassocieerd zijn met oogknipperingen, horizontale oogbewegingen, kaakspanning of spieractiviteit door gebruik te maken van hoofdhuidkaarten, tijdlijnen en vermogensspectra.
    3. Verwijder de geïdentificeerde artefactcomponenten en reconstrueer de gereinigde EEG-signalen. Ondertoon segmenten die nog steeds overmatige amplitudefluctuaties bevatten na onafhankelijke componentanalysecorrectie. In dit demonstratieprotocol worden segmenten die meer dan ±100 μV worden afgewezen.
  5. Het herrefereren van de data
    1. Herreferer de gereinigde EEG-signalen naar de gemeenschappelijke gemiddelde referentie.
  6. Het segmenteren van de EEG-gegevens
    1. Epoche de continue EEG volgens de stimulusstart triggert. Extraheer stimulus-uitgelijnde segmenten die de volledige clip of vaste analysevensters beslaan. In dit demonstratieprotocol segmenteert u het EEG in 2,0 s vensters met 50% overlap. Sluit vensters met resterende artefacten uit na segmentatie.
  7. Berekening van differentiële entropiekenmerken
    1. Verdeel elk EEG-segment in de volgende frequentiebanden: delta (1–4 Hz), theta (4–8 Hz), alfa (8–13 Hz), beta (13–30 Hz) en gamma (30–45 Hz).
    2. Bereken de differentiële entropie van elke frequentieband voor elk kanaal. Gebruik de volgende vergelijking voor een Gaussische variabele:
      DE = 1/2 ln(2πeσ2), waarbij σ2 de variantie is van het bandbeperkte EEG-signaal.
    3. Rangschik de kanaalwijze differentiële entropiewaarden in een tweedimensionale topografische matrix of kanaalfeature-matrix voor modelinvoer.
    4. In dit demonstratieprotocol genereer je EEG-featurekaarten met een invoergrootte van 128 × 128 x 5 per analysevenster. Visueel controlepunt: Plot representatieve differentiële entropiekaarten voor elke band en bevestig dat ontbrekende kanalen, constante-waarde kaarten of abnormale bandgewijze inzakking niet aanwezig zijn.

5. Gezichtsvideo-voorverwerking

  1. Beeldframes extraheren
    1. Decodeer de opgenomen video in beeldframes met behulp van een gescripte pijplijn. Haal frames uit bij 25 frames/s voor modelinvoer terwijl de synchronisatiemetadata behouden blijft.
  2. Het gezicht detecteren en uitlijnen
    1. Detecteer het gezicht in elk frame met een gevalideerde gezichtsdetector. Zoek gezichtsherkenningspunten en lijn het gezicht uit op basis van de oogcentra of standaard herkenningsankers. Verwijder frames waarin het gezicht niet betrouwbaar wordt gedetecteerd.
  3. Het bijsnijden en aanpassen van het gezichtsgebied
    1. Snijd het vlak bij aan de gedetecteerde begrenzingsbox met een kleine marge om contourinformatie te behouden. Verander de bijgesneden afbeelding van het gezicht naar 224 x 224 pixels.
    2. Inspecteer representatieve bijgesneden gezichtsmonsters uit de vier doel-emotiecategorieën, zoals weergegeven in Figuur 2, en bevestig dat het voorhoofd, de wenkbrauwen, ogen, neus, wangen en mond zichtbaar blijven na het croppen.
  4. Het uitbreiden van de trainingsbeelden
    1. Pas willekeurige horizontale flipping toe met kans 0,5 op alleen de trainingsset. Pas willekeurige rotatie toe binnen ±15° op de trainingsset.
    2. Pas geen augmentatie toe op validatie of testafbeeldingen.
  5. Het normaliseren van de gezichtsinput
    1. Normaliseer pixelwaarden naar het bereik [-1, 1] of gebruik de backbone-specifieke normalisatieregel consequent over alle splitsingen.

6. Bouw het multimodale neurale netwerk

  1. Het configureren van de software- en hardwareomgeving
    1. Implementeer het model in Python 3.10 met PyTorch 2.1. Voer training uit op Ubuntu 22.04 of een ander gespecificeerd besturingssysteem.
    2. Gebruik een werkstation met minstens 32 GB RAM, één grafische verwerkingsunit met minstens 12 GB videogeheugen en voldoende lokale opslag voor gesynchroniseerde EEG-videogegevens. Gebruik in dit demonstratieprotocol een NVIDIA RTX 3080 grafische verwerkingseenheid.
    3. Sla het trainingsscript, modeldefinitiebestand, preprocessing-script en configuratiebestand op in een versiegestuurde projectmap.
    4. Rapporteer de coderepository of het gearchiveerde scriptpakket in het manuscript als delen is toegestaan.
  2. Het bouwen van de gezichtstak
    1. Construeer het totale dual-branch multimodale kader zoals weergegeven in Figuur 3. Initialiseer een MobileNetV2-ruggengraat voor de gezichtsvertakking.
    2. Wijzig de eerste convolutielaag van 32 kanalen naar 24 kanalen. Bouw de gezichtskenmerken-extractietak volgens Figuur 4 en voeg coördinaten-aandachtmodules in na de geselecteerde omgekeerde residuele blokken, zoals getoond in Figuur 5.
    3. Vervang aangewezen standaardconvoluties door parallelle diepteconvoluties van 3 x 3 en 5 x 5 kernelgrootte om de multi-scale feature-extractie te verbeteren.
    4. Exporteer een vaste-dimensionale gezichtskenmerkenvector voor fusie. Gebruik in dit demonstratieprotocol een feature-dimensie van 256.
  3. Het opbouwen van de EEG-tak
    1. Voer de differentiële entropie-eigenschap in kaart in een convolutioneel neuraal netwerk-encoder. Gebruik de convolutionele lagen om ruimtelijke patronen uit de EEG-featurekaarten te halen.
    2. Voer de convolutionele uitvoersequentie in een bidirectionele module voor het langetermijngeheugen om temporele afhankelijkheid over vensters te registreren.
    3. Exporteer een vaste-dimensionale EEG-featurevector. Gebruik in dit demonstratieprotocol een feature-dimensie van 256.
  4. Het bouwen van de cross-modale fusiemodule
    1. Implementeer de multimodale feature-interactiemodule zoals weergegeven in Figuur 6. Voer een multi-head cross-attention blok uit met 8 hoofden.
    2. Gebruik de EEG-featuresequentie als query en de gezichtskenmerkende sequentie als sleutel en waarde in één cross-attention-stream.
    3. Gebruik de gezichtskenmerkenreeks als de query en de EEG-kenmerkreeks als sleutel en waarde in de reciproke kruis-aandachtstroom.
    4. Verbind de uitgangen van de twee cross-attention stromen. Haal het gekoppelde kenmerk door een fusieprojectielaag.
  5. Toevoeging van de zelfresiduele gedilateerde convolutiemodule
    1. Verfijn de gefuseerde representatie met de zelfresiduele verwijdde convolutie-verbindingslaag zoals weergegeven in Figuur 7.
    2. Bouw een gedilateerde convulutie-concatenatielaag met behulp van dilatatiesnelheden van 1, 3, 6 en 12. Verbind de uitgangen van de vier dilatatietakken.
    3. Voeg residuele skipverbindingen toe om de gradiëntstroom te stabiliseren en informatie op lagere niveaus te behouden.
  6. De classifier toevoegen
    1. Plat of voeg de samengevoegde representatie samen. Voeg één volledig verbonden laag toe en een laatste softmax-uitvoerlaag. Stel de outputklassen in op angst, geluk, kalmte en verdriet.
  7. Het definiëren van de trainingsinstellingen
    1. Gebruik de netwerk- en trainingsinstellingen die in Tabel 1 zijn samengevat. De vier emotieklassen (angst, geluk, kalmte en verdriet) werden operationeel gedefinieerd met behulp van een gecombineerde labelingsprocedure gebaseerd op stimulusontwerp en zelfrapportage van de deelnemer. Elke schilderclip werd vooraf geselecteerd om een doel-emotiecategorie op te roepen, en deelnemers rapporteerden hun dominante emotionele ervaring na het bekijken. De uiteindelijke labels werden toegekend door de bedoelde stimuluscategorie uit te lijnen met zelfgerapporteerde responsen, en inconsistente steekproeven werden uitgesloten om de labelbetrouwbaarheid te waarborgen.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

De prestaties van het voorgestelde dubbelvoudige kruis-aandacht netwerk werden geëvalueerd met behulp van de multimodale dataset die tijdens het schilderen werd verzameld van 327 deelnemers. De primaire uitkomst was de vierklassen emotieclassificatie voor angst, geluk, kalmte en verdriet. Aanvullende analyses onderzochten het gedrag van unimodale modellen, multimodale convergentie, gevoeligheid voor het aantal aandachtshoofden, vergelijkende herkenningsprestaties en het gedrag van de gez...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Dit protocol pakt een praktisch probleem in affectief computeren aan, namelijk hoe emotionele toestanden te herkennen in schilderij-kijkomgevingen waar zichtbare expressie en fysiologische respons niet op elk moment volledig samenvallen. Onder de hier gerapporteerde experimentele omstandigheden behaalde het dual-branch framework een hogere classificatieprestatie dan de unimodale vergelijkingsmodellen, wat de waarde ondersteunt van het combineren van elektro-encefalografie en gezichtsuitd...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

De auteurs geven geen belangenconflicten aan.

Dankbetuigingen

Wij spreken onze oprechte dank uit aan de vrijwilligers van de Minzu Normal University van Xingyi en Southwest University voor hun deelname aan de experimenten. We danken ook het technische personeel van de Universiteit van Girona voor hun hulp bij het verzamelen van EEG-gegevens en de anonieme beoordelaars voor hun inzichtelijke opmerkingen.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
Deep Learning FrameworkPyTorchv2.0 / https://pytorch.orgWordt gebruikt voor modelbouw, training en evaluatie
EEG-acquisitiesysteem (64-kanaals)Brain Products GmbHactiCHamp Plus / v1.6Wordt gebruikt voor high-resolution EEG-signaalregistratie tijdens experimenten
EEG-elektrodencap (10–20 systeem)Brain Products GmbHActiCap / 64-kanaalsStandaard internationale 10–20 elektrodeplacing
High-Definition CameraSony CorporationIMX327 SensorWordt gebruikt voor video-opname van gezichtsuitdrukkingen (≥1080p, 30 fps)

Referenties

  1. Yang, Y., et al. A dual-stream regional feature learning and adaptive fusion method for electroencephalogram-based emotion recognition. Eng Appl Artificial Intell. 164, 113250(2026).
  2. Li, C., Pun, S. H., Li, J. W., Chen, F. Eeg-based emotion recognition using graph attention network with dual-branch attention module. 2024 46th Ann Int Conf IEEE Eng Me Biol Soc (EMBC), , 1-4 (2024).
  3. Ubillús, J. A. T., et al. Algorithms used for facial emotion recognition: A systematic review of the literature. EAI Endorsed Transact Pervasive Health Technol. 9, 1-17 (2023).
  4. Xu, Y., Cheng, L. Face emotion recognition based on gabor wavelet and particle swarm optimization algorithm. Multimed Syst. 31 (6), 435(2025).
  5. Dube, D. Y., Sannasi, M. V., Kyritsis, M., Gulliver, S. R. Facial emotion recognition from feature loss media: Human versus machine learning algorithms. Comp Human Behav. 174, 108806(2026).
  6. Manuel, M. T. J., Medina-DeVilliers, S., Clarkson, T., Lerner, M. D., Riccardi, G. Evaluation of interpretability for deep learning algorithms in EEG emotion recognition: A case study in autism. Artif Intell Med. 143, 102545(2023).
  7. Watanabe, A., Yamazaki, T. Representation of the brain network by electroencephalograms during facial expressions. J Neurosci Meth. 357, 109158(2021).
  8. Prakash, A., Poulose, A. Electroencephalogram-based emotion recognition: A comparative analysis of supervised machine learning algorithms. Data Sci Manag. 8 (3), 342-360 (2025).
  9. Sun, Y., Ayaz, H., Akansu, A. N. Multimodal affective state assessment using fnirs + eeg and spontaneous facial expression. Brain Sci. 10 (2), 85(2020).
  10. Huang, Y., Yang, J., Liu, S., Pan, J. Combining facial expressions and electroencephalography to enhance emotion recognition. Future Internet. 11 (5), 105(2019).
  11. Han, Q., et al. A multi-branch electroencephalogram emotion recognition framework based on cross-subject or cross-session multi-perspective representation fusion. Neurocomputing. 658, 131767(2025).
  12. Wang, L., Chang, Y., Wang, K. Dual-branch multimodal fusion network for driver facial emotion recognition. Appl Sci. 14 (20), 9430(2024).
  13. Mutawa, A. M., Hassouneh, A. Multimodal real-time patient emotion recognition system using facial expressions and brain EEG signals based on machine learning and log-sync methods. Biomed Signal Proc Contr. 91, 105942(2024).
  14. Qi, Y., Ibrayim, M., Hamdulla, A. Attention-based dual-branch network for micro-expression recognition with global-local feature fusion. 2024 IEEE Int Joint Conf Biometr (IJCB), , 1-9 (2024).
  15. Li, E. Intervention of art education on college students’ aesthetic mood based on emotion recognition algorithm. Front Art Res. 6 (9), 81-90 (2024).
  16. Liu, Z., Han, M., Wu, B., Rehman, A. Speech emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multi-task learning. Appl Acoustics. 202, 109178(2023).
  17. Xue, P., Wang, S., Bai, J., Qiang, Y. Research on bimodal emotion recognition algorithm based on multi-branch bidirectional multi-scale time perception. J Biome Eng. 42 (3), 528-536 (2025).
  18. Shioiri, S., Nagata, H., Sato, Y., Hatori, Y. Prediction of preference judgments of face images using facial expressions and eeg signals. J Vis. (9), 5063(2023).
  19. Lu, Y., Chen, J. Cross-subject EEG emotion recognition using the SSA-EMS algorithm for feature extraction. Entropy. 27 (9), 986(2025).
  20. Thapa, D., Rai, R. Freq-eer: A novel frequency-driven ensemble framework for emotion recognition and classification of eeg signals. Appl Sci. 15 (19), 10671(2025).
  21. Yang, Y., et al. Investigating of deaf emotion cognition pattern by eeg and facial expression combination. IEEE J Biomed Health Inform. 26 (2), 589-599 (2022).
  22. Tong, L., Yang, L., Wang, X., Liu, L. Self-aware face emotion accelerated recognition algorithm: A novel neural network acceleration algorithm of emotion recognition for international students. PeerJ Comput Sci. 9, e1611(2023).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Tags

EEG-emotieherkenninganalyse van gezichtsuitdrukkingendifferentiële entropieconvolutioneel neuraal netwerkbidirectionele LSTMaffectief computenmens-computerinteractie