È richiesta un abbonamento a JoVE per visualizzare questo contenuto. Accedi o inizia la tua prova gratuita.

Articolo metodologico

Rete di Doppia Direzione di Attenzione Incrociata per l'Elettroencefalografia e il Riconoscimento Multimodale delle Emozioni Facciali durante la Visualizzazione della Pittura

105 visualizzazioni

DOI:

10.3791/70600

12 maggio 2026

In questo articolo

Sommario

Questo protocollo descrive l'acquisizione sincronizzata di elettroencefalografia e dati facciali in contesti di visione di pittura e una rete di doppia direzione di attenzione incrociata per il riconoscimento multimodale delle emozioni, inclusi preprocessing, fusione delle caratteristiche e classificazione di quattro stati emotivi.

Abstract

Il riconoscimento delle emozioni durante la visione della pittura rimane difficile perché le risposte estetiche sono dinamiche, dipendenti dal contesto e solo parzialmente osservabili attraverso il comportamento esteriore. Gli approcci unimodali basati solo sulle espressioni facciali o solo su segnali fisiologici, quindi, spesso forniscono rappresentazioni incomplete dell'esperienza dello spettatore. Questo articolo descrive un metodo riproducibile per costruire una rete di doppia direzione di attenzione incrociata che integra il video facciale con i dati di elettroencefalografia (EEG) per il riconoscimento multimodale delle emozioni in un contesto di esposizione pittorica. Il protocollo inizia con l'istituzione di un ambiente di acquisizione sincronizzato utilizzando un sistema EEG a 64 canali e una telecamera ad alta risoluzione per la registrazione simultanea durante la visione della pittura. La procedura successiva dettaglia la preelaborazione del segnale, inclusi filtraggio EEG, segmentazione ed estrazione delle caratteristiche di entropia differenziale, insieme al rilevamento facciale, all'allineamento e alla preparazione dei fotogrammi per l'analisi video. La rete neurale contiene due rami specifici per modalità. Il ramo EEG utilizza una rete neurale convoluzionale e una rete bidirezionale di memoria a breve termine per modellare le caratteristiche neurali spazio-temporali, mentre il ramo facciale utilizza una rete convoluzionale leggera e orientata all'attenzione per le coordinate per estrarre le caratteristiche di espressione visiva. Un modulo di cross-attention multi-head viene quindi utilizzato per fondere i due flussi apprendendo la rilevanza intermodale. Nelle condizioni sperimentali qui riportate, il quadro multimodale ha raggiunto una maggiore accuratezza di classificazione rispetto ai modelli di confronto unimodali nel riconoscimento emozionale a quattro categorie. Questo metodo è particolarmente adatto per l'analisi offline in contesti di acquisizione controllata e fornisce un quadro pratico per il calcolo affettivo, l'estetica empirica e la ricerca sull'interazione uomo-computer orientata all'esposizione.

Introduzione

L'emozione è un processo psicologico e fisiologico multidimensionale plasmato da stimoli esterni, valutazione interna e regolazione cognitiva continua, e quindi occupa una posizione centrale nell'interazione uomo-computer e nelle scienzecognitive 1. Negli ambienti espositivi pittorici, l'emozione media anche il rapporto tra opere visive e interpretazione dello spettatore. Per questo motivo, l'identificazione degli stati emotivi dello spettatore ha un valore pratico per la valutazione delle mostre, il design spaziale e gli studi empirici dell'esperienzaestetica 2. Allo stesso tempo, la misurazione delle emozioni in ambienti espositivi semi-naturali rimane tecnicamente difficile perché le risposte sono sottili, transitorie e influenzate sia dall'opera sia dal contesto di visione.

La ricerca sul riconoscimento delle emozioni si è generalmente sviluppata su due linee principali: analisi comportamentale e analisi fisiologica. Gli approcci comportamentali, in particolare l'analisi delle espressioni facciali basata sulla visione artificiale, sono ampiamente utilizzati perché non invasivi e relativamente facili daimplementare 3. I modelli di deep learning come le reti residue e le reti convoluzionali leggere hanno mostrato ottime prestazioni nei compiti di classificazione delle emozioni faccialidi base 4. Tuttavia, il comportamento facciale durante la visione della pittura può essere debole, socialmente moderato o deliberatamente trattenuto, il che può ridurre la corrispondenza tra espressione visibile e sentimentosoggettivo 5. Gli approcci fisiologici, in particolare quelli basati sull'elettroencefalografia (EEG), offrono un accesso più diretto all'attività neurale associata all'elaborazioneaffettiva 6. L'EEG è stato ampiamente utilizzato negli studi emotivi perché le fluttuazioni temporali nei segnali neurali sono informative per i cambiamenti dello stato affettivo, incluse le dimensioni legate alla valenza eall'attivazione 7. Tuttavia, le registrazioni EEG sono sensibili a artefatti di movimento, contaminazione elettromiografica e rumore ambientale, e l'EEG da solo spesso fornisce informazioni contestuali limitate su ciò a cui lo spettatore rispondevisivamente 8.

Questi punti di forza e debolezza complementari hanno aumentato l'interesse per il riconoscimento multimodale delleemozioni 9. Il presupposto centrale della fusione multimodale è che i segnali eterogenei possono fornire prove reciprocamente informative e ridurre l'ambiguità che sorge quando una singola modalità viene interpretataisolatamente 10. Nei compiti di visione della pittura, ad esempio, il comportamento facciale trattenuto può comunque coincidere con cambiamenti neurali misurabili associati all'attenzione o all'impegno affettivo. Tuttavia, i sistemi multimodali esistenti non sempre modellano efficacemente questa relazione. Le prime strategie di fusione basate sulla concatenazione diretta delle caratteristiche possono aumentare il carico dimensionale e possono sfumare la struttura temporale specifica della modalità11. Le strategie di fusione tardiva basate su decisioni separate sono più facili da implementare, ma possono trascurare interazioni dettagliate tra segnali visivi e fisiologici durante l'elaborazioneemotiva 12. Inoltre, molti modelli multimodali utilizzano schemi di fusione fissi o debolmente adattivi, che non sono adatti alle risposte fluttuanti degli spettatori in contesti simili a esposizioni13.

Per affrontare queste limitazioni, il protocollo attuale descrive una rete a doppia ramazione di attenzione incrociata per il riconoscimento multimodale delle emozioni durante la visualizzazione della pittura. In questo contesto, le caratteristiche EEG sono elaborate da un modello di memoria a lungo termine bidirezionale di rete neurale convoluzionale (CNN-BiLSTM), utilizzato per rappresentare la dinamica neurale spazio-temporale. Le caratteristiche video facciali sono elaborate da un ramo MobileNetV2 con attenzione migliorata di coordinate, utilizzato per catturare segnali di espressione a bassa intensità mantenendo l'efficienzacomputazionale 14. I due rami vengono quindi integrati tramite un meccanismo multi-head cross-attention che apprende la rilevanza tra le modalità invece di limitarsi a concatenare i lorooutput 15,16. Questo design è pensato per preservare la struttura specifica per modalità migliorando al contempo la modellazione delle interazioni cross-modali.

Il metodo è progettato principalmente per l'analisi offline in condizioni di acquisizione dati controllate, piuttosto che per una distribuzione diretta in tempo reale in spazi espositivi pubblici aperti. Un'implementazione affidabile richiede EEG e acquisizione video sincronizzati, illuminazione stabile, posizionamento controllato della telecamera, impedenza accettabile degli elettrodi e risorse di calcolo sufficienti per l'addestramento del modello. La performance può anche dipendere dalla composizione del campione, dal tipo di stimolo e dal grado in cui i partecipanti modificano il comportamento perché sanno di essere registrati. Questi vincoli operativi dovrebbero essere considerati nell'adattamento del protocollo ad altri contesti espositivi o popolazioni.

Il protocollo presentato qui copre l'intera pipeline sperimentale, inclusa acquisizione sincronizzata da 327 partecipanti, pre-elaborazione dei dati EEG e video facciali, estrazione delle caratteristiche, fusione cross-modale e classificazione. L'obiettivo è fornire un flusso di lavoro riproducibile per il riconoscimento multimodale delle emozioni nella ricerca delle mostre pittoriche. Oltre al calcoloaffettivo 17, il protocollo può anche supportare indagini quantitative in estetica empirica e studi psicologicicorrelati 18.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Il protocollo dello studio è stato esaminato e approvato dal Comitato Etico per la Protezione della Ricerca Umana dell'Università Normale Xingyi Minzu (Approvazione n. 2600AL0621). Il consenso informato scritto è stato ottenuto da tutti i partecipanti prima della loro inclusione nello studio e prima della raccolta dei dati.

1. Reclutamento dei partecipanti e conformità etica

  1. Ottenere l'approvazione etica
    1. Invia il protocollo sperimentale completo, il modulo di consenso, la scheda informativa per i partecipanti e il piano di protezione dei dati al comitato di revisione istituzionale (IRB) o al comitato etico prima di iniziare lo studio.
    2. Ottieni l'approvazione scritta e registra il numero di approvazione nella documentazione dello studio.
  2. Reclutamento dei partecipanti
    1. Reclutare partecipanti adulti sani per l'acquisizione multimodale delle emozioni durante la visione della pittura. In questo protocollo dimostrativo, reclutare 327 partecipanti.
    2. Applicare i seguenti criteri di inclusione: età 18–35 anni, vista normale o corretta a normale, nessuna storia auto-riportata di disturbi neurologici, nessun uso attuale di farmaci psicoattivi e disponibilità a sottoporsi a registrazioni elettroencefalografiche (EEG) e video facciali.
    3. Applicare i seguenti criteri di esclusione: lesioni eccessive al cuoio capelluto o condizioni dermatologiche che impediscono il posizionamento degli elettrodi, impossibilità di completare l'intera sessione di registrazione, movimenti intensi durante l'acquisizione o documentazione del consenso incompleta.
    4. Registrare le caratteristiche dei partecipanti, inclusi età, sesso, destrezza, esperienza precedente di visione dell'arte e livello di istruzione. In questo protocollo dimostrativo, registra il seguente campione BREVE E LUNGO ABSTRACT: media di età 24,8 ± 3,7 anni, 165 femmine e 162 uomini, tutti i partecipanti destromani.
    5. Definisci l'equilibrio demografico operativo prima del reclutamento. In questo protocollo dimostrativo, si utilizza questo termine per indicare una distribuzione sessuale approssimativamente equilibrata e una fascia d'età concentrata nella prima età adulta per ridurre la varianza legata all'età nelle risposte EEG e nelle espressioni facciali.
  3. Ottenere il consenso informato
    1. Fornire a ciascun partecipante un modulo scritto di consenso informato che descriva la registrazione EEG, la registrazione video facciale, le procedure di sincronizzazione, l'anonimizzazione, l'archiviazione dei dati e il diritto di ritirarsi in qualsiasi momento senza penalità.
    2. Spiega che le immagini facciali saranno usate per l'estrazione delle caratteristiche e che le regioni oculari saranno mascherate in tutte le figure manoscritte per proteggere l'identità dei partecipanti.
    3. Ottieni il consenso informato scritto prima di iniziare qualsiasi procedura sperimentale.
  4. Assegnazione di identificatori e anonimizzazione dei dati
    1. Assegnare a ciascun partecipante un ID numerico unico dello studio. Conservare file EEG, file video e metadati utilizzando solo l'ID dello studio.
    2. Conserva i moduli di consenso identificabili separatamente dai dati fisiologici e delle immagini. Utilizzare montature facciali deidentificate o output derivati da punti di riferimento facciali per l'archiviazione interna dell'analisi quando richiesto dalla politica etica locale.

2. Ambiente sperimentale e impostazione degli stimoli

  1. Preparazione dell'ambiente di visione
    1. Prepara una stanza interna tranquilla per simulare un ambiente controllato di esposizione di pittura. Mantenere una temperatura ambiente di 22–24 °C e un'umidità relativa tra il 45% e il 60%. Controlla il rumore di fondo sotto i 40 dB quando possibile.
    2. Fai sedere il partecipante su una sedia verticale con supporto per la schiena e posiziona la sedia in modo che la distanza di visione tra il partecipante e lo spettacolo sia di 2,0 m.
    3. Istruire il partecipante a rimanere seduto da solo nell'area di registrazione durante la presentazione dello stimolo. Non permettere ad altri partecipanti o osservatori di trovarsi nel campo visivo immediato durante l'acquisizione dei dati.
  2. Configurazione dell'illuminazione
    1. Installare un'illuminazione diffusa ad anello o circolare davanti al partecipante per ridurre l'ombreggiatura facciale. Imposta l'illuminazione a un livello stabile di circa 500 lux all'altezza del viso.
    2. Evita le fluttuazioni rapide della luce e il riflesso diretto su occhi, fronte o guance. Checkpoint visivo: Conferma che tutto il viso, inclusi fronte, sopracciglia, occhi, naso, guance e zona della bocca, sia visibile nell'anteprima della fotocamera senza sovraesposizione o ombre profonde.
  3. Configurazione della presentazione dello stimolo visivo
    1. Presenta gli stimoli visivi su un monitor o uno schermo di proiezione. In questo protocollo dimostrativo, si utilizza un monitor a cristallo liquido da 27 pollici con una risoluzione di 1.920 x 1.080 pixel e una frequenza di aggiornamento di 60 Hz.
    2. Mostra gli stimoli per la visione della pittura in formato video o slideshow secondo il design dello studio. Usa le stesse regole di luminosità, contrasto e ordine di presentazione dello schermo per tutti i partecipanti.
    3. Presenta ogni clip per 90–120 secondi. In questo protocollo dimostrativo, si usano 6 clip, ciascuno della durata di 100 s, con un intervallo di riposo interstimolo di 20 s.
      ATTENZIONE: Collega correttamente a terra tutte le apparecchiature elettriche e posiziona l'amplificatore EEG e i cavi di alimentazione lontano da fonti ad alta interferenza per ridurre il rumore di linea 50/60 Hz.

3. Acquisizione dati multimodale

  1. Acquisizione di video facciali
    1. Posiziona una telecamera industriale ad alta definizione direttamente davanti al partecipante, approssimativamente all'altezza degli occhi. Imposta la distanza tra la telecamera e il contatto a 1,2 m.
    2. Usa una fotocamera con una risoluzione minima di acquisizione di 1.920 x 1.080 pixel e un frame rate di 30 fotogrammi/s.
    3. Imposta manualmente l'esposizione per evitare fluttuazioni da fotogramma a fotogramma. In questo protocollo dimostrativo, usa ISO 400, tempo di scatto 1/60 s e bilanciamento del bianco fisso.
    4. Salva il video in formato MP4 o AVI utilizzando un frame rate costante. In questo protocollo dimostrativo, salva il video come MP4, codifica H.264, 30 fotogrammi/s.
    5. Verifica che il volto completo rimanga nel campo visivo per tutta la durata della sessione di registrazione. Checkpoint visivo: Verifica che sopracciglia e fronte siano completamente visibili. Riposiziona immediatamente la telecamera se la fronte, la zona delle sopracciglia o il mento vengono tagliati.
      NOTA: Utilizzare 30 fotogrammi/s perché questo frame rate fornisce una risoluzione temporale adeguata per dinamiche di espressione facciale a bassa intensità, mantenendo al contempo un carico di archiviazione e elaborazione gestibili nella registrazione multimodale sincronizzata.
  2. Acquisizione dei segnali EEG
    1. Misura la circonferenza della testa e seleziona la misura corretta del cappuccio per il partecipante. Posizionare il cappuccio EEG a 64 canali secondo il sistema internazionale 10–20 o una disposizione di estensione a 64 canali specificata dal produttore.
    2. Allinea il cappuccio usando punti di riferimento anatomici. Posiziona Fpz sulla linea mediana sopra il nasion e verifica la simmetria tra gli emisferi sinistro e destro.
    3. Separare i capelli in ogni sito dell'elettrodo e applicare un gel conduttivo per migliorare il contatto tra elettrodo e cuoio capelluto.
    4. Prepara delicatamente il cuoio capelluto nei punti ad alta impedenza usando un cotton fioc o uno strumento di preparazione contundente. Non sbuffare eccessivamente la pelle.
    5. Collega il condensatore all'amplificatore EEG ed esegui la misurazione dell'impedenza. Riduci l'impedenza dell'elettrodo a meno di 10 kΩ per tutti i canali. In questo protocollo dimostrativo, punta a < 5 kΩ per elettrodi frontali e centrali quando possibile.
    6. Imposta la frequenza di campionamento a 500 Hz. Imposta il riferimento online in base alla configurazione dell'amplificatore. In questo protocollo dimostrativo, si utilizza un riferimento mastoideo collegato durante l'acquisizione ed esegui un ririferimento medio comune durante la pre-elaborazione.
    7. Posiziona l'elettrodo di massa secondo le specifiche dell'amplificatore. In questo protocollo dimostrativo, posizionare il terreno su AFz. Registra almeno 60 secondi di base a riposo prima della presentazione dello stimolo.
    8. Checkpoint visivo: Ispezionare le tracce EEG in tempo reale prima di iniziare l'esperimento. Confermare attività stabile di base, bassa deriva e assenza di canali saturi persistenti o artefatti di movimento maggiori.
  3. Sincronizzazione EEG e flussi video
    1. Collega il computer di presentazione dello stimolo all'ingresso di trigger dell'amplificatore EEG utilizzando un cavo di trigger o una scatola di trigger a logica transistor-transistor (TTL).
    2. Usa il software di presentazione per inviare un impulso di trigger TTL all'inizio di ogni clip di pittura e un secondo impulso di trigger TTL all'offset di ogni clip.
    3. Assegna codici di attivazione unici a ogni tipo di evento. In questo protocollo dimostrativo, si usa 11–16 per l'inizio del clip e 21–26 per il clip offset.
    4. Registra contemporaneamente il flusso della telecamera e quello EEG da almeno 5 secondi prima del primo trigger fino ad almeno 5 s dopo l'ultimo trigger. Registra automaticamente la tabella dei timestamp dei trigger nel software di stimolo.
    5. Validare la sincronizzazione dopo l'acquisizione abbinando i timestamp di trigger nella registrazione EEG con gli indici dei frame video dal registro della presentazione. Checkpoint visivo: Conferma che l'errore medio di allineamento tra timestamp dei trigger EEG e timestamp dei frame video sia entro ±33 ms a 30 frame/s.
      NOTA: Se non è disponibile un'interfaccia di sincronizzazione hardware con precisione dei frame, esportare i log di timestamp da entrambi i sistemi ed eseguire la correzione offline dell'allineamento tramite il trigger inset matching.
  4. Registrazione dei dati sperimentali
    1. Istruisci il partecipante a guardare i dipinti in modo naturale, minimizzando i grandi movimenti della testa, il battito eccessivo, il parlare e il contatto facciale.
    2. Presenta le clip predefinite nella pittura nell'ordine selezionato. Registra EEG sincronizzato e video facciale continuamente durante tutta la sessione di visione.
    3. Mettere in pausa l'esperimento e ricontrollare gli elettrodi se più di 5 canali superano la soglia di impedenza durante la registrazione. Documenta le interruzioni, il disagio dei partecipanti e i problemi tecnici nel registro delle sessioni.

4. Preprocessing EEG ed estrazione delle caratteristiche

  1. Importazione dei dati EEG grezzi
    1. Importare le registrazioni EEG grezze nell'ambiente di analisi. In questo protocollo dimostrativo, si utilizza o MATLAB R2023b con EEGLAB 2024.0 oppure Python 3.10 con MNE 1.6.
    2. Importare i marcatori di evento e verificare che tutti i trigger di inizio e offset dello stimolo siano presenti.
  2. Riduzione del campionamento dei segnali EEG
    1. Ridimensiona i segnali da 500 Hz a 200 Hz e pre-elaborali secondo il flusso di lavoro mostrato nella Figura 1.
    2. Applica l'anti-aliasing durante il ricampionamento secondo le impostazioni predefinite del software o il filtro definito.
  3. Filtraggio dei segnali EEG
    1. Applicare un filtro passabanda da 0,5 a 45 Hz. Applicare un filtro a tacca alla frequenza di potenza locale se il rumore di linea visibile persiste. In questo protocollo dimostrativo, applica un filtro a tacca a 50 Hz.
  4. Rimozione di artefatti
    1. Ispezionare manualmente l'EEG continuo e segnare i segmenti con artefatti grossolani del movimento.
    2. Esegui un'analisi indipendente dei componenti sui dati filtrati. Identifica i componenti associati a battimenti di ciglia oculari, movimenti orizzontali degli occhi, tensione della mascella o attività muscolare utilizzando mappe del cuoio capelluto, percorsi temporali e spettri di potenza.
    3. Rimuovere i componenti dell'artefatto identificati e ricostruire i segnali EEG puliti. Segmenti di rifiuto che contengono ancora fluttuazioni di ampiezza eccessiva dopo una correzione indipendente dell'analisi dei componenti. In questo protocollo dimostrativo, i segmenti di rifiuto superano ±100 μV.
  5. Ririferimento dei dati
    1. Riferisci i segnali EEG puliti alla media comune di riferimento.
  6. Segmentazione dei dati EEG
    1. Epoca l'EEG continuo in base ai trigger di inizio dello stimolo. Estrarre segmenti allineati allo stimolo che coprono l'intera finestra di analisi a clip o fissa. In questo protocollo dimostrativo, segmenta l'EEG in finestre da 2,0 s con il 50% di sovrapposizione. Escludere le finestre con artefatti residui dopo la segmentazione.
  7. Calcolo delle caratteristiche di entropia differenziale
    1. Scomporre ogni segmento EEG nelle seguenti bande di frequenza: delta (1–4 Hz), theta (4–8 Hz), alfa (8–13 Hz), beta (13–30 Hz) e gamma (30–45 Hz).
    2. Calcola l'entropia differenziale di ogni banda di frequenza per ogni canale. Usa la seguente equazione per una variabile gaussiana:
      DE = 1/2 ln(2πeσ2), dove σ2 è la varianza del segnale EEG limitato in banda.
    3. Organizzare i valori differenziali di entropia canale per canale in una matrice topografica bidimensionale o in una matrice canale-caratteristiche per l'input del modello.
    4. In questo protocollo dimostrativo, genera mappe di caratteristiche EEG con una dimensione di input di 128 × 128 x 5 per finestra di analisi. Checkpoint visivo: Traccia mappe rappresentative di entropia differenziale per ogni banda e conferma che canali mancanti, mappe a valore costante o collasso anomalo a banda a banda non sono presenti.

5. Preprocessing video facciale

  1. Estrazione dei fotogrammi
    1. Decodifica il video registrato in fotogrammi immagine usando una pipeline scriptata. Estrai i frame a 25 frame/s per l'input del modello preservando i metadati di sincronizzazione.
  2. Rilevamento e allineamento del volto
    1. Rileva il volto in ogni fotogramma usando un rilevatore di volti validato. Individua i punti di riferimento facciali e allinea il volto in base ai centri degli occhi o agli ancoraggi standard. Scartare i fotogrammi in cui la faccia non viene rilevata in modo affidabile.
  3. Ritaglio e ridimensionamento della regione del volto
    1. Ritaglia la faccia fino alla riquadro di delimitazione rilevata con un piccolo margine per preservare le informazioni sui contorni. Ridimensiona l'immagine del volto ritagliata a 224 x 224 pixel.
    2. Ispezionare campioni rappresentativi ritagliati del viso delle quattro categorie emotive target, come mostrato nella Figura 2, e confermare che fronte, sopracciglia, occhi, naso, guance e bocca rimangano visibili dopo il ritaglio.
  4. Potenziare le immagini di addestramento
    1. Applica il flipping orizzontale casuale con probabilità 0,5 solo al set di addestramento. Applica una rotazione casuale entro ±15° solo sul set di addestramento.
    2. Non applicare l'aumento alle immagini di validazione o di test.
  5. Normalizzazione dell'input facciale
    1. Normalizza i valori dei pixel all'intervallo [-1, 1] oppure usa la regola di normalizzazione specifica della backbone in modo coerente su tutte le divisioni.

6. Costruire la rete neurale multimodale

  1. Configurazione dell'ambiente software e hardware
    1. Implementa il modello in Python 3.10 usando PyTorch 2.1. Esegui l'addestramento su Ubuntu 22.04 o un altro sistema operativo specificato.
    2. Utilizzare una workstation con almeno 32 GB di RAM, un'unità di elaborazione grafica con almeno 12 GB di memoria video e sufficiente spazio di archiviazione locale per dati EEG-video sincronizzati. In questo protocollo dimostrativo, si utilizza un'unità di elaborazione grafica NVIDIA RTX 3080.
    3. Memorizza lo script di addestramento, il file di definizione del modello, lo script di preelaborazione e il file di configurazione in una directory di progetto controllata da versione.
    4. Segnala il repository di codice o il pacchetto di script archiviato nel manoscritto se è consentito la condivisione.
  2. Costruzione del ramo facciale
    1. Costruire il quadro multimodale a doppio ramo complessivo come mostrato nella Figura 3. Inizializza una backbone MobileNetV2 per il ramo facciale.
    2. Modifica il primo strato di convoluzione da 32 a 24 canali. Costruisci il ramo di estrazione delle caratteristiche facciali secondo la Figura 4 e inserisci moduli di attenzione coordinate dopo i blocchi residui invertiti selezionati, come mostrato nella Figura 5.
    3. Sostituire le convoluzioni standard designate con convoluzioni parallele in profondità di dimensioni di 3 x 3 e 5 x 5 per 5 per migliorare l'estrazione delle caratteristiche su più scala.
    4. Esporta un vettore di caratteristiche facciali a dimensione fissa per la fusione. In questo protocollo dimostrativo, si utilizza una dimensione di caratteristica pari a 256.
  3. Costruzione del ramo EEG
    1. Inserisci la caratteristica di entropia differenziale in un codificatore di rete neurale convoluzionale. Usa gli strati convoluzionali per estrarre i pattern spaziali dalle mappe di caratteristiche EEG.
    2. Inserisce la sequenza convoluzionale in uscita in un modulo bidirezionale di memoria a breve termine per catturare la dipendenza temporale tra le finestre.
    3. Esporta un vettore di caratteristiche EEG a dimensione fissa. In questo protocollo dimostrativo, si utilizza una dimensione di caratteristica pari a 256.
  4. Costruzione del modulo di fusione cross-modale
    1. Implementa il modulo di interazione multimodale delle caratteristiche mostrato nella Figura 6. Implementa un blocco di attenzione incrociata multi-testa con 8 teste.
    2. Usa la sequenza delle caratteristiche EEG come query e la sequenza delle caratteristiche facciali come chiave e valore in un unico flusso di attenzioni incrociate.
    3. Usa la sequenza delle caratteristiche facciali come query e la sequenza delle caratteristiche EEG come chiave e valore nel flusso reciproco di attenzione incrociata.
    4. Concatena gli output dei due flussi di attenzione incrociata. Fai passare la caratteristica concatenata attraverso uno strato di proiezione a fusione.
  5. Aggiunta del modulo di convoluzione dilatata auto-residuo
    1. Affinare la rappresentazione fusa con lo strato di connessione a convoluzione dilatata auto-residuo mostrato nella Figura 7.
    2. Costruire uno strato di concatenazione a convoluzione dilatata usando velocità di dilatazione di 1, 3, 6 e 12. Concatena gli output dai quattro rami di dilatazione.
    3. Aggiungere connessioni residue di salto per stabilizzare il flusso gradiente e preservare le informazioni a livello inferiore.
  6. Aggiunta del classificatore
    1. Appiattire o mettere in pool la rappresentazione fusa. Aggiungi un livello completamente connesso e un livello finale di output softmax. Imposta le classi di output su paura, felicità, calma e tristezza.
  7. Definizione delle impostazioni di addestramento
    1. Usa le impostazioni di rete e addestramento riassunte nella Tabella 1. Le quattro classi di emozioni (paura, felicità, calma e tristezza) sono state definite operativamente utilizzando una procedura combinata di etichettatura basata sul design dello stimolo e sull'auto-valutazione dei partecipanti. Ogni clip di pittura è stato preselezionato per suscitare una categoria di emozioni target e i partecipanti hanno riportato la loro esperienza emotiva dominante dopo la visione. Le etichette finali sono state assegnate allineando la categoria di stimolo prevista con le risposte auto-riportate, e i campioni incoerenti sono stati esclusi per garantire l'affidabilità dell'etichettatura.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Le prestazioni della proposta rete di doppia ramo di attenzione incrociato sono state valutate utilizzando il dataset multimodale raccolto da 327 partecipanti durante la visione della pittura. L'esito primario è stato la performance di classificazione emozionale in quattro classi: paura, felicità, calma e tristezza. Ulteriori analisi hanno esaminato il comportamento dei modelli unimodali, la convergenza multimodale, la sensibilità al numero di teste di attenzione, le prestazioni comparat...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Questo protocollo affronta un problema pratico nel calcolo affettivo, ovvero come riconoscere gli stati emotivi in contesti di visione di dipinti dove espressione visibile e risposta fisiologica potrebbero non coincidere completamente in ogni momento. Nelle condizioni sperimentali qui riportate, il framework a doppio ramo ha raggiunto prestazioni di classificazione superiori rispetto ai modelli di confronto unimodali, il che supporta il valore di combinare elettroencefalografia e informa...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Gli autori dichiarano di non esserci conflitti di interesse.

Ringraziamenti

Esprimiamo la nostra sincera gratitudine ai volontari della Minzu Normal University di Xingyi e della Southwest University per la loro partecipazione agli esperimenti. Ringraziamo inoltre il personale tecnico dell'Università di Girona per il loro aiuto nell'acquisizione dei dati EEG e i revisori anonimi per i loro commenti approfonditi.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Quadro di Deep LearningPyTorchv2.0 / https://pytorch.orgUtilizzato per la costruzione di modelli, l'addestramento e la valutazione
Sistema di Acquisizione EEG (64 canali)Brain Products GmbHactiCHamp Plus / v1.6Utilizzato per l'acquisizione di segnali EEG ad alta risoluzione durante esperimenti
Cappuccio elettrodo EEG (10– sistema 20)Brain Products GmbHActiCap / 64 canaliStandard internazionale 10 e ndash; Posizionamento a 20 elettrodi
Telecamera ad alta definizioneSony CorporationSensore IMX327Utilizzato per la registrazione video delle espressioni facciali (≥ 1080p, 30 fps)

Riferimenti

  1. Yang, Y., et al. A dual-stream regional feature learning and adaptive fusion method for electroencephalogram-based emotion recognition. Eng Appl Artificial Intell. 164, 113250(2026).
  2. Li, C., Pun, S. H., Li, J. W., Chen, F. Eeg-based emotion recognition using graph attention network with dual-branch attention module. 2024 46th Ann Int Conf IEEE Eng Me Biol Soc (EMBC), , 1-4 (2024).
  3. Ubillús, J. A. T., et al. Algorithms used for facial emotion recognition: A systematic review of the literature. EAI Endorsed Transact Pervasive Health Technol. 9, 1-17 (2023).
  4. Xu, Y., Cheng, L. Face emotion recognition based on gabor wavelet and particle swarm optimization algorithm. Multimed Syst. 31 (6), 435(2025).
  5. Dube, D. Y., Sannasi, M. V., Kyritsis, M., Gulliver, S. R. Facial emotion recognition from feature loss media: Human versus machine learning algorithms. Comp Human Behav. 174, 108806(2026).
  6. Manuel, M. T. J., Medina-DeVilliers, S., Clarkson, T., Lerner, M. D., Riccardi, G. Evaluation of interpretability for deep learning algorithms in EEG emotion recognition: A case study in autism. Artif Intell Med. 143, 102545(2023).
  7. Watanabe, A., Yamazaki, T. Representation of the brain network by electroencephalograms during facial expressions. J Neurosci Meth. 357, 109158(2021).
  8. Prakash, A., Poulose, A. Electroencephalogram-based emotion recognition: A comparative analysis of supervised machine learning algorithms. Data Sci Manag. 8 (3), 342-360 (2025).
  9. Sun, Y., Ayaz, H., Akansu, A. N. Multimodal affective state assessment using fnirs + eeg and spontaneous facial expression. Brain Sci. 10 (2), 85(2020).
  10. Huang, Y., Yang, J., Liu, S., Pan, J. Combining facial expressions and electroencephalography to enhance emotion recognition. Future Internet. 11 (5), 105(2019).
  11. Han, Q., et al. A multi-branch electroencephalogram emotion recognition framework based on cross-subject or cross-session multi-perspective representation fusion. Neurocomputing. 658, 131767(2025).
  12. Wang, L., Chang, Y., Wang, K. Dual-branch multimodal fusion network for driver facial emotion recognition. Appl Sci. 14 (20), 9430(2024).
  13. Mutawa, A. M., Hassouneh, A. Multimodal real-time patient emotion recognition system using facial expressions and brain EEG signals based on machine learning and log-sync methods. Biomed Signal Proc Contr. 91, 105942(2024).
  14. Qi, Y., Ibrayim, M., Hamdulla, A. Attention-based dual-branch network for micro-expression recognition with global-local feature fusion. 2024 IEEE Int Joint Conf Biometr (IJCB), , 1-9 (2024).
  15. Li, E. Intervention of art education on college students’ aesthetic mood based on emotion recognition algorithm. Front Art Res. 6 (9), 81-90 (2024).
  16. Liu, Z., Han, M., Wu, B., Rehman, A. Speech emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multi-task learning. Appl Acoustics. 202, 109178(2023).
  17. Xue, P., Wang, S., Bai, J., Qiang, Y. Research on bimodal emotion recognition algorithm based on multi-branch bidirectional multi-scale time perception. J Biome Eng. 42 (3), 528-536 (2025).
  18. Shioiri, S., Nagata, H., Sato, Y., Hatori, Y. Prediction of preference judgments of face images using facial expressions and eeg signals. J Vis. (9), 5063(2023).
  19. Lu, Y., Chen, J. Cross-subject EEG emotion recognition using the SSA-EMS algorithm for feature extraction. Entropy. 27 (9), 986(2025).
  20. Thapa, D., Rai, R. Freq-eer: A novel frequency-driven ensemble framework for emotion recognition and classification of eeg signals. Appl Sci. 15 (19), 10671(2025).
  21. Yang, Y., et al. Investigating of deaf emotion cognition pattern by eeg and facial expression combination. IEEE J Biomed Health Inform. 26 (2), 589-599 (2022).
  22. Tong, L., Yang, L., Wang, X., Liu, L. Self-aware face emotion accelerated recognition algorithm: A novel neural network acceleration algorithm of emotion recognition for international students. PeerJ Comput Sci. 9, e1611(2023).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Tag

Riconoscimento delle emozioni tramite EEGAnalisi delle espressioni faccialiEntropia differenzialeRete neurale convoluzionaleLSTM bidirezionaleAffective ComputingInterazione uomo-computer