Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de méthode

Réseau d’attention croisée à double branche pour l’électroencéphalographie et la reconnaissance multimodale des émotions faciales lors de la visualisation de peinture

109 vues

⸱

DOI :

10.3791/70600

⸱

12 mai 2026

Dans cet article

Résumé

Ce protocole décrit l’acquisition synchronisée de données électroencéphalographie et faciales dans des contextes de peinture-visualisation, ainsi qu’un réseau d’attention croisée à double branche pour la reconnaissance multimodale des émotions, incluant le prétraitement, la fusion des caractéristiques et la classification de quatre états émotionnels.

Résumé

La reconnaissance des émotions lors de la visualisation de la peinture reste difficile car les réponses esthétiques sont dynamiques, dépendantes du contexte, et seulement partiellement observables à travers le comportement extérieur. Les approches unimodales basées uniquement sur les expressions faciales ou uniquement sur des signaux physiologiques fournissent donc souvent des représentations incomplètes de l’expérience du spectateur. Cet article décrit une méthode reproductible pour construire un réseau d’attention croisée à double branche qui intègre la vidéo faciale avec des données d’électroencéphalographie (EEG) pour la reconnaissance multimodale des émotions dans un contexte d’exposition de peinture. Le protocole commence par la mise en place d’un environnement d’acquisition synchronisé utilisant un système EEG à 64 canaux et une caméra haute résolution pour l’enregistrement simultané lors de la visualisation de la peinture. La procédure suivante détaille le prétraitement du signal, incluant le filtrage EEG, la segmentation et l’extraction des caractéristiques d’entropie différentielle, ainsi que la détection faciale, l’alignement et la préparation des images pour l’analyse vidéo. Le réseau neuronal contient deux branches spécifiques à chaque modalité. La branche EEG utilise un réseau neuronal convolutionnel et un réseau bidirectionnel de mémoire à court terme long terme pour modéliser les caractéristiques neuronales spatio-temporelles, tandis que la branche faciale utilise un réseau convolutionnel léger à attention coordonnée pour extraire les caractéristiques d’expression visuelle. Un module d’attention croisée multi-têtes est ensuite utilisé pour fusionner les deux flux en apprenant la pertinence intermodale. Dans les conditions expérimentales rapportées ici, le cadre multimodal a atteint une précision de classification supérieure à celle des modèles de comparaison unimodals dans la reconnaissance émotionnelle à quatre catégories. Cette méthode convient particulièrement à l’analyse hors ligne dans des contextes d’acquisition contrôlée et fournit un cadre pratique pour l’informatique affective, l’esthétique empirique et la recherche sur l’interaction homme-machine orientée vers l’exposition.

Introduction

L’émotion est un processus psychologique et physiologique multidimensionnel façonné par des stimuli externes, une évaluation interne et une régulation cognitive continue, et occupe donc une place centrale dans l’interaction homme-machine et les sciencescognitives 1. Dans les contextes d’exposition picturale, l’émotion médie également la relation entre les œuvres visuelles et l’interprétation du spectateur. Pour cette raison, l’identification des états émotionnels du spectateur a une valeur pratique pour l’évaluation de l’exposition, la conception spatiale et les études empiriques de l’expérienceesthétique 2. Parallèlement, la mesure de l’émotion dans des environnements d’exposition semi-naturels reste techniquement difficile car les réponses sont subtiles, transitoires et influencées à la fois par l’œuvre et le contexte de visionnage.

La recherche sur la reconnaissance des émotions s’est généralement développée selon deux grandes lignes : l’analyse comportementale et l’analyse physiologique. Les approches comportementales, en particulier l’analyse des expressions faciales basée sur la vision par ordinateur, sont largement utilisées car elles sont non invasives et relativement faciles àdéployer 3. Les modèles d’apprentissage profond tels que les réseaux résiduels et les réseaux convolutionnels légers ont montré de fortes performances dans les tâches de classification des émotions facialesde base 4. Cependant, le comportement facial lors de la visualisation peut être faible, socialement modéré ou délibérément contenu, ce qui peut réduire la correspondance entre l’expression visible et le sentimentsubjectif 5. Les approches physiologiques, en particulier celles basées sur l’électroencéphalographie (EEG), offrent un accès plus direct à l’activité neuronale associée au traitementaffectif 6. L’EEG a été largement utilisé dans les études émotionnelles car les fluctuations temporelles des signaux neuronaux sont informatives pour les changements d’état affectif, y compris les dimensions liées à la valence et à l’éveil7. Pourtant, les enregistrements EEG sont sensibles aux artefacts de mouvement, à la contamination électromyographique et au bruit environnemental, et l’EEG seul fournit souvent des informations contextuelles limitées sur ce à quoi le spectateur réagitvisuellement 8.

Ces forces et faiblesses complémentaires ont accru l’intérêt pour la reconnaissance multimodale desémotions 9. Le principe central de la fusion multimodale est que des signaux hétérogènes peuvent fournir des preuves mutuellement informatives et réduire l’ambiguïté qui surgit lorsqu’une seule modalité est interprétéeisolément 10. Dans les tâches de visualisation de peinture, par exemple, un comportement facial retenu peut encore coïncider avec des changements neuronaux mesurables associés à l’attention ou à l’engagement affectif. Cependant, les systèmes multimodaux existants ne modélisent pas toujours efficacement cette relation. Les premières stratégies de fusion basées sur la concaténation directe des caractéristiques peuvent augmenter la charge dimensionnelle et brouiller la structure temporelle spécifique àla modalité 11. Les stratégies de fusion tardive basées sur des décisions séparées sont plus faciles à mettre en œuvre, mais elles peuvent négliger des interactions fines entre les signaux visuels et physiologiques lors du traitementémotionnel 12. De plus, de nombreux modèles multimodaux utilisent des schémas de fusion fixes ou faiblement adaptatifs, qui ne conviennent pas bien aux réponses fluctuantes des spectateurs dans des contextes de typeexhibition 13.

Pour répondre à ces limitations, le protocole actuel décrit un réseau à double branchement croisé pour la reconnaissance multimodale des émotions lors de la visualisation de peinture. Dans ce cadre, les caractéristiques EEG sont traitées par un modèle de mémoire à long terme bidirectionnel réseau de neurones convolutionnel (CNN-BiLSTM), utilisé pour représenter la dynamique neuronale spatio-temporelle. Les caractéristiques vidéo faciales sont traitées par une branche MobileNetV2 à attention améliorée par coordonnées, utilisée pour capturer des indices d’expression à faible intensité tout en maintenant une efficacité decalcul 14. Les deux branches sont ensuite intégrées via un mécanisme multi-têtes d’attention croisée qui apprend la pertinence entre les modalités plutôt que de simplement concaténer leurs sorties15,16. Cette conception vise à préserver la structure spécifique à chaque modalité tout en améliorant la modélisation des interactions intermodales.

La méthode est principalement conçue pour une analyse hors ligne dans des conditions contrôlées d’acquisition de données, plutôt que pour un déploiement direct en temps réel dans des espaces d’exposition publics ouverts. Une mise en œuvre fiable nécessite une capture EEG et vidéo synchronisée, un éclairage stable, un placement contrôlé de la caméra, une impédance d’électrode acceptable et des ressources informatiques suffisantes pour l’entraînement du modèle. La performance peut aussi dépendre de la composition de l’échantillon, du type de stimulus et du degré auquel les participants modifient leur comportement parce qu’ils savent qu’ils sont enregistrés. Ces contraintes opérationnelles doivent être prises en compte lors de l’adaptation du protocole à d’autres contextes d’exposition ou populations.

Le protocole présenté ici couvre l’ensemble du pipeline expérimental, incluant l’acquisition synchronisée auprès de 327 participants, le prétraitement des données EEG et vidéo faciale, l’extraction de caractéristiques, la fusion intermodale et la classification. L’objectif est de fournir un flux de travail reproductible pour la reconnaissance multimodale des émotions dans la recherche en exposition de peinture. Au-delà du calcul affectif17, le protocole peut également soutenir l’investigation quantitative en esthétique empirique et en études psychologiques connexes18.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Le protocole de l’étude a été examiné et approuvé par le Comité d’éthique pour la protection de la recherche humaine de l’Université normale Xingyi Minzu (Approbation n° 2600AL0621). Un consentement éclairé écrit a été obtenu de tous les participants avant leur inclusion dans l’étude et avant la collecte des données.

1. Recrutement des participants et conformité éthique

  1. Obtenir une approbation éthique
    1. Soumettez le protocole expérimental complet, le formulaire de consentement, la fiche d’information des participants et le plan de protection des données au comité d’éthique institutionnel (IRB) ou au comité d’éthique avant de commencer l’étude.
    2. Obtenez une approbation écrite et notez le numéro d’approbation dans la documentation de l’étude.
  2. Recrutement des participants
    1. Recrutez des participants adultes en bonne santé pour l’acquisition multimodale des émotions lors de la visionnerie de peinture. Dans ce protocole de démonstration, recrutez 327 participants.
    2. Appliquer les critères d’inclusion suivants : âge 18–35 ans, vision normale ou corrigée à normale, absence d’antécédents auto-déclarés de troubles neurologiques, absence d’utilisation actuelle de médicaments psychoactifs, et volonté de subir un enregistrement électroencéphalgraphique (EEG) et un enregistrement vidéo facial.
    3. Appliquer les critères d’exclusion suivants : lésion excessive du cuir chevelu ou affections dermatologiques empêchant la pose d’électrodes, impossibilité de réaliser la séance d’enregistrement complète, mouvement intense lors de l’acquisition ou documentation de consentement incomplète.
    4. Consignez les caractéristiques des participants, y compris l’âge, le sexe, la latéralité, l’expérience préalable de visionnage d’œuvres et le niveau d’éducation. Dans ce protocole de démonstration, enregistrez l’échantillon suivant : Âge moyen 24,8 ± 3,7 ans, 165 femmes et 162 hommes, tous les participants droitiers.
    5. Définir l’équilibre démographique opérationnel avant le recrutement. Dans ce protocole de démonstration, utilisez ce terme pour indiquer une répartition sexuelle approximativement équilibrée et une tranche d’âge concentrée au début de l’âge adulte afin de réduire la variance liée à l’âge dans les réponses EEG et expressions faciales.
  3. Obtenir le consentement éclairé
    1. Fournir à chaque participant un formulaire écrit de consentement éclairé décrivant l’enregistrement EEG, l’enregistrement vidéo faciale, les procédures de synchronisation, l’anonymisation, le stockage des données et le droit de se retirer à tout moment sans pénalité.
    2. Expliquez que les images faciales seront utilisées pour l’extraction des traits et que les régions oculaires seront masquées dans toutes les figures manuscrites afin de protéger l’identité des participants.
    3. Obtenez un consentement éclairé écrit avant de commencer toute procédure expérimentale.
  4. Attribution d’identifiants et anonymisation des données
    1. Attribuez à chaque participant un identifiant numérique unique pour l’étude. Stockez les fichiers EEG, fichiers vidéo et métadonnées en utilisant uniquement l’identifiant de l’étude.
    2. Stockez les formulaires de consentement identifiables séparément des données physiologiques et d’images. Utilisez des cadres faciaux dé-identifiés ou des sorties dérivées de repères faciaux pour le stockage interne de l’analyse lorsque la politique d’éthique locale l’exige.

2. Environnement expérimental et mise en place des stimulus

  1. Préparation de l’environnement de visionnage
    1. Préparez une pièce intérieure calme pour simuler un environnement contrôlé d’exposition de peinture. Maintenir une température ambiante de 22 à 24 °C et une humidité relative de 45 % à 60 %. Contrôlez le bruit de fond en dessous de 40 dB lorsque possible.
    2. Asseoir le participant dans une chaise verticale avec un support pour le dossier et positionner la chaise de façon à ce que la distance de vue entre le participant et l’affichage soit de 2,0 m.
    3. Demandez au participant de rester assis seul dans la zone d’enregistrement pendant la présentation du stimulus. N’autorisez pas d’autres participants ou observateurs à se trouver dans le champ de vision immédiat lors de la collecte des données.
  2. Configuration de l’éclairage
    1. Installez un éclairage diffus en anneau ou circulaire devant le participant pour réduire l’ombre faciale. Réglez l’éclairage à un niveau stable d’environ 500 lux au niveau du visage.
    2. Évitez les fluctuations rapides de la lumière et l’éblouissement direct sur les yeux, le front ou les joues. Point de contrôle visuel : Confirmez que tout le visage, y compris le front, les sourcils, les yeux, le nez, les joues et la région de la bouche, est visible dans l’aperçu de la caméra sans surexposition ni ombre profonde.
  3. Configuration de la présentation du stimulus visuel
    1. Présentez les stimuli visuels sur un moniteur ou un écran de projection. Dans ce protocole de démonstration, utilisez un écran à cristaux liquides de 27 pouces avec une résolution de 1 920 x 1 080 pixels et un taux de rafraîchissement de 60 Hz.
    2. Affichez les stimuli de visionnement de peinture sous forme vidéo ou diaporama selon le design de l’étude. Utilisez les mêmes règles de luminosité, de contraste et d’ordre de présentation pour tous les participants.
    3. Présentez chaque clip de peinture pendant 90 à 120 secondes. Dans ce protocole de démonstration, utilisez 6 clips, chacun d’une durée de 100 s, avec un intervalle de repos interstimulus de 20 s.
      ATTENTION : Mettez correctement tout le matériel électrique à la terre et placez l’amplificateur EEG et les câbles d’alimentation loin des sources à forte interférence afin de réduire le bruit de ligne 50/60 Hz.

3. Acquisition de données multimodales

  1. Acquisition de la vidéo faciale
    1. Placez une caméra industrielle haute définition directement devant le participant, à peu près à hauteur des yeux. Réglez la distance caméra-face à 1,2 m.
    2. Utilisez un appareil photo avec une résolution d’acquisition minimale de 1 920 x 1 080 pixels et un taux d’images de 30 images/s.
    3. Réglez l’exposition manuellement pour éviter les fluctuations d’image à image. Dans ce protocole de démonstration, utilisez une ISO 400, une vitesse d’obturation de 1/60 s et une balance des blancs fixe.
    4. Sauvegardez la vidéo au format MP4 ou AVI avec un taux d’images constant. Dans ce protocole de démonstration, enregistrez la vidéo en MP4, encodage H.264, 30 images/s.
    5. Vérifiez que le visage complet reste dans le champ de vision tout au long de la séance d’enregistrement. Point de contrôle visuel : Vérifiez que les sourcils et le front sont bien visibles. Repositionnez immédiatement la caméra si le front, la région des sourcils ou le menton est coupé.
      REMARQUE : Utilisez 30 images/s car ce taux d’images offre une résolution temporelle adéquate pour des dynamiques d’expression faciale à faible intensité tout en maintenant une charge de stockage et de traitement gérables dans l’enregistrement multimodal synchronisé.
  2. Acquisition des signaux EEG
    1. Mesurez la circonférence de la tête et sélectionnez la bonne taille de casquette pour le participant. Placez le capuchon EEG à 64 canaux selon le système international 10–20 ou une extension 64 canaux spécifiée par le fabricant.
    2. Alignez la casquette en utilisant des repères anatomiques. Positionnez Fpz sur la ligne médiane au-dessus du nasion et vérifiez la symétrie à travers les hémisphères gauche et droit.
    3. Séparer les cheveux à chaque site d’électrode et appliquer un gel conducteur pour améliorer le contact électrode-cuir chevelu.
    4. Préparez doucement le cuir chevelu aux endroits à haute impédance à l’aide d’un coton-tige ou d’un outil de préparation contondant. Ne frottez pas excessivement la peau.
    5. Connectez le condensateur à l’amplificateur EEG et effectuez la mesure de l’impédance. Réduisez l’impédance de l’électrode à moins de 10 kΩ pour tous les canaux. Dans ce protocole de démonstration, visez < 5 kΩ pour les électrodes frontales et centrales lorsque cela est possible.
    6. Réglez la fréquence d’échantillonnage à 500 Hz. Réglez la référence en ligne selon la configuration de l’amplificateur. Dans ce protocole de démonstration, utilisez une référence mastoïde liée lors de l’acquisition et effectuez une re-référence moyenne commune lors du prétraitement.
    7. Placez l’électrode de masse selon la spécification de l’amplificateur. Dans ce protocole de démonstration, placez le sol à la zone AFz. Enregistrez au moins 60 secondes de base au repos avant la présentation du stimulus.
    8. Point de contrôle visuel : Inspectez les traces EEG en direct avant de commencer l’expérience. Confirmer une activité de base stable, une faible dérive et l’absence de canaux saturés persistants ou d’artefacts majeurs de mouvement.
  3. Synchronisation des flux EEG et vidéo
    1. Connectez l’ordinateur de présentation du stimulus à l’entrée de déclenchement de l’amplificateur EEG à l’aide d’un câble de déclenchement ou boîte de déclenchement TTL (transistor-transistor).
    2. Utilisez le logiciel de présentation pour envoyer une impulsion de déclenchement TTL au début de chaque clip de peinture et une seconde impulsion TTL au décalage de chaque clip.
    3. Attribuez des codes déclencheurs uniques à chaque type d’événement. Dans ce protocole de démonstration, utilisez 11–16 pour le déclenchement du clip et 21–26 pour le décalage du clip.
    4. Enregistrez le flux de la caméra et le flux EEG simultanément d’au moins 5 secondes avant le premier déclenchement jusqu’à au moins 5 secondes après le déclenchement final. Enregistrez automatiquement la table d’heures du déclenchement dans le logiciel de stimulus.
    5. Validez la synchronisation après acquisition en faisant correspondre les horodatages de déclenchement dans l’enregistrement EEG avec les indices d’images vidéo du journal de présentation. Point de contrôle visuel : Confirmez que l’erreur d’alignement moyenne entre les horodatages de déclenchement EEG et les horodatages des images vidéo est dans ±33 ms à 30 images/s.
      REMARQUE : Si aucune interface de synchronisation matérielle et fidèle aux trames n’est disponible, exportez les journaux d’orduraps des deux systèmes et effectuez la correction d’alignement hors ligne en utilisant la correspondance de déclenchement.
  4. Données expérimentales enregistrées
    1. Instruisez le participant à regarder les peintures naturellement tout en minimisant les grands mouvements de la tête, les clignements excessifs, la parole et les caresses faciales.
    2. Présentez les extraits de peinture prédéfinis dans l’ordre choisi. Enregistrez en continu l’EEG synchronisé et la vidéo faciale tout au long de la séance de visionnage.
    3. Mettez l’expérience en pause et vérifiez à nouveau les électrodes si plus de 5 canaux dépassent le seuil d’impédance lors de l’enregistrement. Notez les interruptions, l’inconfort des participants et les problèmes techniques dans le journal de la séance.

4. Prétraitement EEG et extraction de caractéristiques

  1. Importation de données EEG brutes
    1. Importez les enregistrements EEG bruts dans l’environnement d’analyse. Dans ce protocole de démonstration, utilisez soit MATLAB R2023b avec EEGLAB 2024.0, soit Python 3.10 avec MNE 1.6.
    2. Importez les marqueurs d’événement et vérifiez que tous les déclencheurs d’apparition et de décalage du stimulus sont présents.
  2. Sous-échantillonnage des signaux EEG
    1. Réduisez l’échantillonnage des signaux de 500 Hz à 200 Hz et prétraitez-les selon le flux de travail illustré à la Figure 1.
    2. Appliquez l’anticrénelage lors du rééchantillonnage selon les paramètres par défaut du logiciel ou les paramètres de filtre définis.
  3. Filtrage des signaux EEG
    1. Appliquez un filtre passe-bande de 0,5 à 45 Hz. Appliquez un filtre à encoche à la fréquence de puissance locale si le bruit visible de ligne persiste. Dans ce protocole de démonstration, appliquez un filtre à encoche à 50 Hz.
  4. Suppression des artefacts
    1. Inspectez manuellement l’EEG continu et marquez les segments avec des artefacts de mouvement grossier.
    2. Effectuez une analyse indépendante des composants sur les données filtrées. Identifiez les composants associés aux clignements des yeux, aux mouvements horizontaux des yeux, à la tension de la mâchoire ou à l’activité musculaire en utilisant des cartes du cuir chevelu, des parcours temporels et des spectres de puissance.
    3. Retirez les composants de l’artefact identifiés et reconstruisez les signaux EEG nettoyés. Segments de rejet qui présentent encore une fluctuation d’amplitude excessive après correction indépendante par analyse des composants. Dans ce protocole de démonstration, les segments de rejet dépassant ±100 μV.
  5. Re-référencement des données
    1. Re-référez les signaux EEG nettoyés à la référence moyenne commune.
  6. Segmentation des données EEG
    1. Épouse l’EEG continu selon les déclencheurs de déclenchement du stimulus. Extraire les segments alignés sur le stimulus couvrant l’intégralité du clip ou les fenêtres d’analyse fixes. Dans ce protocole de démonstration, segmentez l’EEG en fenêtres de 2,0 s avec 50 % de chevauchement. Excluez les fenêtres avec des artefacts résiduels après segmentation.
  7. Calcul des caractéristiques d’entropie différentielle
    1. Décomposer chaque segment EEG dans les bandes de fréquences suivantes : delta (1–4 Hz), theta (4–8 Hz), alpha (8–13 Hz), bêta (13–30 Hz) et gamma (30–45 Hz).
    2. Calculez l’entropie différentielle de chaque bande de fréquence pour chaque canal. Utilisez l’équation suivante pour une variable gaussienne :
      DE = 1/2 ln(2πeσ2), où σ2 est la variance du signal EEG limité par la bande.
    3. Organiser les valeurs différentielles d’entropie canal par canal dans une matrice topographique bidimensionnelle ou une matrice canal-caractéristique pour l’entrée du modèle.
    4. Dans ce protocole de démonstration, générez des cartes de caractéristiques EEG avec une taille d’entrée de 128 × 128 x 5 par fenêtre d’analyse. Point de contrôle visuel : tracez des cartes d’entropie différentielle représentatives pour chaque bande et confirmez que les canaux manquants, les cartes à valeurs constantes ou un effondrement anormal par bande ne sont pas présents.

5. Prétraitement vidéo facial

  1. Extraction des images
    1. Décodez la vidéo enregistrée en images à l’aide d’un pipeline scripté. Extraire les trames à 25 images/s pour l’entrée du modèle tout en préservant les métadonnées de synchronisation.
  2. Détection et alignement du visage
    1. Détectez le visage dans chaque image à l’aide d’un détecteur de visages validé. Localisez les points de repère faciaux et alignez le visage en fonction des centres oculaires ou des points d’ancrage standards. Rejetez les images dans lesquelles la face n’est pas détectée de manière fiable.
  3. Recadrement et redimensionnement de la région de la face
    1. Recadrez la face à la boîte englobante détectée avec une petite marge pour préserver les informations de contour. Redimensionnez l’image de la face recadrée à 224 x 224 pixels.
    2. Inspectez les échantillons représentatifs du visage recadrés parmi les quatre catégories d’émotions cibles, comme montré à la Figure 2, et confirmez que le front, les sourcils, les yeux, le nez, les joues et la bouche restent visibles après le recadre.
  4. En complétant les images d’entraînement
    1. Appliquez des retournements horizontaux aléatoires avec une probabilité de 0,5 uniquement sur l’ensemble d’entraînement. Appliquez une rotation aléatoire dans un rayon de ±15° uniquement sur l’ensemble d’entraînement.
    2. N’appliquez pas d’augmentation aux images de validation ou de test.
  5. Normalisation de l’entrée faciale
    1. Normaliser les valeurs des pixels à la plage [-1, 1] ou utiliser la règle de normalisation spécifique au backbone de manière cohérente sur toutes les divisions.

6. Construire le réseau de neurones multimodal

  1. Configuration de l’environnement logiciel et matériel
    1. Implémentez le modèle en Python 3.10 en utilisant PyTorch 2.1. Exécutez la formation sur Ubuntu 22.04 ou un autre système d’exploitation spécifié.
    2. Utilisez un poste de travail avec au moins 32 Go de RAM, une unité de traitement graphique avec au moins 12 Go de mémoire vidéo, et un stockage local suffisant pour synchroniser les données EEG-vidéo. Dans ce protocole de démonstration, utilisez une unité de traitement graphique NVIDIA RTX 3080.
    3. Stockez le script d’entraînement, le fichier de définition du modèle, le script de prétraitement et le fichier de configuration dans un répertoire de projet contrôlé par version.
    4. Signalez le dépôt de code ou le paquet de scripts archivés dans le manuscrit si le partage est autorisé.
  2. Construction de la branche faciale
    1. Construisons le cadre multimodal double branche global comme montré à la Figure 3. Initialisez un réseau dorsale MobileNetV2 pour la branche faciale.
    2. Modifiez la première couche de convolution de 32 à 24 canaux. Construisez la branche d’extraction des traits faciaux selon la Figure 4 et insérez les modules d’attention des coordonnées après les blocs résiduels inversés sélectionnés, comme montré à la Figure 5.
    3. Remplacer les convolutions standard désignées par des convolutions parallèles en profondeur de 3 x 3 et 5 x 5 de taille de grain pour améliorer l’extraction de caractéristiques à plusieurs échelles.
    4. Exportez un vecteur de caractéristiques faciales en dimension fixe pour la fusion. Dans ce protocole de démonstration, utilisez une dimension de caractéristique de 256.
  3. Construction de la branche EEG
    1. Entrer la caractéristique d’entropie différentielle dans un encodeur de réseau de neurones convolutionnel. Utilisez les couches convolutionnelles pour extraire les motifs spatiaux des cartes de caractéristiques EEG.
    2. Introduisez la séquence de sortie convolutionnelle dans un module bidirectionnel de mémoire à court terme pour capturer la dépendance temporelle entre fenêtres.
    3. Exportez un vecteur de caractéristiques EEG de dimension fixe. Dans ce protocole de démonstration, utilisez une dimension de caractéristique de 256.
  4. Construction du module de fusion intermodale
    1. Implémentez le module d’interaction multimodale des caractéristiques illustré à la Figure 6. Implémentez un bloc d’attention croisée multi-têtes avec 8 têtes.
    2. Utilisez la séquence des caractéristiques EEG comme requête et la séquence des traits faciaux comme clé et valeur dans un flux d’attention croisée.
    3. Utilisez la séquence des traits faciaux comme requête et la séquence des caractéristiques EEG comme clé et valeur dans le flux d’attention croisée réciproque.
    4. Concatéter les sorties des deux flux d’attention croisée. Faire passer la caractéristique concaténée à travers une couche de projection de fusion.
  5. Ajout du module de convolution dilatée auto-résiduelle
    1. Affinez la représentation fusionnée avec la couche de connexion à convolution dilatée auto-résiduelle illustrée à la Figure 7.
    2. Construisons une couche de concaténation de convolution dilatée en utilisant des taux de dilatation de 1, 3, 6 et 12. Concaténéter les sorties des quatre branches de dilatation.
    3. Ajouter des connexions résiduelles de saut pour stabiliser l’écoulement du gradient et préserver les informations de niveau inférieur.
  6. Ajout du classificateur
    1. Aplatir ou regrouper la représentation fusionnée. Ajoutez une couche entièrement connectée et une couche finale de sortie softmax. Définissez les classes de sortie sur peur, bonheur, calme et tristesse.
  7. Définition des cadres d’entraînement
    1. Utilisez les paramètres réseau et d’entraînement résumés dans le tableau 1. Les quatre classes d’émotions (peur, bonheur, calme et tristesse) ont été définies opérationnellement à l’aide d’une procédure d’étiquetage combinée basée sur la conception du stimulus et l’auto-rapport des participants. Chaque extrait de peinture était présélectionné pour susciter une catégorie d’émotion cible, et les participants ont rapporté leur expérience émotionnelle dominante après l’observation. Les dernières distinctions ont été attribuées en alignant la catégorie de stimulus visée avec les réponses auto-déclarées, et les échantillons incohérents ont été exclus afin d’assurer la fiabilité de l’étiquetage.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

La performance du réseau d’attention croisée à double branche proposé a été évaluée à l’aide du jeu de données multimodal collecté auprès de 327 participants lors de l’observation de la peinture. Le principal résultat était la performance en quatre catégories de classification émotionnelle pour la peur, le bonheur, le calme et la tristesse. Des analyses supplémentaires ont examiné le comportement des modèles unimodaux, la convergence multimodale, la sensibilité au nombre de têtes d’atten...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Ce protocole aborde un problème pratique en informatique affective, à savoir comment reconnaître les états émotionnels dans des contextes de visionnage de peinture où l’expression visible et la réponse physiologique ne coïncident pas toujours à chaque instant. Dans les conditions expérimentales présentées ici, le cadre à double branche a obtenu une performance de classification supérieure à celle des modèles de comparaison unimodals, ce qui soutient la valeur de combiner l’électroencépha...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs déclarent ne pas exister de conflit d’intérêts.

Remerciements

Nous exprimons notre sincère gratitude aux bénévoles de l’Université normale Minzu de Xingyi et de l’Université du Sud-Ouest pour leur participation aux expériences. Nous remercions également le personnel technique de l’Université de Gérone pour son aide dans l’acquisition des données EEG et les évaluateurs anonymes pour leurs commentaires éclairants.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Cadre d’apprentissage profondPyTorchv2.0 / https://pytorch.orgUtilisé pour la construction, l’entraînement et l’évaluation de modèles
Système d’acquisition EEG (64 canaux)Brain Products GmbHactiCHamp Plus / v1.6Utilisé pour l’acquisition de signaux EEG à haute résolution lors d’expériences
Capsule d’électrode EEG (10&ndash ; 20)Brain Products GmbHActiCap / 64 canauxStandard international 10&ndash ; Placement des 20 électrodes
Caméra haute définitionSony CorporationCapteur IMX327Utilisé pour l’enregistrement vidéo d’expressions faciales (&ge ; 1080p, 30 fps)

Références

  1. Yang, Y., et al. A dual-stream regional feature learning and adaptive fusion method for electroencephalogram-based emotion recognition. Eng Appl Artificial Intell. 164, 113250(2026).
  2. Li, C., Pun, S. H., Li, J. W., Chen, F. Eeg-based emotion recognition using graph attention network with dual-branch attention module. 2024 46th Ann Int Conf IEEE Eng Me Biol Soc (EMBC), , 1-4 (2024).
  3. Ubillús, J. A. T., et al. Algorithms used for facial emotion recognition: A systematic review of the literature. EAI Endorsed Transact Pervasive Health Technol. 9, 1-17 (2023).
  4. Xu, Y., Cheng, L. Face emotion recognition based on gabor wavelet and particle swarm optimization algorithm. Multimed Syst. 31 (6), 435(2025).
  5. Dube, D. Y., Sannasi, M. V., Kyritsis, M., Gulliver, S. R. Facial emotion recognition from feature loss media: Human versus machine learning algorithms. Comp Human Behav. 174, 108806(2026).
  6. Manuel, M. T. J., Medina-DeVilliers, S., Clarkson, T., Lerner, M. D., Riccardi, G. Evaluation of interpretability for deep learning algorithms in EEG emotion recognition: A case study in autism. Artif Intell Med. 143, 102545(2023).
  7. Watanabe, A., Yamazaki, T. Representation of the brain network by electroencephalograms during facial expressions. J Neurosci Meth. 357, 109158(2021).
  8. Prakash, A., Poulose, A. Electroencephalogram-based emotion recognition: A comparative analysis of supervised machine learning algorithms. Data Sci Manag. 8 (3), 342-360 (2025).
  9. Sun, Y., Ayaz, H., Akansu, A. N. Multimodal affective state assessment using fnirs + eeg and spontaneous facial expression. Brain Sci. 10 (2), 85(2020).
  10. Huang, Y., Yang, J., Liu, S., Pan, J. Combining facial expressions and electroencephalography to enhance emotion recognition. Future Internet. 11 (5), 105(2019).
  11. Han, Q., et al. A multi-branch electroencephalogram emotion recognition framework based on cross-subject or cross-session multi-perspective representation fusion. Neurocomputing. 658, 131767(2025).
  12. Wang, L., Chang, Y., Wang, K. Dual-branch multimodal fusion network for driver facial emotion recognition. Appl Sci. 14 (20), 9430(2024).
  13. Mutawa, A. M., Hassouneh, A. Multimodal real-time patient emotion recognition system using facial expressions and brain EEG signals based on machine learning and log-sync methods. Biomed Signal Proc Contr. 91, 105942(2024).
  14. Qi, Y., Ibrayim, M., Hamdulla, A. Attention-based dual-branch network for micro-expression recognition with global-local feature fusion. 2024 IEEE Int Joint Conf Biometr (IJCB), , 1-9 (2024).
  15. Li, E. Intervention of art education on college students’ aesthetic mood based on emotion recognition algorithm. Front Art Res. 6 (9), 81-90 (2024).
  16. Liu, Z., Han, M., Wu, B., Rehman, A. Speech emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multi-task learning. Appl Acoustics. 202, 109178(2023).
  17. Xue, P., Wang, S., Bai, J., Qiang, Y. Research on bimodal emotion recognition algorithm based on multi-branch bidirectional multi-scale time perception. J Biome Eng. 42 (3), 528-536 (2025).
  18. Shioiri, S., Nagata, H., Sato, Y., Hatori, Y. Prediction of preference judgments of face images using facial expressions and eeg signals. J Vis. (9), 5063(2023).
  19. Lu, Y., Chen, J. Cross-subject EEG emotion recognition using the SSA-EMS algorithm for feature extraction. Entropy. 27 (9), 986(2025).
  20. Thapa, D., Rai, R. Freq-eer: A novel frequency-driven ensemble framework for emotion recognition and classification of eeg signals. Appl Sci. 15 (19), 10671(2025).
  21. Yang, Y., et al. Investigating of deaf emotion cognition pattern by eeg and facial expression combination. IEEE J Biomed Health Inform. 26 (2), 589-599 (2022).
  22. Tong, L., Yang, L., Wang, X., Liu, L. Self-aware face emotion accelerated recognition algorithm: A novel neural network acceleration algorithm of emotion recognition for international students. PeerJ Comput Sci. 9, e1611(2023).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Étiquettes

Reconnaissance des émotions par EEGanalyse des expressions facialesentropie différentielleréseau de neurones convolutionnelsLSTM bidirectionnelinformatique affectiveinteraction homme-machine