L’émotion est un processus psychologique et physiologique multidimensionnel façonné par des stimuli externes, une évaluation interne et une régulation cognitive continue, et occupe donc une place centrale dans l’interaction homme-machine et les sciencescognitives 1. Dans les contextes d’exposition picturale, l’émotion médie également la relation entre les œuvres visuelles et l’interprétation du spectateur. Pour cette raison, l’identification des états émotionnels du spectateur a une valeur pratique pour l’évaluation de l’exposition, la conception spatiale et les études empiriques de l’expérienceesthétique 2. Parallèlement, la mesure de l’émotion dans des environnements d’exposition semi-naturels reste techniquement difficile car les réponses sont subtiles, transitoires et influencées à la fois par l’œuvre et le contexte de visionnage.
La recherche sur la reconnaissance des émotions s’est généralement développée selon deux grandes lignes : l’analyse comportementale et l’analyse physiologique. Les approches comportementales, en particulier l’analyse des expressions faciales basée sur la vision par ordinateur, sont largement utilisées car elles sont non invasives et relativement faciles àdéployer 3. Les modèles d’apprentissage profond tels que les réseaux résiduels et les réseaux convolutionnels légers ont montré de fortes performances dans les tâches de classification des émotions facialesde base 4. Cependant, le comportement facial lors de la visualisation peut être faible, socialement modéré ou délibérément contenu, ce qui peut réduire la correspondance entre l’expression visible et le sentimentsubjectif 5. Les approches physiologiques, en particulier celles basées sur l’électroencéphalographie (EEG), offrent un accès plus direct à l’activité neuronale associée au traitementaffectif 6. L’EEG a été largement utilisé dans les études émotionnelles car les fluctuations temporelles des signaux neuronaux sont informatives pour les changements d’état affectif, y compris les dimensions liées à la valence et à l’éveil7. Pourtant, les enregistrements EEG sont sensibles aux artefacts de mouvement, à la contamination électromyographique et au bruit environnemental, et l’EEG seul fournit souvent des informations contextuelles limitées sur ce à quoi le spectateur réagitvisuellement 8.
Ces forces et faiblesses complémentaires ont accru l’intérêt pour la reconnaissance multimodale desémotions 9. Le principe central de la fusion multimodale est que des signaux hétérogènes peuvent fournir des preuves mutuellement informatives et réduire l’ambiguïté qui surgit lorsqu’une seule modalité est interprétéeisolément 10. Dans les tâches de visualisation de peinture, par exemple, un comportement facial retenu peut encore coïncider avec des changements neuronaux mesurables associés à l’attention ou à l’engagement affectif. Cependant, les systèmes multimodaux existants ne modélisent pas toujours efficacement cette relation. Les premières stratégies de fusion basées sur la concaténation directe des caractéristiques peuvent augmenter la charge dimensionnelle et brouiller la structure temporelle spécifique àla modalité 11. Les stratégies de fusion tardive basées sur des décisions séparées sont plus faciles à mettre en œuvre, mais elles peuvent négliger des interactions fines entre les signaux visuels et physiologiques lors du traitementémotionnel 12. De plus, de nombreux modèles multimodaux utilisent des schémas de fusion fixes ou faiblement adaptatifs, qui ne conviennent pas bien aux réponses fluctuantes des spectateurs dans des contextes de typeexhibition 13.
Pour répondre à ces limitations, le protocole actuel décrit un réseau à double branchement croisé pour la reconnaissance multimodale des émotions lors de la visualisation de peinture. Dans ce cadre, les caractéristiques EEG sont traitées par un modèle de mémoire à long terme bidirectionnel réseau de neurones convolutionnel (CNN-BiLSTM), utilisé pour représenter la dynamique neuronale spatio-temporelle. Les caractéristiques vidéo faciales sont traitées par une branche MobileNetV2 à attention améliorée par coordonnées, utilisée pour capturer des indices d’expression à faible intensité tout en maintenant une efficacité decalcul 14. Les deux branches sont ensuite intégrées via un mécanisme multi-têtes d’attention croisée qui apprend la pertinence entre les modalités plutôt que de simplement concaténer leurs sorties15,16. Cette conception vise à préserver la structure spécifique à chaque modalité tout en améliorant la modélisation des interactions intermodales.
La méthode est principalement conçue pour une analyse hors ligne dans des conditions contrôlées d’acquisition de données, plutôt que pour un déploiement direct en temps réel dans des espaces d’exposition publics ouverts. Une mise en œuvre fiable nécessite une capture EEG et vidéo synchronisée, un éclairage stable, un placement contrôlé de la caméra, une impédance d’électrode acceptable et des ressources informatiques suffisantes pour l’entraînement du modèle. La performance peut aussi dépendre de la composition de l’échantillon, du type de stimulus et du degré auquel les participants modifient leur comportement parce qu’ils savent qu’ils sont enregistrés. Ces contraintes opérationnelles doivent être prises en compte lors de l’adaptation du protocole à d’autres contextes d’exposition ou populations.
Le protocole présenté ici couvre l’ensemble du pipeline expérimental, incluant l’acquisition synchronisée auprès de 327 participants, le prétraitement des données EEG et vidéo faciale, l’extraction de caractéristiques, la fusion intermodale et la classification. L’objectif est de fournir un flux de travail reproductible pour la reconnaissance multimodale des émotions dans la recherche en exposition de peinture. Au-delà du calcul affectif17, le protocole peut également soutenir l’investigation quantitative en esthétique empirique et en études psychologiques connexes18.