Research Article

Modélisation computationnelle de l’expérience utilisateur affective à l’aide de signaux physiologiques et comportementaux multimodaux

DOI:

10.3791/69823

April 7th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce protocole décrit un cadre computationnel qui modélise l’expérience utilisateur affective en intégrant des signaux physiologiques et comportementaux de manière multimodale, en utilisant des techniques d’apprentissage des caractéristiques basées sur la corrélation et de fusion multimodale. Ce protocole propose et teste un cadre de modélisation affective multimodale sur le jeu de données de référence AMIGOS.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce travail propose un protocole computationnel reproductible pour la modélisation affective multimodale utilisant des signaux physiologiques. L’objectif du protocole est de permettre la reconnaissance des émotions hors ligne en intégrant plusieurs signaux bio à l’aide d’un cadre unifié d’apprentissage profond. Le travail proposé comprend cinq étapes : collecte des données, prétraitement, alignement des caractéristiques, fusion multimodale et évaluation. Les signaux EEG, ECG et GSR provenant de données AMIGOS accessibles au public ont été utilisés comme référence expérimentale dans ce travail. Les bio-signaux étaient prétraités et normalisés pour extraire des caractéristiques spécifiques à chaque modalité. Des espaces de caractéristiques hétérogènes ont été alignés entre différentes modalités à l’aide d’une analyse profonde de corrélation canonique, suivie d’un réseau de fusion multimodal pour classifier un état affectif. Le protocole a été évalué avec des expériences hors ligne et comparé à des modèles conventionnels de fusion et de classification utilisant des métriques de performance standard telles que la précision, la précision, le rappel, le score F1 et l’AUC. Cette étude se concentre sur le développement et la validation d’un cadre computationnel pour la modélisation affective multimodale de l’expérience utilisateur plutôt que sur le déploiement d’un système interactif en temps réel. Avec une précision de 92,1 % pour la prédiction de l’état affectif UX et un score F1 de 94,2 % pour la classification valence-éveil, les résultats ont constamment surpassé les modèles de référence sur les dimensions émotionnelles. Ces résultats ont confirmé l’efficacité du flux de travail de fusion multimodal proposé pour la modélisation affective computationnelle en établissant des données physiologiques comparables.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’interaction complexe entre pensée, sentiment et action façonne la façon dont les gens pensent et agissent. L’informatique affective étudie ces relations en tirant parti des connaissances interdisciplinaires issues des neurosciences, de la psychologie et de l’intelligence artificielle pour construire des systèmes capables d’analyser, de comprendre et de réagir aux émotions humaines. Ce domaine a été de plus en plus appliqué à la communication humain–technologie en intégrant la conscience expressive dans des structures d’IA réactives, permettant à la technologie d’interagir non seulement avec les conditions intellectuelles mais aussi avec les conditions émotionnelles, aboutissant à une connaissance utilisateur plus individualisée et consciente des émotions. Une émotion, un processus mental complexe, est un reflet des perceptions humaines et joue un rôle important dans les interactionshumaines 1. Aujourd’hui, de nombreuses applications d’interaction homme-machine (IHM) nécessitent des recherches sur la reconnaissance desémotions 2. L’environnement du système HCI est dynamique et complexe. Dans la plupart des cas, il doit synchroniser ses fonctionnalités avec celles des défendeurs ; Ainsi, un contexte avec intelligence émotionnelle peut mieux s’adapter à ce type d’atmosphère. Ainsi, dans cette étude, la modélisation computationnelle de l’expérience utilisateur affective à travers des signaux physiologiques et comportementaux multimodaux estexplorée 3. Au lieu de développer ou valider un système interactif en pratique, le travail est davantage porté sur la contribution méthodologique liée à l’intégration multimodale du signal ou à l’inférence d’affect avec des contextes d’application d’immersion ou d’exposition. Afin de s’abstenir de l’étendue des concepts, ce travail se concentre sur deux concepts majeurs : la mise en œuvre d’un cadre de modélisation affective multimodale utilisant des approches computationnelles, et des techniques de fusion multimodale de données pour la combinaison de données physiologiques et comportementales. Tous les autres sujets qui émergent dans le manuscrit sont référencés pour le contexte concernant la pertinence des modèles développés.

Chaque modalité d’émotion transmet des informations différentes sur le sentiment d’une personne qui ne peuvent être tirées d’un autre système sensoriel. L’extraction d’émotions du mouvement corporel, qui implique un schéma global de mouvement corporel, a l’avantage d’identifier les sentiments non verbaux d’unepersonne 4. La parole et l’apparence faciale peuvent véhiculer des éléments indisponibles dans le mouvement corporel et les signaux corporels humains. Les humains utilisent diverses modalités émotionnelles en parallèle et en combinaison. Chaque modalité est limitée et possède ses points forts. Pour détecter correctement un sentiment, les méthodes multimodales de reconnaissance émotionnelle bénéficient peut-être d’une performance de reconnaissance supérieure à la reconnaissance unimodale. Cependant, en cas de changement émotionnel, les signaux d’expression faciale, les signaux bio/physiologiques et les signaux de parole ont tendance à apparaître plus tôt que d’autres signaux. Ainsi, la détection émotionnelle basée sur la vision par ordinateur s’intéresse principalement à l’expression émotionnellefaciale 5.

L’informatique affective a été étudiée de manière approfondie dans l’interaction enfant-robot (CRI) ; Les systèmes sensibles aux émotions modifient leur réponse en fonction des signaux physiologiques et comportementaux des utilisateurs. Ces travaux illustrent la faisabilité de la détection biophysique des émotions et de l’interaction adaptative. Cependant, pour la plupart, les systèmes CRI conçus ne conviennent qu’aux contextes structurés, orientés tâches et aux participants. Par conséquent, les systèmes CRI ont une généralisation limitée aux environnements publics dynamiques comme les expositions interactives. Leur travail souligne que les robots sensibles aux émotions sont essentiels pour renforcer la motivation, en plus de s’attaquer à certains enjeux comme la personnalisation. L’implication est un élément clé de l’interaction affective enfant-robot, car les robots réactifs émotionnellement offrent des expériences d’apprentissage plus riches et plus efficaces. L’auteur6 présente un cadre pour détecter l’engagement des utilisateurs sur la base des caractéristiques de tâches et d’interactions sociales. Ils prouvent à travers leurs résultats que l’identification des signaux affectifs, y compris les expressions faciales et le comportement social, permet aux robots d’ajuster dynamiquement leurs réponses pour améliorer l’interaction et l’engagement des utilisateurs. L’adaptation affective dans l’IRC à long terme est un défi permanent. Les auteurs de7 présentent les émotions des enfants sur une période donnée, soulignant que les robots doivent s’adapter aux schémas personnels d’émotions et aux styles d’apprentissage.

Il a également obtenu de solides performances grâce à l’EEG grâce à sa haute résolution temporelle et sa sensibilité aux états affectifs. Des travaux récents 8,9,10 utilisant des approches d’apprentissage profond ont amélioré la robustesse inter-sujets en introduisant la modélisation spatiotemporelle et des mécanismes d’attention basés sur des graphes. Cependant, la plupart des études restent unimodales, et seules quelques-unes prennent en compte les interactions perception-émotion à travers plusieurs canaux sensoriels ; ils sont donc moins applicables dans les scénarios UXimmersifs 11, 12, 13. Le modèle a été évalué sur le jeu de données, qui a montré une amélioration des performances par rapport aux techniques actuelles de pointe. L’algorithme de sélection critique dépendant de l’émotion a été proposé par les auteurs dans14, et la force, le coefficient de clusterisation et la centralité des vecteurs propres des caractéristiques fonctionnelles du réseau de connectivité EEG ont été examinés. Les auteurs de15 ont étudié un réseau unitaire récurrent profond et simple dans le but d’acquérir les caractéristiques temporelles des signaux EEG, et les résultats expérimentaux ont dépassé les travaux connexes de lalittérature 16, 17, 18, 19. Il est presque impossible de collecter un grand ensemble de données de signaux EEG, mais on peut essayer d’autres approches, comme l’approche interdisciplinaire.

Des études récentes ont réalisé des avancées significatives dans l’utilisation d’algorithmes de modélisation spatiotemporelle extrêmement avancés pour traiter la question de la classification des émotions intersujettes basée sur des signaux EEG. Cela inclut un réseau hybride spatio-temporel avec une adaptation de domaine améliorée et une attention dynamique aux graphes pour gérer la variabilité inter-sujet dans la classification des émotions à partir des signauxEEG 22. En particulier, grâce à l’utilisation de mécanismes de modélisation temporelle et de modélisation des relations cérébrales spatiales avec une attention dynamique, ils ont considérablement amélioré la performance de classification émotionnelle indépendante du sujet. Un autre effort de recherche sur ce problème inclut un réseau d’interaction isomorphe isomorphe spatiotemporal entre régionsinter-cervébrales 23. Dans cette recherche, l’accent est davantage mis sur la modélisation des invariants spatio-temporels afin d’améliorer significativement la robustesse inter-sujets pour la classification des émotions à partir des signaux EEG. Bien que ces deux contributions aient réussi à documenter des performances exceptionnelles en classification des émotions à partir de signaux purement neuronaux, elles se limitent aux signaux monomodaux et manquent d’exploration des interactions P-E multimodales. Au contraire, la recherche actuelle s’appuie sur des modèles unimodaux élargis via l’utilisation de solutions d’apprentissage profond qui lient plusieurs modalités P/E ensemble via un apprentissage profond de corrélation, offrant une solution de modélisation affective UX plus riche.

Bien que les recherches actuelles, y compris le projet sur l’interface enfant-robot expressivement consciente utilisant des informations biophysiques, aient validé le potentiel d’exploiter des signaux physiologiques multimodaux pour améliorer la reconnaissance de l’affect, elles restent limitées par des contraintes liées au domaine. En particulier, ces systèmes sont largement optimisés pour une interaction structurée et orientée tâche avec les enfants et ne peuvent pas être généralisés à des environnements plus complexes et dynamiques comme les expositions interactives. De plus, les techniques de fusion de caractéristiques utilisées dans le travail de base ne sont pas évolutives et tendent à s’appuyer sur des approches de fusion superficielles, qui ne capturent pas efficacement l’interaction complexe perception-émotion qui existe dans les environnements UX multisensoriels. De plus, l’article de référence n’utilise pas de techniques d’apprentissage profond de pointe capables d’aligner et fusionner des flux de données multimodales de haute dimension, tels que l’EEG, les expressions faciales et le suivi oculaire, sous différents stimuli environnementaux. Cela met en lumière une lacune fondamentale dans les connaissances pour créer un paradigme computationnel haute performance qui non seulement prend en compte des démographies et contextes de stimulus variés, mais capture aussi l’interaction perception-émotion grâce à l’analyse profonde de corrélation canonique (DCCA) et aux architectures de réseaux de fusion multimodaux (MMFN). Combler cet écart peut apporter une compréhension significative de l’expérience utilisateur (UX).

L’objectif principal de ce travail est de créer un système computationnel facilitant une expérience utilisateur émotionnellement adaptative dans des contextes d’exposition interactive grâce à la détection biophysique et comportementale multimodale. S’appuyant sur les principes fondamentaux de la modélisation émotionnelle issus de la recherche sur l’interaction enfant-robot et de l’informatique affective, ce cadre vise à modéliser et enregistrer les interactions perception-émotion de l’utilisateur en se basant sur des indices physiologiques et comportementaux hétérogènes tels que l’EEG, l’ECG, l’EDA, les expressions faciales et le suivi oculaire. Grâce à l’intégration de l’analyse profonde de corrélation canonique (DCCA) avec un réseau de fusion multimodal (MMFN), le système cherche à apprendre les représentations émotionnelles latentes courantes à travers les modalités et à projeter ces représentations sur les états d’expérience utilisateur affective (UX). L’architecture a pour mission de surmonter les handicaps liés à la fusion de caractéristiques peu profondes et aux modèles émotionnels contraints par l’âge en soutenant l’inférence émotionnelle contextuelle et l’intégration multisensorielle dans des environnements publics dynamiques. Enfin, ce travail vise à développer des systèmes d’exposition intelligents et affectivement sensibles plus avancés, qui répondent aux modes de retour affectif et d’interaction en temps réel des utilisateurs, et ainsi à accroître l’engagement, la satisfaction et la résonance cognitivo-émotionnelle dans les expériences culturelles numériques.

Cet article contribue à la littérature de la manière suivante : un cadre computationnel pour la modélisation affective multimodale qui prend en compte à la fois les données physiologiques et comportementales. Une approche de fusion multimodale qui facilite l’apprentissage efficace de la perception et de la représentation émotionnelle à partir de multiples sources de données. Ce travail suggéré introduit un nouveau paradigme computationnel pour améliorer l’expérience utilisateur affective (UX) grâce à la détection multimodale basée sur l’IA et à la modélisation multisensorielle de pipeline de l’interaction perception-émotion. La contribution principale est la fusion du DCCA avec le MMFN pour faciliter un fort alignement des caractéristiques et un apprentissage de représentation de haut niveau à travers des modalités hétérogènes telles que l’EEG, L’ECG, L’EDA, l’expression faciale et le suivi oculaire. Cela permet de modéliser une évaluation hors ligne précise de la perception sensorielle à des états émotionnels tels que l’intérêt, l’engagement, la surprise ou l’ennui. La validation expérimentale avec l’ensemble de données AMIGOS disponible au public montre que le modèle DCCA+MMFN développé performe mieux que les modèles de référence (par exemple, 1D-CNN, CNN-ResNet et LSTM-CNN) avec une précision moyenne de classification de 89,4 % pour les états émotionnels valence-éveil et 87,1 % pour les classes émotionnelles discrètes.

Contrairement aux études précédentes qui mettaient soit l’accent sur les participants, soit centrées sur les tâches, soit utilisaient des techniques de fusion de caractéristiques en surface, l’approche proposée propose un cadre d’apprentissage profond spécifiquement conçu pour des environnements d’exposition dynamiques et réels. Grâce à l’intégration du DCCA et d’un MMFN, ce travail fournit une méthode extensible et robuste au bruit, capable de comprendre les variations continues de perception et d’émotion dans des groupes d’utilisateurs hétérogènes. Cette fusion claire de signaux physiologiques, comportementaux et environnementaux à haute dimension est une innovation majeure pour la modélisation UX affective. Cet article présente un cadre piloté par l’IA pour modéliser les expériences affectives de l’utilisateur dans des expositions interactives en utilisant la détection multimodale et l’intégration multisensorielle. Le cadre proposé permet d’assurer un alignement robuste et une fusion de modalités hétérogènes telles que l’EEG, l’ECG, l’EDA, les expressions faciales et le suivi oculaire en combinant le DCCA avec le MMFN. Contrairement aux études précédentes limitées à des contextes centrés sur l’utilisateur ou la tâche, l’approche proposée soutient la modélisation continue des perceptions et des émotions dans des environnements publics dynamiques, constituant ainsi une avancée majeure dans la recherche en UX affective.

La création d’une approche computationnelle multimodale systématique et reproductible pour la modélisation physiologique de l’affect, qui gère méthodiquement l’alignement des caractéristiques hétérogènes avant la fusion, constitue la principale nouveauté de ce travail. Le cadre suggéré renforce l’apprentissage corrélé de la représentation entre les signaux EEG, ECG et GSR en introduisant une étape intermédiaire d’alignement latent intermodal utilisant le DCCA, contrairement aux études traditionnelles multimodales de reconnaissance émotionnelle qui reposent sur la concaténation directe des caractéristiques ou la fusion au niveau décisionnel. En garantissant la cohérence des modalités avant la classification, cette approche de fusion basée sur l’alignement améliore la généralisabilité et la robustesse à travers les dimensions affectives. La contribution est un flux de travail de bout en bout orienté benchmark, qui standardise le prétraitement, l’alignement des représentations, la fusion multimodale et l’évaluation au sein d’une seule architecture d’apprentissage profond, permettant une modélisation physiologique des émotions répétable et indépendante de la tâche, plutôt que de suggérer un seul changement algorithmique. Le cadre proposé dans cette étude est présenté comme une démonstration de faisabilité et de démonstration conceptuelle de la modélisation affective multimodale pour des expériences de type exhibition. Au lieu d’essayer de modéliser directement de réels environnements d’exposition multisensoriels, le jeu de données AMIGOS est utilisé comme un proxy de référence pour valider l’approche de modélisation dans un environnement contrôlé.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’ensemble de données AMIGOS utilisé dans cette étude est accessible au public et a été collecté avec l’approbation préalable du comité d’examen institutionnel et le consentement éclairé, comme indiqué dans la publication originale. Cette étude ne consiste qu’en une analyse secondaire de l’ensemble de données, et aucune approbation éthique supplémentaire n’a été requise.

La méthode actuelle utilise des approches d’alignement des caractéristiques et de fusion multimodale pour traiter des données physiologiques et comportementales multimodales afin de décrire les corrélations perception-émotion. Cette étude propose un modèle computationnel pour l’expérience utilisateur affective (UX) dans des expositions interactives, en tirant parti de la détection biophysique multimodale et de la modélisation émotionnelle basée sur l’IA. Basée sur les données biophysiques issues de l’article de référence, cette méthodologie numérise la modélisation computationnelle des états utilisateurs à partir de l’EEG synchronisé, de l’ECG, de l’EDA, du suivi oculaire, des expressions faciales et des entrées environnementales. Le terme « modélisation spatiale-temporelle » dans le manuscrit fait référence à la représentation physiologique spatiale multi-canal des caractéristiques et à l’alignement de corrélation intermodalité via DCCA. Temporel : encodage séquentiel via BiLSTM et préservation des dépendances temporelles au sein de fenêtres segmentées. Ces signaux diversifiés sont initialement prétraités et normalisés pour tenir compte des corrélations temporelles et spatiales entre différentes modalités. Les vecteurs de caractéristiques sont appris indépendamment pour chaque modalité, capturant des motifs liés aux émotions tels que l’excitation, l’attention et l’engagement. Pour apprendre avec succès à partir de représentations émotionnelles partagées à travers des flux de données hétérogènes, le DCCA est utilisé. Le DCCA projette chaque modalité dans un sous-espace commun latent où les caractéristiques corrélées sont maximisées, tout en conservant des informations spécifiques à chaque modalité grâce à une pertinence intermodale accrue. Ces inclusions latentes alignées sur la modalité sont ensuite transmises à un Réseau de Fusion Multimodal (MMFN) qui combine des informations temporelles et contextuelles via une BiLSTM hybride et des couches attentionnelles. Cette fusion permet au système de produire des états affectifs de haut niveau, qui se traduisent en indicateurs d’expérience utilisateur (par exemple, ennui, intérêt, inconfort). Enfin, un module de classification estime l’état UX affectif et fournit des retours pour l’adaptation à l’exposition, par exemple l’ajustement des stimuli visuels ou sonores en modélisation computationnelle. La figure 1 montre l’architecture de la méthode proposée.

Figure 1
Figure 1 : Architecture de la méthode proposée. Structure du cadre de modélisation UX proposé fusionnant des entrées multimodales, incluant EEG, ECG, EDA, expressions faciales et regard oculaire, utilisant DCCA et MMFN. Abréviations ; UX = Expérience utilisateur ; EEG = Électroencéphalographie ; ECG = Électrocardiographie ; EDA = Activité électrodermique ; DCCA = Analyse profonde de corrélation canonique ; MMFN = Réseau de fusion multimodal. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

L’architecture proposée à la Figure 1 illustre un système d’expérience utilisateur affective (UX) de bout en bout utilisant l’analyse profonde de corrélation canonique (DCCA) et un réseau de fusion multimodal (MMFN) pour la modélisation de l’interaction perception-émotion dans des expositions interactives. Le système commence par recevoir des entrées multimodales brutes comme l’EEG, l’ECG et les signaux physiologiques EDA ; les expressions faciales et les signaux comportementaux du regard oculaire ; et des entrées contextuelles comme les informations audiovisuelles et environnementales. Ces signaux sont ensuite intégrés dans un module de prétraitement et d’extraction de caractéristiques, où un traitement spécifique au signal (par exemple, suppression du bruit, normalisation, calcul de caractéristiques) est exécuté pour produire des descripteurs significatifs pour chaque modalité. Deuxièmement, le module DCCA projette des paires de modalités dans un espace latent commun et apprend des embeddings maximalement corrélés qui codent des schémas émotionnels intrinsèques à travers différentes modalités. Les caractéristiques de haute corrélation de ces multiples modules DCCA sont ensuite fusionnées par le Multimodal Fusion Network (MMFN), qui fusionne hiérarchiquement les caractéristiques apprises avec des couches d’apprentissage profond, éventuellement du BiLSTM, des mécanismes d’attention ou des transformateurs pour créer une représentation affective compacte et de haut niveau. Cette représentation intégrée est ensuite intégrée à la couche de classification des états émotionnels et UX, où le modèle prédit des résultats affectifs comme la valence, l’excitation, ou des états cognitifs/émotionnels comme l’engagement, l’ennui ou la surcharge. Une boucle de rétroaction UX adaptative est optionnellement fournie à la fin du pipeline, permettant au système de répondre de manière interactive aux états de l’utilisateur en adaptant des stimuli ou du contenu dans le contexte de l’exposition. Cette architecture évolutive et modulaire garantit une modélisation émotionnelle solide grâce à l’apprentissage de représentations conscient de la corrélation et à une intégration multimodale profonde, ce qui est extrêmement adapté à la modélisation computationnelle de l’informatique affective dans des environnements interactifs ou expérientiels.

Le choix de la fusion DCCA avec MMFN repose sur les limites actuelles des modèles standard unimodals et peu profonds. Bien que CNN-ResNet et LSTM-CNN extraient des caractéristiques temporelles ou spatiales, ils sont mal capables d’équilibrer des modalités hétérogènes comme l’EEG, l’EDA et les expressions faciales sous différentes stimulations environnementales. Le DCCA maximise la corrélation intermodale pour garantir des représentations latentes partagées, tandis que le MMFN utilise des mécanismes de fusion hiérarchique et d’attention pour mettre en avant dynamiquement les signaux les plus informatifs. Lorsqu’ils sont combinés, ces modules offrent une approche de modélisation UX affective plus fiable, compréhensible et largement applicable pour les environnements multisensoriels interactifs.

Acquisition de données
Dans le cadre modèle suggéré d’interaction perception-émotion pour les expositions interactives, l’ensemble de donnéesAMIGOS 24, accessible au public, est utilisé comme base pour des données affectives multimodales. Le jeu de données AMIGOS fournit une collection exhaustive de mesures physiologiques et comportementales provenant de participants humains subissant des stimuli évoquant l’affect, comme des extraits vidéo. Ces données contiennent des signaux EEG, ECG et GSR synchronisés, des enregistrements vidéo faciaux et des étiquettes émotionnelles auto-déclarées sous des formes discrètes (par exemple, heureuse, triste) et dimensionnelles (valence/excitation). Ces modalités correspondent bien aux besoins du système proposé ici, qui vise à déduire les états affectifs de l’expérience utilisateur (UX) lors d’interactions immersives et multisensorielles lors d’expositions. Le jeu de données comprend des enregistrements de 40 sujets, chacun exposé à des stimuli émotionnels courts (clips vidéo <150 s) et longs (films >14 min), dans des circonstances qui simulent un engagement médiatique réel. Pour le cadre de ce travail suggéré, un sous-ensemble pré-traité de l’ensemble de données est utilisé : des enregistrements de 30 sujets avec des signaux EEG, ECG et GSR de haute qualité, sans artéfacts, ainsi que des fichiers vidéo faciaux complets et des annotations. Ce sont les échantillons choisis pour imiter les dynamiques émotionnelles multimodales lors de situations d’exposition. L’ensemble de données appris sert de base d’entraînement et de benchmarking pour le pipeline DCCA + Multimodal Fusion Network (MMFN), avec des états affectifs tels que l’engagement, l’ennui, la confusion et l’excitation explorés comme réponses à des stimuli visuels, auditifs et spatiaux dans un environnement d’exposition simulé. Le tableau 1 présente la description de l’ensemble de données de la méthode proposée.

ParamètreDétails
Nom du jeu de donnéesAMIGOS (Un ensemble de données pour la recherche sur l’affect, la personnalité et l’humeur)
Non. de participants40 au total (30 utilisés dans des travaux proposés avec des données multimodales complètes)
Stimuli TypeClips vidéo courts et longs (annotés émotionnellement)
Canaux EEGCasque EEG Emotiv EPOC 14 canaux
ECGCapteur de fréquence cardiaque (pour la VRC et l’excitation)
GSRCapteur de conductance cutanée (mesure de l’activité sympathique)
Vidéo facialeVidéo frontale haute résolution pour l’analyse des expressions
Étiquettes émotionnellesValeur auto-évaluée, excitation, dominance (échelle 1–9), plus étiquettes discrètes
Taux d’échantillonnageEEG : 128 Hz, ECG/GSR : 1000 Hz
Format des données.mat et journaux horodatages synchronisés
Synchronisation des modalitésOui – Synchronisé sur tous les capteurs et la vidéo
Durée par sessionCourts extraits (<150 s) et longs films (>14 min)
Adéquation à l’applicationModélisation UX affective, fusion multimodale, cartographie perception-émotion en temps réel

Tableau 1 : Description du jeu de données AMIGOS. Description de l’ensemble de données AMIGOS utilisé dans le cadre proposé, incluant les informations sur les participants, les modalités, les taux d’échantillonnage et la conception expérimentale. Abréviations ; AMIGOS = Un ensemble de données pour la recherche sur l’affect, la personnalité et l’humeur sur les individus et les groupes.

L’ensemble de données AMIGOS accessible au public appliqué dans le cadre suggéré consiste en des données comportementales et physiologiques multimodales collectées auprès de 40 participants, dont 33 ont été choisis pour cette étude en raison de l’excellence et de la richesse des enregistrements. Le jeu de données enregistre les réactions émotionnelles aux clips vidéo courts et longs, et propose des signaux tels que l’EEG (provenant d’un casque Emotive à 14 canaux), l’ECG pour la variabilité de la fréquence cardiaque, la GSR pour la conductance cutanée, et la vidéo faciale haute résolution pour la mesure de l’expression. Les états émotionnels sont auto-déclarés à la fois dans les catégories dimensionnelles (valence, excitation, dominance) et discrètes. Les données sont bien alignées entre elles dans les modalités et sont correctement échantillonnées : 128 Hz pour l’EEG, 1000 Hz pour l’ECG et la GSR. Une telle configuration rend l’ensemble de données idéal pour modéliser l’expérience utilisateur (UX) lors d’expositions interactives, afin que les interactions perception-émotion puissent être suivies précisément grâce à la détection multimodale basée sur l’IA.

Prétraitement des données
Toutes les étapes de prétraitement, l’entraînement des modèles et les évaluations impliquées ont été implémentés dans des scripts Python personnalisés (Python 3.10, PyTorch 2.0) individuellement, chaque module étant dédié au prétraitement du signal, à l’alignement basé sur DCCA, à la formation MMFN et à l’évaluation des performances ; le réglage des paramètres clés et certaines configurations computationnelles essentielles sont résumés dans le tableau 1. Afin de traiter le jeu de données AMIGOS accessible au public pour la modélisation UX affective de l’exposition interactive, il faut initialement mettre en place un pipeline systématique de prétraitement des données sur les modalités physiologiques et comportementales telles que l’EEG, l’ECG, la GSR et la vidéo faciale. Au début, standardisez et synchronisez chaque modalité, puis effectuez un prétraitement spécifique à chaque modalité. Actuellement, les informations contextuelles ne sont obtenues que par des indices audiovisuels intrinsèques dans les stimuli vidéo, par exemple les expressions faciales, les mouvements visuels et les caractéristiques acoustiques telles que la prosodie de la parole et l’audio de fond.

Normalisation du signal et rééchantillonnage
Les signaux physiologiques bruts x(t) de toutes les modalités sont rééchantillonnés à une fréquence commune fs=128 Hz pour un alignement temporel entre différentes modalités :

Équation 1(1)

Le rééchantillonnage était effectué à l’aide d’une fonction standard de bibliothèque de traitement du signal plutôt qu’à un algorithme conçu sur mesure. Plus précisément, la mise en œuvre a été réalisée en utilisant l’utilitaire de rééchantillonnage disponible dans l’écosystème de traitement du signal Python (SciPy), qui applique une interpolation basée sur la méthode de Fourier pour convertir les signaux à la fréquence d’échantillonnage cible. Le taux d’échantillonnage cible fs a été sélectionné afin d’assurer une résolution temporelle uniforme entre les modalités avant la segmentation et l’extraction des caractéristiques. Chaque signal est ensuite normalisé par le z-score afin d’éliminer la variabilité entre sujets :

Équation 2(2)

μx et σx sont la moyenne par fenêtre d’essai et l’écart-type du signal.

Prétraitement EEG
Les signaux EEG, capturés à partir de 14 canaux, sont filtrés en passe-bande au choix de 4 à 45 Hz afin de préserver les fréquences cognitives :

Équation 3(3)

Le spectre de puissance est utilisé pour déterminer les schémas fréquentiels dans les signaux, et cela peut varier selon le type d’émotion, dans le cas du signal cérébral, et peut fournir des informations utiles sur ce signal. La technique de Welch est une technique supérieure de l’équation 3 des periodogrammes, qui fournit une estimation de la densité spectrale et peut être utilisée pour obtenir des spectrogrammes. La technique de Welch segmente le signal dans le domaine temporel en intervalles de temps discrets et construit. Un spectrogramme pour chaque segment, puis tous les spectrogrammes sont moyennés comme démontré dans l’équation 4. Ce processus est plus fluide que l’approche FFT complète, et par conséquent, il tire le maximum de puissance des signaux. Enfin, la densité spectrale de puissance (PSD)19 est calculée en utilisant la technique de Welch pour capturer les caractéristiques du domaine fréquentiel :

Équation 4(4)

Les caractéristiques PSD sont réparties sur cinq bandes : Theta (4–8 Hz), Alpha (8–13 Hz), Bêta (13–30 Hz), Gamma bas (30–45 Hz).

Traits du visage basés sur la vidéo
Extrait des unités d’action faciale (UA) et des vecteurs de regard oculaire pour chaque image vidéo à l’aide d’un jeu de données EEG multicanal ou d’un logiciel similaire, ces éléments sont ensuite combinés en séquences temporelles :

Équation 5(5)

Mappage des étiquettes d’émotion
Les scores valence-éveil ainsi que les étiquettes émotionnelles discrètes sont attribués par AMIGOS. Les notes continues sont normalisées à [0,1] :

Équation 6(6)

Où V est la valeur réellement observée avant la normalisation, Vmin est la plus petite valeur de la variable dans l’ensemble de données, Vmax est la plus grande valeur de la variable dans l’ensemble de données et V' est la valeur normalisée dans l’intervalle de 0 à 1. Ces étiquettes sont appliquées comme vérité fondamentale pour la modélisation affective supervisée. Ces étiquettes sont appliquées comme vérité fondamentale pour la modélisation affective supervisée.

Synchronisation entre modalités
Toutes les modalités sont synchronisées en utilisant l’alignement temporel ou la distorsion temporelle dynamique (DTW) lorsque cela est nécessaire :

Équation 7(7)

Les données prétraitées riches en fonctionnalités sont ensuite saisies dans le module Deep Canonical Correlation Analysis (DCCA), qui apprend les représentations maximalement corrélées entre les modalités.

Extraction de caractéristiques à l’aide de DCCA
Dans le cadre envisagé de la modélisation affective UX pour les expositions interactives, le DCCA est utilisé pour apprendre des caractéristiques latentes connectées dans des modalités hétérogènes telles que l’EEG, l’ECG, l’EDA, les expressions faciales et les données de suivi oculaire. L’objectif est d’apprendre un espace de représentation commun dans lequel les signaux provenant de diverses modalités, bien qu’individuellement bruyants ou spécifiques à chaque modalité, soient au maximum corrélés et sémantiquement cohérents en termes d’états émotionnels perçus. Dans ce travail, la DCCA a été appliquée aux paires de modalités suivantes : i) EEG–ECG, ii) EEG–GSR, et iii) représentations EEG–traits faciaux. Ces paires ont été sélectionnées afin de capturer les corrélations complémentaires neuro-physiologiques et neuro-comportementales pertinentes pour l’engagement affectif. Afin d’étendre la DCCA à un contexte multimodal, les embembardings DCCA par paires pour chaque paire de modalité ont été calculés puis fusionnés à l’aide du MMFN proposé, ce qui permet une intégration efficace de plus de deux modalités sans modifier la formulation centrale de la DCCA.

En réalisant un alignement latent guidé par la corrélation avant la fusion, le DCCA sépare structurellement l’alignement des représentations de la fusion décisionnelle, contrairement aux réseaux d’attention intermodale ou de fusion tensorielle, qui agissent directement sur des représentations potentiellement mal alignées. La redondance est réduite, et la cohérence des représentations est améliorée grâce à cette architecture à deux niveaux. De plus, le DCCA optimise directement la dépendance statistique intermodale au lieu de dépendre uniquement de fonctions de perte partagées, ce qui est plus approprié pour des données physiologiques hétérogènes que les cadres d’apprentissage multitâche. Premièrement, les DCCA20 sont utilisés pour calculer des représentations de plusieurs modalités en les traitant séquentiellement à travers plusieurs couches empilées de transformations non linéaires. La figure 2 illustre la construction du DCCA utilisée dans ce travail de recherche. Nous avons utilisé une méthode de recherche en grille pour déterminer les hyperparamètres optimaux afin d’architecturer le modèle d’apprentissage profond à utiliser dans l’approche DCCA. Après une analyse expérimentale approfondie, les auteurs ont sélectionné un optimiseur de descente de gradient stochastique, une perte d’entropie croisée et un paramètre régulateur de 1e5. Ensuite, les auteurs ont sélectionné 15 étapes d’optimisation en utilisant le vecteur de biais comme tous zéros, le jeu de validation comme critères d’arrêt précoce, et l’initialiseur Xavier comme initialiseur de poids. La figure 2 montre le processus de fonctionnement du DCCA.

Figure 2
Figure 2 : Processus de fonctionnement du DCCA. Flux de travail de processus de DCCA, montrant la correspondance des caractéristiques de diverses modalités dans un espace latent commun afin de maximiser la corrélation.
Abréviations ; DCCA = Analyse profonde de corrélation canonique. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

La Figure 2 illustre visuellement le cadre de travail interne de l’analyse de corrélation canonique profonde (DCCA) pour l’apprentissage de représentation partagée entre deux modalités différentes, EEG (Modalité A) et EDA (Modalité B). Les deux modalités sont intégrées dans leurs réseaux d’extracteurs de caractéristiques profonds respectifs (extracteur de caractéristiques A et B), qui comportent plusieurs couches cachées apprennent des caractéristiques abstraites spécifiques à chaque modalité. Avant la fusion, l’alignement latent intermodal est réalisé à l’aide de l’analyse profonde de corrélation canonique (DCCA). Deux réseaux parallèles de projection profonde sont construits pour chaque paire de modalités (EEG–ECG, EEG–EDA et EEG–Facial). Grâce à l’activation ReLU, chaque réseau de projection est composé de trois couches entièrement connectées de dimensions [256, 128, 64]. Pour l’espace latent partagé, 64 est la dimension d’immersion ultime. Avec un coefficient de régularisation L2 de 1e-5 pour garantir la stabilité numérique, la fonction objectif maximise la corrélation canonique entre les plongements de modalité projetés. Les vecteurs de polarisation sont initialisés à zéro, et les poids sont initialisés via l’initialisation de Xavier. Pour stabiliser l’apprentissage de l’alignement, les modules DCCA sont entraînés séparément avant la formation MMFN. Pour maintenir la cohérence de l’alignement, il n’y a pas de réglage fin de bout en bout entre DCCA et MMFN. Ces pipelines de réseaux neuronaux acceptent les flux de données d’entrée en parallèle mais isolés. La sortie de l’extracteur de caractéristiques de chacune d’elles est ensuite projetée dans l’espace latent commun, où les caractéristiques des deux modalités sont mappées pour devenir comparables en structure. Les projections sont optimisées selon l’objectif de la DCCA, qui est de maximiser la corrélation entre les représentations latentes correspondantes de l’EEG et de l’EDA. En acquérant ce sous-espace maximalement corrélé, la DCCA garantit que les embeddings de sortie conservent des motifs complémentaires et sémantiquement significatifs des deux modalités, essentiels pour des applications en aval telles que la reconnaissance des émotions ou l’informatique affective.

Dans ce travail, les fonctionnalités sont converties via DCCA puis intégrées pour la catégorisation. Le modèle DCCA, montré à la Figure 2, utilise un modèle d’apprentissage profond pour la transformation des caractéristiques. La couche CCA calcule la corrélation, qui est ensuite utilisée pour la combinaison et la classification des caractéristiques. Supposons que la matrice Équation 8 stocke des essais de la modalité EEG, et que la matrice Équation 9 inclut des expériences de la modalité de la vidéo faciale. Dans ce cas, les dimensions des caractéristiques dans les essais EEG et les clips vidéo faciales sont représentées respectivement par n 1 et n2, tandis que le nombre total d’essais est indiqué par l’AM. Pour chaque modalité, les auteurs ont créé le réseau de neurones profond suivant afin de réarranger les caractéristiques d’entrée de manière non linéaire :

Équation 10(8)

où les paramètres de la transformation non linéaire sont représentés par HT1 et HT2 ; les caractéristiques suivantes de chaque réseau de neurones sont représentées comme Équation 11 et Équation 12 et mesure de la caractéristique de DCCA comme n. Les paramètres appris récursivement HT1 et HT2, générés à partir de DCCA, ont accru la corrélation entre ON1 et ON 2 autant que possible :

Équation 13(9)

Les paramètres appris mutuellement tels que HT1 et HT2 étaient entraînés par l’algorithme de rétropropagation. Pour obtenir la réponse voulue, les gradients de la fonction objectif ont été approximés comme suggéré. Les caractéristiques modifiées ON1 et ON2 ∈ SP se trouvent dans la SP hyperspatiale combinée après l’entraînement des deux réseaux neuronaux. Les auteurs de DCCA principalmente20 n’ont pas spécifiquement mentionné l’utilisation de caractéristiques modifiées. Les fonctionnalités modifiées peuvent être utilisées de manière à mieux servir l’application de l’utilisateur. Dans ce travail, les auteurs ont obtenu les caractéristiques fusionnées suivantes à partir de caractéristiques modifiées :

Équation 14(10)

où α et β représentent des poids maintenant α + β = 1. Les caractéristiques ON intégrées via DCCA sont saisies dans le classificateur SoftMax. Les tâches de reconnaissance des émotions sont utilisées pour entraîner le classificateur. Comme mentionné précédemment, construire un DCCA pour la fusion de données à travers de nombreux formats présente certains avantages. Pour observer les caractéristiques et la corrélation des transformations centrées sur la modalité, par exemple, le DCCA obtient explicitement ON1 et ON2 pour chaque modalité lors de la fusion au niveau des caractéristiques. De plus, les données basées sur l’émotion peuvent être préservées en contrôlant les fonctions de mappage non linéaires f1(·) et f2(·). De plus, les auteurs utilisent des poids équivalents pour chaque modalité dans la fusion à somme pondérée. Un réseau de fusion multimodal (MMFN) qui prévoit les états de l’expérience utilisateur reçoit cet espace combiné. Pour l’alignement multimodal, une approche hiérarchique est utilisée, où les signaux bruts sont d’abord alignés temporellement avec le rééchantillonnage et l’alignement temporel, et l’alignement des signaux riches en sémantiques provenant de différentes modalités est obtenu via une analyse de corrélation canonique profonde (DCCA). Cela garantit que les représentations conscientes de la modalité sont transformées en un espace latent commun avant le processus de fusion basé sur l’attention dans le MMFN.

Réseau de fusion multimodal (MMFN) pour la modélisation UX affective
Le MMFN encode chaque modalité séparément, puis les fusionne à l’aide d’une porte de fusion et d’un mécanisme d’attention pour produire une représentation intégrée de prédiction des émotions.

Codage spécifique à la modalité
Soit x(i)Rdi le vecteur caractéristique de la i-ème modalité (par exemple, EEG, EDA). Chaque modalité est encodée avec un encodeur neuronal :

Équation 15(11)

Mécanisme de fusion par commande
Pour gérer le flux d’informations provenant de chaque modalité, une porte de fusion est utilisée :

Équation 16(12)

Équation 17(13)

σ’est la fonction d’activation sigmoïde. ⊙ caractérise le développement par élément. Cela permet au réseau de réduire le poids des modalités bruitées ou d’augmenter dynamiquement des fonctionnalités utiles.

Fusion d’attention intermodale
Une couche d’attention apprend combien de poids accorder à la représentation de chaque modalité :

Équation 18(14)

Équation 19(15)

α(i) sont les pondérationsÉquation 21d’attention la représentation finale fusionnée.

Prédiction de l’état affectif
Le vecteur fusionné est entré dans une couche de sortie pour faire des prédictions de valence/éveil ou d’états d’expérience utilisateur :

Équation 2222(16)

Équation 23 peut être utilisé pour représenter : classe émotionnelle discrète (heureuse, neutre, triste), échelle continue (valence/excitation) et catégories UX (engagé, distrait, surchargé).

Figure 3
Figure 3 : Structure du MMFN. Structure du MMFN avec encodeurs spécifiques à la modalité, fusion par porte et intégration basée sur l’attention pour la prédiction de l’état affectif.
Abréviations ; MMFN = Réseau de fusion multimodal. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

La figure 3 montre le processus de travail d’un réseau de fusion multimodal (MMFN) utilisé dans un cadre de calcul affectif pour la prédiction des émotions et de l’expérience utilisateur (UX). Des encodeurs spécifiques à chaque modalité, des couches de fusion par guichet, un module d’intégration basé sur l’attention et une tête de classification finale composent l’architecture de fusion hiérarchique du MMFN. Il illustre comment diverses modalités d’entrée hétérogènes, telles que l’EEG (Modalité A), l’EDA (Modalité B) et les expressions faciales (Modalité C), sont traitées avec leurs propres réseaux d’encodeurs spécialisés (Encodeur A, B et C). Un encodeur indépendant composé de deux couches complètement connectées avec activation ReLU traite chaque modalité (EEG, ECG, EDA et caractéristiques faciales) avant qu’une couche bidirectionnelle de mémoire à court terme (BiLSTM) ne capture les dépendances temporelles. Chaque encodeur apprend une représentation spécifique à chaque modalité qui conserve des caractéristiques émotionnelles ou physiologiques significatives issues du flux de données correspondant. Chaque direction dans la BiLSTM possède 128 unités cachées, donnant à chaque modalité un plongement contextuel de 256 dimensions. Pour éviter le surapprentissage, le dropout (taux = 0,5) est effectué après la couche BiLSTM. Une approche de fusion par porte utilisant l’activation sigmoïde pour contrôler dynamiquement les contributions des modalités est ensuite appliquée aux représentations encodées des modalités. Une couche d’auto-attention calcule ensuite les poids de l’attention entre différentes modalités pour supprimer les signaux bruyants et mettre en évidence les informations pertinentes. Une couche entièrement connectée, soit une couche de sortie linéaire pour les tâches de régression valence-éveil, soit une couche de sortie Softmax pour les tâches de classification discrète projettent la représentation fusionnée. La sortie de chaque encodeur est ensuite entrée dans une couche de fusion multimodale, qui effectue la concaténation de toutes les caractéristiques de modalité et applique un mécanisme d’attention pour mettre en évidence des signaux plus informatifs et masquer le bruit. Cette opération produit une représentation latente commune qui intègre les signaux émotionnels à travers toutes les modalités dans un vecteur dense de haut niveau.

Les couches BiLSTM appliquées aux embeddings séquentiels spécifiques à la modalité modélisent directement la dynamique temporelle. Le BiLSTM permet de modéliser contextuellement les changements affectifs en capturant à la fois les dépendances temporelles avant et arrière au sein de séquences physiologiques segmentées. De plus, la pondération adaptative des caractéristiques informatives temporelles est rendue possible par la couche de fusion basée sur l’attention qui suit, qui fonctionne sur des représentations encodées dans le temps. Les auteurs ont récemment mis à jour le texte pour rendre plus évident comment la construction de séquences, le codage récurrent et la pondération de l’attention fonctionnent ensemble pour soutenir la modélisation temporelle.

Le pseudocode proposé 1 montre le processus global de modélisation affective de l’expérience utilisateur utilisant DCCA-MMFN sous une forme reproductible. Pour commencer, des signaux physiologiques et comportementaux multimodaux sont intégrés à une étape de prétraitement indépendante impliquant la réduction du bruit et la normalisation des échelles. Les caractéristiques sont ensuite intégrées dans le DCCA, où les caractéristiques corrélées sont apprises conjointement pour des paires de modalités spécifiées, visant un alignement intermodal robuste. Les caractéristiques alignées sont ensuite combinées au sein d’un MMFN composé de mécanismes à filtres et d’attention pour une modulation spécifique à chaque modalité visant à promouvoir des modalités informatives et à supprimer le bruit. La représentation finale combinée des caractéristiques est utilisée pour entraîner un classificateur destiné à l’estimation affective et liée à l’UX, et l’évaluation globale des performances est réalisée sur la base de métriques standards. La nature étape par étape de ce pseudocode proposé garantit transparence, faisabilité et facilité de reproduction par d’autres pour toutes les personnes techniquement informées s’intéressant à ce protocole proposé.

Le cadre proposé vise à prédire l’état d’expérience utilisateur affective (UX) en utilisant des signaux physiologiques et comportementaux multimodaux issus de l’ensemble de données AMIGOS, en se basant sur les étapes suivantes : Étape 1 : Les données multimodales d’entrée consistent en EEG, ECG, EDA, regard oculaire et signaux d’expression faciale. Au départ, on accède à l’ensemble de données multimodal AMIGOS, et chaque modalité subit un prétraitement du signal, y compris le filtrage du bruit et la normalisation afin d’assurer la qualité et la cohérence des données. Étape 2 : Pour maintenir l’uniformité temporelle entre les modalités, tous les signaux sont rééchantillonnés à une fréquence standard. Par la suite, l’extraction de caractéristiques spécifiques à la modalité est effectuée afin d’obtenir des représentations distinctives correspondant à chaque type de signal. Étape 3 : Pour capturer les relations intermodales, des paires de modalités sélectionnées (EEG–ECG, EEG–EDA et EEG–Facial) sont traitées à l’aide d’une analyse de corrélation canonique profonde (DCCA). Les réseaux DCCA sont entraînés à apprendre des représentations latentes corrélées entre modalités appariées, ce qui aboutit à des plongements de caractéristiques alignés pour chaque paire de modalités. Ces représentations alignées sont ensuite combinées pour former un espace de caractéristiques multimodal unifié. Étape 4 : Les caractéristiques agrégées alignées sont fournies en entrée à un Réseau de Fusion Multimodal (MMFN), où des mécanismes d’attention et des stratégies de fusion par portes sont utilisés pour intégrer efficacement des informations complémentaires entre les modalités. Ce processus de fusion génère une représentation affective complète. Étape 5 : La représentation résultante est ensuite utilisée pour entraîner un classificateur avec des données émotionnelles identifiées afin de prédire l’état affectif de l’UX. Enfin, la performance du modèle est évaluée à l’aide de métriques standard, notamment la Précision, la Précision, le Rappel, le score F1 et l’Aire sous la courbe (AUC). L’état affectif UX prédit est rendu comme la sortie finale du cadre.

Modélisation perception-émotion utilisant le cadre DCCA-MMFN proposé
Dans le cadre computationnel suggéré pour l’expérience utilisateur affective (UX) des expositions interactives, le module de modélisation perception–émotion est le processus central qui relie les réactions perceptuelles de l’utilisateur aux stimuli environnementaux à leurs états émotionnels multimodaux dérivés de la biophysique. Ce module est basé sur les représentations courantes acquises par le DCCA de modalités physiologiques et comportementales telles que l’EEG, l’EDA, l’ECG, les expressions faciales et les mouvements oculaires afin d’enregistrer la dynamique affective de l’utilisateur. Parallèlement, des métadonnées sur l’environnement d’exposition environnant – stimuli visuels, paysages sonores, schémas d’interactivité et caractéristiques ambiantes – sont utilisées pour encoder des indices perceptuels. En utilisant un réseau de fusion multimodal (MMFN) pour combiner ces représentations multimodales, le modèle acquiert des mappages détaillés et non linéaires à partir de caractéristiques perceptuelles de stimulus et d’étiquettes ou dimensions émotionnelles (par exemple, valence, excitation, engagement). Cette cartographie permet au système de savoir en permanence comment un utilisateur réagit émotionnellement face à divers éléments de l’exposition, puis de modifier le contenu ou l’interface en conséquence pour augmenter l’engagement, la satisfaction ou la résonance cognitive. Enfin, la modélisation perception-émotion facilite l’adaptation de l’interaction consciente de l’émotion, ce qui constitue le cœur de la modélisation computationnelle et des systèmes d’exposition sensibles à l’utilisateur.

Premièrement, les modules DCCA ont été entraînés à apprendre des représentations latentes corrélées pour chaque paire de modalité. L’inclusion résultante sert d’entrée au MMFN, entraînée séquentiellement pour la tâche de prédiction affective. Aucun réglage fin de bout en bout n’est effectué pour maintenir la stabilité de l’entraînement.

CatégorieParamètreValeur / Description
Prétraitement du signalFiltre passe-bande EEG4–45 Hz
Fréquence de rééchantillonnage128 Hz
Longueur de fenêtre2 s
Chevauchement des fenêtres50%
NormalisationNormalisation du score Z
DCCA ArchitectureNombre de couches cachées3 couches par modalité
Neurones par couche128–64–32
Dimension latente (n)32
Paramètre de régularisation1 × 10⁻⁵
OptimiseurAdam
Taux d’apprentissage0.001
Taille du lot32
Époques de formation maximales150
Arrêt précoce de patience15 époques
MMFN ConfigurationType d’encodeurBiLSTM
Unités cachées64
Taux d’abandon scolaire0.3
Stratégie de fusionFusion à portes avec attention
Type d’attentionEEG, ECG, GSR, vidéo
Formation et évaluationFonction de pertePerte croisée d’entropie
Séparation train-essaiValidation croisée à 5 fois
Indicateurs d’évaluationPrécision, Précision, Rappel, F1-score, Cohen’s Kappa, AUC–ROC
Points de contrôle de reproductibilitéForme tensorielle d’entrée EEGLes canaux × échantillons temporels (par exemple, 14 × 256 par fenêtre)
Représentation des sorties DCCAImmersion latente partagée en 32 dimensions
Sortie MMFNProbabilités de classes émotionnelles (classes valence–éveil ou discrètes)
Performance de validation attenduePrécision de la classification de 85 à 90 %

Tableau 2 : Paramètres de l’algorithme DCCA–MMFN proposé. Résumé des paramètres de prétraitement, architecture, fusion, entraînement, évaluation et reproductibilité pris en compte dans le cadre de modélisation affective UX proposé. Abréviations ; DCCA = Analyse profonde de corrélation canonique ; MMFN = Réseau de fusion multimodal ; UX = Expérience utilisateur.

Dans le tableau 2, l’ensemble des paramètres utilisés dans le cadre DCCA-MMFN proposé est fourni, tenant compte du prétraitement du signal, de la conception en architecture profonde, des techniques de fusion, ainsi que des conditions d’entraînement. Les signaux physiologiques ont été uniformément rééchantillonnés et normalisés pour les synchroniser par rapport à leurs modalités respectives. La couche DCCA était configurée pour utiliser des transformations non linéaires multi-couches, ce qui aidait à l’apprentissage des espaces latents maximalement corrélés, tandis que la composante MMFN utilisait des réseaux d’encodeurs BiLSTM avec des mécanismes d’attention par porte pour peser dynamiquement la valeur des différentes modalités. Les exigences pour la formation et l’évaluation sont explicitement définies, garantissant une comparaison équitable avec les options existantes.

Le cadre suggéré est destiné à servir de base informatique pour des systèmes sensibles à l’affect qui utilisent l’information comportementale et physiologique dans plusieurs dimensions. L’architecture est conceptuellement adaptable à des environnements réels tels que les espaces d’exposition intelligents, les interfaces intelligentes adaptatives et les systèmes d’interaction homme-machine sensibles à l’affect, même si l’étude actuelle valide le modèle par des expériences contrôlées hors ligne utilisant le jeu de données AMIGOS accessible au public. Le cadre peut fonctionner comme un module fondamental pour les applications nécessitant une inférence émotionnelle fiable en proposant des techniques de fusion unifiées, un alignement inter-modal et un prétraitement structuré. Cependant, plutôt que d’être des systèmes déployés expérimentalement, ces environnements sont décrits dans cette étude comme des contextes de déploiement possibles.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Évaluation du système proposé
Pour évaluer le système proposé, il a mené des expériences sur le jeu de données AMIGOS, accessible au public, qui fournit des mesures synchronisées de l’EEG, ECG, GSR, vidéo et audio de 40 utilisateurs exposés à des stimuli émotionnellement engageants. Pour cette recherche, les auteurs ont utilisé des données provenant de 33 participants (après prétraitement et retrait des essais incomplets), ce qui a abouti à 1 320 échantillons valides sur les dimensions de valence et d...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les contextes spatiaux, environnementaux et d’interactions physiques, tels que la disposition spatiale, la densité de foule ou les conditions environnementales ambiantes, ne sont explicitement pas donnés dans l’ensemble de données AMIGOS. Ainsi, de tels facteurs ne sont pas non plus directement modélisés dans les expériences actuelles. Le cadre computationnel suggéré pour la modélisation de l’Expérience Utilisateur Affective (UX) va bien plus loin que les concepts fondamentaux de l’artic...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont aucun conflit d’intérêts.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs reconnaissent le soutien de l’École de Design Spatial et de l’École de Design Industriel de l’Université Hongik. Les auteurs remercient également les partenaires et participants de l’exposition pour leurs contributions à l’étude.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Jeu de donnéesJeu de données AMIGOS40 participants ; EEG (128 Hz), ECG (1000 Hz), GSR (1000 Hz), vidéo faciale, étiquettes auto-déclarées de valence/éveilDonnées de vérité multimodales sur le terrain pour la modélisation de l’état affectif
Capteurs physiologiquesCasque EEGEmotiv EPOC+ (14 canaux, 128 Hz)Capture de l’activité cérébrale liée à l’attention, à l’éveil et à l’engagement
Capteur ECGBiopac MP150 ou équivalent (1000 Hz)Variabilité de la fréquence cardiaque et éveil
Capteur GSR/EDAShimmer GSR+ ou équivalent (1000 Hz)La conductance cutanée comme mesure de l’excitation
Capteurs comportementauxDispositif de suivi oculaireTobii Pro X2-60 ou équivalentEnregistrement de la fixation du regard et des saccadées
Enregistrement des expressions facialesCaméra vidéo haute résolution ; analysé avec OpenFace (AU, vecteurs de regard)Extraction des unités d’action faciales (AU) et des indices de regard
Intrants environnementauxInstallation d’enregistrement audiovisuelMicrophone + Caméra (synchronisé avec les stimuli)Capturer les stimuli contextuels pendant l’exposition
Logiciels / Trousses à outilsOpenFaceBoîte à outils open source pour l’analyse du comportement facialExtraction des unités d’action (AU), direction du regard
MATLAB / Python (NumPy, SciPy, scikit-learn)Prétraitement du signal (rééchantillonnage, normalisation du score z, calcul PSD)Prétraitement des données et extraction de fonctionnalités
TensorFlowv2.13 / PyTorchv2.0Cadre d’apprentissage profond pour DCCA et MMFNMise en œuvre et entraînement du modèle
Algorithmes / ModèlesAnalyse profonde de corrélation canonique (DCCA)Méthode d’alignement non linéaire des caractéristiquesL’apprentissage corrélait les représentations latentes entre différentes modalités
Réseau de fusion multimodal (MMFN)BiLSTM + Couches de fusion basées sur l’attentionFusion hiérarchique de modalités hétérogènes pour la classification des états UX
Indicateurs d’évaluationPrécision, Précision, Rappel, F1-Score, Cohen s Kappa, AUC-ROC, Matrice de confusionImplémenté avec les métriques scikit-learn / TensorFlowÉvaluation des performances du modèle
Matériel informatiqueCluster de station de travail / GPUNVIDIA RTX 3080 (10 Go) ou équivalent, 32 Go de RAM, processeur Intel i9Entraînement et simulation de modèles

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Affective ModelingMultimodal FusionPhysiological SignalsEmotion RecognitionDeep Learning FrameworkEEG SignalsECG SignalsGSR SignalsFeature AlignmentOffline Experiments

Related Articles