$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El conjunto de datos AMIGOS utilizado en este estudio es de acceso público y fue recopilado con la aprobación previa del comité de revisión institucional y consentimiento informado, según se informó en la publicación original. Este estudio implica únicamente un análisis secundario del conjunto de datos, y no se requirió ninguna aprobación ética adicional.
El método actual utiliza enfoques de alineación de características y fusión multimodal para manejar datos fisiológicos y conductuales multimodales con el fin de describir las correlaciones percepción–emoción. Este estudio propone un modelo computacional para la experiencia de usuario afectiva (UX) en exposiciones interactivas, aprovechando la detección biofísica multimodal y la modelización emocional basada en IA. Basada en datos biofísicos del artículo base, esta metodología digitaliza el modelado computacional de los estados del usuario a partir de EEG sincronizados, ECG, EDA, seguimiento ocular, expresiones faciales y entradas ambientales. El término "modelado espacio-temporal" en el manuscrito se refiere a la representación fisiológica espacial multicanal de características y a la correlación intermodal mediante DCCA. Temporal: codificación secuencial mediante BiLSTM y preservación de dependencias temporales dentro de ventanas segmentadas. Estas diversas señales se preprocesan y normalizan inicialmente para tener en cuenta las correlaciones temporales y espaciales entre modalidades. Los vectores de características se aprenden de forma independiente para cada modalidad, capturando patrones relacionados con la emoción como excitación, atención y compromiso. Para aprender con éxito a partir de representaciones emocionales compartidas a través de flujos de datos heterogéneos, se utiliza DCCA. DCCA proyecta cada modalidad en un subespacio común latente donde se maximizan las características correlacionadas, mientras se conserva información específica de la modalidad mediante una relevancia cruzada entre modales aumentadas. Estas incrustaciones latentes alineadas con modalidades se pasan luego a una Red de Fusión Multimodal (MMFN) que combina información temporal y contextual mediante una biLSTM híbrida y capas de atención. Esta fusión permite al sistema producir estados afectivos de alto nivel, que se traducen en indicadores de experiencia del usuario (por ejemplo, aburrimiento, interés, incomodidad). Por último, un módulo de clasificación estima el estado afectivo de la experiencia de usuario y proporciona retroalimentación para la adaptación a la exhibición, por ejemplo, ajustando estímulos visuales o auditivos en modelado computacional. La Figura 1 muestra la arquitectura del método propuesto.

Figura 1: Arquitectura del método propuesto. Estructura del marco de modelado UX propuesto que fusiona entradas multimodales, incluyendo EEG, ECG, EDA, expresiones faciales y mirada ocular, utilizando DCCA y MMFN. Abreviaturas; UX = Experiencia de usuario; EEG = Electroencefalografía; ECG = Electrocardiografía; EDA = Actividad Electrodérmica; DCCA = Análisis Profundo de Correlación Canónica; MMFN = Red de fusión multimodal. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
La arquitectura propuesta en la Figura 1 ilustra un sistema de experiencia de usuario afectiva (UX) de extremo a extremo que utiliza Deep Canonical Correlation Analysis (DCCA) y una Red de Fusión Multimodal (MMFN) para el modelado de interacción percepción-emoción en exposiciones interactivas. El sistema comienza recibiendo entradas multimodales en bruto como EEG, ECG y señales fisiológicas EDA; las expresiones faciales y las señales de comportamiento de la mirada ocular; y entradas contextuales como información audiovisual y ambiental. Estas señales se introducen luego en un módulo de preprocesamiento y extracción de características, donde se ejecuta procesamiento específico de la señal (por ejemplo, eliminación de ruido, normalización, cálculo de características) para producir descriptores significativos para cada modalidad. En segundo lugar, el módulo DCCA proyecta pares de modalidades en un espacio latente común y aprende incrustaciones maximamente correlacionadas que codifican patrones emocionales intrínsecos entre modalidades. Las características de alta correlación de estos múltiples módulos DCCA se fusionan posteriormente mediante la Red de Fusión Multimodal (MMFN), que fusiona jerárquicamente las características aprendidas con capas de aprendizaje profundo, posiblemente BiLSTM, mecanismos de atención o transformadores para crear una representación afectiva compacta y de alto nivel. Esta representación integrada se introduce entonces en la capa de clasificación de estados de emociones y UX, en la que el modelo predice resultados afectivos como la valencia, la excitación o estados cognitivos/emocionales como el engagement, el aburrimiento o la sobrecarga. Opcionalmente, se proporciona un bucle de retroalimentación adaptativa de UX al terminar la canalización, permitiendo al sistema responder de forma interactiva a los estados del usuario adaptando estímulos o contenido en el contexto de la exposición. Esta arquitectura escalable y modular garantiza un modelado fuerte de las emociones mediante el aprendizaje de representaciones consciente de la correlación y la integración multimodal profunda, lo cual es extremadamente adecuado para el modelado computacional computacional de la computación afectiva en entornos interactivos o experienciales.
La selección de la fusión de DCCA con MMFN se basa en las limitaciones actuales de los modelos estándar unimodales y de fusión superficial. Aunque CNN-ResNet y LSTM-CNN extraen características temporales o espaciales, son pobres para equilibrar modalidades heterogéneas como EEG, EDA y expresiones faciales bajo diferentes estimulaciones ambientales. DCCA maximiza la correlación entre modales para asegurar representaciones latentes compartidas, mientras que MMFN utiliza mecanismos jerárquicos de fusión y atención para resaltar dinámicamente las señales más informativas. Cuando se combinan, estos módulos ofrecen un enfoque de modelado UX afectivo más fiable, comprensible y ampliamente aplicable para entornos multisensoriales interactivos.
Adquisición de datos
En el marco modelo sugerido de interacción percepción-emoción para exposiciones interactivas, el conjunto de datosAMIGOS 24, disponible públicamente, se utiliza como base para datos afectivos multimodales. El conjunto de datos AMIGOS ofrece una colección exhaustiva de medidas fisiológicas y conductuales de participantes humanos que experimentan estímulos que evocan el afecto, como clips de vídeo. Estos datos contienen señales sincronizadas de EEG, ECG y GSR, grabaciones de vídeo facial y etiquetas emocionales autoinformadas en formas discretas (por ejemplo, felices, tristes) y dimensionales (valencia/excitación). Estas modalidades se alinean bien con las necesidades del sistema aquí propuesto, que pretende inferir estados de experiencia de usuario afectiva (UX) durante interacciones inmersivas y multisensoriales en exhibiciones. El conjunto de datos incluye grabaciones de 40 sujetos, cada uno expuesto tanto a estímulos cortos (clips de vídeo <150 s) como largos (películas >14 min) que inducen emociones, en circunstancias que simulan la interacción real con los medios. Para el alcance de este trabajo sugerido, se emplea un subconjunto preprocesado del conjunto de datos: registros de 30 sujetos con señales EEG, ECG y GSR de alta calidad y libres de artefactos, así como archivos completos de vídeo facial y anotaciones. Estas son las muestras seleccionadas para imitar dinámicas emocionales multimodales durante situaciones basadas en exposiciones. El conjunto de datos aprendido es una base de entrenamiento y benchmarking para la cadena DCCA + Multimodal Fusion Network (MMFN), donde se exploran estados afectivos como el compromiso, el aburrimiento, la confusión y la excitación como respuestas a estímulos visuales, auditivos y espaciales en un entorno de exhibición simulada. La Tabla 1 muestra la descripción del conjunto de datos del método propuesto.
| Parámetro | Detalles |
| Nombre del conjunto de datos | AMIGOS (Un conjunto de datos para la investigación del afecto, la personalidad y el estado de ánimo) |
| No. de participantes | 40 en total (30 utilizados en trabajos propuestos con datos multimodales completos) |
| Tipo de estímulo | Clips de vídeo cortos y largos (anotados emocionalmente) |
| Canales EEG | Casco EEG Emotiv EPOC de 14 canales |
| ECG | Sensor de frecuencia cardíaca (para HRV y excitación) |
| GSR | Sensor de conductancia cutánea (midiendo la actividad simpática) |
| Vídeo facial | Vídeo frontal facial de alta resolución para análisis de expresiones |
| Etiquetas de Emoción | Valencia, activación, dominancia autoevaluadas (escala 1–9), además de etiquetas discretas |
| Frecuencia de muestreo | EEG: 128Hz, ECG/GSR: 1000Hz |
| Formato de datos | .mat y registros sincronizados de marcas de tiempo |
| Sincronización de modalidades | Sí – Sincronizado entre todos los sensores y vídeo |
| Duración por sesión | Clips cortos (<150 s) y películas largas (>14 min) |
| Ajuste a la aplicación | Modelado UX afectivo, fusión multimodal, mapeo percepción-emoción en tiempo real |
Tabla 1: Descripción del conjunto de datos AMIGOS. Descripción del conjunto de datos AMIGOS utilizado en el marco propuesto, incluyendo información sobre los participantes, modalidades, tasas de muestreo y diseño experimental. Abreviaturas; AMIGOS = Un conjunto de datos para la investigación de afecto, personalidad y estado de ánimo en individuos y grupos.
El conjunto de datos AMIGOS disponible públicamente aplicado en el marco sugerido consiste en datos multimodales conductuales y fisiológicos recogidos de 40 participantes, de los cuales 33 fueron seleccionados para este estudio en función de la excelencia y plenitud de las grabaciones. El conjunto de datos registra reacciones emocionales a clips de vídeo cortos y largos, e incluye señales como EEG (de un auricular Emotive de 14 canales), ECG para variabilidad de la frecuencia cardíaca, GSR para conductancia cutánea y vídeo facial de alta resolución para medición de expresiones. Los estados emocionales se autoinforman tanto en categorías dimensionales (valencia, excitación, dominancia) como discretas. Los datos están bien alineados entre sí en las modalidades y se muestrean adecuadamente: 128Hz para EEG, 1000Hz para ECG y GSR. Esta configuración hace que el conjunto de datos sea ideal para modelar la experiencia del usuario (UX) en exposiciones interactivas, de modo que las interacciones percepción-emoción puedan ser rastreadas con precisión mediante la detección multimodal basada en IA.
Preprocesamiento de datos
Todos los pasos de preprocesamiento, entrenamiento de modelos y evaluaciones implicados se implementaron en scripts Python personalizados (Python 3.10, PyTorch 2.0) de forma individual, con cada módulo para preprocesamiento de señales, alineación basada en DCCA, entrenamiento MMFN y evaluación del rendimiento; la configuración de parámetros clave y algunas configuraciones computacionales esenciales se resumen en la Tabla 1. Para procesar el conjunto de datos AMIGOS disponible públicamente para el modelado UX afectivo de exhibiciones interactivas, se implementa inicialmente una cadena sistemática de preprocesamiento de datos sobre modalidades fisiológicas y conductuales como EEG, ECG, GSR y vídeo facial. Al principio, estandariza y sincroniza cada modalidad, y luego realiza el preprocesamiento específico de cada modalidad. Actualmente, la información contextual se obtiene únicamente a partir de pistas audiovisuales intrínsecas dentro de los estímulos de vídeo, por ejemplo, expresiones faciales, patrones de movimiento visual y características acústicas como la prosodia del habla y el audio de fondo.
Normalización de señales y remuestreo
Las señales fisiológicas brutas x(t) de todas las modalidades se remuestrean a una frecuencia común fs=128 Hz para alineación temporal entre modalidades:
(1)
El remuestreo se realizaba utilizando una función estándar de biblioteca de procesamiento de señales en lugar de un algoritmo diseñado a medida. Específicamente, la implementación se llevó a cabo utilizando la utilidad de remuestreo disponible en el ecosistema de procesamiento de señales de Python (SciPy), que aplica interpolación basada en el método de Fourier para convertir señales a la frecuencia de muestreo objetivo. Se seleccionó la tasa de muestreo objetivo fs para asegurar una resolución temporal uniforme entre modalidades antes de la segmentación y la extracción de características. Posteriormente, cada señal se normaliza con puntuación z para eliminar la variabilidad entre sujetos:
(2)
donde μx y σx son la media de la ventana de prueba y la desviación estándar de la señal.
Preprocesamiento EEG
Las señales EEG, capturadas de 14 canales, están filtradas pasa-banda eligiendo entre 4 y 45 Hz para preservar frecuencias cognitivas:
(3)
El espectro de potencia se emplea para determinar patrones de frecuencia en señales, y esto puede variar según el tipo de emoción, en el caso de la señal cerebral, y puede proporcionar información útil sobre dicha señal. La técnica de Welch es una técnica superior de periodogramas ecuación 3, que proporciona una estimación de la densidad espectral y puede emplearse para obtener espectrogramas. La técnica de Welch segmenta la señal en el dominio del tiempo en intervalos discretos de tiempo y construye. Un espectrograma para cada segmento, luego se promedian todos los espectrogramas como se muestra en la ecuación 4. Este proceso es más fluido en comparación con el enfoque FFT completo y, por tanto, obtiene la máxima potencia de las señales. Finalmente, la Densidad Espectral de Potencia (PSD)19 se calcula utilizando la técnica de Welch para capturar características del dominio de la frecuencia:
(4)
Las características PSD se suman en cinco bandas: Theta (4–8 Hz), Alfa (8–13 Hz), Beta (13–30 Hz), Gamma Bajo (30–45 Hz).
Rasgos faciales basados en vídeo
Extraer Unidades de Acción Facial (UA) y vectores de mirada ocular para cada fotograma de vídeo usando un conjunto de datos de EEG multicanal o software similar, estos se combinan posteriormente como secuencias temporales:
(5)
Mapeo de etiquetas emocionales
Tanto las puntuaciones de valencia-activación como las etiquetas de emoción discretas son proporcionadas por AMIGOS. Las calificaciones continuas se normalizan a [0,1]:
(6)
Donde V es el valor observado real antes de la normalización, Vmin es el valor más pequeño de la variable en el conjunto de datos, Vmax es el valor más grande de la variable en el conjunto de datos y V' es el valor normalizado en el rango de 0 a 1. Estas etiquetas se aplican como fundamento para el modelado supervisado del afecto. Estas etiquetas se aplican como fundamento para el modelado supervisado del afecto.
Sincronización entre modalidades
Todas las modalidades se sincronizan usando alineación de marcas de tiempo o distorsión temporal dinámica (DTW) cuando es necesario:
(7)
Los datos preprocesados y ricos en características se introducen luego en el módulo de Análisis de Correlación Canónica Profunda (DCCA), que aprende representaciones maximamente correlacionadas entre modalidades.
Extracción de características usando DCCA
En el marco previsto del modelado afectivo de UX para exposiciones interactivas, el DCCA se utiliza para aprender características latentes conectadas en modalidades heterogéneas como EEG, ECG, EDA, expresiones faciales y datos de seguimiento ocular. El objetivo es aprender un espacio de representación común en el que las señales de diversas modalidades, aunque individualmente ruidosas o específicas de cada modalidad, estén al máximo correlacionadas y semánticamente consistentes en términos de estados emocionales percibidos. En este trabajo, la DCCA se aplicó a los siguientes pares de modalidades: i) EEG–ECG, ii) EEG–GSR y iii) representaciones EEG–rasgos faciales. Estos pares se seleccionaron para capturar correlaciones complementarias neural-fisiológicas y neural-conductuales relevantes para el compromiso afectivo. Para extender el DCCA a un entorno multimodal, se calcularon y luego fusionaron las incrustaciones por pares de DCCA para cada par de modalidades utilizando el MMFN propuesto, lo que permite una integración eficiente de más de dos modalidades sin alterar la formulación central de DCCA.
Al realizar un alineamiento latente impulsado por correlación antes de la fusión, DCCA separa estructuralmente el alineamiento de representaciones de la fusión de decisión, en contraste con las Redes de Atención Cross-Modal o Fusión Tensorial, que actúan directamente sobre representaciones posiblemente desalineadas. La redundancia disminuye y la coherencia de las representaciones mejora gracias a esta arquitectura de dos etapas. Además, DCCA optimiza directamente la dependencia estadística intermodal en lugar de depender solo de funciones de pérdida compartidas, lo cual es más adecuado para datos fisiológicos heterogéneos que los marcos de aprendizaje multitarea. Primero, DCCA20 se utilizan para calcular representaciones de varias modalidades tratándolas secuencialmente a través de múltiples capas apiladas de transformaciones no lineales. La Figura 2 ilustra la construcción del DCCA empleado en este trabajo de investigación. Utilizamos un método de búsqueda en cuadrícula para determinar los hiperparámetros óptimos para diseñar el modelo de aprendizaje profundo que se utilizará en el enfoque DCCA. Tras un análisis experimental exhaustivo, los autores seleccionaron un optimizador de descenso de gradiente estocástico, pérdida cruzada de entropía y un parámetro regulador de 1e5. A continuación, los autores seleccionaron 15 pasos de optimización usando el vector de sesgo como ceros, el conjunto de validación como criterios de parada temprana y el inicializador Xavier como inicializador de peso. La Figura 2 muestra el proceso de funcionamiento de DCCA.

Figura 2: Proceso de funcionamiento de DCCA. Flujo de trabajo de procesos de DCCA, mostrando la correspondencia de características de diversas modalidades en un espacio latente común para maximizar la correlación.
Abreviaturas; DCCA = Análisis de Correlación Canónica Profunda. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
La Figura 2 muestra visualmente el marco interno de trabajo del Análisis de Correlación Canónica Profunda (DCCA) para el aprendizaje de representación compartida entre dos modalidades diferentes, EEG (Modalidad A) y EDA (Modalidad B). Ambas modalidades se alimentan en sus respectivas redes profundas de extractores de características (Extractor de Características A y B), que tienen varias capas ocultas que aprenden características abstractas específicas de cada modalidad. Antes de la fusión, el alineamiento latente cruzado se realiza mediante Análisis de Correlación Canónica Profunda (DCCA). Se construyen dos redes paralelas de proyección profunda para cada par de modalidades (EEG–ECG, EEG–EDA y EEG–Facial). Usando la activación de ReLU, cada red de proyección está compuesta por tres capas completamente conectadas con dimensiones [256, 128, 64]. Para el espacio latente compartido, 64 es la dimensión última de incrustación. Con un coeficiente de regularización L2 de 1e-5 para garantizar la estabilidad numérica, la función objetivo maximiza la correlación canónica entre las incrustaciones de modalidad proyectadas. Los vectores de sesgo se inicializan a cero y los pesos se inicializan mediante la inicialización de Xavier. Para estabilizar el aprendizaje de alineación, los módulos DCCA se entrenan por separado antes del entrenamiento MMFN. Para mantener la consistencia de la alineación, no existe un ajuste fino de extremo a extremo entre DCCA y MMFN. Estas canaletas de redes neuronales aceptan los flujos de datos de entrada en paralelo pero de forma aislada. La salida del extractor de características de cada una de ellas se proyecta entonces en el espacio latente común, donde las características de ambas modalidades se mapean para que sean comparables en estructura. Las proyecciones se optimizan según el objetivo de DCCA, que es maximizar la correlación entre las representaciones latentes correspondientes del EEG y el EDA. Al adquirir este subespacio maximamente correlacionado, DCCA garantiza que las incrustaciones de salida mantengan patrones complementarios y semánticamente significativos de ambas modalidades, que son esenciales para aplicaciones posteriores como el reconocimiento emocional o la computación afectiva.
En este trabajo, las características se convierten usando DCCA y luego se integran para la categorización. El modelo DCCA, mostrado en la Figura 2, utiliza un modelo de aprendizaje profundo para la transformación de características. La capa CCA calcula la correlación, que luego se utiliza para combinar y clasificar características. Supongamos que la matriz
almacena ensayos de la modalidad EEG, y la matriz
incluye experimentos de la modalidad de vídeo de caras. En este caso, las dimensiones de las características en los ensayos EEG y los clips de vídeo facial se representan con n1 y n2, respectivamente, mientras que el número total de ensayos se indica con la AM. Para cada modalidad, los autores crearon la siguiente red neuronal profunda para reorganizar las características de entrada de forma no lineal:
(8)
donde los parámetros de la transformación no lineal se representan como HT1 y HT2; las características posteriores de cada red neuronal se representan como
y
y medición de la característica de DCCA como n. Los parámetros aprendidos recursivamente HT1 y HT2, generados a partir de DCCA, han incrementado la correlación entre ON1 y ON 2 a un nivel tanto como ha sido posible:
(9)
Los parámetros mutuamente aprendidos como HT1 y HT2 fueron entrenados por el algoritmo de retropropagación. Para obtener la respuesta deseada, se aproximaron los gradientes de la función objetivo según lo sugerido. Las características alteradas ON1 y ON2 ∈ SP están en la SP combinada del hiperespacio después de que las dos redes neuronales hayan sido entrenadas. Los autores de DCCA principalmente20 no mencionaron específicamente el uso de características alteradas. Las funciones modificadas pueden utilizarse de la manera que mejor sirva a la aplicación del usuario. En este trabajo, los autores obtuvieron las siguientes características fusionadas a partir de características alteradas:
(10)
donde α y β representan pesos que mantienen α + β = 1. Las características ON integradas mediante DCCA se introducen en el clasificador SoftMax. Las tareas de reconocimiento emocional se utilizan para entrenar al clasificador. Como se mencionó antes, construir DCCA para la fusión de datos en varios formatos tiene algunas vantas. Para observar las características y correlación de las transformaciones centradas en modalidad, por ejemplo, DCCA obtiene explícitamente ON1 y ON2 para cada modalidad en la fusión a nivel de características. Además, los datos basados en emociones pueden preservarse controlando las funciones de mapeo no lineales f1(·) y f2(·). Además, los autores están utilizando pesos equivalentes para cada modalidad en la fusión de suma ponderada. Una Red de Fusión Multimodal (MMFN) que prevé los estados de experiencia del usuario recibe este espacio combinado. Para el alineamiento multimodal, se utiliza un enfoque jerárquico, donde las señales en bruto se alinean temporalmente primero con el remuestreo y el alineamiento de marcas de tiempo, y el alineamiento de las señales semánticamente ricas de diversas modalidades se obtiene mediante Análisis de Correlación Canónica Profunda (DCCA). Esto asegura que las representaciones conscientes de la modalidad se transformen en un espacio latente común antes del proceso de fusión basado en la atención en el MMFN.
Red de fusión multimodal (MMFN) para modelado UX afectivo
El MMFN codifica cada modalidad por separado y luego las fusiona usando una puerta de fusión y un mecanismo de atención para generar una representación integrada para la predicción emocional.
Codificación específica por modalidad
Sea x(i)∈R di el vector característico para la i-ésima modalidad (por ejemplo, EEG, EDA). Cada modalidad está codificada con un codificador neuronal:
(11)
Mecanismo de fusión con compuerta
Para gestionar el flujo de información de cada modalidad, se emplea una puerta de fusión:
(12)
(13)
σ es la función de activación sigmoide. ⊙ caracteriza el desarrollo elemento. Esto permite a la red reducir el peso de modalidades ruidosas o aumentar el peso de características útiles de forma dinámica.
Fusión de atención entre modalidades
Una capa de atención aprende cuánto peso debe dar a la representación de cada modalidad:
(14)
(15)
α(i) son pesos
de atención la representación final fusionada.
Predicción del estado afectivo
El vector fusionado se introduce en una capa de salida para hacer predicciones de valencia/activación o estados de experiencia de usuario:
22(16)
Donde
puede usarse para representar: clase de emoción discreta (feliz, neutral, triste), escala continua (valencia/excitación) y categorías UX (comprometido, distraído, sobrecargado).

Figura 3: Estructura del MMFN. Estructura del MMFN con codificadores específicos de modalidad, fusión por puertas e integración basada en atención para la predicción del estado afectivo.
Abreviaturas; MMFN = Red de fusión multimodal. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
La Figura 3 es el proceso de trabajo de una Red de Fusión Multimodal (MMFN) empleada en un marco de computación afectiva para la predicción de emociones y experiencia de usuario (UX). Codificadores específicos por modalidad, capas de fusión con puertas, un módulo de integración basado en atención y un cabezal de clasificación final conforman la arquitectura jerárquica de fusión del MMFN. Ilustra cómo se procesan diversas modalidades de entrada heterogéneas, como EEG (Modalidad A), EDA (Modalidad B) y Expresiones faciales (Modalidad C), con sus propias redes especializadas de codificadores (Codificador A, B y C). Un codificador independiente compuesto por dos capas completamente conectadas con activación de ReLU procesa cada modalidad (EEG, ECG, EDA y características faciales) antes de que una capa Bidireccional de Memoria a Corto Plazo (BiLSTM) capture las dependencias temporales. Cada codificador aprende una representación de características específicas de la modalidad que retiene rasgos emocionales o fisiológicos significativos del flujo de datos correspondiente. Cada dirección en la BiLSTM tiene 128 unidades ocultas, lo que otorga a cada modalidad una incrustación contextual de 256 dimensiones. Para evitar el sobreajuste, se realiza dropout (tasa = 0,5) después de la capa BiLSTM. A continuación, se aplica un enfoque de fusión con puertas que utiliza activación sigmoide para controlar dinámicamente las contribuciones de modalidad a las representaciones de modalidad codificadas. Una capa de autoatención calcula entonces los pesos de atención entre modalidades para suprimir señales ruidosas y resaltar información relevante. Una capa totalmente conectada y ya sea una capa de salida lineal para tareas de regresión de activación de valencia o una capa de salida Softmax para tareas de clasificación discreta proyectan la representación fusionada. La salida de cada codificador se introduce entonces en una Capa de Fusión Multimodal, que realiza la concatenación de todas las características de la modalidad y aplica un mecanismo de atención para resaltar señales más informativas y enmascarar el ruido. Esta operación produce una representación latente común que integra señales emocionales de todas las modalidades en un vector denso de alto nivel.
Las capas BiLSTM aplicadas a incrustaciones secuenciales específicas de modalidad modelan directamente la dinámica temporal. La BiLSTM permite la modelización contextual de los estados afectivos cambiantes al capturar tanto dependencias temporales hacia adelante como hacia atrás dentro de secuencias fisiológicas segmentadas. Además, la ponderación adaptativa de las características informativas en el tiempo es posible gracias a la capa de fusión basada en la atención que sigue, que funciona sobre representaciones codificadas temporalmente. Los autores han actualizado recientemente el texto para hacer más evidente cómo la construcción de secuencias, la codificación recurrente y la ponderación de atención funcionan conjuntamente para apoyar el modelado temporal.
El pseudocódigo propuesto 1 muestra el proceso global de modelado afectivo de la experiencia de usuario usando DCCA-MMFN en una forma reproducible. Para empezar, las señales fisiológicas y de comportamiento multimodales se introducen en un paso de preprocesamiento independiente que implica la reducción de ruido y la normalización de escalas. Las características se introducen entonces en DCCA, donde las características correlacionadas se aprenden conjuntamente para pares de modalidad especificados, con el objetivo de lograr una alineación robusta entre modales. Las características alineadas se combinan posteriormente dentro de un MMFN que consiste en mecanismos de control y de atención para la modulación específica de cada modalidad, con el objetivo de promover modalidades informativas y suprimir el ruido. La representación final combinada de características se emplea para entrenar un clasificador destinado a la estimación de estados afectivo y relacionado con UX, y la evaluación general del rendimiento se realiza en base a métricas estándar. La naturaleza paso a paso de este pseudocódigo propuesto garantiza transparencia, viabilidad y fácil reproducción por parte de otros para todas las personas técnicamente informadas que se interesen por este protocolo.
El marco propuesto pretende predecir el estado de experiencia del usuario afectivo (UX) utilizando señales fisiológicas y conductuales multimodales del conjunto de datos AMIGOS basándose en los siguientes pasos: Paso 1: Los datos multimodales de entrada consisten en señales de EEG, ECG, EDA, mirada ocular y expresión facial. Inicialmente, se accede al conjunto de datos multimodal AMIGOS y cada modalidad pasa por preprocesamiento de señales, incluyendo filtrado y normalización de ruido para garantizar la calidad y consistencia de los datos. Paso 2: Para mantener la uniformidad temporal entre modalidades, todas las señales se remuestrean a una frecuencia estándar. Posteriormente, se realiza la extracción de características específicas de la modalidad para obtener representaciones distintivas correspondientes a cada tipo de señal. Paso 3: Para capturar relaciones intermodales, se procesan pares de modalidad seleccionados (EEG–ECG, EEG–EDA y EEG–Facial) mediante Análisis de Correlación Canónica Profunda (DCCA). Las redes DCCA están entrenadas para aprender representaciones latentes correlacionadas entre modalidades emparejadas, resultando en incrustaciones de características alineadas para cada par de modalidad. Estas representaciones alineadas se combinan para formar un espacio de características multimodal unificado. Paso 4: Las características agregadas alineadas se proporcionan como entrada a una Red de Fusión Multimodal (MMFN), donde se emplean mecanismos de atención y estrategias de fusión con puertas para integrar eficazmente información complementaria entre modalidades. Este proceso de fusión genera una representación afectiva integral. Paso 5: La representación resultante se utiliza posteriormente para entrenar un clasificador con datos emocionales etiquetados para predecir el estado afectivo de la experiencia de usuario. Finalmente, el rendimiento del modelo se evalúa utilizando métricas estándar, incluyendo Precisión, Precisión, Recordatorio, puntuación F1 y Área Bajo la Curva (AUC). El estado afectivo UX previsto se devuelve como la salida final del marco.
Modelado percepción-emoción utilizando el marco propuesto DCCA-MMFN
En el marco computacional sugerido de la experiencia de usuario afectiva (UX) de exposiciones interactivas, el módulo de Modelado Percepción–Emoción es el proceso central que conecta las reacciones perceptivas del usuario a estímulos ambientales con sus estados emocionales biofísicos multimodales. Este módulo se basa en las representaciones comunes obtenidas por DCCA de modalidades fisiológicas y conductuales, como EEG, EDA, ECG, expresiones faciales y movimientos oculares, para registrar la dinámica afectiva del usuario. Simultáneamente, se utilizan metadatos sobre el entorno de exhibición circundante —estímulos visuales, paisajes sonoros, patrones de interactividad y características ambientales— para codificar las señales perceptivas. Utilizando una Red de Fusión Multimodal (MMFN) para combinar estas representaciones multimodales, el modelo adquiere mapeos detallados y no lineales a partir de características perceptuales de estímulo y etiquetas o dimensiones emocionales (por ejemplo, valencia, activación, compromiso). Este mapeo permite al sistema saber constantemente cómo reacciona emocionalmente un usuario ante diversos elementos de la exposición y luego modificar el contenido o la interfaz en consecuencia para aumentar el compromiso, la satisfacción o la resonancia cognitiva. Finalmente, el modelado percepción-emoción facilita la adaptación consciente de la emoción de la interacción, que constituye el núcleo del modelado computacional y los sistemas de exhibición sensibles al usuario.
Primero, se entrenaron módulos DCCA para aprender representaciones latentes correlacionadas para cada par de modalidades. La incrustación resultante sirve como entrada al MMFN, entrenada secuencialmente para la tarea de predicción afectiva. No se realiza ajustes finos de extremo a extremo para mantener la estabilidad del entrenamiento.
| Categoría | Parámetro | Valor / Descripción |
| Preprocesamiento de señales | Filtro pasa banda EEG | 4–45 Hz |
| Frecuencia de remuestreo | 128 Hz |
| Longitud de la ventana | 2 s |
| Solapamiento de ventanas | 50% |
| Normalización | Normalización de puntuación Z |
| Arquitectura DCCA | Número de capas ocultas | 3 capas por modalidad |
| Neuronas por capa | 128–64–32 |
| Tamaño de dimensión latente (n) | 32 |
| Parámetro de regularización | 1 × 10⁻⁵ |
| Optimizador | Adam |
| Tasa de aprendizaje | 0.001 |
| Tamaño del lote | 32 |
| Épocas máximas de formación | 150 |
| Paciencia de parar temprano | 15 épocas |
| Configuración del MMFN | Tipo de codificador | BiLSTM |
| Unidades ocultas | 64 |
| Tasa de abandono | 0.3 |
| Estrategia de fusión | Fusión con puertas y atención |
| Tipo de atención | EEG, ECG, GSR, Vídeo |
| Formación y evaluación | Función de pérdida | Pérdida de entropía cruzada |
| División tren–prueba | Validación cruzada de 5 vías |
| Métricas de evaluación | Precisión, Precisión, Recordatorio, Puntuación en F1, Kappa de Cohen, AUC–ROC |
| Puntos de control de reproducibilidad | Forma tensorial de entrada EEG | Canales × muestras de tiempo (por ejemplo, 14 × 256 por ventana) |
| Representación de salida DCCA | Incrustación latente compartida de 32 dimensiones |
| Salida MMFN | Probabilidades de clase emocional (valencia–activación o clases discretas) |
| Rendimiento esperado de validación | Precisión en la clasificación del 85–90% |
Tabla 2: Parámetros del algoritmo propuesto DCCA–MMFN. Resumen de los parámetros de preprocesamiento, arquitectura, fusión, entrenamiento, evaluación y reproducibilidad considerados en el marco propuesto de modelado afectivo UX. Abreviaturas; DCCA = Análisis Profundo de Correlación Canónica; MMFN = Red de Fusión Multimodal; UX = Experiencia del usuario.
En la Tabla 2, se proporciona el conjunto completo de parámetros utilizados dentro del marco propuesto DCCA-MMFN, que tiene en cuenta el preprocesamiento de señales, el diseño de arquitectura profunda, la técnica de fusión y las condiciones de entrenamiento. Las señales fisiológicas se remuestrearon y normalizaron uniformemente para sincronizarlas respecto a sus respectivas modalidades. La capa DCCA estaba configurada para usar transformaciones no lineales de varias capas, que ayudaban en el aprendizaje de espacios latentes maximamente correlacionados, mientras que el componente MMFN utilizaba redes codificadoras BiLSTM con mecanismos de atención con puertas para ponderar dinámicamente el valor de diferentes modalidades. Los requisitos para la formación y evaluación están definidos explícitamente, garantizando una comparación justa con las opciones existentes.
El marco sugerido pretende servir como base computacional para sistemas conscientes del afecto que utilizan información conductual y fisiológica en varias dimensiones. La arquitectura es conceptualmente adaptable a entornos reales como espacios de exposición inteligentes, interfaces inteligentes adaptativas y sistemas de interacción humano-ordenador conscientes del afecto, aunque el estudio actual valida el modelo mediante experimentos controlados fuera de línea utilizando el conjunto de datos AMIGOS, disponible públicamente. El marco puede funcionar como un módulo fundamental para aplicaciones que requieren inferencia emocional fiable, ofreciendo técnicas de fusión unificadas, alineación cruzada y preprocesamiento estructurado. Sin embargo, en lugar de ser sistemas desplegados experimentalmente, estos entornos se describen en este estudio como posibles contextos de despliegue.