Research Article

Modelado computacional de la experiencia afectiva del usuario utilizando señales fisiológicas y conductuales multimodales

DOI:

10.3791/69823

April 7th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo describe un marco computacional que modela la experiencia afectiva del usuario integrando señales fisiológicas y conductuales de forma multimodal, utilizando técnicas para el aprendizaje de características basado en correlación y la fusión multimodal. Este protocolo propone y prueba un marco para el modelado afectivo multimodal en el conjunto de datos de referencia AMIGOS.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo propone un protocolo computacional reproducible para el modelado afectivo multimodal que utiliza señales fisiológicas. El objetivo del protocolo es habilitar el reconocimiento emocional offline integrando múltiples señales biológicas mediante un marco unificado de aprendizaje profundo. El trabajo propuesto consta de cinco pasos: recogida de datos, preprocesamiento, alineación de características, fusión multimodal y evaluación. Las señales EEG, ECG y GSR de datos públicos de AMIGOS se utilizaron como línea base experimental en este trabajo. Las señales biológicas se preprocesaron y normalizaron para extraer características específicas de la modalidad. Los espacios de características heterogéneos se alinearon entre modalidades mediante Análisis de Correlación Canónica Profunda, seguido de una red de fusión multimodal para clasificar un estado afectivo. El protocolo ha sido evaluado con experimentos offline y comparado con modelos convencionales de fusión y clasificación utilizando métricas estándar de rendimiento como precisión, precisión, recuerdo, puntuación F1 y AUC. Este estudio se centra en el desarrollo y validación de un marco computacional para el modelado multimodal afectivo de la experiencia de usuario, más que en el despliegue de un sistema interactivo en tiempo real. Con un 92,1% de precisión para la predicción del estado afectivo UX-y un 94,2% de puntuación F1 para la clasificación de activación de valencia, los resultados superaron consistentemente a los modelos de línea base en dimensiones emocionales. Estos hallazgos verificaron la eficacia del flujo de trabajo de fusión multimodal propuesto para la modelización afectiva computacional mediante la comparación de datos fisiológicos.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La compleja interacción entre pensar, sentir y actuar moldea cómo piensan y actúan las personas. La computación afectiva consiste en estudiar estas relaciones aprovechando conocimientos interdisciplinares de neurociencia, psicología e inteligencia artificial para construir sistemas capaces de analizar, comprender y reaccionar a las emociones humanas. Esta área se ha aplicado cada vez más a la comunicación entre humanos y tecnología incorporando la conciencia expresiva en estructuras de IA responsivas, haciendo que la tecnología interactúe no solo con las condiciones intelectuales sino también con las emotivas, resultando en un conocimiento del usuario más individualizado y consciente de las emociones. Una emoción, un proceso mental complejo, es un reflejo de las percepciones humanas y tiene un papel sustancial en las interaccioneshumanas 1. Hoy en día, existen numerosas aplicaciones de interacción humano-ordenador (HCI) que necesitan investigación sobre el reconocimiento emocional2. El entorno del sistema HCI es dinámico y complejo. En la mayoría de los casos, debe sincronizar sus funcionalidades con las de los demandados; Por lo tanto, un contexto con inteligencia emocional puede adaptarse mejor a este tipo de ambiente. Por lo tanto, en este estudio se explora la modelización computacional de la experiencia afectiva del usuario mediante señales fisiológicas y conductualesmultimodales. En lugar de desarrollar o validar un sistema interactivo en la práctica, el trabajo se inclina más hacia la contribución en metodologías relacionadas con la integración multimodal de señales o la inferencia afectiva con contextos de aplicación en entornos de inmersión o exposiciones. Para abstenerse de la amplitud de conceptos, este trabajo se centra en dos conceptos principales: la implementación de un marco de modelado afectivo multimodal utilizando enfoques computacionales, y técnicas de fusión de datos multimodales para la combinación de datos fisiológicos y conductuales. Todos los demás temas que surgen en el manuscrito se hacen referencia para contextualizar la relevancia de los modelos desarrollados.

Cada modalidad de emoción transmite información diferente sobre el sentimiento de una persona que no puede derivarse de otro sistema sensorial. La extracción de emociones del movimiento corporal, que implica un patrón general de movimiento corporal, tiene la ventaja de identificar los sentimientos no verbales de unapersona 4. El habla y la apariencia facial pueden transmitir material no disponible en el movimiento corporal y las señales corporales humanas. Los humanos utilizan diversas modalidades emocionales en paralelo y en combinación. Cada modalidad es limitada y tiene sus fortalezas. Para detectar correctamente una sensación, los métodos multimodales de reconocimiento emocional quizá disfruten de un rendimiento de reconocimiento superior al reconocimiento unimodal. Sin embargo, en caso de un cambio emocional, las señales de expresión facial, las señales biológicas/fisiológicas y las señales del habla tienden a aparecer antes que otras señales. Así, la detección emocional basada en visión por ordenador se ocupa principalmente de la expresión emocionalfacial 5.

La computación afectiva ha sido investigada de forma exhaustiva en la interacción niño-robot (CRI); Los sistemas conscientes de las emociones cambian su respuesta en función de las señales fisiológicas y conductuales de los usuarios. Estas obras ilustran la viabilidad de la detección biofísica de emociones y la interacción adaptativa. Sin embargo, en su mayoría, los sistemas CRI diseñados solo son adecuados para contextos estructurados, orientados a tareas y participantes. En consecuencia, los sistemas CRI tienen una generalización limitada a entornos públicos dinámicos como exposiciones interactivas. Su trabajo señala que los robots sensibles a las emociones son esenciales para mejorar la motivación, además de abordar cuestiones como la personalización. La implicación es un elemento clave para la interacción afectiva-niño-robot, ya que los robots emocionalmente reactivos proporcionan experiencias de aprendizaje más ricas y efectivas. El autor6 presenta un marco para detectar la interacción del usuario en función de las características de la tarea y la interacción social. Demuestran a través de sus hallazgos que identificar señales afectivas, incluidas las expresiones faciales y el comportamiento social, permite a los robots ajustar dinámicamente sus respuestas para mejorar la interacción y el compromiso del usuario. La adaptación afectiva en la CRI a largo plazo es un desafío constante. Los autores en7 presentan las emociones de los niños durante un periodo de tiempo, subrayando que los robots deben adaptarse a los patrones personales de emociones y estilos de aprendizaje.

También ha logrado un gran rendimiento en EEG debido a su alta resolución temporal y sensibilidad a los estados afectivos. Trabajos recientes 8,9,10 que utilizan enfoques de aprendizaje profundo mejoraron la robustez entre sujetos al introducir modelado espaciotemporal y mecanismos de atención basados en grafos. Sin embargo, la mayoría de los estudios siguen siendo unimodales, y solo unos pocos tienen en cuenta las interacciones percepción-emoción a través de múltiples canales sensoriales; por lo tanto, son menos aplicables en escenarios de experiencia inmersiva11, 12 y 13. El modelo fue evaluado con el conjunto de datos, que mostró un rendimiento mejorado en comparación con las técnicas actuales de vanguardia. El algoritmo de selección crítica dependiente de la emoción fue propuesto por losautores en 14, y se examinaron la fuerza, el coeficiente de agrupamiento y la centralidad del vector propio de las características de la red de conectividad funcional EEG. Los autores en15 investigaron una red unitaria recurrente profunda y sencilla en un esfuerzo por adquirir las características temporales de las señales EEG, y los resultados experimentales superaron al trabajo relacionado en laliteratura 16,17,18,19. Es casi imposible recopilar un gran conjunto de datos de señales EEG, pero se pueden probar otros enfoques, como el enfoque intersujeto.

Estudios recienteshan avanzado significativamente en el uso de algoritmos de modelado espaciotemporal extremadamente avanzados para abordar el problema de la Clasificación de Emociones entre sujetos basada en señales EEG. Esto incluye una red híbrida espacio-temporal con adaptación mejorada de dominios y atención dinámica a grafos para manejar la variabilidad entre sujetos en la Clasificación de Emociones a partir de señalesEEG 22. En particular, mediante el uso de mecanismos de modelado temporal y modelado de relaciones cerebrales espaciales con atención dinámica, mejoraron significativamente el rendimiento en la clasificación emocional independiente del sujeto. Otro esfuerzo de investigación sobre este problema incluye una red de interacción isomorfa espaciotemporal entre regiones cruzadasy cerebroscóphales 23. En esta investigación, se pone mayor énfasis en modelar invariantes espacio-temporales para mejorar significativamente la robustez entre sujetos para la Clasificación de Emociones a partir de señales EEG. Aunque estas dos contribuciones de investigación han documentado con éxito un desempeño sobresaliente en la Clasificación de Emociones a partir de señales puramente neuronales, se limitan a señales monomodales y carecen de exploración de interacciones multimodales P-E. Por el contrario, la investigación actual se centra en modelos de señal unimodal ampliados mediante el uso de soluciones de aprendizaje profundo que unen múltiples modalidades P/E mediante aprendizaje profundo de correlación, proporcionando una solución de modelado UX afectivo con más sabor y profundidad.

Aunque la investigación actual, incluido el proyecto sobre la interfaz niño-robot expresivamente consciente utilizando información biofísica, ha validado el potencial de acceder a señales fisiológicas multimodales para mejorar el reconocimiento de afectos, no obstante están limitadas por restricciones relacionadas con el dominio. En particular, estos sistemas están en gran medida optimizados para una interacción estructurada y orientada a tareas con los niños y no son generalizables a entornos más intrincados y dinámicos como exposiciones interactivas. Además, las técnicas de fusión de características utilizadas en el trabajo base no son escalables y tienden a recurrir a enfoques de fusión superficial, que no capturan eficazmente la compleja interacción percepción-emoción que existe en entornos UX multisensoriales. Además, el artículo base no utiliza técnicas de aprendizaje profundo de última generación que puedan alinear y fusionar flujos multimodales de datos de alta dimensión, como EEG, expresiones faciales y seguimiento ocular, bajo diferentes estímulos ambientales. Esto pone de manifiesto una brecha fundamental de conocimiento en la creación de un paradigma computacional de alto rendimiento que no solo acomoda diferentes demografías de audiencia y contextos de estímulo, sino que también captura la interacción percepción-emoción mediante el análisis profundo de correlación canónica (DCCA) y arquitecturas de redes de fusión multimodales (MMFN). Cerrar esta brecha puede afectar significativamente la comprensión de la experiencia del usuario (UX).

El objetivo principal de este trabajo es crear un sistema computacional que facilite una experiencia de usuario emocionalmente adaptativa dentro de contextos de exhibición interactiva mediante la detección multimodal, biofísica y conductual. Basándose en los principios básicos de modelado emocional de la investigación de interacción niño-robot y la computación afectiva, este marco pretende modelar y registrar las interacciones percepción-emoción del usuario basándose en señales fisiológicas y conductuales heterogéneas como EEG, ECG, EDA, expresiones faciales y seguimiento ocular. Mediante la integración del análisis profundo de correlaciones canónicas (DCCA) con una red de fusión multimodal (MMFN), el sistema busca aprender representaciones emocionales latentes comunes entre modalidades y proyectar estas representaciones sobre estados de experiencia de usuario afectiva (UX). La arquitectura tiene la tarea de superar las dificultades de la fusión superficial de características y los modelos emocionales con constrención de edad, apoyando la inferencia emocional consciente del contexto y la integración multisensorial en entornos públicos dinámicos. Por último, este trabajo pretende ayudar a desarrollar sistemas de exhibición inteligentes, más avanzados y sensibles a lo afectivo que respondan a los modos de retroalimentación e interacción afectiva en tiempo real de los usuarios, aumentando así el compromiso, la satisfacción y la resonancia cognitivo-emocional en las experiencias culturales digitales.

Este artículo contribuye a la literatura de las siguientes maneras: Un marco computacional para el modelado afectivo multimodal que considera tanto datos fisiológicos como conductuales. Un enfoque de fusión multimodal que facilita el aprendizaje efectivo de la percepción y la representación emocional a partir de múltiples fuentes de datos. Este trabajo sugerido introduce un nuevo paradigma computacional para mejorar la experiencia de usuario afectiva (UX) mediante la detección multimodal basada en IA y el modelado de la cadena de integración multisensorial de la interacción percepción-emoción. La contribución principal es la fusión de DCCA con MMFN para facilitar una fuerte alineación de características y un aprendizaje de representación de alto nivel a través de modalidades heterogéneas como EEG, ECG, EDA, expresión facial y seguimiento ocular. Esto permite modelar una evaluación offline precisa que mapea la percepción sensorial con estados emocionales como interés, compromiso, sorpresa o aburrimiento. La validación experimental con el conjunto de datos AMIGOS de acceso público muestra que el modelo DCCA+MMFN desarrollado funciona mejor que los modelos de referencia (por ejemplo, 1D-CNN, CNN-ResNet y LSTM-CNN), con una precisión media de clasificación del 89,4% para estados emocionales valencia-activación y del 87,1% para clases emocionales discretas.

A diferencia de estudios previos que enfatizaban a los participantes, situaciones centradas en tareas o utilizaban técnicas superficiales de fusión de características, el enfoque propuesto aporta un marco de aprendizaje profundo diseñado específicamente para entornos expositivos dinámicos en el mundo real. Mediante la integración de DCCA y un MMFN, este trabajo proporciona un método expansible y robusto al ruido capaz de comprender los cambios continuos de percepción-emoción en grupos de usuarios heterogéneos. Esta clara fusión de señales fisiológicas, conductuales y ambientales de alta dimensión es una innovación fundamental para el modelado UX afectivo. Este artículo presenta un marco impulsado por IA para modelar experiencias de usuario afectivas en exposiciones interactivas utilizando sensores multimodales e integración multisensorial. El marco propuesto logra una alineación robusta y fusión de modalidades heterogéneas como EEG, ECG, EDA, expresiones faciales y seguimiento ocular combinando DCCA con MMFN. A diferencia de estudios anteriores que se limitaban a entornos centrados en el usuario o en la tarea, el enfoque propuesto apoya el modelado continuo de percepción-emoción dentro de entornos públicos dinámicos, siendo así un avance clave en la investigación en UX afectiva.

La creación de un enfoque computacional multimodal sistemático y repetible para el modelado fisiológico del afecto que maneje metódicamente la alineación heterogénea de características antes de la fusión es la principal novedad de este trabajo. El marco sugerido impone el aprendizaje de representaciones correlacionadas entre señales de EEG, ECG y GSR introduciendo una etapa intermedia de alineamiento latente cross-modal usando DCCA, en contraste con los estudios tradicionales de reconocimiento emocional multimodal que se basan en la concatenación directa de características o la fusión a nivel de decisión. Al garantizar la consistencia de modalidades antes de la clasificación, este enfoque de fusión impulsado por alineación mejora la generalizabilidad y robustez a través de dimensiones afectivas. La contribución es un flujo de trabajo orientado a benchmarks, de extremo a extremo, que estandariza el preprocesamiento, la alineación de representaciones, la fusión multimodal y la evaluación dentro de una única arquitectura de aprendizaje profundo, permitiendo un modelado fisiológico de emociones repetible y agnóstico a la tarea, en lugar de sugerir un cambio algorítmico único. El marco propuesto en este estudio se establece como una demostración de viabilidad y conceptual de la modelización afectiva multimodal para experiencias similares a la exposición. En lugar de intentar modelar directamente entornos multisensoriales reales de exhibición, el conjunto de datos AMIGOS se utiliza como un proxy de referencia para validar el enfoque de modelado en un entorno controlado.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El conjunto de datos AMIGOS utilizado en este estudio es de acceso público y fue recopilado con la aprobación previa del comité de revisión institucional y consentimiento informado, según se informó en la publicación original. Este estudio implica únicamente un análisis secundario del conjunto de datos, y no se requirió ninguna aprobación ética adicional.

El método actual utiliza enfoques de alineación de características y fusión multimodal para manejar datos fisiológicos y conductuales multimodales con el fin de describir las correlaciones percepción–emoción. Este estudio propone un modelo computacional para la experiencia de usuario afectiva (UX) en exposiciones interactivas, aprovechando la detección biofísica multimodal y la modelización emocional basada en IA. Basada en datos biofísicos del artículo base, esta metodología digitaliza el modelado computacional de los estados del usuario a partir de EEG sincronizados, ECG, EDA, seguimiento ocular, expresiones faciales y entradas ambientales. El término "modelado espacio-temporal" en el manuscrito se refiere a la representación fisiológica espacial multicanal de características y a la correlación intermodal mediante DCCA. Temporal: codificación secuencial mediante BiLSTM y preservación de dependencias temporales dentro de ventanas segmentadas. Estas diversas señales se preprocesan y normalizan inicialmente para tener en cuenta las correlaciones temporales y espaciales entre modalidades. Los vectores de características se aprenden de forma independiente para cada modalidad, capturando patrones relacionados con la emoción como excitación, atención y compromiso. Para aprender con éxito a partir de representaciones emocionales compartidas a través de flujos de datos heterogéneos, se utiliza DCCA. DCCA proyecta cada modalidad en un subespacio común latente donde se maximizan las características correlacionadas, mientras se conserva información específica de la modalidad mediante una relevancia cruzada entre modales aumentadas. Estas incrustaciones latentes alineadas con modalidades se pasan luego a una Red de Fusión Multimodal (MMFN) que combina información temporal y contextual mediante una biLSTM híbrida y capas de atención. Esta fusión permite al sistema producir estados afectivos de alto nivel, que se traducen en indicadores de experiencia del usuario (por ejemplo, aburrimiento, interés, incomodidad). Por último, un módulo de clasificación estima el estado afectivo de la experiencia de usuario y proporciona retroalimentación para la adaptación a la exhibición, por ejemplo, ajustando estímulos visuales o auditivos en modelado computacional. La Figura 1 muestra la arquitectura del método propuesto.

Figura 1
Figura 1: Arquitectura del método propuesto. Estructura del marco de modelado UX propuesto que fusiona entradas multimodales, incluyendo EEG, ECG, EDA, expresiones faciales y mirada ocular, utilizando DCCA y MMFN. Abreviaturas; UX = Experiencia de usuario; EEG = Electroencefalografía; ECG = Electrocardiografía; EDA = Actividad Electrodérmica; DCCA = Análisis Profundo de Correlación Canónica; MMFN = Red de fusión multimodal. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La arquitectura propuesta en la Figura 1 ilustra un sistema de experiencia de usuario afectiva (UX) de extremo a extremo que utiliza Deep Canonical Correlation Analysis (DCCA) y una Red de Fusión Multimodal (MMFN) para el modelado de interacción percepción-emoción en exposiciones interactivas. El sistema comienza recibiendo entradas multimodales en bruto como EEG, ECG y señales fisiológicas EDA; las expresiones faciales y las señales de comportamiento de la mirada ocular; y entradas contextuales como información audiovisual y ambiental. Estas señales se introducen luego en un módulo de preprocesamiento y extracción de características, donde se ejecuta procesamiento específico de la señal (por ejemplo, eliminación de ruido, normalización, cálculo de características) para producir descriptores significativos para cada modalidad. En segundo lugar, el módulo DCCA proyecta pares de modalidades en un espacio latente común y aprende incrustaciones maximamente correlacionadas que codifican patrones emocionales intrínsecos entre modalidades. Las características de alta correlación de estos múltiples módulos DCCA se fusionan posteriormente mediante la Red de Fusión Multimodal (MMFN), que fusiona jerárquicamente las características aprendidas con capas de aprendizaje profundo, posiblemente BiLSTM, mecanismos de atención o transformadores para crear una representación afectiva compacta y de alto nivel. Esta representación integrada se introduce entonces en la capa de clasificación de estados de emociones y UX, en la que el modelo predice resultados afectivos como la valencia, la excitación o estados cognitivos/emocionales como el engagement, el aburrimiento o la sobrecarga. Opcionalmente, se proporciona un bucle de retroalimentación adaptativa de UX al terminar la canalización, permitiendo al sistema responder de forma interactiva a los estados del usuario adaptando estímulos o contenido en el contexto de la exposición. Esta arquitectura escalable y modular garantiza un modelado fuerte de las emociones mediante el aprendizaje de representaciones consciente de la correlación y la integración multimodal profunda, lo cual es extremadamente adecuado para el modelado computacional computacional de la computación afectiva en entornos interactivos o experienciales.

La selección de la fusión de DCCA con MMFN se basa en las limitaciones actuales de los modelos estándar unimodales y de fusión superficial. Aunque CNN-ResNet y LSTM-CNN extraen características temporales o espaciales, son pobres para equilibrar modalidades heterogéneas como EEG, EDA y expresiones faciales bajo diferentes estimulaciones ambientales. DCCA maximiza la correlación entre modales para asegurar representaciones latentes compartidas, mientras que MMFN utiliza mecanismos jerárquicos de fusión y atención para resaltar dinámicamente las señales más informativas. Cuando se combinan, estos módulos ofrecen un enfoque de modelado UX afectivo más fiable, comprensible y ampliamente aplicable para entornos multisensoriales interactivos.

Adquisición de datos
En el marco modelo sugerido de interacción percepción-emoción para exposiciones interactivas, el conjunto de datosAMIGOS 24, disponible públicamente, se utiliza como base para datos afectivos multimodales. El conjunto de datos AMIGOS ofrece una colección exhaustiva de medidas fisiológicas y conductuales de participantes humanos que experimentan estímulos que evocan el afecto, como clips de vídeo. Estos datos contienen señales sincronizadas de EEG, ECG y GSR, grabaciones de vídeo facial y etiquetas emocionales autoinformadas en formas discretas (por ejemplo, felices, tristes) y dimensionales (valencia/excitación). Estas modalidades se alinean bien con las necesidades del sistema aquí propuesto, que pretende inferir estados de experiencia de usuario afectiva (UX) durante interacciones inmersivas y multisensoriales en exhibiciones. El conjunto de datos incluye grabaciones de 40 sujetos, cada uno expuesto tanto a estímulos cortos (clips de vídeo <150 s) como largos (películas >14 min) que inducen emociones, en circunstancias que simulan la interacción real con los medios. Para el alcance de este trabajo sugerido, se emplea un subconjunto preprocesado del conjunto de datos: registros de 30 sujetos con señales EEG, ECG y GSR de alta calidad y libres de artefactos, así como archivos completos de vídeo facial y anotaciones. Estas son las muestras seleccionadas para imitar dinámicas emocionales multimodales durante situaciones basadas en exposiciones. El conjunto de datos aprendido es una base de entrenamiento y benchmarking para la cadena DCCA + Multimodal Fusion Network (MMFN), donde se exploran estados afectivos como el compromiso, el aburrimiento, la confusión y la excitación como respuestas a estímulos visuales, auditivos y espaciales en un entorno de exhibición simulada. La Tabla 1 muestra la descripción del conjunto de datos del método propuesto.

ParámetroDetalles
Nombre del conjunto de datosAMIGOS (Un conjunto de datos para la investigación del afecto, la personalidad y el estado de ánimo)
No. de participantes40 en total (30 utilizados en trabajos propuestos con datos multimodales completos)
Tipo de estímuloClips de vídeo cortos y largos (anotados emocionalmente)
Canales EEGCasco EEG Emotiv EPOC de 14 canales
ECGSensor de frecuencia cardíaca (para HRV y excitación)
GSRSensor de conductancia cutánea (midiendo la actividad simpática)
Vídeo facialVídeo frontal facial de alta resolución para análisis de expresiones
Etiquetas de EmociónValencia, activación, dominancia autoevaluadas (escala 1–9), además de etiquetas discretas
Frecuencia de muestreoEEG: 128Hz, ECG/GSR: 1000Hz
Formato de datos.mat y registros sincronizados de marcas de tiempo
Sincronización de modalidadesSí – Sincronizado entre todos los sensores y vídeo
Duración por sesiónClips cortos (<150 s) y películas largas (>14 min)
Ajuste a la aplicaciónModelado UX afectivo, fusión multimodal, mapeo percepción-emoción en tiempo real

Tabla 1: Descripción del conjunto de datos AMIGOS. Descripción del conjunto de datos AMIGOS utilizado en el marco propuesto, incluyendo información sobre los participantes, modalidades, tasas de muestreo y diseño experimental. Abreviaturas; AMIGOS = Un conjunto de datos para la investigación de afecto, personalidad y estado de ánimo en individuos y grupos.

El conjunto de datos AMIGOS disponible públicamente aplicado en el marco sugerido consiste en datos multimodales conductuales y fisiológicos recogidos de 40 participantes, de los cuales 33 fueron seleccionados para este estudio en función de la excelencia y plenitud de las grabaciones. El conjunto de datos registra reacciones emocionales a clips de vídeo cortos y largos, e incluye señales como EEG (de un auricular Emotive de 14 canales), ECG para variabilidad de la frecuencia cardíaca, GSR para conductancia cutánea y vídeo facial de alta resolución para medición de expresiones. Los estados emocionales se autoinforman tanto en categorías dimensionales (valencia, excitación, dominancia) como discretas. Los datos están bien alineados entre sí en las modalidades y se muestrean adecuadamente: 128Hz para EEG, 1000Hz para ECG y GSR. Esta configuración hace que el conjunto de datos sea ideal para modelar la experiencia del usuario (UX) en exposiciones interactivas, de modo que las interacciones percepción-emoción puedan ser rastreadas con precisión mediante la detección multimodal basada en IA.

Preprocesamiento de datos
Todos los pasos de preprocesamiento, entrenamiento de modelos y evaluaciones implicados se implementaron en scripts Python personalizados (Python 3.10, PyTorch 2.0) de forma individual, con cada módulo para preprocesamiento de señales, alineación basada en DCCA, entrenamiento MMFN y evaluación del rendimiento; la configuración de parámetros clave y algunas configuraciones computacionales esenciales se resumen en la Tabla 1. Para procesar el conjunto de datos AMIGOS disponible públicamente para el modelado UX afectivo de exhibiciones interactivas, se implementa inicialmente una cadena sistemática de preprocesamiento de datos sobre modalidades fisiológicas y conductuales como EEG, ECG, GSR y vídeo facial. Al principio, estandariza y sincroniza cada modalidad, y luego realiza el preprocesamiento específico de cada modalidad. Actualmente, la información contextual se obtiene únicamente a partir de pistas audiovisuales intrínsecas dentro de los estímulos de vídeo, por ejemplo, expresiones faciales, patrones de movimiento visual y características acústicas como la prosodia del habla y el audio de fondo.

Normalización de señales y remuestreo
Las señales fisiológicas brutas x(t) de todas las modalidades se remuestrean a una frecuencia común fs=128 Hz para alineación temporal entre modalidades:

Ecuación 1(1)

El remuestreo se realizaba utilizando una función estándar de biblioteca de procesamiento de señales en lugar de un algoritmo diseñado a medida. Específicamente, la implementación se llevó a cabo utilizando la utilidad de remuestreo disponible en el ecosistema de procesamiento de señales de Python (SciPy), que aplica interpolación basada en el método de Fourier para convertir señales a la frecuencia de muestreo objetivo. Se seleccionó la tasa de muestreo objetivo fs para asegurar una resolución temporal uniforme entre modalidades antes de la segmentación y la extracción de características. Posteriormente, cada señal se normaliza con puntuación z para eliminar la variabilidad entre sujetos:

Ecuación 2(2)

donde μx y σx son la media de la ventana de prueba y la desviación estándar de la señal.

Preprocesamiento EEG
Las señales EEG, capturadas de 14 canales, están filtradas pasa-banda eligiendo entre 4 y 45 Hz para preservar frecuencias cognitivas:

Ecuación 3(3)

El espectro de potencia se emplea para determinar patrones de frecuencia en señales, y esto puede variar según el tipo de emoción, en el caso de la señal cerebral, y puede proporcionar información útil sobre dicha señal. La técnica de Welch es una técnica superior de periodogramas ecuación 3, que proporciona una estimación de la densidad espectral y puede emplearse para obtener espectrogramas. La técnica de Welch segmenta la señal en el dominio del tiempo en intervalos discretos de tiempo y construye. Un espectrograma para cada segmento, luego se promedian todos los espectrogramas como se muestra en la ecuación 4. Este proceso es más fluido en comparación con el enfoque FFT completo y, por tanto, obtiene la máxima potencia de las señales. Finalmente, la Densidad Espectral de Potencia (PSD)19 se calcula utilizando la técnica de Welch para capturar características del dominio de la frecuencia:

Ecuación 4(4)

Las características PSD se suman en cinco bandas: Theta (4–8 Hz), Alfa (8–13 Hz), Beta (13–30 Hz), Gamma Bajo (30–45 Hz).

Rasgos faciales basados en vídeo
Extraer Unidades de Acción Facial (UA) y vectores de mirada ocular para cada fotograma de vídeo usando un conjunto de datos de EEG multicanal o software similar, estos se combinan posteriormente como secuencias temporales:

Ecuación 5(5)

Mapeo de etiquetas emocionales
Tanto las puntuaciones de valencia-activación como las etiquetas de emoción discretas son proporcionadas por AMIGOS. Las calificaciones continuas se normalizan a [0,1]:

Ecuación 6(6)

Donde V es el valor observado real antes de la normalización, Vmin es el valor más pequeño de la variable en el conjunto de datos, Vmax es el valor más grande de la variable en el conjunto de datos y V' es el valor normalizado en el rango de 0 a 1. Estas etiquetas se aplican como fundamento para el modelado supervisado del afecto. Estas etiquetas se aplican como fundamento para el modelado supervisado del afecto.

Sincronización entre modalidades
Todas las modalidades se sincronizan usando alineación de marcas de tiempo o distorsión temporal dinámica (DTW) cuando es necesario:

Ecuación 7(7)

Los datos preprocesados y ricos en características se introducen luego en el módulo de Análisis de Correlación Canónica Profunda (DCCA), que aprende representaciones maximamente correlacionadas entre modalidades.

Extracción de características usando DCCA
En el marco previsto del modelado afectivo de UX para exposiciones interactivas, el DCCA se utiliza para aprender características latentes conectadas en modalidades heterogéneas como EEG, ECG, EDA, expresiones faciales y datos de seguimiento ocular. El objetivo es aprender un espacio de representación común en el que las señales de diversas modalidades, aunque individualmente ruidosas o específicas de cada modalidad, estén al máximo correlacionadas y semánticamente consistentes en términos de estados emocionales percibidos. En este trabajo, la DCCA se aplicó a los siguientes pares de modalidades: i) EEG–ECG, ii) EEG–GSR y iii) representaciones EEG–rasgos faciales. Estos pares se seleccionaron para capturar correlaciones complementarias neural-fisiológicas y neural-conductuales relevantes para el compromiso afectivo. Para extender el DCCA a un entorno multimodal, se calcularon y luego fusionaron las incrustaciones por pares de DCCA para cada par de modalidades utilizando el MMFN propuesto, lo que permite una integración eficiente de más de dos modalidades sin alterar la formulación central de DCCA.

Al realizar un alineamiento latente impulsado por correlación antes de la fusión, DCCA separa estructuralmente el alineamiento de representaciones de la fusión de decisión, en contraste con las Redes de Atención Cross-Modal o Fusión Tensorial, que actúan directamente sobre representaciones posiblemente desalineadas. La redundancia disminuye y la coherencia de las representaciones mejora gracias a esta arquitectura de dos etapas. Además, DCCA optimiza directamente la dependencia estadística intermodal en lugar de depender solo de funciones de pérdida compartidas, lo cual es más adecuado para datos fisiológicos heterogéneos que los marcos de aprendizaje multitarea. Primero, DCCA20 se utilizan para calcular representaciones de varias modalidades tratándolas secuencialmente a través de múltiples capas apiladas de transformaciones no lineales. La Figura 2 ilustra la construcción del DCCA empleado en este trabajo de investigación. Utilizamos un método de búsqueda en cuadrícula para determinar los hiperparámetros óptimos para diseñar el modelo de aprendizaje profundo que se utilizará en el enfoque DCCA. Tras un análisis experimental exhaustivo, los autores seleccionaron un optimizador de descenso de gradiente estocástico, pérdida cruzada de entropía y un parámetro regulador de 1e5. A continuación, los autores seleccionaron 15 pasos de optimización usando el vector de sesgo como ceros, el conjunto de validación como criterios de parada temprana y el inicializador Xavier como inicializador de peso. La Figura 2 muestra el proceso de funcionamiento de DCCA.

Figura 2
Figura 2: Proceso de funcionamiento de DCCA. Flujo de trabajo de procesos de DCCA, mostrando la correspondencia de características de diversas modalidades en un espacio latente común para maximizar la correlación.
Abreviaturas; DCCA = Análisis de Correlación Canónica Profunda. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La Figura 2 muestra visualmente el marco interno de trabajo del Análisis de Correlación Canónica Profunda (DCCA) para el aprendizaje de representación compartida entre dos modalidades diferentes, EEG (Modalidad A) y EDA (Modalidad B). Ambas modalidades se alimentan en sus respectivas redes profundas de extractores de características (Extractor de Características A y B), que tienen varias capas ocultas que aprenden características abstractas específicas de cada modalidad. Antes de la fusión, el alineamiento latente cruzado se realiza mediante Análisis de Correlación Canónica Profunda (DCCA). Se construyen dos redes paralelas de proyección profunda para cada par de modalidades (EEG–ECG, EEG–EDA y EEG–Facial). Usando la activación de ReLU, cada red de proyección está compuesta por tres capas completamente conectadas con dimensiones [256, 128, 64]. Para el espacio latente compartido, 64 es la dimensión última de incrustación. Con un coeficiente de regularización L2 de 1e-5 para garantizar la estabilidad numérica, la función objetivo maximiza la correlación canónica entre las incrustaciones de modalidad proyectadas. Los vectores de sesgo se inicializan a cero y los pesos se inicializan mediante la inicialización de Xavier. Para estabilizar el aprendizaje de alineación, los módulos DCCA se entrenan por separado antes del entrenamiento MMFN. Para mantener la consistencia de la alineación, no existe un ajuste fino de extremo a extremo entre DCCA y MMFN. Estas canaletas de redes neuronales aceptan los flujos de datos de entrada en paralelo pero de forma aislada. La salida del extractor de características de cada una de ellas se proyecta entonces en el espacio latente común, donde las características de ambas modalidades se mapean para que sean comparables en estructura. Las proyecciones se optimizan según el objetivo de DCCA, que es maximizar la correlación entre las representaciones latentes correspondientes del EEG y el EDA. Al adquirir este subespacio maximamente correlacionado, DCCA garantiza que las incrustaciones de salida mantengan patrones complementarios y semánticamente significativos de ambas modalidades, que son esenciales para aplicaciones posteriores como el reconocimiento emocional o la computación afectiva.

En este trabajo, las características se convierten usando DCCA y luego se integran para la categorización. El modelo DCCA, mostrado en la Figura 2, utiliza un modelo de aprendizaje profundo para la transformación de características. La capa CCA calcula la correlación, que luego se utiliza para combinar y clasificar características. Supongamos que la matriz Ecuación 8 almacena ensayos de la modalidad EEG, y la matriz Ecuación 9 incluye experimentos de la modalidad de vídeo de caras. En este caso, las dimensiones de las características en los ensayos EEG y los clips de vídeo facial se representan con n1 y n2, respectivamente, mientras que el número total de ensayos se indica con la AM. Para cada modalidad, los autores crearon la siguiente red neuronal profunda para reorganizar las características de entrada de forma no lineal:

Ecuación 10(8)

donde los parámetros de la transformación no lineal se representan como HT1 y HT2; las características posteriores de cada red neuronal se representan como Ecuación 11 y Ecuación 12 y medición de la característica de DCCA como n. Los parámetros aprendidos recursivamente HT1 y HT2, generados a partir de DCCA, han incrementado la correlación entre ON1 y ON 2 a un nivel tanto como ha sido posible:

Ecuación 13(9)

Los parámetros mutuamente aprendidos como HT1 y HT2 fueron entrenados por el algoritmo de retropropagación. Para obtener la respuesta deseada, se aproximaron los gradientes de la función objetivo según lo sugerido. Las características alteradas ON1 y ON2 ∈ SP están en la SP combinada del hiperespacio después de que las dos redes neuronales hayan sido entrenadas. Los autores de DCCA principalmente20 no mencionaron específicamente el uso de características alteradas. Las funciones modificadas pueden utilizarse de la manera que mejor sirva a la aplicación del usuario. En este trabajo, los autores obtuvieron las siguientes características fusionadas a partir de características alteradas:

Ecuación 14(10)

donde α y β representan pesos que mantienen α + β = 1. Las características ON integradas mediante DCCA se introducen en el clasificador SoftMax. Las tareas de reconocimiento emocional se utilizan para entrenar al clasificador. Como se mencionó antes, construir DCCA para la fusión de datos en varios formatos tiene algunas vantas. Para observar las características y correlación de las transformaciones centradas en modalidad, por ejemplo, DCCA obtiene explícitamente ON1 y ON2 para cada modalidad en la fusión a nivel de características. Además, los datos basados en emociones pueden preservarse controlando las funciones de mapeo no lineales f1(·) y f2(·). Además, los autores están utilizando pesos equivalentes para cada modalidad en la fusión de suma ponderada. Una Red de Fusión Multimodal (MMFN) que prevé los estados de experiencia del usuario recibe este espacio combinado. Para el alineamiento multimodal, se utiliza un enfoque jerárquico, donde las señales en bruto se alinean temporalmente primero con el remuestreo y el alineamiento de marcas de tiempo, y el alineamiento de las señales semánticamente ricas de diversas modalidades se obtiene mediante Análisis de Correlación Canónica Profunda (DCCA). Esto asegura que las representaciones conscientes de la modalidad se transformen en un espacio latente común antes del proceso de fusión basado en la atención en el MMFN.

Red de fusión multimodal (MMFN) para modelado UX afectivo
El MMFN codifica cada modalidad por separado y luego las fusiona usando una puerta de fusión y un mecanismo de atención para generar una representación integrada para la predicción emocional.

Codificación específica por modalidad
Sea x(i)R di el vector característico para la i-ésima modalidad (por ejemplo, EEG, EDA). Cada modalidad está codificada con un codificador neuronal:

Ecuación 15(11)

Mecanismo de fusión con compuerta
Para gestionar el flujo de información de cada modalidad, se emplea una puerta de fusión:

Ecuación 16(12)

Ecuación 17(13)

σ es la función de activación sigmoide. ⊙ caracteriza el desarrollo elemento. Esto permite a la red reducir el peso de modalidades ruidosas o aumentar el peso de características útiles de forma dinámica.

Fusión de atención entre modalidades
Una capa de atención aprende cuánto peso debe dar a la representación de cada modalidad:

Ecuación 18(14)

Ecuación 19(15)

α(i) son pesosEcuación 21de atención la representación final fusionada.

Predicción del estado afectivo
El vector fusionado se introduce en una capa de salida para hacer predicciones de valencia/activación o estados de experiencia de usuario:

Ecuación 2222(16)

Donde Ecuación 23 puede usarse para representar: clase de emoción discreta (feliz, neutral, triste), escala continua (valencia/excitación) y categorías UX (comprometido, distraído, sobrecargado).

Figura 3
Figura 3: Estructura del MMFN. Estructura del MMFN con codificadores específicos de modalidad, fusión por puertas e integración basada en atención para la predicción del estado afectivo.
Abreviaturas; MMFN = Red de fusión multimodal. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La Figura 3 es el proceso de trabajo de una Red de Fusión Multimodal (MMFN) empleada en un marco de computación afectiva para la predicción de emociones y experiencia de usuario (UX). Codificadores específicos por modalidad, capas de fusión con puertas, un módulo de integración basado en atención y un cabezal de clasificación final conforman la arquitectura jerárquica de fusión del MMFN. Ilustra cómo se procesan diversas modalidades de entrada heterogéneas, como EEG (Modalidad A), EDA (Modalidad B) y Expresiones faciales (Modalidad C), con sus propias redes especializadas de codificadores (Codificador A, B y C). Un codificador independiente compuesto por dos capas completamente conectadas con activación de ReLU procesa cada modalidad (EEG, ECG, EDA y características faciales) antes de que una capa Bidireccional de Memoria a Corto Plazo (BiLSTM) capture las dependencias temporales. Cada codificador aprende una representación de características específicas de la modalidad que retiene rasgos emocionales o fisiológicos significativos del flujo de datos correspondiente. Cada dirección en la BiLSTM tiene 128 unidades ocultas, lo que otorga a cada modalidad una incrustación contextual de 256 dimensiones. Para evitar el sobreajuste, se realiza dropout (tasa = 0,5) después de la capa BiLSTM. A continuación, se aplica un enfoque de fusión con puertas que utiliza activación sigmoide para controlar dinámicamente las contribuciones de modalidad a las representaciones de modalidad codificadas. Una capa de autoatención calcula entonces los pesos de atención entre modalidades para suprimir señales ruidosas y resaltar información relevante. Una capa totalmente conectada y ya sea una capa de salida lineal para tareas de regresión de activación de valencia o una capa de salida Softmax para tareas de clasificación discreta proyectan la representación fusionada. La salida de cada codificador se introduce entonces en una Capa de Fusión Multimodal, que realiza la concatenación de todas las características de la modalidad y aplica un mecanismo de atención para resaltar señales más informativas y enmascarar el ruido. Esta operación produce una representación latente común que integra señales emocionales de todas las modalidades en un vector denso de alto nivel.

Las capas BiLSTM aplicadas a incrustaciones secuenciales específicas de modalidad modelan directamente la dinámica temporal. La BiLSTM permite la modelización contextual de los estados afectivos cambiantes al capturar tanto dependencias temporales hacia adelante como hacia atrás dentro de secuencias fisiológicas segmentadas. Además, la ponderación adaptativa de las características informativas en el tiempo es posible gracias a la capa de fusión basada en la atención que sigue, que funciona sobre representaciones codificadas temporalmente. Los autores han actualizado recientemente el texto para hacer más evidente cómo la construcción de secuencias, la codificación recurrente y la ponderación de atención funcionan conjuntamente para apoyar el modelado temporal.

El pseudocódigo propuesto 1 muestra el proceso global de modelado afectivo de la experiencia de usuario usando DCCA-MMFN en una forma reproducible. Para empezar, las señales fisiológicas y de comportamiento multimodales se introducen en un paso de preprocesamiento independiente que implica la reducción de ruido y la normalización de escalas. Las características se introducen entonces en DCCA, donde las características correlacionadas se aprenden conjuntamente para pares de modalidad especificados, con el objetivo de lograr una alineación robusta entre modales. Las características alineadas se combinan posteriormente dentro de un MMFN que consiste en mecanismos de control y de atención para la modulación específica de cada modalidad, con el objetivo de promover modalidades informativas y suprimir el ruido. La representación final combinada de características se emplea para entrenar un clasificador destinado a la estimación de estados afectivo y relacionado con UX, y la evaluación general del rendimiento se realiza en base a métricas estándar. La naturaleza paso a paso de este pseudocódigo propuesto garantiza transparencia, viabilidad y fácil reproducción por parte de otros para todas las personas técnicamente informadas que se interesen por este protocolo.

El marco propuesto pretende predecir el estado de experiencia del usuario afectivo (UX) utilizando señales fisiológicas y conductuales multimodales del conjunto de datos AMIGOS basándose en los siguientes pasos: Paso 1: Los datos multimodales de entrada consisten en señales de EEG, ECG, EDA, mirada ocular y expresión facial. Inicialmente, se accede al conjunto de datos multimodal AMIGOS y cada modalidad pasa por preprocesamiento de señales, incluyendo filtrado y normalización de ruido para garantizar la calidad y consistencia de los datos. Paso 2: Para mantener la uniformidad temporal entre modalidades, todas las señales se remuestrean a una frecuencia estándar. Posteriormente, se realiza la extracción de características específicas de la modalidad para obtener representaciones distintivas correspondientes a cada tipo de señal. Paso 3: Para capturar relaciones intermodales, se procesan pares de modalidad seleccionados (EEG–ECG, EEG–EDA y EEG–Facial) mediante Análisis de Correlación Canónica Profunda (DCCA). Las redes DCCA están entrenadas para aprender representaciones latentes correlacionadas entre modalidades emparejadas, resultando en incrustaciones de características alineadas para cada par de modalidad. Estas representaciones alineadas se combinan para formar un espacio de características multimodal unificado. Paso 4: Las características agregadas alineadas se proporcionan como entrada a una Red de Fusión Multimodal (MMFN), donde se emplean mecanismos de atención y estrategias de fusión con puertas para integrar eficazmente información complementaria entre modalidades. Este proceso de fusión genera una representación afectiva integral. Paso 5: La representación resultante se utiliza posteriormente para entrenar un clasificador con datos emocionales etiquetados para predecir el estado afectivo de la experiencia de usuario. Finalmente, el rendimiento del modelo se evalúa utilizando métricas estándar, incluyendo Precisión, Precisión, Recordatorio, puntuación F1 y Área Bajo la Curva (AUC). El estado afectivo UX previsto se devuelve como la salida final del marco.

Modelado percepción-emoción utilizando el marco propuesto DCCA-MMFN
En el marco computacional sugerido de la experiencia de usuario afectiva (UX) de exposiciones interactivas, el módulo de Modelado Percepción–Emoción es el proceso central que conecta las reacciones perceptivas del usuario a estímulos ambientales con sus estados emocionales biofísicos multimodales. Este módulo se basa en las representaciones comunes obtenidas por DCCA de modalidades fisiológicas y conductuales, como EEG, EDA, ECG, expresiones faciales y movimientos oculares, para registrar la dinámica afectiva del usuario. Simultáneamente, se utilizan metadatos sobre el entorno de exhibición circundante —estímulos visuales, paisajes sonoros, patrones de interactividad y características ambientales— para codificar las señales perceptivas. Utilizando una Red de Fusión Multimodal (MMFN) para combinar estas representaciones multimodales, el modelo adquiere mapeos detallados y no lineales a partir de características perceptuales de estímulo y etiquetas o dimensiones emocionales (por ejemplo, valencia, activación, compromiso). Este mapeo permite al sistema saber constantemente cómo reacciona emocionalmente un usuario ante diversos elementos de la exposición y luego modificar el contenido o la interfaz en consecuencia para aumentar el compromiso, la satisfacción o la resonancia cognitiva. Finalmente, el modelado percepción-emoción facilita la adaptación consciente de la emoción de la interacción, que constituye el núcleo del modelado computacional y los sistemas de exhibición sensibles al usuario.

Primero, se entrenaron módulos DCCA para aprender representaciones latentes correlacionadas para cada par de modalidades. La incrustación resultante sirve como entrada al MMFN, entrenada secuencialmente para la tarea de predicción afectiva. No se realiza ajustes finos de extremo a extremo para mantener la estabilidad del entrenamiento.

CategoríaParámetroValor / Descripción
Preprocesamiento de señalesFiltro pasa banda EEG4–45 Hz
Frecuencia de remuestreo128 Hz
Longitud de la ventana2 s
Solapamiento de ventanas50%
NormalizaciónNormalización de puntuación Z
Arquitectura DCCANúmero de capas ocultas3 capas por modalidad
Neuronas por capa128–64–32
Tamaño de dimensión latente (n)32
Parámetro de regularización1 × 10⁻⁵
OptimizadorAdam
Tasa de aprendizaje0.001
Tamaño del lote32
Épocas máximas de formación150
Paciencia de parar temprano15 épocas
Configuración del MMFNTipo de codificadorBiLSTM
Unidades ocultas64
Tasa de abandono0.3
Estrategia de fusiónFusión con puertas y atención
Tipo de atenciónEEG, ECG, GSR, Vídeo
Formación y evaluaciónFunción de pérdidaPérdida de entropía cruzada
División tren–pruebaValidación cruzada de 5 vías
Métricas de evaluaciónPrecisión, Precisión, Recordatorio, Puntuación en F1, Kappa de Cohen, AUC–ROC
Puntos de control de reproducibilidadForma tensorial de entrada EEGCanales × muestras de tiempo (por ejemplo, 14 × 256 por ventana)
Representación de salida DCCAIncrustación latente compartida de 32 dimensiones
Salida MMFNProbabilidades de clase emocional (valencia–activación o clases discretas)
Rendimiento esperado de validaciónPrecisión en la clasificación del 85–90%

Tabla 2: Parámetros del algoritmo propuesto DCCA–MMFN. Resumen de los parámetros de preprocesamiento, arquitectura, fusión, entrenamiento, evaluación y reproducibilidad considerados en el marco propuesto de modelado afectivo UX. Abreviaturas; DCCA = Análisis Profundo de Correlación Canónica; MMFN = Red de Fusión Multimodal; UX = Experiencia del usuario.

En la Tabla 2, se proporciona el conjunto completo de parámetros utilizados dentro del marco propuesto DCCA-MMFN, que tiene en cuenta el preprocesamiento de señales, el diseño de arquitectura profunda, la técnica de fusión y las condiciones de entrenamiento. Las señales fisiológicas se remuestrearon y normalizaron uniformemente para sincronizarlas respecto a sus respectivas modalidades. La capa DCCA estaba configurada para usar transformaciones no lineales de varias capas, que ayudaban en el aprendizaje de espacios latentes maximamente correlacionados, mientras que el componente MMFN utilizaba redes codificadoras BiLSTM con mecanismos de atención con puertas para ponderar dinámicamente el valor de diferentes modalidades. Los requisitos para la formación y evaluación están definidos explícitamente, garantizando una comparación justa con las opciones existentes.

El marco sugerido pretende servir como base computacional para sistemas conscientes del afecto que utilizan información conductual y fisiológica en varias dimensiones. La arquitectura es conceptualmente adaptable a entornos reales como espacios de exposición inteligentes, interfaces inteligentes adaptativas y sistemas de interacción humano-ordenador conscientes del afecto, aunque el estudio actual valida el modelo mediante experimentos controlados fuera de línea utilizando el conjunto de datos AMIGOS, disponible públicamente. El marco puede funcionar como un módulo fundamental para aplicaciones que requieren inferencia emocional fiable, ofreciendo técnicas de fusión unificadas, alineación cruzada y preprocesamiento estructurado. Sin embargo, en lugar de ser sistemas desplegados experimentalmente, estos entornos se describen en este estudio como posibles contextos de despliegue.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Evaluación del sistema propuesto
Para evaluar el sistema propuesto, se realizaron experimentos con el conjunto de datos AMIGOS, disponible públicamente, que proporciona mediciones sincronizadas de EEG, ECG, GSR, vídeo y audio de 40 usuarios expuestos a estímulos emocionalmente estimulantes. Para el propósito de esta investigación, los autores utilizaron datos de 33 participantes (tras preprocesamiento y eliminación de ensayos incompletos), resultando en 1.320 muestras válidas sobre las dimensiones de ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los contextos de interacción espacial, ambiental y física, como la disposición espacial, la densidad de multitudes o las condiciones ambientales ambientales, no se indican explícitamente en el conjunto de datos de AMIDOS. Por tanto, tales factores tampoco están modelados directamente en los experimentos actuales. El marco computacional sugerido para el modelado de la Experiencia de Usuario Afectiva (UX) avanza mucho más allá de los conceptos fundamentales del artículo base que trataban l...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de interés.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores reconocen el apoyo de la Escuela de Diseño Espacial y la Escuela de Diseño Industrial de la Universidad Hongik. Los autores también agradecen a los socios y participantes de la exposición por sus contribuciones al estudio.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Conjunto de datosConjunto de datos AMIGOS40 participantes; EEG (128 Hz), ECG (1000 Hz), GSR (1000 Hz), vídeo facial, etiquetas autoinformadas de valencia/activaciónDatos de verdad multimodales para el modelado del estado afectivo
Sensores fisiológicosCasco EEGEmotiv EPOC+ (14 canales, 128 Hz)Captura de la actividad cerebral relacionada con la atención, la excitación y la interacción
Sensor ECGBiopac MP150 o equivalente (1000 Hz)Variabilidad y activación de la frecuencia cardíaca
Sensor GSR/EDAShimmer GSR+ o equivalente (1000 Hz)Conductancia cutánea como medida de la excitación
Sensores de comportamientoDispositivo de seguimiento ocularTobii Pro X2-60 o equivalenteRegistro de la fijación de la mirada y sacadas
Grabación de la expresión facialCámara de vídeo de alta resolución; analizado con OpenFace (AUs, vectores de mirada)Extracción de Unidades de Acción (AU) faciales y señales de mirada
Insumos medioambientalesConfiguración de grabación audiovisualMicrófono + Cámara (sincronizado con estímulos)Capturando estímulos contextuales durante la exposición
Software / Kits de herramientasOpenFaceKit de herramientas de análisis de comportamiento facial de código abiertoExtracción de Unidades de Acción (AU), dirección de la mirada
MATLAB / Python (NumPy, SciPy, scikit-learn)Preprocesamiento de señales (remuestreo, normalización de puntuación z, cálculo PSD)Preprocesamiento de datos y extracción de características
TensorFlowv2.13 / PyTorchv2.0Marco de aprendizaje profundo para DCCA y MMFNImplementación y entrenamiento de modelos
Algoritmos / ModelosAnálisis profundo de correlación canónica (DCCA)Método de alineación de características no linealEl aprendizaje correlacionó representaciones latentes entre modalidades
Red de Fusión Multimodal (MMFN)BiLSTM + Capas de fusión basadas en la atenciónFusión jerárquica de modalidades heterogéneas para la clasificación de estados UX
Métricas de evaluaciónPrecisión, Precisión, Recordatorio, F1-Score, Cohen' s Kappa, AUC-ROC, Matriz de ConfusiónImplementado con métricas scikit-learn / TensorFlowEvaluación del rendimiento del modelo
Hardware informáticoClúster de estación de trabajo / GPUNVIDIA RTX 3080 (10GB) o equivalente, 32 GB de RAM, procesador Intel i9Entrenamiento y simulación de modelos

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Affective ModelingMultimodal FusionPhysiological SignalsEmotion RecognitionDeep Learning FrameworkEEG SignalsECG SignalsGSR SignalsFeature AlignmentOffline Experiments

Related Articles