Artículo de investigación

Mapeo visual de características emocionales multimodales para el diseño de interacción inteligente

DOI:

10.3791/71171

21 de agosto de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El trabajo propone un marco de análisis de emociones multimodal de extremo a extremo que aprovecha codificadores transformadores, representaciones de emociones desacopladas y atención multimodal basada en grafos con mapeo visual para mejorar la precisión del reconocimiento de emociones en dos conjuntos de datos.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Al permitir que las máquinas comprendan, interpreten y reaccionen a estados afectivos humanos, la representación visual de rasgos emocionales multimodales es fundamental para el diseño de interfaces inteligentes. Sin embargo, los algoritmos actuales de detección emocional multimodal se centran principalmente en el rendimiento predictivo, aportando escasa comprensión sobre la interpretabilidad, la conciencia de la interacción o las interacciones entre modalidades a nivel de características. Este trabajo presenta un marco para la representación visual de aspectos emocionales multimodales que combina visualización orientada a la interacción, aprendizaje de representaciones interpretables y predicción emocional. Sin utilizar características creadas manualmente, se emplearon codificadores basados en transformadores para extraer representaciones emocionales de alto nivel a partir de modalidades textual, de audio y visual. Para mejorar la robustez, se separó la información específica de cada emoción y de cada modalidad mediante una técnica de aprendizaje de representaciones desentrañadas. Además, se diseñó una red de atención multimodal basada en grafos que utiliza ponderación adaptativa de la atención para simular relaciones emocionales sutiles entre modalidades. Se desarrolló un módulo de representación visual multivista para mostrar trayectorias emocionales temporales, distribuciones de atención cruzada entre modalidades e incrustaciones emocionales latentes, con el fin de aumentar la transparencia. El marco propuesto fue evaluado utilizando el conjunto de datos Carnegie Mellon University Multimodal Opinion Sentiment and Emotion Intensity (CMU-MOSEI) y el conjunto de datos chino de Análisis de Sentimientos Multimodal (CH-SIMS). Los resultados experimentales indican que el marco sugerido ofrece una mejor interpretabilidad a nivel de características y una visualización consciente de la interacción, superando consistentemente a técnicas básicas representativas en términos de precisión, puntuación F1, correlación y error absoluto medio. Además, el módulo de representación visual facilitó la interpretación cualitativa de las representaciones emocionales multimodales, las interacciones entre modalidades y la dinámica emocional temporal, apoyando así la visualización y el análisis con conciencia de la interacción.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La capacidad de identificar y comprender correctamente el sentimiento humano se ha vuelto crucial para mejorar la interacción entre humanos y máquinas. Además de ser esencial para mejorar la interacción humano-ordenador, el análisis de emociones tiene el potencial de revolucionar varios campos, incluyendo el diagnóstico médico pre-diagnóstico1, el análisis del comportamiento en el aula2, el seguimiento psicológico de pacientes3, la identificación de fatiga en vehículos4, y la gestión inteligente en entornos de hogares inteligentes5. Los recientes avances en computación afectiva y aprendizaje profundo6 han aumentado el interés en crear sistemas en tiempo real que puedan capturar la complejidad de la emoción humana.

Muchos métodos actuales dependen principalmente de datos unimodales, como signos textuales, gráficos o auditivos7,8,9. Estos enfoques fracasan repetidamente en detectar señales refinadas, como el sarcasmo o matices específicos del contexto. La investigación ha avanzado hacia la evaluación multimodal de emociones, que incorpora datos complementarios de múltiples fuentes para superar estas limitaciones.10,11,12. Las ventajas de combinar múltiples modalidades han sido demostradas por modelos de referencia como la fusión temprana-red neuronal de memoria a corto plazo (EF-LSTM)13 y las redes neuronales profundas ligeras y FM (LF-DNN)14, redes de fusión tensorial (TFN) y enfoques de fusión multimodal de rango bajo. Sin embargo, la mayoría de estos enfoques dependen de la generación previa de características y no son adecuados para situaciones dinámicas del mundo real.

Con el fin de dar cabida a los estados emocionales, en los últimos diez años ha crecido la investigación y las aplicaciones en identificación multimodal de emociones15. Una de las áreas de investigación más desafiantes y significativas en la actualidad es el monitoreo continuo de los estados emocionales mediante diversas fuentes de datos16. La idea de multimodalidad surgió de forma bastante natural con el surgimiento de un sistema tan diverso de conocimientos, lo que ha llevado a numerosos avances en la aplicación de emociones en áreas como la computación emocional, la interacción humano-computadora (HCI), el aprendizaje, los videojuegos, el servicio al consumidor, la atención médica, la evaluación de la experiencia del usuario (UX), etc. Sin embargo, no siempre ha sido sencillo aplicar técnicas de reconocimiento emocional en la evaluación de la experiencia del usuario.

Una de las principales razones para centrarse en el reconocimiento multimodal en lugar de métodos unimodales radica en las desventajas inherentes de depender de una única fuente de información. Los sistemas de detección de emociones unimodales pueden presentar menor precisión debido a datos ausentes o poco claros, mientras que los esquemas de MER son más confiables y ofrecen una comprensión más completa y reflexiva de los estados expresivos al integrar múltiples fuentes de datos17. Por ejemplo, el lenguaje facial por sí solo podría no ser suficiente para clasificar con precisión los sentimientos, especialmente cuando los gestos son complejos o ambiguos. Sin embargo, combinar expresiones faciales con otras formas de comunicación, como el lenguaje o las señales físicas, podría aumentar la precisión en el reconocimiento de emociones.

Se ha realizado una amplia investigación sobre el reconocimiento de emociones en varias modalidades. Los estudios iniciales se centraron en identificar características distintivas de diferentes modalidades, como entradas gráficas, acústicas o basadas en texto. Aunque cada vez es más evidente que la integración de diversas modalidades puede proporcionar información emocional equilibrada, lo que conduce a una detección de sentimientos más confiable y precisa. Este segmento revisa los avances clave en el análisis de emociones unimodal y multimodal, centrándose en los enfoques básicos, sus limitaciones y la justificación de nuestro método.

El estudio inicial sobre el reconocimiento de emociones se centró principalmente en una única modalidad. En el ámbito visual, investigaciones pioneras condujeron a la categorización de movimientos faciales prototípicos20. Avances posteriores incluyeron técnicas para capturar dinámicas temporales, como el movimiento visual21 y los modelos ocultos de Markov22, mientras que las respuestas faciales se dividieron en unidades de acción mediante el Sistema de Codificación de Acciones Faciales (FACS)23. Las redes neuronales de memoria a corto y largo plazo (LSTM) y las redes neuronales convolucionales (CNN) se han utilizado con éxito para extraer características significativas directamente de señales de audio en bruto; las metodologías para la identificación de emociones basadas en audio han evolucionado desde el procesamiento convencional de señales hasta el aprendizaje profundo24. La extracción de señales de sentimiento contextual en el análisis de emociones basado en texto se ha mejorado considerablemente mediante redes neuronales recurrentes (RNN) que incorporan mecanismos de atención y, más recientemente, mediante modelos basados en transformadores. A pesar de sus logros, las técnicas unimodales son intrínsecamente incapaces de representar con precisión las complejidades que experimentan las personas, ya que carecen de la información complementaria presente en otras modalidades.

Algunos modelos basados en mecanismos de atención, como el modelo DialogXL25, fueron propuestos en 2021 para recopilar datos ambientales de mayor duración en el área de identificación del sentimiento en conversaciones. Kim et al.26 presentó el modelo EmoBERTa en 2021 para aumentar la precisión del ERC. Este modelo utiliza datos de los hablantes para mejorar las características de los interlocutores en las conversaciones y sus interacciones mutuas. En 2022, Li et al.27 presentó el método CoG-BART. La organización utiliza aprendizaje contrastivo supervisado para mejorar la capacidad del modelo de interpretar datos relevantes. Cabe destacar que el aprendizaje supervisado requiere una cantidad considerable de datos etiquetados.

Un ejemplo típico de este tipo de trabajo es el marco de Representación con Conciencia de Interacción Multimodal (MIAR, por sus siglas en inglés)28, que utiliza tokens de interacción de características y alineación contrastiva para mejorar la generalización entre modalidades. MIAR mejora el alineamiento de modalidades y logra un rendimiento sólido en múltiples conjuntos de datos; sin embargo, se centra principalmente en la precisión predictiva sin abordar el mapeo visual. De manera similar, el modelo de Fusión Audiovisual con Atención Cruzada29 captura eficazmente interacciones audiovisuales finamente detalladas para la predicción de valencia y activación, pero se limita a dos modalidades y carece de capacidades de visualización. Los enfoques de modelado temporal basados en redes LSTM y fusión mediante autoencoders capturan con éxito la dinámica temporal de las emociones, pero ofrecen una visión limitada sobre las interacciones entre modalidades y las representaciones emocionales aprendidas. Más recientemente, métodos basados en transformadores, como la Red Neuronal de Fusión Multimodal Basada en Transformadores (TMFN, por sus siglas en inglés)30, han demostrado un buen desempeño en CMU-MOSI y CMU-MOSEI mediante una fusión multimodal mejorada y aprendizaje contrastivo. No obstante, estos enfoques siguen siendo principalmente impulsados por el rendimiento y ofrecen un soporte limitado para la explicabilidad, la interpretación a nivel de características y la visualización orientada a interacciones.

Para mejorar la integración de datos textuales, acústicos y visuales, se han propuesto varias técnicas de reconocimiento multimodal de emociones. Aunque las técnicas de fusión temprana como EF-LSTM y LF-DNN demostraron las ventajas de utilizar información multimodal para el análisis de sentimientos y emociones, no lograron capturar interacciones complejas entre modalidades. Aunque TFN mejoró el rendimiento en conjuntos de datos de referencia como CMU-MOSI y CMU-MOSEI e introdujo un modelado explícito de las interacciones intermodales, su baja interpretabilidad y alta complejidad computacional limitaron su utilidad. Para mejorar la alineación de modalidades y la fusión dinámica de características, técnicas más modernas como MIAR, modelos de fusión con atención cruzada, TMFN y transformadores multimodales adaptativos han empleado topologías de transformadores y mecanismos de atención. Estos métodos se centraron principalmente en el rendimiento predictivo, ofreciendo poca información sobre las representaciones emocionales a nivel de características y las dependencias intermodales, a pesar de obtener resultados competitivos en métricas de evaluación comunes como precisión, puntuación F1 y error absoluto medio. Además, pocos estudios han establecido técnicas de visualización que puedan revelar incrustaciones latentes de emociones, distribuciones de atención y dinámicas temporales de las emociones, o han integrado modelado basado en grafos de las interacciones intermodales. El enfoque propuesto incorpora mapeo visual multi-vista, fusión de atención intermodal basada en grafos y aprendizaje de representaciones desacopladas para superar estas limitaciones y mejorar el rendimiento del reconocimiento multimodal de emociones.

De manera similar, el Transformador Multimodal Adaptativo32 propone una fusión basada en intercambio para mitigar de forma adaptativa información modal ruidosa o faltante, mejorando así el rendimiento en la clasificación de sentimientos. Aunque este enfoque puede abordar eficazmente las discrepancias en la distribución de la información modal, su diseño es específico para el análisis de sentimientos y ofrece una visión limitada sobre las representaciones emocionales aprendidas. Otra contribución importante es el Modelo de Fusión Multimodal33, que integra CNN, LSTMs multiplicativos y atención basada en transformadores para el reconocimiento multimodal de emociones en tiempo real. El modelo realiza una fusión completa de las modalidades de video, audio y texto, y muestra un rendimiento robusto en el reconocimiento. Sin embargo, al igual que otros modelos existentes, se centra principalmente en la precisión predictiva y carece de características explícitas para la visualización y la interpretabilidad orientada a la interacción.

En conclusión, aunque los actuales enfoques multimodales de última generación para el reconocimiento de emociones han logrado un éxito considerable en la captura de interacciones entre modalidades y en la mejora de la precisión de las predicciones, la mayoría de ellos se centran en tareas orientadas al reconocimiento. Se ha prestado poca atención a aspectos como la interpretabilidad a nivel de características, la visualización de representaciones emocionales en el espacio de la imagen y la incorporación del marco propuesto para el diseño de interacciones inteligentes. Es con estos desafíos en mente que se presenta el marco propuesto.

La mayoría de los métodos actuales se centran principalmente en mejorar el rendimiento predictivo, ofreciendo escasa interpretabilidad de las representaciones emocionales aprendidas y de las interacciones multimodales, a pesar de los notables avances en el reconocimiento multimodal de emociones28,29. Las interacciones complejas entre las modalidades textual, acústica y visual suelen ser difíciles de modelar para las estrategias de fusión actuales, especialmente cuando ocurren discrepancias entre modalidades y escasez de información 28,31. Aunque los diseños basados en transformadores y los mecanismos de atención han mejorado el aprendizaje de representaciones, su transparencia e interpretabilidad a menudo se ven reducidas por la falta de separación explícita de la información específica de la emoción y de la información específica de la modalidad31,32,33. Además, solo un pequeño número de estudios ha investigado la modelización basada en grafos de las interacciones intermodales o ha creado marcos de visualización capaces de revelar dinámicas temporales de la emoción, distribuciones de atención e incrustaciones de emociones. Estas limitaciones demuestran la necesidad de un marco multimodal interpretable para la interacción inteligente entre humanos y máquinas que combine una representación visual orientada a la interacción con un aprendizaje cruzado modal robusto.

Este trabajo presenta un marco interpretable para la representación visual de aspectos emocionales multimodales en el diseño de interfaces inteligentes. Sin necesidad de características creadas manualmente, el sistema utiliza aprendizaje profundo de extremo a extremo para extraer representaciones emocionales de alto nivel a partir de modalidades textual, de audio y visual. Las interacciones emocionales cruzadas se modelan mediante un mecanismo de fusión con atención basado en grafos que separa la información específica de la emoción y la específica de la modalidad, lo que permite un aprendizaje de representación desacoplado y mejora la interpretabilidad y la robustez. Además, se crea un módulo de visualización multivista para mostrar la dinámica emocional temporal, los patrones de atención cruzada entre modalidades y los embeddings emocionales. La eficacia y adecuación del marco propuesto en sistemas inteligentes de interacción humano-máquina se evalúan mediante validación en conjuntos de datos de referencia para el reconocimiento emocional multimodal.

Este trabajo ofrece un marco único para la representación visual de aspectos emocionales multimodales que va más allá de los enfoques tradicionales orientados a la predicción, con el fin de superar la deficiente modelización de las interacciones entre modalidades y la limitada interpretabilidad en los actuales sistemas de identificación emocional multimodal. Dentro de una única arquitectura, el enfoque propuesto combina aprendizaje de representaciones multimodales basado en transformadores, modelado de características desacopladas con conciencia emocional, fusión de atención entre modalidades basada en grafos y visualización orientada a las interacciones. El marco separa claramente las representaciones específicas de la emoción y las específicas de la modalidad para mejorar la interpretabilidad, la robustez y la coherencia entre modalidades, en contraste con los enfoques actuales que se centran principalmente en el rendimiento de clasificación. Además, se presenta un mecanismo de atención basado en grafos para permitir la modelización adaptativa de las interacciones intermodales, capturando la interdependencia emocional fina entre las modalidades textual, de audio y visual. Se desarrolla un módulo de representación visual multivista para aumentar la transparencia, revelando trayectorias temporales de las emociones, patrones de atención entre modalidades y representaciones latentes de las emociones, lo que proporciona una comprensión intuitiva del proceso de toma de decisiones del modelo. Además de ofrecer una visualización y interpretabilidad mejoradas de la dinámica emocional multimodal, la evaluación experimental en los conjuntos de datos de referencia CH-SIMS y CMU-MOSEI mostró un rendimiento competitivo en cuanto a precisión, puntuación F1, error absoluto medio y correlación.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El trabajo propuesto tiene como objetivo mejorar el diseño de interacción inteligente al ofrecer un marco interpretable para la representación visual de características emocionales multimodales. En este trabajo se utilizaron las bases de datos CH-SIMS y CMU-MOSEI, que son de acceso público. Ambos conjuntos de datos se obtuvieron de sus fuentes oficiales y se emplearon cumpliendo con las directrices de uso, los estándares de investigación y los términos de licencia establecidos por sus respectivos creadores. El contenido multimodal de los conjuntos de datos, que incluye datos de texto, audio y video, fue recopilado y anotado inicialmente por los proveedores de los conjuntos de datos de acuerdo con los permisos autorizados de los participantes y sus protocolos de recolección de datos. En este estudio no hubo interacción humana directa, ni reclutamiento de nuevos participantes, ni recopilación de información personal identificable. Todos los análisis se realizaron utilizando conjuntos de datos de investigación disponibles públicamente. Por consiguiente, nuestro análisis secundario de datos no requirió ninguna aprobación ética adicional ni revisión por parte de una Junta de Revisión Institucional (IRB). El estudio se llevó a cabo cumpliendo con las normas institucionales adecuadas que regulan el uso de conjuntos de datos disponibles públicamente, los procedimientos éticos de investigación y las políticas aplicables de uso de datos.

Se empleó un mecanismo de atención cruzada basado en grafos para aprender caracterizaciones emocionales entre modalidades, utilizando características específicas de la emoción o de la modalidad con el fin de mejorar la comprensión. Se utiliza un componente de mapeo visual multivista para mejorar el diseño interactivo inteligente en tiempo real, y se estima su eficiencia en el reconocimiento emocional. Los resultados muestran que el método propuesto mejora tanto la interpretabilidad como la eficiencia de las interfaces inteligentes de usuario sensibles a las emociones en entornos reales. Figura 1 muestra el flujo arquitectónico del trabajo propuesto. Figura 1 muestra el flujo completo del marco de mapeo visual sugerido para el aprendizaje de características emocionales multimodales en el contexto de sistemas de interacción inteligente. El flujo comienza con tres modalidades de entrada sincronizadas: texto, audio y video, que capturan información emocional complementaria proveniente de las modalidades lingüística, prosódica y de expresión facial, respectivamente. Un codificador transformador específico de modalidad procesa cada modalidad para obtener representaciones de alto nivel de los datos de entrada brutos. Luego, estas representaciones se introducen en un módulo de aprendizaje de representaciones desacopladas, donde los embeddings específicos de la emoción se separan de las características específicas de la modalidad, garantizando así la coherencia de las emociones aprendidas a través de fuentes de datos heterogéneas. Posteriormente, los embeddings específicos de la emoción de cada modalidad se agrupan mediante una red de atención cruzada entre modalidades basada en grafos, que modela las dependencias emocionales intermodales y asigna pesos dinámicos de importancia a cada modalidad según el contexto de interacción. Finalmente, el marco proporciona tanto salidas de clasificación emocional como información sobre la interacción, lo que facilita la toma de decisiones transparente sensible a las emociones y el diseño de interacciones inteligentes adaptables.

Adquisición de datos multimodal

Los conjuntos de datos CH-SIMS y CMU-MOSEI son dos conjuntos de datos multimodales de dominio público existentes que han recopilado información multimodal, como video, audio y texto sincronizados. El conjunto de datos CH-SIMS comprende exámenes multimodales de personas chinas, incluyendo 2.281 segmentos de video, derivados de múltiples segmentos de películas, dramas televisivos y programas de variedades. La adición de audio y texto correspondientes a estos segmentos de video hace que los estudios sobre análisis multimodal de emociones utilizando datos multimodales sean más atractivos y factibles. Sin embargo, uno de los conjuntos de datos multimodales más grandes para el examen de opiniones, sentimientos y emociones es el conjunto de datos CMU-MOSEI, que fue recopilado a partir de más de 23.000 clips de video de frases pronunciadas por más de 1.000 hablantes sobre una variedad de temas. El conjunto de datos se dividió aleatoriamente en subconjuntos de entrenamiento (70 %), validación (15 %) y prueba (15 %), manteniendo la distribución de clases.

Se obtienen transcripciones textuales, señales de audio y cuadros de video, y se alinean según la marca de tiempo para coincidir a un nivel temporal finamente detallado. La integración a nivel de cuadro garantiza que los mecanismos propuestos de aprendizaje de representación y fusión basada en grafos puedan modelar y aprovechar conjuntamente el contenido emocional derivado de expresiones visuales, tonos vocales y contenido lingüístico. La extracción eficaz de dinámicas emocionales intermodales se posibilita mediante esta técnica de adquisición multimodal, que es esencial para el diseño de interacciones inteligentes y la creación de mapas visuales comprensibles.

Tabla 1 presenta las estructuras clave de los conjuntos de datos multimodales de emociones utilizados en el método propuesto. Para obtener un rango más amplio de sentimientos relacionados, como palabras habladas, entonaciones vocales y expresiones faciales, CH-SIMS y CMU-MOSEI integran modalidades de video, audio y texto provenientes de estos conjuntos de datos. Además, el número de muestras de datos disponibles en CH-SIMS es limitado, lo que permite un examen exhaustivo de las interacciones entre modalidades y la variación emocional en China. Por otro lado, el conjunto de datos CMU-MOSEI es más importante para evaluar la robustez del aprendizaje de representaciones y los algoritmos de visualización relacionados tratados en este trabajo, ya que contiene una gran cantidad de datos en diversos idiomas, sujetos y niveles de emoción anotados. Asimismo, en comparación con investigaciones anteriores, reduce las dificultades en la selección de información al probar modelos.

Preprocesamiento y sincronización multimodal

Las anotaciones de marca de tiempo de los conjuntos de datos CH-SIMS y CMU-MOSEI se utilizaron para sincronizar las modalidades textual, auditiva y visual, asegurando un aprendizaje coherente de representación multimodal. Cada emisión funcionó como la unidad fundamental de análisis y se asoció con segmentos de audio y video correspondientes dentro del mismo intervalo temporal. La alineación se realizó a nivel de emisión. La transcripción se dividió en segmentos según las marcas de tiempo de inicio y finalización de cada emisión. Se estableció la correspondencia entre transcripción, audio y video extrayendo los fotogramas de video y las señales de audio que caían dentro del mismo intervalo de tiempo. Mientras que los segmentos de audio se procesaron utilizando Wav2Vec 2.0 para generar representaciones acústicas, los fotogramas visuales del segmento de video se muestrearon a una tasa predeterminada y se codificaron usando el Transformador de Visión (ViT). El codificador RoBERTa se utilizó para crear embeddings textuales a partir de las transcripciones de las emisiones. La sincronización temporal se logró alineando todas las características de modalidad a un único límite de emisión, ya que las tres modalidades producían secuencias de características de longitudes variables. Se utilizó un formato de longitud fija para normalizar secuencias de longitudes distintas. Las secuencias más largas se acortaron a la longitud máxima permitida, mientras que las secuencias más cortas se rellenaron con ceros. Durante el entrenamiento, se utilizaron máscaras de atención para separar los elementos rellenados de las posiciones de características válidas. Los embeddings específicos de cada modalidad se proyectaron en un espacio latente común antes de la fusión, con el fin de superar las diferentes longitudes de secuencia entre modalidades. Esto garantizó la consistencia dimensional y permitió que el mecanismo de atención basado en grafos facilitara un aprendizaje eficaz de interacción cruzada entre modalidades. Para preservar la calidad de los datos y la integridad de la sincronización, se excluyeron de los estudios las muestras con archivos dañados, anotaciones faltantes o información incompleta de modalidad.

Extracción de características basada en transformadores

Se utiliza un método de aprendizaje profundo para aprender representaciones de características de alto nivel conscientes de las emociones a partir de información de múltiples modalidades, como visión, audio y texto, de manera integral, tras alinear los datos multimodales y realizar cualquier preprocesamiento necesario. Al emplear un codificador transformador para aprender representaciones de características intrínsecamente discriminativas a partir de datos multimodales crudos, el método propuesto elimina la necesidad de ingeniería de características. Para facilitar la coherencia entre los conjuntos de datos utilizados en el enfoque propuesto, se aprende un incrustado (embedding) de tamaño fijo para cada modalidad. Por ejemplo, se aprenden incrustados de características de 768 dimensiones en cada una de las modalidades individuales, incluyendo imágenes, audio y texto, formando colectivamente un espacio de características unificado utilizado en todo el enfoque, particularmente un enfoque de extracción de características aplicado al conjunto de datos CH-SIMS propuesto y al conjunto de datos CMU-MOSEI para aprender características de alto nivel a partir de datos de diversos tamaños.

Modalidad visual: Transformador de visión para incorporaciones de fotogramas con reconocimiento emocional

Se utilizó un modelo de Transformador de Visión (ViT-Base) para extraer información visual de los fotogramas de video con el fin de obtener representaciones espaciales relevantes para las emociones. Antes de extraer las características, los fotogramas de cada segmento de video se redimensionaron a (224 × 224) píxeles y se muestrearon a intervalos temporales regulares. Mediante un tamaño de parche de 16 × 16 píxeles, la arquitectura ViT-Base produce una serie de tokens visuales que son procesados por 12 capas codificadoras de transformador. Las representaciones a nivel de fotograma recuperadas se proyectaron en un espacio de incrustación de 768 dimensiones utilizando un modelo ViT previamente entrenado como base visual. Las incrustaciones a nivel de fotograma se agregaron mediante promediar agrupación (mean pooling) para crear la representación visual final de cada segmento. Durante el entrenamiento, se utilizaron normalización de imágenes y métodos comunes de aumento, como recorte aleatorio y volteo horizontal, para mejorar la generalización. Luego, se utilizó el marco propuesto de fusión multimodal para combinar estas incrustaciones visuales con representaciones textuales y auditivas.

Para mantener la dinámica temporal en la emoción, se tomarán muestras uniformemente de los videos de los conjuntos de datos CH-SIMS y CMU-MOSEI para la modalidad visual. Los fotogramas de cada video, figure-protocol-1, pueden dividirse en N secciones de tamaño fijo, que luego se aplanan y transfieren inversamente a un espacio de incrustación latente con dimensión figure-protocol-2. Se crea una serie mediante la adición de incrustaciones posicionales y un token de agrupación aprendible:

figure-protocol-3   (1)

donde figure-protocol-4  representa la codificación posicional y figure-protocol-5  es la matriz de incrustación de fragmentos.

Se utilizan capas codificadoras de transformador apiladas, compuestas por redes de alimentación directa y autoatención multi-cabeza, para procesar la secuencia de fragmentos incrustados. La transformación en la capa l se describe como:

figure-protocol-6   (2)

figure-protocol-7   (3)

Para obtener el vector de características visuales consciente de las emociones, se extrae la salida equivalente al token de clase como vector de características figure-protocol-8. Para abordar representaciones visuales de emociones consistentes a pesar de las diferencias lingüísticas y de contenido entre conjuntos de datos, se combinan los embeddings a nivel de cuadro de cada segmento de video con el fin de capturar las expresiones faciales y la evolución de las emociones.

Modalidad de audio utilizando Wav2Vec 2.0 para prosodia e incrustaciones acústicas semánticas Se generaron incrustaciones de habla contextualizadas utilizando un codificador Wav2Vec 2.0 previamente entrenado como base acústica. Se obtuvo un vector de características acústicas de longitud fija para cada frase mediante la agregación de las representaciones ocultas de salida utilizando promediado. El modelo Wav2Vec 2.0 se utilizó para extraer representaciones acústicas de señales de audio con el fin de capturar características del habla contextualmente relevantes y relacionadas con la emoción. Antes de la extracción de características, las grabaciones de audio se normalizaron y remuestrearon a 16 kHz. Para garantizar la sincronización entre las modalidades textual y visual, cada segmento de audio a nivel de enunciado se aisló utilizando los límites de marca de tiempo proporcionados por las anotaciones del conjunto de datos. El codificador acústico previamente entrenado se ajustó durante el entrenamiento del modelo para mejorar la adaptación específica a la tarea, permitiendo que las representaciones derivadas reflejen con mayor precisión los aspectos emocionales de las señales de habla. Luego, se realizó una fusión de atención multimodal basada en grafos y un aprendizaje de representaciones desacopladas utilizando las incrustaciones de audio finales.

En la modalidad de audio, se utiliza Wav2Vec-2.0 para modelar las señales de voz derivadas de la información inicial del habla en los conjuntos de datos CH-SIMS y CMU-MOSEI, extrayendo directamente características de audio relacionadas con la emoción. Existe una codificación de características convolucional para cada señal de voz de entrada figure-protocol-9:

figure-protocol-10   (4)

donde Z representa rasgos prosódicos de bajo nivel como melodía, tono y energía. Una red contextual basada en transformadores es útil para las estructuras mencionadas anteriormente, ya que representa dependencias temporales de largo alcance:

figure-protocol-11   (5)

Los datos acústicos prosódicos y semánticos, que son esenciales para expresar emociones, se incluyen en estas representaciones acústicas contextuales. Se crea un embedding de audio de longitud específica mediante un procedimiento de agrupación temporal:

figure-protocol-12   (6)

El diseño evita el uso de características acústicas como los MFCC y logra durabilidad utilizando datos de habla en inglés del CMU-MOSEI y datos de habla en chino del CH-SIMS, simplemente extrayendo representaciones de las formas de onda.

Modalidad de texto utilizando RoBERTa para incrustaciones contextuales de emociones

Para la modalidad textual, se aplica el transformador bidireccional profundo RoBERTa a las transcripciones de habla de los dos conjuntos de datos para generar semántica contextual y significado afectivo. Se utilizaron codificadores transformadores basados en RoBERTa para extraer representaciones textuales de los datos de transcripción y capturar información semántica contextual y emocional. Se empleó un modelo RoBERTa preentrenado para el conjunto de datos CMU-MOSEI en inglés, mientras que se utilizó una variante de RoBERTa en chino para el conjunto de datos CH-SIMS en chino, con el fin de considerar mejor las características lingüísticas específicas del idioma. El preprocesamiento del texto incluyó la tokenización mediante el tokenizador RoBERTa adecuado para cada idioma y la normalización del texto. Para garantizar un procesamiento por lotes consistente, las secuencias de entrada se convirtieron en incrustaciones de tokens y se rellenaron o recortaron hasta una longitud máxima de secuencia predeterminada. De acuerdo con el formato de entrada de RoBERTa, se introdujeron tokens especiales de clasificación y separación. Se obtuvo una incrustación textual de longitud fija mediante la agregación de las representaciones de tokens contextualizadas producidas por el codificador transformador, utilizando la representación final de oración equivalente a [CLS]. Para adaptar las representaciones aprendidas a la tarea de reconocimiento de emociones, los codificadores RoBERTa preentrenados se refinaron mediante entrenamiento multimodal. Luego, se utilizó el marco propuesto de fusión multimodal para combinar las incrustaciones textuales con las características auditivas y visuales.

Las incrustaciones de tokens y las codificaciones de posición se pueden combinar para cada entrada tokenizada, figure-protocol-13, para crear la representación de entrada en la técnica de transformación profunda bidireccional conocida como

figure-protocol-14   (7)

Esta forma se representa mediante las capas del transformador L, que utiliza la autoatención para descubrir las dependencias de contexto entre palabras:

figure-protocol-15  (8)

La incorporación del contexto emocional se obtiene utilizando el estado oculto final del token de clasificación:

figure-protocol-16   (9)

La polaridad del sentimiento, las emociones intensas y las implicaciones asociadas son ejemplos de características lingüísticas relacionadas con las emociones que serán representadas por esta incrustación. RoBERTa facilita la modelización independiente del idioma. Esto permite al sistema utilizar el mismo tamaño de incrustación tanto para textos en inglés del conjunto de datos CMU-MOSEI como para textos en chino del conjunto de datos CH-SIMS.

Se extraen tres vectores de características específicas de modalidad de 768 dimensiones, cada uno correspondiente a las modalidades visual fv, auditiva fa y textual ft , mediante el paso propuesto de aprendizaje de representación de características profundas. En el diseño de interacción inteligente, estas representaciones aprendidas crean un espacio unificado de características multimodal que sirve como base para la asignación visual a nivel de características, la fusión cruzada de modalidades basada en grafos y el aprendizaje de representaciones desacopladas.

Aprendizaje de representación desenredada

Después de aprender una representación de características profundas, un procesamiento adicional de los vectores de características multimodales provenientes de las modalidades visual, auditiva y textual puede generar una descripción emocional desarticulada. Si las incrustaciones de características específicas de cada modalidad —auditiva, visual y textual— utilizadas en el paso anterior se representan mediante fv, fa y ft, respectivamente, de tal manera que figure-protocol-17  y figure-protocol-18, el objetivo de este paso consiste en factorizar todas las características modales en dos representaciones latentes distintas, que incluyen las representaciones emocionales tras considerar la semántica previa de cada una de las diferentes modalidades.

Esto se logra alimentando cada característica de modalidad, fm , a dos redes de proyección paralelas: un codificador de emociones figure-protocol-19  y un codificador de modalidad figure-protocol-20, donde se generan las dos codificaciones.

figure-protocol-21  (10)

Donde figure-protocol-22 la característica latente asociada con la emoción está representada por figure-protocol-23 representa una característica latente específica de una modalidad. Esto permite que los embeddings específicos de la emoción se comuniquen con un espacio de manera repetida a través de múltiples entradas, incluyendo audio, visual y texto, al tiempo que conservan los datos estructurales únicos asociados con cada modalidad.

Se logra una separación efectiva mediante la reconstrucción con restricciones de independencia. La reconstrucción de la característica original de la modalidad se da mediante:

figure-protocol-24  (11)

donde figure-protocol-25  es una red decodificadora. La pérdida de reconstrucción conserva los siguientes datos:

figure-protocol-26   (12)

Además, la ortogonalidad, o decorrelación, entre la emoción y las representaciones específicas de la modalidad a menudo limita la superposición de información:

figure-protocol-27   (13)

Al alcanzar estos objetivos, el modelo podría aprender representaciones de emociones que sean confiables, comprensibles y resistentes a la variabilidad de la modalidad. Las fusiones posteriores basadas en grafos entre modalidades y las características de mapeo visual, especialmente para el diseño de interacciones inteligentes, dependen en gran medida de representaciones emocionales interpretables y estructuradas.

Coincidencia emocional entre modalidades

La incorporación de la consistencia emocional mejora claramente la eficacia de la fusión entre las modalidades. Esto se debe a que las estrategias de fusión no necesitan compensar grandes diferencias entre las dos representaciones, ya que los embeddings emocionales específicos de cada modalidad comparten un espacio latente. La ilustración combinada de las dos emociones se describe a continuación figure-protocol-28. La fusión ponderada será más estable cuando las representaciones específicas de la emoción sean consistentes, porque las variaciones entre las señales provenientes de distintas modalidades ya no afectarán el resultado.

figure-protocol-29   (14)

Al exigir el alineamiento semántico de la información emocional, este objetivo minimiza las discrepancias entre modalidades y asegura que la percepción emocional permanezca consistente independientemente de la modalidad utilizada para expresarla. En consecuencia, se crea un espacio de representación coherente y afectivo mediante la proyección de las señales emocionales obtenidas de las señales de habla, expresiones faciales y contenido lingüístico.

Impacto en la fusión cruzada modal

La fusión multimodal se vuelve más efectiva cuando se introduce consistencia emocional entre las modalidades. Los mecanismos de fusión ya no tienen que compensar grandes brechas en las representaciones intermodales, ya que los embeddings específicos de la emoción están alineados en un espacio latente común. La representación emocional fusionada se define de la siguiente manera:

figure-protocol-30  (15)

Donde αm representa el peso de la atención asignado a la modalidad m. La fusión ponderada se vuelve más estable y comprensible cuando las representaciones específicas de la emoción son coherentes, ya que el resultado de la fusión muestra evidencia emocional complementaria en lugar de señales modales contradictorias.

Matemáticamente, reducir la figure-protocol-31 varianza entre varios tipos de representaciones específicas de emociones con respecto a figure-protocol-32 es equivalente a:

figure-protocol-33   (16)

donde figure-protocol-34  representa la expresión media de la emoción. Una varianza reducida hace que las modalidades de entrada se ponderen según su significado emocional preciso en lugar del ruido de la modalidad, lo que garantiza una convergencia de la red mejorada y una evaluación de la atención más precisa.

El objetivo final de aprendizaje de las visualizaciones de emociones desacopladas es combinar la fragmentación, la reconstrucción y la uniformidad emocional:

figure-protocol-35   (17)

que dos hiperparámetros, λ1 y λ2, controlan la relación entre la fiabilidad emocional cruzada y la disociación. El modelo propuesto obtiene representaciones emocionales invariantes a la modalidad, interpretables y fusibles para lograr esto, haciendo hincapié en proporcionar una base sólida para la fusión basada en grafos y la representación a nivel de características en el diseño de interfaces inteligentes.

Fusión de atención multimodal basada en grafos

Se utilizó una red de atención multimodal basada en grafos para simular relaciones emocionales finamente detalladas entre modalidades. Para facilitar el flujo de información entre modalidades, se construyó un grafo multimodal completamente conectado, en el que cada representación específica de una modalidad (texto, audio y visual) se representó como un nodo del grafo. Las relaciones entre modalidades se emplearon para establecer la matriz de adyacencia del grafo, la cual luego se mejoró mediante un método de atención aprendible. Se creó un espacio latente compartido mediante la concatenación y proyección de las salidas de varias cabezas de atención. Una representación unificada de la emoción multimodal se generó entonces al agregar las representaciones de los nodos utilizando un agrupamiento ponderado por atención. Este vector fusionado fue enviado posteriormente a los módulos de predicción y visualización para el análisis sensible a interacciones y el reconocimiento emocional. El módulo de fusión basado en grafos tenía una dimensión de representación oculta de 256 y dos capas de atención gráfica, cada una con ocho cabezas de atención. Para determinar la importancia relativa de las modalidades vecinas, se calcularon y normalizaron los coeficientes de atención entre nodos conectados mediante la función softmax. Cada capa de atención gráfica fue seguida por normalización por capas, conexiones residuales y una tasa de abandono (dropout) de 0,2 para aumentar la estabilidad del entrenamiento y reducir el sobreajuste. Tras concatenar y proyectar las salidas de varias cabezas de atención hacia un espacio latente común, las representaciones de los nodos se combinaron en un único vector de emoción multimodal mediante agrupamiento ponderado por atención. Posteriormente, esta representación fusionada se utilizó para la predicción emocional y la proyección visual multimodal.

Se capturaron diversas interacciones multimodales utilizando una atención gráfica multi-cabeza. Se utilizó la función softmax para normalizar los coeficientes de atención entre nodos conectados para cada nodo. Para aumentar la estabilidad durante el entrenamiento y evitar el sobreajuste, a las capas apiladas de atención gráfica del módulo de fusión gráfica se les añadieron conexiones residuales, normalización por capas y regularización por eliminación aleatoria.

Consideremos que los términos figure-protocol-36  representan individualmente las representaciones correspondientes a las emociones particulares recopiladas por las modalidades visual, auditiva y textual; cada componente se encuentra dentro del espacio latente compartido figure-protocol-37. Los modelos para los nodos de modalidad utilizan una notación para el grafo figure-protocol-38, con los nodos de la colección figure-protocol-39  correspondientes a los tres nodos de modalidad mismos, con el fin de reforzar explícitamente las dependencias emocionales compartidas entre las diversas representaciones de modalidad.

Después de asignar un vector de características específico de la emoción a cada nodo en el grafo, tenemos:

figure-protocol-40   (18)

A diferencia de los métodos tradicionales de fusión, que utilizan pesos de fusión predeterminados o fijos, el método propuesto aprende pesos de borde adaptativos según su importancia y dependencias, tanto entre canales como entre situaciones emocionales.

Se utiliza una red de atención gráfica (GAT) para la fusión multimodal. Se calcula un coeficiente de atención para cada nodo i y sus nodos vecinos, es decir, el nodo j:

figure-protocol-41   (19)

El efecto emocional de cambiar del modo j a la modalidad i se mide mediante los pesos normalizados αij.

A continuación, se calcula la apariencia fusionada de cada nodo de modalidad como un agrupamiento ponderado de sus vecinos:

figure-protocol-42   (20)

donde la función de activación figure-protocol-43  es no lineal. En última instancia, las características actualizadas de cada nodo se combinan para obtener una representación emocional global fusionada:

figure-protocol-44   (21)

Es una técnica útil para la modelización de emociones interpretable y la posterior representación visual, ya que captura información complementaria de diversas modalidades al tiempo que conserva las complejas relaciones intermodales.

El algoritmo 1 (Archivo Suplementario 1) proporciona el esquema general para llevar a cabo la fusión multimodal basada en grafos. Inicialmente, se crea un grafo con las características específicas de cada emoción vinculadas a las modalidades visual, auditiva y textual. Luego, se calculan las puntuaciones de atención para cada par de nodos del grafo, que representan la combinación de dependencia emocional. A continuación, las puntuaciones de atención se normalizan para indicar la contribución relativa de cada modalidad al contexto emocional especificado, lo que permite el aprendizaje de los pesos de atención. La incrustación general de emociones se genera en la última etapa mediante la agregación de las características asociadas a los nodos del grafo. En este sentido, la fusión general del algoritmo de las características multimodales vinculadas a las emociones especificadas muestra potencial en cuanto a adaptabilidad, interpretabilidad e inteligencia contextual.

Figura 2 muestra la estructura y el funcionamiento de la red propuesta de atención cruzada modal para la fusión de sentimientos multimodal. Los embeddings específicos de emoción, derivados independientemente para las modalidades de texto, auditiva y de video, pasan inicialmente por mecanismos de atención a nivel de modalidad que aprenden la importancia relativa de la información lingüística, vocal y facial en un contexto emocional determinado. Las representaciones ponderadas por la atención de las modalidades se combinan luego para formar un embedding emocional unificado, en el cual la matriz de atención captura las dependencias intermodales y las intensidades de interacción. La matriz de atención aprendida por la red modula dinámicamente las contribuciones de las modalidades, permitiéndole enfocarse en la modalidad instructiva más fuerte mientras ignora aquellas ruidosas o menos informativas. La representación emocional fusionada permite un reconocimiento preciso de emociones y un análisis detallado de estados emocionales como neutralidad, abrazo y preocupación.

Módulo de mapeo visual

Con la ayuda de la sección de mapeo visual, creada específicamente para este fin, un diseñador de interacciones inteligente puede convertir la representación unificada del estado emocional en una forma visual comprensible y fácilmente digerible tras el proceso de fusión cruzada de modalidades, basándose en el gráfico.

Para facilitar la comprensión de las representaciones emocionales latentes, se utilizaron técnicas de reducción de dimensionalidad para visualizar los embeddings multimodales de emociones aprendidos. Después de reducir la dimensionalidad de las características manteniendo la mayor parte de la varianza mediante el Análisis de Componentes Principales (PCA), los embeddings se proyectaron en un espacio bidimensional para su visualización usando el método t-Stochastic Neighbor Embedding (t-SNE). Para t-SNE se utilizó un valor de perplejidad de 30, una tasa de aprendizaje de 200 y 1.000 iteraciones de optimización. Mediante las proyecciones obtenidas se visualizaron agrupaciones específicas de emociones y las relaciones entre modalidades. Los pesos normalizados de atención cruzada obtenidos por la red de atención basada en grafos se utilizaron para crear mapas de calor de atención. En estos mapas de calor se representan las contribuciones relativas de las modalidades textual, de audio y visual durante la predicción de emociones. Los coeficientes de atención aprendidos se utilizaron como pesos de los enlaces para crear grafos de interacción cruzada, lo que permitió examinar visualmente las relaciones intermodales y el flujo de información dentro del marco de fusión. Se generaron gráficos de trayectoria emocional mediante el seguimiento del desarrollo de los embeddings latentes de emociones a lo largo de enunciados sucesivos para examinar la dinámica emocional temporal. Estas trayectorias aportan información sobre cómo evolucionan los estados emocionales y las contribuciones de las modalidades a lo largo del tiempo. Todos los gráficos se crearon utilizando paquetes de Python como Matplotlib y Scikit-learn. Para evaluar la interpretabilidad, la formación de clústeres, las contribuciones modales y la dinámica emocional temporal, se realizaron análisis cualitativos de las visualizaciones de embeddings, los grafos de interacción y los mapas de calor de atención.

Sea la variable figure-protocol-45  que represente la representación fusionada del estado emocional mediante la función de red de atención gráfica. A diferencia de la visualización a nivel de salida de las gráficas de estado emocional, el objetivo principal del módulo consiste en convertir las representaciones del estado emocional y los pesos correspondientes del mecanismo de atención en una forma visual comprensible.

Utilizando el valor aprendido de αji, se crea un mapa de calor de atención para examinar visualmente la contribución de cada modalidad. Luego, los pesos de atención entrantes se suman para determinar una puntuación de importancia compuesta para cada modalidad:

figure-protocol-46    (22)

donde si representa la contribución emocional relativa de la modalidad I. Para ayudar a crear un mapa de calor de atención, los valores obtenidos se normalizan y se asignan a un mapa de colores que facilita al usuario identificar la modalidad predominante en diferentes pasos temporales o estados interactivos. A través de diversas modalidades de entrada visual, auditiva o textual, dicha interfaz ayuda al usuario a comprender cómo funciona el mecanismo de atención del sistema.

El grafo aprendido se modela específicamente como un «grafo de interacción ponderado» para representar la dependencia cruzada de modalidades en las emociones humanas. Cada modalidad se representa mediante un nodo en el grafo, y la intensidad de las interacciones relacionadas con las emociones humanas se representa mediante pesos en forma de αji en las aristas que los conectan. El grafo ponderado anterior ilustra la intensidad de las interacciones emocionales humanas. La definición de i y j es:

figure-protocol-47   (23)

El grosor o la transparencia de las líneas en la visualización del grafo se muestran adecuadamente gracias a estos pesos. Esto facilita la comprensión de cómo interactúan las modalidades. El diseñador puede comprender mejor cómo interactúan los indicadores emocionales durante el proceso de fusión con la ayuda de los gráficos de interacción cruzada entre modalidades.

Los embeddings de emociones fusionados figure-protocol-48 en varios pasos de tiempo se reducen a un espacio de menor dimensionalidad mediante un algoritmo de reducción de dimensionalidad, como PCA o t-SNE, con el fin de mostrar la evolución de las emociones temporales:

figure-protocol-49   (24)

donde la función de proyección está representada por figure-protocol-50. La aparición de trayectorias emocionales 2D/3D, que muestran transiciones emocionales, intensidades y estabilidad en las interacciones, puede interpretarse como una representación intuitiva de la evolución de los estados emocionales a lo largo del tiempo. Estos aspectos pueden utilizarse para la interacción inteligente, la toma de decisiones y la monitorización en tiempo real.

A diferencia de los sistemas convencionales de emociones que simplemente proporcionan asignaciones a clases o puntuaciones específicas, este sistema se centra en demostrar cómo se forman las emociones humanas dentro de él. Revela su proceso de toma de decisiones mediante visualizaciones de características intermedias, incluyendo factores de ponderación, interacciones entre modelos y sus trayectorias correspondientes. Esto permite al usuario comprender cómo cada factor—visual, vocal o lingüístico—influye en la generación de sus respuestas ante la emoción humana.

Asignar emociones a formas comprensibles mediante representaciones visuales puede, por tanto, cerrar la brecha entre el análisis de emociones utilizando métodos de aprendizaje profundo y su integración en el diseño de interfaces inteligentes. Los datos recopilados a partir de ambos enfoques pueden utilizarse entonces para crear interfaces de usuario más precisas. Así, el enfoque propuesto puede proporcionar a los diseñadores de interacción información esencial para desarrollar interfaces de usuario más precisas. Dicho de otro modo, la comprensión de las emociones se convierte en una parte muy activa del diseño de interacción. La precisión solo puede aumentar cuando la comprensión de las emociones se incorpora activamente al diseño de interacción.

El módulo de mapeo visual posibilita la explicabilidad de varias formas interconectadas pero diferentes: la explicabilidad a nivel de características revela las representaciones subyacentes de la emoción creadas por la red neuronal profunda (DNN), permitiéndonos comprender la semántica utilizada para describir cada característica relacionada con la emoción; la explicabilidad a nivel de modalidad utiliza datos provenientes de los gráficos de interacción y los mapas de calor de atención visual para describir cómo cada modalidad —visual, auditiva o textual— contribuye a las decisiones tomadas para expresar emociones; y finalmente, las trayectorias resultantes del incrustado de emociones nos permiten entender cómo cambia cada modalidad visual y textual a lo largo del tiempo desde una perspectiva de interacción dinámica. Consulte el Algoritmo 2 (Supplementary File 1).

Las características emocionales multimodales fusionadas se asignan a representaciones visualmente significativas para el diseño de interacción inteligente mediante el algoritmo de asignación visual propuesto, Algoritmo 2. Los pesos de atención multimodal basados en grafos se utilizan para cuantificar las diferencias entre los elementos visuales, auditivos y textuales de entrada en cada paso temporal. Estas diferencias luego se asignan a representaciones visuales para resaltar las principales fuentes que influyen en las emociones, utilizando elementos visuales de mapa de calor. Para ofrecer una visión informativa de la interacción entre los elementos de entrada y transmitir la evolución emocional generada por los elementos de entrada multimodales, se calculan entonces las intensidades de interacción por pares para crear los pesos de interacción multimodal. Al mismo tiempo, se genera una vista de la evolución emocional mediante la proyección de los elementos emocionales fusionados acumulados a lo largo del tiempo en un espacio de baja dimensionalidad, produciendo así una evolución continua del elemento emocional.

Predicción de emociones y retroalimentación de la interacción

El resultado de la representación de emoción fusionada, representado como figure-protocol-51, se utiliza entonces como una función tanto para la retroalimentación de la interacción como para la predicción de emociones. Además, la predicción de emociones se describe como un modelo multitarea que comprende una tarea de regresión para el reconocimiento de la intensidad de la emoción continua y una tarea de clasificación para el reconocimiento de emociones discretas. El siguiente modelo de clasificación basado en softmax se utiliza para el reconocimiento de emociones discretas:

figure-protocol-52   (25)

donde figure-protocol-53 representa las probabilidades esperadas de las clases de emociones y Wc y bc son restricciones aprendibles. Se utiliza la pérdida de entropía cruzada para mejorar el objetivo de clasificación:

figure-protocol-54  (26)

donde yk es la etiqueta real, y K es el número de clases de emociones. Se utiliza una rama de regresión para estimar la intensidad emocional en paralelo, generando una predicción de diversos atributos afectivos continuos, incluyendo valencia y activación. Asígnale la siguiente definición:

figure-protocol-55   (27)

donde el puntaje esperado de intensidad emocional está indicado por figure-protocol-56. Se utiliza la pérdida del error cuadrático medio para mejorar la tarea de regresión:

figure-protocol-57   (28)

En general, las dos tareas se combinan en el objetivo de predicción:

figure-protocol-58   (29)

donde los objetivos de regresión y clasificación están equilibrados por λ. Se sugiere una modificación dinámica del módulo de visualización basada en el estado emocional identificado para permitir este tipo de retroalimentación sensible a la interacción. El contexto de interacción en un momento dado t se representa mediante ct. La respuesta del módulo de visualización se proporciona mediante:

figure-protocol-59    (30)

donde la función de adaptación de visualización está representada por figure-protocol-60. Esto permite ajustar las mapas de calor de modalidad, los gráficos de interacción y las trayectorias emocionales en tiempo real según los cambios y emociones anticipados. Esto indica que el sistema proporciona un apoyo considerable para la retroalimentación, además de desempeñarse bien en la predicción del estado emocional.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo valida el marco propuesto de mapeo visual para características emocionales multimodales en términos de interpretabilidad sensible a la interacción y rendimiento predictivo, utilizando dos conjuntos de datos de referencia, CH-SIMS y CMU-MOSEI. Según los resultados experimentales, el enfoque sugerido tiene un desempeño consistentemente superior al de las técnicas actuales de reconocimiento emocional multimodal en una variedad de métricas, incluyendo correlación, exactitud, puntuación F1 y error absoluto medio (MAE). La representación emocional desentrañada, el mecanismo de fusión multimodal basado en grafos y la estrategia de aprendizaje de representación profunda de extremo a extremo contribuyen a esta mejora al permitir una modelización emocional más estable y semánticamente alineada. El enfoque propuesto proporciona información más rica a nivel de características mediante el mapeo visual, lo que va más allá de las ganancias cuantitativas y facilita la comprensión de las contribuciones de cada modalidad y de las dinámicas emocionales. A pesar de las variaciones en el idioma, la expresión cultural y el tamaño del conjunto de datos, se observa de forma consistente la ganancia de rendimiento mencionada en ambos conjuntos de datos, lo que demuestra la fuerte capacidad de generalización del marco sugerido.

En el trabajo propuesto se utilizan los conjuntos de datos públicos CH-SIMS y CMU-MOSEI para emociones multimodales. El conjunto de datos CH-SIMS comprende 2,281 clips de video de películas, series de televisión y programas de variedades. En CH-SIMS están disponibles datos sincronizados de texto, audio y visuales. Tanto las etiquetas de sentimiento unimodal como multimodal se clasifican en categorías positiva, neutral y negativa. El gran conjunto de datos multimodal en inglés conocido como CMU-MOSEI contiene aproximadamente 23,453 clips de video anotados con más de 1,000 hablantes discutiendo una amplia variedad de temas. Este conjunto de datos incluye anotaciones continuas de intensidad emocional, como valencia y activación, así como etiquetas categóricas de emociones. Al apoyar una variedad de condiciones lingüísticas, culturales y emocionales, la experimentación con estos dos conjuntos de datos mediante el marco sugerido fortalece la solidez y confiabilidad. Tabla 2 muestra los detalles del entorno de simulación.

Los principales ajustes experimentales e implementaciones utilizados para evaluar el marco propuesto se resumen en este entorno de simulación. Para garantizar una dimensionalidad uniforme de las características en las modalidades basadas en texto, audio y visual, se aplican codificadores basados en transformadores de manera uniforme. Emplea un mecanismo de atención basado en grafos para la fusión multimodal, lo que permite el aprendizaje adaptativo de las dependencias intermodales respecto a los estados emocionales.

El marco propuesto extrae representaciones textuales, auditivas y visuales utilizando codificadores modales basados en transformadores. Capas completamente conectadas con activación ReLU proyectan los embeddings específicos de cada modalidad en un espacio latente compartido. Luego se utilizan codificadores separados específicos para la emoción y específicos para la modalidad, cada uno con dos capas completamente conectadas y activación y normalización no lineales, para aprender representaciones desacopladas. Las representaciones latentes se proyectan en un espacio de características de 256 dimensiones, donde se aprende por separado la información de cada modalidad y emoción. Para mantener la información de la modalidad y promover un desacoplamiento eficiente, se emplean decodificadores de reconstrucción. Antes de la fusión multimodal y la predicción, el módulo de atención cruzada basado en grafos modela las dependencias emocionales entre modalidades utilizando las representaciones latentes. La red se entrenó utilizando el optimizador Adam con una tasa de aprendizaje inicial de 1 × 10⁻4 y un tamaño de lote de 32. Se aplicó la detención temprana basada en la pérdida de validación para prevenir el sobreajuste. La función objetivo total comprendió pérdidas de clasificación, reconstrucción y consistencia de representación, cada una ponderada por hiperparámetros ajustables. El entrenamiento del modelo se realizó durante un máximo de 100 épocas, y se conservó el modelo con mejor desempeño en el conjunto de validación para las pruebas.

El marco propuesto se evaluó utilizando métricas de clasificación, incluyendo Exactitud, Precisión, Exhaustividad y puntuación F1, junto con métricas de regresión como el Error Absoluto Medio (MAE). La Precisión, la Exhaustividad y la puntuación F1 se calcularon utilizando promedio macro para tener en cuenta el desequilibrio de clases entre las categorías emocionales. Para los experimentos de clasificación, las etiquetas predefinidas de emoción/sentimiento proporcionadas por los conjuntos de datos CH-SIMS y CMU-MOSEI se utilizaron como clases reales. Para la predicción de sentimiento basada en regresión, las puntuaciones continuas de intensidad de sentimiento de los conjuntos de datos sirvieron como variables objetivo. Se generaron matrices de confusión para analizar el rendimiento de la predicción por clase y los patrones de clasificación errónea con un intervalo de confianza del 95 %. Para garantizar la solidez, cada experimento se repitió 5 veces utilizando diferentes inicializaciones aleatorias, y los resultados reportados corresponden al rendimiento medio ±± desviación estándar obtenido en todas las ejecuciones. La significancia estadística se evaluó mediante procedimientos adecuados de prueba de hipótesis, y los intervalos de confianza se calcularon cuando fue aplicable. El tiempo de entrenamiento se midió como el tiempo total transcurrido necesario para la convergencia del modelo en la plataforma de hardware especificada.

Se puede comparar una serie de modelos básicos representativos, incluyendo la fusión temprana y la fusión tardía, con el método propuesto. TFN, métodos basados en LSTM, modelos de fusión multimodal de rango reducido, transformadores multimodales adaptativos y nuevas arquitecturas basadas en atención cruzada modal. Estas líneas básicas reflejan técnicas de vanguardia que se centran principalmente en mejorar la precisión del reconocimiento emocional mediante diversos métodos de fusión. El aprendizaje de representaciones desacopladas del marco sugerido y la fusión basada en grafos mejoran la interpretabilidad y la conciencia de interacción, en contraste con estos métodos, que se concentran principalmente en la predicción a nivel de salida. LSTM Fusion, TFN, Fusión Multimodal de Rango Reducido (LMF), Adaptive-Graph y técnicas basadas en transformadores son ejemplos de modelos básicos implementados utilizando sus repositorios oficiales o implementaciones de referencia públicamente accesibles. Se utilizaron los ajustes originales de hiperparámetros de los autores cuando estuvieron disponibles. Todos los modelos básicos reentrenados se evaluaron utilizando las mismas divisiones de conjuntos de datos, técnicas de preprocesamiento, parámetros de optimización y criterios de evaluación para garantizar una comparación justa. Las tablas comparativas identifican claramente las referencias pertinentes para los datos obtenidos directamente de publicaciones anteriores.

Precisión

Se mide la precisión de la clasificación de emociones discretas tanto en CH-SIMS como en CMU-MOSEI; sin embargo, la tendencia de precisión difiere según las características de los dos conjuntos de datos. Debido a que CH-SIMS es un conjunto de datos de tamaño medio con un número igual de categorías de sentimiento y clips de video cuidadosamente preprocesados, su precisión es alta, lo que sugiere que el modelo puede captar información emocional multimodal sutil con poco ruido. No obstante, clasificar emociones con precisión es un desafío porque CMU-MOSEI es un conjunto de datos a gran escala con hablantes de diversos orígenes. Por lo tanto, además de la capacidad del modelo para identificar el sentimiento, la precisión en el conjunto de datos CMU-MOSEI indica su capacidad para generalizar y resistir una variedad de escenarios de interacción. La mejora en la precisión a través de los dos conjuntos de datos muestra que el enfoque propuesto se generaliza bien en conjuntos de datos de diferentes idiomas, tamaños y niveles de complejidad emocional.

Las precisiones de clasificación del enfoque propuesto y otras líneas base comunes en los conjuntos de datos CH-SIMS y CMU-MOSEI se muestran en la Tabla 3. Como se indica en la Tabla 3, el marco propuesto alcanzó la mayor precisión en ambos conjuntos de datos, CH-SIMS y CMU-MOSEI, superando a la mejor línea base (Adaptive-Graph) en aproximadamente 3,3% y 3,1 puntos porcentuales, respectivamente. Valores más bajos de desviación estándar también indican una mayor estabilidad a lo largo de ejecuciones experimentales repetidas. Los enfoques tradicionales de fusión LSTM presentan menor precisión debido a su capacidad limitada para capturar relaciones complejas entre modalidades. TFN y LMF mejoran la precisión de clasificación mediante la modelación de relaciones entre modalidades.

Puntuación F1

En los problemas de clasificación de emociones, el equilibrio entre recuperación y precisión se mide utilizando el puntaje F1. Por lo tanto, es más adecuado para conjuntos de datos de clasificación de emociones multimodal, que probablemente tengan un número desigual de clases. En las tareas de clasificación de emociones, el equilibrio entre recuperación y precisión se mide mediante el puntaje F1. Dado que se espera que los conjuntos de datos de clasificación de emociones multimodal estén desbalanceados, el puntaje F1 es más apropiado. Cuanto mejor sea el modelo para detectar las clases de emociones, mayor será el puntaje F1.

Figura 3 ilustra la evaluación del puntaje F1 de la técnica propuesta frente a las líneas base en el conjunto de datos CH-SIMS. El puntaje F1 más bajo revela la capacidad limitada del modelo básico basado en LSTM para modelar relaciones emocionales complejas entre modalidades. En la Figura 3 se comparan los puntajes F1 obtenidos por las técnicas evaluadas en el conjunto de datos CH-SIMS. Como se muestra, las arquitecturas más avanzadas basadas en grafos y en transformadores superan sistemáticamente a los métodos tradicionales basados en fusión. El modelo LSTM obtuvo el puntaje F1 más bajo (0,71), seguido por TFN (0,74) y LMF (0,76). El puntaje F1 aumentó aún más hasta 0,79 con Adaptive-Graph, lo que demuestra la utilidad de modelar las conexiones entre modalidades. El marco propuesto superó a Adaptive-Graph en un 3,8 %, a LMF en un 7,9 %, a TFN en un 10,8 % y a LSTM en un 15,5 %, alcanzando un puntaje F1 de 0,82. Estos resultados indican que el mecanismo propuesto de atención cruzada basado en grafos y el aprendizaje de representaciones desacopladas capturan de manera más efectiva la información emocional complementaria a través de las modalidades textual, auditiva y visual, lo que conduce a un mejor desempeño en la clasificación.

Las tendencias relativas son consistentes, aunque todos los métodos muestran una ligera disminución en el puntaje F1 en comparación con CH-SIMS, como se muestra en Figura 4. Los hallazgos muestran una mejora constante en el rendimiento, desde los métodos tradicionales de fusión hasta las estrategias de aprendizaje multimodal basadas en grafos. Los modelos con el puntaje F1 más bajo fueron LSTM (0,69), TFN (0,72) y LMF (0,74). El rendimiento del modelo Adaptive-Graph aumentó hasta 0,77, lo que demuestra cuán bien pueden modelarse las conexiones entre modalidades. El marco propuesto superó a todos los demás enfoques, alcanzando el puntaje F1 más alto de 0,80. La mejora respecto al mejor modelo de referencia, Adaptive-Graph, demuestra la contribución del aprendizaje de representación emocional desacoplado y del mecanismo de atención multimodal basado en grafos para capturar indicadores emocionales complementarios a través de las modalidades textual, acústica y visual. Estos resultados indican que el marco propuesto para el reconocimiento multimodal de emociones es confiable y eficiente. El enfoque propuesto demuestra una mejora significativa tanto frente al enfoque basado en grafos como frente al método tradicional de fusión, confirmando además la sólida capacidad de generalización del método. La mejora en el puntaje F1 en el conjunto de datos CMU-MOSEI demuestra que el enfoque propuesto puede lograr un rendimiento equilibrado en la clasificación emocional incluso en entornos ruidosos y diversos.

Precisión

En los sistemas de comunicación inteligentes, la precisión es crucial porque una señal emocional falsa puede degradar la experiencia del usuario. La proporción de instancias anticipadas con precisión de una emoción específica respecto al número total de casos proyectados como esa emoción se conoce como precisión. Debido a que las representaciones emocionales desacopladas son menos ruidosas y menos propensas a errores de clasificación en la modalidad, el modelo propuesto supera a los modelos de referencia en el conjunto de datos CH-SIMS en Figura 5.

La precisión alcanzada por varias técnicas multimodales de reconocimiento de emociones en los conjuntos de datos CH-SIMS y CMU-MOSEI se compara en la Figura 5. A medida que los modelos avanzan desde técnicas tradicionales basadas en fusión hacia arquitecturas más sofisticadas basadas en grafos, la precisión aumenta progresivamente. El marco propuesto alcanzó la máxima precisión de 0,82 en el conjunto de datos CH-SIMS, con un aumento de la precisión desde 0,71 para LSTM hasta 0,74, 0,76 y 0,79 para TFN, LMF y Adaptive-Graph, respectivamente. En el conjunto de datos CMU-MOSEI, la precisión aumentó desde 0,69 para LSTM hasta 0,72, 0,74 y 0,77 para TFN, LMF y Adaptive-Graph, respectivamente. El enfoque propuesto logró la mayor precisión de 0,80. El marco sugerido incrementó la precisión aproximadamente en un 3,8 % en CH-SIMS y en un 3,9 % en CMU-MOSEI en comparación con la línea base más fuerte (Adaptive-Graph). Estos resultados demuestran que, al capturar información emocional complementaria a través de modalidades textual, acústica y visual, el aprendizaje propuesto de representaciones desacopladas y el mecanismo de atención cruzada basado en grafos reducen eficazmente las predicciones falsas positivas. La atención cruzada basada en grafos también mitiga adicionalmente el impacto de la modalidad irrelevante. La mayor diversidad de hablantes y expresiones lingüísticas en el corpus CMU-MOSEI provoca una ligera disminución de la precisión en todos los modelos.

Recuperación

En las tareas de reconocimiento de emociones, la recuperación, una medida de la capacidad de un modelo para categorizar adecuadamente instancias emocionales que pertenecen a una clase específica, es fundamental porque la falta de información emocional puede afectar negativamente la calidad de la interacción. Un valor de recuperación más alto sugiere que el modelo identifica menos falsos negativos y más expresiones emocionales reales. La recuperación puede considerarse una medida de la eficiencia con la que se extrae la información emocional de modalidades textuales, auditivas y visuales en el contexto del análisis multimodal de emociones.

La ventaja de la técnica propuesta frente a los enfoques de referencia en los conjuntos de datos CH-SIMS y CMU-MOSEI se muestra en la comparación de recuperación en la Figura 6. A medida que los modelos evolucionan desde métodos convencionales basados en fusión hasta estructuras multimodales más sofisticadas basadas en grafos, los resultados muestran consistentemente mejoras en la recuperación. La recuperación en el conjunto de datos CH-SIMS aumentó de 0,70 para LSTM a 0,73, 0,75 y 0,78 para TFN, LMF y Adaptive-Graph, respectivamente; el valor máximo de recuperación de 0,82 fue alcanzado por el marco sugerido. El enfoque propuesto logró la mejor recuperación de 0,80 en el conjunto de datos CMU-MOSEI, donde la recuperación aumentó de 0,68 para LSTM a 0,71, 0,73 y 0,76 para TFN, LMF y Adaptive-Graph, respectivamente. El marco sugerido produjo mejoras relativas de aproximadamente 5,1 % en CH-SIMS y 5,3 % en CMU-MOSEI en comparación con el mejor enfoque de referencia (Adaptive-Graph). Estos resultados indican que, al capturar señales emocionales complementarias a través de modalidades textual, acústica y visual, el aprendizaje propuesto de representaciones desacopladas y el mecanismo de atención multimodal basado en grafos reducen con éxito las predicciones de falsos negativos, mejorando así la identificación de clases emocionales en ambos conjuntos de datos. Debido a que los métodos tradicionales tienen una capacidad limitada para modelar relaciones multimodales complejas, tienden a presentar valores más bajos de recuperación. Al modelar las relaciones modales de forma más explícita, TFN y LMF logran mejoras moderadas. Al simular las relaciones estructuradas entre las modalidades, el método Adaptive-Graph ha mejorado aún más la recuperación. Para ambos conjuntos de datos, el método propuesto alcanza la recuperación más alta, lo que indica su mayor capacidad para detectar instancias emocionales en distintos escenarios de interacción. La mejora es más evidente en el conjunto de datos CMU-MOSEI de mayor escala, lo que demuestra la robustez y la capacidad de generalización del marco propuesto.

Error absoluto medio (MAE)

El error absoluto medio (MAE) se utiliza para evaluar el rendimiento de tareas de predicción de intensidad emocional continua, como la predicción de valencia o activación. A diferencia de la precisión, el MAE refleja mejor la proximidad entre la intensidad emocional predicha y el estado emocional real. Por esta razón, el MAE es más adecuado para conjuntos de datos como CH-SIMS y CMU-MOSEI, que tienen etiquetas afectivas continuas. Un valor de MAE más bajo indica una mayor precisión en la predicción de la intensidad emocional.

La comparación de MAE entre el marco propuesto y los enfoques básicos en los conjuntos de datos CH-SIMS y CMU-MOSEI se muestra en la Tabla 4. Los métodos tradicionales de fusión basados en LSTM tienden a tener valores de MAE más altos debido a su capacidad limitada para modelar dependencias emocionales multimodales complejas. TFN y LMF pueden reducir el MAE mediante la modelación de interacciones multimodales, y el enfoque Adaptive-Graph lo reduce aún más al aprender las relaciones del grafo de modalidades. El marco propuesto logra el MAE más bajo en ambos conjuntos de datos, lo que indica una estimación más precisa de la intensidad emocional. Vale la pena destacar que la mejora es más significativa en el conjunto de datos CMU-MOSEI, donde la variabilidad a gran escala de los datos y las condiciones del hablante hacen que la tarea de predicción sea más desafiante.

Matriz de confusión para el conjunto de datos CH-SIMS

Los métodos básicos de LSTM con fusión temprana y TFN presentan una confusión significativa entre las clases de emociones neutrales y positivas, según las matrices de confusión para el conjunto de datos CH-SIMS. Esto sugiere que estos métodos no son muy buenos para identificar expresiones emocionales multimodales sutiles. Por otro lado, el método propuesto muestra claramente una fuerte dominancia diagonal, con muy pocos elementos fuera de la diagonal, mejorando así la separabilidad entre clases. El mecanismo de aprendizaje de emociones desacoplado del método propuesto garantiza una representación consistente de las emociones a través de las modalidades, y su enfoque de fusión mediante grafos mejora la discriminación entre clases de sentimientos estrechamente relacionadas. Figura 7A–E muestra la matriz de confusión para el conjunto de datos CH-SIMS con varios métodos básicos.

Matriz de confusión para el conjunto de datos CMU-MOSEI

El marco propuesto utiliza incorporaciones de emociones invariantes a la modalidad y pesos de atención adaptativos para reducir significativamente la tasa de clasificación incorrecta, especialmente en entradas emocionalmente ambiguas. Esto confirma que el marco sugerido funciona bien en una variedad de escenarios de interacción multimodal a gran escala. Debido al tamaño del conjunto de datos, la variación entre hablantes y la naturaleza continua de las etiquetas de sentimiento, las matrices de confusión de CMU-MOSEI presentan una tasa de clasificación incorrecta general más alta. Los métodos de referencia muestran un grado considerable de confusión entre diversas categorías emocionales. Figura 8A–E muestra la matriz de confusión para el conjunto de datos CMU-MOSEI con diversos métodos de referencia.

Tiempo de entrenamiento por época

Los compromisos computacionales de las técnicas avanzadas de fusión multimodal se destacan mediante la comparación del tiempo de entrenamiento por época. Debido a los codificadores transformadores y a los mecanismos de atención en grafos, el modelo propuesto requiere un tiempo de entrenamiento ligeramente mayor que los enfoques de fusión sencilla, pero este incremento no resulta inviable. El marco propuesto demostró un rendimiento sólido en conjuntos de datos de referencia para el análisis multimodal de emociones y muestra potencial para su integración en sistemas inteligentes de interacción humano-máquina. Sin embargo, la idoneidad para implementación en tiempo real no fue evaluada en el presente estudio y requiere una investigación adicional mediante análisis de latencia, rendimiento, memoria e implementación. Cabe señalar que la mayor estabilidad en la convergencia, junto con un rendimiento predictivo y de interpretabilidad superior, hacen que el costo computacional adicional sea justificable. Figura 9 muestra el resultado del tiempo de entrenamiento por época para el método propuesto.

Estudio de ablación

Para determinar la influencia de cada elemento importante en el marco propuesto, como el módulo de mapeo visual, la fusión cruzada multimodal basada en grafos y la representación desentrañada de emociones, se realizó un estudio de ablación. Para comprender el impacto, se eliminó cada elemento uno a la vez. Según los resultados experimentales, la estrategia de fusión basada en grafos mejora la modelización de dependencias cruzadas entre modalidades, y la contribución de la representación desentrañada de emociones es la más importante para la estabilidad del rendimiento. El papel auxiliar del módulo de mapeo visual queda validado por el ligero impacto que su eliminación tiene en el rendimiento. Los resultados del estudio de ablación bajo las mismas condiciones de entrenamiento y evaluación se muestran en Tabla 5. La mayor disminución en el rendimiento se observó tras eliminar el módulo de atención cruzada multimodal basado en grafos, lo que redujo la precisión del 81,72 % al 77,88 % y el valor F1 de 0,823 a 0,776. Esto subraya la importancia de modelar interacciones intramodales complejas. El papel del módulo de aprendizaje de representación desentrañada en el aprendizaje de representaciones específicas de emociones robustas quedó demostrado por el hecho de que su eliminación redujo la precisión en 2,78 puntos porcentuales y el valor F1 en 0,032. La principal ventaja del módulo de mapeo visual es la interpretabilidad, más que la precisión en la clasificación, como lo demuestra la ligera disminución en el rendimiento predictivo tras su eliminación. La configuración de Fusión Básica obtuvo el peor desempeño, lo que demuestra que para lograr el mejor rendimiento en el reconocimiento multimodal de emociones se requiere la influencia combinada de todos los módulos propuestos.

DISPONIBILIDAD DE LOS DATOS:

Los conjuntos de datos utilizados en este estudio son conjuntos de datos de referencia disponibles públicamente. El conjunto de datos CMU-MOSEI es proporcionado por el SDK Multimodal de la Universidad Carnegie Mellon y se describe en Zadeh et al. (2018) (https://doi.org/10.18653/v1/P18-1208), con acceso disponible en https://multicomp.cs.cmu.edu/multimodal-language-analysis-in-the-wild-cmu-mosei-dataset-and-interpretable-dynamic-fusion-graph/. El conjunto de datos CH-SIMS se describe en Yu et al. (2020) (https://doi.org/10.18653/v1/2020.acl-main.343) y es accesible públicamente a través de los recursos proporcionados por los autores, incluyendo https://github.com/thuiar/MMSA. Todos los experimentos se realizaron utilizando las versiones oficiales de estos conjuntos de datos. Los datos extraídos en bruto, los archivos de datos procesados, las salidas del preprocesamiento, las particiones de entrenamiento/validación/prueba, las representaciones de características derivadas y los detalles de implementación que respaldan los hallazgos de este estudio están disponibles públicamente en el repositorio Zenodo en https://doi.org/10.5281/zenodo.21124921.

figure-results-1
Figura 1: Diagrama esquemático del marco propuesto para la representación visual de características emocionales multimodales. Ilustración conceptual de la arquitectura general, que muestra la extracción de características multimodales, el aprendizaje de representaciones desacopladas, la fusión de atención multimodal basada en grafos y los componentes de representación visual para el análisis emocional multimodal interpretable. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-2
Figura 2: Diagrama esquemático del flujo de trabajo del protocolo computacional propuesto.
Representación conceptual de la tubería de procesamiento de extremo a extremo, que incluye la adquisición del conjunto de datos, el preprocesamiento, la extracción de características específica por modalidad, la fusión multimodal, la visualización y las etapas de predicción de emociones Haga clic aquí para ver una versión más grande de esta figura.

figure-results-3
Figura 3: Comparación del rendimiento del puntaje F1 en el conjunto de datos CH-SIMS. Valores promedio del puntaje F1 obtenidos de cinco ejecuciones experimentales independientes (n = 5) utilizando diferentes inicializaciones aleatorias de semillas. Las barras de error representan ±± una desviación estándar (DE). Valores más altos del puntaje F1 indican un mejor rendimiento en la clasificación de emociones. Haga clic aquí para ver una versión ampliada de esta figura.

figure-results-4
Figura 4: Comparación del rendimiento en puntuación F1 en el conjunto de datos CMU-MOSEI. Valores promedio de la puntuación F1 obtenidos de cinco ejecuciones experimentales independientes (n = 5) utilizando diferentes inicializaciones de semillas aleatorias. Las barras de error representan ±± una desviación estándar (DE), y los valores correspondientes de media ±± DE se muestran encima de cada punto de datos. Valores más altos de la puntuación F1 indican un mejor rendimiento en la clasificación de emociones. Haga clic aquí para ver una versión ampliada de esta figura.

figure-results-5
Figura 5: Comparación de precisión en los conjuntos de datos CH-SIMS y CMU-MOSEI. Puntuaciones medias de precisión obtenidas por LSTM, TFN, LMF, Adaptive-Graph y el marco propuesto en cinco ejecuciones experimentales independientes (n = 5). Las barras de error representan ±± una desviación estándar (SD) calculada a partir de ejecuciones repetidas con diferentes inicializaciones de semillas aleatorias. El marco propuesto alcanza la mayor precisión en ambos conjuntos de datos, demostrando una mejor discriminación de las clases emocionales mediante un aprendizaje efectivo de características multimodales y una fusión multimodal basada en grafos. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-6
Figura 6: Comparación de recuperación en los conjuntos de datos CH-SIMS y CMU-MOSEI. Puntuaciones medias de recuperación obtenidas por LSTM, TFN, LMF, Adaptive-Graph y el marco propuesto a lo largo de cinco ejecuciones experimentales independientes (n = 5). Las barras de error indican ±± una desviación estándar (DE) derivada de experimentos repetidos. El marco propuesto logra consistentemente la mayor recuperación en ambos conjuntos de datos, lo que indica una capacidad superior para capturar información emocional multimodal y reducir predicciones de falsos negativos. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-7
Figura 7: Matriz de confusión para el conjunto de datos CH-SIMS con varios métodos de referencia. Las filas corresponden a las clases reales de emociones, y las columnas corresponden a las clases predichas. Los valores de las celdas representan el porcentaje de muestras normalizadas con respecto a cada clase real. La matriz de confusión se calculó utilizando la partición de prueba independiente de CH-SIMS. Porcentajes más altos en la diagonal indican una mejor precisión de reconocimiento para la categoría de emoción correspondiente. Matrices de confusión de (A) LSTM con fusión temprana, (B) TFN, (C) LMF, (D) Gráfico Adaptativo y (E) el método propuesto en el conjunto de datos CH-SIMS. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-8
Figura 8: Matriz de confusión para el conjunto de datos CMU-MOSEI con varios métodos de referencia. Las filas representan las etiquetas reales de emociones y las columnas representan las etiquetas predichas. Los valores se reportan como porcentajes normalizados por clase en el conjunto de prueba de CMU-MOSEI. La matriz ilustra tanto las muestras clasificadas correctamente (entradas diagonales) como la confusión entre categorías emocionales (entradas fuera de la diagonal). Matriz de confusión en CMU-MOSEI (A) LSTM con fusión temprana, (B) TFN, (C) LMF, (D) Gráfico adaptativo y (E) Método propuesto en el conjunto de datos CMU-MOSEI. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-9
Figura 9. Comparación del tiempo de entrenamiento por época en conjuntos de datos multimodales de referencia para emociones.
Tiempo medio de entrenamiento por época obtenido a partir de cinco ejecuciones experimentales independientes (n = 5) para los conjuntos de datos CH-SIMS y CMU-MOSEI bajo condiciones idénticas de hardware y software. Las barras de error representan ±± una desviación estándar (SD) calculada a partir de experimentos repetidos utilizando diferentes inicializaciones de semillas aleatorias. Valores más bajos indican una mayor eficiencia computacional, mientras que tiempos de entrenamiento estables entre ejecuciones indican una mejor reproducibilidad y consistencia del entrenamiento. Haga clic aquí para ver una versión ampliada de esta figura.

Conjunto de datosModalidadesNúmero de muestrasIdiomaEtiquetas de emoción/sentimiento
CH-SIMS34Vídeo, Audio, Texto2,281 segmentos de vídeoChinoEtiquetas de sentimiento multimodal y unimodal (negativo, neutral, positivo)
CMU-MOSEI35Vídeo, Audio, Texto~23,453 clips anotadosInglésEtiquetas de intensidad de sentimiento y emoción (continuas y categóricas)

Tabla 1: Descripción del conjunto de datos. Resumen de los conjuntos de datos utilizados en este estudio, modalidades, número de muestras, idioma y etiquetas de emoción/sentimiento para los conjuntos de datos CH-SIMS y CMU-MOSEI.

ComponenteEspecificación
Marco de programaciónPython con PyTorch
Extractor de características visualesVision Transformer (ViT)
Extractor de características de audioWav2Vec 2.0
Extractor de características de textoRoBERTa
Estrategia de fusiónRed de atención cruzada basada en grafos
Dimensión de características768 por modalidad
Optimizador de entrenamientoAdam
Tasa de aprendizaje1.00E-04
Tamaño de lote16
HardwareGPU NVIDIA (por ejemplo, serie RTX)
Conjuntos de datos de evaluaciónCH-SIMS, CMU-MOSEI
Dimensión latente2.56E+02
Dimensión de incrustación768
Función de activaciónReLU
OptimizadorAdam
Tasa de aprendizaje1.00E-04
Tamaño de lote32
Épocas100
Detención tempranaHabilitada
Función de pérdidaClasificación + Reconstrucción + Consistencia

Tabla 2: Entorno de simulación. Configuración experimental y detalles de implementación del entorno de simulación, como especificaciones del modelo, características, optimizador y hardware utilizado.

MétodoPrecisión de CH-SIMS (%)Precisión de CMU-MOSEI (%)
LSTM (Fusión temprana/tardía)72.84 ± 1.1270.35 ± 1.26
TFN74.91 ± 0.9872.68 ± 1.10
LMF76.23 ± 0.8574.12 ± 0.94
Adaptive-Graph78.46 ± 0.7376.89 ± 0.81
Método propuesto81.72 ± 0.6179.94 ± 0.69

Tabla 3: Evaluación de la precisión del método propuesto frente a técnicas de referencia en los conjuntos de datos CH-SIMS y CMU-MOSEI. Los resultados se presentan como media ±± desviación estándar obtenidos a partir de cinco ejecuciones experimentales independientes (n = 5) utilizando distintas inicializaciones de semillas aleatorias. Todos los métodos se evaluaron utilizando particiones idénticas de entrenamiento, validación y prueba de sus respectivos conjuntos de datos para garantizar una comparación justa.

MétodoCH-SIMS MAE ↓CMU-MOSEI MAE ↓
LSTM (Fusión temprana/tardía)0.412 ± 0.0140.465 ± 0.016
TFN0.387 ± 0.0120.439 ± 0.014
LMF0.361 ± 0.0100.412 ± 0.012
Adaptive-Graph0.334 ± 0.0090.379 ± 0.010
Método propuesto0.298 ± 0.0070.341 ± 0.008

Tabla 4: Resultado del error absoluto medio. Los resultados se informan como media ±± desviación estándar obtenido de cinco repeticiones experimentales independientes (n = 5) utilizando diferentes inicializaciones de semillas aleatorias. Todos los métodos se evaluaron utilizando particiones idénticas de entrenamiento, validación y prueba de sus respectivos conjuntos de datos para garantizar una comparación justa. Comparación del error absoluto medio (MAE) para la predicción de intensidad de emociones continuas mediante el marco propuesto y enfoques de referencia en ambos conjuntos de datos.

Variante del modeloPrecisión (%)Puntuación F1
Modelo completo81.72 ± 0.610.823 ± 0.008
Sin desentrelazamiento78.94 ± 0.740.791 ± 0.010
Sin fusión de grafos77.88 ± 0.810.776 ± 0.011
Sin mapeo visual80.11 ± 0.660.807 ± 0.009
Fusión básica74.91 ± 0.980.742 ± 0.013

Tabla 5: Resultado del estudio de ablación con métodos de referencia. Los resultados se presentan como media ±± desviación estándar obtenidos a partir de cinco ejecuciones experimentales independientes (n = 5) utilizando diferentes inicializaciones de semillas aleatorias. Todos los métodos se evaluaron utilizando particiones idénticas de entrenamiento, validación y prueba de sus respectivos conjuntos de datos para garantizar una comparación justa. Comparación del rendimiento entre variantes del modelo, que indica la eficacia del aprendizaje a partir de representaciones desacopladas, la fusión basada en grafos y el módulo de mapeo visual.

Archivo suplementario 1: Algoritmo 1 y Algoritmo 2.Haga clic aquí para descargar este archivo.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los hallazgos experimentales demuestran que, en los conjuntos de datos CH-SIMS y CMU-MOSEI, el marco propuesto de mapeo visual para características emocionales multimodales supera a las técnicas actuales de reconocimiento emocional multimodal. En comparación con los modelos de fusión temprana y tardía, como EF-LSTM y TFN, la técnica propuesta alcanza una mayor precisión y puntuaciones F1, lo que demuestra su robustez para manejar información emocional diversa. La mejora del método puede atribuirse a la representación emocional desacoplada, que suprime el ruido específico de cada modalidad y garantiza la consistencia emocional entre las modalidades visual, de audio y de texto36.

Recientemente, modelos multimodales basados en transformadores como Adaptive Multimodal Transformers37 y MIAR38 han demostrado resultados impresionantes en la modelización de dependencias entre modalidades. No obstante, estos modelos se centran principalmente en la predicción y carecen de mecanismos que permitan la interpretabilidad a nivel de características. Por el contrario, el sistema propuesto combina la atención multimodal basada en grafos con un módulo de mapeo visual, lo que permite un análisis transparente de las interacciones entre modalidades y emociones. Este es un aspecto crucial que actualmente falta en la literatura, donde la inferencia emocional se trata como un proceso de caja negra.

El marco propuesto demostró un rendimiento consistente en los conjuntos de datos de referencia CH-SIMS y CMU-MOSEI. Aunque el marco podría tener aplicaciones potenciales en la interacción inteligente entre humanos y máquinas, el monitoreo de la salud, entornos de aprendizaje adaptativos y otros sistemas con reconocimiento emocional, el presente estudio evaluó el método únicamente bajo condiciones controladas de referencia. No se realizó ninguna implementación en el mundo real, evaluación de interfaz de usuario, estudio de usabilidad ni evaluación con sujetos humanos. Por lo tanto, la efectividad práctica del marco en entornos operativos aún debe investigarse. Los trabajos futuros se centrarán en evaluaciones orientadas a la implementación, estudios centrados en el usuario, análisis de latencia, evaluación del consumo de memoria y el rendimiento en interacciones en tiempo real.

Además, las mejoras de rendimiento en diversos conjuntos de datos cultural y lingüísticamente diversos demuestran la validez del marco propuesto. A diferencia de trabajos anteriores validados en un solo conjunto de datos o en un escenario de interacción específico, el marco propuesto demuestra un rendimiento robusto a través de idiomas, hablantes y expresiones emocionales. Por lo tanto, el marco propuesto es muy adecuado para sistemas prácticos de interacción inteligente que requieren reconocimiento preciso de emociones y toma de decisiones interpretables.

La interpretabilidad del marco propuesto se evaluó mediante un análisis basado en visualización de las representaciones multimodales aprendidas. En concreto, se examinaron los embeddings latentes de emociones, los mapas de atención cruzada entre modalidades, los gráficos de interacción modal y las trayectorias temporales de las emociones para obtener información sobre el proceso de decisión del modelo y las contribuciones de cada modalidad. El objetivo del módulo de mapeo visual es mejorar la transparencia al permitir la observación de las interacciones a nivel de características y de la dinámica emocional. Sin embargo, en el presente trabajo no se incluyeron métricas formales de interpretabilidad, evaluaciones de fidelidad de la atención ni estudios con usuarios. Por lo tanto, los beneficios de interpretabilidad reportados deben interpretarse como evidencia basada en visualización, y no como medidas de explicabilidad cuantitativamente validadas.

Desde un punto de vista teórico, esta investigación aporta las siguientes contribuciones al cómputo afectivo multimodal: propone una forma sistemática de modelar emociones que distingue claramente entre representaciones específicas de la emoción y representaciones específicas de la modalidad. Al garantizar la coherencia emocional entre modalidades en un espacio latente común, el marco propuesto avanza así en la teoría del aprendizaje de representaciones en sistemas multimodales. La incorporación de mecanismos de atención basados en grafos formaliza además las dependencias entre las distintas modalidades al expresar emociones.

Desde una perspectiva práctica, el marco propuesto es muy beneficioso para el diseño de interacciones inteligentes y las interfaces de usuario conscientes de las emociones. El módulo de mapeo visual en el marco propuesto permite a los diseñadores de sistemas comprender el efecto de diversas modalidades en la predicción de emociones, lo cual es muy importante para ellos. El marco propuesto es muy útil para aplicaciones como agentes conversacionales afectivos, sistemas de aprendizaje adaptativos, interfaces de monitoreo de salud y plataformas de evaluación de la experiencia del usuario.

Sin embargo, el marco propuesto tiene algunas limitaciones. El uso de mecanismos de atención en grafos y codificadores tipo transformador añade complejidad, lo cual podría ser problemático para dispositivos con capacidades limitadas. Además, el estudio actual ignora otras señales fisiológicas, como el EEG y el rastreo ocular, en favor de centrarse en modalidades visuales, de audio y de texto. No se evaluó específicamente la eficiencia computacional del marco sugerido para su implementación en tiempo real, a pesar de que logró un rendimiento competitivo en predicción y una mejor capacidad de visualización. Las investigaciones futuras examinarán el rendimiento de la implementación en contextos reales de interacción inteligente, el retardo en la inferencia, el rendimiento, el consumo de memoria y técnicas de compresión de modelos. Para mejorar aún más la precisión del modelado emocional y la capacidad de respuesta de la interacción, las investigaciones futuras se centrarán en desarrollar modelos ligeros, técnicas de optimización en tiempo real e incorporar modalidades adicionales. No se evaluó el rendimiento en implementaciones en tiempo real, y la inclusión de codificadores tipo transformador y métodos de atención basados en grafos incrementa la complejidad computacional. Solo se utilizaron los conjuntos de datos de referencia CH-SIMS y CMU-MOSEI para validar la metodología, lo cual podría introducir sesgos específicos del conjunto de datos y restringir la generalización a otros dominios, idiomas y poblaciones de usuarios. Además, el estudio actual no incluye señales fisiológicas como datos de EEG o rastreo ocular; en cambio, se centra en modalidades visuales, de audio y textuales. Aunque las descripciones detalladas del entorno de implementación y simulación han mejorado la reproducibilidad, actualmente no se dispone públicamente del código fuente ni de los modelos preentrenados.

En este trabajo se utiliza un nuevo marco de mapeo visual para el aprendizaje de características emocionales multimodales destinado al diseño de interacciones inteligentes. El método propuesto integra un aprendizaje de representaciones basado en transformadores de extremo a extremo, un modelado emocional desacoplado y una atención cruzada multimodal basada en grafos, logrando una alta precisión predictiva e interpretabilidad. Los experimentos realizados con los conjuntos de datos CH-SIMS y CMU-MOSEI muestran que el marco propuesto supera a los modelos actuales de reconocimiento emocional multimodal en términos de precisión y puntuación F1. Más importante aún, la solución de mapeo visual propuesta reduce la brecha entre el reconocimiento emocional y la estrategia de interacción, ofreciendo una nueva dirección para el diseño de sistemas interpretables de computación afectiva multimodal conscientes de la interacción.

Para facilitar un diseño de interacción interpretable e inteligente, este estudio presentó un nuevo marco visual de mapeo para el aprendizaje de características multimodales de emociones. El sistema propuesto integra con éxito la detección de emociones y la interpretabilidad dentro de una única arquitectura mediante la combinación de extracción de características multimodales basada en transformadores, aprendizaje de representaciones emocionales desacopladas, fusión de atención multimodal basada en grafos y métodos de mapeo visual. Además de ofrecer representaciones visuales claras de las contribuciones de cada modalidad, las interacciones multimodales y la dinámica temporal de las emociones, la evaluación experimental en los conjuntos de datos de referencia CH-SIMS y CMU-MOSEI mostró un mejor rendimiento frente a métodos de referencia representativos en varias métricas, incluyendo Exactitud, Precisión, Exhaustividad, puntuación F1 y Error Absoluto Medio (MAE). Sin embargo, este estudio no incluye estudios de implementación en entornos reales, evaluaciones centradas en el usuario, evaluaciones cuantitativas de interpretabilidad ni la integración de modalidades fisiológicas, limitándose a evaluaciones en dos conjuntos de datos de referencia. Además, los entornos con recursos limitados podrían enfrentar dificultades debido al costo computacional de los codificadores basados en transformadores y los procesos de atención basados en grafos. Aunque en trabajos futuros se centrará en una validación más amplia a través de diversos conjuntos de datos, la integración de modalidades adicionales, estudios de usabilidad, publicación de recursos reproducibles y la optimización para escenarios de implementación en tiempo real, el marco propuesto muestra en general el potencial del análisis interpretable de emociones multimodales para aplicaciones de computación afectiva y de interacción inteligente.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de intereses.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores desean agradecer el apoyo brindado por la Escuela de Vivienda, Construcción y Planeación, Universiti Sains Malaysia, Penang, Malasia, y la Escuela de Diseño y Arte, Universidad de Ciencia y Tecnología de Changsha & Technology, Changsha, China. Los autores también expresan su agradecimiento a la Academia de Arte y Diseño de Xiamen, Universidad de Fuzhou, Xiamen, China, por su apoyo académico e investigador a lo largo de este trabajo.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
AdamBiblioteca de Optimizadores de PyTorchhttps://pytorch-optimizers.readthedocs.io/en/latest/ (Tasa de Aprendizaje = 1 × 10-4)Optimización de parámetros durante el entrenamiento del modelo
CH-SIMSRepositorio del Conjunto de Datos OriginalÚltima Versión PúblicaConjunto de datos de referencia para el análisis multimodal de sentimientos/emociones en chino
CMU-MOSEIRepositorio del SDK Multimodal de CMUhttps://github.com/CMU-MultiComp-Lab/CMU-MultimodalSDK (Última Versión Pública)Conjunto de datos de referencia para el reconocimiento multimodal de sentimientos y emociones
Codificador de Emociones DesacopladoImplementación Personalizadahttps://pytorch-geometric.readthedocs.io/en/latest/(Arquitectura de Doble Codificador)Separación de representaciones latentes específicas de emociones y específicas de modalidad
Red de Atención Basada en Grafos (GAT)PyTorch GeometricGAT de múltiples cabezas (https://pytorch-geometric.readthedocs.io/en/latest/)Modelado de relaciones emocionales cruzadas entre modalidades y fusión adaptativa de características
Capa de Atención Cruzada Basada en GrafosImplementación PersonalizadaFusión de Atención de Múltiples CabezasAprendizaje de dependencias emocionales finas entre modalidades
MatplotlibProyecto Matplotlib3.7+Generación de gráficos y análisis visuales
NetworkXProyecto NetworkX3.0+Construcción y visualización de grafos de interacción cruzada entre modalidades
GPU de NVIDIACorporación NVIDIAGPU con CUDA habilitadoAceleración del entrenamiento de transformadores y redes neuronales gráficas
Análisis de Componentes Principales (PCA)Scikit-learnsklearn.decomposition.PCAReducción inicial de embeddings emocionales de alta dimensión
PythonPython Software Foundation3.8+Lenguaje de programación principal para implementar el marco de análisis multimodal de emociones
PyTorchPyTorch Foundation2.0+Desarrollo, entrenamiento y optimización de redes neuronales profundas
RoBERTaHugging Face Transformershttps://huggingface.co/docs/transformers/index (roberta-base, embeddings de 768 dimensiones)Extracción de representaciones lingüísticas y semánticas contextuales de emociones
SeabornProyecto Seaborn0.12+Generación de mapas de calor de atención y visualizaciones estadísticas
t-SNE (t-distributed Stochastic Neighbor Embedding)Scikit-learn
scikit-learn.org (Perplejidad = 30, Iteraciones = 1000)
Visualización de clústeres y trayectorias latentes de emociones
Ubuntu LinuxCanonical Ubuntu20.04 LTS o posteriorEntorno de ejecución experimental
Transformador de Visión (ViT-Base)Google Research Vision TransformerViT-Base/16, embeddings de 768 dimensionesExtracción de representaciones visuales conscientes de emociones a partir de fotogramas de video
Wav2Vec 2.0Meta AI ResearchModelo Base, embeddings de 768 dimensionesExtracción de características contextuales acústicas y de habla relacionadas con las emociones

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhu X, et al. EMVAS: End-to-end multimodal emotion visualization analysis system. Complex Intell Syst. 2025;11:1-15.
  2. Zhu X, et al. A client-server based recognition system: Non-contact single/multiple emotional and behavioral state assessment methods. Comput Methods Programs Biomed. 2025;260:108564.
  3. Lasri I, Riadsolh A, Elbelkacemi M. Facial emotion recognition of deaf and hard-of-hearing students for engagement detection using deep learning. Educ Inf Technol. 2023;28:4069-4092.
  4. Saibene A, Assale M, Giltri M. Expert systems: Definitions, advantages and issues in medical field applications. Expert Syst Appl. 2021;177:114900.
  5. Poria S, Cambria E, Bajpai R, Hussain A. A review of affective computing: From unimodal analysis to multimodal fusion. Inf Fusion. 2017;37:98-125.
  6. Chatterjee R, et al. Real-time speech emotion analysis for smart home assistants. IEEE Trans Consum Electron. 2021;67(1):68-76.
  7. Zhu X, Huang Y, Wang X, Wang R. Emotion recognition based on brain-like multimodal hierarchical perception. Multimed Tools Appl. 2024;83:56039-56057.
  8. Khan M, El Saddik A, Alotaibi FS, Pham NT. AAD-Net: Advanced end-to-end signal processing system for human emotion detection and recognition using attention-based deep echo state network. Knowl Based Syst. 2023;270:110525.
  9. Chaturvedi I, Chen Q, Cambria E, McConnell D. Landmark calibration for facial expressions and fish classification. Signal Image Video Process. 2022;16:377-384.
  10. Li D, Liu J, Yang Z, Sun L, Wang Z. Speech emotion recognition using recurrent neural networks with directional self-attention. Expert Syst Appl. 2021;173:114683.
  11. Zhu X, et al. A review of key technologies for emotion analysis using multimodal information. Cogn Comput. 2024;16:1504-1530.
  12. Wang R, et al. Multimodal emotion recognition using tensor decomposition fusion and self-supervised multitasking. Int J Multimed Inf Retr. 2024;13:39.
  13. Fan C, Lin J, Mao R, Cambria E. Fusing pairwise modalities for emotion recognition in conversations. Inf Fusion. 2024;106:102306.
  14. Williams J, Kleinegesse S, Comanescu R, Radu O. Recognizing emotions in video using multimodal DNN feature fusion. Proceedings of Grand Challenge and Workshop on Human Multimodal Language. Melbourne, Australia. 2018;10.18653/v1/W18-3302.
  15. Zhao Z, Wang Y, Wang Y. Multi-level fusion of Wav2Vec 2.0 and BERT for multimodal emotion recognition. arXiv. 2022;arXiv:2207.04697.
  16. Middya AI, Nag B, Roy S. Deep learning based multimodal emotion recognition using model-level fusion of audio-visual modalities. Knowl Based Syst. 2022;244:108580.
  17. Maithri M, et al. Automated emotion recognition: Current trends and future perspectives. Comput Methods Programs Biomed. 2022;215:106646.
  18. Wu Y, Mi Q, Gao T. A comprehensive review of multimodal emotion recognition: Techniques, challenges, and future directions. Biomimetics. 2025;10(4):418.
  19. Zheng S, Zhang X, Liu Y, Li Z. CMFF: A cross-modal multi-layer feature fusion network for multimodal sentiment analysis. Appl Soft Comput. 2025;184(Pt B):113868.
  20. Yan L, Shi Y, Wei M, Wu Y. Multi-feature fusing local directional ternary pattern for facial expressions signal recognition based on video communication system. Alex Eng J. 2023;63:307-320.
  21. Guo X, Zhang Y, Lu S, Lu Z. Facial expression recognition: A review. Multimed Tools Appl. 2024;83(8):23689-23735.
  22. Liu ZT, Han MT, Wu BH, Rehman A. Audio emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multitask learning. Appl Acoust. 2023;202:109178.
  23. Mirsamadi S, Barsoum E, Zhang C. Automatic audio emotion recognition using recurrent neural networks with local attention. 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), New Orleans, LA, USA. 2017; 10.1109/ICASSP.2017.7952552.
  24. Gu T, He Z, Zhao H, Li M, Ying D. Aspect-based sentiment analysis with multi-granularity information mining and sentiment hint. Expert Syst Appl. 2024;252:124104.
  25. Shen W, Chen J, Quan X, Xie Z. DialogXL: All-in-one XLNet for multi-party conversation emotion recognition. Proc AAAI Conf Artif Intell. 2021;35(15):13789-13797.
  26. Kim T, Vossen P. EmoBERTa: Speaker-aware emotion recognition in conversation with RoBERTa. arXiv. 2021;arXiv:2108.12009.
  27. Li S, Yan H, Qiu X. Contrast and generation make BART a good dialogue emotion recognizer. Proc AAAI Conf Artif Intell. 2022;36(10):11002-11010.
  28. Zhu J, Yu J. MIAR: Modality interaction and alignment representation fusion for multimodal emotion. arXiv. 2026;arXiv:2601.02414.
  29. Praveen RG, Granger E, Cardinal P. Cross attentional audio-visual fusion for dimensional emotion recognition. 2021 16th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2021), Jodhpur, India. 2021;10.1109/FG52635.2021.9667055.
  30. Salas-Cáceres J, López M, Martínez A, Rodríguez P. Multimodal emotion recognition based on a fusion of audio-visual information with temporal dynamics. Multimed Tools Appl. 2025;84:27327-27343.
  31. Fu J, Zhang Y, Wang L, Chen H. TMFN: A text-based multimodal fusion network with multi-scale feature extraction and unsupervised contrastive learning for multimodal sentiment analysis. Complex Intell Syst. 2025;11:133.
  32. Tuerhong G, Fu F, Wushouer M. Adaptive multimodal transformer based on exchanging for multimodal sentiment analysis. Sci Rep. 2025;15:27265.
  33. Gupta C, Sharma R, Patel S, Verma A. A multimodal fusion model for real-time environment emotion recognition using audio-visual-textual features. J Big Data. 2025;12:256.
  34. Yu W, Li X, Zhang H, Wang Z, Liu Z. CH-SIMS: A Chinese multimodal sentiment analysis dataset with fine-grained annotation of modality. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. 2020; 10.18653/v1/2020.acl-main.343.
  35. Zadeh A, et al. Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics, Melbourne, Australia. 2018; 10.18653/v1/P18-1208.
  36. Zadeh A, Chen M, Poria S, Cambria E, Morency LP. Tensor fusion network for multimodal sentiment analysis. arXiv. 2017;arXiv:1707.07250.
  37. Tsai YHH, Bai S, Yamada M, Morency LP, Salakhutdinov R. Multimodal transformer for unaligned multimodal language sequences. Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, Florence, Italy. 2019; 10.18653/v1/P19-1656.
  38. Moreno M, Rioseco P, Van Den Bosch H. Spectrum of the linearized Vlasov–Poisson equation around steady states from galactic dynamics. arXiv. 2023;arXiv:2305.05749.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Predicci n de emocionesaprendizaje de representacionesatenci n cross modalcodificadores Transformerrepresentaci n desenredadatrayectorias emocionales temporalesinterpretabilidad de caracter sticas

Artículos relacionados