$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El trabajo propuesto tiene como objetivo mejorar el diseño de interacción inteligente al ofrecer un marco interpretable para la representación visual de características emocionales multimodales. En este trabajo se utilizaron las bases de datos CH-SIMS y CMU-MOSEI, que son de acceso público. Ambos conjuntos de datos se obtuvieron de sus fuentes oficiales y se emplearon cumpliendo con las directrices de uso, los estándares de investigación y los términos de licencia establecidos por sus respectivos creadores. El contenido multimodal de los conjuntos de datos, que incluye datos de texto, audio y video, fue recopilado y anotado inicialmente por los proveedores de los conjuntos de datos de acuerdo con los permisos autorizados de los participantes y sus protocolos de recolección de datos. En este estudio no hubo interacción humana directa, ni reclutamiento de nuevos participantes, ni recopilación de información personal identificable. Todos los análisis se realizaron utilizando conjuntos de datos de investigación disponibles públicamente. Por consiguiente, nuestro análisis secundario de datos no requirió ninguna aprobación ética adicional ni revisión por parte de una Junta de Revisión Institucional (IRB). El estudio se llevó a cabo cumpliendo con las normas institucionales adecuadas que regulan el uso de conjuntos de datos disponibles públicamente, los procedimientos éticos de investigación y las políticas aplicables de uso de datos.
Se empleó un mecanismo de atención cruzada basado en grafos para aprender caracterizaciones emocionales entre modalidades, utilizando características específicas de la emoción o de la modalidad con el fin de mejorar la comprensión. Se utiliza un componente de mapeo visual multivista para mejorar el diseño interactivo inteligente en tiempo real, y se estima su eficiencia en el reconocimiento emocional. Los resultados muestran que el método propuesto mejora tanto la interpretabilidad como la eficiencia de las interfaces inteligentes de usuario sensibles a las emociones en entornos reales. Figura 1 muestra el flujo arquitectónico del trabajo propuesto. Figura 1 muestra el flujo completo del marco de mapeo visual sugerido para el aprendizaje de características emocionales multimodales en el contexto de sistemas de interacción inteligente. El flujo comienza con tres modalidades de entrada sincronizadas: texto, audio y video, que capturan información emocional complementaria proveniente de las modalidades lingüística, prosódica y de expresión facial, respectivamente. Un codificador transformador específico de modalidad procesa cada modalidad para obtener representaciones de alto nivel de los datos de entrada brutos. Luego, estas representaciones se introducen en un módulo de aprendizaje de representaciones desacopladas, donde los embeddings específicos de la emoción se separan de las características específicas de la modalidad, garantizando así la coherencia de las emociones aprendidas a través de fuentes de datos heterogéneas. Posteriormente, los embeddings específicos de la emoción de cada modalidad se agrupan mediante una red de atención cruzada entre modalidades basada en grafos, que modela las dependencias emocionales intermodales y asigna pesos dinámicos de importancia a cada modalidad según el contexto de interacción. Finalmente, el marco proporciona tanto salidas de clasificación emocional como información sobre la interacción, lo que facilita la toma de decisiones transparente sensible a las emociones y el diseño de interacciones inteligentes adaptables.
Adquisición de datos multimodal
Los conjuntos de datos CH-SIMS y CMU-MOSEI son dos conjuntos de datos multimodales de dominio público existentes que han recopilado información multimodal, como video, audio y texto sincronizados. El conjunto de datos CH-SIMS comprende exámenes multimodales de personas chinas, incluyendo 2.281 segmentos de video, derivados de múltiples segmentos de películas, dramas televisivos y programas de variedades. La adición de audio y texto correspondientes a estos segmentos de video hace que los estudios sobre análisis multimodal de emociones utilizando datos multimodales sean más atractivos y factibles. Sin embargo, uno de los conjuntos de datos multimodales más grandes para el examen de opiniones, sentimientos y emociones es el conjunto de datos CMU-MOSEI, que fue recopilado a partir de más de 23.000 clips de video de frases pronunciadas por más de 1.000 hablantes sobre una variedad de temas. El conjunto de datos se dividió aleatoriamente en subconjuntos de entrenamiento (70 %), validación (15 %) y prueba (15 %), manteniendo la distribución de clases.
Se obtienen transcripciones textuales, señales de audio y cuadros de video, y se alinean según la marca de tiempo para coincidir a un nivel temporal finamente detallado. La integración a nivel de cuadro garantiza que los mecanismos propuestos de aprendizaje de representación y fusión basada en grafos puedan modelar y aprovechar conjuntamente el contenido emocional derivado de expresiones visuales, tonos vocales y contenido lingüístico. La extracción eficaz de dinámicas emocionales intermodales se posibilita mediante esta técnica de adquisición multimodal, que es esencial para el diseño de interacciones inteligentes y la creación de mapas visuales comprensibles.
Tabla 1 presenta las estructuras clave de los conjuntos de datos multimodales de emociones utilizados en el método propuesto. Para obtener un rango más amplio de sentimientos relacionados, como palabras habladas, entonaciones vocales y expresiones faciales, CH-SIMS y CMU-MOSEI integran modalidades de video, audio y texto provenientes de estos conjuntos de datos. Además, el número de muestras de datos disponibles en CH-SIMS es limitado, lo que permite un examen exhaustivo de las interacciones entre modalidades y la variación emocional en China. Por otro lado, el conjunto de datos CMU-MOSEI es más importante para evaluar la robustez del aprendizaje de representaciones y los algoritmos de visualización relacionados tratados en este trabajo, ya que contiene una gran cantidad de datos en diversos idiomas, sujetos y niveles de emoción anotados. Asimismo, en comparación con investigaciones anteriores, reduce las dificultades en la selección de información al probar modelos.
Preprocesamiento y sincronización multimodal
Las anotaciones de marca de tiempo de los conjuntos de datos CH-SIMS y CMU-MOSEI se utilizaron para sincronizar las modalidades textual, auditiva y visual, asegurando un aprendizaje coherente de representación multimodal. Cada emisión funcionó como la unidad fundamental de análisis y se asoció con segmentos de audio y video correspondientes dentro del mismo intervalo temporal. La alineación se realizó a nivel de emisión. La transcripción se dividió en segmentos según las marcas de tiempo de inicio y finalización de cada emisión. Se estableció la correspondencia entre transcripción, audio y video extrayendo los fotogramas de video y las señales de audio que caían dentro del mismo intervalo de tiempo. Mientras que los segmentos de audio se procesaron utilizando Wav2Vec 2.0 para generar representaciones acústicas, los fotogramas visuales del segmento de video se muestrearon a una tasa predeterminada y se codificaron usando el Transformador de Visión (ViT). El codificador RoBERTa se utilizó para crear embeddings textuales a partir de las transcripciones de las emisiones. La sincronización temporal se logró alineando todas las características de modalidad a un único límite de emisión, ya que las tres modalidades producían secuencias de características de longitudes variables. Se utilizó un formato de longitud fija para normalizar secuencias de longitudes distintas. Las secuencias más largas se acortaron a la longitud máxima permitida, mientras que las secuencias más cortas se rellenaron con ceros. Durante el entrenamiento, se utilizaron máscaras de atención para separar los elementos rellenados de las posiciones de características válidas. Los embeddings específicos de cada modalidad se proyectaron en un espacio latente común antes de la fusión, con el fin de superar las diferentes longitudes de secuencia entre modalidades. Esto garantizó la consistencia dimensional y permitió que el mecanismo de atención basado en grafos facilitara un aprendizaje eficaz de interacción cruzada entre modalidades. Para preservar la calidad de los datos y la integridad de la sincronización, se excluyeron de los estudios las muestras con archivos dañados, anotaciones faltantes o información incompleta de modalidad.
Extracción de características basada en transformadores
Se utiliza un método de aprendizaje profundo para aprender representaciones de características de alto nivel conscientes de las emociones a partir de información de múltiples modalidades, como visión, audio y texto, de manera integral, tras alinear los datos multimodales y realizar cualquier preprocesamiento necesario. Al emplear un codificador transformador para aprender representaciones de características intrínsecamente discriminativas a partir de datos multimodales crudos, el método propuesto elimina la necesidad de ingeniería de características. Para facilitar la coherencia entre los conjuntos de datos utilizados en el enfoque propuesto, se aprende un incrustado (embedding) de tamaño fijo para cada modalidad. Por ejemplo, se aprenden incrustados de características de 768 dimensiones en cada una de las modalidades individuales, incluyendo imágenes, audio y texto, formando colectivamente un espacio de características unificado utilizado en todo el enfoque, particularmente un enfoque de extracción de características aplicado al conjunto de datos CH-SIMS propuesto y al conjunto de datos CMU-MOSEI para aprender características de alto nivel a partir de datos de diversos tamaños.
Modalidad visual: Transformador de visión para incorporaciones de fotogramas con reconocimiento emocional
Se utilizó un modelo de Transformador de Visión (ViT-Base) para extraer información visual de los fotogramas de video con el fin de obtener representaciones espaciales relevantes para las emociones. Antes de extraer las características, los fotogramas de cada segmento de video se redimensionaron a (224 × 224) píxeles y se muestrearon a intervalos temporales regulares. Mediante un tamaño de parche de 16 × 16 píxeles, la arquitectura ViT-Base produce una serie de tokens visuales que son procesados por 12 capas codificadoras de transformador. Las representaciones a nivel de fotograma recuperadas se proyectaron en un espacio de incrustación de 768 dimensiones utilizando un modelo ViT previamente entrenado como base visual. Las incrustaciones a nivel de fotograma se agregaron mediante promediar agrupación (mean pooling) para crear la representación visual final de cada segmento. Durante el entrenamiento, se utilizaron normalización de imágenes y métodos comunes de aumento, como recorte aleatorio y volteo horizontal, para mejorar la generalización. Luego, se utilizó el marco propuesto de fusión multimodal para combinar estas incrustaciones visuales con representaciones textuales y auditivas.
Para mantener la dinámica temporal en la emoción, se tomarán muestras uniformemente de los videos de los conjuntos de datos CH-SIMS y CMU-MOSEI para la modalidad visual. Los fotogramas de cada video,
, pueden dividirse en N secciones de tamaño fijo, que luego se aplanan y transfieren inversamente a un espacio de incrustación latente con dimensión
. Se crea una serie mediante la adición de incrustaciones posicionales y un token de agrupación aprendible:
(1)
donde
representa la codificación posicional y
es la matriz de incrustación de fragmentos.
Se utilizan capas codificadoras de transformador apiladas, compuestas por redes de alimentación directa y autoatención multi-cabeza, para procesar la secuencia de fragmentos incrustados. La transformación en la capa l se describe como:
(2)
(3)
Para obtener el vector de características visuales consciente de las emociones, se extrae la salida equivalente al token de clase como vector de características
. Para abordar representaciones visuales de emociones consistentes a pesar de las diferencias lingüísticas y de contenido entre conjuntos de datos, se combinan los embeddings a nivel de cuadro de cada segmento de video con el fin de capturar las expresiones faciales y la evolución de las emociones.
Modalidad de audio utilizando Wav2Vec 2.0 para prosodia e incrustaciones acústicas semánticas Se generaron incrustaciones de habla contextualizadas utilizando un codificador Wav2Vec 2.0 previamente entrenado como base acústica. Se obtuvo un vector de características acústicas de longitud fija para cada frase mediante la agregación de las representaciones ocultas de salida utilizando promediado. El modelo Wav2Vec 2.0 se utilizó para extraer representaciones acústicas de señales de audio con el fin de capturar características del habla contextualmente relevantes y relacionadas con la emoción. Antes de la extracción de características, las grabaciones de audio se normalizaron y remuestrearon a 16 kHz. Para garantizar la sincronización entre las modalidades textual y visual, cada segmento de audio a nivel de enunciado se aisló utilizando los límites de marca de tiempo proporcionados por las anotaciones del conjunto de datos. El codificador acústico previamente entrenado se ajustó durante el entrenamiento del modelo para mejorar la adaptación específica a la tarea, permitiendo que las representaciones derivadas reflejen con mayor precisión los aspectos emocionales de las señales de habla. Luego, se realizó una fusión de atención multimodal basada en grafos y un aprendizaje de representaciones desacopladas utilizando las incrustaciones de audio finales.
En la modalidad de audio, se utiliza Wav2Vec-2.0 para modelar las señales de voz derivadas de la información inicial del habla en los conjuntos de datos CH-SIMS y CMU-MOSEI, extrayendo directamente características de audio relacionadas con la emoción. Existe una codificación de características convolucional para cada señal de voz de entrada
:
(4)
donde Z representa rasgos prosódicos de bajo nivel como melodía, tono y energía. Una red contextual basada en transformadores es útil para las estructuras mencionadas anteriormente, ya que representa dependencias temporales de largo alcance:
(5)
Los datos acústicos prosódicos y semánticos, que son esenciales para expresar emociones, se incluyen en estas representaciones acústicas contextuales. Se crea un embedding de audio de longitud específica mediante un procedimiento de agrupación temporal:
(6)
El diseño evita el uso de características acústicas como los MFCC y logra durabilidad utilizando datos de habla en inglés del CMU-MOSEI y datos de habla en chino del CH-SIMS, simplemente extrayendo representaciones de las formas de onda.
Modalidad de texto utilizando RoBERTa para incrustaciones contextuales de emociones
Para la modalidad textual, se aplica el transformador bidireccional profundo RoBERTa a las transcripciones de habla de los dos conjuntos de datos para generar semántica contextual y significado afectivo. Se utilizaron codificadores transformadores basados en RoBERTa para extraer representaciones textuales de los datos de transcripción y capturar información semántica contextual y emocional. Se empleó un modelo RoBERTa preentrenado para el conjunto de datos CMU-MOSEI en inglés, mientras que se utilizó una variante de RoBERTa en chino para el conjunto de datos CH-SIMS en chino, con el fin de considerar mejor las características lingüísticas específicas del idioma. El preprocesamiento del texto incluyó la tokenización mediante el tokenizador RoBERTa adecuado para cada idioma y la normalización del texto. Para garantizar un procesamiento por lotes consistente, las secuencias de entrada se convirtieron en incrustaciones de tokens y se rellenaron o recortaron hasta una longitud máxima de secuencia predeterminada. De acuerdo con el formato de entrada de RoBERTa, se introdujeron tokens especiales de clasificación y separación. Se obtuvo una incrustación textual de longitud fija mediante la agregación de las representaciones de tokens contextualizadas producidas por el codificador transformador, utilizando la representación final de oración equivalente a [CLS]. Para adaptar las representaciones aprendidas a la tarea de reconocimiento de emociones, los codificadores RoBERTa preentrenados se refinaron mediante entrenamiento multimodal. Luego, se utilizó el marco propuesto de fusión multimodal para combinar las incrustaciones textuales con las características auditivas y visuales.
Las incrustaciones de tokens y las codificaciones de posición se pueden combinar para cada entrada tokenizada,
, para crear la representación de entrada en la técnica de transformación profunda bidireccional conocida como
(7)
Esta forma se representa mediante las capas del transformador L, que utiliza la autoatención para descubrir las dependencias de contexto entre palabras:
(8)
La incorporación del contexto emocional se obtiene utilizando el estado oculto final del token de clasificación:
(9)
La polaridad del sentimiento, las emociones intensas y las implicaciones asociadas son ejemplos de características lingüísticas relacionadas con las emociones que serán representadas por esta incrustación. RoBERTa facilita la modelización independiente del idioma. Esto permite al sistema utilizar el mismo tamaño de incrustación tanto para textos en inglés del conjunto de datos CMU-MOSEI como para textos en chino del conjunto de datos CH-SIMS.
Se extraen tres vectores de características específicas de modalidad de 768 dimensiones, cada uno correspondiente a las modalidades visual fv, auditiva fa y textual ft , mediante el paso propuesto de aprendizaje de representación de características profundas. En el diseño de interacción inteligente, estas representaciones aprendidas crean un espacio unificado de características multimodal que sirve como base para la asignación visual a nivel de características, la fusión cruzada de modalidades basada en grafos y el aprendizaje de representaciones desacopladas.
Aprendizaje de representación desenredada
Después de aprender una representación de características profundas, un procesamiento adicional de los vectores de características multimodales provenientes de las modalidades visual, auditiva y textual puede generar una descripción emocional desarticulada. Si las incrustaciones de características específicas de cada modalidad —auditiva, visual y textual— utilizadas en el paso anterior se representan mediante fv, fa y ft, respectivamente, de tal manera que
y
, el objetivo de este paso consiste en factorizar todas las características modales en dos representaciones latentes distintas, que incluyen las representaciones emocionales tras considerar la semántica previa de cada una de las diferentes modalidades.
Esto se logra alimentando cada característica de modalidad, fm , a dos redes de proyección paralelas: un codificador de emociones
y un codificador de modalidad
, donde se generan las dos codificaciones.
(10)
Donde
la característica latente asociada con la emoción está representada por
representa una característica latente específica de una modalidad. Esto permite que los embeddings específicos de la emoción se comuniquen con un espacio de manera repetida a través de múltiples entradas, incluyendo audio, visual y texto, al tiempo que conservan los datos estructurales únicos asociados con cada modalidad.
Se logra una separación efectiva mediante la reconstrucción con restricciones de independencia. La reconstrucción de la característica original de la modalidad se da mediante:
(11)
donde
es una red decodificadora. La pérdida de reconstrucción conserva los siguientes datos:
(12)
Además, la ortogonalidad, o decorrelación, entre la emoción y las representaciones específicas de la modalidad a menudo limita la superposición de información:
(13)
Al alcanzar estos objetivos, el modelo podría aprender representaciones de emociones que sean confiables, comprensibles y resistentes a la variabilidad de la modalidad. Las fusiones posteriores basadas en grafos entre modalidades y las características de mapeo visual, especialmente para el diseño de interacciones inteligentes, dependen en gran medida de representaciones emocionales interpretables y estructuradas.
Coincidencia emocional entre modalidades
La incorporación de la consistencia emocional mejora claramente la eficacia de la fusión entre las modalidades. Esto se debe a que las estrategias de fusión no necesitan compensar grandes diferencias entre las dos representaciones, ya que los embeddings emocionales específicos de cada modalidad comparten un espacio latente. La ilustración combinada de las dos emociones se describe a continuación
. La fusión ponderada será más estable cuando las representaciones específicas de la emoción sean consistentes, porque las variaciones entre las señales provenientes de distintas modalidades ya no afectarán el resultado.
(14)
Al exigir el alineamiento semántico de la información emocional, este objetivo minimiza las discrepancias entre modalidades y asegura que la percepción emocional permanezca consistente independientemente de la modalidad utilizada para expresarla. En consecuencia, se crea un espacio de representación coherente y afectivo mediante la proyección de las señales emocionales obtenidas de las señales de habla, expresiones faciales y contenido lingüístico.
Impacto en la fusión cruzada modal
La fusión multimodal se vuelve más efectiva cuando se introduce consistencia emocional entre las modalidades. Los mecanismos de fusión ya no tienen que compensar grandes brechas en las representaciones intermodales, ya que los embeddings específicos de la emoción están alineados en un espacio latente común. La representación emocional fusionada se define de la siguiente manera:
(15)
Donde αm representa el peso de la atención asignado a la modalidad m. La fusión ponderada se vuelve más estable y comprensible cuando las representaciones específicas de la emoción son coherentes, ya que el resultado de la fusión muestra evidencia emocional complementaria en lugar de señales modales contradictorias.
Matemáticamente, reducir la
varianza entre varios tipos de representaciones específicas de emociones con respecto a
es equivalente a:
(16)
donde
representa la expresión media de la emoción. Una varianza reducida hace que las modalidades de entrada se ponderen según su significado emocional preciso en lugar del ruido de la modalidad, lo que garantiza una convergencia de la red mejorada y una evaluación de la atención más precisa.
El objetivo final de aprendizaje de las visualizaciones de emociones desacopladas es combinar la fragmentación, la reconstrucción y la uniformidad emocional:
(17)
que dos hiperparámetros, λ1 y λ2, controlan la relación entre la fiabilidad emocional cruzada y la disociación. El modelo propuesto obtiene representaciones emocionales invariantes a la modalidad, interpretables y fusibles para lograr esto, haciendo hincapié en proporcionar una base sólida para la fusión basada en grafos y la representación a nivel de características en el diseño de interfaces inteligentes.
Fusión de atención multimodal basada en grafos
Se utilizó una red de atención multimodal basada en grafos para simular relaciones emocionales finamente detalladas entre modalidades. Para facilitar el flujo de información entre modalidades, se construyó un grafo multimodal completamente conectado, en el que cada representación específica de una modalidad (texto, audio y visual) se representó como un nodo del grafo. Las relaciones entre modalidades se emplearon para establecer la matriz de adyacencia del grafo, la cual luego se mejoró mediante un método de atención aprendible. Se creó un espacio latente compartido mediante la concatenación y proyección de las salidas de varias cabezas de atención. Una representación unificada de la emoción multimodal se generó entonces al agregar las representaciones de los nodos utilizando un agrupamiento ponderado por atención. Este vector fusionado fue enviado posteriormente a los módulos de predicción y visualización para el análisis sensible a interacciones y el reconocimiento emocional. El módulo de fusión basado en grafos tenía una dimensión de representación oculta de 256 y dos capas de atención gráfica, cada una con ocho cabezas de atención. Para determinar la importancia relativa de las modalidades vecinas, se calcularon y normalizaron los coeficientes de atención entre nodos conectados mediante la función softmax. Cada capa de atención gráfica fue seguida por normalización por capas, conexiones residuales y una tasa de abandono (dropout) de 0,2 para aumentar la estabilidad del entrenamiento y reducir el sobreajuste. Tras concatenar y proyectar las salidas de varias cabezas de atención hacia un espacio latente común, las representaciones de los nodos se combinaron en un único vector de emoción multimodal mediante agrupamiento ponderado por atención. Posteriormente, esta representación fusionada se utilizó para la predicción emocional y la proyección visual multimodal.
Se capturaron diversas interacciones multimodales utilizando una atención gráfica multi-cabeza. Se utilizó la función softmax para normalizar los coeficientes de atención entre nodos conectados para cada nodo. Para aumentar la estabilidad durante el entrenamiento y evitar el sobreajuste, a las capas apiladas de atención gráfica del módulo de fusión gráfica se les añadieron conexiones residuales, normalización por capas y regularización por eliminación aleatoria.
Consideremos que los términos
representan individualmente las representaciones correspondientes a las emociones particulares recopiladas por las modalidades visual, auditiva y textual; cada componente se encuentra dentro del espacio latente compartido
. Los modelos para los nodos de modalidad utilizan una notación para el grafo
, con los nodos de la colección
correspondientes a los tres nodos de modalidad mismos, con el fin de reforzar explícitamente las dependencias emocionales compartidas entre las diversas representaciones de modalidad.
Después de asignar un vector de características específico de la emoción a cada nodo en el grafo, tenemos:
(18)
A diferencia de los métodos tradicionales de fusión, que utilizan pesos de fusión predeterminados o fijos, el método propuesto aprende pesos de borde adaptativos según su importancia y dependencias, tanto entre canales como entre situaciones emocionales.
Se utiliza una red de atención gráfica (GAT) para la fusión multimodal. Se calcula un coeficiente de atención para cada nodo i y sus nodos vecinos, es decir, el nodo j:
(19)
El efecto emocional de cambiar del modo j a la modalidad i se mide mediante los pesos normalizados αij.
A continuación, se calcula la apariencia fusionada de cada nodo de modalidad como un agrupamiento ponderado de sus vecinos:
(20)
donde la función de activación
es no lineal. En última instancia, las características actualizadas de cada nodo se combinan para obtener una representación emocional global fusionada:
(21)
Es una técnica útil para la modelización de emociones interpretable y la posterior representación visual, ya que captura información complementaria de diversas modalidades al tiempo que conserva las complejas relaciones intermodales.
El algoritmo 1 (Archivo Suplementario 1) proporciona el esquema general para llevar a cabo la fusión multimodal basada en grafos. Inicialmente, se crea un grafo con las características específicas de cada emoción vinculadas a las modalidades visual, auditiva y textual. Luego, se calculan las puntuaciones de atención para cada par de nodos del grafo, que representan la combinación de dependencia emocional. A continuación, las puntuaciones de atención se normalizan para indicar la contribución relativa de cada modalidad al contexto emocional especificado, lo que permite el aprendizaje de los pesos de atención. La incrustación general de emociones se genera en la última etapa mediante la agregación de las características asociadas a los nodos del grafo. En este sentido, la fusión general del algoritmo de las características multimodales vinculadas a las emociones especificadas muestra potencial en cuanto a adaptabilidad, interpretabilidad e inteligencia contextual.
Figura 2 muestra la estructura y el funcionamiento de la red propuesta de atención cruzada modal para la fusión de sentimientos multimodal. Los embeddings específicos de emoción, derivados independientemente para las modalidades de texto, auditiva y de video, pasan inicialmente por mecanismos de atención a nivel de modalidad que aprenden la importancia relativa de la información lingüística, vocal y facial en un contexto emocional determinado. Las representaciones ponderadas por la atención de las modalidades se combinan luego para formar un embedding emocional unificado, en el cual la matriz de atención captura las dependencias intermodales y las intensidades de interacción. La matriz de atención aprendida por la red modula dinámicamente las contribuciones de las modalidades, permitiéndole enfocarse en la modalidad instructiva más fuerte mientras ignora aquellas ruidosas o menos informativas. La representación emocional fusionada permite un reconocimiento preciso de emociones y un análisis detallado de estados emocionales como neutralidad, abrazo y preocupación.
Módulo de mapeo visual
Con la ayuda de la sección de mapeo visual, creada específicamente para este fin, un diseñador de interacciones inteligente puede convertir la representación unificada del estado emocional en una forma visual comprensible y fácilmente digerible tras el proceso de fusión cruzada de modalidades, basándose en el gráfico.
Para facilitar la comprensión de las representaciones emocionales latentes, se utilizaron técnicas de reducción de dimensionalidad para visualizar los embeddings multimodales de emociones aprendidos. Después de reducir la dimensionalidad de las características manteniendo la mayor parte de la varianza mediante el Análisis de Componentes Principales (PCA), los embeddings se proyectaron en un espacio bidimensional para su visualización usando el método t-Stochastic Neighbor Embedding (t-SNE). Para t-SNE se utilizó un valor de perplejidad de 30, una tasa de aprendizaje de 200 y 1.000 iteraciones de optimización. Mediante las proyecciones obtenidas se visualizaron agrupaciones específicas de emociones y las relaciones entre modalidades. Los pesos normalizados de atención cruzada obtenidos por la red de atención basada en grafos se utilizaron para crear mapas de calor de atención. En estos mapas de calor se representan las contribuciones relativas de las modalidades textual, de audio y visual durante la predicción de emociones. Los coeficientes de atención aprendidos se utilizaron como pesos de los enlaces para crear grafos de interacción cruzada, lo que permitió examinar visualmente las relaciones intermodales y el flujo de información dentro del marco de fusión. Se generaron gráficos de trayectoria emocional mediante el seguimiento del desarrollo de los embeddings latentes de emociones a lo largo de enunciados sucesivos para examinar la dinámica emocional temporal. Estas trayectorias aportan información sobre cómo evolucionan los estados emocionales y las contribuciones de las modalidades a lo largo del tiempo. Todos los gráficos se crearon utilizando paquetes de Python como Matplotlib y Scikit-learn. Para evaluar la interpretabilidad, la formación de clústeres, las contribuciones modales y la dinámica emocional temporal, se realizaron análisis cualitativos de las visualizaciones de embeddings, los grafos de interacción y los mapas de calor de atención.
Sea la variable
que represente la representación fusionada del estado emocional mediante la función de red de atención gráfica. A diferencia de la visualización a nivel de salida de las gráficas de estado emocional, el objetivo principal del módulo consiste en convertir las representaciones del estado emocional y los pesos correspondientes del mecanismo de atención en una forma visual comprensible.
Utilizando el valor aprendido de αji, se crea un mapa de calor de atención para examinar visualmente la contribución de cada modalidad. Luego, los pesos de atención entrantes se suman para determinar una puntuación de importancia compuesta para cada modalidad:
(22)
donde si representa la contribución emocional relativa de la modalidad I. Para ayudar a crear un mapa de calor de atención, los valores obtenidos se normalizan y se asignan a un mapa de colores que facilita al usuario identificar la modalidad predominante en diferentes pasos temporales o estados interactivos. A través de diversas modalidades de entrada visual, auditiva o textual, dicha interfaz ayuda al usuario a comprender cómo funciona el mecanismo de atención del sistema.
El grafo aprendido se modela específicamente como un «grafo de interacción ponderado» para representar la dependencia cruzada de modalidades en las emociones humanas. Cada modalidad se representa mediante un nodo en el grafo, y la intensidad de las interacciones relacionadas con las emociones humanas se representa mediante pesos en forma de αji en las aristas que los conectan. El grafo ponderado anterior ilustra la intensidad de las interacciones emocionales humanas. La definición de i y j es:
(23)
El grosor o la transparencia de las líneas en la visualización del grafo se muestran adecuadamente gracias a estos pesos. Esto facilita la comprensión de cómo interactúan las modalidades. El diseñador puede comprender mejor cómo interactúan los indicadores emocionales durante el proceso de fusión con la ayuda de los gráficos de interacción cruzada entre modalidades.
Los embeddings de emociones fusionados
en varios pasos de tiempo se reducen a un espacio de menor dimensionalidad mediante un algoritmo de reducción de dimensionalidad, como PCA o t-SNE, con el fin de mostrar la evolución de las emociones temporales:
(24)
donde la función de proyección está representada por
. La aparición de trayectorias emocionales 2D/3D, que muestran transiciones emocionales, intensidades y estabilidad en las interacciones, puede interpretarse como una representación intuitiva de la evolución de los estados emocionales a lo largo del tiempo. Estos aspectos pueden utilizarse para la interacción inteligente, la toma de decisiones y la monitorización en tiempo real.
A diferencia de los sistemas convencionales de emociones que simplemente proporcionan asignaciones a clases o puntuaciones específicas, este sistema se centra en demostrar cómo se forman las emociones humanas dentro de él. Revela su proceso de toma de decisiones mediante visualizaciones de características intermedias, incluyendo factores de ponderación, interacciones entre modelos y sus trayectorias correspondientes. Esto permite al usuario comprender cómo cada factor—visual, vocal o lingüístico—influye en la generación de sus respuestas ante la emoción humana.
Asignar emociones a formas comprensibles mediante representaciones visuales puede, por tanto, cerrar la brecha entre el análisis de emociones utilizando métodos de aprendizaje profundo y su integración en el diseño de interfaces inteligentes. Los datos recopilados a partir de ambos enfoques pueden utilizarse entonces para crear interfaces de usuario más precisas. Así, el enfoque propuesto puede proporcionar a los diseñadores de interacción información esencial para desarrollar interfaces de usuario más precisas. Dicho de otro modo, la comprensión de las emociones se convierte en una parte muy activa del diseño de interacción. La precisión solo puede aumentar cuando la comprensión de las emociones se incorpora activamente al diseño de interacción.
El módulo de mapeo visual posibilita la explicabilidad de varias formas interconectadas pero diferentes: la explicabilidad a nivel de características revela las representaciones subyacentes de la emoción creadas por la red neuronal profunda (DNN), permitiéndonos comprender la semántica utilizada para describir cada característica relacionada con la emoción; la explicabilidad a nivel de modalidad utiliza datos provenientes de los gráficos de interacción y los mapas de calor de atención visual para describir cómo cada modalidad —visual, auditiva o textual— contribuye a las decisiones tomadas para expresar emociones; y finalmente, las trayectorias resultantes del incrustado de emociones nos permiten entender cómo cambia cada modalidad visual y textual a lo largo del tiempo desde una perspectiva de interacción dinámica. Consulte el Algoritmo 2 (Supplementary File 1).
Las características emocionales multimodales fusionadas se asignan a representaciones visualmente significativas para el diseño de interacción inteligente mediante el algoritmo de asignación visual propuesto, Algoritmo 2. Los pesos de atención multimodal basados en grafos se utilizan para cuantificar las diferencias entre los elementos visuales, auditivos y textuales de entrada en cada paso temporal. Estas diferencias luego se asignan a representaciones visuales para resaltar las principales fuentes que influyen en las emociones, utilizando elementos visuales de mapa de calor. Para ofrecer una visión informativa de la interacción entre los elementos de entrada y transmitir la evolución emocional generada por los elementos de entrada multimodales, se calculan entonces las intensidades de interacción por pares para crear los pesos de interacción multimodal. Al mismo tiempo, se genera una vista de la evolución emocional mediante la proyección de los elementos emocionales fusionados acumulados a lo largo del tiempo en un espacio de baja dimensionalidad, produciendo así una evolución continua del elemento emocional.
Predicción de emociones y retroalimentación de la interacción
El resultado de la representación de emoción fusionada, representado como
, se utiliza entonces como una función tanto para la retroalimentación de la interacción como para la predicción de emociones. Además, la predicción de emociones se describe como un modelo multitarea que comprende una tarea de regresión para el reconocimiento de la intensidad de la emoción continua y una tarea de clasificación para el reconocimiento de emociones discretas. El siguiente modelo de clasificación basado en softmax se utiliza para el reconocimiento de emociones discretas:
(25)
donde
representa las probabilidades esperadas de las clases de emociones y Wc y bc son restricciones aprendibles. Se utiliza la pérdida de entropía cruzada para mejorar el objetivo de clasificación:
(26)
donde yk es la etiqueta real, y K es el número de clases de emociones. Se utiliza una rama de regresión para estimar la intensidad emocional en paralelo, generando una predicción de diversos atributos afectivos continuos, incluyendo valencia y activación. Asígnale la siguiente definición:
(27)
donde el puntaje esperado de intensidad emocional está indicado por
. Se utiliza la pérdida del error cuadrático medio para mejorar la tarea de regresión:
(28)
En general, las dos tareas se combinan en el objetivo de predicción:
(29)
donde los objetivos de regresión y clasificación están equilibrados por λ. Se sugiere una modificación dinámica del módulo de visualización basada en el estado emocional identificado para permitir este tipo de retroalimentación sensible a la interacción. El contexto de interacción en un momento dado t se representa mediante ct. La respuesta del módulo de visualización se proporciona mediante:
(30)
donde la función de adaptación de visualización está representada por
. Esto permite ajustar las mapas de calor de modalidad, los gráficos de interacción y las trayectorias emocionales en tiempo real según los cambios y emociones anticipados. Esto indica que el sistema proporciona un apoyo considerable para la retroalimentación, además de desempeñarse bien en la predicción del estado emocional.