$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
O trabalho proposto tem como objetivo aprimorar o design de interação inteligente ao oferecer um framework interpretável para o mapeamento visual de características emocionais multimodais. Os bancos de dados CH-SIMS e CMU-MOSEI, que são de acesso público, foram utilizados neste trabalho. Ambos os conjuntos de dados foram obtidos de suas fontes oficiais e utilizados em conformidade com as diretrizes de uso, padrões de pesquisa e termos de licenciamento estabelecidos por seus respectivos criadores. O conteúdo multimodal dos conjuntos de dados, incluindo dados de texto, áudio e vídeo, foi inicialmente coletado e anotado pelos provedores dos conjuntos de dados, conforme suas permissões autorizadas para participantes e protocolos de coleta de dados. Não houve interação humana direta, recrutamento de novos participantes nem coleta de informações pessoalmente identificáveis neste estudo. Todas as análises foram realizadas utilizando conjuntos de dados de pesquisa de acesso público. Consequentemente, nossa análise secundária de dados não exigiu aprovação ética adicional nem revisão por parte de uma Junta de Revisão Institucional (IRB). O estudo foi conduzido em conformidade com as normas institucionais apropriadas que regulam o uso de conjuntos de dados de acesso público, procedimentos éticos de pesquisa e políticas aplicáveis de uso de dados.
Um mecanismo de atenção cruzada baseado em grafos foi empregado para aprender caracterizações emocionais entre modalidades, utilizando características específicas de emoção ou modalidade para aprimorar a compreensão. Um componente de mapeamento visual multivisão é usado para aprimorar o design interativo com percepção emocional em tempo real, e sua eficiência é estimada para o reconhecimento de emoções. Os resultados mostram que o método proposto melhora tanto a interpretabilidade quanto a eficiência de interfaces inteligentes com percepção emocional em ambientes reais. Figura 1 mostra o fluxo arquitetural do trabalho proposto. Figura 1 mostra o fluxo completo do framework de mapeamento visual sugerido para aprendizado de características emocionais multimodais no contexto de sistemas interativos inteligentes. O fluxo inicia com três modalidades de entrada sincronizadas, a saber, texto, áudio e vídeo, que capturam informações emocionais complementares das modalidades linguística, prosódica e de expressão facial, respectivamente. Um codificador transformer específico à modalidade processa cada modalidade para obter representações de alto nível dos dados brutos de entrada. As representações são então inseridas em um módulo de aprendizado de representação desacoplado, no qual os embeddings específicos à emoção são separados das características específicas à modalidade, garantindo consistência nas emoções aprendidas entre fontes de dados heterogêneas. Os embeddings específicos à emoção de cada modalidade são então agregados por uma rede de atenção cruzada baseada em grafos, que modela as dependências emocionais intermodais e atribui pesos dinâmicos de importância a cada modalidade com base no contexto da interação. Por fim, o framework fornece tanto saídas de classificação emocional quanto insights de interação, o que facilita a tomada de decisões transparente com percepção emocional e o design adaptativo de interação inteligente.
Aquisição de dados multimodal
Os conjuntos de dados CH-SIMS e CMU-MOSEI são dois conjuntos multimodais de domínio público já existentes que coletaram informações multimodais, como vídeo, áudio e texto sincronizados. O conjunto de dados CH-SIMS compreende exames multimodais de pessoas chinesas, incluindo 2.281 segmentos de vídeo, derivados de múltiplos segmentos de filmes, novelas de televisão e programas de variedades. Os estudos sobre análise multimodal de emoções utilizando dados multimodais tornam-se mais envolventes e viáveis com a adição de áudio e texto correspondentes a esses segmentos de vídeo. No entanto, um dos maiores conjuntos de dados multimodais para o exame de opinião, sentimentos e emoções é o conjunto de dados CMU-MOSEI, coletado a partir de mais de 23.000 clipes de vídeo de frases proferidas por mais de 1.000 oradores sobre uma variedade de tópicos. O conjunto de dados foi dividido aleatoriamente em subconjuntos de treinamento (70%), validação (15%) e teste (15%), mantendo a distribuição das classes.
Transcrições textuais, sinais de áudio e quadros de vídeo são obtidos e alinhados por carimbo de tempo para coincidir em um nível temporal fino. A integração em nível de quadro garante que os mecanismos propostos de aprendizado de representação e fusão baseada em grafos possam conjuntamente modelar e aproveitar o conteúdo emocional proveniente de expressões visuais, tons vocais e conteúdo linguístico. A extração eficaz das dinâmicas emocionais intermodais é viabilizada por esse tipo de técnica de aquisição multimodal, essencial para o design de interação inteligente e mapeamento visual compreensível.
Tabela 1 apresenta as principais estruturas dos conjuntos de dados multimodais de emoções utilizados no método proposto. Para obter uma gama mais ampla de sentimentos relacionados, como palavras faladas, entonações vocais e expressões faciais, CH-SIMS e CMU-MOSEI integram modalidades de vídeo, áudio e texto provenientes desses conjuntos de dados. Além disso, um número limitado de amostras de dados está disponível no CH-SIMS, permitindo uma análise minuciosa das interações entre modalidades e da variação emocional na China. Por outro lado, o conjunto de dados CMU-MOSEI é mais importante para avaliar a robustez dos algoritmos de aprendizado de representação e visualização relacionados abordados neste trabalho, pois contém uma grande quantidade de dados em diversos idiomas, sujeitos e níveis de emoção anotados. Adicionalmente, em comparação com pesquisas anteriores, ele reduz as dificuldades na seleção de informações durante os testes de modelos.
Pré-processamento e sincronização multimodal
As anotações de carimbo de data/hora dos conjuntos de dados CH-SIMS e CMU-MOSEI foram utilizadas para sincronizar as modalidades textual, auditiva e visual, garantindo uma aprendizagem consistente da representação multimodal. Cada enunciado funcionou como unidade fundamental de análise e foi associado a segmentos de áudio e vídeo correspondentes dentro do mesmo intervalo temporal. O alinhamento foi realizado no nível do enunciado. A transcrição foi dividida em segmentos com base nos carimbos de data/hora de início e fim de cada enunciado. A correspondência entre transcrição, áudio e vídeo foi estabelecida mediante a extração dos quadros de vídeo e sinais de áudio correspondentes que ocorreram dentro do mesmo intervalo de tempo. Enquanto os segmentos de áudio foram processados usando o Wav2Vec 2.0 para gerar representações acústicas, os quadros visuais do segmento de vídeo foram amostrados a uma taxa predeterminada e codificados usando o Vision Transformer (ViT). O codificador RoBERTa foi utilizado para criar incorporações textuais a partir das transcrições dos enunciados. A sincronização temporal foi alcançada ao alinhar todas as características das modalidades a um único limite de enunciado, já que as três modalidades produziram sequências de características de comprimentos variados. Um formato de comprimento fixo foi usado para normalizar sequências de comprimentos diferentes. Sequências mais longas foram reduzidas ao comprimento máximo permitido, enquanto sequências mais curtas foram preenchidas com zeros. Durante o treinamento, máscaras de atenção foram usadas para separar elementos preenchidos de posições legítimas de características. As incorporações específicas de cada modalidade foram projetadas em um espaço latente comum antes da fusão, a fim de superar os diferentes comprimentos de sequência entre as modalidades. Isso garantiu consistência dimensional e permitiu que o mecanismo de atenção baseado em grafos facilitasse a aprendizagem eficaz da interação cruzada entre modalidades. Para preservar a qualidade dos dados e a integridade da sincronização, amostras com arquivos corrompidos, anotações ausentes ou informações incompletas de modalidade foram excluídas dos estudos.
Extração de características baseada em transformador
Um método de aprendizado profundo é utilizado para aprender representações de características de alto nível com percepção emocional a partir de informações de múltiplas modalidades, como visão, áudio e texto, de maneira end-to-end, após o alinhamento dos dados multimodais e qualquer pré-processamento necessário. Ao utilizar um codificador transformer para aprender representações de características intrinsecamente discriminativas a partir de dados multimodais brutos, o método proposto elimina a necessidade de engenharia de características. Para facilitar a consistência entre os conjuntos de dados utilizados na abordagem proposta, um embedding de tamanho fixo é aprendido para cada modalidade. Por exemplo, embeddings de características de 768 dimensões são aprendidos em cada uma das modalidades individuais, incluindo imagem, áudio e texto, formando coletivamente um espaço de características unificado utilizado em toda a abordagem, particularmente uma abordagem de extração de características aplicada ao conjunto de dados CH-SIMS proposto e ao conjunto de dados CMU-MOSEI, com o objetivo de aprender características de alto nível em dados de diversos tamanhos.
Modalidade visual: Transformador de visão para incorporações de quadros com reconhecimento de emoção
Um modelo Vision Transformer (ViT-Base) foi utilizado para extrair informações visuais de quadros de vídeo com o objetivo de obter representações espaciais relevantes para emoções. Antes da extração de características, os quadros de cada segmento de vídeo foram redimensionados para (224 × 224) pixels e amostrados em intervalos temporais regulares. Utilizando um tamanho de patch de 16 × 16 pixels, a arquitetura ViT-Base produz uma série de tokens visuais que são processados por 12 camadas codificadoras do transformer. As representações obtidas em nível de quadro foram projetadas em um espaço de incorporação de 768 dimensões usando um modelo ViT pré-treinado como base visual. Os embeddings em nível de quadro foram agregados utilizando pooling médio para criar a representação visual final de cada segmento. Durante o treinamento, foram utilizadas normalização de imagem e métodos comuns de aumento de dados, como recorte aleatório e inversão horizontal, para melhorar a generalização. Em seguida, o framework proposto de fusão multimodal foi usado para combinar esses embeddings visuais com representações textuais e auditivas.
Para manter a dinâmica temporal da emoção, amostras de vídeo dos conjuntos de dados CH-SIMS e CMU-MOSEI serão amostradas uniformemente para a modalidade visual. Os quadros de cada vídeo,
, podem ser divididos em N seções de tamanho fixo, que são então aplanadas e inversamente transformadas para um espaço de incorporação latente com dimensão
. Uma série é criada adicionando incorporações posicionais e um token de agrupamento ajustável:
(1)
em que
representa a codificação posicional e
é a matriz de incorporação de fragmentos.
Camadas codificadoras de transformador empilhadas, compostas por redes feed-forward e autoatenção multi-cabeça, são usadas para processar a sequência de segmentos incorporados. A transformação na camada l é descrita como:
(2)
(3)
Para obter o vetor de características visuais com reconhecimento emocional, a saída equivalente ao token de classe é extraída como o vetor de características
. Para lidar com representações visuais de emoção consistentes, apesar das diferenças de idioma e conteúdo entre conjuntos de dados, os embeddings em nível de quadro de cada segmento de vídeo são combinados para capturar expressões faciais e a evolução da emoção.
Modalidade de áudio usando Wav2Vec 2.0 para embeddings acústicos semânticos e de prosódia Embeddings de fala contextualizados foram gerados utilizando um codificador pré-treinado Wav2Vec 2.0 como base acústica. Um vetor de características acústicas de comprimento fixo para cada frase foi obtido por meio da agregação das representações ocultas de saída usando média de agrupamento. O modelo Wav2Vec 2.0 foi utilizado para extrair representações acústicas de sinais de áudio, capturando características da fala contextuais e relevantes para emoção. Antes da extração de características, as gravações de áudio foram normalizadas e reamostradas para 16 kHz. Para garantir a sincronização entre as modalidades textual e visual, cada segmento de áudio no nível da enunciação foi isolado utilizando os limites de carimbo de tempo fornecidos pelas anotações do conjunto de dados. O codificador acústico pré-treinado foi ajustado durante o treinamento do modelo para melhorar a adaptação específica à tarefa, permitindo que as representações derivadas representassem com maior precisão os aspectos emocionais dos sinais de fala. Em seguida, foi realizada a fusão de atenção intermodal baseada em grafos e a aprendizagem de representações desacopladas utilizando os embeddings finais de áudio.
Na modalidade de áudio, o Wav2Vec-2.0 é utilizado para modelar sinais de fala derivados das informações iniciais de fala dos conjuntos de dados CH-SIMS e CMU-MOSEI, extraindo diretamente características de áudio relacionadas à emoção. Existe uma codificação de características convolucional para cada sinal de fala de entrada
:
(4)
em que Z representa traços prosódicos de baixo nível, como melodia, tom e energia. Uma rede contextual baseada em transformador é útil para as estruturas mencionadas anteriormente, representando dependências temporais de longo alcance:
(5)
Dados acústicos prosódicos e semânticos, essenciais para expressar emoção, estão incluídos nessas representações acústicas contextuais. Um embedding de áudio de comprimento específico é criado ao realizar um procedimento de agrupamento temporal:
(6)
O design evita o uso de características acústicas, como MFCCs, e alcança durabilidade utilizando dados de fala em inglês do CMU-MOSEI e dados de fala em chinês do CH-SIMS, simplesmente extraindo representações das formas de onda.
Modalidade de texto usando RoBERTa para incorporações contextuais de emoção
Para a modalidade textual, o transformador bidirecional profundo RoBERTa é aplicado às transcrições de fala dos dois conjuntos de dados para gerar semântica contextual e significado afetivo. Codificadores de transformadores baseados no RoBERTa foram utilizados para extrair representações textuais dos dados de transcrição, capturando informações semânticas contextuais e emocionais. Um modelo pré-treinado de RoBERTa foi usado para o conjunto de dados CMU-MOSEI em língua inglesa, enquanto uma variante chinesa do RoBERTa foi empregada para o conjunto de dados CH-SIMS em chinês, a fim de levar melhor em conta características linguísticas específicas do idioma. O pré-processamento do texto incluiu tokenização utilizando o tokenizador RoBERTa apropriado para cada idioma e normalização do texto. Para garantir um processamento consistente por lotes, as sequências de entrada foram convertidas em incorporações de tokens e, posteriormente, preenchidas ou truncadas até um comprimento máximo de sequência predeterminado. De acordo com o formato de entrada do RoBERTa, foram introduzidos tokens especiais de classificação e separadores. Uma incorporação textual de comprimento fixo foi obtida por meio da agregação das representações de tokens contextualizadas produzidas pelo codificador de transformador, utilizando a representação final da sentença equivalente ao [CLS]. Para adaptar as representações aprendidas à tarefa de reconhecimento de emoções, os codificadores RoBERTa pré-treinados foram refinados por meio de treinamento multimodal. Em seguida, o framework proposto de fusão multimodal foi utilizado para combinar as incorporações textuais com as características de áudio e vídeo.
Os embeddings de tokens e as codificações posicionais podem ser combinados para cada entrada tokenizada,
, para criar a representação de entrada na técnica de transformação profunda bidirecional conhecida como
(7)
Essa forma é representada pelas camadas do transformador L, que utiliza a autoatenção para descobrir as dependências contextuais entre palavras:
(8)
O embedding emocional contextual é obtido usando o estado oculto final do token de classificação:
(9)
Polaridade de sentimento, emoções intensas e implicações associadas são exemplos de características linguísticas relacionadas a emoções que serão representadas por esse embedding. O RoBERTa facilita a modelagem independente de idioma. Isso permite que o sistema utilize o mesmo tamanho de embedding tanto para textos em inglês do conjunto de dados CMU-MOSEI quanto para textos em chinês do conjunto de dados CH-SIMS.
São extraídos três vetores de características específicos para cada modalidade, com 768 dimensões cada, correspondentes às modalidades visual fv, áudio fa e textual ft , pela etapa proposta de aprendizado de representação de características profundas. No design de interação inteligente, essas representações aprendidas criam um espaço unificado de características multimodal que serve como base para a associação visual em nível de características, fusão cruzada de modalidades baseada em grafos e aprendizado de representações desacopladas.
Aprendizado de representação desemaranhada
Após aprender uma representação de características profundas, um processamento adicional dos vetores de características multimodais provenientes das modalidades visual, auditiva e textual pode gerar uma descrição emocional desvinculada. Se os embeddings de características específicas de modalidade das modalidades auditiva, visual e textual utilizadas na etapa anterior forem representados por fv, fa e ft, respectivamente, de modo que
e
, o objetivo desta etapa é fatorar todas as características de modalidade em duas representações latentes distintas, que incluem as representações emocionais após considerar a semântica anterior de cada uma das diferentes modalidades.
Isso é realizado alimentando cada característica de modalidade, fm , em duas redes de projeção paralelas: um codificador de emoção
e um codificador de modalidade
, onde as duas codificações são produzidas.
(10)
Onde
a característica latente associada à emoção é representada por
representa uma característica latente específica a uma modalidade. Isso permite que incorporações específicas de emoções se comuniquem com um espaço repetidamente ao longo de múltiplas entradas, incluindo áudio, visual e texto, mantendo ao mesmo tempo os dados estruturais únicos associados a cada modalidade.
Uma separação eficaz é garantida pela reconstrução com restrições de independência. A reconstrução da característica da modalidade original é dada por:
(11)
onde
é uma rede decodificadora. A perda de reconstrução preserva os seguintes dados:
(12)
Além disso, a ortogonalidade, ou decorrelação, entre emoção e representações específicas da modalidade frequentemente limita a sobreposição de informações:
(13)
Ao atingir esses objetivos, o modelo pode aprender representações emocionais que são confiáveis, compreensíveis e resistentes à variabilidade de modalidade. Fusões cruzadas modais baseadas em grafos e características de mapeamento visual, especialmente para o design de interação inteligente, dependem fortemente de representações emocionais interpretáveis e estruturadas.
Consistência emocional entre modalidades
A inclusão da consistência emocional melhora claramente a eficácia da fusão entre as modalidades. Isso ocorre porque as estratégias de fusão não precisam compensar grandes lacunas entre as duas representações, já que os embeddings emocionais específicos da modalidade compartilham um espaço latente. A ilustração combinada das duas emoções é descrita da seguinte forma
. A fusão ponderada será mais estável quando as representações específicas da emoção forem consistentes, pois as variações entre os sinais de diferentes modalidades não afetarão mais o resultado.
(14)
Ao impor o alinhamento semântico das informações emocionais, este objetivo minimiza discrepâncias entre modalidades e garante que a percepção emocional permaneça consistente, independentemente da modalidade utilizada para expressá-la. Consequentemente, um espaço de representação coeso e afetivo é criado ao projetar pistas emocionais obtidas de sinais de fala, expressões faciais e conteúdo linguístico.
Impacto na fusão cruzada de modalidades
A fusão multimodal torna-se mais eficaz quando a consistência emocional é introduzida entre as modalidades. Os mecanismos de fusão não precisam mais compensar grandes lacunas nas representações intermodais, pois os embeddings específicos à emoção são alinhados em um espaço latente comum. A representação emocional fundida é definida da seguinte forma:
(15)
Onde αm representa o peso da atenção atribuído à modalidade m. A fusão ponderada torna-se mais estável e compreensível quando as representações específicas da emoção são consistentes, já que o resultado da fusão mostra evidências emocionais complementares em vez de sinais contraditórios das modalidades.
Matematicamente, reduzir a
variância entre diversos tipos de representações específicas de emoções em relação a
é equivalente a:
(16)
em que
representa a expressão média da emoção. A variância reduzida faz com que as modalidades de entrada sejam ponderadas de acordo com sua significância emocional precisa, em vez do ruído da modalidade, garantindo uma convergência melhorada da rede e uma avaliação de atenção mais precisa.
O objetivo final de aprendizado das visualizações emocionais desacopladas é combinar fragmentação, reconstrução e uniformidade emocional:
(17)
que dois hiperparâmetros, λ1 e λ2, controlam a relação entre confiabilidade emocional cruzada e dissociação. O modelo proposto adquire representações emocionais invariantes à modalidade, interpretáveis e passíveis de fusão para alcançar esse objetivo, com ênfase em fornecer uma base sólida para a fusão baseada em grafos e representação em nível de características no design de interfaces inteligentes.
Fusão de atenção multimodal baseada em grafos
Uma rede de atenção multimodal baseada em grafos foi utilizada para simular relações emocionais finamente detalhadas entre as modalidades. Para facilitar o fluxo de informações entre as modalidades, foi construído um grafo multimodal totalmente conectado, no qual cada incorporação específica de modalidade (texto, áudio e visual) foi representada como um nó do grafo. As relações entre modalidades foram usadas para estabelecer a matriz de adjacência do grafo, a qual foi posteriormente aprimorada por meio de um método de atenção treinável. Um espaço latente compartilhado foi criado pela concatenação e projeção das saídas de múltiplos cabeçotes de atenção. Uma representação unificada de emoção multimodal foi então produzida ao agregar as representações dos nós usando um agrupamento ponderado pela atenção. Esse vetor fundido foi então fornecido aos módulos de predição e visualização para análise sensível à interação e reconhecimento de emoções. O módulo de fusão por grafos possuía uma dimensão de representação oculta de 256 e duas camadas de atenção em grafos, cada uma com oito cabeçotes de atenção. Para determinar a importância relativa das modalidades vizinhas, os coeficientes de atenção entre nós conectados foram calculados e normalizados usando a função softmax. Cada camada de atenção em grafos foi seguida por normalização de camada, conexões residuais e uma taxa de dropout de 0,2, a fim de aumentar a estabilidade durante o treinamento e reduzir o sobreajuste. Após a concatenação e projeção das saídas de diversos cabeçotes de atenção em um espaço latente comum, as representações dos nós foram combinadas em um único vetor de emoção multimodal por meio de agrupamento ponderado pela atenção. Em seguida, a representação fundida foi utilizada para mapeamento visual multivisão e predição de emoções.
Diversas interações cruzadas foram capturadas usando atenção gráfica multi-cabeça. A função softmax foi utilizada para normalizar os coeficientes de atenção entre nós conectados para cada nó. Para aumentar a estabilidade do treinamento e evitar overfitting, as camadas empilhadas de atenção gráfica do módulo de fusão gráfica foram seguidas por conexões residuais, normalização de camada e regularização por dropout.
Vamos considerar que os termos
representam individualmente as representações correspondentes às emoções específicas coletadas pelas modalidades visual, auditiva e textual; cada componente reside no espaço latente compartilhado
. Os modelos para os nós de modalidade utilizam uma notação para o grafo
, com os nós da coleção
correspondendo explicitamente aos três nós de modalidade, a fim de fortalecer de maneira explícita as dependências emocionais compartilhadas entre as diversas representações de modalidade.
Após atribuir um vetor de características específico à emoção a cada nó no grafo, temos:
(18)
Diferentemente dos métodos tradicionais de fusão, que utilizam pesos de fusão predeterminados ou fixos, o método proposto aprende pesos de borda adaptativos com base em sua significância e interdependências, tanto entre canais quanto entre situações emocionais.
Uma rede de atenção em grafos (GAT) é utilizada para fusão intermodal. Um coeficiente de atenção é calculado para cada nó i e seus nós vizinhos, ou seja, nó j:
(19)
O efeito emocional da troca do modo j para a modalidade i é medido pelos pesos normalizados αij.
Em seguida, a aparência fundida de cada nó de modalidade é calculada como um agrupamento ponderado de seus vizinhos:
(20)
onde a função de ativação
é não linear. Em última análise, as características atualizadas de cada nó são combinadas para obter uma representação emocional global fundida:
(21)
É uma técnica útil para modelagem interpretável de emoções e mapeamento visual subsequente, pois capta informações complementares de diversas modalidades, ao mesmo tempo que preserva as complexas relações intermodais.
O Algoritmo 1 (Arquivo Suplementar 1) fornece o esquema geral para realizar a fusão cruzada baseada em grafos. Inicialmente, cria-se um grafo com as características específicas de emoção associadas a cada uma das modalidades visual, auditiva e textual. Em seguida, calculam-se as pontuações de atenção para cada par de nós do grafo, que representam a combinação da dependência emocional. As pontuações de atenção são então normalizadas para indicar a contribuição relativa de cada modalidade ao contexto emocional especificado, permitindo a aprendizagem dos pesos de atenção. O embedding geral de emoção é produzido na última etapa pela agregação das características associadas aos nós do grafo. Nesse sentido, a fusão geral do algoritmo das características multimodais ligadas às emoções especificadas mostra potencial para adaptabilidade, interpretabilidade e inteligência contextual.
Figura 2 mostra a estrutura e o funcionamento da rede proposta de atenção cruzada modal para fusão de sentimentos multimodal. Os embeddings específicos para emoções, derivados independentemente para as modalidades textual, auditiva e de vídeo, são inicialmente passados por mecanismos de atenção em nível de modalidade que aprendem a importância relativa das informações linguísticas, vocais e faciais em um determinado contexto emocional. As representações ponderadas pela atenção das modalidades são então combinadas para formar um embedding emocional unificado, no qual a matriz de atenção captura as dependências intermodais e as intensidades de interação. A matriz de atenção aprendida pela rede modula dinamicamente as contribuições das modalidades, permitindo que ela se concentre na modalidade instrucional mais forte enquanto ignora aquelas ruidosas e menos informativas. A representação emocional fundida permite o reconhecimento preciso de emoções e a análise detalhada de estados emocionais, como neutro, abraço e preocupação.
Módulo de mapeamento visual
Com a ajuda da seção de mapeamento visual, criada especificamente para esse fim, um designer de interação inteligente pode converter a representação unificada do estado emocional em uma forma visual compreensível e prontamente utilizável após o processo de fusão cruzada de modalidades, com base no gráfico.
Para facilitar a compreensão das representações emocionais latentes, foram utilizadas técnicas de redução de dimensionalidade para visualizar os embeddings multimodais de emoção aprendidos. Após reduzir a dimensionalidade das características mantendo a maior parte da variância usando a Análise de Componentes Principais (PCA), os embeddings foram projetados em um espaço bidimensional para exibição, utilizando o t-SNE (t-distributed Stochastic Neighbor Embedding). Foram utilizados um valor de perplexidade de 30, uma taxa de aprendizado de 200 e 1.000 iterações de otimização para o t-SNE. Os agrupamentos específicos de emoções e as relações entre modalidades foram visualizados por meio das projeções obtidas. Os pesos normalizados de atenção cruzada obtidos pela rede de atenção baseada em grafos foram utilizados para criar mapas de calor de atenção. As contribuições relativas das modalidades textual, áudio e visual durante a predição da emoção são representadas nesses mapas de calor. Os coeficientes de atenção aprendidos foram usados como pesos das arestas para criar grafos de interação cruzada, o que permitiu a análise visual das relações intermodais e do fluxo de informação dentro do framework de fusão. Gráficos de trajetória emocional foram criados monitorando a evolução dos embeddings latentes de emoção ao longo de enunciados sucessivos, a fim de examinar a dinâmica emocional temporal. Essas trajetórias fornecem insights sobre como os estados emocionais e as contribuições das modalidades evoluem ao longo do tempo. Matplotlib e Scikit-learn são dois pacotes Python utilizados para criar todas as visualizações. Para avaliar a interpretabilidade, a formação de agrupamentos, as contribuições modais e a dinâmica emocional temporal, foram realizadas análises qualitativas das visualizações de embeddings, grafos de interação e mapas de calor de atenção.
Deixe a variável
representar a representação fundida do estado emocional pela função da rede de atenção em grafo. Em contraste com a visualização no nível de saída dos gráficos de estado emocional, o objetivo principal do módulo é converter as representações de estado emocional e os pesos correspondentes do mecanismo de atenção em uma forma visual compreensível.
Usando o valor aprendido de αji, cria-se um mapa de calor de atenção para examinar visualmente a contribuição de cada modalidade. Os pesos de atenção recebidos são então somados para determinar uma pontuação de importância composta para cada modalidade:
(22)
em que si representa a contribuição emocional relativa da modalidade I. Para auxiliar na criação de um mapa de calor de atenção, os valores obtidos são normalizados e mapeados em uma escala de cores que facilita ao usuário identificar a modalidade predominante em diferentes etapas temporais ou estados interativos. Por meio de diversas modalidades de entrada visual, auditiva ou textual, essa interface ajuda o usuário a compreender como funciona o mecanismo de atenção do sistema.
O grafo aprendido é modelado especificamente como um "grafo de interação ponderado" para representar a dependência cruzada de modalidades nas emoções humanas. A própria modalidade é representada por cada nó no grafo, e a intensidade das interações envolvendo emoções humanas é representada por pesos na forma de αji nas arestas que os conectam. O grafo ponderado acima ilustra a intensidade das interações emocionais humanas. A definição de i e j é:
(23)
A espessura ou transparência da linha na visualização do grafo é exibida adequadamente graças a esses pesos. Isso facilita a compreensão de como as modalidades interagem. O projetista pode entender melhor como os indicadores emocionais interagem durante o processo de fusão com a ajuda dos gráficos de interação cruzada.
Os embeddings de emoção fundidos
em diferentes etapas temporais são reduzidos a um espaço de menor dimensionalidade por meio de um algoritmo de redução de dimensionalidade, como PCA ou t-SNE, com o objetivo de exibir a evolução das emoções ao longo do tempo:
(24)
onde a função de projeção é representada por
. O surgimento de trajetórias emocionais 2D/3D, que mostram transições emocionais, intensidades e estabilidade nas interações, pode ser interpretado como uma representação intuitiva da evolução dos estados emocionais ao longo do tempo. Esses aspectos podem ser utilizados para interação inteligente, tomada de decisão e monitoramento em tempo real.
Diferentemente dos sistemas convencionais de emoção que simplesmente fornecem mapeamentos para classes ou pontuações específicas, este sistema enfatiza demonstrar como as emoções humanas se formam dentro dele. Ele revela seu processo de tomada de decisão ao oferecer visualizações de características intermediárias, incluindo fatores de ponderação, interações entre modelos e seus respectivos caminhos. Isso permite ao usuário compreender como cada fator — visual, vocal ou linguístico — o influencia na produção de suas respostas às emoções humanas.
Mapear emoções em formas compreensíveis por meio de representações visuais pode, portanto, preencher a lacuna entre a análise de emoções usando métodos de aprendizado profundo e sua integração para o design de interfaces inteligentes. Os dados coletados a partir de ambas as abordagens podem então ser utilizados para criar interfaces de usuário mais precisas. Assim, a abordagem proposta pode fornecer aos designers de interação informações essenciais para desenvolver interfaces de usuário mais precisas. Em outras palavras, a compreensão das emoções torna-se uma parte muito ativa do design de interação. A precisão só pode aumentar quando a compreensão das emoções é incorporada ativamente ao design de interação.
O módulo de mapeamento visual possibilita a explicabilidade de várias formas interconectadas, porém distintas: a explicabilidade em nível de característica revela as representações subjacentes de emoção criadas pela DNN, permitindo-nos compreender a semântica utilizada para descrever cada característica relacionada à emoção; a explicabilidade em nível de modalidade utiliza dados provenientes dos gráficos de interação e dos mapas de calor de atenção visual para descrever como cada modalidade — visual, áudio ou textual — contribui para as decisões tomadas para expressar emoções; e, por fim, as trajetórias resultantes do embedding de emoção permitem-nos entender como cada modalidade visual e textual muda ao longo do tempo sob uma perspectiva de interação dinâmica. Consulte o Algoritmo 2 (Arquivo Suplementar 1).
As características emocionais multimodais fundidas são mapeadas em representações visualmente significativas para o design de interação inteligente utilizando o Algoritmo 2 de mapeamento visual sugerido. Os pesos de atenção multimodal baseados em grafos são utilizados para quantificar as diferenças entre os elementos visuais, sonoros e textuais de entrada em cada passo temporal. Essas diferenças são então mapeadas em representações visuais para destacar as principais fontes que influenciam as emoções, utilizando elementos visuais de mapa de calor. Para fornecer uma visão elucidativa da interação entre os elementos de entrada e transmitir a evolução emocional gerada pelos elementos de entrada multimodais, são calculadas as intensidades de interação par a par, criando assim os pesos de interação multimodal. Enquanto isso, uma visão da evolução emocional é criada ao mapear os elementos emocionais fundidos acumulados ao longo do tempo em um espaço de baixa dimensionalidade, produzindo uma evolução contínua do elemento emocional.
Previsão de emoção e feedback de interação
O resultado da representação de emoção fundida, representado como
, é então utilizado como uma função tanto para feedback de interação quanto para predição de emoção. Além disso, a predição de emoção é descrita como um modelo multitarefa que compreende uma tarefa de regressão para reconhecimento contínuo da intensidade da emoção e uma tarefa de classificação para reconhecimento de emoção discreta. O seguinte modelo de classificação baseado em softmax é utilizado para o reconhecimento de emoção discreta:
(25)
onde
representa as probabilidades esperadas das classes de emoção e Wc e bc são restrições ajustáveis. A perda de entropia cruzada é utilizada para aprimorar o objetivo de classificação:
(26)
em que yk é a etiqueta real, e K é o número de classes de emoção. Um ramo de regressão é utilizado para estimar a intensidade da emoção em paralelo, produzindo uma predição de diversos atributos afetivos contínuos, incluindo valência e arousal. Dê a ele a seguinte definição:
(27)
onde a pontuação esperada de intensidade emocional é indicada por
. A perda do erro quadrático médio é utilizada para aprimorar a tarefa de regressão:
(28)
Em geral, as duas tarefas são combinadas no objetivo de previsão:
(29)
onde os objetivos de regressão e classificação são balanceados por λ. Isso sugere uma modificação dinâmica do módulo de visualização com base no estado emocional identificado, para permitir esse tipo de feedback consciente da interação. O contexto de interação em um determinado momento t é representado por ct. A resposta do módulo de visualização é fornecida por:
(30)
onde a função de adaptação de visualização é representada por
. Isso torna possível ajustar as mapas de calor de modalidade, gráficos de interação e trajetórias emocionais em tempo real com base em mudanças e emoções antecipadas. Isso indica que o sistema oferece suporte substancial ao feedback, além de apresentar bom desempenho na predição de estados emocionais.