A emoção é um processo psicológico e fisiológico multidimensional moldado por estímulos externos, avaliação interna e regulação cognitiva contínua, ocupando portanto uma posição central na interação humano-computador e na ciênciacognitiva 1. Em ambientes de exposições de pintura, a emoção também media a relação entre obras visuais e a interpretação do espectador. Por essa razão, a identificação dos estados emocionais do espectador tem valor prático para avaliação de exposições, design espacial e estudos empíricos da experiênciaestética 2. Ao mesmo tempo, a medição da emoção em ambientes de exibição semi-naturais continua tecnicamente difícil porque as respostas são sutis, transitórias e influenciadas tanto pela obra quanto pelo contexto de visualização.
A pesquisa em reconhecimento emocional geralmente se desenvolveu em duas grandes linhas: análise comportamental e análise fisiológica. Abordagens comportamentais, especialmente a análise de expressões faciais baseada em visão computacional, são amplamente utilizadas porque não são invasivas e relativamente fáceis de implementar3. Modelos de aprendizado profundo, como redes residuais e redes convolucionais leves, demonstraram forte desempenho em tarefas básicas de classificação de emoçõesfaciais 4. No entanto, o comportamento facial durante a visualização da pintura pode ser fraco, socialmente moderado ou deliberadamente contido, o que pode reduzir a correspondência entre expressão visível e sentimentosubjetivo 5. Abordagens fisiológicas, especialmente aquelas baseadas em eletroencefalografia (EEG), oferecem acesso mais direto à atividade neural associada ao processamentoafetivo 6. O EEG tem sido amplamente utilizado em estudos emocionais porque as flutuações temporais nos sinais neurais são informativas para mudanças no estado afetivo, incluindo dimensões relacionadas à valência e àexcitação 7. Mesmo assim, as gravações de EEG são sensíveis a artefatos de movimento, contaminação eletromiográfica e ruído ambiental, e o EEG sozinho frequentemente fornece informações contextuais limitadas sobre o que o espectador está respondendovisualmente 8.
Essas forças e fraquezas complementares aumentaram o interesse pelo reconhecimento multimodalde emoções 9. A premissa central da fusão multimodal é que sinais heterogêneos podem fornecer evidências mutuamente informativas e reduzir a ambiguidade que surge quando uma única modalidade é interpretadaisoladamente 10. Em tarefas de visualização de pintura, por exemplo, o comportamento facial contido ainda pode coincidir com mudanças neurais mensuráveis associadas à atenção ou ao engajamento afetivo. No entanto, sistemas multimodais existentes nem sempre modelam essa relação de forma eficaz. Estratégias de fusão precoces baseadas na concatenação direta de características podem aumentar a carga dimensional e podem confundir a estrutura temporal específica damodalidade 11. Estratégias de fusão tardia baseadas em decisões separadas são mais fáceis de implementar, mas podem negligenciar interações detalhadas entre sinais visuais e fisiológicos durante o processamentoemocional 12. Além disso, muitos modelos multimodais utilizam esquemas de fusão fixos ou fracamente adaptativos, que não são adequados para respostas flutuantes do espectador em ambientes semelhantes aexposições 13.
Para abordar essas limitações, o protocolo atual descreve uma rede de atenção cruzada de duplo ramo para reconhecimento multimodal de emoções durante a visualização de pinturas. Nesse contexto, as características do EEG são processadas por um modelo convolucional de memória de longo prazo bidirecional em rede neural bidirecional (CNN-BiLSTM), que é usado para representar dinâmicas neurais espaço-temporais. As características de vídeo facial são processadas por um branch MobileNetV2 aprimorado por atenção coordenada, que é usado para capturar pistas de expressão de baixa intensidade mantendo a eficiênciacomputacional 14. Os dois ramos são então integrados por meio de um mecanismo de atenção cruzada multi-cabeças que aprende a relevância entre modalidades, em vez de simplesmente concatenar suassaídas 15,16. Este projeto tem como objetivo preservar a estrutura específica de cada modalidade, ao mesmo tempo em que melhora a modelagem de interação entre modais.
O método é projetado principalmente para análise offline sob condições controladas de aquisição de dados, em vez de para implantação direta em tempo real em espaços públicos abertos de exposição. A implementação confiável requer captura sincronizada de EEG e vídeo, iluminação estável, posicionamento controlado da câmera, impedância aceitável de eletrodos e recursos computacionais suficientes para treinamento de modelos. O desempenho também pode depender da composição da amostra, do tipo de estímulo e do grau em que os participantes modificam o comportamento porque sabem que estão sendo registrados. Essas restrições operacionais devem ser consideradas ao adaptar o protocolo a outros ambientes ou populações de exposição.
O protocolo apresentado aqui cobre todo o pipeline experimental, incluindo aquisição sincronizada de 327 participantes, pré-processamento de dados de EEG e vídeo facial, extração de características, fusão cross-modal e classificação. O objetivo é fornecer um fluxo de trabalho reprodutível para o reconhecimento multimodal de emoções na pesquisa de exposições de pintura. Além da computaçãoafetiva 17, o protocolo também pode apoiar investigações quantitativas em estética empírica e estudos psicológicos relacionados18.