É necessária uma assinatura do JoVE para visualizar este conteúdo. Faça login ou inicie seu teste gratuito.

Artigo de método

Rede de Atenção Cruzada de Duplo Ramo para Eletroencefalografia e Reconhecimento Multimodal de Emoções Faciais durante a Visualização de Pinturas

109 visualizações

⸱

DOI:

10.3791/70600

⸱

12 de maio de 2026

Neste artigo

Resumo

Este protocolo descreve a aquisição sincronizada de eletroencefalografia e dados faciais em cenários de visualização de pintura e uma rede de atenção cruzada de dois ramos para reconhecimento multimodal de emoções, incluindo pré-processamento, fusão de características e classificação de quatro estados emocionais.

Resumo

O reconhecimento emocional durante a visualização da pintura continua difícil porque as respostas estéticas são dinâmicas, dependentes do contexto e apenas parcialmente observáveis através do comportamento externo. Abordagens unimodais baseadas apenas em expressões faciais ou apenas em sinais fisiológicos, portanto, frequentemente fornecem representações incompletas da experiência do espectador. Este artigo descreve um método reproduzível para construir uma rede de atenção cruzada de duplo ramo que integra vídeo facial com dados de eletroencefalografia (EEG) para reconhecimento multimodal de emoções em um contexto de exposição de pintura. O protocolo começa com o estabelecimento de um ambiente de aquisição sincronizado usando um sistema EEG de 64 canais e uma câmera de alta resolução para gravação simultânea durante a visualização da pintura. O procedimento subsequente detalha o pré-processamento de sinais, incluindo filtragem EEG, segmentação e extração de características de entropia diferencial, juntamente com detecção facial, alinhamento e preparação de quadros para análise de vídeo. A rede neural contém dois ramos específicos de modalidade. O ramo do EEG utiliza uma rede neural convolucional e uma rede bidirecional de memória de curto prazo longo para modelar características neurais espaço-temporais, enquanto o ramo facial utiliza uma rede convolucional leve aprimorada por atenção por coordenadas para extrair características de expressão visual. Um módulo de atenção cruzada multi-cabeças é então usado para fundir os dois fluxos, aprendendo a relevância intermodal. Sob as condições experimentais aqui relatadas, a estrutura multimodal alcançou maior precisão de classificação do que os modelos de comparação unimodais no reconhecimento de emoções em quatro categorias. Esse método é mais adequado para análise offline em ambientes de aquisição controlada e fornece uma estrutura prática para computação afetiva, estética empírica e pesquisa em interação humano-computador orientada para exposições.

Introdução

A emoção é um processo psicológico e fisiológico multidimensional moldado por estímulos externos, avaliação interna e regulação cognitiva contínua, ocupando portanto uma posição central na interação humano-computador e na ciênciacognitiva 1. Em ambientes de exposições de pintura, a emoção também media a relação entre obras visuais e a interpretação do espectador. Por essa razão, a identificação dos estados emocionais do espectador tem valor prático para avaliação de exposições, design espacial e estudos empíricos da experiênciaestética 2. Ao mesmo tempo, a medição da emoção em ambientes de exibição semi-naturais continua tecnicamente difícil porque as respostas são sutis, transitórias e influenciadas tanto pela obra quanto pelo contexto de visualização.

A pesquisa em reconhecimento emocional geralmente se desenvolveu em duas grandes linhas: análise comportamental e análise fisiológica. Abordagens comportamentais, especialmente a análise de expressões faciais baseada em visão computacional, são amplamente utilizadas porque não são invasivas e relativamente fáceis de implementar3. Modelos de aprendizado profundo, como redes residuais e redes convolucionais leves, demonstraram forte desempenho em tarefas básicas de classificação de emoçõesfaciais 4. No entanto, o comportamento facial durante a visualização da pintura pode ser fraco, socialmente moderado ou deliberadamente contido, o que pode reduzir a correspondência entre expressão visível e sentimentosubjetivo 5. Abordagens fisiológicas, especialmente aquelas baseadas em eletroencefalografia (EEG), oferecem acesso mais direto à atividade neural associada ao processamentoafetivo 6. O EEG tem sido amplamente utilizado em estudos emocionais porque as flutuações temporais nos sinais neurais são informativas para mudanças no estado afetivo, incluindo dimensões relacionadas à valência e àexcitação 7. Mesmo assim, as gravações de EEG são sensíveis a artefatos de movimento, contaminação eletromiográfica e ruído ambiental, e o EEG sozinho frequentemente fornece informações contextuais limitadas sobre o que o espectador está respondendovisualmente 8.

Essas forças e fraquezas complementares aumentaram o interesse pelo reconhecimento multimodalde emoções 9. A premissa central da fusão multimodal é que sinais heterogêneos podem fornecer evidências mutuamente informativas e reduzir a ambiguidade que surge quando uma única modalidade é interpretadaisoladamente 10. Em tarefas de visualização de pintura, por exemplo, o comportamento facial contido ainda pode coincidir com mudanças neurais mensuráveis associadas à atenção ou ao engajamento afetivo. No entanto, sistemas multimodais existentes nem sempre modelam essa relação de forma eficaz. Estratégias de fusão precoces baseadas na concatenação direta de características podem aumentar a carga dimensional e podem confundir a estrutura temporal específica damodalidade 11. Estratégias de fusão tardia baseadas em decisões separadas são mais fáceis de implementar, mas podem negligenciar interações detalhadas entre sinais visuais e fisiológicos durante o processamentoemocional 12. Além disso, muitos modelos multimodais utilizam esquemas de fusão fixos ou fracamente adaptativos, que não são adequados para respostas flutuantes do espectador em ambientes semelhantes aexposições 13.

Para abordar essas limitações, o protocolo atual descreve uma rede de atenção cruzada de duplo ramo para reconhecimento multimodal de emoções durante a visualização de pinturas. Nesse contexto, as características do EEG são processadas por um modelo convolucional de memória de longo prazo bidirecional em rede neural bidirecional (CNN-BiLSTM), que é usado para representar dinâmicas neurais espaço-temporais. As características de vídeo facial são processadas por um branch MobileNetV2 aprimorado por atenção coordenada, que é usado para capturar pistas de expressão de baixa intensidade mantendo a eficiênciacomputacional 14. Os dois ramos são então integrados por meio de um mecanismo de atenção cruzada multi-cabeças que aprende a relevância entre modalidades, em vez de simplesmente concatenar suassaídas 15,16. Este projeto tem como objetivo preservar a estrutura específica de cada modalidade, ao mesmo tempo em que melhora a modelagem de interação entre modais.

O método é projetado principalmente para análise offline sob condições controladas de aquisição de dados, em vez de para implantação direta em tempo real em espaços públicos abertos de exposição. A implementação confiável requer captura sincronizada de EEG e vídeo, iluminação estável, posicionamento controlado da câmera, impedância aceitável de eletrodos e recursos computacionais suficientes para treinamento de modelos. O desempenho também pode depender da composição da amostra, do tipo de estímulo e do grau em que os participantes modificam o comportamento porque sabem que estão sendo registrados. Essas restrições operacionais devem ser consideradas ao adaptar o protocolo a outros ambientes ou populações de exposição.

O protocolo apresentado aqui cobre todo o pipeline experimental, incluindo aquisição sincronizada de 327 participantes, pré-processamento de dados de EEG e vídeo facial, extração de características, fusão cross-modal e classificação. O objetivo é fornecer um fluxo de trabalho reprodutível para o reconhecimento multimodal de emoções na pesquisa de exposições de pintura. Além da computaçãoafetiva 17, o protocolo também pode apoiar investigações quantitativas em estética empírica e estudos psicológicos relacionados18.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

O protocolo do estudo foi revisado e aprovado pelo Comitê de Ética para Proteção da Pesquisa Humana da Universidade Normal Xingyi Minzu (Aprovação nº 2600AL0621). O consentimento informado por escrito foi obtido de todos os participantes antes de sua inclusão no estudo e antes da coleta dos dados.

1. Recrutamento de participantes e conformidade ética

  1. Obtendo aprovação ética
    1. Submeta o protocolo experimental completo, o formulário de consentimento, a folha informativa dos participantes e o plano de proteção de dados ao conselho de revisão institucional (IRB) ou ao comitê de ética antes de iniciar o estudo.
    2. Obtenha aprovação por escrito e registre o número de aprovação na documentação do estudo.
  2. Recrutamento de participantes
    1. Recrute participantes adultos saudáveis para aquisição multimodal de emoções durante a visualização da pintura. Neste protocolo de demonstração, recrute 327 participantes.
    2. Aplique os seguintes critérios de inclusão: idade de 18 a 35 anos, visão normal ou corrigida para normal, sem histórico autorrelatado de distúrbios neurológicos, ausência de uso atual de medicação psicoativa e disposição para realizar gravação eletroencefalográfica (EEG) e gravação de vídeo facial.
    3. Aplique os seguintes critérios de exclusão: lesão excessiva no couro cabeludo ou condições dermatológicas que impedem a colocação de eletrodos, incapacidade de completar a sessão completa de gravação, movimento intenso durante a aquisição ou documentação de consentimento incompleta.
    4. Registre características dos participantes, incluindo idade, sexo, lateralidade, experiência prévia de visualização de obras e nível de escolaridade. Neste protocolo de demonstração, registre a seguinte amostra RESUMO CURTO LONGO: idade média 24,8 ± 3,7 anos, 165 mulheres e 162 homens, todos os participantes destros.
    5. Defina o equilíbrio demográfico operacional antes do recrutamento. Neste protocolo de demonstração, use esse termo para indicar uma distribuição sexual aproximadamente equilibrada e uma faixa etária concentrada no início da vida adulta para reduzir a variância relacionada à idade nas respostas do EEG e das expressões faciais.
  3. Obtenção do consentimento informado
    1. Forneça a cada participante um formulário escrito de consentimento informado descrevendo gravação de EEG, gravação de vídeo facial, procedimentos de sincronização, anonimização, armazenamento de dados e o direito de retirada a qualquer momento sem penalidade.
    2. Explique que imagens faciais serão usadas para extração de características e que regiões oculares serão mascaradas em todas as figuras manuscritas para proteger a identidade dos participantes.
    3. Obtenha consentimento informado por escrito antes de qualquer procedimento experimental começar.
  4. Atribuição de identificadores e anonimização dos dados
    1. Atribua a cada participante um ID numérico único do estudo. Armazene arquivos EEG, arquivos de vídeo e metadados usando apenas o ID do estudo.
    2. Armazene formulários de consentimento identificáveis separadamente dos dados fisiológicos e de imagem. Use molduras faciais desidentificadas ou saídas derivadas de marcos faciais para armazenamento de análises internas quando exigido pela política local de ética.

2. Ambiente experimental e configuração do estímulo

  1. Preparação do ambiente de visualização
    1. Prepare um ambiente interno silencioso para simular um ambiente controlado de exposição de pintura. Mantenha uma temperatura ambiente de 22–24 °C e umidade relativa de 45%–60%. Controle o ruído de fundo abaixo de 40 dB sempre que possível.
    2. Sente o participante em uma cadeira vertical com suporte para as costas e posicione a cadeira de modo que a distância de visualização entre o participante e a exibição seja de 2,0 m.
    3. Instrua o participante a permanecer sentado sozinho na área de gravação durante a apresentação do estímulo. Não permita que outros participantes ou observadores estejam no campo de visão imediato durante a aquisição dos dados.
  2. Configuração da iluminação
    1. Instale iluminação circular ou circular difusa à frente do participante para reduzir a sombra facial. Ajuste a iluminação para um nível estável de aproximadamente 500 lux na altura do rosto.
    2. Evite flutuações rápidas de luz e o reflexo direto nos olhos, testa ou bochechas. Checkpoint visual: Confirme que o rosto inteiro, incluindo testa, sobrancelhas, olhos, nariz, bochechas e região da boca, está visível na prévia da câmera sem superexposição ou sombra profunda.
  3. Configuração da apresentação do estímulo visual
    1. Apresente os estímulos visuais em um monitor ou tela de projeção. Neste protocolo de demonstração, use um monitor de cristal líquido de 27 polegadas com resolução de 1.920 x 1.080 pixels e taxa de atualização de 60 Hz.
    2. Exiba estímulos para visualização de pinturas em formato de vídeo ou slideshow de acordo com o desenho do estudo. Use as mesmas regras de brilho, contraste e ordem de apresentação da tela para todos os participantes.
    3. Apresente cada clipe de pintura por 90–120 segundos. Neste protocolo de demonstração, use 6 clipes, cada um com duração de 100 s, com intervalo de descanso entre estímulos de 20 s.
      ATENÇÃO: Aterre todos os equipamentos elétricos corretamente e coloque o amplificador de EEG e os cabos de alimentação longe de fontes de alta interferência para reduzir o ruído de linha 50/60 Hz.

3. Aquisição multimodal de dados

  1. Aquisição de vídeo facial
    1. Posicione uma câmera industrial de alta definição diretamente à frente do participante, aproximadamente na altura dos olhos. Ajuste a distância da câmera-face para 1,2 m.
    2. Use uma câmera com resolução mínima de aquisição de 1.920 x 1.080 pixels e taxa de quadros de 30 quadros/s.
    3. Ajuste a exposição manualmente para evitar flutuações de quadro a quadro. Neste protocolo de demonstração, use ISO 400, velocidade do obturador 1/60 s e balanço de branco fixo.
    4. Salve o vídeo em formato MP4 ou AVI usando uma taxa de quadros constante. Neste protocolo de demonstração, salve vídeo como MP4, codificação H.264, 30 quadros/s.
    5. Verifique se o rosto completo permanece dentro do campo de visão durante toda a sessão de gravação. Checkpoint visual: Confirme que as sobrancelhas e a testa estão totalmente visíveis. Reposicione a câmera imediatamente se a testa, região da sobrancelha ou queixo estiverem cortados.
      NOTA: Use 30 quadros/s porque essa taxa de quadros oferece resolução temporal adequada para dinâmicas de expressão facial de baixa intensidade, mantendo uma carga de armazenamento e processamento gerenciáveis em gravações multimodais sincronizadas.
  2. Aquisição de sinais EEG
    1. Meça a circunferência da cabeça e selecione o tamanho correto da touca para o participante. Coloque a tampa EEG de 64 canais de acordo com o sistema internacional 10–20 ou um layout de extensão de 64 canais especificado pelo fabricante.
    2. Alinhe a tampa usando pontos de referência anatômicos. Posicione Fpz na linha média acima da nasion e verifique a simetria entre os hemisférios esquerdo e direito.
    3. Separe o cabelo em cada local do eletrodo e aplique gel condutor para melhorar o contato entre eletrodo e couro cabeludo.
    4. Prepare o couro cabeludo suavemente em locais de alta impedância usando um cotonete ou uma ferramenta de preparação sem rodeios. Não desgaste a pele em excesso.
    5. Conecte o condensador ao amplificador de EEG e realize a medição de impedância. Reduza a impedância do eletrodo para menos de 10 kΩ para todos os canais. Neste protocolo de demonstração, busque < 5 kΩ para eletrodos frontais e centrais sempre que possível.
    6. Defina a frequência de amostragem para 500 Hz. Defina a referência online de acordo com a configuração do amplificador. Neste protocolo de demonstração, use uma referência mastoide vinculada durante a aquisição e realize uma re-referência média comum durante o pré-processamento.
    7. Coloque o eletrodo de terra de acordo com a especificação do amplificador. Neste protocolo de demonstração, coloque o solo em AFz. Registre pelo menos 60 segundos de repouso basal antes da apresentação do estímulo.
    8. Checkpoint visual: Inspecione os traços de EEG ao vivo antes de iniciar o experimento. Confirme atividade de base estável, baixa deriva e ausência de canais saturados persistentes ou artefatos de movimento maiores.
  3. Sincronização de fluxos de EEG e vídeo
    1. Conecte o computador de apresentação de estímulo à entrada de disparo do amplificador EEG usando um cabo de disparo ou caixa de disparo TTL (transistor-transistor).
    2. Use o software de apresentação para enviar um pulso de gatilho TTL no início de cada clipe de pintura e um segundo pulso de gatilho TTL no deslocamento de cada clipe.
    3. Atribua códigos de gatilho únicos a cada tipo de evento. Neste protocolo de demonstração, use 11–16 para início do clipe e 21–26 para deslocamento do clipe.
    4. Grave o fluxo da câmera e o fluxo de EEG simultaneamente de pelo menos 5 segundos antes do primeiro disparo até pelo menos 5 segundos após o disparo final. Registre automaticamente a tabela de datas de disparo no software de estímulo.
    5. Valide a sincronização após a aquisição comparando os carimbos de tempo de disparo na gravação EEG com índices de quadros de vídeo do registro de apresentação. Checkpoint visual: Confirme que o erro médio de alinhamento entre os carimbos de disparo do EEG e os de quadros de vídeo está dentro de ±33 ms a 30 quadros/s.
      NOTA: Se não houver uma interface de sincronização de hardware com precisão de quadros disponível, exporte logs de carimbo de tempo de ambos os sistemas e realize correção de alinhamento offline usando correspondência de início de gatilho.
  4. Registrar dados experimentais
    1. Instrua o participante a ver as pinturas de forma natural, minimizando grandes movimentos da cabeça, piscar excessivamente, falar e toques faciais.
    2. Apresente os clipes de pintura pré-definidos na ordem selecionada. Grave EEG sincronizado e vídeo facial continuamente durante toda a sessão de visualização.
    3. Pause o experimento e verifique novamente os eletrodos se mais de 5 canais excederem o limiar de impedância durante a gravação. Registre interrupções, desconforto dos participantes e problemas técnicos no registro de sessões.

4. Pré-processamento de EEG e extração de características

  1. Importação de dados brutos de EEG
    1. Importe as gravações brutas de EEG para o ambiente de análise. Neste protocolo de demonstração, use MATLAB R2023b com EEGLAB 2024.0 ou Python 3.10 com MNE 1.6.
    2. Importe os marcadores de evento e verifique se todos os gatilhos de início e deslocamento do estímulo estão presentes.
  2. Amostragem reduzida dos sinais de EEG
    1. Reduza a amostragem dos sinais de 500 Hz para 200 Hz e pré-processe-os de acordo com o fluxo de trabalho mostrado na Figura 1.
    2. Aplique anti-aliasing durante a reamostragem de acordo com o padrão do software ou as configurações definidas do filtro.
  3. Filtragem dos sinais do EEG
    1. Aplique um filtro passa-banda de 0,5 a 45 Hz. Aplique um filtro de entalhe na frequência local de potência se houver ruído visível na linha. Neste protocolo de demonstração, aplique um filtro de entalhe de 50 Hz.
  4. Remoção de artefatos
    1. Inspecione manualmente o EEG contínuo e marque segmentos com artefatos de movimento grosseiro.
    2. Execute uma análise independente de componentes nos dados filtrados. Identifique componentes associados a piscadas, movimentos horizontais dos olhos, tensão da mandíbula ou atividade muscular usando mapas do couro cabeludo, cursos de tempo e espectros de potência.
    3. Remova os componentes identificados do artefato e reconstrua os sinais de EEG limpos. Segmentos de rejeição que ainda contêm flutuação excessiva de amplitude após correção independente de análise de componentes. Neste protocolo de demonstração, segmentos rejeitados excedem ±100 μV.
  5. Rereferenciação dos dados
    1. Refaça a referência dos sinais de EEG limpos para a média comum de referência.
  6. Segmentando os dados do EEG
    1. Época o EEG contínuo de acordo com os gatilhos de início do estímulo. Extraia segmentos alinhados ao estímulo que cobrem toda a janela de análise de clipe ou fixa. Neste protocolo de demonstração, segmente o EEG em janelas de 2,0 s com 50% de sobreposição. Exclua janelas com artefatos residuais após a segmentação.
  7. Cálculo das características de entropia diferencial
    1. Decomponha cada segmento de EEG nas seguintes faixas de frequência: delta (1–4 Hz), theta (4–8 Hz), alfa (8–13 Hz), beta (13–30 Hz) e gama (30–45 Hz).
    2. Calcule a entropia diferencial de cada faixa de frequência para cada canal. Use a seguinte equação para uma variável Gaussiana:
      DE = 1/2 ln(2πeσ2), onde σ2 é a variância do sinal EEG limitado por banda.
    3. Organize os valores diferenciais de entropia canal a canal em uma matriz topográfica bidimensional ou matriz canal-característica para entrada do modelo.
    4. Neste protocolo de demonstração, gere mapas de características do EEG com tamanho de entrada de 128 × 128 x 5 por janela de análise. Checkpoint visual: Plote mapas representativos de entropia diferencial para cada banda e confirme que canais ausentes, mapas de valor constante ou colapso anormal na faixa não estão presentes.

5. Pré-processamento de vídeo facial

  1. Extração de quadros de imagem
    1. Decode o vídeo gravado em quadros de imagem usando um pipeline scriptado. Extrair os quadros a 25 quadros/s para entrada do modelo preservando os metadados de sincronização.
  2. Detecção e alinhamento da face
    1. Detecte o rosto em cada quadro usando um detector de rosto validado. Localize pontos de referência faciais e alinhe o rosto com base nos centros dos olhos ou nas âncoras padrão de referência. Descarte quadros em que a face não é detectada de forma confiável.
  3. Recorte e redimensionamento da região da face
    1. Recorte a face até a caixa delimitadora detectada com uma pequena margem para preservar a informação do contorno. Redimensione a imagem do rosto cortado para 224 x 224 pixels.
    2. Inspecione amostras faciais representativas recortadas das quatro categorias de emoções alvo, conforme mostrado na Figura 2, e confirme que a testa, sobrancelhas, olhos, nariz, bochechas e boca permanecem visíveis após o recorte.
  4. Ampliando as imagens de treinamento
    1. Aplique flips horizontais aleatórios com probabilidade 0,5 apenas no conjunto de treinamento. Aplique rotação aleatória dentro de ±15° apenas no conjunto de treinamento.
    2. Não aplique aumento em validação ou teste de imagens.
  5. Normalização da entrada facial
    1. Normalize os valores dos pixels para o intervalo [-1, 1] ou use a regra de normalização específica da espinha dorsal consistentemente em todas as divisões.

6. Construir a rede neural multimodal

  1. Configuração do ambiente de software e hardware
    1. Implemente o modelo em Python 3.10 usando PyTorch 2.1. Execute o treinamento no Ubuntu 22.04 ou em outro sistema operacional especificado.
    2. Use uma estação de trabalho com pelo menos 32 GB de RAM, uma unidade de processamento gráfico com pelo menos 12 GB de memória de vídeo e armazenamento local suficiente para dados sincronizados EEG-vídeo. Neste protocolo de demonstração, use uma unidade de processamento gráfico NVIDIA RTX 3080.
    3. Armazene o script de treinamento, o arquivo de definição do modelo, o script de pré-processamento e o arquivo de configuração em um diretório de projeto controlado por versão.
    4. Reporte o repositório de código ou o pacote de script arquivado no manuscrito, caso o compartilhamento seja permitido.
  2. Construindo o ramo facial
    1. Construa a estrutura multimodal de duplo ramo como mostrado na Figura 3. Inicialize uma espinha dorsal MobileNetV2 para o ramo facial.
    2. Modificar a primeira camada de convolução de 32 canais para 24 canais. Construa o ramo de extração de características faciais de acordo com a Figura 4 e insira módulos de atenção coordenada após os blocos residuais invertidos selecionados, como mostrado na Figura 5.
    3. Substitua as convoluções padrão designadas por convoluções paralelas em profundidade de 3 x 3 e 5 x 5 de tamanho de grão para melhorar a extração de características em múltiplas escalas.
    4. Exporte um vetor de características faciais de dimensão fixa para fusão. Neste protocolo de demonstração, use uma dimensão de característica de 256.
  3. Construindo a filial do EEG
    1. Insira a característica de entropia diferencial em um codificador de rede neural convolucional. Use as camadas convolucionais para extrair padrões espaciais dos mapas de características do EEG.
    2. Alimente a sequência convolucional de saída em um módulo bidirecional de memória de curto prazo longo para capturar a dependência temporal entre janelas.
    3. Exporte um vetor de características EEG de dimensão fixa. Neste protocolo de demonstração, use uma dimensão de característica de 256.
  4. Construindo o módulo de fusão cross-modal
    1. Implemente o módulo de interação multimodal de características mostrado na Figura 6. Implemente um bloco de atenção cruzada com múltiplas cabeças e 8 cabeças.
    2. Use a sequência de características EEG como consulta e a sequência de traços faciais como chave e valor em um fluxo de atenção cruzada.
    3. Use a sequência de características faciais como consulta e a sequência de características EEG como chave e valor no fluxo de atenção cruzada recíproca.
    4. Concatene as saídas dos dois fluxos de atenção cruzada. Passe a característica concatenada por uma camada de projeção de fusão.
  5. Adição do módulo de convolução dilatada auto-residual
    1. Refinar a representação fundida com a camada de conexão de convolução dilatada auto-residual mostrada na Figura 7.
    2. Construa uma camada de concatenação de convolução dilatada usando taxas de dilatação de 1, 3, 6 e 12. Concatene as saídas dos quatro ramos de dilatação.
    3. Adicione conexões residuais de salto para estabilizar o fluxo do gradiente e preservar informações de nível inferior.
  6. Adição do classificador
    1. Achatar ou agrupar a representação fundida. Adicione uma camada totalmente conectada e uma camada final de saída softmax. Defina as classes de saída para medo, felicidade, calma e tristeza.
  7. Definição dos ambientes de treinamento
    1. Use as configurações de rede e treinamento resumidas na Tabela 1. As quatro classes de emoções (medo, felicidade, calma e tristeza) foram definidas operacionalmente usando um procedimento combinado de rotulagem baseado no desenho do estímulo e no autorrelato dos participantes. Cada clipe de pintura foi pré-selecionado para provocar uma categoria de emoção alvo, e os participantes relataram sua experiência emocional dominante após a visualização. Os rótulos finais foram atribuídos alinhando a categoria de estímulo pretendida com as respostas auto-relatadas, e amostras inconsistentes foram excluídas para garantir a confiabilidade da rotulagem.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

O desempenho da proposta rede de atenção cruzada de dois ramos foi avaliado usando o conjunto de dados multimodal coletado de 327 participantes durante a visualização da pintura. O resultado primário foi o desempenho de classificação emocional em quatro classes para medo, felicidade, calma e tristeza. Análises adicionais examinaram o comportamento do modelo unimodal, convergência multimodal, sensibilidade ao número de cabeças de atenção, desempenho de reconhecimento comparativo e o compo...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Esse protocolo aborda um problema prático na computação afetiva, ou seja, como reconhecer estados emocionais em ambientes de visualização de pinturas, onde a expressão visível e a resposta fisiológica podem não coincidir totalmente em todos os momentos. Sob as condições experimentais aqui relatadas, a estrutura de duplo ramo alcançou desempenho de classificação superior aos modelos de comparação unimodais, o que apoia o valor de combinar eletroencefalografia e informações de expressão fa...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Os autores não declaram conflitos de interesse.

Agradecimentos

Expressamos nossa sincera gratidão aos voluntários da Universidade Normal Minzu de Xingyi e da Universidade do Sudoeste por sua participação nos experimentos. Também agradecemos à equipe técnica da Universidade de Girona pela assistência na aquisição de dados do EEG e aos revisores anônimos por seus comentários perspicazes.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Estrutura de Aprendizado ProfundoPyTorchv2.0 / https://pytorch.orgUsado para construção de modelos, treinamento e avaliação
Sistema de Aquisição de EEG (64 canais)Brain Products GmbHactiCHamp Plus / v1.6Usado para aquisição de sinais de EEG de alta resolução durante experimentos
Tampa do Eletrodo EEG (10– sistema 20)Brain Products GmbHActiCap / 64 canaisStandard International 10– Posicionamento de 20 eletrodos
Câmera de Alta DefiniçãoSony CorporationIMX327 SensorUsado para gravação de vídeo com expressões faciais (≥ 1080p, 30 fps)

Referências

  1. Yang, Y., et al. A dual-stream regional feature learning and adaptive fusion method for electroencephalogram-based emotion recognition. Eng Appl Artificial Intell. 164, 113250(2026).
  2. Li, C., Pun, S. H., Li, J. W., Chen, F. Eeg-based emotion recognition using graph attention network with dual-branch attention module. 2024 46th Ann Int Conf IEEE Eng Me Biol Soc (EMBC), , 1-4 (2024).
  3. Ubillús, J. A. T., et al. Algorithms used for facial emotion recognition: A systematic review of the literature. EAI Endorsed Transact Pervasive Health Technol. 9, 1-17 (2023).
  4. Xu, Y., Cheng, L. Face emotion recognition based on gabor wavelet and particle swarm optimization algorithm. Multimed Syst. 31 (6), 435(2025).
  5. Dube, D. Y., Sannasi, M. V., Kyritsis, M., Gulliver, S. R. Facial emotion recognition from feature loss media: Human versus machine learning algorithms. Comp Human Behav. 174, 108806(2026).
  6. Manuel, M. T. J., Medina-DeVilliers, S., Clarkson, T., Lerner, M. D., Riccardi, G. Evaluation of interpretability for deep learning algorithms in EEG emotion recognition: A case study in autism. Artif Intell Med. 143, 102545(2023).
  7. Watanabe, A., Yamazaki, T. Representation of the brain network by electroencephalograms during facial expressions. J Neurosci Meth. 357, 109158(2021).
  8. Prakash, A., Poulose, A. Electroencephalogram-based emotion recognition: A comparative analysis of supervised machine learning algorithms. Data Sci Manag. 8 (3), 342-360 (2025).
  9. Sun, Y., Ayaz, H., Akansu, A. N. Multimodal affective state assessment using fnirs + eeg and spontaneous facial expression. Brain Sci. 10 (2), 85(2020).
  10. Huang, Y., Yang, J., Liu, S., Pan, J. Combining facial expressions and electroencephalography to enhance emotion recognition. Future Internet. 11 (5), 105(2019).
  11. Han, Q., et al. A multi-branch electroencephalogram emotion recognition framework based on cross-subject or cross-session multi-perspective representation fusion. Neurocomputing. 658, 131767(2025).
  12. Wang, L., Chang, Y., Wang, K. Dual-branch multimodal fusion network for driver facial emotion recognition. Appl Sci. 14 (20), 9430(2024).
  13. Mutawa, A. M., Hassouneh, A. Multimodal real-time patient emotion recognition system using facial expressions and brain EEG signals based on machine learning and log-sync methods. Biomed Signal Proc Contr. 91, 105942(2024).
  14. Qi, Y., Ibrayim, M., Hamdulla, A. Attention-based dual-branch network for micro-expression recognition with global-local feature fusion. 2024 IEEE Int Joint Conf Biometr (IJCB), , 1-9 (2024).
  15. Li, E. Intervention of art education on college students’ aesthetic mood based on emotion recognition algorithm. Front Art Res. 6 (9), 81-90 (2024).
  16. Liu, Z., Han, M., Wu, B., Rehman, A. Speech emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multi-task learning. Appl Acoustics. 202, 109178(2023).
  17. Xue, P., Wang, S., Bai, J., Qiang, Y. Research on bimodal emotion recognition algorithm based on multi-branch bidirectional multi-scale time perception. J Biome Eng. 42 (3), 528-536 (2025).
  18. Shioiri, S., Nagata, H., Sato, Y., Hatori, Y. Prediction of preference judgments of face images using facial expressions and eeg signals. J Vis. (9), 5063(2023).
  19. Lu, Y., Chen, J. Cross-subject EEG emotion recognition using the SSA-EMS algorithm for feature extraction. Entropy. 27 (9), 986(2025).
  20. Thapa, D., Rai, R. Freq-eer: A novel frequency-driven ensemble framework for emotion recognition and classification of eeg signals. Appl Sci. 15 (19), 10671(2025).
  21. Yang, Y., et al. Investigating of deaf emotion cognition pattern by eeg and facial expression combination. IEEE J Biomed Health Inform. 26 (2), 589-599 (2022).
  22. Tong, L., Yang, L., Wang, X., Liu, L. Self-aware face emotion accelerated recognition algorithm: A novel neural network acceleration algorithm of emotion recognition for international students. PeerJ Comput Sci. 9, e1611(2023).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Etiquetas

Reconhecimento de Emoções por EEGAnálise de Expressão FacialEntropia DiferencialRede Neural ConvolucionalLSTM BidirecionalComputação AfetivaInteração Humano-Computador