Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de método

Red de Doble Rama de Atención Cruzada para Electroencefalografía y Reconocimiento Multimodal de Emociones Faciales durante la Visualización de Pinturas

114 visualizaciones

⸱

DOI:

10.3791/70600

⸱

12 de mayo de 2026

En este artículo

Resumen

Este protocolo describe la adquisición sincronizada de electroencefalografía y datos faciales en entornos de visualización de pintura y una red de doble rama cruzada de atención para el reconocimiento multimodal de emociones, incluyendo preprocesamiento, fusión de características y clasificación de cuatro estados emocionales.

Resumen

El reconocimiento emocional durante la visualización de la pintura sigue siendo difícil porque las respuestas estéticas son dinámicas, dependes del contexto y solo parcialmente observables a través del comportamiento externo. Por tanto, los enfoques unimodales basados únicamente en expresiones faciales o únicamente en señales fisiológicas, a menudo proporcionan representaciones incompletas de la experiencia del espectador. Este artículo describe un método reproducible para construir una red de doble rama de atención cruzada que integra vídeo facial con datos de electroencefalografía (EEG) para el reconocimiento multimodal de emociones en un contexto de exposición de pintura. El protocolo comienza con el establecimiento de un entorno de adquisición sincronizado utilizando un sistema EEG de 64 canales y una cámara de alta resolución para la grabación simultánea durante la visualización de pinturas. El procedimiento posterior detalla el preprocesamiento de señales, incluyendo filtrado EEG, segmentación y extracción de características de entropía diferencial, junto con la detección facial, alineación y preparación de fotogramas para análisis de vídeo. La red neuronal contiene dos ramas específicas de cada modalidad. La rama EEG utiliza una red neuronal convolucional y una red bidireccional de memoria a corto plazo largo para modelar características neuronales espacio-temporales, mientras que la rama facial utiliza una red convolucional ligera mejorada por coordenadas para extraer características de expresión visual. A continuación, se utiliza un módulo de atención cruzada multicabeza para fusionar ambos flujos aprendiendo la relevancia intermodal. Bajo las condiciones experimentales aquí reportadas, el marco multimodal alcanzó una mayor precisión de clasificación que los modelos unimodales de comparación en el reconocimiento emocional de cuatro categorías. Este método es más adecuado para el análisis offline en entornos de adquisición controlada y proporciona un marco práctico para la computación afectiva, la estética empírica y la investigación de interacción humano-ordenador orientada a exposiciones.

Introducción

La emoción es un proceso psicológico y fisiológico multidimensional moldeado por estímulos externos, evaluación interna y regulación cognitiva continua, y por ello ocupa una posición central en la interacción humano-ordenador y en la cienciacognitiva. En los entornos de exposiciones pictóricas, la emoción también media la relación entre las obras visuales y la interpretación del espectador. Por esta razón, la identificación de los estados emocionales del espectador tiene un valor práctico para la evaluación de exposiciones, el diseño espacial y los estudios empíricos de la experienciaestética 2. Al mismo tiempo, la medición de la emoción en entornos expositivos seminaturales sigue siendo técnicamente difícil porque las respuestas son sutiles, transitorias e influenciadas tanto por la obra como por el contexto de visualización.

La investigación en reconocimiento emocional se ha desarrollado generalmente en dos líneas principales: análisis conductual y análisis fisiológico. Los enfoques conductuales, especialmente el análisis de expresiones faciales basados en visión por ordenador, se utilizan ampliamente porque no son invasivos y relativamente fáciles de implementar3. Los modelos de aprendizaje profundo, como las redes residuales y las redes convolucionales ligeras, han mostrado un gran rendimiento en tareas básicas de clasificación de emocionesfaciales 4. Sin embargo, el comportamiento facial durante la visualización de la pintura puede ser débil, moderado socialmente o deliberadamente contenido, lo que puede reducir la correspondencia entre la expresión visible y el sentimientosubjetivo 5. Los enfoques fisiológicos, especialmente los basados en la electroencefalografía (EEG), ofrecen un acceso más directo a la actividad neuronal asociada al procesamientoafectivo 6. El EEG se ha utilizado ampliamente en estudios emocionales porque las fluctuaciones temporales en las señales neuronales son informativas para los cambios en el estado afectivo, incluyendo dimensiones relacionadas con la valencia y laactivación 7. Aun así, las grabaciones de EEG son sensibles a artefactos de movimiento, contaminación electromiográfica y ruido ambiental, y el EEG por sí solo a menudo proporciona información contextual limitada sobre a qué responde visualmenteel espectador 8.

Estas fortalezas y debilidades complementarias han incrementado el interés en el reconocimiento multimodalde emociones 9. La premisa central de la fusión multimodal es que las señales heterogéneas pueden proporcionar evidencia mutuamente informativa y reducir la ambigüedad que surge cuando una sola modalidad se interpretaaisladamente 10. En tareas de visualización de pintura, por ejemplo, el comportamiento facial contenido puede coincidir aún con cambios neurales medibles asociados a la atención o al compromiso afectivo. Sin embargo, los sistemas multimodales existentes no siempre modelan esta relación de forma efectiva. Las primeras estrategias de fusión basadas en la concatenación directa de características pueden aumentar la carga dimensional y difuminar la estructura temporal específica de lamodalidad 11. Las estrategias de fusión tardía basadas en decisiones separadas son más fáciles de implementar, pero pueden pasar por alto interacciones detalladas entre señales visuales y fisiológicas durante el procesamientoemocional 12. Además, muchos modelos multimodales utilizan esquemas de fusión fijos o débilmente adaptativos, que no son adecuados para respuestas fluctuantes del espectador en entornos tipoexhibición 13.

Para abordar estas limitaciones, el protocolo actual describe una red de doble rama cruzada de atención para el reconocimiento multimodal de emociones durante la visualización de pinturas. En este marco, las características EEG se procesan mediante un modelo de memoria a corto plazo bidireccional de red neuronal convolucional (CNN-BiLSTM), que se utiliza para representar la dinámica neuronal espacio-temporal. Las características de vídeo facial se procesan mediante una rama MobileNetV2 mejorada por atención en coordenadas, que se utiliza para capturar señales de expresión de baja intensidad manteniendo la eficienciacomputacional 14. Las dos ramas se integran entonces mediante un mecanismo de atención cruzada multi-cabeza que aprende la relevancia entre modalidades en lugar de simplemente concatenar sussalidas 15,16. Este diseño pretende preservar la estructura específica de cada modalidad mientras mejora el modelado de interacción entre modales.

El método está diseñado principalmente para el análisis offline bajo condiciones controladas de adquisición de datos, más que para su despliegue directo en tiempo real en espacios públicos abiertos de exposición. Una implementación fiable requiere EEG y captura de vídeo sincronizados, iluminación estable, colocación controlada de la cámara, impedancia de electrodos aceptable y recursos computacionales suficientes para el entrenamiento del modelo. El rendimiento también puede depender de la composición de la muestra, el tipo de estímulo y el grado en que los participantes modifican su comportamiento porque saben que están siendo registrados. Estas limitaciones operativas deben tenerse en cuenta al adaptar el protocolo a otros entornos o poblaciones expositivas.

El protocolo presentado aquí cubre toda la cadena experimental, incluyendo la adquisición sincronizada de 327 participantes, preprocesamiento de datos de EEG y vídeo facial, extracción de características, fusión intermodal y clasificación. El objetivo es proporcionar un flujo de trabajo reproducible para el reconocimiento multimodal de emociones en la investigación de exposiciones pictóricas. Más allá de la computaciónafectiva 17, el protocolo también puede apoyar la investigación cuantitativa en estética empírica y estudios psicológicos relacionados18.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

El protocolo del estudio fue revisado y aprobado por el Comité de Ética para la Protección de la Investigación Humana de la Universidad Normal Xingyi Minzu (Aprobación nº 2600AL0621). Se obtuvo el consentimiento informado por escrito de todos los participantes antes de su inclusión en el estudio y antes de la recogida de datos.

1. Reclutamiento de participantes y cumplimiento ético

  1. Obtención de la aprobación ética
    1. Presentar el protocolo experimental completo, el formulario de consentimiento, la hoja informativa del participante y el plan de protección de datos al comité de revisión institucional (IRB) o al comité de ética antes de comenzar el estudio.
    2. Obtén la aprobación por escrito y registra el número de aprobación en la documentación del estudio.
  2. Reclutamiento de participantes
    1. Recluta participantes adultos sanos para la adquisición multimodal de emociones durante la visualización de pinturas. En este protocolo de demostración, recluta a 327 participantes.
    2. Aplicar los siguientes criterios de inclusión: edad de 18 a 35 años, visión normal o corregida a normal, sin antecedentes autoinformados de trastornos neurológicos, ausencia de uso actual de medicación psicoactiva y disposición a someterse a una grabación electroencefalológica (EEG) y grabación de vídeo facial.
    3. Aplicar los siguientes criterios de exclusión: lesión excesiva en el cuero cabelludo o condiciones dermatológicas que impidan la colocación de electrodos, imposibilidad de completar la sesión completa de grabación, movimiento severo durante la adquisición o documentación de consentimiento incompleta.
    4. Registrar características de los participantes, incluyendo edad, sexo, lateralidad, experiencia previa en la visualización de arte y nivel educativo. En este protocolo de demostración, registrar la siguiente muestra SHORT LONG ABSTRACT: edad media 24,8 ± 3,7 años, 165 mujeres y 162 hombres, todos participantes diestros.
    5. Define el equilibrio demográfico operativo antes de la contratación. En este protocolo de demostración, utiliza este término para indicar una distribución de sexos aproximadamente equilibrada y un rango de edad concentrado en la adultez temprana para reducir la variación relacionada con la edad en el EEG y las respuestas de expresión facial.
  3. Obtención del consentimiento informado
    1. Proporcionar a cada participante un formulario escrito de consentimiento informado que describa la grabación EEG, la grabación de vídeo facial, los procedimientos de sincronización, la anonimización, el almacenamiento de datos y el derecho a retirarse en cualquier momento sin penalización.
    2. Explica que las imágenes faciales se utilizarán para la extracción de rasgos y que las regiones oculares estarán ocultas en todas las figuras manuscritas para proteger la identidad de los participantes.
    3. Obtén el consentimiento informado por escrito antes de que comience cualquier procedimiento experimental.
  4. Asignación de identificadores y anonimización de datos
    1. Asigna a cada participante un ID numérico único de estudio. Almacena archivos EEG, archivos de vídeo y metadatos usando únicamente el ID del estudio.
    2. Guarda los formularios de consentimiento identificables por separado de los datos fisiológicos e imagen. Utiliza marcos faciales desidentificados o salidas derivadas de puntos de referencia faciales para almacenamiento interno de análisis cuando la política de ética local lo requiera.

2. Entorno experimental y preparación de estímulos

  1. Preparación del entorno de visualización
    1. Prepara una sala interior tranquila para simular un entorno controlado de exposición de pintura. Mantener una temperatura ambiente de 22–24 °C y una humedad relativa del 45%–60%. Controla el ruido de fondo por debajo de 40 dB cuando sea posible.
    2. Sienta al participante en una silla vertical con soporte para el respaldo y coloca la silla de modo que la distancia de visión entre el participante y la pantalla sea de 2,0 m.
    3. Instruye al participante para que permanezca sentado solo en el área de grabación durante la presentación del estímulo. No permitas que otros participantes u observadores estén en el campo de visión inmediato durante la adquisición de datos.
  2. Configuración de la iluminación
    1. Instala iluminación circular o de anillo difuso delante del participante para reducir la sombra facial. Ajusta la iluminación a un nivel estable de aproximadamente 500 lux a nivel de cara.
    2. Evita fluctuaciones rápidas de la luz y el deslumbramiento directo en los ojos, la frente o las mejillas. Punto de control visual: Confirma que toda la cara, incluyendo la frente, las cejas, los ojos, la nariz, las mejillas y la zona de la boca, es visible en la vista previa de la cámara sin sobreexposición ni sombra profunda.
  3. Configuración de la presentación del estímulo visual
    1. Presenta los estímulos visuales en un monitor o pantalla de proyección. En este protocolo de demostración, utiliza un monitor de cristal líquido de 27 pulgadas con una resolución de 1.920 x 1.080 píxeles y una tasa de refresco de 60 Hz.
    2. Mostrar los estímulos para ver la pintura en formato de vídeo o presentación según el diseño del estudio. Utiliza las mismas reglas de brillo, contraste y orden de presentación de pantalla para todos los participantes.
    3. Presenta cada clip de pintura durante 90–120 s. En este protocolo de demostración, utiliza 6 clips, cada uno de 100 s de duración, con un intervalo de descanso interestímulo de 20 s.
      PRECAUCIÓN: Conecta a tierra todo el equipo eléctrico correctamente y coloca el amplificador EEG y los cables de alimentación alejados de fuentes de alta interferencia para reducir el ruido de línea de 50/60 Hz.

3. Adquisición de datos multimodales

  1. Adquisición de vídeo facial
    1. Coloca una cámara industrial de alta definición directamente delante del participante, aproximadamente a la altura de los ojos. Ajusta la distancia cámara-cara a 1,2 m.
    2. Utiliza una cámara con una resolución mínima de adquisición de 1.920 x 1.080 píxeles y una tasa de fotogramas de 30 fotogramas/s.
    3. Ajusta la exposición manualmente para evitar fluctuaciones de fotograma a fotograma. En este protocolo de demostración, usa ISO 400, velocidad de obturación 1/60 s y balance de blancos fijo.
    4. Guarda el vídeo en formato MP4 o AVI usando una tasa de fotogramas constante. En este protocolo de demostración, guarda el vídeo como MP4, codificación H.264, 30 fotogramas/s.
    5. Verifica que la cara completa permanezca dentro del campo de visión durante toda la sesión de grabación. Punto de control visual: Confirma que las cejas y la frente estén completamente visibles. Recoloca la cámara inmediatamente si la frente, la zona de las cejas o la barbilla están recortadas.
      NOTA: Utilice 30 fotogramas/s porque esta tasa proporciona una resolución temporal adecuada para dinámicas de expresión facial de baja intensidad, manteniendo al mismo tiempo un almacenamiento y carga de procesamiento manejables en grabación multimodal sincronizada.
  2. Adquisición de señales EEG
    1. Mide la circunferencia de la cabeza y selecciona el tamaño correcto de gorra para el participante. Colocar el tapón EEG de 64 canales según el sistema internacional 10–20 o una disposición de extensión de 64 canales especificada por el fabricante.
    2. Alinea la gorra usando puntos anatómicos. Coloca Fpz en la línea media por encima del nasion y verifica la simetría entre los hemisferios izquierdo y derecho.
    3. Parte el cabello en cada sitio del electrodo y aplica gel conductor para mejorar el contacto electrodo-cuero cabelludo.
    4. Prepara el cuero cabelludo suavemente en zonas de alta impedancia usando un hisopo de algodón o una herramienta de preparación contundente. No desgastes la piel en exceso.
    5. Conecta el condensador al amplificador de EEG y realiza la medición de impedancia. Reducir la impedancia del electrodo a menos de 10 kΩ para todos los canales. En este protocolo de demostración, apunta a < 5 kΩ para electrodos frontales y centrales cuando sea posible.
    6. Configura la frecuencia de muestreo a 500 Hz. Establece la referencia en línea según la configuración del amplificador. En este protocolo de demostración, utiliza una referencia mastoide enlazada durante la adquisición y realiza una re-referencia promedio común durante el preprocesamiento.
    7. Coloca el electrodo de tierra según la especificación del amplificador. En este protocolo de demostración, coloca el suelo en AFz. Registrar al menos 60 segundos de línea base en reposo antes de la presentación del estímulo.
    8. Punto de control visual: Inspecciona las trazas de EEG en vivo antes de comenzar el experimento. Confirmar actividad estable en la línea base, baja deriva y ausencia de canales saturados persistentes o artefactos de movimiento mayores.
  3. Sincronización de EEG y flujos de vídeo
    1. Conecta el ordenador de presentación de estímulo a la entrada de disparo del amplificador EEG usando un cable de disparo o caja de disparo de lógica transistor-transistor (TTL).
    2. Utiliza el software de presentación para enviar un pulso de disparo TTL al inicio de cada clip de pintura y un segundo pulso de disparo TTL en el desplazamiento de cada clip.
    3. Asigna códigos de disparo únicos a cada tipo de evento. En este protocolo de demostración, utiliza 11–16 para el inicio del clip y 21–26 para el desplazamiento del clip.
    4. Graba el flujo de cámara y el flujo EEG simultáneamente desde al menos 5 segundos antes del primer disparo hasta al menos 5 segundos después del disparo final. Registra automáticamente la tabla de marcas de tiempo del disparador en el software de estímulo.
    5. Validar la sincronización tras la adquisición comparando las marcas de tiempo de disparo en la grabación EEG con los índices de fotogramas de vídeo del registro de presentación. Punto de control visual: Confirma que el error medio de alineación entre las marcas de tiempo del disparador EEG y las marcas de tiempo de los fotogramas de vídeo está dentro de ±33 ms a 30 fotogramas/s.
      NOTA: Si no existe una interfaz de sincronización hardware con precisión de trama disponible, exporta los registros de marca de tiempo de ambos sistemas y realiza correcciones de alineación offline usando la coincidencia de inicio de disparo.
  4. Registro de datos experimentales
    1. Instruye al participante a ver las pinturas de forma natural minimizando los movimientos grandes de la cabeza, parpadeos excesivos, hablar y tocar la cara.
    2. Presenta los clips de pintura predefinidos en el orden seleccionado. Graba EEG sincronizado y vídeo facial de forma continua durante toda la sesión de visualización.
    3. Pausa el experimento y vuelve a revisar los electrodos si más de 5 canales superan el umbral de impedancia durante la grabación. Documenta las interrupciones, las molestias de los participantes y los problemas técnicos en el registro de la sesión.

4. Preprocesamiento EEG y extracción de características

  1. Importación de datos EEG en bruto
    1. Importa las grabaciones de EEG en bruto al entorno de análisis. En este protocolo de demostración, utiliza MATLAB R2023b con EEGLAB 2024.0 o Python 3.10 con MNE 1.6.
    2. Importa los marcadores de eventos y verifica que todos los desencadenantes de inicio y desplazamiento del estímulo estén presentes.
  2. Reducción de muestreo de las señales EEG
    1. Reduce la muestra de las señales de 500 Hz a 200 Hz y preprocesa según el flujo de trabajo mostrado en la Figura 1.
    2. Aplica antialiasing durante el remuestreo según la configuración predeterminada o del filtro definida por defecto.
  3. Filtrado de las señales EEG
    1. Aplicar un filtro pasa-banda de 0,5 a 45 Hz. Aplicar un filtro de muesca a la frecuencia local de potencia si persiste ruido visible en la línea. En este protocolo de demostración, aplica un filtro muesca de 50 Hz.
  4. Eliminación de artefactos
    1. Inspecciona manualmente el EEG continuo y marca los segmentos con artefactos de movimiento grueso.
    2. Realiza un análisis independiente de componentes sobre los datos filtrados. Identifica los componentes asociados con parpadeos, movimientos oculares horizontales, tensión mandibular o actividad muscular utilizando mapas del cuero cabelludo, trayectos temporales y espectros de potencia.
    3. Retirar los componentes identificados del artefacto y reconstruir las señales EEG limpiadas. Segmentos de rechazo que aún contienen fluctuaciones de amplitud excesivas tras una corrección independiente de análisis de componentes. En este protocolo de demostración, los segmentos de rechazo superan los ±100 μV.
  5. Re-referenciación de los datos
    1. Vuelve a revisar las señales EEG limpias a la referencia media común.
  6. Segmentación de los datos del EEG
    1. Epoch el EEG continuo según los desencadenantes de inicio del estímulo. Extraer segmentos alineados con estímulo que cubran todo el clip o ventanas de análisis fijas. En este protocolo de demostración, segmenta el EEG en ventanas de 2,0 s con un 50% de solapamiento. Excluye las ventanas con artefactos residuales tras la segmentación.
  7. Cálculo de características de entropía diferencial
    1. Descompone cada segmento EEG en las siguientes bandas de frecuencia: delta (1–4 Hz), theta (4–8 Hz), alfa (8–13 Hz), beta (13–30 Hz) y gamma (30–45 Hz).
    2. Calcular la entropía diferencial de cada banda de frecuencia para cada canal. Utilice la siguiente ecuación para una variable gaussiana:
      DE = 1/2 ln(2πeσ2), donde σ2 es la varianza de la señal EEG limitada por banda.
    3. Organizar los valores diferenciales de entropía canal a canal en una matriz topográfica bidimensional o matriz canal-rasgo para la entrada del modelo.
    4. En este protocolo de demostración, genera mapas de características EEG con un tamaño de entrada de 128 × 128 x 5 por ventana de análisis. Punto de control visual: Grafica mapas representativos de entropía diferencial para cada banda y confirma que no hay canales ausentes, mapas de valor constante o colapso anormal a banda a banda.

5. Preprocesamiento de vídeo facial

  1. Extracción de fotogramas de imagen
    1. Decodifica el vídeo grabado en fotogramas de imagen usando una tubería guionizada. Extrae tramas a 25 fotogramas/s para la entrada del modelo preservando los metadatos de sincronización.
  2. Detección y alineación de la cara
    1. Detecta la cara en cada fotograma usando un detector de caras validado. Localiza puntos de referencia faciales y alinea el rostro según los centros oculares o los anclajes estándar de los puntos de referencia. Descarta fotogramas en los que la cara no se detecta de forma fiable.
  3. Recorte y redimensionamiento de la región de la cara
    1. Recorta la cara hasta la caja delimitadora detectada con un pequeño margen para preservar la información de contorno. Redimensiona la imagen recortada a 224 x 224 píxeles.
    2. Inspecciona muestras faciales recortadas representativas de las cuatro categorías de emociones objetivo, como se muestra en la Figura 2, y confirma que la frente, las cejas, los ojos, la nariz, las mejillas y la boca permanecen visibles tras el recorte.
  4. Ampliación de las imágenes de entrenamiento
    1. Aplica volteos horizontales aleatorios con probabilidad 0,5 solo al conjunto de entrenamiento. Aplica rotaciones aleatorias dentro de ±15° solo al conjunto de entrenamiento.
    2. No aplique aumentos a imágenes de validación o prueba.
  5. Normalización de la entrada facial
    1. Normaliza los valores de píxeles al rango [-1, 1] o utiliza la regla de normalización específica de la columna vertebral de forma consistente en todas las divisiones.

6. Construir la red neuronal multimodal

  1. Configuración del entorno de software y hardware
    1. Implementa el modelo en Python 3.10 usando PyTorch 2.1. Ejecuta entrenamiento en Ubuntu 22.04 u otro sistema operativo especificado.
    2. Utilice una estación de trabajo con al menos 32 GB de RAM, una unidad de procesamiento gráfico con al menos 12 GB de memoria de vídeo y suficiente almacenamiento local para datos sincronizados EEG-vídeo. En este protocolo de demostración, utiliza una unidad de procesamiento gráfico NVIDIA RTX 3080.
    3. Almacena el script de entrenamiento, el archivo de definición del modelo, el script de preprocesamiento y el archivo de configuración en un directorio de proyecto controlado por versiones.
    4. Informa del repositorio de código o del paquete de scripts archivados en el manuscrito si se permite compartir.
  2. Construcción de la rama facial
    1. Construye el marco multimodal de doble rama global como se muestra en la Figura 3. Inicializa una columna vertebral de MobileNetV2 para la rama facial.
    2. Modifica la primera capa de convolución de 32 canales a 24 canales. Construye la rama de extracción de rasgos faciales según la Figura 4 e inserte módulos de atención de coordenadas tras los bloques residuales invertidos seleccionados, como se muestra en la Figura 5.
    3. Sustituir las convoluciones estándar designadas por convoluciones paralelas en profundidad de 3 x 3 y 5 x 5 de tamaño de núcleo para mejorar la extracción de características a múltiples escalas.
    4. Exporta un vector de rasgos faciales de dimensión fija para fusión. En este protocolo de demostración, utiliza una dimensión de característica de 256.
  3. Construcción de la rama EEG
    1. Introduce la característica de entropía diferencial en un codificador de red neuronal convolucional. Utiliza las capas convolucionales para extraer patrones espaciales de los mapas de características EEG.
    2. Alimenta la secuencia de salida convolucional en un módulo bidireccional de memoria a corto plazo largo para capturar la dependencia temporal entre ventanas.
    3. Exporta un vector de características EEG de dimensión fija. En este protocolo de demostración, utiliza una dimensión de característica de 256.
  4. Construcción del módulo de fusión cross-modal
    1. Implementa el módulo de interacción multimodal de características que se muestra en la Figura 6. Implementa un bloque de atención cruzada con múltiples cabezas y 8 cabezas.
    2. Utiliza la secuencia de características EEG como consulta y la secuencia de rasgos faciales como clave y valor en un flujo de atención cruzada.
    3. Utiliza la secuencia de rasgos faciales como consulta y la secuencia de características EEG como clave y valor en el flujo de atención cruzada recíproca.
    4. Concatena las salidas de los dos flujos de atención cruzada. Pasa la característica concatenada a través de una capa de proyección de fusión.
  5. Adición del módulo de convolución dilatada auto-residual
    1. Refinar la representación fusionada con la capa de conexión de convolución dilatada auto-residual mostrada en la Figura 7.
    2. Construye una capa de concatenación de convolución dilatada usando tasas de dilatación de 1, 3, 6 y 12. Concatena las salidas de las cuatro ramas de dilatación.
    3. Añadir conexiones residuales de salto para estabilizar el flujo de gradiente y preservar la información de nivel inferior.
  6. Añadiendo el clasificador
    1. Aplana o agrupa la representación fusionada. Añade una capa completamente conectada y una capa final de salida softmax. Configura las clases de salida en miedo, felicidad, calma y tristeza.
  7. Definición de los entornos de entrenamiento
    1. Utiliza la red y los ajustes de entrenamiento resumidos en la Tabla 1. Las cuatro clases de emociones (miedo, felicidad, calma y tristeza) se definieron operativamente mediante un procedimiento combinado de etiquetado basado en el diseño del estímulo y el autoinforme de los participantes. Cada clip de pintura fue preseleccionado para provocar una categoría de emoción objetivo, y los participantes informaron de su experiencia emocional dominante tras la visualización. Las etiquetas finales se asignaron alineando la categoría de estímulo prevista con las respuestas autoinformadas, y se excluyeron muestras inconsistentes para garantizar la fiabilidad del etiquetado.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

El rendimiento de la red de doble rama propuesta de atención cruzada se evaluó utilizando el conjunto de datos multimodal recogido de 327 participantes durante la visualización de la pintura. El resultado principal fue el desempeño en cuatro categorías de clasificación emocional para miedo, felicidad, calma y tristeza. Análisis adicionales examinaron el comportamiento de modelos unimodales, la convergencia multimodal, la sensibilidad al número de cabezas de atención, el rendimiento compa...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Este protocolo aborda un problema práctico en la computación afectiva, es decir, cómo reconocer estados emocionales en entornos de visualización de pintura donde la expresión visible y la respuesta fisiológica pueden no coincidir completamente en cada momento. Bajo las condiciones experimentales aquí reportadas, el marco de doble rama alcanzó un rendimiento de clasificación superior al de los modelos de comparación unimodal, lo que respalda el valor de combinar la electroencefalografía y...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores no declaran conflictos de interés.

Agradecimientos

Expresamos nuestro sincero agradecimiento a los voluntarios de la Universidad Normal Minzu de Xingyi y de la Universidad del Suroeste por su participación en los experimentos. También agradecemos al personal técnico de la Universidad de Girona por su ayuda en la adquisición de datos EEG y a los revisores anónimos por sus comentarios tan perspicaces.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Marco de Aprendizaje ProfundoPyTorchv2.0 / https://pytorch.orgUtilizado para la construcción, entrenamiento y evaluación de modelos
Sistema de Adquisición EEG (64 canales)Brain Products GmbHactiCHamp Plus / v1.6Utilizado para la adquisición de señales EEG de alta resolución durante experimentos
Tapa de electrodo EEG (10– sistema 20)Brain Products GmbHActiCap / 64 canalesStandard International 10– Colocación de 20 electrodos
Cámara de alta definiciónSony CorporationIMX327 SensorUtilizado para la grabación de vídeo con expresiones faciales (≥ 1080p, 30 fps)

Referencias

  1. Yang, Y., et al. A dual-stream regional feature learning and adaptive fusion method for electroencephalogram-based emotion recognition. Eng Appl Artificial Intell. 164, 113250(2026).
  2. Li, C., Pun, S. H., Li, J. W., Chen, F. Eeg-based emotion recognition using graph attention network with dual-branch attention module. 2024 46th Ann Int Conf IEEE Eng Me Biol Soc (EMBC), , 1-4 (2024).
  3. Ubillús, J. A. T., et al. Algorithms used for facial emotion recognition: A systematic review of the literature. EAI Endorsed Transact Pervasive Health Technol. 9, 1-17 (2023).
  4. Xu, Y., Cheng, L. Face emotion recognition based on gabor wavelet and particle swarm optimization algorithm. Multimed Syst. 31 (6), 435(2025).
  5. Dube, D. Y., Sannasi, M. V., Kyritsis, M., Gulliver, S. R. Facial emotion recognition from feature loss media: Human versus machine learning algorithms. Comp Human Behav. 174, 108806(2026).
  6. Manuel, M. T. J., Medina-DeVilliers, S., Clarkson, T., Lerner, M. D., Riccardi, G. Evaluation of interpretability for deep learning algorithms in EEG emotion recognition: A case study in autism. Artif Intell Med. 143, 102545(2023).
  7. Watanabe, A., Yamazaki, T. Representation of the brain network by electroencephalograms during facial expressions. J Neurosci Meth. 357, 109158(2021).
  8. Prakash, A., Poulose, A. Electroencephalogram-based emotion recognition: A comparative analysis of supervised machine learning algorithms. Data Sci Manag. 8 (3), 342-360 (2025).
  9. Sun, Y., Ayaz, H., Akansu, A. N. Multimodal affective state assessment using fnirs + eeg and spontaneous facial expression. Brain Sci. 10 (2), 85(2020).
  10. Huang, Y., Yang, J., Liu, S., Pan, J. Combining facial expressions and electroencephalography to enhance emotion recognition. Future Internet. 11 (5), 105(2019).
  11. Han, Q., et al. A multi-branch electroencephalogram emotion recognition framework based on cross-subject or cross-session multi-perspective representation fusion. Neurocomputing. 658, 131767(2025).
  12. Wang, L., Chang, Y., Wang, K. Dual-branch multimodal fusion network for driver facial emotion recognition. Appl Sci. 14 (20), 9430(2024).
  13. Mutawa, A. M., Hassouneh, A. Multimodal real-time patient emotion recognition system using facial expressions and brain EEG signals based on machine learning and log-sync methods. Biomed Signal Proc Contr. 91, 105942(2024).
  14. Qi, Y., Ibrayim, M., Hamdulla, A. Attention-based dual-branch network for micro-expression recognition with global-local feature fusion. 2024 IEEE Int Joint Conf Biometr (IJCB), , 1-9 (2024).
  15. Li, E. Intervention of art education on college students’ aesthetic mood based on emotion recognition algorithm. Front Art Res. 6 (9), 81-90 (2024).
  16. Liu, Z., Han, M., Wu, B., Rehman, A. Speech emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multi-task learning. Appl Acoustics. 202, 109178(2023).
  17. Xue, P., Wang, S., Bai, J., Qiang, Y. Research on bimodal emotion recognition algorithm based on multi-branch bidirectional multi-scale time perception. J Biome Eng. 42 (3), 528-536 (2025).
  18. Shioiri, S., Nagata, H., Sato, Y., Hatori, Y. Prediction of preference judgments of face images using facial expressions and eeg signals. J Vis. (9), 5063(2023).
  19. Lu, Y., Chen, J. Cross-subject EEG emotion recognition using the SSA-EMS algorithm for feature extraction. Entropy. 27 (9), 986(2025).
  20. Thapa, D., Rai, R. Freq-eer: A novel frequency-driven ensemble framework for emotion recognition and classification of eeg signals. Appl Sci. 15 (19), 10671(2025).
  21. Yang, Y., et al. Investigating of deaf emotion cognition pattern by eeg and facial expression combination. IEEE J Biomed Health Inform. 26 (2), 589-599 (2022).
  22. Tong, L., Yang, L., Wang, X., Liu, L. Self-aware face emotion accelerated recognition algorithm: A novel neural network acceleration algorithm of emotion recognition for international students. PeerJ Comput Sci. 9, e1611(2023).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Reconocimiento de emociones mediante EEGAnálisis de expresiones facialesEntropía diferencialRed neuronal convolucionalLSTM bidireccionalComputación afectivaInteracción persona-computadora