La emoción es un proceso psicológico y fisiológico multidimensional moldeado por estímulos externos, evaluación interna y regulación cognitiva continua, y por ello ocupa una posición central en la interacción humano-ordenador y en la cienciacognitiva. En los entornos de exposiciones pictóricas, la emoción también media la relación entre las obras visuales y la interpretación del espectador. Por esta razón, la identificación de los estados emocionales del espectador tiene un valor práctico para la evaluación de exposiciones, el diseño espacial y los estudios empíricos de la experienciaestética 2. Al mismo tiempo, la medición de la emoción en entornos expositivos seminaturales sigue siendo técnicamente difícil porque las respuestas son sutiles, transitorias e influenciadas tanto por la obra como por el contexto de visualización.
La investigación en reconocimiento emocional se ha desarrollado generalmente en dos líneas principales: análisis conductual y análisis fisiológico. Los enfoques conductuales, especialmente el análisis de expresiones faciales basados en visión por ordenador, se utilizan ampliamente porque no son invasivos y relativamente fáciles de implementar3. Los modelos de aprendizaje profundo, como las redes residuales y las redes convolucionales ligeras, han mostrado un gran rendimiento en tareas básicas de clasificación de emocionesfaciales 4. Sin embargo, el comportamiento facial durante la visualización de la pintura puede ser débil, moderado socialmente o deliberadamente contenido, lo que puede reducir la correspondencia entre la expresión visible y el sentimientosubjetivo 5. Los enfoques fisiológicos, especialmente los basados en la electroencefalografía (EEG), ofrecen un acceso más directo a la actividad neuronal asociada al procesamientoafectivo 6. El EEG se ha utilizado ampliamente en estudios emocionales porque las fluctuaciones temporales en las señales neuronales son informativas para los cambios en el estado afectivo, incluyendo dimensiones relacionadas con la valencia y laactivación 7. Aun así, las grabaciones de EEG son sensibles a artefactos de movimiento, contaminación electromiográfica y ruido ambiental, y el EEG por sí solo a menudo proporciona información contextual limitada sobre a qué responde visualmenteel espectador 8.
Estas fortalezas y debilidades complementarias han incrementado el interés en el reconocimiento multimodalde emociones 9. La premisa central de la fusión multimodal es que las señales heterogéneas pueden proporcionar evidencia mutuamente informativa y reducir la ambigüedad que surge cuando una sola modalidad se interpretaaisladamente 10. En tareas de visualización de pintura, por ejemplo, el comportamiento facial contenido puede coincidir aún con cambios neurales medibles asociados a la atención o al compromiso afectivo. Sin embargo, los sistemas multimodales existentes no siempre modelan esta relación de forma efectiva. Las primeras estrategias de fusión basadas en la concatenación directa de características pueden aumentar la carga dimensional y difuminar la estructura temporal específica de lamodalidad 11. Las estrategias de fusión tardía basadas en decisiones separadas son más fáciles de implementar, pero pueden pasar por alto interacciones detalladas entre señales visuales y fisiológicas durante el procesamientoemocional 12. Además, muchos modelos multimodales utilizan esquemas de fusión fijos o débilmente adaptativos, que no son adecuados para respuestas fluctuantes del espectador en entornos tipoexhibición 13.
Para abordar estas limitaciones, el protocolo actual describe una red de doble rama cruzada de atención para el reconocimiento multimodal de emociones durante la visualización de pinturas. En este marco, las características EEG se procesan mediante un modelo de memoria a corto plazo bidireccional de red neuronal convolucional (CNN-BiLSTM), que se utiliza para representar la dinámica neuronal espacio-temporal. Las características de vídeo facial se procesan mediante una rama MobileNetV2 mejorada por atención en coordenadas, que se utiliza para capturar señales de expresión de baja intensidad manteniendo la eficienciacomputacional 14. Las dos ramas se integran entonces mediante un mecanismo de atención cruzada multi-cabeza que aprende la relevancia entre modalidades en lugar de simplemente concatenar sussalidas 15,16. Este diseño pretende preservar la estructura específica de cada modalidad mientras mejora el modelado de interacción entre modales.
El método está diseñado principalmente para el análisis offline bajo condiciones controladas de adquisición de datos, más que para su despliegue directo en tiempo real en espacios públicos abiertos de exposición. Una implementación fiable requiere EEG y captura de vídeo sincronizados, iluminación estable, colocación controlada de la cámara, impedancia de electrodos aceptable y recursos computacionales suficientes para el entrenamiento del modelo. El rendimiento también puede depender de la composición de la muestra, el tipo de estímulo y el grado en que los participantes modifican su comportamiento porque saben que están siendo registrados. Estas limitaciones operativas deben tenerse en cuenta al adaptar el protocolo a otros entornos o poblaciones expositivas.
El protocolo presentado aquí cubre toda la cadena experimental, incluyendo la adquisición sincronizada de 327 participantes, preprocesamiento de datos de EEG y vídeo facial, extracción de características, fusión intermodal y clasificación. El objetivo es proporcionar un flujo de trabajo reproducible para el reconocimiento multimodal de emociones en la investigación de exposiciones pictóricas. Más allá de la computaciónafectiva 17, el protocolo también puede apoyar la investigación cuantitativa en estética empírica y estudios psicológicos relacionados18.