本方案描述了在绘画观赏情境下同步采集脑电图与面部数据的方法,以及用于多模态情绪识别的双分支交叉注意力网络,包括预处理、特征融合及四种情绪状态的分类。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本方案描述了在绘画观赏情境下同步采集脑电图与面部数据的方法,以及用于多模态情绪识别的双分支交叉注意力网络,包括预处理、特征融合及四种情绪状态的分类。
在绘画观赏过程中,情绪识别仍然具有挑战性,因为审美反应是动态的、依赖于情境的,且仅能通过外在行为部分观察到。因此,仅基于面部表情或仅基于生理信号的单模态方法,往往无法完整表征观赏者的体验。本文介绍了一种可重复的方法,用于构建双分支交叉注意力网络,该网络在绘画展览情境下整合面部视频与脑电图(EEG)数据,实现多模态情绪识别。该方案首先建立一个同步采集环境,使用64通道脑电系统和高分辨率摄像机,在观看绘画过程中同步记录数据。随后的步骤详细说明了信号预处理过程,包括脑电信号的滤波、分段和微分熵特征提取,以及面部检测、对齐和视频帧准备。该神经网络包含两个模态特异性分支:脑电分支采用卷积神经网络和双向长短期记忆网络,以建模神经活动的时空特征;面部分支则采用坐标注意力增强的轻量级卷积网络,提取视觉表情特征。随后,通过多头交叉注意力模块学习模态间的相关性,实现两种信息流的融合。在本文报告的实验条件下,该多模态框架在四类别情绪识别任务中的分类准确率高于单模态对比模型。该方法最适用于受控采集环境下的离线分析,为情感计算、实证美学以及面向展览的人机交互研究提供了实用框架。
情绪是一种由外部刺激、内部评估以及持续的认知调节共同塑造的多维心理和生理过程,因此在人机交互与认知科学中占据核心地位1。在绘画展览环境中,情绪也在视觉艺术作品与观众解读之间起到中介作用。因此,识别观众的情绪状态对于展览评估、空间设计以及审美体验的实证研究具有实际价值2。与此同时,在半自然展览环境中进行情绪测量在技术上仍然存在困难,因为观众的反应较为细微、短暂,且受到艺术作品本身和观看情境的双重影响。
情绪识别研究通常沿着两个主要方向发展:行为分析和生理分析。行为分析方法,尤其是基于计算机视觉的面部表情分析,因其具有非侵入性和相对易于部署的优点而被广泛使用3。深度学习模型,如残差网络和轻量级卷积网络,在基本的面部情绪分类任务中已展现出强大的性能4。然而,在观看绘画作品时,面部行为可能较微弱、受社会因素调节或被有意抑制,这会降低可见表情与主观感受之间的一致性5。生理分析方法,特别是基于脑电图(EEG)的技术,能够更直接地获取与情感处理相关的神经活动信息6。脑电图已被广泛应用于情绪研究,因为神经信号的时间动态变化能够反映情感状态的变化,包括与效价和唤醒度相关的维度7。尽管如此,脑电图记录容易受到运动伪迹、肌电干扰和环境噪声的影响,且单独使用脑电图通常难以提供关于观察者所响应视觉内容的充分背景信息8。
这些互补的优势与不足之处提高了人们对多模态情绪识别的兴趣9。多模态融合的核心前提是,异质信号能够提供相互补充的信息,并减少单独解释单一模态时所产生的歧义10。例如,在观看绘画任务中,尽管面部行为可能受到抑制,但仍可能伴随可测量的与注意力或情感参与相关的神经变化。然而,现有的多模态系统并不总能有效建模这种关系。基于直接特征拼接的早期融合策略可能增加维度负担,并模糊模态特有的时间结构11。基于独立决策的晚期融合策略虽然更易于实现,但在情绪加工过程中可能忽略视觉与生理信号之间的精细交互作用12。此外,许多多模态模型采用固定或弱自适应的融合方案,难以适应类似展览环境中观众反应的动态变化13。
为解决这些局限性,本实验方案描述了一种用于绘画观赏过程中多模态情感识别的双分支交叉注意力网络。在该框架中,脑电图(EEG)特征由卷积神经网络-双向长短期记忆模型(CNN-BiLSTM)进行处理,以表征神经活动的时空动态特性;面部视频特征则由坐标注意力增强型MobileNetV2分支进行处理,在保持计算效率的同时捕捉低强度表情线索14。两个分支通过多头交叉注意力机制进行融合,该机制学习模态之间的相关性,而非简单拼接各分支输出15,16。该设计旨在保留各模态特有结构的同时,提升跨模态交互建模能力。
该方法主要设计用于受控数据采集条件下的离线分析,而非直接在开放的公共展览空间中进行实时部署。可靠的实施需要同步的脑电图(EEG)和视频采集、稳定的照明、固定的摄像机位置、可接受的电极阻抗,以及足够的计算资源用于模型训练。性能还可能受到样本构成、刺激类型以及参与者因知晓被记录而改变行为程度的影响。在将该方案适配于其他展览环境或人群时,应考虑这些操作限制。
本文介绍的实验方案涵盖了完整的实验流程,包括对327名参与者进行同步数据采集、脑电(EEG)和面部视频数据的预处理、特征提取、跨模态融合以及分类分析。其目标是为绘画展览研究中的多模态情绪识别提供一个可重复的工作流程。该方案除了可用于情感计算17之外,还可支持实证美学及相关心理学研究的定量分析18。
访问受限。请登录或开始试用以查看此内容。
本研究方案已通过兴义民族师范学院人类研究保护伦理委员会的审查和批准(批准号:2600AL0621)。在所有参与者纳入研究及数据收集之前,均已获得其签署的知情同意书。
1. 受试者招募与伦理合规
2. 实验环境与刺激设置
3. 多模态数据采集
4. 脑电图预处理与特征提取
5. 面部视频预处理
6. 构建多模态神经网络
访问受限。请登录或开始试用以查看此内容。
采用在327名参与者观看绘画过程中收集的多模态数据集,对所提出的双分支交叉注意力网络的性能进行了评估。主要结局指标为对恐惧、快乐、平静和悲伤四类情绪的分类性能。额外分析包括单模态模型的行为、多模态融合情况、对注意力头数量的敏感性、比较识别性能,以及面部和脑电图子网络的行为。本研究未设置独立的对照组,因为研究目的并非将暴露组与非暴露组或基线人群进行比较,而是评估在同一数据集中单模态与多模态配置之间的相对性能。此外,未将文化表达性作为独立因素进行分析,因为参与者样本在文化背景上相对同质,且实验设计并未旨在探究情绪表达中的跨文化差异。该设计选择使研究能够在受控条件下专注于多模态框架的方法学验证。
单模态分支的训练行为
首先对单模态面部分支进行检验,以建立视觉模态的基础学习行为。如图8所示,面部分支在训练过程中表现出稳定的优化趋势,训练曲线和验证曲线逐渐接近90%附近的平台期。该结果表明,尽管在此情境下观察到的面部变化相对较弱且幅度较低,面部分支仍能够在观看绘画时捕捉到有用的与表情相关的信...
访问受限。请登录或开始试用以查看此内容。
本方案针对情感计算中的一个实际问题,即在观看绘画的场景中,由于可见表情与生理反应可能并非在每一时刻都完全同步,如何识别个体的情绪状态。在本文报告的实验条件下,双分支框架的分类性能优于单模态对比模型,这表明在类似展览的环境中,结合脑电图与面部表情信息具有重要价值。研究结果表明,当面部变化较为细微或受到社会因素调节时,多模态融合尤其有效,因为生理信号能够提供未完全体现在外在行为中的额外信息。从这一角度来看,该方法不仅可能对多模态情绪识别具有应用价值,也可能适用于实证美学研究以及面向展览的人机交互研究。同时,当前结果的解释应限定于本文所报告的数据集、记录设置及标签定义方法的范围内18。
该方案的一个关键特征是交叉注意力融合机制。与直接的特征拼接或简单的后期决策融合不同,交叉注意力机制使模型能够学习在不同条件下哪种模态提供了更有用的信息。这一点在观看绘画作品时尤为重要,因为即使神经活动表明存在持续的情感参与或注意力变化,面部反应可能仍然较为微弱。多模态模型中观察到的性能提升与这一设计逻辑一致。面部特征提供了外部可观测的线索,而脑电图则贡献了较...
访问受限。请登录或开始试用以查看此内容。
作者声明无利益冲突。
我们诚挚感谢来自兴义民族师范学院和西南大学的志愿者参与本实验。同时感谢赫罗纳大学的技术人员在脑电图数据采集方面提供的帮助,以及匿名审稿人提出的富有见地的评论。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 深度学习框架 | PyTorch | v2.0 / https://pytorch.org | 用于模型构建、训练与评估 |
| 脑电采集系统(64通道) | Brain Products GmbH | actiCHamp Plus / v1.6 | 用于实验过程中高分辨率脑电信号的采集 |
| 脑电电极帽(10–20系统) | Brain Products GmbH | ActiCap / 64通道 | 符合国际标准的10–20电极布局 |
| 高清摄像头 | Sony Corporation | IMX327传感器 | 用于面部表情视频记录(≥1080p,30 fps) |
访问受限。请登录或开始试用以查看此内容。