该研究提出了一种端到端的多模态情感分析框架,该框架利用Transformer编码器、解耦的情感表征以及基于图的跨模态注意力机制结合视觉映射,在两个数据集上提升了情感识别的准确率。
研究文章
该研究提出了一种端到端的多模态情感分析框架,该框架利用Transformer编码器、解耦的情感表征以及基于图的跨模态注意力机制结合视觉映射,在两个数据集上提升了情感识别的准确率。
通过使机器能够理解、解释并响应人类的情感状态,多模态情感特征的可视化映射对智能界面设计至关重要。然而,当前的多模态情感检测算法主要关注预测性能,在可解释性、交互感知能力以及特征层级的跨模态交互方面提供的洞察十分有限。本研究提出了一种用于多模态情感特征可视化映射的框架,该框架结合了面向交互的可视化方法、可解释的表征学习以及情感预测。在不使用人工构建特征的前提下,采用基于Transformer的编码器从文本、音频和视觉模态中提取高层情感嵌入。为提高鲁棒性,采用解耦表征学习技术分离情感特异性信息与模态特异性信息。此外,设计了一种基于图结构的跨模态注意力网络,利用自适应注意力权重模拟模态间细微的情感关联。同时构建了一个多视角可视化映射模块,用于呈现情感的时间轨迹、跨模态注意力分布以及潜在情感嵌入,以增强模型透明度。所提出的框架在卡内基梅隆大学多模态观点情感与情绪强度数据集(CMU-MOSEI)和中国多模态情感分析数据集(CH-SIMS)上进行了评估。实验结果表明,该框架在准确性、F1分数、相关系数和平均绝对误差方面持续优于代表性基线方法,同时在特征层级的可解释性与交互感知可视化方面表现更优。此外,可视化映射模块有助于对多模态情感表征、跨模态交互关系以及情感时间动态进行定性解读,支持交互感知的可视化与分析。
准确识别和理解人类情感对于改善人机交互至关重要。除了对提升人机交互具有关键作用外,情感分析还有望革新多个领域,包括医学预诊断1、课堂行为分析2、患者心理追踪3、车辆中的疲劳识别4以及智能家居环境中的智能管理5。情感计算与深度学习领域的最新进展6进一步推动了人们对构建能够捕捉人类情感复杂性的实时系统的兴趣。
目前许多方法主要依赖于单模态数据,例如文本、图像或听觉信号7,8,9。这些方法在检测讽刺或特定语境下的细微情绪等精细信号时常常失败。研究已转向多模态情绪评估,通过整合来自多个来源的互补数据以克服这些限制10,11,12。早期融合-长短期记忆网络(EF-LSTM)13、轻量级与FM深度神经网络(LF-DNN)14、张量融合网络(TFN)以及低秩多模态融合方法等基线模型已证明了融合多种模态的优势。然而,这些方法大多依赖于离线特征生成,不适用于动态的真实世界场景。
为了适应情绪状态的研究,多模态情绪识别的研究与应用在过去十年中迅速发展15。当前最具挑战性且意义重大的研究领域之一,是利用多种数据源对情绪状态进行持续监测16。随着如此多样化知识体系的出现,多模态的概念应运而生,并推动了情绪在情感计算、人机交互(HCI)、学习、视频游戏、客户服务、医疗护理、用户体验(UX)评估等领域应用的诸多进展。然而,在用户体验(UX)评估中应用情绪识别技术并非总是那么简单。
相较于单模态方法,关注多模态识别的主要原因之一在于依赖单一信息源存在固有缺陷。单模态情感检测系统可能由于数据缺失或不清晰而导致准确率较低,而多模态情感识别(MER)方案通过整合多种数据来源,具有更高的可靠性,并能更全面、深入地理解表达状态17。例如,仅依靠面部语言可能不足以精确分类情绪,尤其是在表情复杂或模糊的情况下。然而,若将面部表情与其他形式的交流(如语言或肢体线索)相结合,则可能提高情绪识别的准确性。
针对情感识别的大量研究已在多种模态上开展。早期研究主要关注从不同模态(如图像、声学或基于文本的输入)中识别出具有区分性的特征。尽管越来越多的证据表明,融合多种模态可提供更均衡的情感信息,从而实现更可靠、更精确的情感检测。本节将回顾单模态与多模态情感分析的关键进展,重点讨论基线方法、其局限性以及本研究方法的理论依据。
早期关于情绪识别的研究主要集中在单一模态上。在视觉领域,开创性研究促成了典型面部动作的分类20。随后的发展包括捕捉时间动态的技术,例如视觉运动21和隐马尔可夫模型22,同时利用面部动作编码系统(FACS)将面部反应划分为动作单元23。长短期记忆网络(LSTM)和卷积神经网络(CNN)已成功用于直接从原始音频信号中提取有意义的特征;基于音频的情绪识别方法已从传统的信号处理发展到深度学习24。在基于文本的情绪分析中,循环神经网络(RNN)结合注意力机制,以及近期基于Transformer的模型,显著增强了上下文情感信号的提取能力。尽管这些单模态技术取得了成果,但由于缺乏其他模态中的补充信息,它们本质上无法准确表征人们所经历的复杂情绪。
一些基于注意力机制的模型,例如 DialogXL 模型25,于2021年被提出,用于在对话情感识别领域收集更长期的上下文环境数据。Kim 等人26 2021年提出了EmoBERTa模型,以提高情感识别分类(ERC)的准确性。该模型利用说话者数据来增强对话中说话者的特征及其相互间的交互。2022年,Li等人27 提出了CoG-BART方法。该方法采用有监督对比学习来提升模型对相关数据的解读能力。需要注意的是,有监督学习需要大量标注数据。
此类研究的一个典型例子是多模态交互感知表示(Multimodal Interaction-Aware Representation, MIAR)框架28,该框架利用特征交互标记和对比对齐来提升跨模态的泛化能力。MIAR 改进了模态对齐效果,并在多个数据集上实现了优异的性能;然而,它主要关注预测准确性,未解决可视化映射问题。类似地,基于交叉注意力的音视频融合模型29能够有效捕捉用于效价和唤醒度预测的细粒度音视频交互,但其局限于两种模态,且缺乏可视化能力。基于 LSTM 网络和自编码器融合的时序建模方法能够成功捕捉情绪的时序动态特性,但对模态间交互以及所学习到的情绪表征提供的解释性有限。最近,基于 Transformer 的方法,例如基于 Transformer 的多模态融合网络(Transformer-based Multimodal Fusion Network, TMFN)30,通过增强的多模态融合与对比学习,在 CMU-MOSI 和 CMU-MOSEI 数据集上表现出色。然而,这些方法仍然以性能为导向,对可解释性、特征层级的解释以及面向交互的可视化支持有限。
为了增强文本、声学和视觉数据的融合,已提出多种多模态情感识别技术。尽管早期融合方法(如 EF-LSTM 和 LF-DNN)无法捕捉复杂的跨模态交互,但它们已展现出利用多模态信息进行情感与情绪分析的优势。虽然张量融合网络(TFN)在 CMU-MOSI 和 CMU-MOSEI 等基准数据集上提升了性能,并引入了对模态间交互的显式建模,但其可解释性有限且计算复杂度较高,限制了实际应用价值。为了改善模态对齐和动态特征融合,更现代的技术(如 MIAR、交叉注意力融合模型、TMFN 和自适应多模态 Transformer)采用了 Transformer 架构和注意力机制。这些方法主要关注预测性能,在准确率、F1 分数和平均绝对误差等常见评估指标上取得了具有竞争力的结果,但对特征层级的情感表征和跨模态依赖关系仍缺乏深入洞察。此外,目前很少有研究建立能够揭示潜在情感嵌入、注意力分布和时序情感动态的可视化技术,或整合基于图的模态间交互建模。本文提出的方法结合多视角可视化映射、基于图的跨模态注意力融合以及解耦表征学习,以克服上述缺陷并提升多模态情感识别性能。
类似地,自适应多模态变换器32提出了一种基于交换的融合方法,以自适应地缓解噪声或缺失的模态信息,从而提升情感分类性能。尽管该方法能够有效应对模态信息分布上的差异,但其设计针对情感分析任务,对所学习到的情感表征缺乏深入的解释性。另一项重要贡献是多模态融合模型33,该模型结合了卷积神经网络(CNN)、乘法长短期记忆网络(LSTM)以及基于变换器的注意力机制,用于实现实时多模态情感识别。该模型对视频、音频和文本三种模态进行完全融合,并表现出稳健的识别性能。然而,与其他现有模型类似,该模型主要关注预测准确性,缺乏用于可视化和面向交互的可解释性设计。
总之,尽管当前最先进的多模态情感识别方法在捕捉跨模态交互和提高预测准确性方面已取得显著进展,但大多数方法仍集中于以识别为导向的任务。在特征层级的可解释性、在图像空间中可视化情感表征,以及将所提出的框架应用于智能交互设计等方面,相关研究仍鲜有涉及。正是基于上述挑战,本文提出了该框架。
目前大多数方法主要致力于提升预测性能,而在情感表征学习和跨模态交互的可解释性方面贡献有限,尽管多模态情感识别已取得显著进展28,29。文本、声学和视觉模态之间的复杂交互通常难以被现有的融合策略建模,尤其是在模态差异和信息缺失并存的情况下28,31。尽管基于Transformer的设计和注意力机制增强了表征学习能力,但由于缺乏对情感特异性信息与模态特异性信息的显式分离,其透明性和可解释性往往受到限制31,32,33。此外,仅有少数研究探索了基于图结构的模态间交互建模,或构建了能够揭示情感时序动态、注意力分布及情感嵌入的可视化框架。这些局限性表明,亟需一种可解释的多模态框架,将面向交互的可视化映射与强大的跨模态学习能力相结合,以支持智能的人机交互。
本研究提出了一种可解释的框架,用于智能界面设计中多模态情绪特征的可视化映射。该系统无需依赖人工构建的特征,而是采用端到端的深度学习方法,从文本、音频和视觉模态中提取高层情绪表征。通过基于图的注意力融合机制对跨模态情绪交互进行建模,该机制分离了情绪特异性与模态特异性信息,实现了解耦表征学习,从而提升了模型的可解释性与鲁棒性。此外,还设计了一个多视角可视化模块,用于展示情绪的时间动态变化、跨模态注意力模式以及情绪嵌入结果。通过对标准多模态情绪识别数据集进行验证,评估了所提出框架在智能人机交互系统中的有效性与适用性。
本研究提出了一种独特的框架,用于对多模态情感特征进行可视化映射,突破了传统以预测为导向的方法局限,解决了当前多模态情感识别系统中跨模态交互建模不足和可解释性受限的问题。该方法在一个统一架构中,融合了基于Transformer的多模态表征学习、解耦的情感感知特征建模、基于图结构的跨模态注意力融合机制以及面向交互的可视化模块。与现有方法主要关注分类性能不同,该框架通过明确分离情感特异性与模态特异性表征,提升了模型的可解释性、鲁棒性以及跨模态一致性。此外,本文提出一种基于图的注意力机制,通过捕捉文本、音频和视觉模态之间细粒度的情感相互依赖关系,实现跨模态交互的自适应建模。同时设计了一个多视角可视化映射模块,通过揭示情感的时间动态轨迹、跨模态注意力模式以及潜在情感嵌入,增强模型透明度,为理解模型决策过程提供直观洞察。在CH-SIMS和CMU-MOSEI两个基准数据集上的实验评估表明,该方法不仅在可视化效果和多模态情感动态的可解释性方面表现优异,而且在准确率、F1分数、平均绝对误差和相关系数等指标上均取得了具有竞争力的性能。
本研究旨在通过提供一种可解释的多模态情感特征可视化映射框架,以改进智能交互设计。研究中使用了公开可获取的 CH-SIMS 和 CMU-MOSEI 数据库。这两个数据集均从其官方来源获取,并严格遵循各自创建者所规定的使用指南、研究标准和授权条款进行使用。数据集的多模态内容(包括文本、音频和视频数据)最初由数据集提供方根据其授权的参与者许可及数据采集协议进行收集和标注。本研究未涉及直接的人类互动,未招募新的参与者,也未收集任何个人身份信息。所有分析均基于公开可用的研究数据集进行。因此,我们的二次数据分析无需额外的伦理审批或机构审查委员会(IRB)审查。本研究严格遵守相关机构关于公开数据集使用、伦理研究程序及适用数据使用政策的规范要求开展。
采用基于图的跨模态注意力机制,利用情感或模态特异性特征来学习跨模态的情感表征,以提升理解能力。通过多视角视觉映射组件增强实时情感感知的交互设计,并评估其在情感识别中的效率。研究结果表明,所提出的方法在现实世界中提升了情感感知智能用户界面的可解释性与效率。图1展示了本研究的架构工作流程。图1展示了在智能交互系统背景下,用于多模态情感特征学习的建议视觉映射框架的完整工作流程。该流程始于三种同步输入模态,即文本、音频和视频,分别从语言、韵律和面部表情模态中捕获互补的情感信息。每个模态由一个模态特异性Transformer编码器进行处理,以获得原始输入数据的高层表示。随后,这些表示被输入到解耦表示学习模块中,在该模块中将情感特异性嵌入从模态特异性特征中分离出来,以确保在异构数据源之间所学习情感的一致性。随后,基于图的跨模态注意力网络对来自各模态的情感特异性嵌入进行聚合,该网络建模模态间的感情依赖关系,并根据交互上下文为每个模态分配动态的重要性权重。最终,该框架同时提供情感分类输出和交互洞察,有助于实现透明的情感感知决策与自适应的智能交互设计。
多模态数据采集
CH-SIMS 和 CMU-MOSEI 数据集是两个现有的公共多模态数据集,收集了同步的视频、音频和文本等多模态信息。CH-SIMS 数据集包含针对中国人群的多模态研究,共有 2,281 个视频片段,这些片段源自电影、电视剧和综艺节目中的多个视频剪辑。通过为这些视频片段添加相应的音频和文本,使得基于多模态数据的情绪多模态分析研究更具吸引力和可行性。然而,用于观点、感受和情绪研究的最大多模态数据集之一是 CMU-MOSEI 数据集,该数据集收集了来自 1,000 多名说话者在多种主题下的超过 23,000 个视频片段。该数据集在保持类别分布的前提下,被随机划分为训练集(70%)、验证集(15%)和测试集(15%)。
获取文本转录、音频信号和视频帧,并在细粒度的时间级别上进行时间戳对齐。帧级别融合确保了所提出的表征学习和基于图的融合机制能够共同建模并利用来自视觉表情、语音语调和语言内容的情感信息。此类多模态采集技术能够有效提取模态间的情感动态,对于智能交互设计和可理解的视觉映射至关重要。
表1列出了所提出方法中使用的多模态情感数据集的关键结构。为了获取更广泛的相关情感信息,例如 spoken words、语音语调和面部表情,CH-SIMS 和 CMU-MOSEI 整合了来自这些数据集的视频、音频和文本模态。此外,CH-SIMS 中的数据样本数量有限,有助于深入研究中国情境下的模态间交互作用及情感变化。另一方面,CMU-MOSEI 数据集包含大量涉及多种语言、不同受试者以及标注情感等级的数据,因此在评估本文所涵盖的表征学习方法及相关可视化算法的鲁棒性方面具有更重要的意义。此外,与早期研究相比,该数据集在模型测试过程中降低了信息选择的难度。
多模态预处理与同步
采用 CH-SIMS 和 CMU-MOSEI 数据集的时间戳标注对文本、听觉和视觉模态进行同步,以确保一致的多模态表征学习。每个语句作为基本分析单元,并与同一时间区间内的对应音频和视频片段相关联。对齐在语句级别进行。根据每个语句的起始和结束时间戳将转录文本划分为片段。通过提取落在相同时间区间内的相应视频帧和音频信号,建立文本-音频-视觉对应关系。音频片段使用 Wav2Vec 2.0 进行处理以生成声学表征,而视频片段中的视觉帧则以预设速率采样,并使用视觉变换器(Vision Transformer, ViT)进行编码。使用 RoBERTa 编码器从语句转录本中生成文本嵌入。由于三种模态产生的特征序列长度不同,时间同步通过将所有模态特征对齐到单个语句边界来实现。采用固定长度格式对不同长度的序列进行归一化处理:较长的序列被截断至允许的最大序列长度,较短的序列则通过补零填充。在训练过程中,使用注意力掩码将填充元素与有效的特征位置区分开。在融合之前,各模态特定的嵌入被投影到一个共同的潜在空间中,以克服不同模态间序列长度的差异。这保证了维度的一致性,并使基于图的注意力机制能够促进有效的跨模态交互学习。为保持数据质量和同步完整性,排除了包含损坏文件、缺失标注或模态信息不完整的样本。
基于 Transformer 的特征提取
采用深度学习方法,在对多模态数据进行对齐及必要的预处理后,以端到端的方式从多种模态(如视觉、音频和文本)的信息中学习高层的情感感知特征表示。通过使用变换器编码器(transformer encoder)从原始多模态数据中学习具有内在判别性的特征表示,该方法无需进行特征工程。为了确保所提出方法中使用数据集之间的一致性,每种模态均学习一个固定大小的嵌入表示。例如,在图像、音频和文本等各个独立模态中均学习768维的特征嵌入,共同构成一个统一的特征空间,应用于整个方法中,特别是应用于所提出的CH-SIMS数据集和CMU-MOSEI数据集上的特征提取方法,以学习不同规模数据中的高层特征。
视觉模态:用于情感感知帧嵌入的视觉变换器
采用视觉Transformer(ViT-Base)模型从视频帧中提取视觉信息,以获得与情绪相关的空间表征。在提取特征之前,对每个视频片段的帧进行缩放,使其尺寸为(224 × 224)像素,并以固定的时间间隔进行采样。使用16 × 16像素的图像块大小,ViT-Base架构生成一系列视觉标记,这些标记由12个Transformer编码器层进行处理。利用预训练的ViT模型作为视觉主干网络,将提取的帧级表征投影到768维的嵌入空间中。通过均值池化对帧级嵌入进行聚合,从而生成每个片段的最终视觉表征。在训练过程中,采用图像归一化以及常见的数据增强方法(如随机裁剪和水平翻转)以提升模型泛化能力。随后,使用所提出的多模态融合框架将这些视觉嵌入与文本和听觉表征进行融合。
为了保持情感的时间动态性,将对 CH-SIMS 和 CMU-MOSEI 数据集中的视频样本进行均匀采样以获取视觉模态数据。每个视频的帧
可被划分为 N 个固定大小的片段,然后展平并反向映射到维度为
的潜在嵌入空间。通过添加位置嵌入和可学习的分组标记,形成一个序列:
(1)
其中
表示位置编码,
是图像块嵌入矩阵。
堆叠的变换器编码器层由前馈网络和多头自注意力机制组成,用于处理嵌入的图像块序列。第 l 层的变换描述如下:
(2)
(3)
为了获得感知情绪的视觉特征向量,提取与类别标记对应的输出作为特征向量
。为了解决不同数据集中因语言和内容差异而导致的视觉情绪表征不一致问题,将每个视频片段的帧级嵌入进行融合,以捕捉面部表情及情绪的演变过程。
使用 Wav2Vec 2.0 进行韵律和语义声学嵌入的音频模态 采用预训练的 Wav2Vec 2.0 编码器作为声学主干网络生成上下文化语音嵌入。通过对输出的隐层表示进行均值池化,获得每个短语的固定长度声学特征向量。使用 Wav2Vec 2.0 模型从音频信号中提取声学表征,以捕捉上下文相关且与情绪相关的语音特征。在特征提取之前,音频记录被归一化并重采样至 16 kHz。为确保文本模态与视觉模态之间的同步,利用数据集标注提供的时间戳边界对每个话语级别的音频片段进行分离。在模型训练过程中对预训练声学编码器进行调整,以增强任务特定的适应性,使所获得的表征能更准确地反映语音信号中的情感特征。随后,利用最终的音频嵌入进行基于图的跨模态注意力融合和解耦表征学习。
在音频模态中,采用 Wav2Vec-2.0 对 CH-SIMS 和 CMU-MOSEI 数据集中的初始语音信息所提取的语音信号进行建模,直接提取与情感相关的音频特征。每个输入语音信号均存在一个卷积特征编码
:
(4)
其中 Z 代表旋律、音调和能量等低层次韵律特征。基于 Transformer 的上下文网络有助于上述结构,能够表示长距离的时间依赖关系:
(5)
这些上下文声学表征包含了表达情绪所必需的韵律和语义声学数据。通过执行时间池化操作,生成特定长度的音频嵌入:
(6)
该设计避免使用梅尔频率倒谱系数(MFCC)等声学特征,仅通过从波形中提取表示,利用来自CMU-MOSEI的英语语音数据和来自CH-SIMS的中文语音数据即可实现鲁棒性。
使用 RoBERTa 进行文本模态的上下文情感嵌入
对于文本模态,采用深度双向变换器 RoBERTa 对两个数据集的语音转录文本进行处理,以生成上下文语义和情感含义。基于 RoBERTa 的变换器编码器被用于从转录数据中提取文本表征,以捕捉上下文语义和情感信息。针对英文的 CMU-MOSEI 数据集使用了预训练的 RoBERTa 模型,而针对中文的 CH-SIMS 数据集则采用了中文版 RoBERTa 变体,以更好地适应语言特有的语言学特征。文本预处理包括使用对应语言的 RoBERTa 分词器进行分词以及文本规范化。为确保一致的批量处理,输入序列被转换为词元嵌入,并通过填充或截断调整至预设的最大序列长度。根据 RoBERTa 的输入格式,引入了特殊的分类标记和分隔标记。通过聚合变换器编码器生成的上下文化词元表征,并采用最终的 [CLS] 等效句子表征,获得固定长度的文本嵌入。为了使学习到的表征适应情感识别任务,预训练的 RoBERTa 编码器通过多模态训练进行了微调。随后,利用所提出的多模态融合框架将文本嵌入与音频和视觉特征进行融合。
对于每个已分词的输入,可将词元嵌入与位置编码相结合,
,以在一种称为深度双向变换的技术中生成输入表示
(7)
该结构通过L变换器的各层表示,利用自注意力机制来发现词语之间的上下文依赖关系:
(8)
通过分类标记的最终隐藏状态获得上下文情感嵌入:
(9)
情感极性、强烈情绪以及相关含义是此类嵌入所表示的情感相关语言特征的示例。RoBERTa 使得语言无关的建模更加容易,从而使系统能够对来自 CMU-MOSEI 数据集的英文文本和来自 CH-SIMS 数据集的中文文本使用相同的嵌入维度。
通过所提出的深度特征表示学习步骤,提取出三个模态特异性的768维特征向量,分别为视觉fv、音频fa和文本ft模态。在智能交互设计中,这些学习到的表示构建了一个统一的多模态特征空间,作为特征级视觉映射、基于图的跨模态融合以及解耦表示学习的基础。
解耦表示学习
在学习深度特征表示后,对来自视觉、听觉和文本模态的多模态特征向量进行额外处理,可得到分离的情感描述。如果前一步中使用的听觉、视觉和文本模态的模态特异性特征嵌入分别表示为 fv、fa 和 ft,相应地,使得
和
,则此步骤的目标是将所有模态特征分解为两种不同的潜在表示,其中包括在考虑各模态先前语义后的情感表示。
这是通过将每种模态特征fm输入两个并行的投影网络实现的:一个情绪编码器
和一个模态编码器
,从而生成两种编码表示。
(10)
其中,与情绪相关的潜在特征由
表示,而
代表特定模态的潜在特征。这使得与情绪相关的嵌入表示能够在多个输入(包括音频、视觉和文本)之间反复与共享空间进行交互,同时保留与各模态相关的独特结构化数据。
通过施加独立性约束进行重构,可实现有效的分离。原始模态特征的重构由以下公式给出:
(11)
其中
是一个解码器网络。重建损失保留以下数据:
(12)
此外,情绪与模态特异性表征之间的正交性或去相关性通常限制了信息的重叠:
(13)
通过实现这些目标,该模型可能学习到可靠、可理解且对模态变化具有鲁棒性的情感表征。后续基于图的跨模态融合以及视觉映射特征,特别是在智能交互设计中,高度依赖于可解释的、结构化的情感表征。
跨模态的情绪一致性
引入情感一致性显著提升了各模态间融合的效果。这是因为融合策略无需再处理两种表征之间的巨大差异,模态特定的情感嵌入共享一个潜在空间。两种情感的联合表示描述如下
。当情感特异性表征保持一致时,加权融合将更加稳定,因为来自不同模态信号之间的波动将不再影响最终结果。
(14)
通过强制实现情感信息的语义对齐,该目标最小化了不同模态之间的差异,确保无论采用何种模态表达情感,情感感知均保持一致。因此,通过将从语音信号、面部表情和语言内容中获取的情感线索进行投影,构建出一个连贯且具情感表征能力的表示空间。
对跨模态融合的影响
当在不同模态间引入情感一致性时,跨模态融合的效果会显著提升。由于特定情感的嵌入表示已在共享的潜在空间中对齐,融合机制不再需要弥补模态间显著的表征差异。融合后的情感表征定义如下:
(15)
其中 αm 表示对模态 m 的注意力权重。当情绪特异性表征保持一致时,加权融合将变得更加稳定且易于理解,因为融合结果呈现出互补的情绪证据,而非相互矛盾的模态信号。
从数学上讲,降低不同类型情绪特异性表征之间相对于
的方差等价于: 
(16)
其中
表示平均情绪表达。降低方差可使输入模态根据其精确的情绪意义而非模态噪声进行加权,从而确保网络收敛性更优,并实现更准确的注意力评估。
解耦情绪可视化最终的学习目标是结合片段化、重构以及情绪一致性:
(17)
其中两个超参数 λ1 和 λ2 用于控制跨模态情绪可靠性与解离之间的关系。该模型旨在获取模态不变、可解释且可融合的情绪表征,重点为后续基于图的融合以及智能界面设计中的特征级表征提供坚实基础。
基于图的跨模态注意力融合
采用基于图的跨模态注意力网络来模拟模态间的细粒度情感关系。为促进模态间的信息流动,构建了一个全连接的多模态图,其中每个模态特有的嵌入(文本、音频和视觉)被表示为图中的节点。利用模态间的关系建立图的邻接矩阵,并通过可学习的注意力方法对其进行优化。通过拼接并投影多个注意力头的输出,创建了一个共享的潜在空间。随后,通过使用注意力加权池化聚合节点表示,生成统一的多模态情感表征。该融合表征被传递至交互感知分析与情感识别的预测和可视化模块。图融合模块的隐藏表征维度为256,并包含两个图注意力层,每层具有八个注意力头。为确定相邻模态的相对重要性,计算连接节点之间的注意力系数,并使用softmax函数进行标准化。每个图注意力层后均接有层归一化、残差连接以及0.2的dropout率,以提高训练稳定性并减少过拟合。在将多个注意力头的输出拼接并投影到共同潜在空间后,通过注意力加权池化将节点表示整合为单一的多模态情感嵌入。随后,该融合表征被用于多视角可视化映射和情感预测。
采用多头图注意力机制捕获了多种跨模态交互。对每个节点,使用 softmax 函数对其连接节点之间的注意力系数进行归一化。为了提高训练稳定性并避免过拟合,图融合模块中堆叠的图注意力层后接残差连接、层归一化和 dropout 正则化。
设
分别表示由视觉、音频和文本模态所获取的特定情绪对应的表征;每个分量均位于共享的潜在空间
内。模态节点的模型采用图的表示符号
,其中集合的节点
对应于三个模态节点本身,以显式增强不同模态表征之间共享的情绪依赖关系。
在为图中的每个节点分配特定情感的特征向量后,我们得到:
(18)
与传统的融合方法(使用预设或固定融合权重)不同,本文提出的方法能够根据通道之间以及不同情绪情境之间的显著性和相互依赖性,学习自适应的边缘权重。
采用图注意力网络(GAT)进行跨模态融合。为每个节点 i 及其相邻节点(即节点 j)计算注意力系数:
(19)
从模式 j 切换到模态 i 的情感效应通过归一化权重 αij 来衡量。
接下来,通过对其邻居节点进行加权分组,计算每种模态节点的融合外观:
(20)
其中激活函数
是非线性的。最终,将每个节点更新后的特征进行融合,以获得全局的情感表征:
(21)
该技术通过捕捉来自多种模态的互补信息,同时保留复杂的模态间关系,因此在可解释的情感建模及后续可视化映射中具有重要应用价值。
算法1(补充文件1)提供了执行基于图的跨模态融合的通用框架。首先,构建一个图结构,其中包含与视觉、音频和文本各模态相关的特定情感特征。随后,计算图中各节点对之间的注意力得分,这些得分表示情感依赖关系的组合。接着对注意力得分进行归一化处理,以反映每种模态在特定情感上下文中的相对贡献,从而实现注意力权重的学习。在最后阶段,通过聚合与图节点相关联的特征生成通用情感嵌入。因此,该算法对与特定情感相关的多模态特征进行的通用融合,在适应性、可解释性和上下文智能方面展现出良好的前景。
图2展示了所提出的用于多模态情感融合的跨模态注意力网络的结构与工作原理。针对文本、听觉和视频模态分别提取的情感特异性嵌入,首先通过模态级注意力机制进行处理,以学习在特定情感背景下语言、语音和面部信息的相对重要性。经过注意力加权的各模态表征随后被融合,形成统一的情感嵌入,其中注意力矩阵捕捉了模态间的依赖关系与交互强度。网络所学习到的注意力矩阵能够动态调节各模态的贡献,使其聚焦于最具信息量的主导模态,同时忽略噪声较多或信息较弱的模态。融合后的情感表征可实现准确的情感识别,并对中性、拥抱、担忧等情感状态进行细粒度分析。
可视化作图模块
借助专为此目的创建的视觉映射模块,智能交互设计人员可根据图表,在跨模态融合过程之后,将情感状态的统一表示转化为易于理解且可直接使用的形式。
为了更直观地理解潜在的情感表征,采用降维技术对学习到的多模态情感嵌入进行可视化。首先使用主成分分析(PCA)在保留大部分方差的前提下降低特征维度,随后通过t分布随机邻域嵌入(t-SNE)将嵌入投影至二维空间进行展示。t-SNE的参数设置为困惑度30、学习率200,优化迭代次数为1,000次。利用所得的投影结果,对特定情感的聚类模式及模态间关系进行可视化。基于图注意力网络获得的归一化跨模态注意力权重,生成注意力热图,用以描绘文本、音频和视觉模态在情感预测过程中的相对贡献。将学习到的注意力系数作为边权重构建跨模态交互图,从而直观地检验融合框架内部的模态间关系与信息流动。通过追踪连续语句中潜在情感嵌入的演变过程,生成情感轨迹图,以分析情感状态的时间动态变化。这些轨迹揭示了情感状态及各模态贡献随时间的演化规律。所有可视化图表均使用Python中的Matplotlib和Scikit-learn等软件包生成。为评估模型的可解释性,对嵌入可视化结果、交互图和注意力热图进行了定性分析,重点考察聚类形成情况、模态贡献度以及时间维度上的情感动态。
设变量
表示图注意力网络函数对情绪状态的融合表示。与情绪状态图的输出层级可视化不同,该模块的主要目标是将情绪状态表示及其注意力机制的相应权重转化为易于理解的可视化形式。
利用学习得到的 αji,生成注意力热图以直观地评估每种模态的贡献。随后将输入的注意力权重相加,以确定每种模态的综合重要性得分:
(22)
其中 si 表示第 I 种模态的相对情感贡献。为了生成注意力热图,将获得的数值进行归一化处理,并映射到颜色图谱上,使用户能够轻松识别在不同时间步长或交互状态下占主导地位的模态。通过多种视觉、听觉或文本输入模态,该界面有助于用户理解系统注意力机制的运行方式。
所学习到的图被特别建模为“加权交互图”,用于表示人类情绪的跨模态依赖关系。图中的每个节点代表一种模态,而连接节点的边上的权重则以αji的形式表示涉及人类情绪的交互强度。上述加权图展示了人类情绪交互的强度。i 和 j 的定义如下:
(23)
由于这些权重的存在,图可视化中的线条粗细或透明度得以适当显示,从而更易于理解各模态之间的相互作用。借助跨模态交互图,设计者能够更清楚地理解情感指标在融合过程中的交互方式。
通过主成分分析(PCA)或t-SNE等降维算法,将不同时间步的融合情感嵌入
投影到低维空间,以展示时序情感的演化过程:
(24)
其中投影函数由
表示。二维/三维情绪轨迹的出现,能够展示交互过程中情绪的转换、强度和稳定性,可被理解为对情绪状态随时间演变的直观呈现。这些特征可用于智能交互、决策制定和实时监测。
与仅提供特定类别或评分映射的传统情感系统不同,该系统着重展示人类情感在其内部的形成过程。它通过提供中间特征的可视化结果,包括权重因子、模型间的相互作用及其对应的路径,揭示其决策过程。这使得用户能够理解各个因素——视觉、语音或语言——如何影响系统对人类情感的响应生成。
通过可视化表征将情绪映射为可理解的形式,可以弥合利用深度学习方法进行情绪分析与智能界面设计集成之间的差距。通过这两种方法收集的数据可用于创建更精确的用户界面。因此,所提出的方法可为交互设计师提供关键信息,以设计出更精准的用户界面。换句话说,情绪理解成为交互设计中一个极为活跃的组成部分。只有将情绪理解积极地融入交互设计中,其准确性才能不断提升。
视觉映射模块通过多种相互关联但不同的方式实现了可解释性:特征级可解释性揭示了深度神经网络(DNN)构建的情绪底层表征,使我们能够理解用于描述与情绪相关各个特征的语义;模态级可解释性利用交互图和视觉注意力热图中的数据,描述视觉、听觉或文本每种模态如何参与情绪表达的决策过程;最后,情绪嵌入所产生的轨迹使我们能够从动态交互的角度理解每种视觉和文本模态随时间的变化。请参见算法2(补充文件1)。
融合的多模态情感特征通过所提出的可视化映射算法2,被映射为对智能交互设计具有视觉显著性的表示形式。基于图结构的多模态注意力权重用于在每个时间步量化输入的视觉、音频和文本元素之间的差异。这些差异随后被映射为视觉表示,利用热图可视化元素突出显示影响情绪的主要来源。为了深入揭示输入元素之间的相互作用,并传达由多模态输入元素产生的情绪演变过程,系统进一步计算成对交互强度,以生成多模态交互权重。同时,通过将随时间累积的融合情感元素映射到低维空间,生成连续的情感元素演变轨迹,从而构建情绪演变的可视化视图。
情绪预测与交互反馈
融合情感表征的结果,表示为
,随后被用作交互反馈和情感预测的函数。此外,情感预测被描述为一个多任务模型,包含一个用于连续情感强度识别的回归任务和一个用于离散情感识别的分类任务。离散情感识别采用以下基于 softmax 的分类模型:
(25)
其中
表示预期的情绪类别概率,Wc 和 bc 为可学习的约束参数。采用交叉熵损失函数以增强分类目标:
(26)
其中 yk 是真实标签,K 为情绪类别的数量。使用一个回归分支并行估计情绪强度,生成对包括效价和唤醒度在内的各种连续情感属性的预测。给出如下定义:
(27)
其中预期的情绪强度得分由
表示。采用均方误差损失来增强回归任务:
(28)
通常,这两个任务在预测目标中被结合起来:
(29)
其中回归与分类的目标通过 λ 实现平衡。该方法建议根据识别出的情绪状态动态调整可视化模块,以实现此类交互感知反馈。在特定时间 t 的交互上下文由 ct 表示。可视化模块的响应由以下公式提供:
(30)
其中视觉化适应函数由
表示。这使得系统能够根据预期的变化和情绪,实时调整模态热图、交互图和情绪轨迹。这表明,该系统除了在情绪状态预测方面表现良好外,还为反馈提供了有力支持。
本研究利用两个基准数据集 CH-SIMS 和 CMU-MOSEI,从交互感知的可解释性与预测性能两方面验证了所提出的多模态情绪特征可视化映射框架。实验结果表明,该方法在相关性、准确率、F1 分数和平均绝对误差(MAE)等多种评估指标上, consistently 优于现有的多模态情绪识别技术。这种性能提升得益于解耦的情绪表征、基于图结构的跨模态融合机制以及端到端的深度表征学习策略,这些设计共同实现了更稳定且语义对齐的情绪建模。此外,该方法通过可视化映射提供了更丰富的特征层级洞察,超越了单纯的量化性能提升,有助于更清晰地理解各模态的贡献及情绪动态变化。尽管在语言、文化表达和数据集规模方面存在差异,上述性能优势在两个数据集中均 consistently 被观察到,表明所提出框架具有较强的泛化能力。
本研究采用了用于多模态情感分析的公开数据集 CH-SIMS 和 CMU-MOSEI。CH-SIMS 数据集包含来自电影、电视剧和综艺节目的 2,281 个视频片段,其中提供了同步的文本、音频和视觉数据。CH-SIMS 中的单模态和多模态情感标签均被划分为正面、中性和负面三类。CMU-MOSEI 是一个大规模英文多模态数据集,包含约 23,453 个经过标注的视频片段,涉及超过 1,000 名说话者对广泛话题的讨论。该数据集既包含效价(valence)和唤醒度(arousal)等连续情绪强度标注,也包含分类情绪标签。通过在这两个数据集上进行实验,所提出的框架能够支持多种语言、文化和情感条件,从而增强了模型的鲁棒性与可靠性。表 2展示了仿真环境的详细信息。
本仿真环境总结了用于评估所提出框架的主要实验与实施设置。为确保基于文本、音频和视觉模态的特征维度一致,统一采用了基于Transformer的编码器。该框架采用基于图的注意力机制进行跨模态融合,能够自适应地学习与情感状态相关的模态间依赖关系。
该建议的框架使用基于变换器的模态编码器提取文本、听觉和视觉表征。通过带有ReLU激活的全连接层,将模态特异性嵌入投影到共享的潜在空间中。随后使用独立的情绪特异性编码器和模态特异性编码器(每个编码器均包含两个全连接层以及非线性激活和归一化操作),以学习解耦的表征。潜在表征被投影到一个256维的特征空间中,在该空间中分别学习每种模态和情绪的信息。为了保持模态信息并促进高效的解耦,采用了重建解码器。在多模态融合与预测之前,基于图的跨模态注意力模块利用潜在表征建模各模态之间的情绪依赖关系。网络采用Adam优化器进行训练,初始学习率为1 × 10⁻4,批量大小为32。基于验证损失采用早停策略以防止过拟合。总目标函数包含分类损失、重建损失和表征一致性损失,每项损失均由可调超参数加权。模型训练最多进行100个训练轮次,并保留验证集上性能最优的模型用于测试。
所提出的框架通过分类指标(包括准确率、精确率、召回率和 F1 分数)以及回归指标(如平均绝对误差(MAE))进行评估。精确率、召回率和 F1 分数采用宏平均法计算,以应对情感类别之间的类别不平衡问题。在分类实验中,使用 CH-SIMS 和 CMU-MOSEI 数据集提供的预定义情感/情感极性标签作为真实类别。在基于回归的情感预测中,数据集的情感强度连续评分作为目标变量。生成混淆矩阵以分析各类别的预测性能及误分类模式,并设定 95% 的置信区间。为确保结果的稳健性,每次实验均使用不同的随机初始化重复 5 次,所报告的结果为 5 次实验的均值 ±± 所有运行中的标准差表现。采用适当的假设检验方法评估统计学显著性,并在适用情况下计算置信区间。训练时间定义为模型在指定硬件平台上达到收敛所需的总耗时。
可以将多种具有代表性的基线模型(包括早期融合和晚期融合)与所提出的方法进行比较,例如张量融合网络(TFN)、基于LSTM的方法、低秩多模态融合模型、自适应多模态变换器以及新型基于跨模态注意力的架构。这些基线模型反映了当前前沿技术,主要致力于通过不同的融合方法提升情感识别的准确性。相比之下,所建议的框架通过解耦表示学习和基于图的融合机制,在可解释性和交互感知方面表现出优势,而现有方法主要关注输出层面的预测。LSTM融合、TFN、低秩多模态融合(LMF)、自适应图模型(Adaptive-Graph)以及基于变换器的技术均为基于其官方代码库或公开可获取的参考实现所实现的基线模型示例。在可获取的情况下,均采用原作者提供的超参数设置。所有重新训练的基线模型均使用相同的数据集划分、预处理技术、优化参数和评估标准进行评估,以确保公平比较。对比表格中明确标注了直接引用自先前出版物的数据所对应的参考文献。
准确性
对CH-SIMS和CMU-MOSEI两个数据集均测量了离散情绪分类的准确率;然而,准确率的变化趋势因两个数据集的特性而异。由于CH-SIMS是一个中等规模的数据集,情感类别数量均衡,且视频片段经过仔细预处理,因此其准确率较高,表明该模型能够以较低噪声捕捉细微的多模态情绪信息。然而,由于CMU-MOSEI是一个大规模数据集,包含来自不同背景的说话人,因此情绪准确分类具有挑战性。因此,除了模型识别情感的能力外,CMU-MOSEI数据集上的准确率还反映了其在多种交互场景下的泛化能力和鲁棒性。在两个数据集上准确率的提升表明,所提出的方法在不同语言、规模和情绪复杂程度的数据集上均具有良好的泛化性能。
所提出方法及其他常见基线方法在 CH-SIMS 和 CMU-MOSEI 数据集上的分类准确率如表3所示。如表3所示,所提出的框架在这两个数据集上均取得了最高的准确率,分别比最强的基线方法(Adaptive-Graph)高出约 3.3% 和 3.1 个百分点。较低的标准差值也表明在多次实验运行中具有更高的稳定性。传统的 LSTM 融合方法由于捕捉复杂跨模态关系的能力有限,准确率较低。TFN 和 LMF 通过建模跨模态关系,提升了分类准确率。
F1分数
在情感分类问题中,召回率与精确率之间的平衡通过F1分数来衡量。对于多模态情感分类数据集而言,由于其类别数量可能不均衡,因此使用F1分数更为合适。在情感分类任务中,召回率与精确率的平衡通过F1分数进行评估。由于多模态情感分类数据集通常存在类别不平衡的情况,F1分数因而更加适用。模型对情感类别的识别能力越强,F1分数就越高。
图3展示了所提出方法在CH-SIMS数据集上与基线模型的F1分数评估结果。基于LSTM的基线模型F1分数最低,表明其在建模复杂的跨模态情感关系方面能力有限。图3对比了各评估方法在CH-SIMS数据集上获得的F1分数。如图所示,更复杂的基于图结构和基于Transformer的方法通常优于传统的基于融合的方法。其中,LSTM模型的F1分数最低,为0.71,其次是TFN(0.74)和LMF(0.76)。采用Adaptive-Graph方法后,F1分数进一步提升至0.79,显示出建模模态间关联的重要性。所提出的方法以0.82的F1分数,分别比Adaptive-Graph高出3.8%,比LMF高出7.9%,比TFN高出10.8%,比LSTM高出15.5%。这些结果表明,所提出的基于图的跨模态注意力机制与解耦表示学习能够更有效地捕捉文本、音频和视觉模态之间的互补情感信息,从而实现更优的分类性能。
尽管所有方法的F1分数相较于CH-SIMS均略有下降,但相对趋势保持一致,如图4所示。研究结果表明,从传统融合方法到基于图的多模态学习策略,模型性能呈现稳步提升。其中F1分数最低的模型为LSTM(0.69)、TFN(0.72)和LMF(0.74)。自适应图模型(Adaptive-Graph)的性能提升至0.77,显示出其在建模跨模态关联方面的有效性。所提出的框架优于所有其他方法,达到了最高的F1分数0.80。相较于最强的基线模型Adaptive-Graph,性能的提升证明了所提出的解耦情绪表征学习与基于图的跨模态注意力机制在捕捉文本、声学和视觉模态间互补情绪线索方面的贡献。这些结果表明,所提出的多模态情绪识别框架具有可靠性和高效性。该方法相较于基于图的方法和传统融合方法均表现出显著提升,进一步验证了其强大的泛化能力。在CMU-MOSEI数据集上F1分数的提高表明,所提出的方法即使在噪声较多且多样化的环境中,也能实现均衡的情绪分类性能。
精确度
在智能通信系统中,精确性至关重要,因为错误的情感信号会降低用户体验。精确率是指被正确预测为某种特定情感的实例数与被预测为该情感的总实例数之比。由于解耦后的情感表征在模态中噪声更少且更不易发生误分类,因此所提出的模型在CH-SIMS数据集上的表现优于基线模型,如图5所示。
在 CH-SIMS 和 CMU-MOSEI 数据集上,对比了多种多模态情感识别技术的准确率 图5随着模型从传统的融合方法转向更复杂的基于图的架构,精确率稳步提升。所提出的框架在CH-SIMS数据集上达到了0.82的最高精确率,相较于LSTM的0.71,TFN、LMF和Adaptive-Graph的精确率分别提升至0.74、0.76和0.79。在CMU-MOSEI数据集上,精确率从LSTM的0.69依次提升至TFN、LMF和Adaptive-Graph的0.72、0.74和0.77,所提出的方法取得了0.80的最高精确率。与最强的基线模型(Adaptive-Graph)相比,所提出的框架在CH-SIMS上精确率提升了约3.8%,在CMU-MOSEI上提升了3.9%。这些结果表明,通过捕捉文本、声学和视觉模态之间互补的情感信息,所提出的解耦表示学习与基于图的跨模态注意力机制有效降低了假阳性预测。基于图的跨模态注意力进一步缓解了无关模态的影响。由于CMU-MOSEI语料库中说话人和语言表达的多样性更高,所有模型的精确率均略有下降。
回忆
在情绪识别任务中,召回率是衡量模型对属于特定类别的表情实例进行正确分类能力的重要指标,因为情绪信息的缺失会对交互质量产生负面影响。较高的召回率表明模型识别出的假阴性较少,而真实的情绪表达识别得更多。在多模态情绪分析的背景下,召回率可被视为衡量从文本、音频和视觉模态中提取情绪信息效率的指标。
在 CH-SIMS 和 CMU-MOSEI 数据集上,所提出方法相较于基线方法的优势体现在图6的召回率对比中。随着模型从传统的基于融合的方法发展为更复杂的基于图的多模态结构,召回率结果持续提升。在 CH-SIMS 数据集上,召回率从 LSTM 的 0.70 提高到 TFN、LMF 和 Adaptive-Graph 的 0.73、0.75 和 0.78;所建议框架达到了最高的 0.82 召回率。在 CMU-MOSEI 数据集上,所提出方法实现了 0.80 的最佳召回率,其中召回率从 LSTM 的 0.68 提高到 TFN、LMF 和 Adaptive-Graph 的 0.71、0.73 和 0.76。与最强的基线方法(Adaptive-Graph)相比,所建议框架在 CH-SIMS 上相对提升了约 5.1%,在 CMU-MOSEI 上提升了约 5.3%。这些结果表明,通过捕捉文本、声学和视觉模态之间互补的情感线索,所提出的解耦表示学习与基于图的跨模态注意力机制有效减少了假阴性预测,从而提升了在两个数据集上情感类别的识别能力。由于传统方法建模复杂跨模态关系的能力有限,其召回率通常较低。TFN 和 LMF 通过更显式地建模模态间关系,实现了中等程度的提升。Adaptive-Graph 方法通过模拟模态间的结构化关系,进一步提高了召回率。对于两个数据集,所提出方法均取得了最高的召回率,表明其在不同交互场景下检测情感实例的能力更强。这种提升在大规模的 CMU-MOSEI 数据集中更为显著,证明了所提出框架的鲁棒性与泛化能力。
平均绝对误差(MAE)
平均绝对误差(MAE)用于评估连续情绪强度预测任务的性能,例如效价或唤醒度的预测。与准确率不同,MAE 更能反映预测情绪强度与实际情绪状态之间的接近程度。因此,MAE 更适用于具有连续情感标签的数据集,如 CH-SIMS 和 CMU-MOSEI。较低的 MAE 值表明情绪强度预测的准确性更高。
所提框架与基线方法在 CH-SIMS 和 CMU-MOSEI 数据集上的平均绝对误差(MAE)比较如表4所示。传统的基于 LSTM 的融合方法由于在建模复杂多模态情感依赖关系方面能力有限,通常具有较高的 MAE 值。TFN 和 LMF 通过建模多模态交互可降低 MAE,而 Adaptive-Graph 方法通过学习模态图关系进一步降低了 MAE。所提框架在两个数据集上均取得了最小的 MAE,表明其对情感强度的估计更为准确。值得注意的是,在 CMU-MOSEI 数据集上改进更为显著,该数据集的大规模数据变异性及说话人条件使得预测任务更具挑战性。
CH-SIMS 数据集的混淆矩阵
根据CH-SIMS数据集的混淆矩阵,早期融合LSTM和TFN这两种基线方法在中性与正向情绪类别之间存在显著的混淆。这表明这些方法在识别细微的多模态情绪表达方面能力有限。相比之下,所提出的方法表现出明显的对角线主导特征,非对角线元素极少,从而提升了类别可分性。该方法的解耦情绪学习机制确保了跨模态情绪表征的一致性,而其图融合策略则增强了对密切相关情感类别的区分能力。图7A–E展示了CH-SIMS数据集上多种基线方法的混淆矩阵。
CMU-MOSEI 数据集的混淆矩阵
该建议框架采用模态不变的情感嵌入和自适应注意力权重,显著降低了误分类率,尤其针对情感上模糊的输入。这证实了该建议框架在多种大规模多模态交互场景中表现良好。由于数据集的规模、说话人差异以及情感标签的连续性,CMU-MOSEI 混淆矩阵表现出较高的总体误分类率。基线方法在不同情感类别之间显示出较明显的混淆现象。图8A–E展示了使用不同基线方法在CMU-MOSEI数据集上的混淆矩阵。
每个训练周期所需时间
通过每轮训练时间的对比,突显了先进多模态融合技术在计算资源上的权衡。由于采用了Transformer编码器和图注意力机制,所提出的模型相较于简单的融合方法需要稍长的训练时间,但这一增加在可接受范围内,并非不可行。该框架在基准多模态情感分析数据集上表现出色,展现出在智能人机交互系统中集成应用的潜力。然而,当前研究尚未评估其在实时部署中的适用性,仍需通过延迟、吞吐量、内存占用和部署效率等方面的分析进一步验证。值得注意的是,该方法在收敛稳定性以及预测性能和可解释性方面的显著提升,使得额外的计算开销具有充分的价值。图9展示了所提方法每轮训练时间的实验结果。
消融研究
为了确定所提出框架中每个重要组成部分(如视觉映射模块、基于图的跨模态融合以及解耦的情绪表征)的影响,开展了一项消融研究。为理解各部分的作用,每次移除其中一个组件。实验结果表明,图融合策略有助于增强跨模态依赖性建模,而解耦情绪表征对性能稳定性贡献最大。视觉映射模块的辅助作用在其被移除后对性能影响较小而得到验证。在相同训练与评估条件下进行的消融研究结果如表5所示。移除基于图的跨模态注意力模块后性能下降最为显著,准确率从81.72%降至77.88%,F1分数从0.823降至0.776。这凸显了建模复杂跨模态交互的重要性。解耦表征学习模块在学习鲁棒的情绪特异性表征方面的作用体现在:移除该模块后,准确率下降2.78个百分点,F1分数下降0.032。视觉映射模块的主要优势在于可解释性而非分类准确率,其被移除后预测性能仅出现相对较小的下降,证实了这一点。基本融合(Basic Fusion)配置表现最差,表明最优的多模态情绪识别性能需要所有所提出模块的共同作用。
数据可用性:
本研究中使用的数据集均为公开可用的基准数据集。CMU-MOSEI 数据集由卡内基梅隆大学多模态 SDK 提供,详见 Zadeh 等人(2018)的研究(https://doi.org/10.18653/v1/P18-1208),可通过 https://multicomp.cs.cmu.edu/multimodal-language-analysis-in-the-wild-cmu-mosei-dataset-and-interpretable-dynamic-fusion-graph/ 获取。CH-SIMS 数据集详见 Yu 等人(2020)的研究(https://doi.org/10.18653/v1/2020.acl-main.343),作者公开提供了相关资源,包括 https://github.com/thuiar/MMSA。所有实验均使用这些数据集的官方版本进行。支持本研究结果的原始提取数据、处理后的数据文件、预处理输出、训练/验证/测试划分、衍生特征表示及实现细节均已公开,可在 Zenodo 仓库中获取,网址为 https://doi.org/10.5281/zenodo.21124921。

图1:所提出的多模态情绪特征可视化映射框架示意图。整体架构的概念性示意图,展示了多模态特征提取、解耦表示学习、基于图的跨模态注意力融合以及可视化映射组件,用于可解释的多模态情绪分析。请点击此处查看该图的放大版本。

图 2:所提出计算协议的示意图工作流程。
端到端处理流程的概念表示,包括数据集获取、预处理、模态特异性特征提取、多模态融合、可视化和情绪预测阶段 请点击此处查看此图的放大版本。

图3:在CH-SIMS数据集上F1分数性能的比较。使用不同的随机种子初始化,通过五次独立实验运行(n = 5)获得的平均F1分数值。误差条表示±±一个标准差(SD)。较高的F1分数值表明情绪分类性能更优。请点击此处查看该图的放大版本。

图 4:在 CMU-MOSEI 数据集上的 F1 分数性能比较。通过五次独立的实验运行(n = 5),使用不同的随机种子初始化所获得的平均 F1 分数值。误差线表示 ±± 一个标准差(SD),相应的 均值 ±± SD 数值显示在每个数据点上方。较高的 F1 分数值表示更优的情感分类性能。请点击此处查看该图的放大版本。

图5:在CH-SIMS和CMU-MOSEI数据集上的精确率比较。 LSTM、TFN、LMF、Adaptive-Graph以及所提出的框架在五次独立实验运行(n = 5)中获得的平均精确率得分。误差条表示基于不同随机种子初始化的重复运行计算得到的±±一个标准差(SD)。所提出的框架在两个数据集上均取得了最高的精确率,表明其通过有效的多模态特征学习和基于图的跨模态融合,提升了情感类别判别的能力。请点击此处查看该图的放大版本。

图6: CH-SIMS 和 CMU-MOSEI 数据集上的召回率比较。 LSTM、TFN、LMF、Adaptive-Graph 以及所提出的框架在 五次独立实验运行(n = 5) 中获得的平均召回率得分。 误差条表示由重复实验计算得出的 ±± 一个标准差(SD)。所提出的框架在两个数据集上均持续取得最高的召回率,表明其在捕捉多模态情感信息和减少假阴性预测方面具有更优的能力。请点击此处查看该图的放大版本。

图7:CH-SIMS 数据集上多种基线方法的混淆矩阵。行对应真实情感类别,列对应预测类别。单元格数值表示相对于每个真实类别的样本百分比。该混淆矩阵使用保留的 CH-SIMS 测试集划分计算得到。对角线上的百分比越高,表示对应情感类别的识别准确率越高。图中分别为 CH-SIMS 数据集上(A)早期融合 LSTM、(B)TFN、(C)LMF、(D)自适应图模型和(E)本文提出方法的混淆矩阵。请点击此处查看该图的高清版本。

图8:CMU-MOSEI 数据集上多种基线方法的混淆矩阵。行表示实际情绪标签,列表示预测标签。数值以 CMU-MOSEI 测试集上类别归一化百分比形式报告。该矩阵展示了正确分类的样本(对角线元素)以及情绪类别之间的混淆情况(非对角线元素)。CMU-MOSEI 上的混淆矩阵:(A)早期融合 LSTM,(B)TFN,(C)LMF,(D)自适应图模型,以及(E)本文提出的方法在 CMU-MOSEI 数据集上的结果。请点击此处查看该图的放大版本

图9在基准多模态情感数据集上每轮训练时间的比较。
每个 epoch 的平均训练时间 五次独立实验(n = 5) 在相同的硬件和软件设置下,针对 CH-SIMS 和 CMU-MOSEI 数据集。误差线表示 ±± 一个标准差(SD) 由使用不同随机种子初始化的重复实验计算得出。较低的数值表示更高的计算效率,而各次运行间稳定的训练时间则表明可重复性和训练一致性得到改善。 请点击此处以查看此图的放大版本。
| 数据集 | 模态 | 样本数量 | 语言 | 情感/情绪标签 |
| CH-SIMS34 | 视频、音频、文本 | 2,281 个视频片段 | 中文 | 多模态与单模态情感标签(负面、中性、正面) |
| CMU-MOSEI35 | 视频、音频、文本 | 约 23,453 个标注片段 | 英文 | 情感与情绪强度标签(连续值与分类值) |
表1: 数据集描述。 本研究中使用数据集的概述,包括模态、样本数量、语言,以及CH-SIMS和CMU-MOSEI数据集的情感/情绪标签。
| 组件 | 规格 |
| 编程框架 | Python with PyTorch |
| 视觉特征提取器 | Vision Transformer (ViT) |
| 音频特征提取器 | Wav2Vec 2.0 |
| 文本特征提取器 | RoBERTa |
| 融合策略 | 基于图的跨模态注意力网络 |
| 特征维度 | 每种模态 768 |
| 训练优化器 | Adam |
| 学习率 | 1.00E-04 |
| 批大小 | 16 |
| 硬件 | NVIDIA GPU (例如 RTX 系列) |
| 评估数据集 | CH-SIMS, CMU-MOSEI |
| 潜在维度 | 2.56E+02 |
| 嵌入维度 | 768 |
| 激活函数 | ReLU |
| 优化器 | Adam |
| 学习率 | 1.00E-04 |
| 批大小 | 32 |
| 训练轮数 | 100 |
| 早停机制 | 启用 |
| 损失函数 | 分类 + 重构 + 一致性 |
表2:仿真环境。仿真环境的实验设置与实施细节,例如模型具体参数、特征、优化器及所用硬件。
| 方法 | CH-SIMS 准确率 (%) | CMU-MOSEI 准确率 (%) |
| LSTM(早期/晚期融合) | 72.84 ± 1.12 | 70.35 ± 1.26 |
| TFN | 74.91 ± 0.98 | 72.68 ± 1.10 |
| LMF | 76.23 ± 0.85 | 74.12 ± 0.94 |
| Adaptive-Graph | 78.46 ± 0.73 | 76.89 ± 0.81 |
| 提出的方法 | 81.72 ± 0.61 | 79.94 ± 0.69 |
表3:在CH-SIMS和CMU-MOSEI数据集上将所建议方法的准确性与基线技术进行比较。结果以均值 ±± 标准差形式报告,数据来源于使用不同随机种子初始化进行的五次独立实验运行(n = 5)。所有方法均采用各自数据集相同的训练、验证和测试划分方式进行评估,以确保比较的公平性。
| 方法 | CH-SIMS MAE ↓ | CMU-MOSEI MAE ↓ |
| LSTM(早期/晚期融合) | 0.412 ± 0.014 | 0.465 ± 0.016 |
| TFN | 0.387 ± 0.012 | 0.439 ± 0.014 |
| LMF | 0.361 ± 0.010 | 0.412 ± 0.012 |
| Adaptive-Graph | 0.334 ± 0.009 | 0.379 ± 0.010 |
| 提出的方法 | 0.298 ± 0.007 | 0.341 ± 0.008 |
表4:平均绝对误差结果结果以……形式报告 平均值 ±± 标准差 来自 五次独立实验(n = 5) 使用不同的随机种子初始化。所有方法均采用各自数据集相同的训练、验证和测试划分进行评估,以确保公平比较。在两个数据集上,使用所提出框架与基线方法进行连续情绪强度预测的平均绝对误差(MAE)比较。
| 模型变体 | 准确率 (%) | F1 分数 |
| 完整模型 | 81.72 ± 0.61 | 0.823 ± 0.008 |
| 无解耦模块 | 78.94 ± 0.74 | 0.791 ± 0.010 |
| 无图融合模块 | 77.88 ± 0.81 | 0.776 ± 0.011 |
| 无视觉映射模块 | 80.11 ± 0.66 | 0.807 ± 0.009 |
| 基础融合模型 | 74.91 ± 0.98 | 0.742 ± 0.013 |
表5: 消融实验与基线方法的结果。 结果以……形式报告 平均值 ±± 标准差 来自 五次独立实验(n = 5) 使用不同的随机种子初始化。所有方法均采用各自数据集上相同的训练、验证和测试划分进行评估,以确保公平比较。模型变体之间的性能比较,表明了从解耦表示、基于图的融合以及视觉映射模块中学习的有效性。
补充文件 1:算法 1 和算法 2。请点击此处下载该文件。
实验结果表明,在CH-SIMS和CMU-MOSEI数据集上,所提出的用于多模态情感特征的视觉映射框架优于当前的多模态情感识别技术。与早期融合和晚期融合模型(如EF-LSTM和TFN)相比,该方法在准确率和F1分数上均取得更高性能,显示出其在处理多样化情感信息方面的鲁棒性。该方法性能的提升可归因于解耦的情感表征,其能够抑制模态特异性噪声,并确保视觉、音频和文本模态之间的情感一致性36。
最近,基于Transformer的多模态模型,如自适应多模态Transformer37和MIAR38,在建模跨模态依赖关系方面表现出色。然而,这些模型主要关注预测性能,缺乏支持特征级可解释性的机制。相比之下,本文提出的系统将基于图的跨模态注意力与可视化映射模块相结合,能够透明地分析模态间及情感交互关系。这一特性在当前文献中尚属缺失,现有研究通常将情感推断视为一个黑箱过程。
该框架在CH-SIMS和CMU-MOSEI基准数据集上表现出一致的性能。尽管该框架在智能人机交互、健康监测、自适应学习环境及其他情感感知系统中具有潜在应用价值,但当前研究仅在受控的基准条件下对方法进行了评估。尚未开展实际部署、用户界面评估、可用性研究或人类受试者评价。因此,该框架在实际运行环境中的有效性仍有待进一步验证。未来的工作将聚焦于面向部署的评估、以用户为中心的研究、延迟分析、内存消耗评估以及实时交互性能的测试。
此外,在多种文化和语言多样性的数据集上表现出的性能提升,证明了所提出框架的有效性。与以往仅在单一数据集或特定交互场景下验证的研究不同,该框架在不同语言、说话人及情感表达方面均展现出稳健的性能。因此,该框架非常适用于需要准确情感识别与可解释决策的实际智能交互系统。
通过基于可视化的学习到的多模态表征分析,评估了所提出框架的可解释性。具体而言,考察了潜在情感嵌入、跨模态注意力图、模态交互图以及时间情感轨迹,以揭示模型的决策过程及各模态的贡献。可视化映射模块的目标是通过实现对特征级交互和情感动态的观察,提升模型透明度。然而,本研究未包含正式的可解释性度量、注意力保真度评估或用户研究。因此,所报告的可解释性优势应被视为基于可视化的证据,而非经过量化验证的可解释性指标。
从理论角度来看,本研究对多模态情感计算领域做出了以下贡献:提出了一种系统化的情感建模方法,明确区分了情感特异性表征与模态特异性表征。通过在共享的潜在空间中确保跨模态的情感一致性,所提出的框架推动了多模态系统中表征学习理论的发展。引入基于图的注意力机制,进一步形式化了不同模态在情感表达中的相互依赖关系。
从实际应用的角度来看,所提出的框架对智能交互设计和情感感知用户界面非常有益。该框架中的视觉映射模块可使系统设计人员理解不同模态对情感预测的影响,这对系统设计人员而言至关重要。所提出的框架在情感化对话代理、自适应学习系统、医疗健康监测界面以及用户体验评估平台等应用中具有重要价值。
然而,所提出的框架存在一些局限性。图注意力机制和变换器编码器的使用增加了复杂性,可能对能力有限的设备造成问题。此外,当前研究忽略了其他生理信号(如脑电图和眼动追踪),而专注于视觉、音频和文本模态。尽管该框架实现了具有竞争力的预测性能并提升了可视化能力,但其在实时部署中的计算效率尚未得到专门评估。未来的研究将考察在真实世界智能交互场景中的部署性能、推理延迟、吞吐量、内存消耗以及模型压缩技术。为进一步提高情感建模的准确性和交互响应性,后续工作将聚焦于轻量化模型的开发、实时优化技术的改进以及更多模态的融合。由于引入了变换器编码器和基于图的注意力方法,计算复杂度较高,而实时部署性能尚未经过评估。本研究仅使用了CH-SIMS和CMU-MOSEI两个基准数据集来验证方法,这可能引入数据集特异性偏差,并限制其在其他领域、语言和用户群体中的泛化能力。此外,当前研究未包含脑电图或眼动追踪等生理信号,而是集中于视觉、音频和文本模态。尽管详细的实现过程和仿真环境描述增强了可重复性,但源代码和预训练模型目前尚未公开提供。
本研究采用了一种新颖的视觉映射框架,用于智能交互设计中的多模态情感特征学习。该方法结合了端到端基于Transformer的表示学习、解耦的情感建模以及基于图结构的跨模态注意力机制,从而实现了高预测准确性和可解释性。在CH-SIMS和CMU-MOSEI数据集上的实验表明,所提出的框架在准确率和F1分数方面优于当前最先进的多模态情感识别模型。更重要的是,该视觉映射方案弥合了情感识别与交互策略之间的鸿沟,为可解释、具备交互感知能力的多模态情感计算系统的设计提供了新方向。
为了促进可解释的智能交互设计,本研究提出了一种用于学习多模态情感特征的新型可视化映射框架。该建议系统通过结合基于Transformer的多模态特征提取、解耦的情感表征学习、基于图的跨模态注意力融合以及可视化映射方法,在单一架构内成功整合了情感检测与可解释性。实验在CH-SIMS和CMU-MOSEI两个基准数据集上进行评估,结果不仅在准确性(Accuracy)、精确率(Precision)、召回率(Recall)、F1分数(F1-score)和平均绝对误差(MAE)等多个指标上优于代表性基线方法,还提供了对模态贡献、跨模态交互以及情感时序动态的清晰可视化表达。然而,本研究仅限于在两个基准数据集上的评估,尚未包含真实场景部署研究、以用户为中心的评估、可解释性的量化评估以及生理模态的整合。此外,由于Transformer编码器和基于图的注意力机制带来的计算开销,资源受限环境可能面临应用困难。尽管如此,未来工作将聚焦于在更多数据集上的广泛验证、更多模态的融合、可用性研究、可复现资源的公开发布以及面向实时部署场景的优化。总体而言,所提出的框架展示了可解释性多模态情感分析在情感计算与智能交互应用中的潜力。
作者谨此感谢马来西亚槟城马来西亚理科大学建筑、建造与规划学院以及长沙理工大学设计艺术学院提供的支持。 & Technology,中国长沙。作者还感谢中国厦门福州大学厦门艺术设计学院在本研究工作期间提供的学术与科研支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Adam | PyTorch 优化器库 | https://pytorch-optimizers.readthedocs.io/en/latest/ (学习率 = 1 × 10-4) | 模型训练过程中的参数优化 |
| CH-SIMS | 原始数据集仓库 | 最新公开版本 | 用于中文多模态情感/情绪分析的基准数据集 |
| CMU-MOSEI | CMU 多模态 SDK 仓库 | https://github.com/CMU-MultiComp-Lab/CMU-MultimodalSDK (最新公开版本) | 用于多模态情感与情绪识别的基准数据集 |
| 解耦情绪编码器 | 自定义实现 | https://pytorch-geometric.readthedocs.io/en/latest/(双编码器架构) | 分离情绪特异性与模态特异性的潜在表示 |
| 图注意力网络 (GAT) | PyTorch Geometric | 多头 GAT (https://pytorch-geometric.readthedocs.io/en/latest/) | 建模跨模态情绪关系与自适应特征融合 |
| 基于图的跨模态注意力层 | 自定义实现 | 多头注意力融合 | 学习模态间细粒度情绪依赖关系 |
| Matplotlib | Matplotlib 项目 | 3.7+ | 生成图表与可视化分析 |
| NetworkX | NetworkX 项目 | 3.0+ | 构建与可视化跨模态交互图 |
| NVIDIA GPU | NVIDIA 公司 | CUDA 支持的 GPU | 加速 Transformer 与图神经网络的训练 |
| 主成分分析 (PCA) | Scikit-learn | sklearn.decomposition.PCA | 高维情绪嵌入的初步降维 |
| Python | Python 软件基金会 | 3.8+ | 实现多模态情绪分析框架的核心编程语言 |
| PyTorch | PyTorch 基金会 | 2.0+ | 深度神经网络的开发、训练与优化 |
| RoBERTa | Hugging Face Transformers | https://huggingface.co/docs/transformers/index (roberta-base, 768 维嵌入) | 提取上下文相关的语言与语义情绪表示 |
| Seaborn | Seaborn 项目 | 0.12+ | 生成注意力热图与统计可视化图表 |
| t-分布随机邻域嵌入 (t-SNE) | Scikit-learn | scikit-learn.org (困惑度 = 30, 迭代次数 = 1000) | 潜在情绪簇与轨迹的可视化 |
| Ubuntu Linux | Canonical Ubuntu | 20.04 LTS 或更高版本 | 实验执行环境 |
| 视觉 Transformer (ViT-Base) | Google Research 视觉 Transformer | ViT-Base/16, 768 维嵌入 | 从视频帧中提取具有情绪感知能力的视觉表示 |
| Wav2Vec 2.0 | Meta AI Research | 基础模型, 768 维嵌入 | 提取上下文相关的声学与语音情绪特征 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可