本方案描述了一种计算框架,该框架通过多模态方式整合生理信号与行为信号,利用基于相关性的特征学习和多模态融合技术,对用户情感体验进行建模。本方案在AMIGOS基准数据集上提出并测试了一种用于多模态情感建模的框架。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本方案描述了一种计算框架,该框架通过多模态方式整合生理信号与行为信号,利用基于相关性的特征学习和多模态融合技术,对用户情感体验进行建模。本方案在AMIGOS基准数据集上提出并测试了一种用于多模态情感建模的框架。
本研究提出了一种可重复的计算协议,用于利用生理信号进行多模态情感建模。该协议的目标是通过统一的深度学习框架整合多种生物信号,实现离线情绪识别。所提出的工作包含五个步骤:数据采集、预处理、特征对齐、多模态融合和评估。本研究以公开可获取的AMIGOS数据中的脑电图(EEG)、心电图(ECG)和皮肤电反应(GSR)信号作为实验基线。生物信号经过预处理和归一化,以提取模态特异性特征。采用深度典型相关分析(Deep Canonical Correlation Analysis)对不同模态间的异构特征空间进行对齐,随后通过多模态融合网络对情感状态进行分类。该协议通过离线实验进行了评估,并使用准确率、精确率、召回率、F1分数和AUC等标准性能指标与传统的融合和分类模型进行了比较。本研究侧重于开发和验证一种用于多模态情感用户体验建模的计算框架,而非部署实时交互系统。在用户体验情感状态预测中准确率达到92.1%,在效价-唤醒度分类中的F1分数达到94.2%,结果在情感维度上持续优于基线模型。这些发现通过生理数据的基准测试,验证了所提出的多模态融合工作流在计算情感建模中的有效性。
思维、情感与行为之间的复杂相互作用决定了人们的思考与行动方式。情感计算通过融合神经科学、心理学和人工智能等跨学科知识,研究这些关系,旨在构建能够分析、理解并响应人类情绪的系统。该领域 increasingly 被应用于人机交互中,通过将表达性意识融入响应式人工智能结构,使技术不仅与用户的认知状态互动,也与其情感状态互动,从而实现更个性化且具备情感感知能力的用户体验。情绪是一种复杂的心理过程,反映了人类的感知,在人际交往中发挥着重要作用1。如今,大量人机交互(HCI)应用需要开展情绪识别相关研究2。人机交互系统所处的环境具有动态性和复杂性,在大多数情况下,系统需要与其用户的功能状态保持同步;因此,具备情感智能的上下文环境能够更好地适应此类氛围。因此,本研究探讨了通过多模态生理信号与行为信号对用户情感体验进行计算建模的方法3。本工作并非侧重于实际开发或验证交互系统,而是更致力于在多模态信号融合或情感推断的方法学方面做出贡献,其应用场景主要聚焦于沉浸式或展览式环境。为避免涉及概念过于宽泛,本研究集中关注两个核心内容:一是采用计算方法实现多模态情感建模框架,二是用于整合生理与行为数据的多模态数据融合技术。文稿中涉及的其他所有主题均仅作为背景引用,以说明所构建模型的相关性。
每种情绪表达方式都传递着关于个体情感的不同信息,这些信息无法从其他感觉....
访问受限。请登录或开始试用以查看此内容。
本研究使用的 AMIGOS 数据集是公开可获取的,数据收集已获得机构审查委员会的批准并取得参与者的知情同意,具体信息见原始发表文献。本研究仅对数据集进行二次分析,无需额外的伦理审批。
本方法采用特征对齐和多模态融合方法处理多模态生理与行为数据,以描述感知–情绪之间的相关性。本研究提出了一种用于交互式展览中情感化用户体验(UX)的计算模型,结合多模态生物物理传感与基于人工智能的情绪建模技术。基于前期论文中的生物物理数据洞察,该方法从同步采集的脑电图(EEG)、心电图(ECG)、皮肤电活动(EDA)、眼动追踪、面部表情及环境输入中,对用户状态进行数字化计算建模。文中“时空建模”一词的含义如下:空间维度指通过DCCA实现的多通道生理特征空间表征及跨模态相关性对齐;时间维度指通过BiLSTM进行序列编码,并在分段时间窗内保持时间依赖性。这些异构信号首先经过预处理与归一化,以消除不同模态间的时间与空间相关性干扰。针对每种模态独立学习特征向量,以捕捉与情绪相关的模式,如唤醒度、注意力和参与度。为了从异构数据流共享的情绪表征中有效学习,采用DCCA方法。DCCA将每种模态投影到一个潜在的公共子空间,在最大化相关特征的同时,通过增强的跨模态相关性保留各模态特有的信息。这些经过模态对齐的潜在嵌入随后输入至多模态融合网络(MMFN),该网络通过混合的BiLSTM与注意力机制层整合时间与上下文信息。该融合机制使系统能够生成高层级的情感状态,并将其转化为用户体验指标(例如:无聊、兴趣、不适)。最后,....
访问受限。请登录或开始试用以查看此内容。
对所提出系统的评估
为评估所提出的系统,研究在公开可用的 AMIGOS 数据集上进行了实验。该数据集提供了 40 名用户在接触情绪激发刺激时的脑电图(EEG)、心电图(ECG)、皮肤电反应(GSR)、视频和音频的同步测量数据。本研究使用了来自 33 名参与者的数据(经过预处理并剔除不完整的试验),在效价和唤醒维度上共获得 1,320 个有效样本。评估重点在于利用基于 DCCA 的表示学习层和多模态融合网络(MMFN)进行情绪分类和情感用户体验(affective UX)状态预测。结果表明,该系统在所有情感状态的预测准确性和鲁棒性方面均显著优于现有方法。MMFN 中的注意力增强融合过程对于突出每种情境下主导模态的作用至关重要。表 3展示了仿真环境。
| 组件 | 规格....... |
访问受限。请登录或开始试用以查看此内容。
空间、环境和物理交互背景(例如空间布局、人群密度或周围环境条件)在 AMIGOS 数据集中并未明确提供。因此,当前实验中也未对这些因素进行直接建模。所提出的用于情感用户体验(UX)建模的计算框架,已远远超越了基础论文中关于用户、任务导向的儿童-机器人交互及生物生理情绪检测的初步概念。该模型将情感计算推广至动态、交互式的展览环境,从而扩展了应用范围、用户群体和使用条件。与基础论文中采用动态贝叶斯混合模型(DBMM)实现结构化交互和静态干预逻辑的方法不同,新框架整合了一种更具可扩展性和鲁棒性的架构,包含深度典型相关分析(DCCA)和多模态融合网络(MMFN)。这使得系统能够处理来自脑电图(EEG)、心电图(ECG)、皮肤电活动(EDA)、面部表情、眼动追踪以及情境环境信息等多种传感器模态的复杂感知-情绪动态,实现更精细、连续且可迁移的情感状态建模。从二元干预转向连续情感建模,代表了在真实沉浸式环境中建模情绪转变的理论突破。尽管 AMIGOS 数据集可用于严格评估多模态情感动态,但其数据采集于实验室环境中,依赖视听刺激,未能捕捉真实展览环境中的完整空间、多感官及社会复杂性。因此,本研究结果应被视为概念验证性的验证。尽管该研究受到沉浸式环境中情.......
访问受限。请登录或开始试用以查看此内容。
作者感谢弘益大学空间设计学院和工业设计学院的支持。作者还感谢展览合作方和参与者为本研究做出的贡献。
....访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 数据集 | AMIGOS 数据集 | 40 名参与者;脑电图(128 Hz)、心电图(1000 Hz)、皮肤电反应(1000 Hz)、面部视频、自我报告的情绪效价/唤醒度标签 | 用于情感状态建模的多模态真实数据 |
| 生理传感器 | 脑电图头戴设备 | Emotiv EPOC+(14 通道,128 Hz) | 采集与注意力、唤醒度和参与度相关的脑活动 |
| 心电图传感器 | Biopac MP150 或同等设备(1000 Hz) | 心率变异性与唤醒度 | |
| 皮肤电反应/皮电活动传感器 | Shimmer GSR+ 或同等设备(1000 Hz) | 以皮肤电导作为唤醒度的测量指标 | |
| 行为传感器 | 眼动追踪设备 | Tobii Pro X2-60 或同等设备 | 记录注视点与扫视眼动 |
| 面部表情记录 | 高分辨率视频摄像机;使用 OpenFace 分析(动作单元、视线向量) | 提取面部动作单元(AUs)和视线线索 | |
| 环境输入 | 音视频记录装置 | 麦克风 + 摄像机(与刺激同步) | 在展示过程中捕捉上下文刺激 |
| 软件/工具包 | OpenFace | 开源面部行为分析工具包 | 提取动作单元(AUs)、视线方向 |
| MATLAB / Python(NumPy, SciPy, scikit-learn) | 信号预处理(重采样、z-score 标准化、功率谱密度计算) | 数据预处理与特征提取 | |
| TensorFlowv2.13 / PyTorchv2.0 | 用于 DCCA 和 MMFN 的深度学习框架 | 模型实现与训练 | |
| 算法/模型 | 深度典型相关分析(DCCA) | 非线性特征对齐方法 | 学习跨模态的相关潜在表示 |
| 多模态融合网络(MMFN) | 双向长短期记忆网络 + 基于注意力的融合层 | 用于用户体验状态分类的异构模态层次化融合 | |
| 评估指标 | 准确率、精确率、召回率、F1 分数、Cohen’s Kappa、AUC-ROC、混淆矩阵 | 使用 scikit-learn / TensorFlow 指标实现 | 模型性能评估 |
| 计算硬件 | 工作站 / GPU 集群 | NVIDIA RTX 3080(10GB)或同等配置,32 GB 内存,Intel i9 处理器 | 模型训练与仿真 |