需要JoVE订阅才能观看此内容。 请登录或开始免费试用

研究文章

健康成年人情绪诱发任务中面部表情与运动分析算法的初步验证

58 次观看

DOI:

10.3791/70843

2026年8月14日

本文内容

摘要

本研究初步验证了一种专有的机器学习算法——FEA算法,在情绪刺激任务中检测反应的有效性。通过Navarasa框架,研究考察了FEA算法评分与标准化面部情绪刺激之间在健康成年人中的符合程度,评估该系统在受控实验条件下是否能够可靠地反映与情绪相关的反应。

摘要

本方案旨在通过测试Emoscape(一种基于Navarasa框架的专有机器学习算法)的情绪评分是否与健康成人在标准化情绪诱发任务中的反应一致,对其进行初步验证。在获得书面知情同意后,共招募了72名健康成人。参与者首先完成患者健康问卷-9(PHQ-9)和广泛性焦虑障碍-7(GAD-7)评估,随后观看TRENDS情绪面部刺激图像和Navarasa图像,期间FEA算法全程记录其上半身的微小动作。参与者还需识别所呈现的情绪。在暴露于TRENDS中的中性、快乐、恐惧和愤怒刺激图像,以及Navarasa图像期间,分析FEA算法评分相对于基线的变化。采用受试者工作特征曲线(ROC)分析来估计情绪类别间区分的敏感性和特异性。结果显示,当TRENDS图像对应于相应情绪(中性–Shanta、快乐–Haasya、恐惧–Bhayanaka、愤怒–Raudra)时,FEA算法评分相对于基线出现显著偏离。在Navarasa图像中也观察到一致的变化,所有平均差异均具有统计学显著性(p < 0.001)。曲线下面积(AUC)值在不同情绪类别间有所差异。FEA算法对愉快情绪的敏感性中等(70–80%),对不愉快情绪的敏感性亦为中等(60–70%)。这些结果为本方案提供了初步支持,并表明FEA算法可用于评估健康成人在受控情绪诱发任务中的情绪相关反应。

引言

情绪识别是社会认知神经科学领域内一个重要的研究方向,具有潜在的临床和科研应用价值。现有的情绪评估方法通过量化生理活动的变化(如脑电图(EEG)或皮肤电反应(GSR))来推断情绪状态。然而,这些方法较为复杂且具有侵入性。对面部和身体动作的直接测量则为个体情感状态提供了更直接、可观察的指标1,2,3。机器学习(ML)算法,特别是基于大规模、异质性面部表情数据集训练的算法,可用于解码此类细微的非语言信号并分类情绪状态。尽管支持向量机(SVMs)等传统ML算法仍被广泛使用,但深度学习架构,尤其是神经网络(NNs)4,5,由于具备自动特征提取的能力,在处理大规模数据集时表现出更优的性能6。在印度语境下,一个传统模型的实例是一种采用基于效价的维度模型来判断唤醒度的交互式工具。情绪识别框架必须对文化背景具有敏感性。在印度文化环境中,纳瓦拉萨(Navarasa)框架提供了一种细致的情绪分类体系,包含九种基本情绪,但该框架在基于机器学习的情绪识别研究中仍鲜有探讨。目前,针对可观察行为线索(如面部微表情和身体动作)进行直接分析的、经过严格验证的机器学习方法仍相对匮乏7,8。这类基于表情驱动的机器学习算法可实现实时应用,操作简便且无创。

面部表情与动作分析算法(下文简称FEA算法)是一种专有的基于机器学习的算法,可分析面部微表情和上半身动作,依据纳瓦拉萨(Navarasa)理论框架,生成九种拉萨(rasa)情绪轨迹的动态表征及各自的聚合评分。本研究旨在通过检测健康成年志愿者对标准化面部情绪刺激的反应与FEA算法生成评分之间的一致性,对FEA算法进行初步验证。

为此,我们借鉴了心理理论(Theory of Mind, ToM)和镜像神经元系统的构念。ToM 是一种核心的社会认知能力,使个体能够在社会情境中推断和理解他人的心理与情绪状态9。实证研究表明,暴露于面部情绪刺激会激活镜像神经元网络,进而引发观察者产生相应的情绪共鸣状态10。个体在观看他人情绪面部表情时,其内在主观情绪状态所发生的相应变化,若能被面部表情分析(FEA)算法捕捉到,则可为该算法提供初步的验证依据。

我们假设,暴露于对应特定纳瓦拉萨类别的面部情绪刺激,将引起FEA算法对该纳瓦拉萨情绪的评分相对于基线出现统计学上显著的偏离。

访问受限。请登录或开始试用以查看此内容。

方案

本研究方案经印度卡纳塔克邦胡布利苏什鲁塔医院伦理委员会(Sushruta Hospitals Ethics Committee, Hubballi, Karnataka, India)批准(伦理委员会注册编号:ECR/372/INST/KA/2013/RR-19),所有参与者在入组前均签署了书面知情同意书。

FEA 算法是一种专有的基于机器学习的方法,通过 Navarasa 框架对面部微表情和上半身动作进行实时分析,以推断情绪状态。Navarasa 框架源自印度古典美学理论,定义了九种基本情绪:shringara(爱)、haasya(喜悦)、karuna(悲伤/沉思)、adbhuta(惊讶)、shanta(平静)、raudra(愤怒)、veera(勇气)、bhayanaka(恐惧)和 vibhitsa(厌恶)。FEA 算法采用一个机器学习模型,该模型训练所用数据来自演员表现九种 Navarasa 情绪时的面部微表情和上半身动作图像。该算法通过分析单个 RGB 摄像头捕获的视觉输入中的细微面部动态和微动作,推断个体的情绪状态,并为这九种基本情绪生成定量评分。这种非侵入式配置可实现无干扰、自然状态下的情绪评估,适用于广泛的研究与实际应用场景。

模型开发

FEA 算法基于一种神经网络(NN)架构。训练数据集为内部采集,包含数小时印度演员表现九种纳瓦拉萨(Navarasa)情绪的录制视频数据。该数据集来源于对多名演员/参与者进行的受控视频录制,每位演员/参与者在不同诱发情绪状态下进行了多次录制/测试。经过预处理(包括面部关键点检测、时间一致性检查、质量筛选以及不可用或低置信度帧的剔除)后,共保留约 25,000 个结构化训练样本。在数据集整理过程中,根据十余项人口统计学和录制相关参数(包括年龄、性别及其他相关属性)对录制内容进行分层,并有意平衡,以实现这些参数上的公平代表性,从而最小化人口统计学偏差。性别分布维持在约 52% 男性和 48% 女性。参与者广泛覆盖青少年和成年年龄组,包含年轻、中年和老年成年队列的代表性样本。演员/参与者均位于印度,代表了印度多个地区和文化背景,以及在印度境内的多个国际种族群体。由于产权限制,演员/参与者的精确人数、个体身份信息、每位演员的视频/录制次数、确切帧数以及内部标注方法均无法公开,因为这些内容属于 Nihilent Ltd. 的专有数据集及模型开发知识产权的一部分;此限制已在讨论部分明确说明。

从这些记录中提取的面部图像通过图像处理技术进行处理,以提取定量特征,这些特征随后被用作神经网络预测的输入。该模型随后在目标人群中进行了评估,所得见解被用于迭代优化后续版本。这一开发、测试与改进的循环反复进行,直至模型性能趋于稳定。最终的预测模型采用多层感知机(MLP)架构,包含一个输入层(约300个选定特征)、若干隐藏层以及一个输出层,输出层生成一个九维得分向量,对应于九种纳瓦拉萨(Navarasa)情绪类别。最初从采集数据中提取了700多个特征,随后通过特征选择和模型优化过程进行了降维。MLP输出的得分随后被输入专有的后处理算法,以生成最终的综合FEA算法得分。更多架构细节(包括可训练参数的确切数量和各层的具体维度)属于专有信息,无法公开;本报告承认这是当前研究的一项局限性。模型开发的详细描述见补充材料(补充文件1补充图1)。

在迭代开发过程中,使用内部数据集进行交叉验证来评估模型性能,在九种纳瓦拉萨(Navarasa)类别上实现了96%的交叉验证分类准确率。随后在超过15,000分钟的视频数据上进行了独立验证。补充材料中提供了总结九种纳瓦拉萨类别整体分类性能的归一化9×9混淆矩阵(补充文件1)。

在模型稳定后,其在专家监督下接受了受控的内部验证。该方法强调通过直接的人体受试者测试进行实证验证,从而评估模型在不同人群中的实际应用性和稳健性。模型的开发过程总结于图1中。

患者健康问卷-9(PHQ-9)和广泛性焦虑障碍-7(GAD-7)量表:参与者在受过培训的心理学家监督下完成自评问卷,以评估其当前的情绪状态。施测的工具包括患者健康问卷-9(PHQ-9)和广泛性焦虑障碍-7(GAD-7)量表。任一量表得分超过9分被视为具有临床意义。

趋势

神经精神疾病情绪识别工具(TRENDS)是一种经过文化验证、具有生态敏感性的评估工具,旨在评估面部情绪识别能力11。该工具已针对印度人群进行了验证,包含40张演员照片,呈现普遍的基本情绪:中性、快乐、恐惧、愤怒和悲伤。TRENDS中的图像被用作参考刺激,以验证FEA算法的情绪分类输出结果。

实验设计

本实验旨在引发生物体对情绪刺激的算法反应。为此研究开发并采用了两种情绪诱发范式。

TRENDS 图像范式

在第一种实验范式中,视频序列首先呈现60秒的空白屏幕,随后显示情绪刺激材料。情绪刺激材料选自TRENDS工具,共呈现20张图片,分别代表中性、快乐、悲伤、愤怒和恐惧情绪。 × 两种性别 × 两个年龄组。每个刺激呈现5秒,因此总刺激呈现时间为20秒。 × 5秒,每两张连续图像之间附加10秒的空白屏幕间隔,总时长为300秒。在每个10秒的空白间隔期间,参与者需从屏幕上显示的五种情绪标签中选择其一,以识别前一张图像所呈现的情绪。

纳瓦拉萨范式

基于九种情感(Navarasa)框架,构建了第二种类似的视频范式。共呈现18张图像(九种情绪 × 两种性别)。每个刺激持续显示5秒,图像之间有10秒的空白屏幕,总时长为270秒。九种情绪被分为三类:中性(shanta)、积极(haasya、veera、shringara、adbhuta)和消极(Krodha、vibhitsa、bhayanaka、karuna)。在每次10秒的空白间隔期间,参与者需通过选择屏幕上显示的三个选项之一(中性、积极或消极),对前一张图像所表达的情绪进行分类。将九种Navarasa情绪分为三类,以方便记录参与者在情绪识别任务中的反应。

参与者

从工作场所和教育机构招募了健康的成年志愿者。纳入标准包括年龄在18至50岁之间、任何性别/性别的个体。排除标准包括有明确诊断的精神疾病、神经系统疾病、严重视力障碍或限制头部和颈部活动的躯体残疾病史。

步骤

受试者就座时,摄像头置于与眼睛齐平的位置,并距离受试者60–70 cm。研究中使用了FEA算法。在笔记本电脑上打开应用程序后,研究人员输入受试者编号。在整个实验过程中,FEA算法持续记录视频数据,以便后续分析面部表情和微小动作。首先获取一段60秒的基础状态记录,在此期间,要求受试者放松并避免明显的表情行为。完成基础状态记录后,受试者依次观看两个视频范式(先观看TRENDS图像,随后观看Navarasa)。所有受试者均按照相同的固定顺序观看范式,以尽量减少与呈现顺序相关的潜在混杂效应;然而,这种固定顺序可能引入顺序效应。在记录过程中,研究人员留在房间外,以减少干扰。研究人员在房间外通过移动应用程序远程监控实验进程。两个范式之间为受试者提供短暂的休息间隔(图2)。

分析

收集的数据被映射到应用程序中输入的受试者 ID,以确保数据的准确性。FEA 算法采用一种结构化的端到端计算流程,用于自动进行情绪推断,该流程包括五个主要阶段:视频采集、特征检测与提取、数据预处理、情绪分类以及输出解释。提取的特征经过一系列预处理操作,包括降噪、跨受试者及光照条件的归一化处理,以及缺失帧的插值。应用时间平滑以增强信号稳定性。所得的特征向量在时间上对齐,以便下游分类模型进行输入。这些时间对齐且去噪后的特征矩阵作为情绪分类组件的输入。

特征提取

该提取框架采用一种多特征提取阶段的算法流程,可将标准的二维单目视频图像流转换为重建的三维坐标空间。系统并非依赖原始的二维像素追踪,而是对面部和上半身的局部空间坐标进行映射。所提取的特征可分为三大类:(i)面部标志区域,涵盖面部结构与动态的几何描述符(包括眼周线索以及源自Navarasa框架的面部微表情相关特征;Navarasa框架根植于《Natyashastra》——联合国教科文组织所认可的人类情感表达最早的形式化体系);(ii)头部姿态信息,用于捕捉头部的方向与运动;以及(iii)上半身运动特征,用于捕捉上半身的连带运动。具体的特征定义,包括精确的标志点索引和关键点标识符,属于专有信息,无法完全公开;这一点已被视为一项局限性。该系统并不直接使用面部动作编码系统(FACS)的动作单元标签,而是从面部和身体运动中提取几何与时间特征。这些三维空间变换在时间上被聚合,以生成一个全面的行为摘要向量,并作为多层感知机(MLP)分类器的输入。总体而言,最初从采集数据中提取了超过700个候选特征,随后通过特征选择与模型优化,缩减至约300个选定特征。该结构化流程依次包括视频采集、从二维到三维的空间重建、时间聚合、特征归一化,最后进行分类。

情绪分类模型

预处理后的特征向量被输入至一个监督式多层感知机(MLP)神经网络架构中,该模型使用内部标注的数据集进行训练,数据集对应九种纳瓦拉萨(Navarasa)情绪类别:Śṛṅgāra(爱)、Hāsya(喜悦)、Karuṇā(悲伤)、Raudra(愤怒)、Vīra(勇气)、Bhayānaka(恐惧)、Bībhatsa(厌恶)、Adbhuta(惊奇)和 Śānta(平静)。该模型被明确设计用于捕捉表情行为数据中的时空依赖性。在每个时间步,该架构都会输出一个包含九类情绪强度预测值的向量。

模型输出的后处理

随后对原始模型输出进行后处理,以获得稳定且可解释的情绪评分。应用了三个连续的操作:(i)时间平滑以减少短期波动,(ii)归一化以确保在不同时间点及不同情绪维度之间的可比性,(iii)在指定的时间窗口或整个序列上进行聚合,以得出汇总指标。这些后处理步骤确保了被试间的可比性,并控制了个体间基线差异。

结果解读与可视化

FEA 算法可生成从视频数据中推断出的情绪动态的定量与可视化表示。其两种主要输出形式为时间情绪轨迹。情绪强度值以时间序列图形式呈现,展示每种情绪在整个视频过程中的演变情况。该表示方法提供了情感变化的连续视图,有助于分析情绪唤醒中的瞬时变化、峰值激活以及恢复或减弱阶段。情绪对比评分:九种 Navarasa 类别中每一类的汇总情绪值以对比评分图形式展示,呈现各情绪在分析时间段内的相对强度。这些对比可视化结果支持不同情绪之间的直接比较,并对整体情感特征提供简明总结。对基线时生成的 FEA 算法评分进行了检查,以确认是否存在平坦线型或无显著变化的情况,此类现象可能提示记录质量不足。

统计学分析

在实验范式中每次图像呈现后的10秒时间间隔内,由FEA算法生成的九种Navarasa情绪领域的评分被作为结果变量进行处理。FEA算法在10秒时间窗内的每一秒(T0、T1、T2… T9)均生成一个评分,其中T0时刻的FEA算法评分被视为基线评分。从T1至T9记录中FEA算法评分的最高值定义为Tmax。将Tmax与基线(Tmax − T0)之间的FEA算法评分变化量计算出来,并作为分析中的结果变量。每种情绪在时间序列中FEA算法评分的变化情况如图3A–D所示。

对于TRENDS图像,对应的靶情绪类别映射如下:Shanta > 中性;Haasya > 快乐;Krodha > 愤怒;Bhayanaka > 恐惧。对于Navarasa图像,FEA算法得分被归类并平均为三个综合类别:中性(Shanta)、愉悦(Haasya、Veera、Shringara、Adbhuta)和不愉悦(Krodha、Vibhitsa、Bhayanaka、Karuna)。

同时进行了组水平和受试者水平的分析。

组水平分析:针对上述每种情绪类别,使用配对t检验比较从基线到Tmax时FEA算法评分的变化。FEA算法评分相对于基线的显著变化表明情绪识别具有良好的一致性。然而,显著差异并不一定意味着较强的分类准确性。

受试者水平分析: 任一FEA算法情绪维度得分高于基线值的情况均被归类为正向情绪反应。随后计算出准确性指标——敏感性与特异性。敏感性和特异性分别量化了当目标条件存在(+)时检测结果为阳性,以及当目标条件不存在(−)时检测结果为阴性的概率。当这两个估计值均接近1时,表明该检测在诊断准确性方面表现良好。估计的敏感性和特异性分别定义为:在具有和不具有参考条件(Navarasa表情)的参与者中,被正确分类者所占的比例。

如果受试者正确识别出至少75%所呈现的情绪,则认为其具有目标状况(+)。该分类标准基于TRENDS量表的验证研究,在这些研究中,60%至80%的准确率被视为具有足够的区分效度。对连续性预测变量进行受试者工作特征(ROC)分析,以估算曲线下面积(AUC)及相应的敏感性和特异性值。敏感性高于80%被认为具有良好的区分能力,低于80%则认为区分能力一般。

访问受限。请登录或开始试用以查看此内容。

结果

该研究考察了面部表情分析(FEA)算法评分在情绪诱发刺激下的变化,并通过受试者工作特征(ROC)分析评估了FEA算法的诊断效能。研究共招募了72名健康志愿者,平均(标准差)年龄为31.9(11.9)岁,包括26名男性和46名女性。所有参与者均接受过至少10年的教育,且均为印度族裔。其PHQ-9和GAD-7评分的平均值(标准差)分别为4.4(4.8)和4.7(4.5)。

对情绪刺激的 FEA 算法评分变化:根据配对 t 检验结果,在两种刺激条件下——TRENDS 图像和 Navarasa——FEA 算法得出的测量值从基线(T0)到峰值时间(Tmax)均表现出具有统计学意义的变化(p < 0.001;表 1、图 4、表 2图 5)。

FEA 算法的诊断准确性:采用受试者工作特征(ROC)曲线分析评估 FEA 算法的诊断效能,并针对不同情绪状态...

访问受限。请登录或开始试用以查看此内容。

讨论

本研究旨在通过检测FEA算法得出的评分与健康成年志愿者对标准化面部情绪刺激反应之间的一致性,对FEA算法进行初步验证。这些早期研究结果表明,FEA算法在面对多种离散情绪类别(包括中性(shanta)、快乐(haasya)、恐惧(bhayanaka)和愤怒(raudra))以及更广泛的情绪状态分类(如愉悦和不愉悦状态)的情绪诱发视觉刺激时,表现出具有统计学可检测意义的变化。这表明,FEA算法评分与情绪刺激任务的反应具有一致性。

FEA算法的敏感性在中性或积极情绪下为70%至80%,在消极情绪下为60%至70%。对于拟用作筛查手段的任何检测方法而言,这些敏感性数值均处于较低水平12。相比之下,利用神经生理学指标(如脑电图(EEG))的更广泛的基于机器学习的情绪推断模型,其分类准确率可达90%13。一种用于自闭症检测的基于EEG和GSR的情绪分类集成分类器系统,其检测准确率高达99.97%14。然而,这些模型通常计算复杂度较高,且需要离线处理。相...

访问受限。请登录或开始试用以查看此内容。

披露

FEA 算法是 Nihilent Ltd. 的专有算法,该公司为 Manoshanti 提供了资金支持,用于开展本研究的数据收集工作。Nihilent 提供了 FEA 算法得分,数据分析由 Manoshanti 独立完成。Nihilent Ltd. 未参与数据分析。

致谢

我们感谢教授们 P. T. Sivakumar 和 Dr. Shivarama Varambally 提供本研究的科学指导。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
EmoscapeNihilent Ltd, Pune1Emoscape 的开发者
Manoshanti 心理健康中心GNR Health Care Pvt Ltd.2临床与科研合作方
神经精神疾病中情绪识别工具版权归属于本研究的通讯作者3本研究中用于验证的工具

参考文献

  1. Garg N, Garg R, Anand A, Baths V. Decoding the neural signatures of valence and arousal from a portable EEG headset. Front Hum Neurosci. 2022;16:1051463. doi:10.3389/fnhum.2022.1051463.
  2. Wang XW, Nie D, Lu BL. Emotional state classification from EEG data using a machine learning approach. Neurocomputing. 2014;129:94–106.
  3. Giannakaki K, Giannakakis GA, Farmaki C, Sakkalis V. Emotional state recognition using advanced machine learning techniques on EEG data [conference paper]. Presented at: 2017 IEEE 30th International Symposium on Computer-Based Medical Systems; Thessaloniki, Greece; 2017. p. 333–6. Available from: https://ieeexplore.ieee.org/document/8104214
  4. Barzilay R, et al. Predicting affect classification in mental status examination using machine learning face action recognition system. Front Psychiatry. 2019;10:288. doi:10.3389/fpsyt.2019.00288.
  5. Houssein EH, Hammad A, Ali AA. Human emotion recognition from EEG-based brain-computer interface using machine learning. Neural Comput Appl. 2022;34:12527–52.
  6. Awan AW, et al. An ensemble learning method for emotion charting using multimodal physiological signals. Sensors (Basel). 2022;22(23):9480. doi:10.3390/s22239480.
  7. Shetty H, Sampathila N, Kumar GS, Behere R. Interactive self assessment tool for analysis of emotional status. Indian J Sci Technol. 2017;10(16):1–5.
  8. Bazgir O, Mohammadi Z, Habibi SAH. Emotion recognition with machine learning using EEG signals [conference paper]. Presented at: 2018 25th National and 3rd International Iranian Conference on Biomedical Engineering; Qom, Iran; 2018. p. 1–5. Available from: https://ieeexplore.ieee.org/document/8703559
  9. Spunt RP, Adolphs R. The neuroscience of understanding the emotions of others. Neurosci Lett. 2019;693:44–8.
  10. Hawco C, et al. Neural activity while imitating emotional faces is related to both lower and higher-level social cognitive performance. Sci Rep. 2017;7:1244. doi:10.1038/s41598-017-01316-z.
  11. Behere RV, et al. TRENDS: a tool for recognition of emotions in neuropsychiatric disorders. Indian J Psychol Med. 2008;30(1):32–8.
  12. Trevethan R. Sensitivity, specificity, and predictive values: foundations, pliabilities, and pitfalls in research and practice. Front Public Health. 2017;5:307. doi:10.3389/fpubh.2017.00307.
  13. Gkintoni E, Aroutzidis A, Antonopoulou H, Halkiopoulos C. From neural networks to emotional networks: a systematic review of EEG-based emotion recognition in cognitive neuroscience and real-world applications. Brain Sci. 2025;15(3):220. doi:10.3390/brainsci15030220.
  14. Joshi S, Srinivas LNB. An ensemble classifier for emotion classification from EEG and GSR signals for autism detection. Comput Methods Programs Biomed. 2025;270:108921. doi:10.1016/j.cmpb.2025.108921.
  15. Lincoln SH, et al. The neural basis of social cognition in typically developing children and its relationship to social functioning. Front Psychol. 2021;12:714176. doi:10.3389/fpsyg.2021.714176.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

Navarasa

本文已发表

视频即将推出