我们提出一个开源的虚拟代理平台,用于开展实时动机性访谈,该平台结合了先进的语言模型和扩散模型,能够根据用户的行为和特征进行自适应调整。通过使用Greta 2.0平台,该系统支持多种主题,包括以营养和运动为重点的干预措施,为增强数字化治疗互动提供了一种灵活且经过验证的工具。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
我们提出一个开源的虚拟代理平台,用于开展实时动机性访谈,该平台结合了先进的语言模型和扩散模型,能够根据用户的行为和特征进行自适应调整。通过使用Greta 2.0平台,该系统支持多种主题,包括以营养和运动为重点的干预措施,为增强数字化治疗互动提供了一种灵活且经过验证的工具。
对治疗支持日益增长的需求正不断超过现有专业人员的承载能力。一种能够执行动机性访谈(MI)的虚拟代理为帮助患者在与人类治疗师会话的间隔期间实现行为改变目标提供了有前景的解决方案。MI本质上是一种合作且具有适应性的沟通形式。因此,开发一种能够根据情境调整其对话策略的代理,可显著提升治疗效果。在MI会话过程中,人类治疗师会根据患者的反应及其个人特征,调整自身的言语和非言语行为。根据患者动机水平的不同,治疗师将相应地调整其干预方式。因此,个性化与适应性对于开发有效的MI虚拟代理至关重要。本文介绍了一种能够通过实时动态调整言语和非言语行为来开展MI会话的虚拟代理。该系统依托最先进的模型,实现了MI交互功能。该虚拟代理基于Greta 2.0平台构建,其非言语行为通过一种名为MODIFF的扩散模型生成,该模型能够适应用户的面部表情及其行为改变准备度。这些面部表情特征是在一个MI语料库上训练获得,并通过专门的用户研究进行了验证。对话内容由最先进的大语言模型(LLM)生成,并由专为MI设计的对话管理器进行增强,该管理器采用强化学习方法,并经过用户测试验证。此外,该对话管理器能够适应不同用户特征。最终构建的平台为开源系统,支持生成实时、多模态的MI对话,为数字化辅助的治疗性交互提供了新工具。
动机性访谈(MI)是一种协作式的治疗方法,旨在促进行为改变。在MI会话期间,MI实践者帮助患者阐明并增强其改变的动机1。为此,他们采用对话策略(如反映性倾听或提问),并辅以非语言行为(如微笑或特定的头部和身体姿势)来加强沟通效果。
近年来,心理健康问题的发生频率不断上升,心理健康服务的需求与可用资源之间出现了差距2。这导致患者在获得治疗前需要等待更长时间2,3。为缓解这一问题,一种提出的解决方案是使用能够为候诊患者模拟动机性访谈(MI)的虚拟代理。通过提供即时支持和干预,这些虚拟代理有助于减轻等待期带来的影响,特别是在需要多次会话的治疗情境中4。多项研究已证明此类代理或聊天机器人具有有效性5,6,7,8,9,其目标并非取代MI专家,而是作为治疗过程中的补充工具。例如,它们可在治疗会话之间提供MI干预。
尽管以往的动机性访谈(MI)代理通常表现出有限的适应性行为,但MI本质上是一种合作且具有适应性的沟通方式。因此,开发能够根据情境调整其对话的代理,可显著提高治疗的有效性10。在MI会话过程中,治疗师会根据患者的反应、动机水平或参与程度11,12,以及其个体特征13,动态调整其言语(对话策略)和非言语行为。根据患者动机水平的不同,治疗师将相应地调整其干预方式。因此,个性化与适应性对于开发高效的MI虚拟代理至关重要。
Greta 2.0 平台14 是一个支持实时交互的模块化虚拟代理框架。该平台最近已得到扩展,能够实现在交互过程中动态适应生成式人工智能模型的能力。
该平台包含一个名为 MODIFF-8 的模型15,可生成实时面部表情,并动态适应用户自身的面部表情。该基于扩散的模型在动机性访谈(MI)情境下收集的多模态数据上进行训练,即AnnoMI语料库,该语料库由治疗师与来访者之间的咨询会话视频组成,视频采集自YouTube和Viméo等流媒体平台,并以对话行为进行标注(一种话语分类,用于表示所执行的行为,例如提问、问候)…)以及动作单元(人类面部表情的分类体系)。这些数据不仅基于用户当前的面部表情,还结合了交互过程中识别出的、与动机性访谈相关的对话行为,进而调控生成内容,这些对话行为关联到所采用的会话策略。其中包括与动机性访谈相关的用户对话行为,例如改变意图表达(change talk),以及虚拟代理自身的对话行为,例如反映或提供信息。通过实时整合这些多模态信号,系统使虚拟代理能够表现出符合社会情境和对话语境的面部表情。通过使其非言语行为(NVB)与交互情境相协调,该虚拟代理旨在促进社会亲和关系的建立,并在整个访谈过程中支持个体内在动机的激发15.
此外,该平台集成了一个专为动机性访谈(MI)设计的对话系统,称为 DREAM16。DREAM 包含一个对话管理器,能够根据当前对话状态和用户画像来选择代理的下一个对话行为。事实上,我们对 AnnoMI 语料库的分析揭示了三种 MI 患者画像:愿意改变型(当患者有改变动机并寻求支持时)、接受型(当患者尚未考虑改变时)和抗拒型(当患者无意改变时)13。在与虚拟代理互动之前,用户会根据其对决策平衡量表(DBS)问卷的回答被分配到上述三种画像之一17。该对话系统结合了一个大型语言模型(LLM),用于生成代理的言语输出,对应于对话管理器所选定的对话行为。这一组件实现了对话的上下文适应性,相较于更僵化的基于规则的方法有所改进6。尽管近期研究已探索使用 LLM 生成符合 MI 原则的对话,但这些研究未考虑用户画像18,19。相比之下,本模块能够动态适应用户的画像,从而在建立融洽关系方面优于这些基线系统。
将这些模型集成到 Greta 2.0 平台中,实现了动态的动机性访谈(MI)干预。其模块化实现方式允许独立评估每个模型的影响。本文介绍了用于开展实验的方法,以评估 MODIFF-8 和 DREAM 模型对平台所提供 MI 对话的贡献。该方法也可用于在 MI 实践者会话间隙提供个性化的 MI 干预。该方法需要配备 16 GB GPU 的 Windows 计算机,并安装开源软件。通过使用该方法,我们证明了所提出的适应性模型能够提升用户对 MI 传递代理感知质量的评价,并增强医患关系的建立。我们还观察到,当代理在言语和非言语层面以及会话策略层面采用适应性行为时,患者改变自身行为的动机有所增强。本文呈现的结果表明,针对每位患者个性化定制代理的 MI 干预具有积极影响。
为支持本系统的设计,我们进行了深入的文献综述,以探讨营养指导的理论与实践基础,包括动机性访谈、行为改变模型以及用户类型学。该综述促成了一个定性知识库的建立,该知识库围绕两个关键维度的交叉点进行组织:1)用户根据跨理论模型19所处的改变准备阶段,该模型确定了5个阶段:前意向阶段、意向阶段、准备阶段、行动阶段和维持阶段;2)基于饮食及心理相关因素的进食行为特征20。研究识别出三种类型:直觉型进食者(即能够感知自身的饥饿与饱腹信号,保持多样化且以植物性食物为主的饮食,优先选择高质量、通常是有机的食物)、情绪型进食者(即通过频繁摄入甜食或高脂食物来应对压力、孤独或喜悦,事后常感到内疚)以及限制型进食者(即过度关注食物控制,经常计算卡路里,频繁节食并出现体重反复波动,可能伴有进食障碍)。
针对每个阶段与用户特征的组合,提出了相应的情境化对话策略,包括量身定制的 SMART 目标、动机表达方式以及具体的行為建议。其目标是使虚拟代理能够根据用户的 心理准备程度和个人倾向,动态调整其干预方式。这一基础工作确保了交互过程中更高程度的个性化与共情能力,这对于维持用户参与度及实现长期行为改变至关重要。
访问受限。请登录或开始试用以查看此内容。
该方法已获得欧洲工商管理学院(INSEAD)机构审查委员会(IRB)的伦理批准,批准编号为:INSEAD 2024-78 和 INSEAD 2025-23。所有参与者均签署了知情同意书,并因其参与实验的时间获得了相应报酬。
1. 受试者招募
2. 预安装要求
3. Greta 的安装
4. Mistral API 密钥配置
5. DeepGram API 密钥配置
6. MODIFF 模型导入
7. 启动 Greta 2.0
8. 启动 OpenFace
9. 启动 MODIFF-8
10. 启动ASR
11. 启动 DREAM
12. 准备房间
13. 欢迎参与者
14. 确定参与者特征
15. 设置主题和配置文件
16. 开始对话
17. 对话过程中
18. 干预后
访问受限。请登录或开始试用以查看此内容。
在本方案中,我们采用针对拟测量行为调整的问卷,收集了交互文本记录和用户反馈。我们比较了使用模型与不使用模型时的交互结果。
使用该方案评估 MODIFF-8 自适应表情生成的影响
MODIFF-8 模块旨在通过使虚拟代理生成既符合语境又与用户行为同步的面部表情,从而增强其社交反应能力15。该设计背后的核心假设是,适应性的非语言行为,尤其是与交流内容相协调的面部表情,在动机性访谈(MI)过程中有助于建立融洽关系并促进自我表露19,20,21。
为了评估这种实时自适应能力的影响,我们开展了一项用户研究。通过索邦大学行为实验室的INSEAD招募平台,我们招募了63名参与者(N = 63;年龄18-45岁;男性30名,女性33名)。该研究采用被试间设计,在三个实验...
访问受限。请登录或开始试用以查看此内容。
本文介绍了一种在受控且可重复的交互框架内,实施个性化动机性访谈干预并测试个体行为生成模块的实验方案。该方法基于 Greta 2.0 平台的模块化架构,能够控制智能体行为所涉及的各个组件,使研究人员可轻松开启或关闭特定模块。这种灵活性使 Greta 2.0 非常适用于在人机多模态交互中进行实验性操控以及对新功能进行有针对性的评估。本方案可用于两个目的:测试 Greta 平台中新模块的有效性(例如,生成自动手势的模块),或提供质量达到治疗阈值以上的个性化动机性访谈。如实验结果所示,采用这些适应性模型可增强用户对智能体的感知体验及其行为改变的动机水平。
该平台的一个关键应用是在人类专家会话间隙期间提供动机性访谈(MI)的对话支持,特别是在缺乏经过MI培训人员的环境中。该平台支持非专家监督,从而提高了MI干预的可及性。同时,它还为系统性测试新的行为模块(如全身姿态生成、注视行为和轮流发言策略)提供了研究环境。由于该平台采用预先验证的对话结构以及集成的表情生成模块(DREAM和MODIFF-8),无需从零开始设计和验证新的交互内容,避免了这一耗时过程对实验结果有效性的影响。
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
本工作部分由 ANR-DFG-JST Panorama、ANR-JST-CREST TAPAS(19-JSTS-0001-01)、Enhancer(ANR-22-EXEN-0004)和 PEPR-Ensemble PC3(ANR-22-EXEN-0004)项目资助。本文所展示的评估工作由索邦大学卓越大学计划(Idex Sorbonne Université)资助,属于法国“未来投资计划”国家支持项目的一部分。本工作还获得了法国政府资助,该资助由法国国家科研署(Agence Nationale de la Recherche)管理,属于“法国2030”计划的一部分,项目编号为 ANR-22-EXEN-0004(PEPR eNSEMBLE / MATCHING)和 22-PESN-0009(PEPR AUTONOM-HEALTH)。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 计算机 | Dell | 配备 Intel Core i7-14700 处理器和 Nvidia RTX5000 显卡的计算机 | |
| 带麦克风的耳机 | Epos | 带麦克风的耳机 | |
| 网络摄像头 | Logitech | 用于面部表情提取 | |
| 网络摄像头2 | Logitech | 用于视频录制 |
访问受限。请登录或开始试用以查看此内容。