2025年12月23日
我们提出一个开源的虚拟代理平台,用于开展实时动机性访谈,该平台结合了先进的语言模型和扩散模型,能够根据用户的行为和特征进行自适应调整。通过使用Greta 2.0平台,该系统支持多种主题,包括以营养和运动为重点的干预措施,为增强数字化治疗互动提供了一种灵活且经过验证的工具。
我们的研究探讨多模态交互,重点在于调整虚拟代理在交互过程中的言语和非言语行为,例如面部表情。近年来,机器学习特别是大语言模型的分析进展,使得人机交互更加自然和灵活。首先,为实验准备一台 Windows 计算机。
从官方分发渠道安装 Java SE 开发工具包 8。然后安装 Visual Studio 2013 的 Visual C++ 可再发行组件。通过在线申请门户申请 CereProc 许可证。
从提供的代码仓库安装 OpenFace。准备一个网络摄像头用于视频采集。接着,从指定的代码仓库下载 Greta 软件版本。
按照提供的说明,使用 NetBeans 编译软件。从在线控制台获取 Mistral 应用编程接口密钥。创建文件,然后将应用编程接口密钥粘贴到所创建的文件中。
现在,从在线控制台获取一个 Deepgram 应用编程接口密钥。创建文件路径,并将应用编程接口密钥粘贴到所创建的文件中。对于 MoDiff 模型的导入,首先从提供的源下载 MoDiff 模型权重。
将下载的文件放入 MoDiff 数据文件夹中。然后启动 Modular JAR,依次点击 File(文件)、Open(打开)、Greta(格蕾塔)、Advanced(高级),并选择 20250128 Greta Expe Lucie_full.xml。
确保显示的配置与预期设置一致。现在启动 OpenFace 离线 ZeroMQ 程序。在“Record”选项卡中,除“通过 ZeroMQ 广播”外,取消勾选所有其他选项。
在“文件”选项卡中,点击“打开网络摄像头”。授权使用可用的网络摄像头进行实时特征提取。选择要使用的网络摄像头。
等待网络摄像头加载完成,实时特征提取将自动开始。接着,在 OpenFace2 输出流读取器中,单击“连接”。等待可用特征列表加载完成。
单击“全选”,然后设置以验证所选特征。在 MoDiff 下,单击“启动”并等待连接确认消息。然后按“连接”以激活 MoDiff 与数据接收器之间的连接。
在“筛选器”中,单击“执行”以允许生成数据的运行。在 MoDiff 窗口中,单击“启用”。等待 90 秒,直至模型稳定。
要启动 ASR,请在 Dee gram 窗口中点击“Enable”。然后选择条件 RL 以使用 dream,或选择 baseline 以使用普通的大型语言模型。在 MI Counselor RL 窗口中,点击“Enable”。
等待模型启动30秒。将一台大型显示器放在桌面上,并在显示器前方放置一把椅子。将网络摄像头置于显示器顶部,使其面向椅子。
将一个指向性麦克风放在椅子前方的桌面上。让受试者使用五级李克特量表完成决策平衡量表(Decision Balance Scale,DBS)问卷。然后要求受试者对着麦克风讲话。
首先,确定参与者特征并评估其 DBS 评分。根据评分将参与者分类为抗拒型、犹豫型或开放型。在 MI 咨询师 RL 窗口中,选择参与者选定的讨论主题。
单击“开始”以允许智能体与参与者启动对话。在 MI Counselor 窗口中监控回答部分是否存在有害输出。在 Deepgram 窗口中,待智能体完成发言后,单击“收听”。
如果语音未被识别,请将参与者的言语输入请求字段,然后点击发送。等待参与者的回答。请参与者完成干预后的问卷调查。
然后使用准备好的发言对参与者进行事后说明。与具有自适应面部表情的智能体进行互动的用户,在其陈述中表现出比其他行为条件下的用户更积极的情感。在评估态度、社会融洽度和动机性访谈质量的主观问卷评分中,三种表情条件之间未观察到显著差异。
面部表情不匹配的条件(即人际反应一致性不再被遵守时)在主观测量的各项指标中,普遍评分低于无表情条件(即代理对象不显示任何表情)和适应性条件(即代理对象的表情由本研究模型驱动)。感知到的态度对感知到的访谈质量具有显著的直接影响。感知到的态度与动机性访谈质量之间的关系,有43%的部分通过社会融洽关系的中介作用得以解释。
与自适应梦境对话管理器互动的参与者报告的融洽关系显著高于与普通大语言模型基线互动的参与者。在使用决策平衡量表测量的动机得分方面,梦境对话管理器在适应不同参与者特征方面优于基线模型。基线条件和梦境条件均产生的动机性访谈客户评估得分高于治疗阈值。
我们的研究结果表明,调整语言和非语言行为显著提高了智能体的有效性,并改善了人们对社交交互智能体的感知。我们的平台能够评估其他自适应组件,例如手势生成及其他对话主题的表达。未来的研究将聚焦于长期交互以及跨多个对话会话的持续自适应。
查看完整文字稿并访问数千部科学视频
本研究介绍了一个开源的虚拟代理平台,该平台旨在进行实时动机性访谈,利用先进的语言模型和扩散模型来适应用户行为。该平台Greta 2.0支持多种干预主题,包括营养与运动,可增强数字化治疗互动。
利用自适应虚拟代理进行数字化介导的动机性访谈(MI),可应对行为健康干预中可扩展性的挑战,为患者参与提供可复制且标准化的方法。通过实时调整语言和非语言线索,可提高对用户反应的预测置信度,并为数字疗法提供可靠的靶点验证支持。该平台使企业研发团队能够针对不同患者特征评估和优化数字干预策略,推动基于风险调整的投资组合进展。
这种自适应的动机性访谈代理平台适用于数字治疗发现的连续过程,涵盖从早期假设验证到行为干预的临床前验证。