需要JoVE订阅才能观看此内容。 请登录或开始免费试用

研究文章

设计自适应多模态交互框架以增强人机智能协作

425 次观看

DOI:

10.3791/69830

2026年2月24日

本文内容

摘要

本研究提出了一种基于动态时间规整(DTW)的分层对齐机制,结合在线自适应与注意力驱动的多模态融合方法,能够实现可靠的长时程意图预测与任务跟踪。轻量级可解释性模块提升了模型的可解释性,有助于增强人机协作中的信任。该方法可推广应用于机器人系统及虚拟交互系统。

摘要

实现高效且自然的人机协作仍然是一个重大挑战,尤其是在动态的真实世界环境中。现有框架通常受限于僵化的单模态输入或基于规则的多模态融合,从而限制了其鲁棒性、个性化能力与适应性。本研究提出一种自适应多模态交互框架,该框架在分层的人类意图预测模型中整合了基于视觉的姿态估计与基于语音的指令理解。该框架采用基于Transformer的序列模型进行动作预测,并利用动态时间规整(Dynamic Time Warping)将人类行为与结构化任务图对齐,以实现长期规划。与依赖静态模态切换的先前方法不同,本架构采用基于注意力的融合机制,动态加权最具信息量的输入。此外,一个在线适应模块可实现对用户行为的实时调整,并辅以轻量级的可解释性层以增强用户信任。在协作装配任务中的实验评估表明,该框架在任务表现(最高提升24%)、意图预测准确率(最高提升18%)以及用户满意度方面均有显著提升。这些结果凸显了自适应多模态交互框架的有效性与通用性,支持其推动协作智能向更可靠、透明且以人为中心的AI系统发展。

引言

人机协作(HRC)已成为重要的研究领域之一,尤其是在机器人越来越多地被部署于以人为中心的环境中的背景下。尽管短期人机协作的框架与技术已取得显著进展1,2,长期人机协作的发展尚不成熟3。在工业应用中,长期人机协作的实施有望显著提升复杂制造过程中的生产效率与适应能力4。在家庭环境中,作为伴侣或老年人照护代理的机器人,有望通过长期人机协作提升生活质量5。在医疗领域,社区机器被用作家庭成员和照护者的补充,服务于患有痴呆症、自闭症及其他身体或精神疾病的患者6。同时,在旅游与服务领域,工业机器人被用于提升用户体验与知识获取7。在智能工程中,其目标是以以人为中心的方式融合人工智能,恢复人类能力并实现个性化生产,这一阶段被称为工业5.0。人机智能与人机协作系统已在多种应用领域中得到探索8,9,10;然而,近期研究 increasingly focused on 需要可靠意图预测与长时程任务理解的协作式机器人场景....

访问受限。请登录或开始试用以查看此内容。

方案

提出的人机协同增强架构采用自适应的多模态交互流程,将视觉和语音模态结合到一个动态的、分层的推理框架中。本研究使用了先前已发表实验中的公开数据,未涉及新的受试者,也无需额外的伦理审批。

提出的自适应多模态交互架构

该系统的核心始于感知模块,例如利用RGB-D传感器捕捉用户姿态与动作的视觉流,以及采用轻量级ASR(自动语音识别)引擎分析语音输入的音频流。这些原始输入被送入基于Transformer的动作预测模块,该模块对姿态和指令序列中的时间依赖性进行编码,以推断低层次的人类行为。随后,为了实现高层次的协作规划,采用动态时间规整(Dynamic Time Warping, DTW)机制将检测到的动作与预定义任务图中的节点对齐,从而预测用户目标及下一步动作。一种新的基于注意力机制的融合模块在每个时间步判断哪种模态(音频或视觉)提供了最具上下文重要性的信息,并动态调整输入权重。为实现交互的个性化,系统包含在线模型自适应功能,可实时调整动作预测器以适应用户行为的变化。此外,一个轻量级的可解释性模块生成用户友好的预测意图和人工智能决策摘要,以提升透明度与信任度。整个系统在模拟但贴近真实世界的协作装配环境中进行了测试,支持在单模态与自适应多模态环境之间进行比较。该方法有助于在各个领域实现更具适应性、更直观且更可靠的与人工智能代理的协作。

访问受限。请登录或开始试用以查看此内容。

结果

本文提出的自适应多模态交互模型解决了上述问题,通过无缝融合视觉与语音模态,并结合实时用户自适应机制,显著增强了人机协作效果。与基线分层多模态系统相比,我们的方法引入了个性化反馈循环以及认知负荷感知的自适应机制,从而实现更直观、更具情境感知能力的交互体验。在模拟协作任务(如物体操作、组件呈现以及基于序列的目标完成)的实验测试中,该系统始终表现出更高的效率、灵活性以及用户满意度。具体而言,所提出的方法在完成任务所需时间上减少了25%,在意图预测准确率上提升了15%,尤其在复杂的交互情境下表现更为突出。此外,用户感受到更流畅的交互过程以及更高的系统透明度,这证明了自适应反馈在支持长期协作中的必要性。3展示了所提出方法的仿真环境。

.......
模拟描述

访问受限。请登录或开始试用以查看此内容。

讨论

研究结果明确证明了所提出的自适应多模态交互基础在增强人机协作方面的有效性。

除了任务完成时间(TCT)、人类意图预测准确率(HIPA)、多模态融合效率(MFE)、错误恢复率(ERR)、用户满意度评分(USS)和交互流畅性指数(ISI)等标准评估指标外,还可添加其他以用户为中心的指标,以深入分析自适应多模态框架。特别是可引入认知负荷指数(CLI),用于量化参与者所产生的认知努力,从而评估自适应融合在协同工作过程中是否降低了用户的压力。

信任校准评分可用于实证验证可解释性模块在多轮使用过程中对用户系统信心的影响程度,以此作为衡量该框架在维持适当信任水平方面性能的指标。最后,学习曲线分析能够展示系统与用户在一系列试验中的学习过程,确定协作过程中性能、错误恢复能力以及信任关系的发展情况。这些补充性测量指标共同将认知与情感层面的因素融入技术性指标之中,从而对所提出的范式提供更为全面的评估。图8展示了基于用户的测量如何更深入地揭示自适应多模态交互的性能表现。认知负荷指数(CLI).......

访问受限。请登录或开始试用以查看此内容。

致谢

作者衷心感谢中国无锡江南大学设计学院提供的支持。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
RGB-D 摄像头(Intel RealSense D435)Intel CorporationD435深度分辨率为 1280×720 像素 @ 30 fps;RGB 分辨率为 1920×1080 像素 @ 30 fps;用于捕捉用户姿态、身体动作和空间上下文
指向性麦克风通用 / 多个供应商N/A宽带、降噪麦克风(16 kHz–44.1 kHz);用于采集语音指令
BlazePose(预训练模型)Googlehttps://developers.google.com/mediapipe/solutions/vision/pose具有 33 个关键点的姿态估计模型;用于实时人体姿态提取
OpenPose(预训练模型)CMU 感知计算实验室https://github.com/CMU-Perceptual-Computing-Lab/openpose多人姿态估计框架,用于提取运动轨迹
DeepSpeech 语音识别引擎Mozillav0.9.3预训练的自动语音识别模型,用于语音转文本转录
wav2vec 2.0 语音识别引擎Meta AIhttps://github.com/facebookresearch/fairseq自监督语音表征模型,用于实时语音处理
基于 Transformer 的动作预测模型(DLinear / Seq2Seq)自定义实现N/A具有注意力机制的时间编码器-解码器架构,用于短期动作预测
动态时间规整(DTW)模块自定义 / 基于 SciPyhttps://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.distance.cdist.html软对齐算法,用于将用户动作与预定义任务图进行匹配
基于注意力的多模态融合网络自定义实现N/A采用置信度加权注意力机制,融合视觉和语音输入
在线自适应模块(LoRA / 基于梯度)自定义实现https://github.com/microsoft/LoRA轻量级、参数高效的微调方法,用于适应用户行为
可解释性模块(基于规则 + 注意力图)自定义实现N/A利用规则和注意力可视化提供可解释的决策依据
KINOVA Gen3 机械臂KINOVA RoboticsGen37 自由度机械臂,集成扭矩传感器;用于协作式玩具汽车组装
协作式装配仿真环境自定义环境N/A真实世界中的玩具汽车组装设置,用于多模态协作性能基准测试
评估指标(TCT、HIPA、MFE、延迟、ERR、USS、ISI)自定义定义N/A用于评估协作效率、准确性和信任度的定量及以用户为中心的指标

参考文献

  1. Yu, P., Abuduweili, A., Liu, R., Liu, C. Robustifying long-term human-robot collaboration through a hierarchical and multimodal framework. arXiv. , (2024).
  2. Cheng, Y., Sun, L., Liu, C., Tomizuka, M. Towards efficient human-robot collaborat....

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

Transformer