研究文章

设计自适应多模态交互框架以增强人机协作

DOI:

10.3791/69830

2026年2月24日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了基于动态时间扭曲(DTW)的层级对齐机制,结合在线适应和注意力驱动的多模态融合,实现了可靠的长期意图预测和任务跟踪。轻量级的可解释性模块提升了可解释性,促进了人机协作的信任。该方法可推广到机器人和虚拟交互系统。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

实现有效且自然的人机协作仍是一大挑战,尤其是在动态的现实环境中。现有框架常受限于僵化的单模态输入或基于规则的多模态融合,限制了其稳健性、个性化和适应性。本研究引入了一种自适应多模态交互框架,将基于视觉的姿态估计和基于语音的指令理解整合在分层的人类意图预测模型中。该框架采用基于Transformer的序列模型进行动作预测,并采用动态时间扭曲技术,使人类行为与结构化任务图对齐,实现长期规划。与以往依赖静态模态切换的方法不同,我们的架构采用基于注意力的融合机制,动态加权最具信息量的输入。此外,在线适应模块支持用户行为的实时调整,辅以轻量级解释层以促进用户信任。协作组装任务中的实验评估显示,任务表现(最高可达24%)、意图预测准确率(最高可达18%)和用户满意度均有显著提升。这些结果凸显了自适应多模态交互框架的有效性和多样性,支持其推动协作智能迈向更可靠、透明和以人为本的人工智能系统的潜力。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

人机协作(HRC)一直是重要的研究领域之一,尤其是在机器人越来越多地被应用于以人为中心的环境中之后。虽然短期HRC的框架和技术有了显著改进1,2,但长期HRC尚未达到成熟阶段在工业应用中,长期HRC的利用可以显著提升复杂制造过程中的生产力和适应性。家庭环境、机器人作为伴侣或老年护理人员,有潜力通过长期HRC5提升生活质量。医疗机构将社区机器作为家庭和照护者的替代,涵盖患有痴呆症、自闭症及其他身心疾病的患者护理。同时,旅游和友好领域利用工业机器人提升用户知识。在智能工程中,目标是以以人为本的方式参与人工智能,恢复能力并打造个性化作物,这一阶段被称为工业5.0。人机协作系统已在多个应用领域被探索:8910;然而,近期研究越来越多地聚焦于需要可靠意图预测和长期任务理解的协作机器人环境。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

用于增强人机协作的架构采用了结合视觉和语音模态的自适应多模态交互流水线,形成动态、层级的推理框架。本研究使用了此前公开发表的实验数据。没有新的人类受试者参与,也不需要额外的伦理审批。

拟议的自适应多模交互架构

从根本上讲,系统从感知模块开始,例如视觉流利用RGB-D传感器捕捉用户姿势和动作,音频流则利用轻量级自动语音识别(ASR)引擎分析语音输入。这些原始输入会被输入基于Transformer的动作预测模块,该模块编码姿态和指令序列中的时间依赖性,以推理低层次人类行为。随后,为了实现高层次协作规划,动态时间扭曲(DTW)机制将检测到的动作与预定义任务图的节点对齐,预测用户目标和下一步行动。一个基于注意力的新型融合模块在每个时间步决定哪种模态(音频或视觉)提供最具上下文重要性的信息,并动态调整输入权重。为了实现交互个性化,系统包含在线模型适应,实时调整动作预测变量以适应用户行为的变化。一个轻量级的解释模块还能生成用户友好的预测意图和人工智能决策摘要,以提升透明度和信任度。整个系统在模拟但真实的协作组装环境中进行测试,允许在单模态和自适应多模态环境中进行比较。这种方法促进了与AI代理在各个领域的更灵活、更直观且更可靠的协作。

图....

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

这里提出的自适应多模态交互模型解决了这些问题,并通过无缝结合视觉和语音模态与实时用户适应过程,大大提升了人机协作。与基线层级多模态系统不同,我们的方法包含个性化反馈回路以及认知负载感知适应,提供更直观、更符合上下文的交互。在模拟协作活动中进行实验测试,如对象处理、组件展示和基于顺序的目标完成,系统始终表现出更高的效率、灵活性和用户满意度。具体来说,该方法在复杂交互情境下,完成任务的时间减少了25%,意图预测准确率提高了15%。此外,用户体验到更顺畅的互动和更高的系统透明度,这也证明了支持长期协作的自适应反馈的必要性。 3展示了拟议方法的模拟环境。

模拟描述

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

研究结果充分展示了所建议的自适应多模态交互基础在提升人机协作方面的高效性。

除了标准评估评分如任务完成时间(TCT)、人类意图预测准确度(HIPA)、多模融合效率(MFE)、错误恢复率(ERR)、用户满意度评分(USS)和交互平滑指数(ISI)外,还可以添加更多以用户为中心的指标,以便对自适应多模态框架进行深入分析。特别是,可以引入认知负荷指数(CLI),以量化参与者所引发的认知努力,以评估自适应融合是否能降低用户协作时的压力。

信任校准评分可用于实证确认可解释性模块对用户对系统信心的影响程度,作为框架在反复使用时维持适当信任水平表现的衡量标准。最后,学习曲线分析可以通过一系列试验展示系统学习和用户学习,确定通过协作过程如何发展性能、错误恢复和信任。这些补充措施将结合起来,辅以人机协作的认知和情感方面,补充技术指标,从而对拟议范式提供更全面的评估。 图8展示了基于用户的度量如何为自适应多模态交互性能提.......

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者之间没有利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者衷心感谢中国无锡江南大学设计学院的支持。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
RGB-D摄像头(英特尔RealSense D435)英特尔公司D435深度分辨率:1280×720像素 @ 30帧每秒;RGB 分辨率 1920 及以上;1080 px @ 30 fps;用于捕捉用户姿势、身体动作和空间上下文
定向麦克风通用/多供应商宽带降噪麦克风(16 kHz及无阻拦截;44.1 kHz);用于收集口头指令
BlazePose(预训练模型)谷歌https://developers.google.com/mediapipe/solutions/vision/pose具有33个关键点的姿态估计模型;实时人体姿态提取
OpenPose(预训练模型)卡内基梅隆大学感知计算实验室https://github.com/CMU-Perceptual-Computing-Lab/openpose用于提取运动轨迹的多人姿态估计框架
DeepSpeech ASR 引擎Mozillav0.9.3预训练自动语音识别模型用于语音转文本转录
wav2vec 2.0 ASR 发动机元人工智能https://github.com/facebookresearch/fairseq实时语音处理的自监督语音表示模型
基于变换器的工作预测模型(DLinear / Seq2Seq)自定义实现关注短期动作预测的时序编码-解码架构
动态时间扭曲(DTW)模块自定义/基于科学https://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.distance.cdist.html用于将用户操作与预定义任务图匹配的软对齐算法
基于注意力的多模聚变网络自定义实现融合视觉与语音输入的信心加权注意力机制
在线改编模块(基于LoRA / 渐变)自定义实现https://github.com/microsoft/LoRA轻量级、参数高效微调以适应用户行为
可解释性模块(基于规则+注意力映射)自定义实现通过规则和注意力可视化提供可解释的决策理由
KINOVA第三代机械臂KINOVA机器人第三代7自由度机器人机械手,集成扭矩传感器;用于协作玩具车组装
协作组装仿真环境自定义环境用于多模态协作基准测试的真实玩具车组装装置
评估指标(TCT、HIPA、MFE、延迟、ERR、USS、ISI)自定义定义定量且以用户为中心的指标,用于评估协作效率、准确性和信任度

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Yu, P., Abuduweili, A., Liu, R., Liu, C. Robustifying long-term human-robot collaboration through a hierarchical and multimodal framework. arXiv. , (2024).
  2. Cheng, Y., Sun, L., Liu, C., Tomizuka, M. Towards efficient human-robot collaborat....

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

Transformer

相关文章