需要JoVE订阅才能观看此内容。 请登录或开始免费试用

综述文章

无缝多模态人机交互:人机交互中的融合技术

64 次观看

DOI:

10.3791/70218

2026年6月9日

本文内容

摘要

本文综述了深度学习、多模态感知以及集成策略方面的最新进展,这些进展实现了人类与机器人之间无缝、自适应且以人类为中心的通信。

摘要

随着社交机器人、辅助机器人和教育机器人进入家庭、医疗保健机构和教室等日常环境,无缝的多模态人机通信变得至关重要。在这些场景中,机器人需要以高精度、低延迟和强健的现实适应性,整合语音、手势、注视、面部表情以及触觉线索。本综述系统地考察了当前技术如何实现实时、双向的多模态人机交互(HRI),重点关注融合策略、系统架构以及在特定领域的应用。我们检索了Web of Science核心合集2015年至2025年间以英文发表的实证研究,筛选出148篇涉及交流整合的论文。其中最重要的发现包括:自2022年以来,融合方法明显转向混合式和基于注意力机制的融合(约占所有方法的43%),相较于早期方法,能更有效地处理时间异步性和具身交互;评估指标普遍存在不一致性,阻碍了跨研究的比较;实验室中表现优异的系统在面对噪声、遮挡或用户差异等现实条件时,其鲁棒性仍明显不足。关键挑战包括实时处理、语义对齐、数据效率、部署鲁棒性,以及触觉信号与情感信息整合的研究尚不充分。展望未来,本综述建议优先发展自适应融合策略、建立针对同步性和流畅性的标准化基准,并推动持续学习,以实现面向用户个性化适应的能力。最终目标是指导开发更具人性化、能够在日常生活中实现协作性、有意义且社会可接受的机器人智能体。

引言

机器人已从结构化环境中使用的工业工具,发展为融入家庭、医院和教室等社会场景的智能体。如今,它们在教育、治疗和陪伴等方面提供辅助,体现了从以任务为导向的自动化向以用户为中心、具备适应性交互的转变。这一转变的核心在于多模态通信,使机器人能够以动态环境中自然交流所需的时序精度,感知并响应人类的多种线索——包括言语、注视、手势、面部表情和触觉。这种对协调性与响应性的强调,与人机交互和认知科学领域的核心问题高度一致。本文所指的无缝多模态通信,是指对用户而言流畅且直观的交互体验,其特征包括亚秒级响应时间(通常小于300毫秒)、可感知的延迟或不匹配最小化,以及对现实世界中各种变化的强适应能力。这使其区别于传统的基于指令或单模态的系统,后者常因时序误差、模态失效或僵化的响应而破坏交互的自然性。

在人机交互(HRI)领域,本综述聚焦于人机通信,即人类与机器人之间多模态信号的双向实时交换。尽管HRI还包括规划、控制与安全等方面,但通信关注的是跨感官通道的感知与行为的同步。早期基于命令的系统优先考虑效率而非交互性,常导致僵化或延迟的行为表现。当前的研究致力于开发适应性强、具备情境感知能力的模型,以适应用户状态与情绪1,2。这一发展趋势凸显了构建精确、直观且个性化的交互框架的必要性。

早期的社交与辅助机器人通常依赖预设脚本程序或....

访问受限。请登录或开始试用以查看此内容。

综述与观点

随着机器人逐渐成为家庭、教室和医疗环境中的常见设备,自然且自适应的交流对其成功至关重要。机器人 increasingly 被视为社交伙伴而非工具,必须能够感知、解读并响应跨模态的人类信号。能够准确捕捉用户意图并提供及时反馈的系统可提升任务表现、信任感以及情感舒适度——尤其是在与儿童、老年人或残障人士互动时。实现这一目标需要持续且直观的交互,使机器人的回应与人类正在进行的行为保持一致,而非打断该行为。这种流畅性要求通过模仿人类自身交流机制的方式,整合语音、注视、手势和面部表情等多模态输入14,16

感知与通信通道
视觉仍然是多模态人机交互的基础。面部表情、注视方向、姿势和手势等视觉线索是意图识别、情绪推断和参与度追踪的关键17,18,19,20,21。早期基于手工设计的方法,如使用Haar检测22或背景减除23

访问受限。请登录或开始试用以查看此内容。

结论

本综述存在若干局限性。将检索范围限定于Web of Science核心合集中的英文文献,可能引入语言偏倚,并排除了相关的非英文研究成果。聚焦于2015年至2025年间发表的同行评审文章,也可能反映出出版偏倚,从而可能遗漏预印本、灰色文献或正在出现的未发表结果。尽管对148篇论文的筛选过程依据明确的标准进行,但人工筛选仍不可避免地带有一定主观性。最后,对趋势的主题解读反映了我们自身在这一快速发展的领域中的观点。

尽管存在这些局限性,该综述仍指明了推进无缝多模态人机交互(HRI)的明确优先方向。实时同步以及在非结构化环境中的鲁棒性仍是最重要的挑战,因为它们直接影响系统的部署可靠性与用户信任。未来,该领域应优先发展三个相互关联的方向:能够根据噪声水平和同步程度动态选择策略的情境自适应融合策略;用于时间对齐、跨模态延迟和交互流畅性的标准化基准;以及突破性方法,例如面向边缘优化的多模态变换器或持续学习技术,以实现无需完全重新训练的长期适应。集成轻量级大语言模型用于前瞻性意图预测,以及触觉-视觉协同适应,有望进一步加速该领域的发展。

无缝.......

访问受限。请登录或开始试用以查看此内容。

披露

作者声明不存在利益冲突。

致谢

本工作由马来西亚理科大学资助,项目编号:R501-LR-RND003-0000001342-0000。

....

访问受限。请登录或开始试用以查看此内容。

参考文献

  1. Frennert, S., et al. Towards a hierarchical user requirement structure for upper limb assistive robotics. ACM Trans Hum-Robot Interact. 14 (1), 1-26 (2024).
  2. Kansizoglou, I., Bampis, L., Gasteratos, A.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签