综述文章

无缝多模态人机通信:人机交互中的集成技术

DOI:

10.3791/70218

2026年6月9日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本综述综合了深度学习、多模态传感和集成策略的最新进展,这些策略实现了人与机器人之间无缝、适应性和以人为本的沟通。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

随着社交、辅助和教育机器人进入家庭、医疗机构和教室等日常场所,无缝的多模态人机通信变得不可或缺,它们需要以高精度、低延迟和现实世界强韧性整合语音、手势、凝视、面部表情和触觉线索。本综述系统地考察当前技术如何实现实时互惠多模态人机交互(HRI),重点关注聚变策略、系统架构及特定领域的应用。我们检索了Web of Science核心合集中2015年至2025年的英语实证研究,选取了148篇涉及传播整合的论文。最重要的见解包括自2022年以来,约43%的方法明显转向混合和基于注意力的融合,这比以往方法更能处理时间异步和具象互动;评估指标普遍不一致,阻碍跨研究比较;以及在噪声、遮挡或用户变异性下,强而有力的实验室性能与较弱的现实鲁棒性之间存在持续的差距。主要挑战包括实时处理、语义对齐、数据效率、部署鲁棒性以及触觉信号与情感的整合尚未充分探索。展望未来,综述建议优先考虑自适应融合策略、标准化的同步与流畅度基准,以及持续学习,以实现用户个性化适应。最终,它旨在引导开发更具以人为本的机器人智能体,这些智能体能够协作、有意义地参与,并在日常生活中获得社会认可。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

机器人已经从结构化环境中的工业工具,发展成为家庭、医院和教室中嵌入社会的智能体。它们现在协助教育、治疗和陪伴,反映出从任务导向自动化向以用户为中心、适应性互动的转变。这一转变的核心在于多模态通信,使机器人能够感知并响应人类信号——言语、凝视、手势、面部表情和触觉——以实现动态环境中自然交流所需的时间精确度。这种对协调和响应性的强调与人机交互和认知科学的核心关注点相契合。在本综述中,无缝多模态通信指的是用户感觉流畅且直观的交互,特点是响应时间低于300毫秒,几乎没有明显的延迟或错配,并且对现实世界变异性具有强韧的适应能力。这使其区别于传统的基于命令或单模态系统,后者因时序错误、模态失效或僵化响应而干扰自然流程。

在人机交互(HRI)中,本综述聚焦于人机通信,定义为人与机器人之间多模态信号的互惠、实时交换。虽然HRI还包括规划、控制和安全,而沟通则关注感知与行动在感官通道上的同步。早期基于指挥的系统更注重效率而非交战,常导致僵化或延迟的行为。当代研究追求适应性、情境感知模型,以适应用户状态和情绪 1,2。这一演变凸显了精准、直观且个性化的交互框架的必要性。

最初的社交和辅助机器人通常依赖脚本化程序或单一模态输入,如语音或触摸,限制了灵活性3.基于规则的逻辑和缓慢的处理常常导致手势与语音之间的时间不匹配,或对用户行为的适应不良。为解决这些问题,研究人员采用低延迟融合、多模态感官整合和用户自适应学习 4,5。这些策略可以通过HRI广泛认可的三个基础沟通原则来理解:互补性(模式相互补偿)、冗余性(重叠提升稳健性)和协同效应(趋同增强自然性)。

感知和学习的进步催生了能够实时整合视觉、听觉、触觉和生理输入的社会响应机器人5,6。这些系统不是固定脚本,而是不断根据用户提示进行调整。可访问的编程界面和从示范中学习的方法使教育者和治疗师能够为照护和教学定制行为,而精准、响应性和适应性至关重要。

社会HRI中的沟通模式可以分为平行模式、互补模式和互动模式(见图1)。在并行交互中,人类和机器人独立行动,交换极少。互补互动引入了结构化提示或基于事件的支持。最先进的交互模式涉及语音、移动和凝视7等通道间的持续双向调整。

文献选择与分析

系统评价方法论: 我们在Web of Science核心收藏中进行了系统文献检索,目标是主要出版商(IEEE、ACM、Springer、Elsevier、Wiley, Taylor & Francis)的同行评审期刊文章和完整会议论文集。布尔查询为:((“人机交互”或 HRI)和(多模态 OR “传感器融合”或手势 OR 凝视 OR 语音 或触觉) AND(“实时” 或 “低延迟” 或 自适应 或 鲁棒))。纳入标准包括:2015年1月至2025年间的英文出版物——这一时期涵盖了从基于规则的单模态系统向强调低延迟、自适应性和稳健交互的深度学习架构转变的时期——重点关注多模态集成技术用于沟通HRI和实证验证(定量或定性)。我们排除了仅限于单峰交互的研究、无交流意图的机器人控制研究,以及非实证研究(如纯理论或仅模拟研究)。初步检索获得了大量资料。删除重复后,我们根据纳入标准筛选标题和摘要,然后进行全文综述以评估其对可靠多模态融合的相关性和贡献。这一多阶段过程在PRISMA风格流程图中总结(见图2),最终汇集了148篇论文,构成本综述的实证基础。

精选文献概述图3 显示了发表趋势和学科分布,计算机科学和自动化与机器人学占据主导地位,行为科学和神经科学的贡献也在不断增长,这凸显了该领域的跨学科发展轨迹。我们按多模积分的技术贡献主题分组了文献(见表1)。该综合涵盖了模态、融合方法、延迟处理、鲁棒性策略、适应性和指标。2019年至2021年的研究主要采用早期或晚期融合,常强调手势和触觉输入。自2022年以来,混合型和注意力型架构越来越受欢迎,尤其是在情感性和身体互动方面。在该语料库中,混合融合约占43%,早期融合29%,晚期融合28%——这一分布表明对时间异步的容忍度有所提升。

尽管最初筛选的广泛文献中通常宣称实时能力,但只有少数研究详细介绍了具体的缓解策略(如缓冲处理、预测模型或传感器级优化)。鲁棒性通常依赖于过滤、冗余或基于规则的备用措施,而预见性适应则较为罕见。评估实践不一致,时间同步或交互流畅度的标准化评估仍然很少。各项研究的指标差异极大,直接比较往往困难。准确率、F1分数和延迟数据很常见,但它们源自不同的数据集、任务和环境条件;很少有论文采用共享的时间对齐或噪声鲁棒性基准。因此,在洁净实验室中表现优异,常常夸大了哪些方法能达到外部控制环境。制定一致的评估框架——或许包括在现实变异条件下的标准化延迟测试——将大大简化判断哪些方法真正推动该领域发展。

触觉-情感整合(仅有六项研究8910111213研究涉及此问题)以及用户驱动时间不确定性下的动态延迟调整仍存在关键空白。文献中浮现出几个有趣的张力。混合融合常被赞扬为处理时间错位的良好表现,但真正的预判或适应性行为仍然罕见,这让人质疑这种所谓的实时性能到底有多无缝。与此同时,视觉和基于语言的情感识别取得了显著进步,与将触觉线索与情感理解结合的有限工作形成鲜明对比。受控实验中的高精度在现实环境中也往往会下降,这凸显了在不同环境和用户之间泛化的持续挑战。表2总结了代表性的架构趋势和评估方法,并为后续章节讨论的挑战提供了参考。

本综述对多模态HRI文献作出了独特贡献。近期调查如赵等人14,提供了感知驱动决策的广泛概述,而王等人15 则关注5G驱动的视觉-触觉传输。两者都强调通用框架或通信协议,对实时聚变权衡、度量可比性或部署挑战的讨论有限。相比之下,我们提供了更具针对性的分析:比较特定约束下的融合策略,批判跨研究指标的不一致,并突出实际差距——尤其是此前调查大多忽视的实验室与现场绩效差距。

访问受限。请登录或开始试用以查看此内容。

综述与观点

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

随着机器人成为家庭、教室和医疗环境中的固定设备,自然且适应性的沟通对它们的成功至关重要。他们越来越被视为社会伙伴,而非工具,必须感知、解读并响应各种方式的人类信号。准确捕捉用户意图并及时反馈的系统提升任务表现、信任度和情感舒适度——尤其是在吸引儿童、老年人或残障人士参与时。实现这一目标需要持续且直观的交互,使机器人的反应与人类行为的持续行为保持一致,而非中断其行为。这种流利度需要多模态输入——声音、目光、手势、面部表情——通过映射人类交流的机制整合起来14,16

感知与沟通渠道
视觉依然是多模态人机交互的基础。面部表情、凝视、姿态和手势等视觉线索支撑着意图识别、情感推断和参与追踪17,18,19,20,21。早期手工制作的Haar检测22或背景减法23在遮挡或光照变化下常常失败16,21。深度学习系统现已占据主导地位,采用卷积神经网络和多机位输入的循环模型。图4展示了HI-ROS跟踪流水线,该流水线在实时手势监测中减少了27%的运动误差。

凝视、手臂和头部线索的整合提升了用户动作的预测能力17,而本体感觉和深度融合则提升了精度24,25。Mutual Gaze19和仿生眼设计18进一步展示了微妙信号在信任与协调中的作用。图5展示了26号的架构,双Leap Motion Controller捕捉手部运动,通过LSTM-RNN融合实现稳健的外科远程操作。近期的多摄像头系统,如Hi-ROS20和RPF 21,27,增强了非结构化环境中的跟踪能力。图6展示了通过连续分类器细化维持遮挡跟踪的自适应ReID生命周期。对主动标记28和语义SLAM26的补充研究提升了上下文意识,将感知从物体识别扩展到行为理解。

语言提供了一条平行的交流渠道。早期基于规则的对话系统存在模糊性问题,促使采用数据驱动和基于变换器的模型29。情感和社会响应能力现在是关键:多模态系统将面部和语音信号对齐,以实现适应性对话 2,30。强化学习改善情感与听觉线索之间的协调 5,31,32。大型语言模型如GPT-33和ChatGPT34,能够实现上下文推理和任务353637的指令跟踪。它们与愿景与奖励建模的结合,38,39,40,41,42,43,44,支持具有社会意识的、通用的互动。

听觉感知与视觉和语言相辅相成。当视觉线索不可靠时,韵律、音高和节奏传递意图。基于强化的特征提取提升了语音与表达之间的同步。AVA ActiveSpeaker45、AFFECT-HRI5、SAVEn-Vid46、HumorHRI47 和 CHiME-5 等数据集增强了模型在嘈杂且情感环境中的稳健性。Pan等人32 推动了多说话场景中的语音-唇同步,而多模态融合与触觉或生理输入则指导适应行为。

具身与生理感知
触觉和生理感知增强了社会和身体意识。力、压力和生物信号使得对意图、压力和参与度进行了推断。基于视觉的触觉模拟器如TACTO4 和神经映射器如FOTS48 能以300帧每秒生成高分辨率接触数据,支持低延迟控制。FOTS 通过学习到的反射函数 R 来建模照明和变形:

方程1

以及影子投射:

方程2

其中 Ms 编码投影几何。高分辨率触觉皮肤已通过磁流变弹性体49、EtherCAT传感器阵列50和辅助霍尔效应材料51实现。像DiGeTac13 这样的系统通过模块化管道统一手势、触觉和距离信号。飞行时间距离数据的过滤建模如下:

方程3

随后是神经手势分类和基于CNN的接触定位。安全控制通过通过分隔d调整机器人速度来强制执行。这些模块支持了稳健的人机协作。多模变换器进一步整合了触觉、视觉和文本信号。TVT-Transformer6 将模态特异的表示(qi, ki, vi)对齐到联合矩阵中:

方程4

实现跨模态的自我关注,实现统一理解(见图7)。

生理感知促进情绪对齐。Heinisch等人5将生理信号和视听信号同步以进行情感建模。基于肌电图的系统52,53解码手势和无声语音,而MetaSonic54通过声学定位提升空间感知。大型数据集如 AgiBot World Colosseo55 支持拥有超过一百万条触觉-视觉轨迹的多模态训练。这些进展共同标志着从单模态感知向对社会、物理和内在状态的综合理解的转变。更高的感应精度使机器人不仅能测量接触,还能解读犹豫、紧张或不适,并以灵敏度和自适应控制做出反应,这些是后续章节中讨论的无缝多模态框架的关键基础。

多模融合与表示学习
融合使分布式感官流能够转化为连贯、情境感知的控制。方法通常分为早期、晚期或混合融合。早期融合在输入阶段整合特征,支持语音-手势或面部-韵律对齐等同步线索。蔡等人的多模变换器14 展示了基于注意力的视觉、声学和文本信号早期整合。Xue 等人通过面部标志和语音特征的残差耦合扩展 了这一方法,提高了光照变化下的稳健性,而 Hu 等人则在提出MMSERNet57,这是一个多尺度融合网络,利用膨胀卷积和残差融合,将MFCC、频谱图和词汇特征合并用于情感识别。熔断输出表示为:

方程5

相比之下,晚期聚变结合了独立处理后的决策,对异步或噪声输入具有更高的容忍度。例如水下HRI58,59中凝视、惯性和运动信号的决策层组合。混合融合融合了这两种方法——将异质模态映射到共享嵌入空间,同时保持时间特异性。多模态脑机融合网络60在分类前对齐脑电图和视觉特征,而三维姿态估计的跨模态设计则融合惯性和单眼数据61。近期框架结合卷积层、递归层和变换器层,注意力对齐62,63,动态权重情境或任务相关性646566。早期、晚期和混合融合之间的选择并非一刀切。早期聚变通常在模态高度同步且噪声水平低时效果良好,使模型能够从一开始就捕捉丰富的跨模态关系。相比之下,晚期融合在混乱、异步的现实环境中通常更稳健,因为每种模态可以在合并决策前独立处理。混合方法现已出现在约43%的近期研究中,在情感和身体互动中占据了有用的中间地带,通过关注动态平衡的输入,尽管它们会带来额外的计算需求。最终,最佳策略取决于具体任务、噪声特性和硬件限制,这表明未来的系统可能会从实时切换聚变模式中受益。

模态之间的互补性也会因上下文而有很大差异。视觉与触觉结合在近距离物理任务中尤为有效,如抓取或物体切换,触觉反馈可以补偿视觉遮挡、光线变化或距离限制,并提供音频无法提供的精确力量和接触信息。相反,视觉与音频结合在远距离或社交环境中表现更好,比如在嘈杂环境中的情感识别或对话,因为韵律和语调带有意图,当视觉线索不可得或不可靠时会产生影响。

超越经典的早期、晚期和混合框架,深度学习实现了更细致的分类。基于注意力的融合使模型能够学习每个输入的动态模态重要性,有效创建任务和上下文特定的集成路径,而无需僵化的阶段边界。学习到的聚变策略更进一步,将整个聚变过程视为端到端的可微模块,让网络直接从数据中发现最优组合模式。这些发展将范式从预设规则转向完全数据驱动、自适应架构,更好地应对实时多模态HRI的复杂性。

视觉语言基础
大型语言模型的快速发展扩大了多模态推理的覆盖范围,尤其是通过视觉语言模型(VLMs)。这些架构将语言和视觉信息对齐,使机器人能够理解指令、感知场景并生成上下文敏感的动作。LXMERT64 和CLIP66 等基础框架建立了图像-文本对齐的联合嵌入。Flamingo65 引入了少射多模态推理,而Maggio的Clio39 则通过CLIP语义动态将指令与场景图链接。Gao等人开发了 基于多模态预测的预判规划LAMARS,Xie等人67 则应用时空卷积模型实现手势理解。Arenas 等人提出了基于提示的个性化互动风格定制68。这些系统允许像 “拿起红杯 ”这样的命令直接基于场景语义。

与空间推理的结合进一步增强了机器人导航和解读的能力。Wilson的LatentBKI38 基于体素空间映射,而Nwankwo等人则将大型语言模型与VLM推理融合, 在视觉不确定性下解释对话行为。基于事件的分割和异步感知方法提高了动态任务的效率。总体而言,VLMs作为象征性指令与具身理解之间的桥梁,为灵活互动提供了认知基础。

领域特定应用
在医疗和老年护理领域,多模态沟通能够实现安全、直观且富有同理心的帮助。核心功能——跌倒检测、日常活动监测、紧急响应——依赖姿势、声音和面部表情提示3.层级控制模型提升辅助手臂机器人的运动精度1,而本体感觉反馈指导协作穿衣助手69图8所示的对象切换体现了同步感知和运动协调70。通过LOVOT等系统研究的情感响应性,有助于增强用户信任,但也引发了关于过度依赖的伦理问题。

社交机器人需要流畅的多模态响应能力,以维持家庭和公共环境中的同理心与信任。图9概述了典型架构,整合了感知、规划和社会情感推理层。与感知集成的大型语言模型允许开放式对话,并由目光和声调调制。儿科研究显示,表达性动作和韵律能减轻儿童的焦虑,71,而调查强调非语言行为是参与度的决定因素。主动模型如RoboAgent37和次先验引导的蚁群优化72,使共同目标的探索成为可能。能够表达内部状态(准备好、困惑)的系统73增强了透明度和协调性,而适应性社会代理则调节群体协作74,75

教育机器人:在教育领域,多模态HRI通过利用身体和社会信号来促进动机和学习。结合手势、面部表情和口头提示,提升了可及性和参与度,达到697778。情绪适应性支持年轻学习者:感知情感状态并调节言语和动作的系统提升注意力和词汇量 7,79。与虚拟现实的集成提升了沉浸感,但对可扩展性提出了挑战。这些系统共同作用,使机器人的角色从教师转变为情感敏锐的协作者。

个性化确保了多模态系统的相关性和信任度 71,81,82。伦理个性化平衡自主与同理心,通过参与式反馈定制回应。Maaz等人展示了以面部和认知线索为指导的情感辅导,而Gomez-Izquierdo等人则建模了用户对同步行为的偏好。个性化适应可以形式化为:

方程6

其中 wi 是学习偏好权重。如RFIS等实现了边缘85的实时人物重新识别和手势识别,而本体感觉触摸界面10 则实现直观的物理交流。社会感知效应进一步调节个性化结果,叙述者身份改变用户反应时间和话长86。个性化因此将用户从被动接受者转变为共同设计者,通过相互适应塑造互动。

虽然大部分被评审的工作仍处于研究原型阶段,但若干多模态HRI技术已从研究原型转向商业或工业应用。例如,SoftBank的Pepper机器人集成了语音、手势和面部表情识别,用于零售和教育环境中的客户服务和教育。丰田的人类支持机器人采用视觉与手势融合技术,用于家庭和医疗机构的辅助任务88。这些商业化实现通常简化融合策略,通常采用基于规则的后期或混合方法,以确保可靠性和低成本,凸显了先进学术模型与可扩展工业解决方案之间持续存在的差距。要弥合这一差距,需要更加重视边缘部署和严格的实际验证。

人力资源信息体系中无缝沟通的挑战
尽管多模态传感和聚变技术取得了进步,但在受控环境之外维持无缝的人机通信仍然困难重重。在实验室中表现出色的模型,往往会在噪声、延迟、遮挡、意图转移或资源限制下退化。文献汇聚于六个交织的障碍:视觉-语言整合、实时同步、多模态鲁棒性、语义精确度、数据集覆盖率和部署约束。

视觉语言集成
视觉理解支撑着扎实的语言和行动。基础步骤通过无手动初始化的视觉-惯性SLAM改善空间一致性和抽象,89,重新识别及传感器融合实现闭塞鲁棒跟踪,16,车道图预测90,半监督分割(将标签与导航工具对齐),以及利用SLAM和大规模分割实现可穿越性的自我中心视频26.不确定性感知映射依然是核心:uPLAM 将概率定位与动态场景的全景分割融合,而 Clio 则自适应构建基于 CLIP 的层级三维场景图,以实现任务敏感语义30。基础化方法从结构化描述和感知API92,93发展到多模编码器和解码器94,95

开放环境中的指令整合了感知和推理。RobotGPT35 和 GroundingGPT36 通过结合视觉-语言推理解释命令;SayPlan、LFG和LLM-Planner将导航和规划对齐到基础语言3444。为减少幻觉并维护语义一致性,GLAM和Vtimellm引入了对齐目标96,97,自适应框架验证LLM输出与感知结果的验证。时序关键地影响可读性:优化的手势时机提升了可预测性9;强化学习减少了情感管道中的视听滞后2;手势同步会使感知流畅度提升100;并回顾整合LSTM、DTW和GAN工具以实现对齐入门。总体而言,无缝性要求在感知、融合和响应之间建立一个延迟感知的环路,其中拟态30和小脑启发的预测102对应坐标时间,如图10中的系统级计时环所示。

跨模态的实时感知
流利度依赖于异质流间端到端的有界延迟。TACTO提供低延迟的高分辨率触觉反馈,实现响应式操作。如图11所示,肌腱驱动的手通过事件视觉和轻量级推理103实现快速互动游戏。对于视觉-语言-动作,将CLIP与GraspNet结合可加速104级杂波中的抓取。变压器支持快速社交触觉手势分类11。边缘优化的视听模型维持亚秒推断24。精准的头部动作时机提升了105级的参与度。这些结果共同主张同步融合、根据模态调整缓冲政策以及轻量化关注以保持时间共适应。可接受的延迟因任务领域而异。在社交对话或情感识别中,200–300毫秒以下的延迟保持感知流畅性和自然互动。辅助任务如物体交接或坠落检测需要更严格的约束(50–150毫秒),以确保安全和响应性。远程操作或协作操作通常需要低于100毫秒的延迟,以防止操作员迷失方向或晕动症,而导航或监控应用则能承受300–500毫秒而不产生致命影响。

时间和语义处理挑战
错位和延迟会削弱信任和任务效率,尤其是在分布式遥控操作员-机器人-人类系统中106。感知和界面策略帮助用户容忍延迟:身体手势和非词汇填充107,视觉叠加和自适应线索 108,109,110,111对照级预测缩短了反应间隙102。并行对话管道与填充词生成、语音合成和提示编辑重叠,以减少感知到的延迟,如图112图12所示。系统研究分解捕获、编码/解码、网络、决策和执行的累计延迟113。如图13所示,延迟通过传感器捕获、视频编码与解码、网络传输、操作员处理和车辆驱动引入,形成复杂的双向反馈回路。Syntalos为闭环实验提供毫秒同步114。在情感交换中,实时面部模仿增强了同步性23。远程手术等延迟敏感领域表明,将触觉定位以抵消延迟视力,有助于精确性和响应性115。如图14所示,锚定触觉反馈带来了更好的性能和更强的响应感。

细致效应和意图识别依然充满挑战。微表情、韵律、凝视和预期动作通常短暂且异步地发生。情绪化会产生与用户状态116相符的预期面部表情。仅凭肢体语言就能传达意图,而面部或声音无法察觉时,117。基于胡椒的多模态显示结合了语言分类、富有表现力的手势和表情符号,实现情感同步118。在线强化学习加强面部和语音流的融合2,而轻量级模仿支持边缘部署30。开放性问题包括群体效应、文化差异和时间效应漂移。

开放领域的泛化也有限。来自人类反馈的强化学习(RLHF)在分布外输入下表现出稀疏的奖励和脆弱性119。RoboAgent 将空间推理与跨任务传输的语言基础相结合29。通过无动作数据(RAD)推理利用被动视频和语言实现零拍摄能力,无需手动标签120。感知者-演员为操作不熟悉物品的对象属性建立基础121。RobotGPT和GroundingGPT中感知与语义的持续对齐提升了自适应推理能力,但仍面临实时反馈挑战35,36

多模态的鲁棒性与环境变异性
鲁棒性必须涵盖信号完整性和行为一致性。SimuMuHRI 注入特定模态的噪声和中撤,以测试韧性122。物理接地结构光仿真提升了RGB-D在光照和遮挡下的可靠性123,124。延迟-触觉耦合揭示了远程操作中的灵敏度125。安全关键能源系统的冗余和热韧性原理为容错HRI126,127提供了参考。

行为一致性同样重要。声音与外观不匹配降低信任度128,而不稳定但正确的动作削弱合作度129。基于观察者的自适应力控制和稳健的交互控制器在结构性和非结构性不确定性下都能维持稳定130,131。数据集覆盖率也限制了进展。多机器人感知数据集——OPV2V132、CoPeD133、CSE134 和 AgiBot World Colosseo55——扩展了跨模拟和现场的协作感知。AV-HRI 资源——CHiME-5135 及其后续的 CHiME-8 挑战136、AVA-ActiveSpeaker45、AFFECT-HRI5 和 SAVEn-Vid46——支持了 ASR、说话者活动、情感和长上下文指令跟随。大规模社交基准——HumorHRI47、THÖR-MAGNI137、RW4T138和InViG139——针对幽默、导航、团队合作和互动接地。尽管数据广度较广,许多数据集仍是特定领域或脚本化的,时间深度有限,用于评估无缝性,如表3所示。

无缝性的评估
传统指标如准确性和延迟无法完全涵盖共适应、相互预测或社交流畅度。新评估者将情境连贯性与协作评分为140,整合用户反馈和情境信号141,并为物理HRI增加了可预测性、协调性和舒适度,达到84。团队框架量化共享预期74,而数字孪生则跟踪信任校准和团队流畅度142。一个融合时间同步、情感对齐和以用户为中心的流利度的统一基准仍是一个开放的需求。

多模态HRI评估的标准化努力仍然有限且零散。诸如CHiME Challenges135,136等重要举措,在视听语音识别方面取得了先进基准,尤其是在噪声鲁棒性方面。THÖR-MAGNI137和RW4T138等数据集为动作捕捉和组队行为提供共享资源。然而,目前尚无广泛采用的跨模态时间同步、交互流畅性或情感对齐的统一协议,涵盖不同模态和领域的跨模态。缺乏标准化指标持续阻碍了可重复性和可比性,凸显了社区驱动基准的必要性。

从实验室到实际部署
由于感官不规则、意图转移和计算瓶颈,在非结构化环境中表现常常下降143。这种性能下降凸显了实验室与现实环境之间持续存在的鸿沟。在受控环境中,混合型和基于注意力的融合表现出色,能在物体操作或场景理解等任务中提供高准确性和低延迟。然而,现实中的部署却讲述了不同的故事。老年护理中的辅助机器人、家庭中的陪伴系统以及教室中的教育工具,经常面临噪音、遮挡、光线变化以及不可预测的用户行为,这些都会削弱效果。晚期聚变方法在这种变化和异步条件下往往更可靠,而混合模型尽管在情感和情境适应方面有优势,但可能受到边缘设备的计算需求限制。许多成功的现场实施仍包含更简单的冗余或基于规则的可靠性保障,这凸显了从有前景的实验室演示到强劲的日常性能仍是一项艰巨的挑战。生态有效性的测试对于识别哪些技术在受控实验之外真正成功至关重要。自适应强力控制器在干扰131中保持力量精度。LLM驱动的协作规划随着用户意图的发展而更新目标,144。视觉叠加和延迟感知反馈帮助在链路劣化下保持操作员的感知107,109。轻量级监控与LoRa和数字阴影支持低带宽场域的监控145。空间机器人的经验强调,自主性必须与人类认知在不确定性和延迟条件下共同进化。

资源限制决定可行性。基于声音的情感和触控识别在低功耗平台的1MB和0.7 GFLOPs以下运行。增加社交功能可能提升存在感,但当延迟增加时,存在过载的风险147。调度和功能选择必须在认知需求与连续性之间取得平衡,148。延迟缓解涵盖了感知、控制和网络,正如113条所组织的。用户通常更倾向于透明、稳定的交互而非最大化任务效率,这进一步强调无缝HRI必须将技术能力与人类舒适度并列优先考虑149,151。在不同领域,现实世界的部署表现出明显偏好:社交和教育应用通常依赖视觉-音频融合进行情感对话,而辅助和协作任务则偏好视觉-触觉结合,晚期或早期融合以实现精准的物理互动。这些模式与总结策略一致——优先采用晚融合以增强变量环境的稳健性,采用混合/注意力基础以实现更丰富的情境适应——尽管为了可靠性而简化仍属常见做法。

访问受限。请登录或开始试用以查看此内容。

结论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本评测存在若干局限。将搜索限制为Web of Science核心收藏中的英语出版物,可能引入了语言偏见,并排除了相关的非英语研究。关注2015年至2025年的同行评审文章也可能反映发表偏见,可能忽视了预印本、灰色文献或新兴未发表成果。对148篇论文的人工筛选虽然遵循明确标准,但不可避免地涉及一定的主观性。最后,趋势的主题解读反映了我们在快速发展领域的视角。

尽管存在这些局限,综述指出推进无缝多模态HRI的优先事项明确。实时同步和非结构化环境中的稳健性仍是最关键的挑战,因为它们直接影响部署的可靠性和用户信任。展望未来,该领域应优先考虑三个相互关联的领域:基于噪声和同步水平动态选择策略的情境自适应融合策略;时间对齐、跨模态延迟和交互流畅度的标准化基准测试;以及突破性方法,如边缘优化的多模变换器或持续学习,实现长期适应而无需完全重新训练。整合轻量级大型语言模型进行预期意图预测和触觉-视觉共适应,有望进一步加快进展。

无缝沟通最终依赖于整合感知、推理和适应行为。尽管多模态融合、视觉语言基础和情感建模的进步提升了机器人解读人类意图和自然...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明他们没有利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该工作得到了马来西亚理科大学的桥梁资助,项目编号:R501-LR-RND003-0000001342-00000。

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

Multimodal Human RobotHuman Robot CommunicationHuman Computer InteractionFusion StrategiesSystem ArchitecturesReal Time ProcessingSemantic AlignmentAdaptive FusionContinual LearningSocially Assistive Robots

相关文章