本研究提出了基于动态时间扭曲(DTW)的层级对齐机制,结合在线适应和注意力驱动的多模态融合,实现了可靠的长期意图预测和任务跟踪。轻量级的可解释性模块提升了可解释性,促进了人机协作的信任。该方法可推广到机器人和虚拟交互系统。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| RGB-D摄像头(英特尔RealSense D435) | 英特尔公司 | D435 | 深度分辨率:1280×720像素 @ 30帧每秒;RGB 分辨率 1920 及以上;1080 px @ 30 fps;用于捕捉用户姿势、身体动作和空间上下文 |
| 定向麦克风 | 通用/多供应商 | 无 | 宽带降噪麦克风(16 kHz及无阻拦截;44.1 kHz);用于收集口头指令 |
| BlazePose(预训练模型) | 谷歌 | https://developers.google.com/mediapipe/solutions/vision/pose | 具有33个关键点的姿态估计模型;实时人体姿态提取 |
| OpenPose(预训练模型) | 卡内基梅隆大学感知计算实验室 | https://github.com/CMU-Perceptual-Computing-Lab/openpose | 用于提取运动轨迹的多人姿态估计框架 |
| DeepSpeech ASR 引擎 | Mozilla | v0.9.3 | 预训练自动语音识别模型用于语音转文本转录 |
| wav2vec 2.0 ASR 发动机 | 元人工智能 | https://github.com/facebookresearch/fairseq | 实时语音处理的自监督语音表示模型 |
| 基于变换器的工作预测模型(DLinear / Seq2Seq) | 自定义实现 | 无 | 关注短期动作预测的时序编码-解码架构 |
| 动态时间扭曲(DTW)模块 | 自定义/基于科学 | https://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.distance.cdist.html | 用于将用户操作与预定义任务图匹配的软对齐算法 |
| 基于注意力的多模聚变网络 | 自定义实现 | 无 | 融合视觉与语音输入的信心加权注意力机制 |
| 在线改编模块(基于LoRA / 渐变) | 自定义实现 | https://github.com/microsoft/LoRA | 轻量级、参数高效微调以适应用户行为 |
| 可解释性模块(基于规则+注意力映射) | 自定义实现 | 无 | 通过规则和注意力可视化提供可解释的决策理由 |
| KINOVA第三代机械臂 | KINOVA机器人 | 第三代 | 7自由度机器人机械手,集成扭矩传感器;用于协作玩具车组装 |
| 协作组装仿真环境 | 自定义环境 | 无 | 用于多模态协作基准测试的真实玩具车组装装置 |
| 评估指标(TCT、HIPA、MFE、延迟、ERR、USS、ISI) | 自定义定义 | 无 | 定量且以用户为中心的指标,用于评估协作效率、准确性和信任度 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可