方法文章

人类多指抓握过程中手与物体接触区域的估计

3.2K 次观看

DOI:

10.3791/64877

2023年4月21日

本文内容

摘要

当我们抓握物体时,手指和手掌的多个区域通常会与物体表面接触。重建这些接触区域具有挑战性。本文介绍了一种方法,通过结合基于标记的运动捕捉与现有的基于深度学习的手部网格重建技术,来近似估计接触区域。

摘要

为了成功抓取物体,我们必须选择手在物体表面的合适接触区域。然而,识别这些区域具有挑战性。本文描述了一种从基于标记的追踪数据中估计接触区域的工作流程。参与者抓取真实物体,同时我们追踪物体和手(包括手指关节)的三维位置。首先,我们根据位于手背上的若干追踪标记确定关节的欧拉角。然后,我们采用先进的手部网格重建算法,生成参与者手部在当前姿态和三维位置下的网格模型。

使用通过3D打印或3D扫描获得的物体(因此既具有实物形式,也具有网格数据),可实现手部与物体网格的共配准。进而,可通过计算手部网格与共配准的三维物体网格之间的交集,来估算近似的接触区域。该方法可用于估计人类在多种条件下抓握物体的位置和方式。因此,该方法可能对研究视觉与触觉感知、运动控制、虚拟与增强现实中的人机交互以及机器人学的研究人员具有重要意义。

引言

抓握和操控物体的能力是人类改造环境以满足自身需求的关键能力。然而,有效控制多关节的手部是一项具有挑战性的任务,需要一个复杂的控制系统。该运动控制系统由多种形式的感觉输入所引导,其中视觉最为重要。通过视觉,个体能够识别环境中的物体,估计其位置和物理特性,进而轻松地伸手、抓取并操控这些物体。理解将视网膜输入与控制手部的运动指令相联系的这一复杂系统,是感觉运动神经科学面临的核心挑战之一。为了建模、预测并深入理解该系统的工作机制,我们必须首先能够对其进行细致的研究。这需要对视觉输入和手部运动输出进行高保真度的测量。

以往的运动追踪技术对人类抓握行为的研究施加了诸多限制。例如,需要将电缆连接到受试者手部的系统1,2往往会限制手指运动的范围,可能改变抓握动作本身或测量结果。尽管存在这些局限性,先前的研究仍成功识别出若干影响视觉引导抓握的因素。其中一些因素包括物体形状3,4,5,6、表面粗糙度7,8,9,或物体相对于手的朝向4,8,10。然而,为了克服以往的技术限制,大多数先前研究采用了简单的刺激材料和高度受限的任务,因而主要聚焦于个别因素3,4,6,7,10、双指精确抓握3,4,6,9,11,12,13,14,15,16,17,18、单一物体19,或非常简单的二维形状20,21。此前的研究发现能否推广至这些简化且人工化的实验室条件之外,尚不明确。此外,对手与物体接触的测量通常被简化为对指端接触点的估计22。这种简化可能适用于仅指尖与物体接触的一小类抓握行为。但在大多数真实世界的抓握中,手指和手掌的大范围区域均会与物体接触。进一步地,最近一项研究23利用触觉手套表明,物体可通过其表面与手部的接触方式被识别。这凸显了研究手与被抓握物体之间广泛接触区域的重要性,而不仅仅是物体与指尖之间的接触点22

近年来,运动捕捉和三维手部建模技术的进步使我们得以突破以往的局限,全面深入地研究抓握动作的复杂性。基于被动标记点的运动追踪技术现已能够使用毫米级的小型标记点,将其附着于受试者手背,以追踪关节运动24。此外,针对被动标记点系统的自动标记点识别算法已具备足够的鲁棒性,几乎无需对标记点数据进行大量手动后期处理25,26,27。无标记点解决方案在视频中追踪动物身体部位方面也达到了令人印象深刻的性能水平28。因此,这些运动追踪方法最终实现了对复杂多指手部运动的可靠且非侵入式测量24。此类测量可提供关节运动学信息,并使我们能够估算手部与物体之间的接触点。此外,近年来计算机视觉领域一直在致力于构建能够复制手部在抓握物体过程中,甚至在手部各部分相互接触时软组织形变的人手模型29,30,31,32。此类三维网格重建可基于多种类型的数据生成,例如视频影像33,34、骨骼关节(来自基于标记点35或无标记点追踪36)以及深度图像37。该领域的一项关键进展由Romero等人38提出,他们基于31名受试者在不同姿势下的1000多次手部扫描数据,构建了一个参数化手部模型(MANO)。该模型包含手部姿态和形状的参数,有助于从不同数据源回归出完整的手部重建结果。近期的DeepHandMesh29方法在此基础上进一步发展,通过深度学习构建参数化模型,并引入穿透避免机制,更准确地模拟手部各部分之间的物理交互。因此,通过将此类手部网格重建与三维追踪的物体网格相结合,现在不仅可以估算物体表面的接触区域32,还能估算手部表面的接触区域。

本文提出了一种将高保真度的物体与手部关节三维追踪技术与新型手部网格重建算法相结合的工作流程。该方法可生成手部与物体接触表面的详细图谱。这些测量数据将有助于感觉运动神经科学家拓展对人类视觉引导抓取行为的理论认知。此外,该方法也可能对相关领域的研究人员具有应用价值。例如,人因工程学研究人员可利用该方法在虚拟现实和增强现实中构建更优的人机交互系统18。对人类抓取行为的高保真度测量还可协助机器人研究人员基于交互感知原理,设计受人类启发的机器人抓取系统39,40,41,42,43。因此,我们期望该方法能够推动抓取行为研究从对高度受限任务的简略描述,发展为对复杂物体和真实世界任务中自然抓取行为的全面表征,从而促进神经科学与工程学领域的研究进展。整体研究方法如图1所示。

动作捕捉系统设置示意图;三维建模、手部标记点、网格计算、接触估计。
图1:所提出方法的关键步骤。A)动作捕捉相机从多个角度拍摄工作台。(B)刺激物体由三角网格模型通过三维打印制成。(C)四个球形反光标记点被粘贴在真实物体表面。一个半自动化的流程在网格模型表面识别出对应的四个点。该对应关系使我们能够对网格模型进行旋转和平移,以匹配真实物体在三维空间中的追踪位置。(D)使用双面胶将反光标记点贴附在受试者手背的不同解剖标志位置。(E)动作捕捉系统在一个试验过程中获取被追踪物体和手部标记点在三维空间中的运动轨迹。(F)使用三维计算机图形软件构建受试者特异性的手部骨骼模型。随后通过逆向运动学方法,估算实验中每次试验每一帧的骨骼关节姿态。(G)将关节姿态输入至DeepHandMesh29的改进版本,输出当前三维姿态和位置下的估计手部三维网格模型。(H)最后,我们利用网格交集计算手与物体之间的接触区域。请点击此处查看该图的放大版本。

方案

在开始实验之前,参与者必须根据机构指南和《赫尔辛基宣言》签署知情同意书。本文所述所有方案均已获得吉森尤斯图斯-李比希大学当地伦理委员会(LEK-FB06)的批准。

1. 安装所有必要的软件

  1. 在数据与代码仓库中下载项目代码库。
  2. 安装材料表中列出的软件(注意软件版本,并按照链接中的说明进行购买和安装)。
  3. 在数据与代码仓库中打开命令窗口,运行以下命令:
    conda env create -f environment.yml
  4. 根据 https://github.com/facebookresearch/DeepHandMesh 提供的说明,下载并安装预训练的 DeepHandMesh29 实例。
    1. 将 DeepHandMesh 放置在数据与代码仓库的“deephandmesh”文件夹中。用数据与代码仓库中包含的 model.py 文件替换“main/model.py”文件。

2. 准备动作捕捉系统

  1. 将工作台放置在由环绕工作区的支架上布置的运动追踪相机从多个角度成像的追踪范围内(图1A)。通过在每个标记物底部粘贴双面胶带,制备反光标记物。
  2. 以管理员身份运行 Qualisys Track Manager (QTM)。
    注意:必须以管理员身份运行 QTM,以便 Python SDK 能够控制 QTM 界面。建议始终以管理员身份运行 QTM。

3. 校准相机

  1. 将L形校准物体放置在跟踪范围内。
  2. QTM 中,单击 Capture 菜单中的 Calibrate ,或按下 Capture 工具栏中的 魔杖图标。等待 校准窗口 打开。选择 校准持续时间,然后点击 OK
  3. 在整段校准时间内,将 校准魔杖 在跟踪范围内挥动。按下 Export 按钮,并指定一个文件路径以将校准数据导出为文本文件。点击 OK 以确认校准。

4. 创建刺激对象

  1. 以多边形网格的形式构建一个虚拟的三维对象模型。使用3D打印机构建该对象模型的实体复制品。
    ​注意:步骤1.1中的数据存储库提供了STL和Wavefront OBJ文件格式的示例对象。STL格式的对象是流形的,可直接用于3D打印。

5. 准备刺激物体

  1. 在真实物体表面粘贴四个非共面反射标记点。将物体置于追踪范围内。
  2. 在项目仓库中运行 Python 脚本“Acquire_Object.py”。按照脚本提示,对物体标记点的三维位置进行持续 1 秒的采集。
  3. 选中刚体的所有标记点。右键点击并选择 定义刚体 (6DOF) | 当前帧。输入刚体名称,然后点击 确定
  4. 文件 菜单中,选择 导出 | 导出为 TSV。在新窗口的 数据类型 设置中,勾选 3D6D骨骼 选项;在 常规 设置中勾选所有选项。点击 确定,然后点击 保存

6. 刺激物体的真实图像与网格模型配准

  1. 打开 Blender,切换到 脚本编写 工作区。打开文件“Object_CoRegistration.py”,然后点击 运行。切换到 布局 工作区,按下 n 键以显示侧边栏。在侧边栏中,进入 自定义 选项卡。
  2. 选择要进行配准的 .obj 文件,然后点击 加载对象 按钮。
  3. 选择在步骤 3.3 中导出的轨迹文件,并以分号分隔的形式输入附着在刚性物体上的标记点名称。在 标记点表头 中,指定轨迹文件中包含数据列名称的那一行(行号从 0 开始计数)。
  4. 选择带有 6D 后缀的相应刚体文件,并输入在步骤 4.1 中定义的刚体名称。在 6D 表头 中,指定刚体文件中包含数据列名称的那一行。
  5. 点击 加载标记点。平移和/或旋转 标记点 对象和/或 对象 对象以进行对齐。指定一个网格输出文件,然后点击 运行配准。程序将输出一个包含已配准刺激网格的 .obj 文件。

7. 在手部设置标记点

  1. 使用双面胶带将24个球形反射标记点贴附在受试者手部的不同解剖标志位置上。
    注意:标记点的具体定位如图2所示。
    1. 将标记点分别置于食指、中指、无名指和小指的指尖、远端指间关节、近端指间关节以及掌指关节的顶部中央位置。
    2. 对于拇指,分别在指尖和基底腕掌关节处各放置一个标记点,并在掌指关节和指间关节处各放置一对标记点。
      ​注意:这些成对的标记点需沿拇指主轴垂直方向相反放置,以用于估算拇指的空间方位。
    3. 最后,在腕关节中心和舟-大多角-小多角关节处放置标记点。

右手运动捕捉设置示意图;用于生物力学中关节追踪的标记点标注。
图 2:受试者手部的标记点放置。 缩写:RH = 右手。 请点击此处查看此图的放大版本。

8. 获取单次试验数据

  1. 要求受试者将手平放在工作台上,掌心朝下,并闭上眼睛。将刺激物体放置在受试者前方的工作台上。
  2. 在 QTM 运行的同时,在项目仓库中执行 Python 脚本“Single_Trial_Acquisition.py”。按照脚本提供的指示,采集受试者抓取刺激物体的一次试验数据。
    注意:该脚本将生成一个听觉提示,提示受试者睁开眼睛并执行抓取动作。在我们的演示中,任务是伸手抓取目标物体,将其垂直提起约 10 cm,放回原位,并将手返回起始位置。

9. 标记物的标记

  1. 在 QTM 中,将单个标记轨迹从未识别轨迹拖放到已标记轨迹,并根据图2中的命名规范对其进行标注。
  2. 选择所有附着在手部的标记,右键单击并选择根据所选内容生成 AIM 模型。在新窗口中,选择基于现有 AIM 模型的标记连接创建新模型,然后点击下一步按钮。
  3. 选择RH_FH模型定义,然后点击打开。点击下一步,输入 AIM 模型的名称,然后点击确定。最后,点击完成,为该受试者的手部创建一个 AIM 模型,该模型将用于自动识别同一位受试者后续试验中的标记点。

10. 为参与者创建个性化的骨骼定义

  1. QTM,导航至 播放 菜单,然后选择 实时输出演示.
  2. 开放 Maya. 导航至 QTM Connect 架子,并按压 连接至 QTM 图标。在新窗口中,检查 标记物,然后按压 连接现在,按下 播放 图标在 QTM Connect 架子
  3. 按住 Shift 键并选中所有手形标记,然后按下 清洗定位器 图标。选择 洗涤 手部标记,并按压 Ctrl + G。这将产生一个 组节点. 命名该组 标记物.
  4. 选择所有手部标记点。在 修改 菜单,点击 搜索并替换名称. 搜索 RH_ 前缀,并删除标记的前缀。
  5. 按压 导入求解器 图标在 QTM Connect 架子。加载骨骼定义文件“RH_FH.xml”。
  6. Windows 菜单,导航至 总编辑 | 名称空间编辑器在新窗口中,单击 :(根),然后按压 创建一个新命名空间, RH. 点击 RH 命名空间,按压 ,并命名新的命名空间 模型姿态.
  7. 选择所有标记,然后单击 RH 命名空间,然后按 添加所选 添加标记物至 RH 命名空间
  8. 选择骨骼,单击 模型姿态 命名空间,然后按 添加所选 将骨骼添加到 模型姿态 命名空间
  9. 旋转、平移和缩放骨骼模型以匹配标记数据。接着,针对每个骨骼关节,单独操作:按住 Shift 键并选中该骨骼关节及其关联的标记,然后按下 添加附件 图标。最后,按下 导出求解器 将新骨骼定义导出为 XML 文件的图标,该文件可在 QTM 中加载(见下一步)。
    注意:此步骤并非绝对必要,但有助于提高骨骼拟合与标记点数据的准确性。有关更多信息,请参阅 https://github.com/qualisys/QTM-Connect-For-Maya 上的 QSolverQuickstartGuide。

11. 重建关节骨骼姿态

  1. QTM 中,通过点击 齿轮 图标打开项目设置。在侧边栏中,导航至 骨骼求解器,然后点击 加载 以选择一个骨骼定义文件。将 缩放因子调整为 100%,然后点击 应用
  2. 导航至 TSV 导出,在 数据类型设置中勾选 3D6D骨骼 选项。在 常规 设置中勾选所有选项。点击 应用,然后关闭项目设置。
  3. 点击 重新处理图标,勾选 求解骨骼 导出为 TSV 文件,然后点击 确定

12. 生成手部网格重建

  1. 在项目仓库中打开命令窗口,通过执行以下命令激活 conda 环境:
    conda activate contact-regions
  2. 然后执行以下命令,并按照脚本提供的说明操作,为每次试验的每一帧生成重建当前手部姿态的手部网格。
    python Hand_Mesh_Reconstruction.py --gpu 0 --test_epoch 4
    ​注意:这些网格重建是使用开源且预训练的手部网格生成工具 DeepHandMesh 的修改版本自动完成的29

13. 生成手部与物体接触区域的估计

  1. 在项目仓库中打开命令窗口,执行以下命令,并按照脚本提供的说明操作,通过计算手部与物体网格的交集来生成手部与物体接触区域的估计。
    blender --background --python "Contact_Region_Estimation.py"

结果

所提出方法的首要要求是具备一个能够精确定位三维物体和手部位置的系统。具体设置如图1A所示,采用由动作捕捉公司Qualisys生产的硬件和软件。我们在一个跟踪空间(100 cm × 100 cm × 100 cm)内设置一个工作台,该空间由围绕工作区域的立方体框架上的八个跟踪相机和六个视频相机从多个角度进行成像。跟踪相机以每秒180帧的速度对跟踪空间内反光标记点进行三维定位,空间分辨率达亚毫米级。我们使用直径为4 mm的反光标记点,并通过对皮肤无害的双面胶带将其粘附在物体和手部上。三维标记点的位置数据由动作捕捉软件进行处理。讨论部分还回顾了可与本方法结合使用的其他动作捕捉系统。

为了获得被抓取和操作的真实物体的精确三维重建,我们提出两种方案。第一种方案(也是本文所采用的方案)是从多边形网格形式的虚拟三维物体模型开始。此类三维模型可使用适当的软件(例如 Blender 3D44)构建,然后通过三维打印制成实物(图1B)。第二种方案是选取一个已有的真实三维物体,利用三维扫描技术构建该物体的网格模型复制品。无论采用哪种策略,最终目标都是同时获得一个真实的三维物体及其对应的虚拟三维物体网格模型。需要注意的是,本文所述方法仅适用于刚性(即不可变形)物体。

一旦物体的三维表面以网格模型的形式呈现,就必须对其进行位置追踪和共注册(图1C)。为此,需在真实物体表面附着四个非共面的反射标记点,并将物体置于追踪范围内。随后短暂采集这些标记点的三维位置。该采集过程用于建立真实标记点与物体网格模型上四个顶点之间的一一对应关系。此步骤通过一段使用Blender的Python API编写的简易自定义软件流程实现。在Blender的视口中,程序将虚拟物体与标记点位置一同显示,其中标记点被表示为一个由多个球体组成的单一网格对象,每个球体对应一个标记点。用户可旋转和平移虚拟物体和/或标记点,使其与真实物体上的实际标记点对齐。程序将记录所施加的旋转和平移操作,并据此计算出一个统一的旋转变换和平移变换,最终应用于原始物体网格模型,从而获得与QTM中刚体定义相共注册的物体网格模型。

建立对应关系后,当真实物体在跟踪范围内移动时,可通过计算被跟踪标记点与四个对应的网格顶点之间的旋转和平移变换,将虚拟物体放置到新的位置。为了记录抓握动作的动态过程,则使用双面胶带在手部不同解剖标志位置共粘贴24个球形反光标记点(图1D图2)。

在试验开始时(图1E),参与者将手平放在工作台上,掌心朝下,并闭上眼睛。实验人员将一个目标物体放置在参与者前方的工作台上。随后,一个听觉提示信号指示参与者睁开眼睛并执行抓取动作。在我们的演示中,任务是伸手抓取目标物体,将其垂直提起约10 cm,放回原位,然后将手返回起始位置。实验由一段使用 Python 3.7 编写的脚本控制。在每次试验中,该脚本选择当前实验条件设置并告知实验人员(例如物体的身份和位置)。该脚本还控制试验的时间进程,包括听觉提示以及运动捕捉记录的开始与停止。

肢体不仅由其在三维空间中的位置决定,还由其姿态决定。因此,为了获得人手执行真实抓握动作的完整三维重建,我们不仅需要获取每个关节在三维空间中的位置,还需要获得每个关节相对于其父关节的相对姿态(平移和旋转)(图1F)。骨骼关节的位置和方向可以通过逆向运动学从标记点的位置推断得出。在此,我们采用QTM软件提供的骨骼求解器来实现这一过程。为了使求解器正常工作,我们必须首先提供一个骨骼定义,将每个关节的位置和方向与多个标记点的位置关联起来。因此,我们构建了骨骼定义,并使用Maya的QTM Connect插件将骨骼绑定与标记点数据连接。我们为每位参与者创建个性化的骨骼定义,以最大程度提高骨骼拟合与标记点数据的一致性。对于每位参与者,我们手动将手部骨骼模型拟合到一段动作捕捉数据的单帧图像中。在获得针对特定参与者的骨骼定义后,我们随后运行骨骼求解器,以估算实验中每次试验每一帧的骨骼关节姿态。

在实验的每一次试验的每一帧中,我们使用开源且预训练的手部网格生成工具 DeepHandMesh28图 1G)生成重建当前手部姿态的手部网格。DeepHandMesh 是一种深度编码器-解码器网络,可从图像中生成个性化的手部网格。首先,编码器估计图像中手部的姿态(即关节的欧拉角)。然后,将估计的手部姿态和一个个性化 ID 向量输入解码器,解码器据此估计一组对绑定模板网格的三项加性校正。最后,使用线性混合蒙皮技术,根据估计的手部姿态和校正项对模板网格进行形变。第一项校正是依赖于 ID 的骨骼校正,通过该校正调整骨骼绑定以纳入个体特定的关节位置。其余两项校正为网格校正,用于调整网格顶点以更准确地表示受试者的手部表面。其中一项网格校正是依赖于 ID 的网格校正,用于反映个体受试者手部的表面结构。最后一项网格校正则是依赖于姿态的顶点校正,用于反映由当前手部姿态引起的手部表面形变。

DeepHandMesh 使用 2D 关节关键点和场景深度图进行弱监督训练。在此,我们仅使用预训练的 DeepHandMesh 解码器来生成手部网格重建,并通过以下方式进行了修改(图 3)。首先,由于该网络未针对特定参与者进行训练,因此采用预训练模型提供的通用的、依赖于个体身份(ID)的网格校正方法(图 3A)。其次,利用 QTM 骨骼解算器(如上所述)推导出依赖于个体身份的骨骼校正参数(图 3B)。假设手部相对于骨骼长度呈比例缩放,且网格厚度通过由骨骼相对缩放因子推导出的系数进行均匀缩放,从而使网格更准确地逼近参与者的实际手部尺寸(图 3C)。该经过修改的网格连同当前的手部姿态(由标记点数据推导)以及腕部的 3D 位置和朝向,一并输入解码器。因此,解码器计算当前姿态依赖的校正量,应用所有校正项及旋转变换与平移变换,最终输出当前手部姿态的 3D 手部网格重建结果,其坐标系与 3D 跟踪物体网格的坐标系一致(图 3D)。

手部形态测量示意图;A,B,C,D;解剖学手部结构变异分析。
图 3:预训练 DeepHandMesh 解码器的修改。A)固定的、通用的个体身份依赖性网格校正。(B)通过第10步中的逆向运动学推导出的个体身份依赖性骨骼校正。(C)手部网格的大小按骨骼关节相同比例缩放。(D)当前手部姿态的最终三维手部网格重建。请点击此处查看该图的放大版本。

在重建参与者手部和被抓握物体的三维网格模型后,可通过计算手部与物体网格之间的交集来估计手-物体接触区域(图1H)。该方法基于以下假设:真实手部在与物体表面接触时会发生形变,这意味着骨骼可以比手部保持刚性时更接近表面,从而允许手部网格的部分区域穿过物体网格。因此,接触区域可近似为两个网格之间的重叠区域。

具体而言,为了计算这些重叠区域,我们将位于手部网格三维体积内的物体网格顶点定义为与手部接触的点。这些顶点通过标准的光线追踪方法45进行识别。对于物体网格的每个顶点,从该顶点向手部网格外部的任意一个三维点发射一条射线。然后评估该射线与构成手部表面的三角形之间的交点数量。如果交点数量为奇数,则该物体顶点位于手部网格内部;如果交点数量为偶数,则该物体顶点位于手部网格外部。因此,物体表面上的接触区域可近似表示为所有顶点均位于手部网格内部的三角形面的集合。我们可采用相同的逻辑,将位于物体网格三维体积内的手部网格顶点用于估计手部表面上的接触区域。值得注意的是,也可采用更先进的布尔网格运算方法31

视频1展示了一只手在抓取一个3D打印的猫形摆件时,手部、被追踪的关键点以及共同配准的网格模型并排同步运动的视频。而图4A则显示了在手与物体接触瞬间,抓取一个3D打印的牛角面包时的单帧图像,以及对应的手-物体网格重建结果(图4B)和在牛角面包表面估计的接触区域(图4C)。

手部抓握实验;静态平衡;物体上不同手指抓握方式的示意图;运动研究。
图 4:估计的手部与物体接触区域。A)在抓握过程中,从其中一个追踪相机视角观察到的手部与物体的追踪结果。(B)从与追踪相机相同视角渲染出的重建手部网格与追踪物体网格。(C)从多个视角观察到的物体表面的接触区域。请点击此处查看该图的放大版本。

视频 1:手部与物体的网格重建。 单次抓握过程中,从同一摄像机视角观察的手部、追踪标记点以及手部与物体网格重建的动态图,以 gif 动画形式展示。请点击此处下载该视频。

讨论

我们提出一种方法,用于估计多指抓握过程中手与物体接触区域的范围。由于目前尚无法实现对手部整个表面的完整追踪,我们建议采用一种手部网格重建方法,其姿态由手部稀疏的关键点确定。为了追踪这些稀疏关键点,本方案采用基于被动标记点追踪的研究级动作捕捉系统。当然,只要能提供足够精确的三维位置数据,其他动作捕捉系统也可与本方法结合使用。我们不建议使用主动标记点动作捕捉系统(例如曾广泛应用但已停产的Optotrak Certus),因为这类系统需要将电缆和/或电子设备连接到受试者手上,可能限制手部运动,或至少导致抓握动作不够自然,使受试者对其手部姿态产生更强的意识性注意。使用惯性测量单元的动作追踪手套也可能是一种选择,尽管这类系统存在漂移问题,可能限制手部活动,并且无法让手部表面与物体表面实现完全、直接的接触。商用无标记手部追踪解决方案(例如Leap Motion46,47,48)也具备可行性,但仅靠这些系统可能无法同步追踪物体位置。相较于研究级动作捕捉系统,最具前景的替代方案是开源的无标记追踪技术(例如Mathis等28提出的方法)。若结合多个共注册相机49使用,此类系统有望在无需标记点、手套或电缆的情况下,实现对手部关节位置和物体位置的三维追踪。然而,这些无标记方案以及本研究所采用的基于标记的系统,都可能因遮挡问题而出现数据丢失。

局限性与未来研究方向
由于通过该方法获得的手部重建结果并非完全准确,因此该方法在适用的实验类型上存在一定的局限性。手部网格重建结果与真实情况之间的偏差,将反映在估计的手/物体接触区域的偏差上。因此,若要将该方法用于获取绝对测量值,需先评估接触区域估计的准确性。然而,即使仅为近似估计,在被试内实验设计中仍可能具有应用价值,因为该方法的潜在偏差在同一位被试的不同实验条件下可能以相似的方式产生影响。因此,统计分析和推论应仅基于诸如不同条件下接触面积差异等指标,此时效应的方向将与对应的真实情况相关联。在未来的研究中,我们计划进一步验证该方法,例如通过将接触区域估计结果与覆盖有热致变色涂料的物体上的热指纹进行比较。

从数据采集到最终接触区域估计的大多数处理步骤均已实现完全自动化,因此对手-物接触区域估计的标准化流程具有重要意义。然而,仍需手动完成个体骨骼与追踪标记点3D位置的初始匹配,以获得每位参与者的骨骼定义。随着实验中参与者数量的增加,所需进行的手动匹配次数也随之增多,目前这一步骤是整个流程中最耗时的部分,且需要操作者对Autodesk Maya软件中的手动绑定有一定熟悉度。未来,我们计划通过引入自动骨骼校准程序来实现该步骤的自动化,从而避免人为因素对流程的影响。

本文所述的工作流程依赖于Qualisys硬件和软件(例如QTM骨骼求解器),这目前限制了该方法在不具备类似设备的实验室中的可及性。然而从原理上讲,该方法可适用于任何来源的运动捕捉数据。为了提高可及性,我们目前正在探索替代方案,以推广本工作流程,并减少其对特定硬件和软件许可的依赖。

该方法的另一个重要局限性在于,以目前的形式,它仅能应用于刚性(不可变形)物体。未来,可通过采用记录被抓取物体在变形过程中表面形状的方法来克服这一局限性。此外,由于该方法具有近似性,目前尚不适用于非常小或非常薄的物体。

综上所述,通过将先进的运动追踪技术与高保真度的手部表面建模相结合,我们提供了一种用于估计抓握和操作过程中手与物体接触区域的方法。在未来的研究中,我们计划应用该方法来探究和建模人类在视觉引导下的抓握行为16。我们还计划将这些工具与眼动追踪技术46, 50,51,52以及虚拟/增强现实系统53,54,55相结合,以研究在真实和虚拟的自然环境中视觉引导下手部与眼部运动的运动控制机制18,46,56,57。因此,本研究所提出的方法可能对从事触觉感知58、运动控制以及虚拟与增强现实中人机交互研究的科研人员具有重要意义。最后,对人体抓握能力的精确测量可为基于交互感知原理39,40,41,42,43的鲁棒性机器人系统设计提供参考,并可能在上肢假肢领域产生转化应用价值。

披露

作者声明不存在任何竞争利益。

致谢

本研究由德国研究基金会(Deutsche Forschungsgemeinschaft,DFG,项目编号:222641018-SFB/TRR 135 TP C1 和 IRTG-1901 "The Brain in Action")以及由黑森州高等教育、科学、研究与艺术部卓越计划资助的研究集群"The Adaptive Mind"提供经费支持。作者感谢Qualisys技术支持团队(包括Mathias Bankay和Jeffrey Thingvold)在方法开发过程中提供的帮助。作者还感谢Michaela Jeschke作为手部模型参与拍摄。所有用于重现本文所述方法及结果的数据和分析脚本均可在Zenodo上获取(doi: 10.5281/zenodo.7458911)。

材料

本文使用的材料清单
姓名公司目录编号评论
Anaconda Python 发行版 (Anaconda 5.3.1 或更高版本);https://repo.anaconda.com/archive/脚本和函数使用 Python 3.7 版本编写
Autodesk MayaAutodesk, Inc.Maya2022;https://www.autodesk.com/products/maya/overview三维计算机图形应用程序。  
Blender Blender Foundation Blender 2.92;https://download.blender.org/release/三维计算机图形应用程序。  
计算机工作站N/AN/A操作系统:Windows 10 或更高版本。
DeepHandMeshMeta Platforms, Inc. (Meta 开源项目)https://github.com/facebookresearch/DeepHandMesh预训练的手部网格生成工具。
Miqus M5Qualisys Abhttps://www.qualisys.com/cameras/miqus/ 被动标记点运动追踪相机(8 台)。
Miqus 视频相机Qualisys Abhttps://www.qualisys.com/cameras/miqus-video/彩色视频相机,与 Miquis M5 追踪相机同步(6 台)。
项目代码库 N/A数据与代码库 用于复现本项目的数据与代码。该代码库目前仍在建设中,但我们提供一个私有链接,供审稿人下载当前最新版本。最终版本将在论文被接收后公开发布。 
Python 3Python 软件基金会Python 版本 3.7Python3 及其相关内置库。
QTM Connect for MayaQualisys Abhttps://github.com/qualisys/QTM-Connect-For-Maya 将骨骼、刚体和标记点数据从 QTM 流式传输至 Maya
QTM Qualisys 跟踪管理器Qualisys AbQualisys Track Manager 2021.2;https://www.qualisys.com/software/qualisys-track-manager/ 动作捕捉软件
Python 的 Qualisys 软件开发工具包Qualisys Abhttps://github.com/qualisys/qualisys_python_sdk 实现 QTM 与 Python 之间的通信

参考文献

  1. Derzsi, Z., Volcic, R. MOTOM toolbox: MOtion Tracking via Optotrak and Matlab. Journal of Neuroscience Methods. 308, 129-134 (2018).
  2. Franz, V. H. Optotrak Toolbox. The Optotrak Toolbox: Control your Optotrak from within Matlab. , Available from: http://www.ecogsci.cs.uni-tuebingen.de/OptotrakToolbox/ (2004).
  3. Eloka, O., Franz, V. H. Effects of object shape on the visual guidance of action. Vision Research. 51 (8), 925-931 (2011).
  4. Lederman, S. J., Wing, A. M. Perceptual judgement, grasp point selection and object symmetry. Experimental Brain Research. 152 (2), 156-165 (2003).
  5. Schettino, L. F., Adamovich, S. V., Poizner, H. Effects of object shape and visual feedback on hand configuration during grasping. Experimental Brain Research. 151 (2), 158-166 (2003).
  6. Chen, Z., Saunders, J. A. Online processing of shape information for control of grasping. Experimental Brain Research. 233 (11), 3109-3124 (2015).
  7. Burstedt, M. K., Flanagan, J. R., Johansson, R. S. Control of grasp stability in humans under different frictional conditions during multidigit manipulation. Journal of Neurophysiology. 82 (5), 2393-2405 (1999).
  8. Paulun, V. C., Gegenfurtner, K. R., Goodale, M. A., Fleming, R. W. Effects of material properties and object orientation on precision grip kinematics. Experimental Brain Research. 234 (8), 2253-2265 (2016).
  9. Klein, L. K., Maiello, G., Fleming, R. W., Voudouris, D. Friction is preferred over grasp configuration in precision grip grasping. Journal of Neurophysiology. 125 (4), 1330-1338 (2021).
  10. Mamassian, P. Prehension of objects oriented in three-dimensional space. Experimental Brain Research. 114 (2), 235-245 (1997).
  11. Paulun, V. C., Kleinholdermann, U., Gegenfurtner, K. R., Smeets, J. B. J., Brenner, E. Center or side: biases in selecting grasp points on small bars. Experimental Brain Research. 232 (7), 2061-2072 (2014).
  12. Goodale, M. A., et al. Separate neural pathways for the visual analysis of object shape in perception and prehension. Current Biology. 4 (7), 604-610 (1994).
  13. Kleinholdermann, U., Franz, V. H., Gegenfurtner, K. R. Human grasp point selection. Journal of Vision. 13 (8), 23(2013).
  14. Maiello, G., Paulun, V. C., Klein, L. K., Fleming, R. W. Object visibility, not energy expenditure, accounts for spatial biases in human grasp selection. i-Perception. 10 (1), 204166951982760-20 (2019).
  15. Maiello, G., Schepko, M., Klein, L. K., Paulun, V. C., Fleming, R. W. Humans can visually judge grasp quality and refine their judgments through visual and haptic feedback. Frontiers in Neuroscience. 14, 591898(2021).
  16. Klein, L. K., Maiello, G., Paulun, V. C., Fleming, R. W. Predicting precision grip grasp locations on three-dimensional objects. PLoS Computational Biology. 16 (8), 1008081(2020).
  17. Maiello, G., Paulun, V. C., Klein, L. K., Fleming, R. W. The sequential-weight illusion. i-Perception. 9 (4), 204166951879027(2018).
  18. Chessa, M., Maiello, G., Klein, L. K., Paulun, V. C., Solari, F. Grasping objects in immersive Virtual Reality. 2019 IEEE Conference on Virtual Reality and 3D User Interfaces (VR). , 1749-1754 (2019).
  19. Crajé, C., Lukos, J. R., Ansuini, C., Gordon, A. M., Santello, M. The effects of task and content on digit placement on a bottle). Experimental Brain Research. 212 (1), 119-124 (2011).
  20. Lukos, J., Ansuini, C., Santello, M. Choice of contact points during multidigit grasping: Effect of predictability of object center of mass location. Journal of Neuroscience. 27 (14), 3894-3903 (2007).
  21. Gilster, R., Hesse, C., Deubel, H. Contact points during multidigit grasping of geometric objects. Experimental Brain Research. 217 (1), 137-151 (2012).
  22. Schot, W. D., Brenner, E., Smeets, J. B. J. Robust movement segmentation by combining multiple sources of information. Journal of Neuroscience Methods. 187 (2), 147-155 (2010).
  23. Sundaram, S., et al. Learning the signatures of the human grasp using a scalable tactile glove. Nature. 569 (7758), 698-702 (2019).
  24. Yan, Y., Goodman, J. M., Moore, D. D., Solla, S. A., Bensmaia, S. J. Unexpected complexity of everyday manual behaviors. Nature Communications. 11 (1), 3564(2020).
  25. Han, S., et al. Online optical marker-based hand tracking with deep labels. ACM Transactions on Graphics. 37 (4), 1-10 (2018).
  26. Clouthier, A. L., et al. Development and validation of a deep learning algorithm and open-source platform for the automatic labelling of motion capture markers. IEEE Access. 9, 36444-36454 (2021).
  27. Qualisys AB Qualisys Track Manager User Manual (Version 2022.1). , Available from: https://www.qualisys.com/ (2022).
  28. Mathis, A., et al. DeepLabCut: Markerless pose estimation of user-defined body parts with deep learning. Nature Neuroscience. 21 (9), 1281-1289 (2018).
  29. Moon, G., Shiratori, T., Lee, K. M. DeepHandMesh: A weakly-supervised deep encoder-decoder framework for high-fidelity hand mesh modeling. ECCV 2020. , (2020).
  30. Smith, B., et al. Constraining dense hand surface tracking with elasticity. ACM Transactions on Graphics. 39 (6), 219(2020).
  31. Taheri, O., Ghorbani, N., Black, M. J., Tzionas, D. GRAB: A dataset of whole-body human grasping of objects. Computer Vision - ECCV 2020: 16th European Conference. , Glasgow, UK. 581-600 (2020).
  32. Brahmbhatt, S., Tang, C., Twigg, C. D., Kemp, C. C., Hays, J. ContactPose: A dataset of grasps with object contact and hand pose. Computer Vision - ECCV 2020. , 361-378 (2020).
  33. Wang, J., et al. RGB2Hands: Real-time tracking of 3D hand interactions from monocular RGB video. ACM Transactions on Graphics. 39 (6), 218(2020).
  34. Zhang, X., Li, Q., Mo, H., Zhang, W., Zheng, W. End-to-end hand mesh recovery from a monocular RGB image. 2019 IEEE/CVF International Conference on Computer Vision (ICCV). , 2354-2364 (2019).
  35. Endo, Y., Tada, M., Mochimaru, M. Reconstructing individual hand models from motion capture data). Journal of Computational Design and Engineering. 1 (1), 1-12 (2014).
  36. Mueller, F., et al. GANerated hands for real-time 3D hand tracking from monocular RGB. 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. , 49-59 (2018).
  37. Mueller, F., et al. Real-time pose and shape reconstruction of two interacting hands with a single depth camera. ACM Transactions on Graphics. 38 (4), 49(2019).
  38. Romero, J., Tzionas, D., Black, M. J. Embodied hands: Modeling and capturing hands and bodies together. ACM Transactions on Graphics. 36 (6), 245(2017).
  39. Kappler, D., Bohg, J., Schaal, S. Leveraging big data for grasp planning. 2015 IEEE International Conference on Robotics and Automation (ICRA). , 4304-4311 (2015).
  40. Kokic, M., Kragic, D., Bohg, J. Learning task-oriented grasping from human activity datasets). IEEE Robotics and Automation Letters. 5 (2), 3352-3359 (2020).
  41. Shao, L., et al. UniGrasp: Learning a unified model to grasp with multifingered robotic hands. IEEE Robotics and Automation Letters. 5 (2), 2286-2293 (2020).
  42. Shao, L., Migimatsu, T., Zhang, Q., Yang, K., Bohg, J. Concept2Robot: Learning manipulation concepts from instructions and human demonstrations. Robotics: Science and Systems XVI. , (2020).
  43. Bohg, J. Interactive perception: Leveraging action in perception and perception in action. IEEE Transactions on Robotics. 33 (6), 1273-1291 (2017).
  44. Blender Foundation. , Available from: https://www.blender.org (2022).
  45. Roth, S. D. Ray casting for modeling solids. Computer Graphics and Image Processing. 18 (2), 109-144 (1982).
  46. Maiello, G., Kwon, M., Bex, P. J. Three-dimensional binocular eye-hand coordination in normal vision and with simulated visual impairment. Experimental Brain Research. 236 (3), 691-709 (2018).
  47. Weichert, F., Bachmann, D., Rudak, B., Fisseler, D. Analysis of the accuracy and robustness of the leap motion controller. Sensors. 13 (5), 6380-6393 (2013).
  48. Guna, J., Jakus, G., Pogačnik, M., Tomažič, S., Sodnik, J. An analysis of the precision and reliability of the leap motion sensor and its suitability for static and dynamic tracking. Sensors. 14 (2), 3702-3720 (2014).
  49. Sheshadri, S., Dann, B., Hueser, T., Scherberger, H. 3D reconstruction toolbox for behavior tracked with multiple cameras. Journal of Open Source Software. 5 (45), 1849(2020).
  50. Maiello, G., Harrison, W. J., Bex, P. J. Monocular and binocular contributions to oculomotor plasticity. Scientific Reports. 6, 31861(2016).
  51. Caoli, A., et al. A dichoptic feedback-based oculomotor training method to manipulate interocular alignment. Scientific Reports. 10, 15634(2020).
  52. Gibaldi, A., Vanegas, M., Bex, P. J., Maiello, G. Evaluation of the Tobii EyeX eye tracking controller and Matlab toolkit for research. Behavior Research Methods. 49 (3), 923-946 (2017).
  53. Chessa, M., Maiello, G., Borsari, A., Bex, P. J. The Perceptual quality of the Oculus Rift for immersive virtual reality. Human-Computer Interaction. 34 (1), 51-82 (2016).
  54. Maiello, G., Chessa, M., Bex, P. J., Solari, F. Near-optimal combination of disparity across a log-polar scaled visual field. PLoS Computational Biology. 16 (4), 1007699(2020).
  55. Maiello, G., Chessa, M., Solari, F., Bex, P. J. The (in)effectiveness of simulated blur for depth perception in naturalistic images. PLoS One. 10 (10), 0140230(2015).
  56. Maiello, G., Chessa, M., Solari, F., Bex, P. J. Simulated disparity and peripheral blur interact during binocular fusion. Journal of Vision. 14 (8), 13(2014).
  57. Maiello, G., Kerber, K. L., Thorn, F., Bex, P. J., Vera-Diaz, F. A. Vergence driven accommodation with simulated disparity in myopia and emmetropia. Experimental Eye Research. 166, 96-105 (2018).
  58. Moscatelli, A., et al. The change in fingertip contact area as a novel proprioceptive cue. Current Biology. 26 (9), 1159-1163 (2016).

重印与许可

标签

接触区域估计手部网格重建基于标记物的追踪三维物体网格人体抓握动作运动追踪相机关节欧拉角触觉感知运动控制