当我们抓握物体时,手指和手掌的多个区域通常会与物体表面接触。重建这些接触区域具有挑战性。本文介绍了一种方法,通过结合基于标记的运动捕捉与现有的基于深度学习的手部网格重建技术,来近似估计接触区域。
当我们抓握物体时,手指和手掌的多个区域通常会与物体表面接触。重建这些接触区域具有挑战性。本文介绍了一种方法,通过结合基于标记的运动捕捉与现有的基于深度学习的手部网格重建技术,来近似估计接触区域。
为了成功抓取物体,我们必须选择手在物体表面的合适接触区域。然而,识别这些区域具有挑战性。本文描述了一种从基于标记的追踪数据中估计接触区域的工作流程。参与者抓取真实物体,同时我们追踪物体和手(包括手指关节)的三维位置。首先,我们根据位于手背上的若干追踪标记确定关节的欧拉角。然后,我们采用先进的手部网格重建算法,生成参与者手部在当前姿态和三维位置下的网格模型。
使用通过3D打印或3D扫描获得的物体(因此既具有实物形式,也具有网格数据),可实现手部与物体网格的共配准。进而,可通过计算手部网格与共配准的三维物体网格之间的交集,来估算近似的接触区域。该方法可用于估计人类在多种条件下抓握物体的位置和方式。因此,该方法可能对研究视觉与触觉感知、运动控制、虚拟与增强现实中的人机交互以及机器人学的研究人员具有重要意义。
抓握和操控物体的能力是人类改造环境以满足自身需求的关键能力。然而,有效控制多关节的手部是一项具有挑战性的任务,需要一个复杂的控制系统。该运动控制系统由多种形式的感觉输入所引导,其中视觉最为重要。通过视觉,个体能够识别环境中的物体,估计其位置和物理特性,进而轻松地伸手、抓取并操控这些物体。理解将视网膜输入与控制手部的运动指令相联系的这一复杂系统,是感觉运动神经科学面临的核心挑战之一。为了建模、预测并深入理解该系统的工作机制,我们必须首先能够对其进行细致的研究。这需要对视觉输入和手部运动输出进行高保真度的测量。
以往的运动追踪技术对人类抓握行为的研究施加了诸多限制。例如,需要将电缆连接到受试者手部的系统1,2往往会限制手指运动的范围,可能改变抓握动作本身或测量结果。尽管存在这些局限性,先前的研究仍成功识别出若干影响视觉引导抓握的因素。其中一些因素包括物体形状3,4,5,6、表面粗糙度7,8,9,或物体相对于手的朝向4,8,10。然而,为了克服以往的技术限制,大多数先前研究采用了简单的刺激材料和高度受限的任务,因而主要聚焦于个别因素3,4,6,7,10、双指精确抓握3,4,6,9,11,12,13,14,15,16,17,18、单一物体19,或非常简单的二维形状20,21。此前的研究发现能否推广至这些简化且人工化的实验室条件之外,尚不明确。此外,对手与物体接触的测量通常被简化为对指端接触点的估计22。这种简化可能适用于仅指尖与物体接触的一小类抓握行为。但在大多数真实世界的抓握中,手指和手掌的大范围区域均会与物体接触。进一步地,最近一项研究23利用触觉手套表明,物体可通过其表面与手部的接触方式被识别。这凸显了研究手与被抓握物体之间广泛接触区域的重要性,而不仅仅是物体与指尖之间的接触点22。
近年来,运动捕捉和三维手部建模技术的进步使我们得以突破以往的局限,全面深入地研究抓握动作的复杂性。基于被动标记点的运动追踪技术现已能够使用毫米级的小型标记点,将其附着于受试者手背,以追踪关节运动24。此外,针对被动标记点系统的自动标记点识别算法已具备足够的鲁棒性,几乎无需对标记点数据进行大量手动后期处理25,26,27。无标记点解决方案在视频中追踪动物身体部位方面也达到了令人印象深刻的性能水平28。因此,这些运动追踪方法最终实现了对复杂多指手部运动的可靠且非侵入式测量24。此类测量可提供关节运动学信息,并使我们能够估算手部与物体之间的接触点。此外,近年来计算机视觉领域一直在致力于构建能够复制手部在抓握物体过程中,甚至在手部各部分相互接触时软组织形变的人手模型29,30,31,32。此类三维网格重建可基于多种类型的数据生成,例如视频影像33,34、骨骼关节(来自基于标记点35或无标记点追踪36)以及深度图像37。该领域的一项关键进展由Romero等人38提出,他们基于31名受试者在不同姿势下的1000多次手部扫描数据,构建了一个参数化手部模型(MANO)。该模型包含手部姿态和形状的参数,有助于从不同数据源回归出完整的手部重建结果。近期的DeepHandMesh29方法在此基础上进一步发展,通过深度学习构建参数化模型,并引入穿透避免机制,更准确地模拟手部各部分之间的物理交互。因此,通过将此类手部网格重建与三维追踪的物体网格相结合,现在不仅可以估算物体表面的接触区域32,还能估算手部表面的接触区域。
本文提出了一种将高保真度的物体与手部关节三维追踪技术与新型手部网格重建算法相结合的工作流程。该方法可生成手部与物体接触表面的详细图谱。这些测量数据将有助于感觉运动神经科学家拓展对人类视觉引导抓取行为的理论认知。此外,该方法也可能对相关领域的研究人员具有应用价值。例如,人因工程学研究人员可利用该方法在虚拟现实和增强现实中构建更优的人机交互系统18。对人类抓取行为的高保真度测量还可协助机器人研究人员基于交互感知原理,设计受人类启发的机器人抓取系统39,40,41,42,43。因此,我们期望该方法能够推动抓取行为研究从对高度受限任务的简略描述,发展为对复杂物体和真实世界任务中自然抓取行为的全面表征,从而促进神经科学与工程学领域的研究进展。整体研究方法如图1所示。

图1:所提出方法的关键步骤。(A)动作捕捉相机从多个角度拍摄工作台。(B)刺激物体由三角网格模型通过三维打印制成。(C)四个球形反光标记点被粘贴在真实物体表面。一个半自动化的流程在网格模型表面识别出对应的四个点。该对应关系使我们能够对网格模型进行旋转和平移,以匹配真实物体在三维空间中的追踪位置。(D)使用双面胶将反光标记点贴附在受试者手背的不同解剖标志位置。(E)动作捕捉系统在一个试验过程中获取被追踪物体和手部标记点在三维空间中的运动轨迹。(F)使用三维计算机图形软件构建受试者特异性的手部骨骼模型。随后通过逆向运动学方法,估算实验中每次试验每一帧的骨骼关节姿态。(G)将关节姿态输入至DeepHandMesh29的改进版本,输出当前三维姿态和位置下的估计手部三维网格模型。(H)最后,我们利用网格交集计算手与物体之间的接触区域。请点击此处查看该图的放大版本。
在开始实验之前,参与者必须根据机构指南和《赫尔辛基宣言》签署知情同意书。本文所述所有方案均已获得吉森尤斯图斯-李比希大学当地伦理委员会(LEK-FB06)的批准。
1. 安装所有必要的软件
2. 准备动作捕捉系统
3. 校准相机
4. 创建刺激对象
5. 准备刺激物体
6. 刺激物体的真实图像与网格模型配准
7. 在手部设置标记点

图 2:受试者手部的标记点放置。 缩写:RH = 右手。 请点击此处查看此图的放大版本。
8. 获取单次试验数据
9. 标记物的标记
10. 为参与者创建个性化的骨骼定义
11. 重建关节骨骼姿态
12. 生成手部网格重建
13. 生成手部与物体接触区域的估计
所提出方法的首要要求是具备一个能够精确定位三维物体和手部位置的系统。具体设置如图1A所示,采用由动作捕捉公司Qualisys生产的硬件和软件。我们在一个跟踪空间(100 cm × 100 cm × 100 cm)内设置一个工作台,该空间由围绕工作区域的立方体框架上的八个跟踪相机和六个视频相机从多个角度进行成像。跟踪相机以每秒180帧的速度对跟踪空间内反光标记点进行三维定位,空间分辨率达亚毫米级。我们使用直径为4 mm的反光标记点,并通过对皮肤无害的双面胶带将其粘附在物体和手部上。三维标记点的位置数据由动作捕捉软件进行处理。讨论部分还回顾了可与本方法结合使用的其他动作捕捉系统。
为了获得被抓取和操作的真实物体的精确三维重建,我们提出两种方案。第一种方案(也是本文所采用的方案)是从多边形网格形式的虚拟三维物体模型开始。此类三维模型可使用适当的软件(例如 Blender 3D44)构建,然后通过三维打印制成实物(图1B)。第二种方案是选取一个已有的真实三维物体,利用三维扫描技术构建该物体的网格模型复制品。无论采用哪种策略,最终目标都是同时获得一个真实的三维物体及其对应的虚拟三维物体网格模型。需要注意的是,本文所述方法仅适用于刚性(即不可变形)物体。
一旦物体的三维表面以网格模型的形式呈现,就必须对其进行位置追踪和共注册(图1C)。为此,需在真实物体表面附着四个非共面的反射标记点,并将物体置于追踪范围内。随后短暂采集这些标记点的三维位置。该采集过程用于建立真实标记点与物体网格模型上四个顶点之间的一一对应关系。此步骤通过一段使用Blender的Python API编写的简易自定义软件流程实现。在Blender的视口中,程序将虚拟物体与标记点位置一同显示,其中标记点被表示为一个由多个球体组成的单一网格对象,每个球体对应一个标记点。用户可旋转和平移虚拟物体和/或标记点,使其与真实物体上的实际标记点对齐。程序将记录所施加的旋转和平移操作,并据此计算出一个统一的旋转变换和平移变换,最终应用于原始物体网格模型,从而获得与QTM中刚体定义相共注册的物体网格模型。
建立对应关系后,当真实物体在跟踪范围内移动时,可通过计算被跟踪标记点与四个对应的网格顶点之间的旋转和平移变换,将虚拟物体放置到新的位置。为了记录抓握动作的动态过程,则使用双面胶带在手部不同解剖标志位置共粘贴24个球形反光标记点(图1D 和 图2)。
在试验开始时(图1E),参与者将手平放在工作台上,掌心朝下,并闭上眼睛。实验人员将一个目标物体放置在参与者前方的工作台上。随后,一个听觉提示信号指示参与者睁开眼睛并执行抓取动作。在我们的演示中,任务是伸手抓取目标物体,将其垂直提起约10 cm,放回原位,然后将手返回起始位置。实验由一段使用 Python 3.7 编写的脚本控制。在每次试验中,该脚本选择当前实验条件设置并告知实验人员(例如物体的身份和位置)。该脚本还控制试验的时间进程,包括听觉提示以及运动捕捉记录的开始与停止。
肢体不仅由其在三维空间中的位置决定,还由其姿态决定。因此,为了获得人手执行真实抓握动作的完整三维重建,我们不仅需要获取每个关节在三维空间中的位置,还需要获得每个关节相对于其父关节的相对姿态(平移和旋转)(图1F)。骨骼关节的位置和方向可以通过逆向运动学从标记点的位置推断得出。在此,我们采用QTM软件提供的骨骼求解器来实现这一过程。为了使求解器正常工作,我们必须首先提供一个骨骼定义,将每个关节的位置和方向与多个标记点的位置关联起来。因此,我们构建了骨骼定义,并使用Maya的QTM Connect插件将骨骼绑定与标记点数据连接。我们为每位参与者创建个性化的骨骼定义,以最大程度提高骨骼拟合与标记点数据的一致性。对于每位参与者,我们手动将手部骨骼模型拟合到一段动作捕捉数据的单帧图像中。在获得针对特定参与者的骨骼定义后,我们随后运行骨骼求解器,以估算实验中每次试验每一帧的骨骼关节姿态。
在实验的每一次试验的每一帧中,我们使用开源且预训练的手部网格生成工具 DeepHandMesh28(图 1G)生成重建当前手部姿态的手部网格。DeepHandMesh 是一种深度编码器-解码器网络,可从图像中生成个性化的手部网格。首先,编码器估计图像中手部的姿态(即关节的欧拉角)。然后,将估计的手部姿态和一个个性化 ID 向量输入解码器,解码器据此估计一组对绑定模板网格的三项加性校正。最后,使用线性混合蒙皮技术,根据估计的手部姿态和校正项对模板网格进行形变。第一项校正是依赖于 ID 的骨骼校正,通过该校正调整骨骼绑定以纳入个体特定的关节位置。其余两项校正为网格校正,用于调整网格顶点以更准确地表示受试者的手部表面。其中一项网格校正是依赖于 ID 的网格校正,用于反映个体受试者手部的表面结构。最后一项网格校正则是依赖于姿态的顶点校正,用于反映由当前手部姿态引起的手部表面形变。
DeepHandMesh 使用 2D 关节关键点和场景深度图进行弱监督训练。在此,我们仅使用预训练的 DeepHandMesh 解码器来生成手部网格重建,并通过以下方式进行了修改(图 3)。首先,由于该网络未针对特定参与者进行训练,因此采用预训练模型提供的通用的、依赖于个体身份(ID)的网格校正方法(图 3A)。其次,利用 QTM 骨骼解算器(如上所述)推导出依赖于个体身份的骨骼校正参数(图 3B)。假设手部相对于骨骼长度呈比例缩放,且网格厚度通过由骨骼相对缩放因子推导出的系数进行均匀缩放,从而使网格更准确地逼近参与者的实际手部尺寸(图 3C)。该经过修改的网格连同当前的手部姿态(由标记点数据推导)以及腕部的 3D 位置和朝向,一并输入解码器。因此,解码器计算当前姿态依赖的校正量,应用所有校正项及旋转变换与平移变换,最终输出当前手部姿态的 3D 手部网格重建结果,其坐标系与 3D 跟踪物体网格的坐标系一致(图 3D)。

图 3:预训练 DeepHandMesh 解码器的修改。(A)固定的、通用的个体身份依赖性网格校正。(B)通过第10步中的逆向运动学推导出的个体身份依赖性骨骼校正。(C)手部网格的大小按骨骼关节相同比例缩放。(D)当前手部姿态的最终三维手部网格重建。请点击此处查看该图的放大版本。
在重建参与者手部和被抓握物体的三维网格模型后,可通过计算手部与物体网格之间的交集来估计手-物体接触区域(图1H)。该方法基于以下假设:真实手部在与物体表面接触时会发生形变,这意味着骨骼可以比手部保持刚性时更接近表面,从而允许手部网格的部分区域穿过物体网格。因此,接触区域可近似为两个网格之间的重叠区域。
具体而言,为了计算这些重叠区域,我们将位于手部网格三维体积内的物体网格顶点定义为与手部接触的点。这些顶点通过标准的光线追踪方法45进行识别。对于物体网格的每个顶点,从该顶点向手部网格外部的任意一个三维点发射一条射线。然后评估该射线与构成手部表面的三角形之间的交点数量。如果交点数量为奇数,则该物体顶点位于手部网格内部;如果交点数量为偶数,则该物体顶点位于手部网格外部。因此,物体表面上的接触区域可近似表示为所有顶点均位于手部网格内部的三角形面的集合。我们可采用相同的逻辑,将位于物体网格三维体积内的手部网格顶点用于估计手部表面上的接触区域。值得注意的是,也可采用更先进的布尔网格运算方法31。
视频1展示了一只手在抓取一个3D打印的猫形摆件时,手部、被追踪的关键点以及共同配准的网格模型并排同步运动的视频。而图4A则显示了在手与物体接触瞬间,抓取一个3D打印的牛角面包时的单帧图像,以及对应的手-物体网格重建结果(图4B)和在牛角面包表面估计的接触区域(图4C)。

图 4:估计的手部与物体接触区域。(A)在抓握过程中,从其中一个追踪相机视角观察到的手部与物体的追踪结果。(B)从与追踪相机相同视角渲染出的重建手部网格与追踪物体网格。(C)从多个视角观察到的物体表面的接触区域。请点击此处查看该图的放大版本。
视频 1:手部与物体的网格重建。 单次抓握过程中,从同一摄像机视角观察的手部、追踪标记点以及手部与物体网格重建的动态图,以 gif 动画形式展示。请点击此处下载该视频。
我们提出一种方法,用于估计多指抓握过程中手与物体接触区域的范围。由于目前尚无法实现对手部整个表面的完整追踪,我们建议采用一种手部网格重建方法,其姿态由手部稀疏的关键点确定。为了追踪这些稀疏关键点,本方案采用基于被动标记点追踪的研究级动作捕捉系统。当然,只要能提供足够精确的三维位置数据,其他动作捕捉系统也可与本方法结合使用。我们不建议使用主动标记点动作捕捉系统(例如曾广泛应用但已停产的Optotrak Certus),因为这类系统需要将电缆和/或电子设备连接到受试者手上,可能限制手部运动,或至少导致抓握动作不够自然,使受试者对其手部姿态产生更强的意识性注意。使用惯性测量单元的动作追踪手套也可能是一种选择,尽管这类系统存在漂移问题,可能限制手部活动,并且无法让手部表面与物体表面实现完全、直接的接触。商用无标记手部追踪解决方案(例如Leap Motion46,47,48)也具备可行性,但仅靠这些系统可能无法同步追踪物体位置。相较于研究级动作捕捉系统,最具前景的替代方案是开源的无标记追踪技术(例如Mathis等28提出的方法)。若结合多个共注册相机49使用,此类系统有望在无需标记点、手套或电缆的情况下,实现对手部关节位置和物体位置的三维追踪。然而,这些无标记方案以及本研究所采用的基于标记的系统,都可能因遮挡问题而出现数据丢失。
局限性与未来研究方向
由于通过该方法获得的手部重建结果并非完全准确,因此该方法在适用的实验类型上存在一定的局限性。手部网格重建结果与真实情况之间的偏差,将反映在估计的手/物体接触区域的偏差上。因此,若要将该方法用于获取绝对测量值,需先评估接触区域估计的准确性。然而,即使仅为近似估计,在被试内实验设计中仍可能具有应用价值,因为该方法的潜在偏差在同一位被试的不同实验条件下可能以相似的方式产生影响。因此,统计分析和推论应仅基于诸如不同条件下接触面积差异等指标,此时效应的方向将与对应的真实情况相关联。在未来的研究中,我们计划进一步验证该方法,例如通过将接触区域估计结果与覆盖有热致变色涂料的物体上的热指纹进行比较。
从数据采集到最终接触区域估计的大多数处理步骤均已实现完全自动化,因此对手-物接触区域估计的标准化流程具有重要意义。然而,仍需手动完成个体骨骼与追踪标记点3D位置的初始匹配,以获得每位参与者的骨骼定义。随着实验中参与者数量的增加,所需进行的手动匹配次数也随之增多,目前这一步骤是整个流程中最耗时的部分,且需要操作者对Autodesk Maya软件中的手动绑定有一定熟悉度。未来,我们计划通过引入自动骨骼校准程序来实现该步骤的自动化,从而避免人为因素对流程的影响。
本文所述的工作流程依赖于Qualisys硬件和软件(例如QTM骨骼求解器),这目前限制了该方法在不具备类似设备的实验室中的可及性。然而从原理上讲,该方法可适用于任何来源的运动捕捉数据。为了提高可及性,我们目前正在探索替代方案,以推广本工作流程,并减少其对特定硬件和软件许可的依赖。
该方法的另一个重要局限性在于,以目前的形式,它仅能应用于刚性(不可变形)物体。未来,可通过采用记录被抓取物体在变形过程中表面形状的方法来克服这一局限性。此外,由于该方法具有近似性,目前尚不适用于非常小或非常薄的物体。
综上所述,通过将先进的运动追踪技术与高保真度的手部表面建模相结合,我们提供了一种用于估计抓握和操作过程中手与物体接触区域的方法。在未来的研究中,我们计划应用该方法来探究和建模人类在视觉引导下的抓握行为16。我们还计划将这些工具与眼动追踪技术46, 50,51,52以及虚拟/增强现实系统53,54,55相结合,以研究在真实和虚拟的自然环境中视觉引导下手部与眼部运动的运动控制机制18,46,56,57。因此,本研究所提出的方法可能对从事触觉感知58、运动控制以及虚拟与增强现实中人机交互研究的科研人员具有重要意义。最后,对人体抓握能力的精确测量可为基于交互感知原理39,40,41,42,43的鲁棒性机器人系统设计提供参考,并可能在上肢假肢领域产生转化应用价值。
作者声明不存在任何竞争利益。
本研究由德国研究基金会(Deutsche Forschungsgemeinschaft,DFG,项目编号:222641018-SFB/TRR 135 TP C1 和 IRTG-1901 "The Brain in Action")以及由黑森州高等教育、科学、研究与艺术部卓越计划资助的研究集群"The Adaptive Mind"提供经费支持。作者感谢Qualisys技术支持团队(包括Mathias Bankay和Jeffrey Thingvold)在方法开发过程中提供的帮助。作者还感谢Michaela Jeschke作为手部模型参与拍摄。所有用于重现本文所述方法及结果的数据和分析脚本均可在Zenodo上获取(doi: 10.5281/zenodo.7458911)。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Anaconda Python 发行版 | (Anaconda 5.3.1 或更高版本);https://repo.anaconda.com/archive/ | 脚本和函数使用 Python 3.7 版本编写 | |
| Autodesk Maya | Autodesk, Inc. | Maya2022;https://www.autodesk.com/products/maya/overview | 三维计算机图形应用程序。 |
| Blender | Blender Foundation | Blender 2.92;https://download.blender.org/release/ | 三维计算机图形应用程序。 |
| 计算机工作站 | N/A | N/A | 操作系统:Windows 10 或更高版本。 |
| DeepHandMesh | Meta Platforms, Inc. (Meta 开源项目) | https://github.com/facebookresearch/DeepHandMesh | 预训练的手部网格生成工具。 |
| Miqus M5 | Qualisys Ab | https://www.qualisys.com/cameras/miqus/ | 被动标记点运动追踪相机(8 台)。 |
| Miqus 视频相机 | Qualisys Ab | https://www.qualisys.com/cameras/miqus-video/ | 彩色视频相机,与 Miquis M5 追踪相机同步(6 台)。 |
| 项目代码库 | N/A | 数据与代码库 | 用于复现本项目的数据与代码。该代码库目前仍在建设中,但我们提供一个私有链接,供审稿人下载当前最新版本。最终版本将在论文被接收后公开发布。 |
| Python 3 | Python 软件基金会 | Python 版本 3.7 | Python3 及其相关内置库。 |
| QTM Connect for Maya | Qualisys Ab | https://github.com/qualisys/QTM-Connect-For-Maya | 将骨骼、刚体和标记点数据从 QTM 流式传输至 Maya |
| QTM Qualisys 跟踪管理器 | Qualisys Ab | Qualisys Track Manager 2021.2;https://www.qualisys.com/software/qualisys-track-manager/ | 动作捕捉软件 |
| Python 的 Qualisys 软件开发工具包 | Qualisys Ab | https://github.com/qualisys/qualisys_python_sdk | 实现 QTM 与 Python 之间的通信 |