2010年12月15日
我们目前的图灵握手测试,通过telerobotic系统中,读写器是拿着机器人的手写笔,与另一个党(人或人工)交互管理。我们使用一个被迫的选择方法,并为人工模式的相似性,一个人握手中提取的一种措施。
此过程的总体目标是确定握手的计算机模型与人类握手的匹配程度。这是通过首先向受试者展示成对的握手来实现的,握手可以是人机生成的,也可以是使用远程机器人界面将两者结合起来。该过程的第二步是要求每个对象在每对握手中选择两次握手中的哪一次更像人类。
该过程的最后一步是根据受试者的答案计算人类相似度等级,对于握手模型,即模型人类相似度等级或 MHLG。最终,可以获得显示不同模型之间存在显着差异的结果,MH Gs 使用图灵类握手测试。图灵测试实际上仅限于语言智能,科学家和工程师观察到人工智能和自然智能在运动行为的运动控制方面存在巨大差距。
许多科学家都考虑过这种运动版本的巡回赛测试,但直到最近才得到支持,可驾驶的机器人设备在研究实验室中被遗弃,从而促进了类似巡回赛的握手测试的简单可重复协议的实施。这种方法可以帮助回答人机交互领域的关键问题,例如提供自然人类触摸体验的人类手臂运动的关键特征是什么。这项技术的影响延伸到我们对运动障碍(如脑瘫)的诊断。
下一步是构建一种机器人诊断设备,可以区分健康的人类握手和受损的握手。一。这种方法的视觉演示至关重要,因为通过远程机器人系统的握手动作并不自然,并且需要时间和练习来学习如何作机器人并与之交互。遵循经典巡回测试的原始概念,握手实验由三个实体组成,即人类、计算机、审讯员。
审讯员和人类坐在同一个房间里,但被屏幕隔开,因此审讯员看不到计算机或人类正在生成握手。握手不是直接握手,而是通过机械远程机器人界面完成的,该界面由两个幻影桌面机器人(在人工握手的情况下)和一个幻影机器人和软件组成。在计算机握手的情况下,当计算机屏幕上出现 handshake 一词时,审讯员和人立即通过沿垂直方向移动远程机器人界面的手写笔来做出握手动作。
审讯员的工作是比较两次握手,并通过按 home 或 F1 键选择第一次握手,或者按 end 或 F 2 选择第二次握手来选择更像人类的握手。本视频中演示的三种实验方案因比较的握手成分而彼此不同。第一个协议是纯图灵测试协议,但在人类握手和计算机生成的握手之间进行选择。
第二种协议包括握手,握手是人类产生的力和计算机产生的力的不同组合。第三种协议包括握手,这些握手是人类产生的握手和噪音或纯粹计算机生成的力的不同组合。在实验期间,系统会在提示符下自动创建一个随机文件,输入随机文件的名称。
如果文件已存在,则系统将使用现有文件。否则,系统会自动生成具有指定名称的新随机文件。随机文件定义不同握手发生的顺序。
纯粹的协议从 12 次练习开始,每次两次握手,其中人类和审讯者通过远程机器人系统握手 24 次。审讯者知道,这个阶段他与人类握手。这些实践试验的目的是让参与者熟悉远程机器人界面。
在练习轮之后,每次试验都会进行四次试验。将人工握手与随机顺序的四个计算机模型握手中的一个进行比较,如本例所示。例如,在第一块的 Trial 1 中,审讯者握手两次。
第一次握手由人产生,第二次握手由计算机使用模型 3 指示的力产生。然后,审讯者在第一次握手和第二次握手之间进行选择,以决定哪种握手更像人类。例如,如果审讯者选择第一次握手,因为更像人类,则审讯者选择了人类握手。
但是,审讯者不会被告知他或她是否在下一次审判中正确识别了人类握手。审讯者的第一次握手是与计算机生成的模型 2 握手,第二次握手是与人类握手。审讯者再次选择最像人类的握手。
另外两次试验以类似的方式进行。为了测试其余两个模型,模型 1 和模型 4 与人类握手相对应。这样就完成了 1 个 Trial 块。
该实验由 11 个模块组成,每个模块有 4 个试验,每个模块中以随机顺序显示 4 次模型握手。初始模块是一个练习模块,对其余 10 个模块进行分析。在完成实验的 10 个模块后,四个握手模型中的每一个都针对人类握手进行了 10 次测试。
完成 11 个实验块后,为四个测试模型中的每一个计算模型人类相似度等级。分析是通过计算对象表示模型握手比人类握手更像人类的握手比例来完成的。例如,如果询问者在 10 次握手中的 2 次握手中选择模型 1 次握手而不是人类握手,则模型与人类的比例将为 0.2,将此比例乘以 2 以获得模型人类相似度等级。
对于每个比例为 0.2 的模型,模型的模型、人类相似度等级将为 0.4。如果在 10 项试验中有 4 项选择模型 3 更像人类,则其比例为 0.4,其模型人类相似度等级为 0.8。如果模型与人类无法区分,则其计算的比例将为 0.5,模型人类相似度等级将为 1。
如果模型明显是非人类的,就像它的模型一样,人类相似度等级将为零。MHLG 的上限为 1。在该协议中,生成的握手分开人体部位模型,其中特定组合在从纯计算机生成的握手到纯人类握手的规模上因试验而异。
因此,这组实验称为加权人体模型检验。该协议从练习块开始,以帮助审讯者学习识别纯人类握手并熟悉设备。因此,练习块有 30 个试验,将纯人工握手与计算机生成的握手进行比较。
在每次试验结束时,审讯者选择两次握手中的哪一次最像人类。如果询问器正确识别了人类握手,则屏幕显示正确。如果审讯员没有选择正确的握手,则会显示错误的消息,审讯员有机会重复最后一次练习赛。
练习块结束后,审讯者开始一系列试验以评估两次握手。两次握手是刺激握手和参考握手,每一次握手都是人力和模型力的组合。在参考握手中,审讯者感受到的握手是人类和计算机生成的模型产生的力的均匀混合。
换句话说,当人类参与者做出握手动作时,该握手仅占询问者感知的力的 50%,其余 50% 的力来自刺激握手中的模型,询问者感受到的握手是人类和计算机生成的模型产生的力的不同混合物。在一些刺激握手中,人类贡献的分数超过一半,因此比参考握手中的要多。在其他刺激握手中,人类贡献的分数不到一半,因此小于参考握手。
在每次审判结束时,审讯者都会被要求选择感觉更像人类的握手。此实验比较了三个模型、两个测试模型和一个基础模型。与纯协议一样,该协议从一个未分析的块开始,然后是 10 个实验块。
每个实验块由 24 个试验组成,包括模型和人类的八个线性组合中的每一种。完成 10 个实验块后,逻辑心理测量函数适合审讯者的答案。如随附的文章所述,生成的曲线显示了询问者的概率。
为了回答这个问题,刺激握手比参考握手更像人类作为 alpha 刺激减去 alpha 参考的函数,主观相等点或 PSE 是从心理测量曲线的 0.5 阈值水平中提取的,该水平表明 alpha 刺激和 alpha 参考之间的差异,其中握手被认为与模型同样像人类。加权人类模型方案的人类相似度等级是通过从 0.5 中减去 PSE 来计算的,被认为是最不像或最像人类的可能产量模型的模型,人类相似度等级值分别为 0 或 1。最终协议将模型握手与部分人部分随机噪声握手进行比较。
在该协议中,刺激握手是基于模型的计算机生成的握手。另一种握手,即参考握手,是由人次握手和白噪声的各种组合产生的力,最大绝对力为 2 N,使用 5 阶低通巴特沃斯滤波器以 2 over pi 的最大频率过滤。在每次审判结束时,审讯者都会被要求选择感觉更像人类的握手。
该协议的设计与之前的加权人体模型测试相似。在一轮练习和一个未分析的模块之后,将按如下方式运行一系列 10 个实验模块。PSE 像以前一样从心理测量曲线中提取,并为添加的噪声协议定义模型人类相似度等级。
此图显示了 pure 协议的结果,并将人工握手与两种不同的模型握手进行了比较。这两个点显示了两个名为 KB 1 和 KB 2 的粘弹性模型的计算模型人体相似度等级值。结果表明,模型 KB 2 被认为比模型 KB 1 更像人类。
该图显示了加权模型人类协议的结果,该协议将不同比例的人类模型握手与固定的 50:50 人类模型握手比率进行了比较。黑色标记表示测试模型的模型人体相似度等级,灰色标记表示基本模型的相似度等级。误差线表示心理测量曲线、置信区间。
该图显示了添加噪声协议的结果,该协议将模型握手与人噪分量比例不同的握手进行了比较。黑色标记表示模型的模型人类相似性等级,灰色标记表示噪声的等级。误差线表示心理测量曲线的置信区间。
这些结果表明,使用所有三种评估方法,粘弹性模型 KB 2 被认为比粘弹性模型 KB 1 更像人类 在尝试此过程时,重要的是要记住与机器人设备正确交互,并尝试使交互尽可能顺利 遵循此程序。可以执行其他方法,例如测试、识别广泛性发育障碍中的人类握手,以回答其他问题,例如,广泛性发育障碍如何影响区分人类和非人类手势的能力?现在,经过开发,这项技术可以为使用握手作为识别工具铺平道路。
我们假设握手的目的是了解对方的一些信息。因此,我们提出的开发类人握手的方法也可以促进握手分类系统的发展,该系统可以从对方的握手中提取有关他或她的信息。看完这个视频后,它应该对如何执行像握手测试这样的一维巡演以及我们将如何评估提交给第一次国际巡演(如握手测试锦标赛)的握手模型有很好的理解。
本研究提出了一种类似图灵的握手测试,使用遥控机器人系统评估人工握手模型与人类握手的相似性。该方法涉及一种强制选择范式,受试者比较握手并评估它们的人性化程度。
Assessing motor intelligence in computational models addresses a critical gap in human-robot interaction, particularly for applications requiring naturalistic motor behavior such as rehabilitation robotics and assistive devices. The Turing-like handshake test provides a quantitative framework to evaluate model fidelity to human motor patterns, supporting mechanistic de-risking in preclinical model development. This enables predictive confidence in target validation for neuromotor pathways and informs go/no-go decisions in early discovery stages focused on motor function restoration.
The method integrates into the discovery continuum by informing hypothesis testing in motor control pathways, enabling assay readiness through standardized motor output, and supporting analytics-driven comparisons of model performance against human benchmarks.