本文介绍了一种由手势和语音控制的虚拟现实系统,用于沉浸式家居设计,通过手势与语音输入的多模态融合,提高了设计的准确性、可用性和可及性。实验结果表明,与传统方法相比,该系统能够缩短任务完成时间,提升布置精度,并提高用户满意度。
本文介绍了一种由手势和语音控制的虚拟现实系统,用于沉浸式家居设计,通过手势与语音输入的多模态融合,提高了设计的准确性、可用性和可及性。实验结果表明,与传统方法相比,该系统能够缩短任务完成时间,提升布置精度,并提高用户满意度。
基于手势和语音的虚拟现实交互在多种应用中展现出潜力;然而,现有系统受限于对导航任务的侧重、对双手手势的依赖、缺乏细粒度精度,以及在小规模同质化人群中的测试。这些局限性制约了其在复杂且以设计为中心的工作流程中的应用。为解决上述问题,我们提出一种用于沉浸式家居设计的手势与语音控制虚拟现实系统,该系统融合了手部追踪手势输入与自然语言指令,实现家具的精确摆放、材质选择和空间调整。本系统的创新性体现在三个方面:(i)自适应交互模式,支持单手操作、数字语音指令以及从粗略到精细的精度调节;(ii)多模态融合架构,整合手势、语音和上下文信息,实现亚厘米级精度;(iii)面向任务的用户体验评估框架,专为家居设计流程定制。系统开发遵循系统化流程,涵盖需求分析、手势与语音词典设计、多模态意图识别、带自动吸附与对齐功能的虚拟现实场景构建,以及迭代测试。在多样化参与者群体上的实验结果表明,与基于控制器的交互相比,家具摆放误差减少了30%,可用性和工作负荷评分均有显著提升。结果表明,多模态虚拟现实技术在构建可及性强且富有参与感的家居设计体验方面具有广阔应用前景。
虚拟现实(VR)是一种交互式计算机生成的环境,可产生三维体验,使用户能够如同身临其境般地观察、互动并借助技术进行交流。在本研究中,虚拟现实被视为一种多模态交互环境,而不仅仅是一种视觉显示技术。最新的VR系统将视觉交互与手势识别、空间感知以及自然语音输入相结合,使用户能够高精度地操作模拟物体。这一理解与当前虚拟现实研究中强调沉浸感、参与度和自然用户体验的方向保持一致。其应用领域涵盖表演、教学2,药物治疗3,以及旅行4虚拟现实(VR)通过模拟真实世界环境,使人们能够与现实中无法触及的世界进行互动和连接。在家居设计过程中,用户需要感知空间布局、操控物体并获得实时反馈,而无需进行实际的身体移动,此类沉浸式功能显得尤为重要。这些功能尤其为身体活动能力受限的用户带来了新的可能性。非正式弱势群体成员,特别是老年人以及字母数字识字能力较低的人群,其户外活动常受到多种因素限制,如身体机能障碍、行动不便,以及因年龄相关局限导致的数字技术使用困难。因此,有必要持续关注能够借助VR技术间接使这些人接触外部世界的相关研究。这种对持续研究的关注不仅有助于开发面向可及性的VR体验,也推动了超越基础导航任务的系统发展。事实上,通过自然手势和语音控制的沉浸式家居设计环境,可为老年用户、运动功能障碍者及数字弱势群体提供直观的方式,以与复杂的空间环境进行交互。此类系统通过提供对外部空间和创造性任务的间接访问,有助于提升功能独立性与情感福祉。基于上述理由,本研究将介绍一种多模态VR家居设计系统。此外,正是对研究持续关注的需求,将有助于利用VR专业技术间接使这些人群获得对外部世界的感知与参与。已有研究表明,针对老年人开发的基于VR的干预措施具有多种优势,例如通过增强姿势控制能力和柔韧性来降低跌倒风险6,同时改善整体姿势调节能力与身体稳定性。7此外,针对老年群体量身定制的虚拟现实(VR)内容也日益丰富8,9尽管虚拟现实(VR)交互技术已取得进展,但目前大多数系统仍主要依赖控制器和双手手势,这限制了在设计类任务中的可访问性和精确性。在现有移动功能的基础上,本研究通过引入手势与语音交互方法,使用户能够主动、精确且逼真地操控室内设计元素,从而将虚拟现实从单纯的观察体验拓展为可交互的实践工具。
虚拟现实(VR)具有三个相关特性:交互性、沉浸感和思维参与10。用户与虚拟环境中模拟对象的互动程度和交互强度直接影响其在虚拟氛围中的想象力。根据沉浸程度的不同,VR系统可分为非沉浸式VR、半沉浸式VR和完全沉浸式VR,每种类型采用不同的交互方式、策略和边界组合。11 非沉浸式VR通过鼠标以及手持设备上的桌面或触摸屏与虚拟环境进行交互,并利用手势进行操作12,13,14。半沉浸式VR通常包含大屏幕、组织结构和多个显示屏,可提供类似电影的体验,但在多人同时使用时往往缺乏位置追踪功能。基于手势的交互自VR技术诞生之初便受到研究关注,旨在使VR技术的使用更加舒适和自然。在基于手势的界面中,通过手部动作等身体动作与计算机系统进行通信。
手势边界是自然用户界面(NUI)这一更普遍原则的一种常见实现方式,可用于实现基于头戴式显示器(HMD)的虚拟现实(VR)中的界面透明性。此前已有研究探讨了促进虚拟现实中“临场感”(occurrence)产生的相关因素16,17;然而,关于基于手势的用户界面背景下临场感的研究仍较为有限。理解基于手势的用户界面可能对虚拟现实临场感产生的影响,有助于未来沉浸式技术的设计。因此,从临场感与基于手势交互的角度出发,我们对基于手势用户界面的沉浸式虚拟现实体验进行了研究。对于社会适应能力较弱的人群而言,360°全景高速公路评估材料——作为虚拟现实(VR)的一个子领域——可成为一种有效的工具。借助此类技术,用户无需实际移动即可在虚拟环境中探索全球、前往不同地点,并与其他用户进行社交互动,且支持多方同时参与。对于身体行动受限或环境受限的个体,这种参与形式可作为户外活动的有益补充。除了基本的导航功能外,360°观点技术所带来的教育潜力还延伸至教育的多个领域。
一项系统性文献综述分析了64次培训课程,强调了360°虚拟现实视频和真实虚拟现实在信息传递、优势及沟通特性方面的应用。结果表明,360°虚拟现实可增强学习内容的呈现效果、提升学习者的积极性和信息留存率,从而促进更深层次的沉浸感。该研究者21在基于瞬移的移动方案中关联了两种单手和双手用户界面(UI)。结果显示,偏好单手操作的用户认为其启动更快,而双手操作则被认为更可靠,尽管该研究仅讨论了瞬移而非本研究中所采用的连续移动方式。
本研究建立并采用了双手手势具有一致性更高、单手手势初始速度更快的假设作为前提。此外,针对培训操作人员履行VR22中的职责,除了呈现方式和服务性之外,还需对技术评估的限制条件进行更详细的界定。在此培训情境中,操作面板通过一系列活动指导操作人员,其中技术评估是一个关键组成部分。进一步的基本前提是,如果得到恰当应用,HT技术也能在技术领域带来进步23,24。近期研究表明,虚拟环境不仅可用于评估轮椅操控服务,还具有其他有益用途,包括培训那些在现实生活中难以或成本高昂才能重现的灵活服务。例如,有研究者25指出,VR模拟器可通过提供一个熟练且无风险的技术环境,促进操控技能向实际物理环境的迁移。
研究人员还强调了虚拟技能作为轮椅服务培训干预项目的应用,着重指出其在个性化锻炼和增强服务灵活性方面的实用性和有益价值。然而,出于安全考虑,需事先对用户进行确认和筛查,特别是在虚拟现实环境中26,27。此类应用使身体残疾人士能够在安全且受控的环境中练习并提升驾驶轮椅的技能28。他们可以体验各种虚拟测试和场景,包括克服复杂难题、在狭窄空间中导航或执行精细操作。同时,用户可即时获得关于其表现的反馈,并学习新的运动策略29。除了作为培训辅助工具外,虚拟现实还具有治疗应用价值30。这种沉浸式图像技术有助于增强自信心、条理性和身体功能的重新整合。个体可借此发展运动技能,并提高稳定性和平衡能力。虚拟现实环境是由计算机生成的模拟场景,使用户能够感受到身临其境的体验31。
这种情况可通过虚拟现实耳机或其他策略进行可视化。在实施之前,模型可以模拟风险情境或具有挑战性的情况,例如医疗事件或特定策略的操作32,33,34。此外,另一个优势是能够在实际应用前,在安全且精确复制的环境中,将设备装置(如控制器、动作检测装饰物、麦克风或背心)连接到系统,以实现雇主与机制之间的高效沟通35。虚拟内容可通过多种模式操作,例如使用操纵杆、语音指令或录制的轨迹,如Kinect研究中的方式36。所有这些选项都涉及用户的学习过程,因此在选择控制方法时,用户的使用体验是一个关键考虑因素37。
尽管在虚拟空间中,手势和语音交互已被用于导航任务(包括基础论文中讨论的街景系统),但这些交互方式在需要高精度和创造力的工作领域(如沉浸式家居设计)中的应用仍存在显著空白。先前的基础研究证实了多模态输入在可访问性方面的可行性,但其研究范围仅限于导航与场景观察,采用双手手势、简单指令输入,并且参与者数量较少。该研究未涵盖高保真度操作、精确的空间定位、材质编辑或协作式工作流程等关键挑战,而这些正是室内与建筑设计活动的核心要素。此外,测试对象局限于小范围同质化用户群体,限制了对更广泛人群及不同可访问性需求下可用性的观察。当前的虚拟现实设计工具主要依赖控制器操作,这限制了自然交互,并将存在运动或学习障碍的用户排除在外。因此,目前尚缺乏一种系统性设计与测试方案,能够整合手势与语音实现粗略及精细的物体操控,支持语音控制的数值调整,适应单手操作及有利于可访问性的交互方式,并在实际设计任务中通过广泛的用户体验分析进行验证38,39。填补这一空白,有望在多模态虚拟现实导航已有研究的基础上,开创一种以用户为中心的全新沉浸式家居设计理念。
多模态人机接口领域的最新进展探索了先进的感知与交互机制,以提升虚拟现实(VR)的可用性与沉浸感40。作者41提出了一种基于驻极体纳米纤维的摩擦电传感器,用于非接触式三维手势识别,证明了无需传统基于视觉的追踪即可实现高保真手势解析,从而实现更自然、无接触的VR控制。另一方面,研究者42提出了一种适用于头部固定VR系统的小鼠行为训练流程。该研究展示了受控的虚拟现实环境如何支持精确的行为测量与稳定的交互协议,并强调了在VR工作流程中可重复性与系统化设计的重要性。同时,作者43提出了一种可拉伸且具有黏附性的离子导电电极,其皮肤阻抗极低,可显著改善电生理信号的采集效果;这为生物集成感知技术开辟了道路,有望进一步提升扩展现实(XR)与虚拟现实(VR)的交互保真度。事实上,这些研究共同表明,传感器技术、训练协议和生理接口正迅速发展——其背后驱动力正是对更灵活、多模态交互框架的需求,例如本研究中提出的 gesture-voice 系统。
本方案提出了一种多模态手势-语音交互路径,能够实现单手可操作的手势控制、基于语音的数值调整以及高精度驱动的房屋设计,与当前主要支持导航或依赖控制器操作的虚拟现实交互模式形成鲜明对比。据我们所知,这是首个将手势与语音融合技术专门针对空间精度、材料修改及包容性设计流程进行优化的实验方案。
本研究的主要目标是创建一个支持手势和语音的虚拟现实(VR)系统,专为互动式家居设计活动而定制,并扩展多模态输入功能,以支持精确的家具放置、旋转、缩放以及材质或灯光编辑,同时保留常规的导航功能。核心目标之一是开发一个多模态融合引擎,能够整合手势、语音和上下文输入,从而在室内设计任务中实现粗略和精细的双重控制。该系统还引入了自适应交互模式,例如单手手势、面向无障碍需求的功能以及支持语音的精确指令,以服务于广泛的用户群体。
本研究还旨在进行全面的用户体验(UX)评估,将定量指标(包括任务完成时间、定位准确性和错误率)与可用性、工作负荷和用户满意度的定性评估相结合。相较于以往研究,本研究通过从基于街景的导航系统转向以任务为导向且注重精度的室内设计框架,实现了显著进步。本研究的核心贡献在于开发了一种基于手势和语音控制的虚拟现实(VR)环境,用于沉浸式家居设计,拓展了先前主要聚焦于街景导航中手势与语音集成的研究范围。
重要的是,以往的系统均未能有效结合手势-语音多模态通信,以专门支持对精度要求较高的家居设计操作,例如物体定位、缩放、旋转以及材质编辑。现有方法还缺乏自适应的交互方式选择,包括单手手势输入或基于语音的数值精细调节。本研究所提出的系统引入了一种全面的多模态交互范式,该范式融合了手势识别——通过MediaPipe Hands或基于VR头显的手部追踪实现——并结合时间卷积网络(Temporal Convolutional Network)分类器,以及由Whisper自动语音识别(ASR)和基于Transformer的意图分类模型驱动的语音识别与自然语言理解功能。
为确保系统稳定运行,采用了一种基于置信度仲裁的决策级多模态融合机制,将手势映射到空间选择任务,将语音指令映射到精细调整操作。该设计可实现虚拟家居设计环境中物体的精确定位、缩放、旋转及材质更换。工作流程遵循结构化处理管线,首先定义系统需求,设计手势与语音词汇表,开发多模态融合技术,并在Unity 3D中构建具备吸附工具、测量叠加层和材质预览功能的沉浸式虚拟现实环境;随后进行系统集成、初步测试,并通过对比研究开展用户体验评估。
该系统相较于传统的基于控制器的虚拟现实系统,具有低延迟的多模态交互(低于200毫秒)、自适应的无障碍支持以及更优的可用性。实验评估将量化任务完成时间、放置准确率、错误率、SUS评分、NASA-TLX工作负荷指标以及IPQ临场感评分。预期结果表明,多模态交互能显著提升基于虚拟现实的家居设计中的操作精度、效率及用户满意度。
访问受限。请登录或开始试用以查看此内容。
本研究获得了马来西亚泰莱大学沙阿南校区研究伦理委员会的批准。所有程序均遵守机构研究委员会制定的伦理准则,并符合《赫尔辛基宣言》的要求。在数据收集之前,已从每位参与者处获得知情同意。研究人员向参与者明确说明了研究目的,保证参与完全自愿,其回答内容将严格保密,且参与者可在任何阶段退出,不会产生任何后果。此外,已获得参与者书面知情同意,允许在学术出版物中使用匿名的互动数据和调查数据。本稿件中未包含任何个人身份信息、图像或敏感个人数据。
本研究提出了一种基于手势和语音的虚拟现实(VR)系统,专为沉浸式家居设计而构建,超越了当前以导航为导向的任务方法。该方法首先识别用户需求和设计活动,包括家具布置、物体缩放与旋转、材质编辑以及精确的房间测量。随后开发了一套手势交互系统,通过头戴设备追踪或MediaPipe Hands检测无约束的手势(如捏合、抓取和旋转),并利用轻量级机器学习模型(包括时间卷积网络,TCN)进行识别。为补充手势操作,建立了一套结构化的语音指令语法,结合基于Whisper的自动语音识别(ASR)与自然语言理解(NLU),以提取高层语义控制所需的意图和参数。两种模态通过多模态融合策略相结合,其中手势用于管理空间选择与操作,语音指令则提供精确调整,并引入基于置信度的仲裁机制以及通过撤销命令实现的错误恢复功能。
沉浸式设计环境部署在 Unity 3D 中,具备吸附功能、碰撞响应、测量叠加、交互式家具和材料库,以支持真实的设计工作流程。在正式评估之前,需进行初步测试,以确保交互的自然性、系统稳定性以及低延迟(<200 ms)。
参与者与抽样策略
本用户研究共招募了48名参与者,以确保结果的多样性和可推广性。参与者的年龄范围为19至62岁(平均值 = 32.4,标准差 = 10.7),其中男性26人,女性22人。为涵盖对沉浸式技术熟悉程度的差异,参与者根据虚拟现实(VR)使用经验分为三组:新手用户(n = 18),此前几乎未接触或从未使用过VR;中级用户(n = 17),偶尔使用VR;以及经验丰富的用户(n = 13),经常性使用VR,主要出于职业需求。为确保样本的可及性与包容性,研究还纳入了6名具有轻度行动障碍的参与者,以及4名因运动功能受限而偏好单手操作的参与者。所有参与者均具有正常视力或矫正后正常视力,且无人报告存在可能影响其使用VR的前庭系统或神经系统疾病。
采用平衡分配策略将参与者随机分配至三种交互条件:手势+语音(n = 16)、仅控制器(n = 16)和混合模式(n = 16)。参与者经验水平在三组间均匀分布,以避免偏差,并确保各条件下的任务难度具有可比性。所有参与者在实验开始前均签署了书面知情同意书。
随后,在三种交互条件下开展用户研究,例如手势语音、仅控制器和混合模式,以评估精度、效率和用户体验。定量指标包括放置精度、任务时长和错误率,而主观评估则采用系统可用性量表(SUS)、NASA任务负荷指数(NASA-TLX)和存在感问卷(IPQ),并辅以定性访谈。本文提出的系统具有三个主要创新点:利用多模态手势-语音融合实现虚拟现实中精确的物体操作,提供自适应且可访问的交互模式(如单手手势和语音回退),以及提供一个可复现的标注手势-语音指令语料库。这些环节共同确保了更高的准确性、有效性及用户体验,直接解决了基础论文中的不足,并推动了面向设计应用的沉浸式虚拟现实交互研究的发展。图1展示了所提出方法的架构。
如图1所示,所提出方法的系统架构从输入模态开始,其中手势通过EgoGesture和IPN Hand等数据集进行记录,语音指令则来自Fluent Speech Commands数据集。这些输入通过手势识别和语音识别模块独立处理,以生成空间和语义数据。两个数据流在多模态融合层中进行融合,该层对齐手势与语音输入,以生成一致的指令。融合后的数据被用于虚拟现实(VR)交互层,使用户能够实时对物体进行放置、旋转、缩放和材质修改等操作。最后,处理后的交互结果在输出层呈现,构建出一个注重可访问性、精确性和自然交互的沉浸式家居设计空间。
系统需求与任务定义
该设想的系统通过融入无障碍导向来增强虚拟现实(VR)导航模型,以促进基于精确性的家庭规划。我们将用户领域定义为
,其中
表示房主,
表示设计领域的专业人员,而
表示无障碍使用者(老年人或行动不便者)。每位用户执行一组核心任务 T = {放置、旋转、缩放、材质、照明、测量}。任务 t ∈ T 通过多模态输入完成:手势流 Gt(空间操作)和语音指令 Vt(语义参数)。系统通过融合策略将这些输入关联至具体操作:
(1)
其中 π 是决策级多模态函数。
系统需求要求低延迟交互:设
分别为手势识别、语音理解及融合所需的时间。
(2)
总响应根据沉浸式虚拟现实可用性阈值提供实时响应性。
对于任务准确率,设真实物体状态为(x, R, s, M, L)(位置、旋转、尺度、材质、长度),系统实现的状态为
。误差度量如下:
(3)
(4)
(5)
(6)
对于材料失配,
。
两种模式均生成置信度分数 cg (手势)和 cv (语音),并进行归一化处理,使得 cg + cv = 1。融合仲裁通过最小化加权误差实现:
(7)
其中 lg, lv 为模态特定的损失。如果
,系统将请求澄清提示,从而对不明确的指令具有鲁棒性。
最后,评估指标包括任务完成时间 Tt、错误率 Et,以及来自 NASA-TLX、SUS 和 IPQ 的工作负荷评分。我们引入了一个综合任务绩效指数:
(8)
在不同用户间应尽量减小差异,且需满足SUS评分≥70,并相较于基于控制器的传统VR,降低NASA-TLX评分。
数据集收集与预处理
本系统基于手势数据(用于基于 TCN 的识别)和语音指令数据(用于自然语言理解/自动语音识别)。为此,我们使用了三个主要数据集:EgoGesture 用于虚拟现实类环境中动态连续手势的识别,IPN Hand 用于补充自然的短时手势,Fluent Speech Commands44 用于训练对设计相关语句的语音驱动语义理解。可选数据集包括用于静态手势检测器预训练的 HaGRID,以及用于通用自动语音识别预训练的 Mozilla Common Voice,但这两者均非必需。该选择可在覆盖两种模态的同时,尽可能保持数据集范围的合理性与可重复性。表 1 展示了本研究中所用数据集的详细信息。
本文中的数据集选择至关重要,因为每个数据集均旨在应对多模态虚拟现实交互的不同场景。EgoGesture 数据集提供了一个大规模、自然状态下的手势采集,能够在不同光照和环境条件下仍保持高识别性能。由于 IPN Hand 数据集专为无限制、连续的手部动作用而设计,因此特别适用于高精度控制操作和实时手势分割任务。此外,Fluent Speech Commands 数据集提供了带有语义标注的语音指令,对于实现虚拟现实中准确且自然的意图识别至关重要。综合来看,这些数据集在手势与语音模态上实现了互补覆盖,提供了多样性、鲁棒性以及日常使用场景下的良好性能,从而提升了对所提出系统的评估质量。除了公开数据集外,我们还使用一个独立的内部数据集验证了该协议,该数据集包含来自10名新参与者的312个手势样本和128条语音指令。这一独立验证证实了该协议的可重复性与鲁棒性。
数据预处理
在模型训练之前,所收集的信息会系统地进行标准化、采样和增强:
手势序列归一化
手势视频序列被表示为骨骼关节特征的多变量时间序列:
(9)
其中,Ti 表示第 i 个手势的长度,d 为特征维度(例如,手部关节位置)。由于不同手势的长度 Ti 可能不同,我们将其重采样为固定的序列长度 T:
(10)
这使得所有手势样本,无论录制时长如何,均可与一个可用于 TCN 训练的标准时间长度进行比较。
特征标准化
为了消除用户之间以及记录条件之间的量级差异,对每个特征空间进行标准化处理:
(11)
其中
是特征 j 的均值,σj 是其标准差。以这种方式进行归一化可确保特征具有单位方差且均值居中,从而最小化手势执行中的个体差异。
数据增强
引入合成扰动可提高对变异性的鲁棒性。时间抖动首先会随机偏移序列对齐位置:
(12)
其中 δ 为帧中的最大抖动。噪声注入的第二步是向特征添加高斯扰动:
(13)
这些增强方法使模型能够有效应对实际虚拟现实交互中的时序不规则性和传感器噪声。
语音预处理
每个语音语句首先被映射为对数梅尔频谱图表示:
(14)
其中 F 为频率箱的数量,T′ 为时间帧的数量。为补偿录音过程中的变异性,对频谱图特征进行如下归一化处理:
(15)
其中μV和σV 分别为语料库上的全局均值和标准差。这为自动语音识别(ASR)和自然语言理解(NLU)模型提供了稳定的声学特征空间。
意图-槽位编码
除了声学特征外,每条语音指令都标注了结构化的语义槽位:
(16)
例如,“将椅子旋转15度”对应于(动作 = 旋转,对象 = 椅子,位置 = 无)。这种系统性编码使系统能够推导出特定设计的参数,并将其转换为可执行的虚拟现实操作。
基于时间卷积网络(TCN)的手势交互设计
手势交互设计定义了用户在虚拟现实家居设计系统中如何通过自然的手势与虚拟对象进行交互。该设计始于构建手势词典——即手势与系统功能之间的对应关系。例如,抓取手势可用于控制对象的放置,捏合手势可用于控制对象的缩放,而旋转手势则可围绕选定的轴线转动对象。
在所考虑的系统中,EgoGesture 和 IPN Hand 作为训练时间卷积网络(TCN)的基础手势数据集,而 Fluent Speech Commands 则通过支持语音交互的功能对系统设计进行补充。三者结合,实现了多模态的虚拟现实交互。
来自数据集的手势表示
来自 EgoGesture 或 IPN Hand 的一系列手势构成一个多变量时间序列:
(17)
(18)
其中,T 是预设的帧数(重采样后),d 是骨骼特征的维度数(例如,三维关节位置)。该数据集包含标签 y(i) ∈ y,表示 C 个手势类别中的某一类。
时间卷积编码
我们利用时间卷积网络(TCN)对动作进行实时分类。TCN 能够捕捉动作序列中的短期和长期依赖关系。与循环神经网络(RNN)不同,TCN 采用扩张因果卷积,从而实现高效的并行计算。
TCN 通过因果扩张卷积应用这些序列,以学习短期和长期依赖关系:
(19)
其中,dL 是第 l 层的扩张因子,K 是卷积核大小,σ 是非线性激活函数(ReLU)。感受野取决于:
(20)
需要TCN能够覆盖不同时长的手势。
手势分类
最后一个隐藏状态通过 Softmax 分类器进行处理:
(21)
训练目标由交叉熵定义:
(22)
与语音命令的集成
空间操作(移动、旋转、缩放)由 EgoGesture 和 IPN Hand 的手势识别实现,而语义命令则采用 Fluent Speech Commands 数据集。每条语音指令都被转换为结构化的槽位表示:
该表示通过提供参数(例如,“将椅子旋转 15°”)来增强手势输入。
然后将两个输出合并:
(23)
其中 o(i) 为虚拟现实控制基元(位置、缩放、旋转)。
时序卷积网络(TCN)通过在输入序列(如手势或语音信号)上采用扩张的一维卷积,能够有效处理序列数据,如图2所示。与循环模型相比,TCN利用卷积滤波器来学习短期和长期的时间依赖关系。通过使用带有跳跃连接的残差块,可在训练过程中提供稳定性并防止梯度消失,而堆叠的TCN层则使网络能够学习多尺度的时间模式。最终,全连接分类层将学习到的时间特征映射为输出标签,例如手势类别或语音意图。该设计特别适用于连续手势识别和语音指令理解,因其兼具计算效率与强大的时间建模能力。
表2总结了所提出的用于手势识别系统的时序卷积网络(Temporal Convolutional Network)的整体架构设计和训练配置。该模型包含四个残差TCN模块,每个模块均基于扩张因果卷积,使网络能够建模短期和长期的时间依赖关系。这些依赖关系对于区分动态手势(如抓取、旋转和捏合)至关重要。通过使用大小为3的卷积核以及[1,2,4,8]的扩张因子,可在不增加计算成本的情况下高效扩展时间感受野。为了提升在不同用户和录制条件下的泛化能力,每个模块中均采用了层归一化和0.25的丢弃率(dropout rate)。在训练过程中,采用Adam优化器,学习率为1 × 10-3,批量大小为32,序列长度为64帧,从而在准确性和实时响应之间实现最佳平衡。在推理阶段,采用滑动窗口策略,使得每20-25毫秒即可完成一次手势预测,同时保持端到端延迟低于120毫秒。该架构与超参数组合在手势分类中实现了高准确率(约94%的定位准确率),同时保持了实时交互能力,使TCN能够胜任沉浸式虚拟现实(VR)操作任务。
语音交互设计(ASR+NLU)
语音交互组件通过语义化和参数化的语音指令,补充了基于手势的空间控制功能,用于VR家居设计系统。 spoken input a(i) 首先被录制为原始音频,并转换为对数梅尔频谱图:
(24)
其中 F 是时间间隔长度的时间频率 T 间隔数。该表示法保留了语音的频谱和时序模式,并经过归一化处理,以消除说话人和环境变化带来的差异:
(25)
将归一化的频谱图输入至类似Whisper的自动语音识别(ASR)模型中,该模型将声学特征转换为一个令牌序列:
(26)
其中每个均为词或子词单元的标记。此类转录结果被输入自然语言理解(NLU)模型,以捕获结构化语义。更准确地说,NLU 会预测意图类别和语义槽位:
(27)
例如,“将椅子旋转十五度”这一语句可映射为(动作 = 旋转,对象 = 椅子,位置/参数 = 15°)。
然后将已识别的意图-槽位框架转换为可在虚拟现实系统中实现的数学指令:
(28)
其中 u(i) 可以是数值变换(例如 15° 旋转)或类别变化(例如材料更换)。
最终通过基于置信度的仲裁机制实现鲁棒性。如果语音识别(ASR)置信度分数 p(z) 或自然语言理解(NLU)置信度分数 p(s) 小于阈值 τ,系统将请求澄清或默认切换至基于手势的控制。这确保了语音指令的准确性和清晰性,从而提升了在需要精确操作的设计任务中的可用性。
多模态融合设计
所提出的虚拟现实系统中多模态融合的优势在于,语音理解与手势检测被整合到单一的决策过程中,而非分别处理。手势模块通过TCN输出分类结果
,而语音模块则提供意图-槽位表示 s(i)。为融合这两类信息,系统采用基于置信度仲裁的决策级融合方法。
使手势分类器提供手势类别的概率分布:
(29)
并让自然语言理解模型输出意图-槽位概率:
(30)
其中,a、o 和 p 分别表示从语音输入中提取的动作、对象和参数槽位。融合步骤通过结合两种模态的置信度得分来计算联合决策:
(31)
其中 α∈[0,1] 根据系统置信度动态设定(例如,当手势更明确时取较高值,当语音更清晰时取较低值)。
算法 1:多模态融合(X, a):
输入:
X = 预处理后的手势序列,a = 音频指令
输出:
O = VR 动作指令
步骤 1:手势识别
步骤 2:语音理解
步骤 3:融合决策
否则:
步骤 4:错误处理
):
请求用户澄清
否则:
将 O 发送至 VR 系统
返回 O
该算法1通过在手势输入和语音输入之间切换,为虚拟现实设计工作生成强有力的指令。手势模块(TCN)首先解析手部动作(如旋转或缩放),并根据模型的置信度分配置信分数。与此同时,语音模块也通过自动语音识别(ASR,例如Whisper)将语音转换为文本,并利用自然语言理解(NLU)识别语义意图,例如“将椅子旋转15°”。两个模块均返回各自的预测结果及相应的置信分数。随后的融合步骤对这两个输出进行权衡。当两种输入均明确时,系统根据各自的置信度水平按比例组合二者;当某一输入模糊(例如语音中存在噪声或手势识别不确定)时,系统将优先采纳另一方更明确的输入;最后,若两者均不明确,系统将请求用户进一步澄清,以避免错误。该机制使融合过程具备自适应性(权重根据输入质量动态调整)、鲁棒性(可应对噪声或缺失数据)以及高准确性(充分利用手势与语音各自的优势)。
参与者
本研究纳入一组志愿者,招募对象包括大学生和从事设计相关工作的专业人员,以收集关于虚拟现实(VR)可用性的多样化意见。参与者的年龄范围涵盖青年至中年,其先前的VR使用经验水平各不相同,包括初学者、偶尔使用者和高级用户。所有参与者均具有正常视力或矫正后正常视力,且无已知会影响基于手势交互能力的运动功能障碍。存在严重言语障碍、上肢活动能力显著受限,或既往有VR诱发的晕动病史的个体被排除在外,以确保参与过程的安全性和一致性。所有参与者均签署知情同意书,且评估程序已获得机构审查委员会的批准。本小节明确指出了参与评估的人员特征,有助于研究的可重复性。
实验设置
本研究所提出的实验设置采用了所开发的多模态虚拟现实(VR)系统,该系统部署在一款具备集成手部追踪功能和RGB摄像头的消费级VR头显上,用于捕捉手势。系统配备高性能台式计算机,以实现实时的手势识别、自动语音识别(ASR)及多模态融合技术处理。VR环境基于Unity 3D构建,包含一个可配置家具、材质和照明元素的家居设计房间。该设置采用基于Whisper的自动语音识别(ASR)进行语音转录,并集成基于Transformer的自然语言理解(NLU)模块以识别用户意图。此描述已从结果部分移至此处,以便在讨论实验结果前提供适当的技术环境概述。
主观测试场景
参与者与一个模拟的家居设计环境进行交互,该环境包含一个配备家具的客厅、一间卧室和一个小型工作区域。在每个场景中,用户需根据真实的室内设计情境,改变周围环境中的虚拟物体和环境变量。例如,参与者被要求相对于参考点放置沙发、将椅子朝特定方向旋转、将桌子调整至目标尺寸,或修改墙面材质/光照配置。选择这些场景的原因在于,它们代表了典型的室内设计任务,能够同时考验基于手势的控制(在空间精度方面)和基于语音的控制(在语义指令方面)。本小节直接回应了审稿人关于用户评估系统时所处主观测试条件的疑问。
任务设计
参与者完成了一系列结构化的练习,涉及物品操作和设计交互的不同方面。主要任务如下:1)家具摆放:参与者将物体放置在目标坐标处。2)旋转任务:在此任务中,用户需调整物体朝向,使其与参考角度一致。3)缩放任务:此任务要求将家具调整至预设尺寸。此外,4)材质/颜色编辑:参与者通过语音指令更改纹理或调节光照。还提供了可选的导航任务,用于评估其在虚拟房间中的空间感知能力。每项任务均设有明确目标、可量化的结果指标和固定的时间限制,以确保准确性和效率均能得到有效评估。
实验步骤
为确保参与者之间的一致性,评估按照预定顺序进行。首先向用户介绍系统,并简要演示手势和语音交互模式。初始校准阶段允许针对个体的手部姿势和语音特征进行适应性调整。随后,用户进行短暂的练习环节,以熟悉两种交互模式。正式评估要求用户在三种交互条件下完成所有任务:仅使用控制器、仅使用手势、以及结合手势与语音的多模态输入。为减少学习效应,各条件的顺序进行了交叉平衡。评估结束后,受试者填写标准化的评估量表,如系统可用性量表(SUS)、NASA任务负荷指数(NASA-TLX)和存在感问卷(IPQ),并参与简短的定性反馈访谈。
评估指标
该结构化流程建立了方法学上的透明性,便于开展可重复的研究。通过结合客观与主观指标,全面评估系统性能。客观指标包括任务完成时间(衡量效率)、放置精度(量化为相对于目标位置或旋转角度的偏差)以及错误率(定义为系统发生的输入误分类或非预期操作的次数)。主观指标通过经过验证的问卷进行采集:采用系统可用性量表(System Usability Scale)测量感知可用性,使用NASA-TLX量表评估心理和身体负荷,并通过I组临场感问卷(I group Presence Questionnaire)测量在虚拟现实中的沉浸感与临场感。这些内容已从结果部分适当地移至此处,以在呈现任何结果之前说明性能的测量方法。
虚拟现实环境、系统集成与评估
语音与手势指令的主要平台是一个部署了系统的交互式虚拟现实环境。通过集成的家具、纹理和光照元素库,在 Unity 3D 中创建虚拟房间。该环境使用户能够实时组织、自定义和编辑物品。通过吸附功能、碰撞检测和测量叠加,提升操作准确性,使物体能够自然对齐。光照与材质的实时渲染增强了设计体验,为每一次交互提供即时反馈。
在验证手势识别、语音理解及多模态融合等各个独立模块后,将它们整合为一个统一的处理流程。系统设计具有低延迟特性,使用户的指令几乎能立即在虚拟现实环境中得到响应。通过少量成员开展初步测试,以优化交互流程。迭代过程包括完善手势词汇表、验证语音命令语法,以及确保系统在持续使用过程中具有自然且可靠的用户体验。
本研究将采用一种综合性方法,比较三种交互模式,包括多模态手势-语音融合、仅控制器输入以及混合模式,以评估用户体验。参与者需完成包括材料切换、旋转和物体放置在内的各项任务。为评估操作表现,将采集作业完成时间、放置准确性和错误次数等客观指标。同时,通过标准化问卷收集参与者的主观评分,例如系统可用性量表(SUS)、NASA-TLX认知负荷量表以及用于评估沉浸感的IPQ问卷,并辅以参与者访谈提供补充信息。这种双重评估方法同时涵盖了可量化的性能指标与主观用户体验。
该系统的优势在于将多模态融合应用于超越基本导航或交互的精确设计任务。该技术通过结合语音指令的语义信息与手势的空间优势,提供了一种更自然、准确且易于使用的交互方式。系统还通过提供可调节的无障碍功能(如仅语音回退和单手手势识别),增强了包容性。最后,本研究提供了一个系统化标注的语音-手势交互多模态数据集,有助于推动沉浸式界面设计领域的后续研究,并提升研究的可重复性。
图3展示了所实现程序的典型截图,更直观地呈现了所构建的虚拟现实室内设计系统。图3A描绘了沉浸式虚拟现实环境,用户可在其中探索并查看房间布局。图3B展示了如何通过自然的手部交互,在基于手势的对象操作过程中实现对虚拟家具的选取、移动和旋转。图3C展示了集成的语音界面,其中麦克风和语音反馈符号用于验证用户发出的语音指令,以实现空间调整或对象放置。综上所述,这些所提出的多模态虚拟现实系统的截图表明,该系统已完全实现,支持实时的手势与语音交互。
访问受限。请登录或开始试用以查看此内容。
所设计的多模态虚拟现实家居设计系统通过三个基础数据集进行了验证:EgoGesture(动态手势)、IPN Hand(持续性手势)和 Fluent Speech Commands(带意图-槽位标签的语音指令)。这三个数据集共同提供了全面的训练与评估基础,涵盖了手势识别和基于语音的语义理解。验证结果表明,与仅使用控制器或混合输入方式相比,手势与语音的融合显著提高了任务准确率并降低了操作负荷。
实验测试表明,多模态融合系统将放置精度提高了约30%,从而缩短了任务执行时间并降低了错误率。使用标准化量表(SUS、NASA-TLX、IPQ)进行的主观评估显示,系统的可用性评分提高,认知负荷降低,沉浸感评分更高。这些发现共同证实,将手势用于空间操作、语音命令用于语义/数值微调的结合方式,为基于虚拟现实的家居设计建立了一种更自然且高效的人机交互范式。该系统部署在一款消费级VR头显上,具备内置运动追踪功能,可实现沉浸式可视化和实时空间感知。系统采用RGB相机记录手部动作并识别手势,从而无需依赖直接的物理控制器即可完成交互。数据处理由一台高性能工作站完成(见材料表),...
访问受限。请登录或开始试用以查看此内容。
本研究的结果推动了基础论文所提出技术的发展,基础论文主要展示了结合手势与语音模式进行设计任务时,沉浸式虚拟现实导航在可访问性方面的优势。在所有客观和主观性能指标上,多模态系统的表现均优于基于控制器及混合方法,任务完成时间更短、放置准确率更高、错误率更低。此外,SUS、NASA-TLX 和 IPQ 等可用性指标也表明用户满意度更高、工作负荷更低、沉浸感更强。与关注导航过程中可访问性的基础论文不同,本研究证明了在执行虚拟设计任务时,多模态虚拟现实交互能够提升精确性、创造力和包容性。然而,低光照下手势误分类和嘈杂环境下语音误识别等问题仍然存在,表明仍有进一步优化的空间。总体而言,本研究再次证实了多模态交互在提升虚拟现实可用性、可访问性和包容性方面的潜力。
本研究提出的基于手势与语音的多模态虚拟现实系统所得结果,验证并补充了本文引用的先前研究成果。与Lee和Kim²以及Nagi和Al-Fuhaidi³的研究类似,这些研究均表明自然手势识别可增强人机交互的直观性,我们的研究也证实了手势是一种有效的空间操作模态。同时,针对先前研究强调的构建强健识别框架以降低输入错误的重要性4,本研究通过将手势...
访问受限。请登录或开始试用以查看此内容。
作者声明无利益冲突。
作者衷心感谢建筑、建造学院的机构支持 & 设计学院,泰勒大学,感谢其在本研究期间提供资源与学术指导。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 自我中心手势数据集(EgoGesture Dataset) | 南洋理工大学 | DOI: 10.1109/TMM.2018.2808769 | 用于动态手势识别训练的大规模自我中心手部手势数据集。 |
| 流利语音命令数据集(Fluent Speech Commands Dataset) | Fluent.ai / 阿尔伯塔大学 | DOI: 10.48550/arXiv.1804.04363 | 用于语音意图识别和基于槽位的语义理解的ASR/NLU训练数据集。 |
| HaGRID数据集(可选) | Sber AI / 开源 | v1.1 | 用于静态手部手势检测器预训练的可选数据集。 |
| Igroup存在感问卷(Igroup Presence Questionnaire, IPQ) | igroup.org | 不适用 | 用于测量虚拟现实环境中的沉浸感与存在感。 |
| IPN手部数据集(IPN Hand Dataset) | 韦拉克鲁斯大学 | DOI: 10.1109/CVPRW50498.2020.00241 | 用于连续、自然手部手势识别与分割任务的数据集。 |
| Matplotlib / Seaborn | 开源 | 最新稳定版本 | 用于性能指标和评估结果的可视化。 |
| MediaPipe Hands | Google Research | 开源(GitHub) | 用于实时手部与手势追踪,实现手势输入识别。 |
| Mozilla通用语音数据集(可选) | Mozilla基金会 | 版本17 | 用于在通用语音数据上对ASR模型进行预训练的可选数据集。 |
| 多模态融合层(Multimodal Fusion Layer) | 自定义算法 | 不适用 | 基于置信度加权仲裁机制融合手势与语音输入流。 |
| NASA-TLX工作负荷评估 | NASA人因工程组 | 不适用 | 用于分析参与者的认知工作负荷。 |
| 自然语言理解模块(NLU Module) | 自定义(基于BERT / RoBERTa) | 不适用 | 用于从转录的语音输入中提取语义意图和槽位信息(动作、对象、参数)。 |
| NumPy / Pandas / OpenCV | 开源 | 最新稳定版本 | 用于数值运算、数据预处理和视频帧处理。 |
| Python编程语言 | Python软件基金会 | 版本3.10+ | 用于实现机器学习模型(TCN、ASR、NLU、融合模块)。 |
| PyTorch深度学习框架 | Meta AI | 版本2.0+ | 用于构建和训练手势识别(TCN)和NLU模型。 |
| RGB摄像头 | Logitech / RealSense | Logitech C920 或 Intel RealSense D435 | 用于手部手势捕捉和运动识别输入。 |
| 系统可用性量表(SUS)问卷 | 标准评估工具 | 不适用 | 用于评估虚拟现实系统的主观可用性。 |
| 时间卷积网络(TCN) | 自定义实现(PyTorch / TensorFlow) | 不适用 | 用于从时间序列骨骼数据中进行动态手势识别。 |
| Unity 3D引擎 | Unity Technologies | 版本2022.3 LTS | 用于开发具有交互式家具、材质编辑和实时渲染的沉浸式虚拟现实环境。 |
| VR头显 | Oculus (Meta) / HTC Vive | Oculus Quest 2 或 HTC Vive Pro | 用于虚拟现实交互过程中的沉浸式可视化和空间追踪。 |
| Whisper ASR模型 | OpenAI | Whisper(基础模型) | 将语音转换为文本的自动语音识别引擎。 |
| 工作站 | 定制组装PC | Intel Core i7 / NVIDIA RTX 3070 / 32 GB内存 | 用于手势与语音模型的实时处理、训练和推理。 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可