Article de recherche

Un système de réalité virtuelle contrôlé par gestes et voix pour un design résidentiel immersif : conception système et analyse de l’expérience utilisateur

409 vues

DOI :

10.3791/70051

3 mars 2026

Dans cet article

Résumé

Cet article présente un système de réalité virtuelle contrôlé par des gestes et une voix pour un design de maison immersif, qui améliore la précision, l’ergonomie et l’accessibilité grâce à la fusion multimodale des entrées gestes et vocales. Les résultats expérimentaux indiquent des temps de tâche plus courts, une précision de placement accrue et une satisfaction des utilisateurs accrue par rapport à la pratique traditionnelle.

Résumé

L’interaction basée sur les gestes et la voix en VR a montré des promesses dans diverses applications ; cependant, les systèmes existants sont freinés par leur accent sur les tâches de navigation, leur dépendance aux gestes à deux mains, le manque de précision fine et les tests sur de petites populations homogènes. Ces limitations limitent l’applicabilité à des flux de travail complexes centrés sur la conception. Pour remédier à ces limitations, nous introduisons un système de réalité virtuelle contrôlé par gestes et voix pour un design immersif de maison, qui intègre la fusion multimodale d’entrées gestuelles suivies à la main et d’instructions en langage naturel pour un placement précis du mobilier, le choix des matériaux et l’ajustement spatial. Trois aspects de la nouveauté du système sont (i) les modes d’interaction adaptatifs pour supporter une utilisation à une main, les commandes vocales numériques et l’ajustement de la précision de grossièreté à fine ; (ii) architecture de fusion multimodale fusionnant les informations de geste, de parole et de contexte pour une précision sub-centimétrique ; et (iii) cadre d’évaluation de l’expérience utilisateur sensible aux tâches, adapté aux processus de conception de la maison. Le processus de développement suit un pipeline systématique, allant de l’analyse des exigences et de la conception des lexiques gestes et vocaux, à la reconnaissance multimodale des intentions, à l’assemblage de scènes VR avec snapping et alignement, et aux tests itératifs. Les résultats expérimentaux sur une grande variété de populations de participants montrent une diminution de 30 % de l’erreur de placement et des améliorations substantielles de l’utilisabilité et des évaluations de charge de travail par rapport aux interactions basées sur le contrôleur. Les résultats suggèrent le potentiel de la VR multimodale pour créer des expériences de design de maison accessibles et engageantes.

Introduction

La réalité virtuelle (VR) est un environnement interactif généré par ordinateur qui produit une expérience tridimensionnelle dans laquelle les utilisateurs peuvent voir, interagir avec la technologie et communiquer avec elle comme s’ils étaient réellement présents. Dans le contexte de cette étude, la réalité virtuelle est considérée comme un environnement d’interaction multimodal, plutôt que comme une simple technique d’affichage visuel. Les derniers systèmes VR intègrent l’engagement visuel avec la reconnaissance gestuelle, les sens spatiaux et l’entrée vocale naturelle, permettant aux utilisateurs d’utiliser des objets simulés avec une grande précision. Cette compréhension est cohérente avec les recherches actuelles en VR qui privilégient l’immersion, l’engagement et les expériences naturelles de l’utilisateur. Ses domaines d’application couvrent la performance,l’enseignement 2, le traitementmédical 3 etles voyages 4. La VR permet aux gens d’interagir et de se connecter à des mondes qui ne seraient pas accessibles dans la vie réelle en simulant des environnements réels. Pour les processus de conception de maisons, où les utilisateurs doivent percevoir des agencements spatiaux, contrôler des objets et recevoir un retour en temps réel sans nécessiter de mouvement physique, ces fonctionnalités d’immersion sont particulièrement utiles. Ces fonctionnalités peuvent ouvrir de nouvelles possibilités, en particulier aux utilisateurs ayant des mouvements physiques incomplets. Les membres de groupes défavorisés de manière informelle, en particulier les personnes âgées et celles ayant un alphanumérique minimal, verront leurs activités de plein air limitées par plusieurs facteurs, tels que des contraintes physiques, des problèmes de mobilité et des difficultés d’accès à la technologie numérique dues à des limitations liées à l’âge. Il est donc nécessaire de porter une attention constante à la recherche qui rendra indirectement le monde extérieur accessible à ces personnes grâce à l’expertise en RV. Ce besoin d’une attention continue à la recherche soutient non seulement la création d’expériences VR orientées vers l’accessibilité, mais favorise aussi le développement de systèmes allant au-delà des tâches de navigation de base. En effet, les environnements immersifs de design de maison — lorsqu’ils sont contrôlés par des gestes naturels et une voix — peuvent offrir aux utilisateurs âgés, aux personnes ayant des troubles moteurs et aux populations numériquement vulnérables des moyens intuitifs d’interagir avec des environnements spatiaux complexes. Permettant un accès indirect aux espaces extérieurs et aux tâches créatives, ces systèmes contribuent à la fois à l’indépendance fonctionnelle et au bien-être émotionnel. C’est sur cette base que cette étude introduira un système multimodal de conception de maisons en VR. Par conséquent, c’est le désir d’une attention constante à la recherche qui contribuera à rendre le monde extérieur indirectement accessible à ces personnes utilisant la technologie VR. Des études ont montré que les interventions basées sur la VR créées pour les personnes âgées peuvent présenter plusieurs avantages, tels que réduire le risque de chutes en améliorant le contrôle et la flexibilité posturales6, ainsi que renforcer la régulation posturale générale et lafermeté 7. De plus, la disponibilité de matériel VR est de plus en plus adapté spécifiquement à la population adulteâgée 8,9. Même si l’interaction en VR a évolué, la plupart des systèmes actuels reposent principalement sur des manettes et des gestes à deux mains, ce qui limite l’accessibilité et la précision pour les tâches nécessitant de la conception. En développant ces fonctionnalités de mobilité, notre travail étend la VR au-delà de la simple observation en permettant une gestion active, précise et réaliste des éléments de design d’intérieur grâce à des méthodes de geste et de parole

La VR possède trois propriétés liées : communication, implication etréflexion 10. Le niveau d’engagement et la force d’interaction avec les objets simulés influencent directement l’imagination des utilisateurs dans l’atmosphère virtuelle. Selon les étapes de l’immersion, les schémas de RV sont classés en VR non immersive, VR semi-immersive et VR entièrement immersive, chacune utilisant différentes combinaisons de méthodes, stratégies et limites de communication. 11 La VR non immersive permet la communication avec des environnements virtuels sur ordinateur de bureau ou des écrans tactiles sur des appareils portables via une souris, etsigne 12, 13, 14. La VR semi-immersive comprend généralement un grand écran, une organisation et des écrans, offrant une expérience cinématographique, mais manque souvent de suivi positionnel lorsqu’elle est utilisée en groupe. Les connexions basées sur les gestes sont étudiées depuis le début de VR15 pour rendre l’utilisation de la technologie VR confortable et familière. Dans une interface basée sur les gestes, des signes physiques du corps comme les mouvements de la main sont utilisés pour communiquer avec un système informatique.

Une bordure gestuelle est une réalisation courante du principe plus général d’une interface utilisateur naturelle (NUI), qui peut être appliquée pour obtenir de la transparence d’interface en VR basée sur un HMD. Les aspects favorisant la présence en VR ont été étudiés plus tôt 16, 17 ; néanmoins, il existe peu d’études sur la présence en arrière-plan de l’interface utilisateur basée sur les gestes. Comprendre les influences qui peuvent influencer la diffusion de la VR grâce à une interface utilisateur basée sur les gestes peut être bénéfique lors de la conception de technologies immersives à venir. Ainsi, du point de vue de la communication par occurrence et par geste, nous avons étudié l’expérience utilisateur d’un engagement immersif en VR basé sur une interface utilisateur basée sur les gestes. Pour les personnes socialement vulnérables, le matériel d’évaluation des autoroutes à 360°, une sous-catégorie de la réalité virtuelle (VR), peut être un outil efficace. Avec cette technologie, les utilisateurs peuvent explorer virtuellement le globe sans mouvement physique, voyager vers différents lieux et communiquer socialement avec d’autres utilisateurs, avec une fonctionnalité multipartite. Pour les personnes physiquement et environnementales en difficulté, cette implication peut être un complément utile à l’activité en plein air. Au-delà de la simple navigation, les possibilités éducatives rendues possibles par la technologie d’opinion à 360° s’étendent à de nombreux domaines de l’éducation.

Une revue systématique de la littérature, portant sur 64 sessions de formation, a mis l’accent sur les usages informatifs, les avantages et les propriétés de communication des vidéos VR à 360° et de la VR réelle. Les résultats indiquent que la VR à 360° peut améliorer la présentation, la motivation et la rétention de l’information chez les apprenants, favorisant une immersion accrue. Le chercheur21 a associé deux interfaces à une main et deux à deux mains dans un schéma de déplacement basé sur la téléportation. Les résultats montrent que les signaux à une main étaient perçus comme plus rapides à démarrer par ceux qui les préféraient, tandis que les signes à deux mains étaient jugés plus fiables, même si l’élément parle de téléportation seule et non de mouvement constant, comme utilisé dans cette œuvre.

L’hypothèse d’une plus grande cohérence pour les signes à deux mains et d’une plus grande rapidité initiale pour les signes à une main a été établie et utilisée comme prémisse pour cette étude. Une spécification plus détaillée des restrictions d’évaluation technologique, au-delà de la présentation et de la facilité de service, concernant la formation des opérateurs à remplir leurs responsabilités dans VR22 est également requise. Pour cette situation de formation, les panels instruisent les opérateurs à travers des activités, l’évaluation technologique étant un élément crucial. De plus, le postulat fondamental est que la technologie HT, si elle est correctement appliquée, peut également apporter des avancées dans le domaine de latechnologie 23,24. Il a été démontré dans des recherches récentes que les environnements virtuels sont non seulement utiles pour évaluer les services de direction en fauteuil roulant, mais ont aussi des usages bénéfiques, notamment une formation aux services flexibles qui seraient difficiles ou coûteux à recréer dans la vie réelle. Par exemple, l’auteur25 souligne que les simulateurs VR peuvent faciliter la généralisation de la direction des services vers des environnements physiques en offrant un environnement technologique compétent et inoffensif.

Le chercheur souligne également l’application des compétences virtuelles comme programme d’intervention pour la formation aux services en fauteuil roulant, soulignant son utilité et leur valeur bénéfique dans l’individualisation de l’exercice et l’amélioration des services de flexibilité. Cependant, pour des raisons de sécurité, les utilisateurs sont vérifiés et contrôlés à l’avance, en particulier dans des environnements de réalitévirtuelle 26,27. Une telle mise en œuvre permet aux personnes en situation de handicap physique de pratiquer et d’affiner leurs compétences en conduite en fauteuil roulant dans un environnement sécuriséet contrôlé 28. Ils peuvent vivre divers tests et scénarios virtuels, notamment la résolution de problèmes complexes, la navigation dans des espaces étroits ou l’exécution de manœuvres complexes. Pendant ce temps, les utilisateurs peuvent recevoir des retours immédiats sur leurs performances et acquérir de nouvelles stratégiesde mouvement. En plus de servir d’aide à la formation, la réalité virtuelle a des applicationsthérapeutiques 30. Offrir une technologie picturale immersive peut contribuer à renforcer l’assurance en soi, l’organisation et la réintégration physique. Les individus peuvent développer leurs compétences motrices et améliorer leur stabilité et leur stabilité. Les environnements de réalité virtuelle sont des représentations générées par ordinateur qui permettent aux utilisateurs de se sentir comme s’ils enfaisaient partie 31.

Cette situation est visualisée avec des écouteurs en réalité virtuelle ou d’autres stratégies. Les maquettes peuvent simuler des circonstances de risque ou des situations complexes avant leur mise en œuvre, telles que des événements médicaux ou l’exécution de certaines stratégies 32,33,34. Cependant, un avantage supplémentaire est la possibilité d’attacher des équipements de dispositifs, tels que des commandes, des ornements détecteurs de mouvement, des microphones ou des gilets, afin d’assurer une communication efficace entre l’employeur et le mécanisme35 dans un cadre inoffensif et soigneusement reproduit avant son utilisation réelle. Les substances virtuelles peuvent être utilisées dans différents modes, comme à l’aide de joysticks, d’instructions vocales ou de traînées filmées, comme dans une étudeKinect 36. Toutes les alternatives impliquent l’apprentissage pour les utilisateurs, donc l’expérience utilisateur est un critère dans le choix de l’approchede contrôle 37.

Bien que les gestes et l’interaction vocale dans les espaces virtuels aient été étudiés pour des tâches de navigation, y compris le système de vue de rue évoqué dans l’article de base, il existe un écart important dans l’application de ces modalités à des domaines de travail créatifs et axés sur la précision, tels que la conception immersive de maisons. L’étude fondamentale a prouvé que l’entrée multimodale était viable pour l’accessibilité, mais elle n’a englobé que la navigation et l’examen de la scène, utilisant des gestes à deux mains, une exécution de commandes simples et une petite population de participants. Elle n’englobait pas les difficultés de manipulation haute fidélité, de positionnement spatial précis, de montage de matériaux ou de flux de travail collaboratifs, qui définissent les activités de design d’intérieur et d’architecture. De plus, les tests visaient un groupe restreint et homogène d’utilisateurs, ce qui limitait les observations sur l’utilisabilité pour des populations plus larges et des besoins d’accessibilité différents. Les outils actuels de conception VR sont principalement basés sur des manettes, qui restreignent l’interaction naturelle et excluent les utilisateurs ayant des troubles moteurs ou d’apprentissage. En conséquence, il manque la conception et le test d’un système intégrant gestes et parole pour la manipulation grossière et fine, fournissant des modifications numériques contrôlées par la voix, accueillant des styles d’interaction à une main et propices à l’accessibilité, et testé par une analyse approfondie de l’expérience utilisateur dans des tâches de conceptionréelles 38,39. Combler ce fossé peut créer une nouvelle approche centrée sur l’utilisateur du design immersif de la maison, qui s’appuie sur des recherches antérieures en navigation VR multimodale.

Les développements récents dans les interfaces multimodales homme-machine ont exploré des mécanismes avancés de détection et d’interaction pour améliorer l’utilisabilité et l’immersion de VR40. L’auteur41 a présenté un capteur triboélectrique à base de nanofibres d’électret pour la reconnaissance des gestes 3D sans contact, démontrant que l’interprétation haute fidélité des gestes peut être obtenue sans suivi traditionnel basé sur la vision et permettant un contrôle VR plus naturel et sans contact. D’un autre côté, le chercheur42 a présenté une procédure d’entraînement comportemental robuste pour les systèmes VR fixés à tête chez la souris. L’étude a démontré comment les environnements VR contrôlés peuvent soutenir une mesure comportementale précise et des protocoles d’interaction stables, et a souligné l’importance de la répétabilité et de la conception systématique dans les flux de travail VR. Parallèlement, l’auteur43 a proposé une électrode ionico-conductrice extensible et adhésive avec une impédance cutanée ultra-faible pour améliorer l’acquisition du signal électrophysiologique ; cela ouvre la voie à une détection biointégrée qui pourrait encore augmenter la fidélité d’interaction entre la XR et la VR. En fait, toutes ces études montrent à quelle vitesse la technologie des capteurs, les protocoles d’entraînement et les interfaces physiologiques évoluent rapidement — tout cela parce qu’il y a un besoin de cadres d’interaction plus flexibles et multimodales, comme le système geste-voix proposé dans cette étude.

Ce protocole présente un chemin multimodal geste-voix qui permet des gestes accessibles à une main, des améliorations numériques basées sur la voix et une conception de maison axée sur la précision, contrairement aux modèles actuels d’interaction VR, qui supportent principalement la navigation ou la manipulation par manette. D’après notre compréhension, il s’agit du premier protocole qui combine la fusion geste-voix, spécifiquement ajustée pour la précision spatiale, la modification des matériaux et des processus de conception inclusifs.

Les objectifs principaux de ce travail sont de créer un système de réalité virtuelle (VR) habilité par les gestes et la voix, adapté aux activités de design de maisons engageantes, et d’élargir les capacités d’entrée multimodales pour soutenir un placement précis des meubles, une rotation, un ajustement et un montage de matériaux ou d’éclairage en plus des fonctions de navigation habituelles. Un objectif central est de développer un moteur de fusion multimodal qui intègre gestes, voix et entrées contextuelles afin d’assurer un contrôle à la fois grossier et à grain fin lors des tâches de design d’intérieur. Le système introduit en outre des modes d’interaction adaptatifs, tels que des gestes à une main, des fonctionnalités axées sur l’accessibilité et des commandes de précision vocales, afin de prendre en charge un large éventail de groupes d’utilisateurs.

Ce travail vise également à mener une évaluation complète de l’expérience utilisateur (UX) qui combine des mesures quantitatives, notamment le temps d’exécution des tâches, la précision du placement et le taux d’erreur, avec des évaluations qualitatives de l’utilisabilité, de la charge de travail et de la satisfaction des utilisateurs. Une avancée significative par rapport aux études précédentes est réalisée en passant des systèmes de navigation basés sur la vue de rue à un cadre de design d’intérieur axé sur la tâche et axé sur la précision. La contribution clé réside dans le développement d’un environnement VR contrôlé par gestes et voix pour la conception immersive de la maison, élargissant ainsi le champ des recherches antérieures qui portaient principalement sur l’intégration geste-voix pour la navigation en vue de rue.

Il est important de noter qu’aucun système précédent n’a combiné efficacement la communication multimodale geste-voix spécifiquement pour des opérations de conception de maison dépendantes de la précision, telles que le positionnement des objets, la mise à l’échelle, la rotation et l’édition des matériaux. Les approches existantes manquent également d’alternatives d’interaction adaptative, notamment l’entrée de gestes à une main ou le raffinement numérique basé sur la voix. Le système proposé introduit un paradigme d’interaction multimodal complet qui fusionne la reconnaissance gestuelle — obtenue via MediaPipe Hands ou le suivi des mains basé sur casque VR — avec des classificateurs de réseau convolutionnel temporel, ainsi que la reconnaissance vocale et l’interprétation du langage naturel pilotés par des modèles ASR Whisper et de classification d’intention basés sur transformateurs.

Pour assurer un fonctionnement robuste, un mécanisme de fusion multimodale au niveau décisionnel avec arbitrage basé sur la confiance est mis en place, associant les gestes aux tâches de sélection spatiale et les commandes vocales aux raffinements précis. Cette conception permet un placement, un ajustement, une rotation précis et des changements de matériaux des objets dans des environnements virtuels de conception de maisons. Le flux de travail suit un pipeline structuré qui commence par la définition des exigences système, la conception de lexiques gestuels et vocaux, le développement de techniques de fusion multimodale, et la construction d’un environnement VR immersif dans Unity 3D équipé d’outils de snapping, de superpositions de mesure et d’aperçus de matériaux. Cela est suivi par l’intégration des systèmes, des tests pilotes et une évaluation de l’expérience utilisateur par des études comparatives.

Le système offre une interaction multimodale à faible latence (inférieure à 200 ms), un support adaptatif de l’accessibilité et une meilleure utilisabilité par rapport aux systèmes VR conventionnels basés sur contrôleur. L’évaluation expérimentale quantifiera le temps d’accomplissement des tâches, la précision du placement, les taux d’erreur, les scores SUS, les métriques de charge de travail NASA-TLX et les évaluations de présence IPQ. Les résultats attendus démontrent que l’interaction multimodale améliore significativement la précision, l’efficacité et la satisfaction des utilisateurs dans la conception de maisons basée sur la réalité virtuelle.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Cette étude a été approuvée par le Comité d’éthique de la recherche de l’Université Taylor, à Subang Jaya, Malaisie. Toutes les procédures respectaient les lignes directrices éthiques fixées par le comité de recherche institutionnelle et respectaient la Déclaration d’Helsinki. Avant la collecte des données, un consentement éclairé était obtenu de chaque participant. Ils ont été clairement informés des objectifs de l’étude, assurés que la participation était volontaire, que leurs réponses resteraient confidentielles, et qu’ils pouvaient se retirer à tout moment sans aucune conséquence. Un consentement éclairé écrit a également été obtenu pour l’utilisation d’interactions anonymisées et de données d’enquête dans les publications académiques. Aucune information personnelle identifiable, image ou donnée personnelle sensible n’est incluse dans ce manuscrit.

Le projet proposé formule un système de réalité virtuelle (VR) basé sur les gestes et la voix, conçu pour une conception immersive de la maison, surpassant les méthodes actuelles destinées aux tâches orientées vers la navigation. L’approche commence par identifier les besoins des utilisateurs et les activités de conception, y compris le déploiement du mobilier, la mise à l’échelle et la rotation des objets, l’édition des matériaux et les mesures précises des pièces. Un système d’interaction gestuelle est alors développé, où des gestes de la main non contraints (tels que pincer, attraper et tourner) sont détectés via le suivi basé sur un casque ou les mains MediaPipe, et identifiés par des modèles légers d’apprentissage automatique, y compris les réseaux convolutionnels temporels (TCN). Pour compléter les gestes, une grammaire organisée des commandes vocales est établie, combinée à la reconnaissance automatique de la parole (ASR) basée sur le chuchotement et à la compréhension du langage naturel (NLU), afin de dériver les intentions et paramètres pour un contrôle sémantique de haut niveau. Les deux modalités sont combinées dans une stratégie de fusion multimodale, où les gestes sont utilisés pour gérer la sélection et la manipulation spatiales, et les commandes vocales permettent d’offrir des raffinements précis, complétés par un mécanisme d’arbitrage basé sur la confiance et la récupération d’erreurs via des commandes d’annulation.

L’environnement de design immersif est déployé en Unity 3D, avec des snappings, des réponses aux collisions, des superpositions de mesure, ainsi qu’une bibliothèque interactive de meubles et de matériaux permettant des flux de travail réalistes. Les tests pilotes sont réalisés pour garantir la naturalité de l’interaction, la stabilité et la faible latence (<200 ms) avant l’évaluation formelle.

Participants et stratégie d’échantillonnage
Au total, 48 participants ont été recrutés pour l’étude utilisateur afin d’assurer la diversité et la généralisation des résultats. Les participants avaient entre 19 et 62 ans (M = 32,4, SD = 10,7), avec 26 garçons et 22 femmes. Pour capturer la diversité de la familiarité avec les technologies immersives, les participants ont été répartis en trois groupes d’expériences VR : les utilisateurs novices (n = 18) ayant peu ou pas d’exposition préalable à la VR, les utilisateurs intermédiaires (n = 17) ayant une utilisation peu fréquente de la VR, et les utilisateurs expérimentés (n = 13) qui ont utilisé la VR régulièrement, principalement professionnellement. Pour garantir l’accessibilité et l’inclusivité de l’échantillon, il comprenait également 6 participants présentant des limitations de mobilité légères et 4 participants préférant l’interaction à une main en raison de contraintes motrices. Tous les participants avaient une vision normale ou corrigée à normale, aucun n’ayant signalé de conditions vestibulaires ou neurologiques pouvant interférer avec leur utilisation de la VR.

Les participants ont été assignés au hasard aux trois conditions d’interaction selon une stratégie d’allocation équilibrée : Geste + Voix (n = 16), Contrôleur uniquement (n = 16) et Hybride (n = 16). Leur niveau d’expérience a été réparti équitablement entre les trois groupes afin d’éviter les biais et d’assurer une difficulté comparable dans les différentes conditions. Tous les participants ont donné leur consentement éclairé écrit avant le début de l’expérience.

Une étude utilisateur est ensuite réalisée sur trois conditions d’interaction, telles que la voix gestuelle, la manette uniquement et l’hybride, afin d’évaluer la précision, l’efficacité et l’expérience utilisateur. Les métriques quantitatives incluent la précision du placement, la durée des tâches et les taux d’erreur, tandis que l’évaluation subjective utilise SUS, NASA-TLX et IPQ, soutenue par des entretiens qualitatifs. Ce système, présenté ici, offre trois grandes nouveautés : l’utilisation de la fusion multimodale geste-voix pour une manipulation précise d’objets en VR, des modes d’interaction adaptatifs et accessibles tels que les gestes à main simple et la voix de secours, ainsi que la fourniture d’un corpus reproductible de commandes vocaux geste annotées. Combinées, ces étapes garantissent une précision, une efficacité et une expérience utilisateur accrues, répondant directement aux lacunes de l’article de base et faisant progresser la recherche sur l’interaction immersive en VR pour un usage de conception. La figure 1 montre l’architecture de la méthode proposée.

L’architecture système de la méthode proposée, comme illustré à la Figure 1, commence par les modalités d’entrée, où les gestes sont enregistrés à l’aide de jeux de données tels qu’EgoGesture et IPN Hand, ainsi que des instructions vocales issues du jeu de données Fluent Speech Commands. Ces entrées sont traitées indépendamment à l’aide de modules de reconnaissance gestuelle et vocale pour produire des données spatiales et sémantiques. Les deux flux sont fusionnés dans une couche de fusion multimodale, qui aligne les entrées gestuelles et vocales pour produire des commandes cohérentes. Ces données fusionnées sont utilisées dans la couche d’interaction VR pour faciliter la manipulation des objets par placement, rotation, mise à l’échelle et modification des matériaux en temps réel. Enfin, les interactions traitées sont mises à disposition dans la couche de sortie, créant un espace de design immersif axé sur l’accessibilité, la précision et l’interaction naturelle.

Exigences système et définition des tâches
Le système envisagé améliore les modèles de navigation VR avec une orientation vers l’accessibilité afin de faciliter une planification résidentielle basée sur la précision. Nous identifions le domaine utilisateur comme Équation 38, où Équation 39 sont propriétaires, Équation 39 professionnels du design et Équation 40 utilisateurs d’accessibilité (âgés ou mobilité réduite). Chaque utilisateur effectue un ensemble de tâches principales T = {placer, tourner, écheller, matérialiser, éclairer, mesurer}. Une tâche t T est réalisée via des entrées multimodales : flux gestuel Gt (manipulation spatiale) et commande vocale Vt (paramètres sémantiques). Le système relie ces éléments à une action via une politique de fusion :

Équation 41(1)

π est la fonction multimodale au niveau de la décision.

Les besoins du système nécessitent une interaction à faible latence : soit Équation 42 la reconnaissance gestuelle, la compréhension vocale et les temps de fusion.

Équation 43(2)

La réponse somme offre une réactivité en temps réel conforme aux seuils d’ergonomie immersifs en VR.

Pour la précision de la tâche, soit l’état de l’objet de la vérité fondamentale (x, R, s, M, L) (position, rotation, échelle, matériau, longueur) et l’état Équation 44réalisé du système . Les métriques d’erreur sont les suivantes :

Équation 45(3)

Équation 46(4)

Équation 47(5)

Équation 48(6)

Avec pour un Équation 49 décalage de matériaux.

Les deux modalités génèrent des scores de confiance cg (geste) et cv (voix), normalisés de sorte que cg + cv = 1. L’arbitrage de fusion minimise une erreur pondérée :

Équation 50(7)

lg, lv sont des pertes spécifiques à la modalité. Si Équation 51, le système demande une invite de clarification, ce qui le rend robuste pour les commandes non claires.

Enfin, les métriques d’évaluation incluent le temps d’accomplissement des tâches Tt, les taux d’erreur Et, et les scores de charge de travail de NASA-TLX, SUS et IPQ. Nous introduisons un indice composite de performance des tâches :

Équation 52(8)

à minimiser pour les utilisateurs, avec des seuils nécessitant un score SUS de ≥70 et une réduction NASA-TLX par rapport à la VR de base basée sur un contrôleur.

Collecte et prétraitement des ensembles de données
Le système proposé repose à la fois sur les données gestuelles (pour la reconnaissance basée sur TCN) et sur les données de commandes vocales (pour NLU/ASR). À cette fin, nous utilisons trois principaux ensembles de données : EgoGesture pour les gestes dynamiques et continus dans des environnements de type VR, IPN Hand pour compléter les gestes naturels à courte portée, et Fluent SpeechCommands 44 pour entraîner la compréhension sémantique par la voix des énoncés de conception. Les ensembles de données optionnels sont HaGRID pour la préentraînement du détecteur de gestes statiques, et Mozilla Common Voice pour la préentraînement général de l’ASR, mais aucun de ces éléments n’est nécessaire. Un tel choix permet de couvrir les deux modalités tout en maintenant la portée des ensembles de données aussi raisonnable et reproductible que possible. Le tableau 1 présente les détails du jeu de données du travail proposé.

Le choix des jeux de données dans cet article est crucial, car chaque jeu est conçu pour répondre à un scénario distinct d’interaction multimodale en VR. Le jeu de données EgoGesture offre une collection de gestes de main naturalistes à grande échelle, garantissant une haute performance de reconnaissance malgré les variations d’éclairage et de conditions environnementales. Puisque l’ensemble de données IPN Hand est conçu pour des mouvements de la main sans restriction et continus, il serait particulièrement adapté aux opérations de contrôle à haute précision et à la segmentation des gestes en temps réel. De plus, le jeu de données Fluent Speech Commands propose des commandes vocales intitulées avec des annotations sémantiques pour la détection d’intention, ce qui est crucial pour permettre une exécution précise et naturelle des commandes en VR. Combinés, ces ensembles de données offrent une couverture complémentaire des modalités de geste et de parole, apportant diversité, robustesse et performance quotidienne qui améliorent l’évaluation du système proposé. En plus des ensembles de données publics, nous avons également vérifié le protocole à l’aide d’un ensemble de données indépendant interne comprenant 312 échantillons de gestes et 128 commandes vocales de 10 nouveaux participants. Cette validation indépendante a confirmé la reproductibilité et la robustesse du protocole.

Prétraitement des données
Les informations recueillies sont systématiquement normalisées, échantillonnées et augmentées avant l’entraînement du modèle :

Normalisation de la séquence gestuelle
Une séquence vidéo gestuelle est représentée par une série temporelle multivariée de caractéristiques articulaires squelettiques :

Équation 1(9)

Ti est la longueur du i-ème geste et d est la dimension des caractéristiques (par exemple, l’emplacement des articulations de la main). Comme différents gestes peuvent avoir des longueurs Ti variables, nous les rééchantillonnons en une longueur de séquence constante T :

Équation 2(10)

Cela rend tous les échantillons de gestes, quelle que soit la durée de l’enregistrement, comparables à une longueur temporelle standard pouvant être utilisée pour l’entraînement TCN.

Standardisation des caractéristiques
Pour éliminer les différences d’échelle entre les utilisateurs et les conditions d’enregistrement, chaque espace de fonctionnalités est standardisé :

Équation 3(11)

Équation 4 est la moyenne de la caractéristique j, et σj est son écart-type. Cette normalisation garantit ainsi que les caractéristiques sont centrées avec la variance unitaire, et que les différences individuelles dans la performance des gestes sont minimisées.

Augmentation des données
L’inclusion de perturbations synthétiques améliore la robustesse à la variabilité. La gigue temporelle décale d’abord aléatoirement l’alignement de la séquence :

Équation 5(12)

où δ est le jitter maximal dans les images. La seconde injection de bruit ajoute des perturbations gaussiennes aux caractéristiques :

Équation 6(13)

Ces augmentations permettent au modèle d’être robuste face aux irrégularités temporelles et au bruit des capteurs dans les interactions VR réelles.

Prétraitement vocal
Chaque énoncé parlé est initialement associé à une représentation du spectrogramme log-Mel :

Équation 7(14)

Où F est la quantité des compartiments de fréquence et T′ la quantité des référentiels temporels. Pour compenser la variabilité de l’enregistrement, les caractéristiques du spectrogramme sont normalisées comme suit :

Équation 8(15)

μV, σV sont la moyenne globale et l’écart-type sur le corpus. Cela offre un espace acoustique stable pour les modèles ASR et NLU.

Codage par fente d’intention
En plus des caractéristiques acoustiques, chaque commande vocale est étiquetée avec des emplacements sémantiques structurés :

Équation 9 (16)

où, par exemple, « faire pivoter la chaise de 15 degrés » correspond à (action = tourner, objet = chaise, emplacement = nul). Ce codage systématique permet au système de dériver des paramètres spécifiques à la conception et de les transformer en opérations VR exécutables.

Conception d’interaction gestuelle avec réseau convolutionnel temporel (TCN)
Le design d’interaction gestuelle spécifie la manière dont les utilisateurs interagissent avec les objets virtuels dans le système de conception de maison VR en utilisant des gestes naturels de la main. La conception commence par le développement d’un lexique gestuel – une association de gestes de la main à des fonctions système. Par exemple, un geste de saisie pourrait contrôler le placement d’un objet, un geste de pincement pourrait contrôler l’échelle, et un geste de rotation pourrait faire tourner des objets autour d’un axe sélectionné.

Dans le système en question, EgoGesture et IPN Hand servent de bases de jeux de données gestuelles pour l’entraînement du Réseau Convolutionnel Temporel (TCN), tandis que les commandes vocales fluides complètent la conception par des capacités d’interaction vocales. Ensemble, ils offrent une interaction VR multimodale.

Représentations gestuelles à partir du jeu de données
Une séquence de gestes provenant soit d’EgoGesture, soit de la Main IPN est une série temporelle multivariée :

Équation 10(17)

Équation 11(18)

Ici, T est le nombre prédéterminé de trames (après rééchantillonnage), et d est le nombre de dimensions des caractéristiques squelettiques (par exemple, emplacements d’articulations 3D). Le jeu de données comporte des étiquettes y(i)y indiquant l’une des classes de gestes C.

Codage convolutionnel temporel
Nous utilisons un réseau convolutionnel temporel (TCN) pour classer les gestes en temps réel. Le TCN capture les dépendances à court et long terme dans des séquences gestuelles. Les RTC, contrairement aux RNN, utilisent des convolutions causales dilatées, ce qui permet un calcul parallèle efficace.

Le TCN applique ces séquences par des convolutions dilatées causales pour apprendre les dépendances à court et long terme :

Équation 13(19)

dL est le facteur de dilatation dans la couche l, K est la taille du noyau, et σ est une activation non linéaire (ReLU). Le champ récepteur dépend de :

Équation 14(20)

exigeant que le TCN englobe des gestes de différentes longueurs temporelles.

Classification des gestes
Le dernier état caché est transmis via un classificateur Softmax :

Équation 15 (21)

avec l’objectif d’entraînement défini par l’entropie croisée :

Équation 16 (22)

Intégration avec les commandes vocales
Alors que les opérations spatiales (déplacement, rotation, échelle) sont traitées par reconnaissance gestuelle d’EgoGesture et IPN Hand, le jeu de données Fluent Speech Commands est appliqué aux commandes sémantiques. Chaque énoncé est transformé en une représentation structurée en fente : Équation 17 qui augmente l’entrée du geste en proposant des paramètres (par exemple, « faire pivoter la chaise de 15° »).

Ensuite, les deux sorties sont combinées :

Équation 18(23)

o(i) est la primitive de contrôle VR (placement, mise à l’échelle, rotation).

Le Réseau Convolutionnel Temporel (TCN) est efficace pour traiter des données séquentielles en employant des convolutions 1D dilatées sur des séquences d’entrée, telles que les signaux gestuels ou de la parole, comme montré à la Figure 2. Contrairement aux modèles récurrents, les RCT utilisent des filtres convolutifs pour apprendre à la fois les relations temporelles à court et à long terme. Des blocs résiduels avec connexions à saut sont employés pour assurer la stabilité pendant l’entraînement et éviter l’annulation des gradients, tandis que l’utilisation de couches TCN empilées permet au réseau d’apprendre des motifs temporels multi-échelle. En fin de compte, une couche de classification entièrement connectée projette les caractéristiques temporelles apprises dans des étiquettes de sortie, telles que des classes gestuelles ou des intentions parlées. Cette conception est particulièrement adaptée à la reconnaissance continue des gestes et à la compréhension des commandes vocales, car elle combine efficacité computationnelle avec de fortes capacités de modélisation temporelle.

Le tableau 2 résume la conception architecturale globale et la configuration d’entraînement du Réseau Convolutionnel Temporel utilisé dans le système proposé pour la reconnaissance gestuelle. Le modèle présente quatre blocs TCN résiduels, chacun basé sur des convolutions causales dilatées, permettant au réseau de modéliser à la fois des dépendances temporelles à courte et longue portée. Ces dépendances sont cruciales pour distinguer les gestes dynamiques, tels que la saisie, la rotation et la pinçage. Avec une taille de noyau de 3 et des facteurs de dilatation, les facteurs de dilatation de [1,2,4,8] étendent efficacement le champ réceptif temporel sans augmenter le coût de calcul. Pour améliorer la généralisation entre utilisateurs et conditions d’enregistrement, la normalisation des couches et un taux de perte de 0,25 ont été utilisés dans chaque bloc. Pour l’entraînement, un optimiseur Adam avec un taux d’apprentissage de 1 × 10-3, une taille de lot de 32 et une longueur de séquence de 64 trames est utilisé, ce qui équilibre de manière optimale précision et réactivité en temps réel. Lors de l’inférence, une stratégie à fenêtre glissante rend possible la prédiction des gestes tous les 20-25 ms, tout en maintenant une latence de bout en bout inférieure à 120 ms. Cette combinaison d’architecture et d’hyperparamètre permet une grande précision dans la classification des gestes (∼94 % de précision de placement) tout en préservant l’interaction en temps réel, permettant à TCN d’effectuer des tâches immersives de manipulation VR.

Conception d’interaction vocale (ASR+NLU)
La composante interaction vocale complète le contrôle spatial basé sur les gestes grâce à des commandes vocales sémantiques et paramétrées pour le système de conception domestique VR. L’entrée vocale a(i) est d’abord enregistrée en audio brut puis convertie en spectrogramme log-Mel :

Équation 19 (24)

Où F est le nombre de bins de fréquence T la durée des intervalles de temps. La représentation préserve à la fois les schémas spectraux et temporels de la parole et est normalisée pour être invariante à la variabilité du locuteur et de l’environnement :

Équation 37(25)

Le spectrogramme normalisé est intégré à un modèle de reconnaissance vocale automatique (ASR) comme Whisper, qui transforme les caractéristiques acoustiques en une séquence jetonale :

Équation 20 (26)

où chacun est un jeton pour un mot ou une unité de sous-mot. Cette transcription est intégrée dans un modèle de compréhension du langage naturel (NLU), qui capture le sens structuré. Plus précisément, NLU prédit des catégories d’intention et des emplacements sémantiques :

Équation 21 (27)

où, par exemple, l’énoncé « rotation de la chaise de quinze degrés » correspond à (action = tourner, objet = chaise, emplacement/paramètre = 15°).

Le cadre d’intention identifié est ensuite transformé en une commande mathématique pouvant être implémentée dans le système VR :

Équation 22(28)

u(i) peut être une transformation numérique (par exemple, rotation de 15°) ou un changement catégorique (par exemple, l’échange de matériaux).

La robustesse est finalement atteinte grâce à un mécanisme d’arbitrage fondé sur la confiance. Si le score de confiance ASR p(z) ou le score de confiance NLU p(s) est inférieur à un seuil τ, le système demande soit une clarification, soit passe par défaut au contrôle par geste. Cela garantit que les commandes vocales sont précises et claires, améliorant ainsi l’utilisabilité pour les tâches de conception nécessitant de la précision.

Conception de fusion multimodale
L’avantage de la fusion multimodale dans le système VR proposé est que la compréhension vocale et la détection de gestes sont intégrées dans un processus décisionnel unique plutôt que d’être traitées séparément. Le module de geste fournit une sortie Équation 23 de classification à partir du TCN, tandis que le module vocal fournit une représentation s(i) par fente d’intention. Pour fusionner ces aspects, le système met en œuvre une fusion au niveau de la décision avec un arbitrage basé sur la confiance.

Faites en sorte que le classificateur de gestes fournisse une distribution de probabilité sur les classes de gestes :

Équation 24 (29)

et soit le modèle NLU qui donne des probabilités à l’intention des emplacements :

Équation 25 (30)

Où a, o et p désignent des emplacements d’action, d’objet et de paramètres dérivés de l’entrée vocale. L’étape de fusion calcule une décision conjointe en combinant les deux modalités selon leurs scores de confiance :

Équation 26 (31)

Où α∈[0,1] est défini dynamiquement en fonction de la confiance du système (par exemple, plus élevé lorsque les gestes sont plus certains, plus bas lorsque la parole est claire).

Algorithme 1 : Multimodal_Fusion (X, a) :

Entrée :

X = séquence de gestes prétraités, a = commande audio

Sortie :

O = commande d’action VR

Étape 1 : Reconnaissance des gestes

Équation 27  

Étape 2 : Compréhension vocale

Équation 28  

Équation 29  

Étape 3 : Décision sur la fusion

Équation 30  

Équation 31  

Équation 32  

Équation 33  

Équation 34  

Sinon :

Équation 35  

Étape 4 : Gestion des erreurs

Équation 36 ):

Demande de clarification utilisateur

Sinon :

Envoyer O au système VR

retour O

Cet algorithme 1 alterne entre l’entrée par geste et la voix pour formuler une commande puissante pour la conception en VR. Le module de gestes (TCN) interprète d’abord les mouvements de la main tels que la rotation ou l’échelle et attribue un score de confiance basé sur la certitude du modèle. Parallèlement, le module vocal effectue également la conversion de la voix-texte avec ASR (par exemple, Whisper) et applique le NLU pour identifier l’intention sémantique, comme « faire pivoter la chaise de 15° ». Les deux modules retournent leurs prédictions ainsi que les scores de confiance. L’étape de combinaison équilibre ensuite les deux sorties. Si les deux entrées sont définies, le système les combine proportionnellement à leur niveau de confiance. Si une entrée est ambiguë (par exemple, bruit dans la voix ou geste incertain), le système privilégie davantage l’autre. Enfin, si aucune des deux n’est définitive, le système demande des clarifications pour éviter les erreurs. Cela rend la fusion adaptative (les poids changent selon la qualité de l’entrée), robuste (accommodant des données bruyantes ou manquantes) et précise (utilisant les meilleures forces du geste et de la voix).

Participants
Cette étude réunit un groupe de bénévoles choisis à la fois parmi des étudiants universitaires et des professionnels du design afin de recueillir des avis variés sur l’utilisabilité de la VR. Les participants allaient de l’âge adulte au milieu de l’âge moyen, représentant un mélange de niveaux d’expérience VR antérieurs, incluant débutants, utilisateurs occasionnels et avancés. Tous les participants avaient une vision normale ou corrigée et aucun trouble moteur signalé pouvant interférer substantiellement avec les interactions par gestes. Des troubles graves de la parole, des limitations majeures de mobilité des bras ou tout antécédent de mal des transports induit par la VR excluaient les personnes pour des raisons de sécurité et de régularité dans la participation. Tous les participants ont donné leur consentement éclairé, et les procédures d’évaluation ont été approuvées par le comité d’examen institutionnel. Cette sous-section identifie clairement qui a participé à l’évaluation, en tenant compte de la reproductibilité de l’étude.

Installation expérimentale
La configuration expérimentale proposée comprend le système VR multimodal développé, déployé sur un casque VR grand public équipé de capacités intégrées de suivi des mains et d’une caméra RGB pour capturer les gestes. Il dispose d’un bureau haute performance, permettant le traitement en temps réel de la reconnaissance gestuelle, de l’ASR et des techniques de fusion multimodale. L’environnement VR est construit en Unity 3D et comprend une salle de design de maison pouvant être configurée avec du mobilier, des matériaux et des éléments d’éclairage. La configuration comprend un ASR basé sur Whisper pour la transcription vocale, et inclut également un module NLU basé sur un transformateur pour détecter l’intention. Cette description a été déplacée depuis la section Résultats afin de fournir une vue d’ensemble technique appropriée avant de discuter des résultats.

Scénarios de tests subjectifs
Les participants ont interagi avec un environnement de design de maison simulé comprenant un salon meublé, une chambre et un petit espace de travail. Dans chaque scénario, les utilisateurs devaient modifier les objets virtuels et les variables environnementales de l’environnement selon des circonstances de conception réalistes. Par exemple, les participants devaient positionner un canapé par rapport à un point de référence, faire pivoter une chaise dans une direction précise, redimensionner une table à une dimension cible ou modifier le matériau du mur/le profil lumineux. Ces scénarios ont été sélectionnés car ils représentent des tâches typiques de design d’intérieur qui remettent en question à la fois le contrôle par gestes (en termes de précision spatiale) et le contrôle vocal (en termes de commandes sémantiques). Cette sous-section répond directement à la question du relecteur concernant les conditions de test subjectives sous lesquelles les utilisateurs évaluaient le système.

Conception des tâches
Les participants ont suivi un ensemble structuré d’exercices couvrant différents aspects de la manipulation des objets et de l’interaction de conception. Les principales tâches étaient les suivantes : 1) Placement du mobilier : Les participants ont positionné les objets aux coordonnées cibles. 2) Tâche de rotation : Dans cette tâche, les utilisateurs devaient modifier l’orientation pour qu’elle corresponde à un angle de référence. 3) Tâche d’échelle : Cela impliquait de redimensionner les meubles selon des dimensions prédéfinies. De plus, 4) Montage de matériaux/couleur : Les participants utilisaient des commandes vocales pour modifier les textures ou modifier l’éclairage. Des tâches de navigation optionnelles étaient prévues pour capturer la capacité de conscience spatiale dans la salle virtuelle. Chaque travail a été établi avec des objectifs clairs, des résultats quantifiables et une limite de temps définie, garantissant que la précision et l’efficacité puissent être correctement évaluées.

Procédure
Pour garantir l’uniformité entre les participants, l’évaluation a été réalisée selon un séquence planifié. Les utilisateurs ont d’abord été expliqués par le système et une brève démonstration des modalités d’interaction entre le geste et la parole. Une phase initiale d’étalonnage a permis une adaptation aux postures individuelles des mains et aux caractéristiques de la parole. Les utilisateurs ont ensuite eu une courte séance d’entraînement pour s’habituer aux deux modalités. L’évaluation réelle nécessitait d’exécuter toutes les tâches dans trois conditions d’interaction : utiliser uniquement un contrôleur, utiliser uniquement les gestes, et utiliser les gestes plus la voix en entrée multimodale. L’ordre des conditions a été contrebalancé pour réduire les effets d’apprentissage. À la fin, les sujets ont complété des instruments d’évaluation standardisés, tels que le SUS, NASA-TLX et IPQ, et ont participé à un bref entretien qualitatif de rétroaction.

Indicateurs d’évaluation
Cette procédure structurée établit une transparence méthodologique, permettant des études de réplication. Des indicateurs objectifs et subjectifs ont été combinés pour évaluer de manière exhaustive la performance du système. Les indicateurs objectifs comprenaient le temps d’accomplissement des tâches, une mesure d’efficacité ; la précision de positionnement, quantifiée comme la déviation par rapport à la position ou à la rotation de la cible ; et le taux d’erreur, défini comme le nombre de mauvaises classifications d’entrée ou d’actions involontaires effectuées par le système. Les métriques subjectives ont été recueillies à l’aide de questionnaires validés : l’échelle d’utilisabilité du système pour mesurer l’utilisabilité perçue, l’échelle NASA-TLX pour évaluer la charge mentale et physique, et le questionnaire de présence du groupe I pour mesurer l’immersion et la présence en VR. Ces éléments ont été déplacés de manière appropriée depuis la section Résultats pour décrire comment la performance a été mesurée avant de présenter les résultats.

Environnement VR, intégration système et évaluation
La principale plateforme pour les commandes vocales et gestuelles est un environnement de réalité virtuelle interactive où le système est déployé. Des bibliothèques intégrées de mobilier, de textures et d’éléments d’éclairage sont utilisées pour créer des pièces virtuelles dans Unity 3D. Il permet aux utilisateurs d’organiser, de personnaliser et de modifier des éléments en temps réel. La précision est améliorée grâce aux capacités de snapping, de détection de collision et de superpositions de mesure, permettant aux objets de s’aligner naturellement. Le rendu en temps réel de l’éclairage et des matériaux améliore l’expérience de conception en fournissant un retour instantané à chaque interaction.

Après validation des modules individuels pour la reconnaissance gestuelle, la compréhension vocale et la fusion multimodale, ils sont combinés en un pipeline unifié. Le système est conçu pour avoir une faible latence, donc les commandes utilisateur apparaissent presque immédiatement dans l’environnement VR. Les essais pilotes sont réalisés avec un nombre restreint de membres afin d’affiner le flux d’interaction. L’itération inclut des vocabulaires gestuels, la validation de la grammaire des commandes vocales, et la garantie que le système paraisse naturel et fiable lors d’une utilisation continue.

Une étude complète comparant trois modalités d’interaction, telles que la fusion multimodale geste-voix, l’entrée uniquement contrôleur et le mode hybride, sera utilisée pour évaluer l’expérience utilisateur. Des tâches, notamment le changement de matériaux, la rotation et le placement des objets, sont exigées des participants. Pour évaluer la performance, des indicateurs objectifs sont collectés, tels que le temps de réussite au poste, la correction de l’affectation et les frais d’erreur. Les évaluations subjectives sont obtenues auprès des participants à l’aide de questionnaires standardisés, tels que l’échelle d’utilisabilité du système (SUS), la charge cognitive de la NASA-TLX et le questionnaire IPQ pour l’immersion, les entretiens des participants apportant un soutien supplémentaire. Cette double évaluation encode à la fois des mesures de performance quantifiables et une expérience utilisateur subjective.

L’avancée de ce système consiste à appliquer la fusion multimodale à des tâches de conception de précision au-delà de la navigation ou de l’interaction de base. La technique offre une manière d’interagir plus organique, précise et accessible en combinant la valeur sémantique des instructions vocales avec les avantages spatiaux des gestes. En offrant des fonctionnalités d’accessibilité adaptables, telles que la sauvegarde vocale uniquement et la reconnaissance gestuelle à une main, le système renforce également l’inclusivité. Enfin, l’étude propose un ensemble de données méthodique et annoté multimodal des interactions voix-geste, favorisant les futures études en conception d’interfaces immersives et renforçant la reproductibilité.

La figure 3 présente des captures d’écran typiques du programme implémenté, offrant une représentation plus vivante du système de design d’intérieur VR intégré. L’environnement immersif de réalité virtuelle, où les utilisateurs peuvent explorer et voir la disposition de la pièce, est illustré à la Figure 3A. La figure 3B montre comment les interactions naturelles de la main peuvent être utilisées pour sélectionner, déplacer et faire pivoter des meubles virtuels dans un processus de manipulation d’objets basé sur des gestes. La figure 3C illustre l’interface vocale intégrée, où le microphone et les symboles de retour vocal valident les commandes vocales fournies par l’utilisateur pour les modifications spatiales ou le placement des objets. Pris ensemble, ces captures d’écran du système VR multimodal proposé démontrent qu’il a été entièrement implémenté, permettant l’interaction en temps réel entre gestes et voix.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Le système de conception multimodale de la maison VR conçu a été validé avec trois ensembles de données fondamentaux : EgoGesture (gestes dynamiques), IPN Hand (gestes manuels continus) et Fluent Speech Commands (commandes vocales avec étiquettes d’intention slot). Collectivement, ces trois ensembles de données offraient une base complète d’entraînement et d’évaluation, abordant à la fois la reconnaissance gestuelle et la compréhension sémantique basée sur la voix. La validation établit que l’intégration geste-voix améli...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Les résultats de cette recherche font progresser la technologie de l’article de base, qui a principalement montré les mérites de la navigation immersive en VR pour l’accessibilité en combinant les modalités gestuelles et vocales pour des tâches de conception. Le système multimodal a mieux performé sur toutes les mesures objectives et subjectives de performance, avec des temps d’exécution de tâches plus courts, une précision de placement plus élevée et des taux d’erreur plus faibles que l...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs n’ont aucun conflit d’intérêts à déclarer.

Remerciements

Les auteurs reconnaissent chaleureusement le soutien institutionnel de la School of Architecture, Building & Design, ainsi que de la Design School de l’Université Taylor’s, pour avoir fourni des ressources et des conseils académiques au cours de cette recherche.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Jeu de données EgoGestureUniversité technologique de NanyangDOI : 10.1109/TMM.2018.2808769Jeu de données de gestes de la main égocentriques à grande échelle pour l’entraînement à la reconnaissance de gestes dynamiques.
Jeu de données sur les commandes vocales fluidesFluent.ai / Université de l’AlbertaDOI : 10.48550/arXiv.1804.04363Jeu de données pour la compréhension sémantique de l’intention vocale et des emplacements pour l’entraînement ASR/NLU.
Jeu de données HaGRID (optionnel)Sber IA / Open Sourcev1.1Jeu de données optionnel utilisé pour la préentraînement statique du détecteur de gestes manuels.
Questionnaire de présence Igroup (IPQ)igroup.orgN/AUtilisé pour mesurer l’immersion et la présence dans un environnement VR.
Jeu de données manuel IPNUniversidad VeracruzanaDOI : 10.1109/CVPRW50498.2020.00241Jeu de données pour la reconnaissance et la segmentation continues et naturelles des gestes de la main.
Matplotlib / SeabornOpen SourceDernière écurieUtilisé pour la visualisation des indicateurs de performance et des résultats d’évaluation.
Mains MediaPipeGoogle ResearchOpen source (GitHub)Utilisé pour le suivi en temps réel des mains et des gestes pour la reconnaissance des entrées gestuelles.
Mozilla Common Voice (optionnel)Fondation MozillaVersion 17Jeu de données optionnel pour préentraîner le modèle ASR sur des données générales de la parole.
Couche de fusion multimodaleAlgorithme personnaliséN/AFlux de fusibles, gestes et entrées vocales basés sur l’arbitrage pondéré par la confiance.
Évaluation de la charge de travail NASA-TLXFacteurs humains de la NASAN/AUtilisé pour l’analyse de la charge de travail cognitive des participants.
Module de compréhension du langage naturel (NLU)Personnalisé (basé sur BERT / RoBERTa)N/AUtilisé pour extraire les intentions sémantiques et les emplacements (action, objet, paramètre) à partir de l’entrée vocale transcrite.
NumPy / Pandas / OpenCVOpen SourceDernière écurieUtilisé pour les opérations numériques, le prétraitement des données et la manipulation d’images vidéo.
Langage de programmation PythonFondation Python SoftwareVersion 3.10+Utilisé pour implémenter des modèles ML (TCN, ASR, NLU, fusion).
Cadre d’apprentissage profond PyTorchMéta IAVersion 2.0+Utilisé pour la création et l’entraînement de modèles de reconnaissance gestuelle (TCN) et NLU.
Caméra RGBLogitech / RealSenseLogitech C920 ou Intel RealSense D435Utilisé pour la capture de gestes de la main et l’entrée de reconnaissance de mouvement.
Questionnaire sur l’échelle d’utilisabilité du système (SUS)Outil d’évaluation standardN/AUtilisé pour évaluer l’utilisabilité subjective d’un système VR.
Réseau convolutionnel temporel (RTC)Implémentation personnalisée (PyTorch / TensorFlow)N/AUtilisé pour la reconnaissance dynamique de gestes à partir de données squelettiques de séries temporelles.
Moteur 3D UnityUnity TechnologiesVersion 2022.3 LTSUtilisé pour développer un environnement VR immersif avec mobilier interactif, édition de matériaux et rendu en temps réel.
Casque VROculus (Meta) / HTC ViveOculus Quest 2 ou HTC Vive ProUtilisé pour la visualisation immersive et le suivi spatial lors des interactions en VR.
Modèle ASR WhisperOpenAIWhisper (modèle de base)Moteur de reconnaissance vocale automatique pour convertir la parole en texte.
Poste de travailPC assemblé sur mesureIntel Core i7 / NVIDIA RTX 3070 / 32 Go de RAMUtilisé pour le traitement en temps réel, l’entraînement et l’inférence de modèles de gestes et de voix.

Références

  1. Kim, J., Ahn, J. -H., Kim, Y. Immersive interaction for inclusive virtual reality navigation: enhancing accessibility for socially underprivileged users. Electronics. 14, 1046(2025).
  2. Lee, W. -J., Kim, Y. -H. Does VR tourism enhance users' experience. Sustainability. 13, 806(2021).
  3. Embedding virtual and augmented reality in higher education in Yemeni universities. Nagi, G., Al-Fuhaidi, B. 2024 1st International Conference on Emerging Technologies for Dependable Internet of Things (ICETI), 15-17 January, Riyadh, Saudi Arabia, 1, 1-10 (2024).
  4. Narin, N. G. A content analysis of the metaverse articles. J Metaverse. 1, 17-24 (2021).
  5. Towards a social VR-based exergame for elderly users: an exploratory study of acceptance, experiences, and design principles. Shah, S. H. H., Hameed, I. A., Karlsen, A. S. T., Solberg, M. International Conference on Human-Computer Interaction, 1, Springer. Washington, DC, USA. 1-12 (2022).
  6. Zahedian-Nasab, N., Jaberi, A., Shirazi, F., Kavousipor, S. Effect of virtual reality exercises on balance and fall in elderly people with fall risk: a randomized controlled trial. BMC Geriatr. 21, 509(2021).
  7. Babadi, S. Y., Daneshmandi, H. Effects of virtual reality versus conventional balance training on balance of the elderly. Exp Gerontol. 153 (6), 111498(2021).
  8. Liang, H., et al. Metaverse virtual social center for elderly communication in time of social distancing. Virtual Real Intell Hardw. 5, 68-80 (2023).
  9. Shah, S. H. H., Karlsen, A. S. T., Solberg, M., Hameed, I. A. A social VR-based collaborative exergame for rehabilitation: co-design, development, and user study. Virtual Real. 27, 3403-3420 (2023).
  10. Chen, C. -H., Chen, M. -X. Effects of the design of overview maps on three-dimensional virtual environment interfaces. Sensors. 20, 4605(2020).
  11. Sudár, A., Csapó, A. B. Descriptive markers for the cognitive profiling of desktop 3D spaces. Electronics. 12, 448(2023).
  12. Wang, Y., Hu, Y., Chen, Y. An experimental investigation of menu selection for immersive virtual environments: fixed versus handheld menus. Virtual Real. 25, 409-419 (2021).
  13. Grabowski, A. Practical skills training in enclosure fires: an experimental study with cadets and firefighters using CAVE and HMD-based virtual training simulators. Fire Saf J. 125 (4), 103440(2021).
  14. Zhang, L., et al. A hybrid 2D-3D tangible interface combining a smartphone and controller for virtual reality. Virtual Real. 27, 1273-1291 (2023).
  15. Is it real? Measuring the effect of resolution, latency, frame rate, and jitter on the presence of virtual entities. Louis, T., Troccaz, J., Rochet-Capellan, A., Bérard, F. Proc 2019 ACM Int Conf Interactive Surfaces, 1, 5-16 (2019).
  16. Riches, S., Elghany, S., Garety, P., Rus-Calafell, M., Valmaggia, L. Factors affecting sense of presence in a virtual reality social environment: a qualitative study. Cyberpsychol Behav Soc Netw. 22 (5), 288-292 (2019).
  17. Weech, S., Kenny, S., Barnett-Cowan, M. Presence and cybersickness in virtual reality are negatively related: a review. Front Psychol. 10, 158(2019).
  18. Sae-Bae, N., et al. Emerging NUI-based methods for user authentication: a new taxonomy and survey. IEEE Trans Biom Behav Identity Sci. 1, 5-31 (2019).
  19. Appel, L., et al. Older adults with cognitive and/or physical impairments can benefit from immersive virtual reality experiences: a feasibility study. Front Med. 6, 329(2020).
  20. Pirker, J., Dengel, A. The potential of 360 virtual reality videos and real VR for education: a literature review. IEEE Comput Graph Appl. 41 (6), 76-89 (2021).
  21. Schäfer, A., Reis, G., Stricker, D. Controlling teleportation-based locomotion in virtual reality with hand gestures: a comparative evaluation of two-handed and one-handed techniques. Electronics. 10, 715(2021).
  22. Radhakrishnan, U., Koumaditis, K., Chinello, F. A systematic review of immersive virtual reality for industrial skills training. Behav Inf Technol. 40 (12), 1310-1339 (2021).
  23. Zhang, X., et al. How virtual reality affects perceived learning effectiveness: a task-technology fit perspective. Behav Inf Technol. 36, 548-556 (2017).
  24. Challenor, J., White, D., Murphy, D. Hand-controlled user interfacing for head-mounted augmented reality learning environments. Multimodal Technol Interact. 7, 55(2023).
  25. Budiharto, W. Intelligent controller of electric wheelchair from manual wheelchair for disabled person using 3-axis joystick. ICIC Express Lett B Appl. 12, 201-206 (2021).
  26. Letaief, M., Rezzoug, N., Gorce, P. Comparison between joystick- and gaze-controlled electric wheelchair during narrow doorway crossing: feasibility study and movement analysis. Assist Technol. 33 (1), 26-37 (2021).
  27. Venkatesan, M., Mohan, L., Manika, N., Mathapati, A. Voice-controlled intelligent wheelchair for quadriplegics. Computing, Communication, and Networking Technologies. 1, Springer. 41-51 (2021).
  28. Charlton, J., et al. Manual wheelchair skills training using virtual technology: a systematic review. Technical Report. , Flinders University. (2024).
  29. Genova, C., et al. A simulator for both manual and powered wheelchairs in immersive virtual reality CAVE. Virtual Real. 26, 187-203 (2022).
  30. Hoter, E., Nagar, I. The effects of a wheelchair simulation in a virtual world. Virtual Real. 27, 407-419 (2023).
  31. Improving wheelchair driving performance in a virtual reality simulator. Archambault, P. S., Bigras, C. 2019 Int Conf Virtual Rehabilitation (ICVR), Tel Aviv, 1, 1-2 (2019).
  32. Automatic synthesis of virtual wheelchair training scenarios. Li, W., Talavera, J., Samayoa, A. G., Lien, J. M., Yu, L. F. 2020 IEEE Conf Virtual Reality and 3D User Interfaces (VR), , 539-547 (2020).
  33. Yan, H., Archambault, P. S. Augmented feedback for manual wheelchair propulsion technique training in a virtual reality simulator. J Neuroeng Rehabil. 18 (1), 142(2021).
  34. Montalbán, M. A., Arrogante, O. Rehabilitation through virtual reality therapy after a stroke: a literature review. Rev Cient Soc Esp Enferm Neurol (Engl Ed). 52, 19-27 (2020).
  35. Jessica, P., Salim, S., Syahputra, M. E., Suri, P. A. A systematic literature review on implementation of virtual reality for learning. Procedia Comput Sci. 216 (1), 260-265 (2023).
  36. Efficacious opportunities and implications of virtual reality features and techniques. Nithva, B., Asha, V., Kumar, K., Giri, J. 2022 Fourth Int Conf Cognitive Computing and Information Processing (CCIP), , 1-8 (2022).
  37. The impact of controller type on video game user experience in virtual reality. Hufnal, D., Osborne, E., Johnson, T., Yildirim, C. 2019 IEEE Games, Entertainment, and Media Conf (GEM), , 1-7 (2019).
  38. Zhang, Y., Cao, C., Cheng, J., Lu, H. EgoGesture: a new dataset and benchmark for egocentric hand gesture recognition. IEEE Trans Multimed. 20 (4), 1038-1050 (2018).
  39. Egocentric gesture recognition using recurrent 3D convolutional neural networks with spatiotemporal transformer modules. Cao, C., et al. Proc IEEE Int Conf Computer Vision (ICCV), , 1-9 (2017).
  40. IPN Hand: a video dataset and benchmark for real-time continuous hand gesture recognition. Benitez-Garcia, G., et al. 25th Int Conf Pattern Recognition (ICPR), , 1-8 (2021).
  41. Lu, L., et al. Noncontact 3D gesture recognition enabled VR human-machine interface via electret-nanofiber-based triboelectric sensor. Nano Res. 18, 94907924(2025).
  42. Glorius, J. K., et al. Behavioral training procedures for head-fixed virtual reality in mice. J Vis Exp. (211), e67312(2024).
  43. Li, Y., et al. A stretchable, ionic conductive, and adhesive patch electrode with ultra-low on-skin impedance for electrophysiological signal recording. Sci China Inf Sci. 68, 129402(2025).
  44. Fluent speech commands: a dataset for spoken language understanding research. , Fluent.ai. https://fluent.ai/fluent-speech-commands-a-dataset-for-spoken-language-understanding-research/ (2025).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Contr le gestuelcontr le vocalinteraction multimodalesuivi de la mainsaisie en langage naturelplacement pr cis du mobilierajustement spatial

Articles connexes