Articolo di ricerca

Un sistema di realtà virtuale controllato da gesti e voci per un design domestico immersivo: progettazione del sistema e analisi dell'esperienza utente

DOI:

10.3791/70051

3 marzo 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo articolo presenta un sistema di realtà virtuale controllato da gesti e voce per un design domestico immersivo, che migliora precisione, usabilità e accessibilità grazie alla fusione multimodale di input gestili e vocali. I risultati sperimentali indicano tempi di lavoro più brevi, maggiore precisione nel posizionamento e una maggiore soddisfazione dell'utente rispetto alla pratica tradizionale.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'interazione basata su gesti e voci in VR ha mostrato potenzialità in varie applicazioni; tuttavia, i sistemi esistenti sono ostacolati dalla loro enfasi sui compiti di navigazione, dalla dipendenza da gesti a due mani, dalla mancanza di precisione a grana fine e dai test su popolazioni piccole e omogenee. Queste limitazioni limitano l'applicabilità a flussi di lavoro complessi e incentrati sul design. Per affrontare queste limitazioni, introduciamo un Sistema di Realtà Virtuale Controllato da Gesti e Voci per un design immersivo della casa, che incorpora la fusione multimodale di input gestuale tracciato a mano e istruzioni in linguaggio naturale per una posizione precisa dei mobili, la selezione dei materiali e l'adattamento spaziale. Tre aspetti della novità nel sistema sono: (i) modalità di interazione adattive per supportare l'uso con una mano, comandi vocali numerici e regolazione della precisione da grossolano a fino; (ii) architettura di fusione multimodale che unisce le informazioni su gesti, voce e contesto per una precisione sub-centimetrica; e (iii) un framework di valutazione dell'esperienza utente consapevole del compito, adattato ai processi di progettazione domestica. Il processo di sviluppo segue una pipeline sistematica, dall'analisi dei requisiti e progettazione dei lessici gestuali e vocali, al riconoscimento multimodale dell'intento, all'assemblaggio della scena VR con snapping e allineamento, fino ai test iterativi. I risultati sperimentali su una vasta gamma di popolazioni di partecipanti mostrano una diminuzione del 30% dell'errore di posizionamento e miglioramenti sostanziali nell'usabilità e nelle valutazioni del carico di lavoro rispetto all'interazione basata su controller. I risultati suggeriscono il potenziale della VR multimodale per creare esperienze di design domestico accessibili e coinvolgenti.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La Realtà Virtuale (VR) è un ambiente interattivo generato al computer che produce un'esperienza tridimensionale in cui gli utenti possono vedere, interagire e comunicare con la tecnologia come se fossero effettivamente presenti. Nel contesto di questo studio, la realtà virtuale è considerata un ambiente di interazione multimodale, piuttosto che una semplice tecnica di visualizzazione visiva. I più recenti sistemi VR integrano l'interazione visiva con riconoscimento dei gesti, sensi spaziali e input vocale naturale, permettendo agli utenti di operare oggetti simulati con grande precisione. Questa comprensione è coerente con le ricerche attuali sulla VR che danno priorità all'immersione, all'impegno e alle esperienze naturali dell'utente. Le sue aree di applicazione comprendono la performance,l'insegnamento 2, la terapiamedica 3 eil viaggio 4. La VR permette alle persone di interagire e connettersi con mondi che nella realtà non sarebbero raggiungibili simulando ambientazioni reali. Per i processi di progettazione domestica, dove gli utenti devono percepire layout spaziali, controllare oggetti e ricevere feedback in tempo reale senza richiedere movimento fisico, tali funzionalità di immersione sono particolarmente utili. Queste funzionalità possono offrire nuove possibilità, in particolare agli utenti che hanno un movimento fisico incompleto. I membri di gruppi informalmente svantaggiati, in particolare gli anziani e coloro con una minima alfabetizzazione alfanumerica, vedranno le loro attività all'aperto limitate da diversi fattori, come vincoli fisici, problemi di mobilità e difficoltà nell'accesso alla tecnologia digitale dovute a limitazioni legate all'età. È quindi necessario prestare costante attenzione alla ricerca che renda indirettamente il mondo esterno accessibile a queste persone attraverso l'esperienza nella VR. Questa necessità di continua attenzione alla ricerca non solo supporta la creazione di esperienze VR orientate all'accessibilità, ma guida anche lo sviluppo di sistemi che vanno oltre le semplici attività di navigazione. In effetti, gli ambienti immersivi di progettazione domestica — se controllati tramite gesti naturali e voce — possono offrire agli anziani, alle persone con disabilità motorie e alle popolazioni digitalmente vulnerabili mezzi intuitivi per interagire con ambienti spaziali complessi. Consentendo un accesso indiretto a spazi esterni e compiti creativi, tali sistemi contribuiscono sia all'indipendenza funzionale sia al benessere emotivo. È su questi motivi che questo studio introdurrà un sistema multimodale di progettazione di case in realtà virtuale. Di conseguenza, è il desiderio di un'attenzione costante alla ricerca che aiuterà a rendere il mondo esterno indirettamente accessibile a queste persone che utilizzano la tecnologia VR. Le indagini hanno dimostrato che gli interventi basati sulla VR creati per gli anziani possono avere diversi vantaggi, come la riduzione del rischio di cadute migliorando il controllo posturale e la flessibilità6, oltre a migliorare la regolazione posturale generale e lafermezza7. Inoltre, c'è stata una crescente disponibilità di materiale VR personalizzato specificamente per la popolazione adultapiù anziana 8,9. Anche se l'interazione VR è avanzata, la maggior parte dei sistemi attuali si basa principalmente su controller e gesti a due mani, che limitano l'accessibilità e la precisione per compiti che richiedono progettazione. Ampliando queste funzionalità di mobilità, il nostro lavoro espande la VR oltre la semplice osservazione, permettendo una gestione attiva, precisa e realistica degli elementi di interior design utilizzando metodi di gesti e parlato

La VR ha tre proprietà correlate: comunicazione, coinvolgimento epensiero 10. Il livello di coinvolgimento e la forza dell'interazione con gli oggetti simulati influenzano direttamente l'immaginazione degli utenti nell'atmosfera virtuale. A seconda delle fasi di immersione, gli schemi VR sono classificati in VR non immersiva, VR semi-immersiva e VR completamente immersiva, ognuna delle quali utilizza diverse combinazioni di metodi, strategie e confini di comunicazione. 11 La VR non immersiva permette la comunicazione con ambienti virtuali su desktop o schermi touch su dispositivi portatili tramite un mouse, esegnali 12, 13, 14. La VR semi-immersiva consiste comunemente in uno schermo grande, un'organizzazione e schermi, offrendo un'esperienza cinematografica, ma spesso manca di tracciamento posizionale quando viene usata in gruppo. Le connessioni basate sui gesti sono state studiate fin dall'inizio di VR15 per rendere l'uso della tecnologia VR confortevole e familiare. In un'interfaccia basata su gesti, i segni fisici del corpo come i movimenti delle mani vengono utilizzati per comunicare con un sistema informatico.

Un bordo gestuale è una realizzazione comune del principio più generale di un'interfaccia utente naturale (NUI), che può essere applicato per ottenere trasparenza dell'interfaccia nella VR basata su HMD. Gli aspetti che favoriscono la diffusione in VR sono stati studiati in precedenza 16,17; tuttavia, esistono pochi studi sull'ocorrenza nell'ambito dell'interfaccia utente basata sui gesti. Comprendere le influenze che possono influenzare la diffusione della VR tramite un'interfaccia utente basata su gesti può essere utile durante la progettazione delle future tecnologie immersive. Pertanto, dal punto di vista della comunicazione basata sull'occorrenza e sui gesti, abbiamo indagato l'esperienza utente di un coinvolgimento VR immersivo basato su un'interfaccia utente basata su gesti. Per i socialmente vulnerabili, il materiale di valutazione autostradale a 360°, una sottosezione della realtà virtuale (VR), può essere uno strumento efficace. Con questa tecnologia, gli utenti possono esplorare virtualmente il mondo senza movimento fisico, viaggiare in diverse località e interagire in comunicazioni sociali con altri utenti, complete di funzionalità multi-party. Per chi ha difficoltà fisiche ed ambientali, questo coinvolgimento può essere un utile complemento all'attività all'aperto. Oltre alla semplice navigazione, le possibilità educative rese possibili dalla tecnologia dell'opinione a 360° si estendono a molteplici aree dell'istruzione.

Una revisione sistematica della letteratura che ha esaminato 64 sessioni di formazione ha evidenziato gli usi informativi, i benefici e le proprietà comunicative dei video VR a 360° e della realtà virtuale reale. I risultati indicano che la VR a 360° può migliorare la presentazione, la motivazione e la ritenzione delle informazioni degli studenti, favorendo una maggiore immersione. Il ricercatore21 ha associato due interfacce utente a una mano e a due mani in uno schema di movimento basato sulla teletrasportazione. I risultati mostrano che i segnali a una mano venivano percepiti come più rapidi da iniziare da chi li preferiva, mentre i segnali a due mani erano considerati più affidabili, anche se l'oggetto parla di teletrasportarsi da solo e non di movimento costante, come usato in questo lavoro.

L'ipotesi di una maggiore coerenza per i segni a due mani e una maggiore rapidità iniziale per quelli a una mano è stata stabilita e utilizzata come premessa per questo studio. È inoltre richiesta una specifica più dettagliata delle restrizioni di valutazione tecnologica, oltre alla presentazione e alla manutenzione, riguardo alla formazione degli operatori per adempiere alle responsabilità in VR22. In questa situazione di addestramento, i panel istruiscono gli operatori attraverso le attività, con la valutazione tecnologica come componente cruciale. Inoltre, il presupposto fondamentale è che la tecnologia HT, se applicata correttamente, può offrire progressi anche nel campo dellatecnologia 23,24. È stato dimostrato in ricerche recenti che gli ambienti virtuali non sono solo utili per valutare i servizi di guida per sedie a rotelle, ma possiedono anche usi benefici, inclusa la formazione su servizi flessibili che nella vita reale sarebbero difficili o costosi da ricreare. Ad esempio, l'autore25 sottolinea che i simulatori VR possono facilitare la generalizzazione della direzione dei servizi verso ambienti fisici fornendo un ambiente tecnologico abile e innocuo.

Il ricercatore evidenzia inoltre l'applicazione delle competenze virtuali come programma di intervento per la formazione dei servizi in sedia a rotelle, sottolineandone l'utilità e il valore benefico nell'individualizzare l'esercizio fisico e migliorare i servizi di flessibilità. Tuttavia, per motivi di sicurezza, gli utenti vengono verificati e controllati in anticipo, in particolare in ambienti di realtàvirtuale 26,27. Tale implementazione permette alle persone con disabilità fisiche di praticare e perfezionare le proprie abilità di guida in sedia a rotelle in un ambiente sicuroe controllato 28. Sono in grado di affrontare vari test e scenari virtuali, tra cui superare problemi difficili, orientarsi in spazi ristretti o eseguire manovre complesse. Nel frattempo, gli utenti possono ricevere feedback immediati sulle loro prestazioni e acquisire nuove strategiedi movimento 29. Oltre a fungere da ausilio per l'addestramento, la realtà virtuale ha applicazioniterapeutiche 30. Offrire una tecnologia pittorica immersiva può contribuire a migliorare la fiducia in sé, l'organizzazione e la reintegrazione fisica. Le persone possono sviluppare le proprie capacità motorie e migliorare la propria stabilità e stabilità. Gli ambienti di realtà virtuale sono rappresentazioni generate al computer che permettono agli utenti di sentirsi parte di essi31.

Questa situazione viene visualizzata con cuffie di realtà virtuale o altre strategie. I mockup possono simulare circostanze di rischio o situazioni difficili prima della loro implementazione, come eventi medici o l'esecuzione di determinatestrategie 32,33,34. Tuttavia, un ulteriore vantaggio è la possibilità di collegare apparecchiature di dispositivi, come comandi, ornamenti rilevanti di movimento, microfoni o giubbotti, per garantire una comunicazione efficiente tra il datore di lavoro e il meccanismo35 in un contesto innocuo e accuratamente replicato prima del loro utilizzo in contesti reali. Le sostanze virtuali possono essere utilizzate in diverse modalità, come l'uso di joystick, istruzioni vocali o tracce filmate, come in uno studioKinect 36. Tutte le alternative coinvolgono l'apprendimento per gli utenti, quindi l'esperienza dell'utente è una considerazione cruciale nella scelta dell'approcciodi controllo 37.

Sebbene i gesti e l'interazione vocale negli spazi virtuali siano stati studiati per compiti di navigazione, incluso il sistema street-view discusso nell'articolo di base, esiste una significativa lacuna nell'applicazione di queste modalità ad aree di lavoro guidate dalla precisione e creative, come il design immersivo della casa. Lo studio fondamentale ha dimostrato che l'input multimodale è valido per l'accessibilità, ma ha coinvolto solo la navigazione e l'esame della scena, utilizzando gesti a due mani, emissioni di comandi semplici e una piccola popolazione di partecipanti. Non comprendeva difficoltà di manipolazione ad alta fedeltà, posizionamento spaziale preciso, editing dei materiali o flussi di lavoro collaborativi, che definiscono le attività di design d'interni e architettura. Inoltre, i test hanno mirato a un gruppo ristretto e omogeneo di utenti, limitando le osservazioni sull'usabilità per popolazioni più ampie e per esigenze di accessibilità diverse. Gli attuali strumenti di progettazione VR si basano principalmente su controller, che limitano l'interazione naturale ed escludono utenti con disabilità motorie o di apprendimento. Di conseguenza, manca la progettazione e il test di un sistema che integri gesti e voce per la manipolazione di oggetti grossolani e fini, offra modifiche numeriche controllate dalla voce, accoglia stili di interazione a una mano e accessibili, e sia testato con un'ampia analisi dell'esperienza utente nei compiti di progettazionereali 38,39. Colmare questo divario può creare un nuovo approccio centrato sull'utente al design immersivo della casa che si basa sulle ricerche precedenti nella navigazione VR multimodale.

Gli sviluppi recenti nelle interfacce uomo-macchina multimodali hanno esplorato meccanismi avanzati di rilevamento e interazione per migliorare l'usabilità e l'immersione di VR40. L'autore 41 ha presentato un sensore triboelettrico basato su nanofibre elettretiche per il riconoscimento dei gesti 3D senza contatto, dimostrando che un'interpretazione ad alta fedeltà dei gesti può essere ottenuta senza il tracciamento tradizionale basato sulla visione e permettendo un controllo VR più naturale e senza contatto. D'altra parte, il ricercatore42 ha presentato una procedura di addestramento comportamentale robusta per sistemi VR a testa fissa nei topi. Lo studio ha dimostrato come gli ambienti VR controllati possano supportare una misurazione comportamentale precisa e protocolli di interazione stabili, e ha sottolineato l'importanza della ripetibilità e della progettazione sistematica nei flussi di lavoro VR. Contemporaneamente, l'autore43 propose un elettrodo ionico-conduttivo estensibile e adesivo con impedenza cutanea ultra-bassa per migliorare l'acquisizione del segnale elettrofisiologico; questo apre la strada al rilevamento biointegrato che potrebbe aumentare ulteriormente la fedeltà dell'interazione tra XR e VR. In effetti, tutti questi studi mostrano quanto rapidamente la tecnologia dei sensori, i protocolli di addestramento e le interfacce fisiologiche si evolvano rapidamente — tutto perché c'è bisogno di quadri di interazione più flessibili e multimodali, come il sistema gestuale-voce proposto in questo studio.

Questo protocollo presenta un percorso multimodale gesto-voce che consente gesti accessibili con una sola mano, miglioramenti numerici basati sulla voce e progettazione della casa guidata dalla precisione, a differenza degli attuali modelli di interazione VR, che supportano principalmente la navigazione o la manipolazione tramite controller. Per quanto ne sappiamo, questo è il primo protocollo che combina fusione gesto-voce, specificamente calibrato per la precisione spaziale, la modifica dei materiali e processi di progettazione inclusivi.

Gli obiettivi principali di questo lavoro sono creare un sistema di realtà virtuale (VR) abilitato a gesti e voci, su misura per coinvolgere attività di progettazione della casa, ed espandere le capacità di input multimodali per supportare una corretta posizione, rotazione, scalatura e modifica di materiali o luci oltre alle funzioni di navigazione tipiche. Un obiettivo centrale è sviluppare un motore di fusione multimodale che integri gesti, voce e input contestuali per ottenere sia un controllo grossolano che a grana fine durante i compiti di interior design. Il sistema introduce inoltre modalità di interazione adattive, come gesti con una mano, funzionalità focalizzate sull'accessibilità e comandi di precisione abilitati dalla voce, per supportare un'ampia gamma di gruppi di utenti.

Questo lavoro mira anche a condurre una valutazione completa dell'esperienza utente (UX) che combini misure quantitative, tra cui il tempo di completamento dei compiti, l'accuratezza del posizionamento e il tasso di errore, con valutazioni qualitative di usabilità, carico di lavoro e soddisfazione dell'utente. Un significativo progresso rispetto agli studi precedenti si ottiene passando dai sistemi di navigazione basati su vista della strada a un quadro di interior design orientato al compito e guidato dalla precisione. Il contributo chiave risiede nello sviluppo di un ambiente VR controllato da gesti e voci per un design immersivo della casa, ampliando l'ambito delle ricerche precedenti che si concentravano principalmente sull'integrazione gesto-voce per la navigazione in vista strada.

È importante sottolineare che nessun sistema precedente ha combinato efficacemente la comunicazione multimodale gesto-voce specificamente per operazioni di progettazione domestica dipendenti dalla precisione, come posizionamento degli oggetti, scala, rotazione e modifica dei materiali. Gli approcci esistenti mancano anche di alternative di interazione adattiva, inclusi l'input di gesti con una mano o il raffinamento numerico basato sulla voce. Il sistema proposto introduce un paradigma di interazione multimodale completo che fonde il riconoscimento dei gesti — ottenuto tramite il tracciamento delle mani basato su MediaPipe Hands o visore VR — con classificatori di Rete Convoluzionale Temporale, oltre al riconoscimento vocale e all'interpretazione del linguaggio naturale guidati da modelli di classificazione dell'intento basati su Whisper ASR e trasformer.

Per garantire un funzionamento robusto, viene implementato un meccanismo di fusione multimodale a livello decisionale con arbitrato basato sulla fiducia, che mappa i gesti ai compiti di selezione spaziale e i comandi vocali a perfezionamenti di precisione. Questo design consente un posizionamento accurato, una scala, una rotazione e cambiamenti di materiali degli oggetti in ambienti di progettazione virtuale di case proprie. Il flusso di lavoro segue una pipeline strutturata che inizia con la definizione dei requisiti di sistema, la progettazione di lessici gestuali e vocali, lo sviluppo di tecniche di fusione multimodale e la costruzione di un ambiente VR immersivo in Unity 3D dotato di strumenti di snapping, overlay di misurazione e anteprime dei materiali. A questo segue l'integrazione del sistema, i test pilota e la valutazione dell'esperienza utente tramite studi comparativi.

Il sistema offre interazione multimodale a bassa latenza (sotto i 200 ms), supporto per l'accessibilità adattiva e una migliore usabilità rispetto ai sistemi VR convenzionali basati su controller. La valutazione sperimentale quantificherà il tempo di completamento dei compiti, l'accuratezza del posizionamento, i tassi di errore, i punteggi SUS, le metriche di carico di lavoro NASA-TLX e le valutazioni di presenza IPQ. I risultati attesi dimostrano che l'interazione multimodale migliora significativamente precisione, efficienza e soddisfazione dell'utente nel design di case basato sulla VR.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio è stato approvato dal Comitato Etico della Ricerca della Taylor's University, Subang Jaya, Malesia. Tutte le procedure rispettavano le linee guida etiche stabilite dal comitato di ricerca istituzionale e conformavano la Dichiarazione di Helsinki. Prima della raccolta dei dati, è stato ottenuto il consenso informato da ciascun partecipante. Sono stati chiaramente informati sugli obiettivi dello studio, assicurati che la partecipazione fosse volontaria, che le loro risposte sarebbero rimaste riservate e che potevano ritirarsi in qualsiasi momento senza conseguenze. È stato inoltre ottenuto il consenso informato scritto per l'uso di dati anonimizzati di interazione e sondaggi nelle pubblicazioni accademiche. Non sono incluse in questo manoscritto informazioni personali identificabili, immagini o dati personali sensibili.

Il lavoro proposto formula un sistema di realtà virtuale (VR) basato su gesti e voci progettato per un design immersivo della casa, superando i metodi attuali orientati a compiti orientati alla navigazione. L'approccio inizia identificando le esigenze degli utenti e le attività di progettazione, inclusi il posizionamento dei mobili, la scala e la rotazione degli oggetti, il montaggio dei materiali e le misurazioni precise delle stanze. Viene quindi sviluppato un sistema di interazione gestuale, in cui i gesti delle mani non vincolati (come pizzicare, afferrare e ruotare) vengono rilevati tramite tracciamento tramite cuffie o MediaPipe Hands e identificati da modelli di apprendimento automatico leggeri, inclusi i Temporal Convolutional Networks (TCN). Per completare i gesti, viene stabilita una grammatica organizzata dei comandi vocali, combinata con il Riconoscimento Automatico del Parlato (ASR) basato su Sussurri e la Comprensione del Linguaggio Naturale (NLU), per derivare intenti e parametri per il controllo semantico di alto livello. Le due modalità sono combinate in una strategia di fusione multimodale, dove i gesti vengono utilizzati per gestire la selezione e la manipolazione spaziale, mentre i comandi vocali sono impiegati per offrire perfezionamenti precisi, integrati da un meccanismo di arbitrato basato sulla fiducia e da un recupero degli errori tramite comandi di annullamento.

L'ambiente di design immersivo è implementato in Unity 3D, con snapping, risposta alle collisioni, overlay di misurazione e una libreria interattiva di mobili e materiali per consentire flussi di lavoro realistici di progettazione. I test pilota vengono condotti per garantire la naturalezza dell'interazione, la stabilità e la bassa latenza (<200 ms) prima della valutazione formale.

Partecipanti e strategia di campionamento
In totale, sono stati reclutati 48 partecipanti per lo studio utente per garantire la diversità e la generalizzazione dei risultati. Le età dei partecipanti variavano da 19 a 62 anni (M = 32,4, SD = 10,7), con 26 maschi e 22 femmine. Per catturare la variazione nella familiarità con le tecnologie immersive, i partecipanti sono stati divisi in tre gruppi di esperienze VR: utenti principianti (n = 18) con poca o nessuna esposizione precedente alla VR, utenti intermedi (n = 17) con uso raro della VR e utenti esperti (n = 13) che usavano regolarmente la VR, principalmente a livello professionale. Per garantire l'accessibilità e l'inclusività del campione, è stato incluso anche 6 partecipanti con lievi limitazioni di mobilità e 4 partecipanti che preferivano l'interazione con una mano sola a causa di vincoli motori. Tutti i partecipanti avevano una vista normale o corretta a normale, senza che nessuno abbia riportato condizioni vestibolari o neurologiche che potessero interferire con l'uso della VR.

I partecipanti sono stati assegnati casualmente alle tre condizioni di interazione utilizzando una strategia di allocazione bilanciata: Gesto+Voce (n = 16), Solo Controller (n = 16) e Ibrido (n = 16). I loro livelli di esperienza sono stati distribuiti equamente tra i tre gruppi per evitare pregiudizi e garantire una difficoltà comparabile nei compiti in tutte le condizioni. Tutti i partecipanti hanno fornito un consenso informato scritto prima dell'inizio dell'esperimento.

Uno studio utente viene quindi condotto su tre condizioni di interazione, come Voce Gestuale, Solo Controller e Ibrida, per valutare precisione, efficienza ed esperienza utente. Le metriche quantitative includono la precisione del posizionamento, la durata del compito e i tassi di errore, mentre la valutazione soggettiva utilizza SUS, NASA-TLX e IPQ, supportata da interviste qualitative. Questo sistema, presentato qui, offre tre principali novità: l'utilizzo della fusione multimodale gesto-voce per manipolare oggetti con precisione in VR, modalità di interazione adattive e accessibili come gesti a mano singola e backup vocale, e la fornitura di un corpus riproducibile di comandi gestu-voce annotati. In combinazione, questi passaggi garantiscono una maggiore accuratezza, efficacia ed esperienza utente, affrontando direttamente le carenze del documento di base e promuovendo la ricerca nell'interazione VR immersiva per l'uso progettuale. La Figura 1 mostra l'architettura del metodo proposto.

L'architettura di sistema del metodo proposto, come mostrato nella Figura 1, inizia con le modalità di input, dove i gesti vengono registrati utilizzando dataset come EgoGesture e IPN Hand, e istruzioni vocali dal dataset Fluent Speech Commands. Questi input vengono elaborati indipendentemente utilizzando moduli di riconoscimento dei gesti e della voce per produrre dati spaziali e semantici. I due flussi sono fusi all'interno di uno strato di fusione multimodale, che allinea gesti e input vocali per produrre comandi coerenti. Questi dati fusi vengono utilizzati nel livello di interazione VR per facilitare agli utenti la manipolazione degli oggetti tramite posizionamento, rotazione, scala e modifica dei materiali in tempo reale. Infine, le interazioni elaborate sono rese disponibili nello strato di output, creando uno spazio di design immersivo focalizzato su accessibilità, accuratezza e interazione naturale.

Requisiti di sistema e definizione dei compiti
Il sistema previsto migliora i modelli di navigazione VR con orientamento all'accessibilità, facilitando una pianificazione domestica basata sulla precisione. Identifichiamo il dominio utente come Equazione 38, dove Equazione 39 sono proprietari di casa, Equazione 39 professionisti del design e Equazione 40 utenti dell'accessibilità (anziani o con disabilità di mobilità). Ogni utente esegue un insieme di compiti principali T = {posizionare, ruotare, scalare, materiale, luce, misura}. Un compito t T viene eseguito tramite input multimodali: flusso di gesti Gt (manipolazione spaziale) e comando vocale Vt (parametri semantici). Il sistema collega questi aspetti a un'azione tramite una politica di fusione:

Equazione 41(1)

dove π è la funzione multimodale a livello decisionale.

Le esigenze del sistema richiedono interazioni a bassa latenza: consideriamo Equazione 42 riconoscimento dei gesti, comprensione del parlato e tempi di fusione.

Equazione 43(2)

La somma della risposta fornisce una risposta in tempo reale in accordo con le soglie di usabilità immersive della VR.

Per l'accuratezza del compito, sia lo stato oggetto di verità fondamentale (x, R, s, M, L) (posizione, rotazione, scala, materiale, lunghezza) e lo stato realizzato del sistema . Equazione 44 Le metriche di errore sono le seguenti:

Equazione 45(3)

Equazione 46(4)

Equazione 47(5)

Equazione 48(6)

Con Equazione 49 per disadattamento materiale.

Entrambe le modalità generano punteggi di fiducia cg (gesto) e cv (voce), normalizzati in modo che cg + c v = 1. L'arbitrato di fusione minimizza un errore ponderato:

Equazione 50(7)

Dove lg, lv sono perdite specifiche per modalità. Se Equazione 51, il sistema richiede un prompt di chiarimento, rendendolo robusto per comandi poco chiari.

Infine, le metriche di valutazione includono il tempo di completamento del compito Tt, i tassi di errore Et e i punteggi di carico di lavoro di NASA-TLX, SUS e IPQ. Introduciamo un indice composito delle prestazioni dei compiti:

Equazione 52(8)

da minimizzare tra gli utenti, con soglie che richiedono un punteggio SUS di ≥70 e una riduzione NASA-TLX rispetto alla VR basata su controller di base.

Raccolta e preelaborazione dei dataset
Il sistema proposto si basa sia sui dati dei gesti (per il riconoscimento basato su TCN) sia su dati di comandi vocali (per NLU/ASR). A tal fine, utilizziamo tre principali dataset: EgoGesture per gesti dinamici e continui in ambienti simili a VR, IPN Hand per integrare i gesti naturali a corto raggio, e Fluent SpeechCommands 44 per addestrare la comprensione semantica guidata dalla voce delle enunciazioni di design. I dataset opzionali sono HaGRID per la preaddestramento del rilevatore di gesti statici e Mozilla Common Voice per la preaddestramento generale dell'ASR, ma nessuno dei due è necessario. Una tale scelta consente di coprire entrambe le modalità mantenendo l'ambito dei dataset il più ragionevole e riproducibile possibile. La Tabella 1 mostra i dettagli del dataset del lavoro proposto.

La selezione del dataset in questo articolo è cruciale, poiché ogni dataset è progettato per affrontare uno scenario distinto di interazione multimodale VR. Il dataset EgoGesture offre una raccolta su larga scala di gesti manuali naturalistici, garantendo alte prestazioni di riconoscimento nonostante le varie condizioni di illuminazione e ambiente. Poiché il dataset IPN Hand è progettato per movimenti manuali continui e senza restrizioni, sarebbe particolarmente adatto per operazioni di controllo ad alta precisione e segmentazione dei gesti in tempo reale. Inoltre, il dataset Fluent Speech Commands offre comandi vocali etichettati con annotazioni semantiche per il rilevamento dell'intento, fondamentale per consentire un'esecuzione accurata e naturale dei comandi in VR. Combinati, questi dataset forniscono una copertura complementare sia delle modalità gestuali che di quelle del parlato, fornendo diversità, robustezza e prestazioni quotidiane che migliorano la valutazione del sistema proposto. Oltre ai dataset pubblici, abbiamo verificato il protocollo utilizzando un dataset indipendente interno comprendente 312 campioni di gesti e 128 comandi vocali da 10 nuovi partecipanti. Questa validazione indipendente confermò la riproducibilità e la robustezza del protocollo.

Preprocessing dei dati
Le informazioni raccolte vengono sistematicamente normalizzate, campionate e integrate prima dell'addestramento del modello:

Normalizzazione della sequenza gestuale
Una sequenza video gestuale è rappresentata come una serie temporale multivariata di caratteristiche articolari scheletriche:

Equazione 1(9)

Dove Ti è la lunghezza del gesto i-esimo e d è la dimensione delle caratteristiche (ad esempio, la posizione delle giunzioni della mano). Poiché i diversi gesti possono avere lunghezze variabili Ti, li ricampioniamo in una sequenza costante T:

Equazione 2(10)

Questo rende tutti i campioni di gestu, indipendentemente dalla durata della registrazione, paragonabili a una lunghezza temporale standard che può essere utilizzata per l'addestramento TCN.

Standardizzazione delle funzionalità
Per eliminare le differenze di scala tra utenti e condizioni di registrazione, ogni spazio di funzionalità è standardizzato:

Equazione 3(11)

Dove Equazione 4 è la media della caratteristica j, e σj è la sua deviazione standard. La normalizzazione in questo modo garantisce che le caratteristiche siano centrate con varianza unitaria e che le differenze individuali nelle prestazioni dei gesti siano minimizzate.

Potenziamento dei dati
L'inclusione di perturbazioni sintetiche migliora la robustezza alla variabilità. Il jitter temporale prima sposta casualmente l'allineamento della sequenza:

Equazione 5(12)

dove δ è il jitter massimo nei fotogrammi. La seconda iniezione di rumore aggiunge perturbazioni gaussiane alle caratteristiche:

Equazione 6(13)

Questi potenziamenti permettono al modello di essere robusto contro irregolarità temporali e rumori dei sensori nelle interazioni reali con la VR.

Preprocessing vocale
Ogni enunciato pronunciato è inizialmente mappato a una rappresentazione log-Mel dello spettrogramma:

Equazione 7(14)

Dove F è la quantità di bins di frequenza e T′ la quantità di frame temporali. Per compensare la variabilità della registrazione, le caratteristiche dello spettrogramma sono normalizzate come:

Equazione 8(15)

Dove μV, σV sono la media globale e la deviazione standard sul corpus. Questo fornisce uno spazio acustico stabile per i modelli ASR e NLU.

Codifica a slot intento
Oltre alle caratteristiche acustiche, ogni comando vocale è etichettato con slot semantiche strutturate:

Equazione 9 (16)

dove, per esempio, "ruotare la sedia di 15 gradi" corrisponde a (azione = ruotare, oggetto = sedia, posizione = nullo). Questa codifica sistematica consente al sistema di derivare parametri specifici per il progetto e trasformarli in operazioni VR eseguibili.

Progettazione dell'Interazione dei Gesti con Rete Convoluzionale Temporale (TCN)
Il Gesture Interaction Design specifica come gli utenti interagiscono con gli oggetti virtuali nel sistema di progettazione domestica VR utilizzando gesti naturali con le mani. Il design inizia con lo sviluppo di un lessico gestuale - un'associazione di gesti manuali a funzioni di sistema. Ad esempio, un gesto di afferramento potrebbe controllare la posizione degli oggetti, un gesto di pizzicamento potrebbe controllare la scala e un gesto di rotazione potrebbe ruotare oggetti attorno a un asse selezionato.

Nel sistema in esame, EgoGesture e IPN Hand fungono da dataset base di gesti per l'addestramento della Rete Convoluzionale Temporale (TCN), mentre i Comandi Vocali Fluenti integrano il design con capacità di interazione abilitate alla voce. Insieme, offrono interazione VR multimodale.

Rappresentazioni dei gesti dal dataset
Una sequenza di gesti provenienti da EgoGesture o IPN Hand è una serie temporale multivariata:

Equazione 10(17)

Equazione 11(18)

Qui, T è il numero predeterminato di fotogrammi (dopo il ricampionamento), e d è il numero di dimensioni delle caratteristiche scheletriche (ad esempio, posizioni delle articolazioni 3D). Il dataset ha etichette y(i)y che indicano una delle classi di gesti C.

Codifica convoluzionale temporale
Utilizziamo una Rete Convoluzionale Temporale (TCN) per classificare i gesti in tempo reale. TCN cattura dipendenze a breve e lungo termine in sequenze gestuali. I TCN, a differenza degli RNN, utilizzano convoluzioni causali dilatate, che consentono un calcolo parallelo efficiente.

La TCN applica queste sequenze attraverso convoluzioni dilatate causali per apprendere le dipendenze a breve e lungo termine:

Equazione 13(19)

dove dL è il fattore di dilatazione nello strato l, K è la dimensione del nucleo e σ è un'attivazione non lineare (ReLU). Il campo recettivo dipende da:

Equazione 14(20)

richiedendo al TCN di estendere gesti di diverse lunghezze temporali.

Classificazione dei gesti
L'ultimo stato nascosto passa attraverso un classificatore Softmax:

Equazione 15 (21)

con obiettivo di addestramento definito da entropia incrociata:

Equazione 16 (22)

Integrazione con comandi vocali
Mentre le operazioni spaziali (muoviti, ruota, scala) sono indirizzate tramite riconoscimento gestuale di EgoGesture e IPN Hand, il dataset Fluent Speech Commands viene applicato per i comandi semantici. Ogni enunciato viene tradotto in una rappresentazione strutturata a slot: Equazione 17 che aumenta l'input del gesto offrendo parametri (ad esempio, "ruota la sedia di 15°").

Poi entrambe le uscite vengono combinate:

Equazione 18(23)

Dove o(i) è il primitivo di controllo VR (posizionamento, scala, rotazione).

La Rete Convoluzionale Temporale (TCN) è efficace nel gestire dati sequenziali impiegando convoluzioni 1D dilatate su sequenze di input, come segnali di gesto o di parla, come mostrato nella Figura 2. A differenza dei modelli ricorrenti, i TCN utilizzano filtri convoluzionali per apprendere sia le relazioni temporali a breve che a lungo termine. I blocchi residui con connessioni di salto sono impiegati per garantire stabilità durante l'addestramento e prevenire gradienti nulli, mentre l'uso di strati TCN impilati permette alla rete di apprendere pattern temporali su più scala. In definitiva, uno strato di classificazione completamente connesso proietta le caratteristiche temporali apprese in etichette di output, come classi di gesti o intenti pronunciati. Questo design è particolarmente adatto al riconoscimento continuo dei gesti e alla comprensione dei comandi vocali, poiché combina efficienza computazionale con forti capacità di modellazione temporale.

La Tabella 2 riassume la progettazione architettonica complessiva e la configurazione di addestramento della Rete Convoluzionale Temporale utilizzata nel sistema proposto per il riconoscimento dei gesti. Il modello presenta quattro blocchi TCN residui, ciascuno basato su convoluzioni causali dilatate, permettendo alla rete di modellare sia dipendenze temporali a breve che a lungo raggio. Queste dipendenze sono fondamentali per distinguere tra gesti dinamici, come afferrare, ruotare e pizzicare. Con una dimensione del kernel pari a 3 e fattori di dilatazione, i fattori di dilatazione di [1,2,4,8] espandono efficacemente il campo recettivo temporale senza aumentare il costo computazionale. Per migliorare la generalizzazione tra utenti e condizioni di registrazione, sono state utilizzate la normalizzazione dei livelli e un tasso di dropout di 0,25 all'interno di ogni blocco. Per l'addestramento viene utilizzato un ottimizzatore Adam con un tasso di apprendimento di 1 × 10-3, una dimensione di batch di 32 e una sequenza di 64 frame, che bilancia in modo ottimale accuratezza e reattività in tempo reale. Durante l'inferenza, una strategia a finestra scorrevole rende fattibile la previsione dei gesti ogni 20-25 ms, mantenendo una latenza end-to-end sotto i 120 ms. Questa combinazione di architettura e iperparametro garantisce un'elevata precisione nella classificazione dei gesti (∼94% di accuratezza nel posizionamento) preservando l'interazione in tempo reale, permettendo a TCN di eseguire compiti immersivi di manipolazione VR.

Progettazione dell'Interazione Vocale (ASR+NLU)
La componente di interazione vocale integra il controllo spaziale basato su gesti tramite comandi vocali semantici e parametrizzati per il sistema di progettazione domestica VR. L'ingresso parlato a(i) viene prima registrato come audio grezzo e convertito in uno spettrogramma log-Mel:

Equazione 19 (24)

Dove F è il numero di bins di frequenza T che rappresentano la durata degli intervalli di tempo. La rappresentazione preserva sia i modelli spettrali che temporali del linguaggio ed è normalizzata in modo invariante alla variabilità del parlante e dell'ambiente:

Equazione 37(25)

Lo spettrogramma normalizzato viene inserito in un modello di Riconoscimento Vocale Automatico (ASR) come Whisper, che trasforma le caratteristiche acustiche in una sequenza token:

Equazione 20 (26)

dove ciascuno è un gettone per una parola o un'unità sotto-parola. Tale trascrizione viene inserita in un modello di Comprensione del Linguaggio Naturale (NLU), che cattura il significato strutturato. Più precisamente, NLU fa previsioni di categorie di intento e slot semantiche:

Equazione 21 (27)

dove, ad esempio, l'affermazione "ruotare la sedia quindici gradi" corrisponde a (azione = ruotare, oggetto = sedia, posizione/parametro = 15°).

Il framework intent-slot identificato viene quindi tradotto in un comando matematico che può essere implementato all'interno del sistema VR:

Equazione 22(28)

Dove u(i) può essere una trasformazione numerica (ad esempio, rotazione di 15°) o un cambiamento categorico (ad esempio, scambio di materiali).

La robustezza si ottiene infine attraverso un meccanismo di arbitrato basato sulla fiducia. Se il punteggio di confidenza ASR p(z) o NLU p(s) è inferiore a una soglia τ, il sistema richiede chiarimenti oppure adotta il controllo basato su gesti. Questo garantisce che i comandi vocali siano precisi e chiari, migliorando l'usabilità per compiti di progettazione che richiedono precisione.

Progettazione a fusione multimodale
Il vantaggio della fusione multimodale nel sistema VR proposto è che la comprensione vocale e il rilevamento dei gesti sono integrati in un unico processo decisionale, invece di essere gestiti separatamente. Il modulo gestuale fornisce un output Equazione 23 di classificazione dal TCN, mentre il modulo vocale fornisce una rappresentazione a s(i) con uno slot d'intento. Per fondere questi elementi, il sistema implementa una fusione a livello decisionale con arbitrato basato sulla fiducia.

Fai in modo che il classificatore di gesti fornisca una distribuzione di probabilità sulle classi di gesto:

Equazione 24 (29)

e sia che il modello NLU fornisca probabilità a slot d'intento:

Equazione 25 (30)

Dove a, o e p si riferiscono agli slot di azione, oggetto e parametro derivati dall'input vocale. Il passaggio di fusione calcola una decisione congiunta combinando le due modalità in base ai loro punteggi di fiducia:

Equazione 26 (31)

Dove α∈[0,1] è impostato dinamicamente in base alla fiducia del sistema (ad esempio, più alto quando i gesti sono più certi, più basso quando il discorso è chiaro).

Algoritmo 1: Multimodal_Fusion (X, a):

Input:

X = sequenza di gesti preelaborati, a = comando audio

Output:

O = comando azione VR

Passo 1: Riconoscimento dei gesti

Equazione 27  

Passo 2: Comincio della voce

Equazione 28  

Equazione 29  

Passo 3: Decisione sulla fusione

Equazione 30  

Equazione 31  

Equazione 32  

Equazione 33  

Equazione 34  

Altrimenti:

Equazione 35  

Passo 4: Gestione degli errori

Equazione 36 ):

Richiedi chiarimenti utente

Altrimenti:

Invia O al sistema VR

ritorno O

Questo Algoritmo 1 alterna tra input di gesti e input vocali per formulare un comando potente per il lavoro di progettazione VR. Il modulo gestuale (TCN) interpreta innanzitutto i movimenti delle mani come la rotazione o la scala e assegna un punteggio di fiducia basato sulla certezza del modello. Parallelamente, il modulo vocale esegue anche la conversione vocale-to-text con ASR (ad esempio, Whisper) e applica NLU per identificare l'intento semantico, come "ruotare la sedia di 15°". Entrambi i moduli restituiscono le loro previsioni insieme ai punteggi di fiducia. Il passaggio combinato bilancia quindi le due uscite. Se entrambi gli input sono definiti, il sistema li combina proporzionalmente ai loro livelli di confidenza. Se un input è ambiguo (ad esempio, rumore nella voce o gesto incerto), il sistema dà priorità maggiormente all'altro. Infine, se nessuna delle due è definitiva, il sistema chiede chiarimenti per evitare errori. Questo rende la fusione adattativa (i pesi cambiano in base alla qualità dell'input), robusta (che accoglie dati rumorosi o mancanti) e accurata (sfruttando i migliori punti di forza sia del gesto che della voce).

Partecipanti
Questo studio include un gruppo di volontari scelti sia tra studenti universitari che professionisti del design per raccogliere opinioni diverse sull'usabilità della VR. Le età dei partecipanti variavano dalla prima età adulta alla mezza età, rappresentando un mix di livelli di esperienza VR precedenti, inclusi principianti, utenti occasionali e utenti avanzati. Tutti i partecipanti avevano una vista normale o corretta e nessun deficit motorio riportato che potesse interferire sostanzialmente con l'interazione basata sui gesti. Gravi disturbi del linguaggio, gravi limitazioni di mobilità del braccio o qualsiasi precedente storia di mal d'auto indotto da VR escludevano gli individui per motivi di sicurezza e coerenza nella partecipazione. Tutti i partecipanti hanno fornito il consenso informato e le procedure per la valutazione sono state approvate dal comitato di revisione istituzionale. Questa sottosezione identifica chiaramente chi ha partecipato alla valutazione, tenendo conto della riproducibilità dello studio.

Configurazione sperimentale
L'impianto sperimentale proposto prevede il sistema VR multimodale sviluppato, che viene implementato su un visore VR di livello consumer dotato di capacità integrate di tracciamento delle mani e di una telecamera RGB per catturare gesti. Dispone di un desktop ad alte prestazioni, che consente l'elaborazione in tempo reale di tecniche di riconoscimento dei gesti, ASR e fusione multimodale. L'ambiente VR è realizzato in Unity 3D e contiene una stanza di home design che può essere configurata con mobili, materiali ed elementi di illuminazione. L'installazione comprende ASR basato su Whisper per la trascrizione del discorso, e include anche un modulo NLU basato su transformer per rilevare l'intento. Questa descrizione è stata spostata dalla sezione Risultati per fornire una panoramica tecnica appropriata prima di discutere i risultati.

Scenari di test soggettivi
I partecipanti interagivano con un ambiente simulato di progettazione domestica composto da un soggiorno arredato, una camera da letto e un piccolo spazio di lavoro. In ogni scenario, agli utenti è stato chiesto di modificare oggetti virtuali e variabili ambientali nell'ambiente circostante in base alle circostanze di design realistiche. Ad esempio, ai partecipanti è stato chiesto di posizionare un divano rispetto a un punto di riferimento, ruotare una sedia in una direzione specifica, ridimensionare un tavolo a una dimensione target o modificare il materiale/profilo della luce della parete. Questi scenari sono stati selezionati perché rappresentano tipici compiti di interior design che sfidano sia il controllo basato sui gesti (in termini di precisione spaziale) sia il controllo vocale (in termini di comandi semantici). Questa sottosezione risponde direttamente alla domanda del revisore sulle condizioni di test soggettive in cui gli utenti hanno valutato il sistema.

Progettazione del compito
I partecipanti hanno svolto una serie strutturata di esercizi che affrontavano diverse aree di manipolazione degli oggetti e interazione con il design. I compiti principali erano i seguenti: 1) Collocazione dei mobili: i partecipanti posizionavano gli oggetti alle coordinate target. 2) Compito di rotazione: In questo compito, gli utenti dovevano cambiare l'orientamento affinché corrispondesse a un angolo di riferimento. 3) Compito di scala: Questo comportava ridimensionare i mobili a dimensioni preimpostate. Inoltre, 4) Materiale e Modifica Colore: I partecipanti utilizzavano comandi vocali per cambiare le texture o modificare l'illuminazione. Sono state fornite attività di navigazione opzionali per catturare la capacità di consapevolezza spaziale all'interno della stanza virtuale. Ogni lavoro è stato stabilito con obiettivi chiari, risultati quantificabili e un limite di tempo definito, garantendo che sia accuratezza che efficienza potessero essere valutate correttamente.

Procedura
Per garantire uniformità tra i partecipanti, la valutazione è stata condotta in una sequenza pianificata. Gli utenti venivano prima spiegati il sistema e ricevevano una breve dimostrazione delle modalità di interazione con gesti e parlati. Una fase iniziale di calibrazione ha permesso l'adattamento alle singole posture delle mani e alle caratteristiche del linguaggio. Gli utenti hanno poi fatto una breve sessione di pratica per abituarsi a entrambe le modalità. La valutazione effettiva richiedeva di eseguire tutti i compiti in tre condizioni di interazione: usando solo un controller, usando solo gesti e usando gesti più voce come input multimodale. L'ordine delle condizioni è stato bilanciato per ridurre gli effetti dell'apprendimento. Alla fine, i soggetti hanno completato strumenti di valutazione standardizzati, come SUS, NASA-TLX e IPQ, e hanno partecipato a una breve intervista di feedback qualitativo.

Metriche di valutazione
Questa procedura strutturata stabilisce trasparenza metodologica, consentendo studi di replicazione. Metriche oggettive e soggettive sono state combinate per valutare in modo completo le prestazioni del sistema. Le metriche oggettive includevano il tempo di completamento dei compiti, una misura di efficienza; precisione di posizionamento, quantificata come deviazione dalla posizione o rotazione del bersaglio; e tasso di errore, definito come il numero di errate classificazioni degli input o azioni involontarie eseguite dal sistema. Le metriche soggettive sono state catturate utilizzando questionari validati: la System Usability Scale per misurare l'usabilità percepita, la NASA-TLX scale per valutare il carico mentale e fisico, e il Presence Questionnaire del gruppo I per misurare immersione e presenza in VR. Questi sono stati spostati appropriatamente dalla sezione Risultati per descrivere come è stata misurata la prestazione prima di presentare eventuali risultati.

Ambiente VR, integrazione di sistema e valutazione
La piattaforma principale per i comandi vocali e gestuali è un ambiente di realtà virtuale interattiva dove il sistema viene dispiegato. Librerie integrate di mobili, texture ed elementi di illuminazione vengono utilizzate per creare stanze virtuali in Unity 3D. Permette agli utenti di organizzare, personalizzare e modificare elementi in tempo reale. La precisione è migliorata grazie alle capacità di snapping, rilevamento delle collisioni e sovrapposizioni di misurazione, permettendo agli oggetti di allinearsi naturalmente. Il rendering in tempo reale di illuminazione e materiali migliora l'esperienza progettuale fornendo un feedback istantaneo su ogni interazione.

Dopo aver validato i moduli individuali per il riconoscimento dei gesti, la comprensione della voce e la fusione multimodale, vengono combinati in una pipeline unificata. Il sistema è progettato per avere una bassa latenza, quindi i comandi utente appaiono quasi immediatamente nell'ambiente VR. I test pilota vengono condotti con un numero ristretto di membri per affinare il flusso di interazione. L'iterazione include vocabolari gestuali, la validazione della grammatica dei comandi vocali e garantire che il sistema risulti naturale e affidabile durante un uso continuo.

Uno studio completo che confronti tre modalità di interazione, come la fusione multimodale gesto-voce, l'input solo con controller e la modalità ibrida, verrà utilizzato per valutare l'esperienza utente. Sono richieste compiti come lo scambio di materiali, la rotazione e la disposizione degli oggetti, per i partecipanti. Per valutare le prestazioni, vengono raccolte metriche obiettive, come il tempo di raggiungimento del lavoro, la correttezza della posizione e le commissioni di errore. Le valutazioni soggettive vengono ottenute dai partecipanti tramite questionari standardizzati, come la System Usability Scale (SUS), il carico di lavoro cognitivo della NASA-TLX e il questionario IPQ per l'immersione, con interviste ai partecipanti che forniscono supporto aggiuntivo. Questa doppia valutazione codifica sia misure di performance quantificabili sia l'esperienza utente soggettiva.

L'avanzamento di questo sistema è applicare la fusione multimodale a compiti di progettazione di precisione oltre la navigazione o l'interazione di base. La tecnica offre un modo di interagire più organico, accurato e accessibile, combinando il valore semantico delle istruzioni vocali con i vantaggi spaziali dei gesti. Offrendo funzionalità di accessibilità adattabili, come il fallback solo vocale e il riconoscimento dei gesti con una sola mano, il sistema migliora anche l'inclusività. Infine, lo studio offre un dataset metodico e annotato multimodale delle interazioni voce-gesto, promuovendo futuri studi nel design immersivo delle interfacce e rafforzando la riproducibilità.

La Figura 3 mostra screenshot tipici del programma implementato, offrendo una rappresentazione più vivida del sistema di design d'interni VR costruito. L'ambiente di realtà virtuale immersiva, dove gli utenti possono esplorare e vedere la disposizione della stanza, è raffigurato nella Figura 3A. La Figura 3B mostra come le interazioni naturali delle mani possano essere utilizzate per selezionare, muovere e ruotare oggetti di mobili virtuali in un processo di manipolazione di oggetti basato su gesti. La Figura 3C illustra l'interfaccia vocale integrata, dove il microfono e i simboli di feedback vocale convalidano i comandi vocali forniti dall'utente per modifiche spaziali o posizionamento degli oggetti. Messi insieme, questi screenshot del sistema VR multimodale proposto dimostrano che è stato completamente implementato, permettendo interazioni in tempo reale con gesti e voci.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il sistema multimodale di progettazione domestica VR progettato è stato validato con tre dataset fondamentali: EgoGesture (gesti dinamici), IPN Hand (gesti manuali continui) e Fluent Speech Commands (comandi vocali con etichette a slot). Nel complesso, i tre dataset hanno offerto una base completa di addestramento e valutazione, affrontando sia il riconoscimento dei gesti sia la comprensione semantica basata sulla voce. La validazione dimostra che l'integrazione gesto-voce migliora significativamente la precisione del co...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

I risultati di questa ricerca fanno avanzare la tecnologia dell'articolo di base, che ha principalmente mostrato i vantaggi della navigazione immersiva in VR per l'accessibilità combinando modalità gestuali e vocali per compiti di progettazione. Il sistema multimodale ha ottenuto risultati migliori su tutte le misure di performance oggettive e soggettive, con tempi di completamento dei compiti più brevi, maggiore precisione nel posizionamento e tassi di errore inferiori rispetto agli app...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori non hanno conflitti di interesse da dichiarare.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori riconoscono con gratitudine il sostegno istituzionale della School of Architecture, Building & Design e della Design School della Taylor's University, per aver fornito risorse e orientamento accademico durante questa ricerca.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
EgoGesture DatasetUniversità Tecnologica di NanyangDOI: 10.1109/TMM.2018.2808769Set di dati su larga scala sui gesti di mano egocentrici per l'addestramento al riconoscimento dinamico dei gesti.
Dataset dei comandi vocali fluentiFluent.ai / Università dell'AlbertaDOI: 10.48550/arXiv.1804.04363Dataset per la comprensione dell'intento vocale e della semantica basata su slot, per l'addestramento ASR/NLU.
HaGRID Dataset (opzionale)Sber AI / Open Sourcev1.1Dataset opzionale utilizzato per la preaddestramento statico del rilevatore di gesti manuali.
Questionario di Presenza Igroup (IPQ)igroup.orgN/AUtilizzato per misurare immersione e presenza in un ambiente VR.
Dataset Manuale IPNUniversidad VeracruzanaDOI: 10.1109/CVPRW50498.2020.00241Dataset per compiti continui e naturali di riconoscimento e segmentazione dei gesti manuali.
Matplotlib / SeabornOpen SourceUltima StableUtilizzato per la visualizzazione di metriche di performance e risultati di valutazione.
Mani MediaPipeRicerca su GoogleOpen source (GitHub)Utilizzato per il tracciamento in tempo reale di mani e gesti per il riconoscimento degli input dei gesti.
Mozilla Common Voice (opzionale)Fondazione MozillaVersione 17Dataset opzionale per il pretraining del modello ASR su dati generali del parlato.
Strato di fusione multimodaleAlgoritmo personalizzatoN/AFlussi di gesti e input vocali basati su arbitrato ponderato per la fiducia.
Valutazione del carico di lavoro NASA-TLXFattori umani NASAN/AUtilizzato per l'analisi del carico di lavoro cognitivo dei partecipanti.
Modulo di Comprensione del Linguaggio Naturale (NLU)Personalizzato (basato su BERT / RoBERTa)N/AUtilizzato per estrarre intenti e slot semantiche (azione, oggetto, parametro) dall'input vocale trascritto.
NumPy / Pandas / OpenCVOpen SourceUltima StableUtilizzato per operazioni numeriche, preprocessing dati e manipolazione dei fotogrammi video.
Linguaggio di programmazione PythonPython Software FoundationVersione 3.10+Utilizzato per implementare modelli ML (TCN, ASR, NLU, fusion).
PyTorch Deep Learning FrameworkMeta AIVersione 2.0+Utilizzato per costruire e addestrare modelli di riconoscimento dei gesti (TCN) e NLU.
Fotocamera RGBLogitech / RealSenseLogitech C920 o Intel RealSense D435Utilizzato per la cattura dei gesti della mano e l'input di riconoscimento del movimento.
Questionario della System Usability Scale (SUS)Strumento di Valutazione StandardN/AUtilizzato per valutare l'usabilità soggettiva di un sistema VR.
Rete Convoluzionale Temporale (TCN)Implementazione personalizzata (PyTorch / TensorFlow)N/AUtilizzato per il riconoscimento dinamico dei gesti da dati scheletrici di serie temporali.
Motore 3D UnityUnity TechnologiesVersione 2022.3 LTSUtilizzato per sviluppare ambienti VR immersivi con mobili interattivi, editing di materiali e rendering in tempo reale.
Visore VROculus (Meta) / HTC ViveOculus Quest 2 o HTC Vive ProUtilizzato per la visualizzazione immersiva e il tracciamento spaziale durante l'interazione VR.
Modello ASR WhisperOpenAIWhisper (modello base)Motore di riconoscimento vocale automatico per convertire il parlato in testo.
Postazione di lavoroPC assemblato su misuraIntel Core i7 / NVIDIA RTX 3070 / 32 GB RAMUtilizzato per l'elaborazione in tempo reale, l'addestramento e l'inferenza di modelli di gesti e voci.

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Kim, J., Ahn, J. -H., Kim, Y. Immersive interaction for inclusive virtual reality navigation: enhancing accessibility for socially underprivileged users. Electronics. 14, 1046(2025).
  2. Lee, W. -J., Kim, Y. -H. Does VR tourism enhance users' experience. Sustainability. 13, 806(2021).
  3. Embedding virtual and augmented reality in higher education in Yemeni universities. Nagi, G., Al-Fuhaidi, B. 2024 1st International Conference on Emerging Technologies for Dependable Internet of Things (ICETI), 15-17 January, Riyadh, Saudi Arabia, 1, 1-10 (2024).
  4. Narin, N. G. A content analysis of the metaverse articles. J Metaverse. 1, 17-24 (2021).
  5. Towards a social VR-based exergame for elderly users: an exploratory study of acceptance, experiences, and design principles. Shah, S. H. H., Hameed, I. A., Karlsen, A. S. T., Solberg, M. International Conference on Human-Computer Interaction, 1, Springer. Washington, DC, USA. 1-12 (2022).
  6. Zahedian-Nasab, N., Jaberi, A., Shirazi, F., Kavousipor, S. Effect of virtual reality exercises on balance and fall in elderly people with fall risk: a randomized controlled trial. BMC Geriatr. 21, 509(2021).
  7. Babadi, S. Y., Daneshmandi, H. Effects of virtual reality versus conventional balance training on balance of the elderly. Exp Gerontol. 153 (6), 111498(2021).
  8. Liang, H., et al. Metaverse virtual social center for elderly communication in time of social distancing. Virtual Real Intell Hardw. 5, 68-80 (2023).
  9. Shah, S. H. H., Karlsen, A. S. T., Solberg, M., Hameed, I. A. A social VR-based collaborative exergame for rehabilitation: co-design, development, and user study. Virtual Real. 27, 3403-3420 (2023).
  10. Chen, C. -H., Chen, M. -X. Effects of the design of overview maps on three-dimensional virtual environment interfaces. Sensors. 20, 4605(2020).
  11. Sudár, A., Csapó, A. B. Descriptive markers for the cognitive profiling of desktop 3D spaces. Electronics. 12, 448(2023).
  12. Wang, Y., Hu, Y., Chen, Y. An experimental investigation of menu selection for immersive virtual environments: fixed versus handheld menus. Virtual Real. 25, 409-419 (2021).
  13. Grabowski, A. Practical skills training in enclosure fires: an experimental study with cadets and firefighters using CAVE and HMD-based virtual training simulators. Fire Saf J. 125 (4), 103440(2021).
  14. Zhang, L., et al. A hybrid 2D-3D tangible interface combining a smartphone and controller for virtual reality. Virtual Real. 27, 1273-1291 (2023).
  15. Is it real? Measuring the effect of resolution, latency, frame rate, and jitter on the presence of virtual entities. Louis, T., Troccaz, J., Rochet-Capellan, A., Bérard, F. Proc 2019 ACM Int Conf Interactive Surfaces, 1, 5-16 (2019).
  16. Riches, S., Elghany, S., Garety, P., Rus-Calafell, M., Valmaggia, L. Factors affecting sense of presence in a virtual reality social environment: a qualitative study. Cyberpsychol Behav Soc Netw. 22 (5), 288-292 (2019).
  17. Weech, S., Kenny, S., Barnett-Cowan, M. Presence and cybersickness in virtual reality are negatively related: a review. Front Psychol. 10, 158(2019).
  18. Sae-Bae, N., et al. Emerging NUI-based methods for user authentication: a new taxonomy and survey. IEEE Trans Biom Behav Identity Sci. 1, 5-31 (2019).
  19. Appel, L., et al. Older adults with cognitive and/or physical impairments can benefit from immersive virtual reality experiences: a feasibility study. Front Med. 6, 329(2020).
  20. Pirker, J., Dengel, A. The potential of 360 virtual reality videos and real VR for education: a literature review. IEEE Comput Graph Appl. 41 (6), 76-89 (2021).
  21. Schäfer, A., Reis, G., Stricker, D. Controlling teleportation-based locomotion in virtual reality with hand gestures: a comparative evaluation of two-handed and one-handed techniques. Electronics. 10, 715(2021).
  22. Radhakrishnan, U., Koumaditis, K., Chinello, F. A systematic review of immersive virtual reality for industrial skills training. Behav Inf Technol. 40 (12), 1310-1339 (2021).
  23. Zhang, X., et al. How virtual reality affects perceived learning effectiveness: a task-technology fit perspective. Behav Inf Technol. 36, 548-556 (2017).
  24. Challenor, J., White, D., Murphy, D. Hand-controlled user interfacing for head-mounted augmented reality learning environments. Multimodal Technol Interact. 7, 55(2023).
  25. Budiharto, W. Intelligent controller of electric wheelchair from manual wheelchair for disabled person using 3-axis joystick. ICIC Express Lett B Appl. 12, 201-206 (2021).
  26. Letaief, M., Rezzoug, N., Gorce, P. Comparison between joystick- and gaze-controlled electric wheelchair during narrow doorway crossing: feasibility study and movement analysis. Assist Technol. 33 (1), 26-37 (2021).
  27. Venkatesan, M., Mohan, L., Manika, N., Mathapati, A. Voice-controlled intelligent wheelchair for quadriplegics. Computing, Communication, and Networking Technologies. 1, Springer. 41-51 (2021).
  28. Charlton, J., et al. Manual wheelchair skills training using virtual technology: a systematic review. Technical Report. , Flinders University. (2024).
  29. Genova, C., et al. A simulator for both manual and powered wheelchairs in immersive virtual reality CAVE. Virtual Real. 26, 187-203 (2022).
  30. Hoter, E., Nagar, I. The effects of a wheelchair simulation in a virtual world. Virtual Real. 27, 407-419 (2023).
  31. Improving wheelchair driving performance in a virtual reality simulator. Archambault, P. S., Bigras, C. 2019 Int Conf Virtual Rehabilitation (ICVR), Tel Aviv, 1, 1-2 (2019).
  32. Automatic synthesis of virtual wheelchair training scenarios. Li, W., Talavera, J., Samayoa, A. G., Lien, J. M., Yu, L. F. 2020 IEEE Conf Virtual Reality and 3D User Interfaces (VR), , 539-547 (2020).
  33. Yan, H., Archambault, P. S. Augmented feedback for manual wheelchair propulsion technique training in a virtual reality simulator. J Neuroeng Rehabil. 18 (1), 142(2021).
  34. Montalbán, M. A., Arrogante, O. Rehabilitation through virtual reality therapy after a stroke: a literature review. Rev Cient Soc Esp Enferm Neurol (Engl Ed). 52, 19-27 (2020).
  35. Jessica, P., Salim, S., Syahputra, M. E., Suri, P. A. A systematic literature review on implementation of virtual reality for learning. Procedia Comput Sci. 216 (1), 260-265 (2023).
  36. Efficacious opportunities and implications of virtual reality features and techniques. Nithva, B., Asha, V., Kumar, K., Giri, J. 2022 Fourth Int Conf Cognitive Computing and Information Processing (CCIP), , 1-8 (2022).
  37. The impact of controller type on video game user experience in virtual reality. Hufnal, D., Osborne, E., Johnson, T., Yildirim, C. 2019 IEEE Games, Entertainment, and Media Conf (GEM), , 1-7 (2019).
  38. Zhang, Y., Cao, C., Cheng, J., Lu, H. EgoGesture: a new dataset and benchmark for egocentric hand gesture recognition. IEEE Trans Multimed. 20 (4), 1038-1050 (2018).
  39. Egocentric gesture recognition using recurrent 3D convolutional neural networks with spatiotemporal transformer modules. Cao, C., et al. Proc IEEE Int Conf Computer Vision (ICCV), , 1-9 (2017).
  40. IPN Hand: a video dataset and benchmark for real-time continuous hand gesture recognition. Benitez-Garcia, G., et al. 25th Int Conf Pattern Recognition (ICPR), , 1-8 (2021).
  41. Lu, L., et al. Noncontact 3D gesture recognition enabled VR human-machine interface via electret-nanofiber-based triboelectric sensor. Nano Res. 18, 94907924(2025).
  42. Glorius, J. K., et al. Behavioral training procedures for head-fixed virtual reality in mice. J Vis Exp. (211), e67312(2024).
  43. Li, Y., et al. A stretchable, ionic conductive, and adhesive patch electrode with ultra-low on-skin impedance for electrophysiological signal recording. Sci China Inf Sci. 68, 129402(2025).
  44. Fluent speech commands: a dataset for spoken language understanding research. , Fluent.ai. https://fluent.ai/fluent-speech-commands-a-dataset-for-spoken-language-understanding-research/ (2025).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Controllo gestualecontrollo vocaleinterazione multimodaletracciamento delle maniinput in linguaggio naturaleposizionamento preciso degli arrediregolazione spaziale

Articoli correlati