Artículo de investigación

Un sistema de realidad virtual controlado por gestos y voz para un diseño inmersivo del hogar: diseño de sistemas y análisis de la experiencia del usuario

407 vistas

DOI:

10.3791/70051

3 de marzo de 2026

En este artículo

Resumen

Este artículo presenta un sistema de realidad virtual controlado por gestos y voz para un diseño inmersivo del hogar, que mejora la precisión, la usabilidad y la accesibilidad mediante la fusión multimodal de gestos y entradas de voz. Los resultados experimentales indican tiempos de tarea más cortos, mayor precisión en la colocación y mayor satisfacción del usuario en comparación con la práctica tradicional.

Resumen

La interacción basada en gestos y voces en VR ha demostrado ser prometedora en diversas aplicaciones; sin embargo, los sistemas existentes se ven obstaculizados por su énfasis en tareas de navegación, dependencia de gestos con ambas manos, falta de precisión detallada y pruebas en poblaciones pequeñas y homogéneas. Estas limitaciones limitan la aplicabilidad a flujos de trabajo intrincados y centrados en el diseño. Para abordar estas limitaciones, introducimos un Sistema de Realidad Virtual Controlado por Gestos y Voz para el diseño inmersivo del hogar, que incorpora la fusión multimodal de gestos seguidos a mano e instrucciones en lenguaje natural para colocar con precisión el mobiliario, la selección de materiales y el ajuste espacial. Tres aspectos de novedad en el sistema son: (i) modos adaptativos de interacción para soportar el uso con una sola mano, comandos numéricos de voz y ajustes de precisión de groso a fino; (ii) arquitectura de fusión multimodal que fusiona información de gestos, voz y contexto para una precisión subcentímetro; y (iii) marco de evaluación de la experiencia de usuario consciente de tareas adaptado a los procesos de diseño del hogar. El proceso de desarrollo sigue una cadena sistemática, desde el análisis de requisitos y diseño de léxicos de gestos y voz, hasta el reconocimiento multimodal de intenciones, ensamblaje de escenas VR con ajuste y alineación, y pruebas iterativas. Los resultados experimentales en una amplia variedad de poblaciones participantes demuestran una disminución del 30% en el error de colocación y mejoras sustanciales en la usabilidad y la carga de trabajo respecto a la interacción basada en controladores. Los resultados sugieren el potencial de la realidad virtual multimodal para crear experiencias de diseño de hogares accesibles y atractivas.

Introducción

La Realidad Virtual (VR) es un entorno interactivo generado por ordenador que produce una experiencia tridimensional en la que los usuarios pueden ver, interactuar y comunicarse con la tecnología como si realmente estuvieran presentes. En el contexto de este estudio, la realidad virtual se considera un entorno de interacción multimodal, más que simplemente una técnica de visualización visual. Los sistemas de realidad virtual más recientes integran la interacción visual con reconocimiento de gestos, sentidos espaciales y entrada de voz natural, permitiendo a los usuarios manejar elementos simulados con alta precisión. Esta comprensión es coherente con la investigación actual sobre VR que prioriza la inmersión, la participación y las experiencias naturales del usuario. Sus áreas de aplicación incluyen interpretación,enseñanza 2, tratamientomédico 3 yviajes 4. La VR permite a las personas interactuar y conectarse con mundos que no serían alcanzables en la vida real simulando escenarios reales. Para los procesos de diseño del hogar, donde los usuarios deben percibir distribuciones espaciales, controlar objetos y recibir retroalimentación en tiempo real sin necesidad de movimiento físico, estas características de inmersión son especialmente útiles. Estas características pueden aportar nuevas posibilidades, especialmente a usuarios que tienen un movimiento físico incompleto. Los miembros de grupos informalmente desfavorecidos, especialmente los mayores y aquellos con una alfabetización alfanumérica mínima, verán sus actividades al aire libre restringidas por varios factores, como limitaciones físicas, problemas de movilidad y dificultades para acceder a la tecnología digital debido a limitaciones relacionadas con la edad. Por tanto, es necesario prestar atención constante a la investigación que haga indirectamente accesible el mundo exterior a estas personas a través de la experiencia en realidad virtual. Esta necesidad de una atención continua en la investigación no solo apoya la creación de experiencias de realidad virtual orientadas a la accesibilidad, sino que también impulsa el desarrollo de sistemas que van más allá de las tareas básicas de navegación. De hecho, los entornos inmersivos de diseño de hogares —cuando se controlan mediante gestos naturales y voz— pueden ofrecer a usuarios mayores, personas con discapacidades motoras y poblaciones digitalmente vulnerables medios intuitivos para interactuar con entornos espaciales complejos. Al permitir el acceso indirecto a espacios externos y tareas creativas, estos sistemas contribuyen tanto a la independencia funcional como al bienestar emocional. Es por estos motivos que este estudio introducirá un sistema multimodal de diseño de hogares en realidad virtual. Por tanto, es el deseo de una atención constante a la investigación lo que ayudará a que el mundo exterior sea indirectamente accesible para estas personas que utilizan tecnología en VR. Las investigaciones han demostrado que las intervenciones basadas en RV creadas para adultos mayores pueden tener varias ventajas, como reducir el riesgo de caídas al mejorar el control y la flexibilidad postura6, así como mejorar la regulación postural general y lafirmeza7. Además, ha habido una creciente disponibilidad de material de realidad virtual personalizado específicamente para la población adultamayor 8,9. Aunque la interacción en VR ha avanzado, la mayoría de los sistemas actuales dependen principalmente de mandos y gestos con ambas manos, que limitan la accesibilidad y precisión para tareas que requieren diseño. Ampliando estas características de movilidad, nuestro trabajo amplía la VR más allá de la simple observación al permitir una gestión activa, precisa y realista de los elementos de diseño de interiores mediante métodos de gestos y habla

La VR tiene tres propiedades relacionadas: comunicación, implicación ypensamientos 10. El nivel de interacción y la intensidad de la interacción con los objetos simulados afectan directamente la imaginación de los usuarios en la atmósfera virtual. Dependiendo de las etapas de inmersión, los esquemas de VR se clasifican en VR no inmersiva, semi-inmersiva y VR totalmente inmersiva, cada una utilizando combinaciones variables de métodos, estrategias y límites de comunicación. 11 La realidad virtual no inmersiva permite la comunicación con entornos virtuales en el escritorio o con pantallas táctiles en dispositivos portátiles mediante un ratón, ysignos 12, 13 y 14. La VR semi-inmersiva suele consistir en una pantalla grande, organización y pantallas, proporcionando una experiencia cinematográfica, pero a menudo carece de seguimiento posicional cuando se usa en grupo. Las conexiones basadas en gestos se han investigado desde el inicio de VR15 para hacer que el uso de la tecnología VR sea cómodo y familiar. En una interfaz basada en gestos, se utilizan signos físicos del cuerpo como movimientos de manos para comunicarse con un sistema informático.

Un borde gestual es una realización común del principio más general de una interfaz de usuario natural (NUI), que puede aplicarse para lograr transparencia de interfaz en VR basada en HMD. Los factores que favorecen la ocurrencia en la realidad virtual se investigaron anteriormente 16,17; sin embargo, existen pocos estudios sobre la ocurrencia en el contexto de la interfaz basada en gestos. Comprender las influencias que pueden influir en la aparición de la realidad virtual mediante una interfaz basada en gestos puede ser beneficioso durante el diseño de tecnologías inmersivas próximas. Por ello, desde la perspectiva de la ocurrencia y la comunicación basada en gestos, investigamos la experiencia del usuario de una interacción inmersiva en VR basada en la interfaz de usuario basada en gestos. Para los socialmente vulnerables, el material de evaluación de autopistas de 360°, una subsección de la realidad virtual (RV), puede ser una herramienta eficaz. Con esta tecnología, los usuarios pueden explorar virtualmente el mundo sin moverse físicamente, viajar a diferentes lugares y mantener comunicaciones sociales con otros usuarios, con funcionalidad multipartido. Para las personas con discapacidades físicas y ambientales, esta implicación puede ser un complemento útil para la actividad al aire libre. Más allá de la simple navegación, las posibilidades educativas que permite la tecnología de opinión de 360° se extienden a múltiples áreas de la educación.

Una revisión sistemática de la literatura, que examinó 64 sesiones de formación, destacó los usos informativos, beneficios y propiedades de comunicación de los vídeos de VR a 360° y la realidad virtual real. Los resultados indican que la VR a 360° puede mejorar la presentación, la motivación y la retención de la información de los alumnos, promoviendo una mayor inmersión. El investigador21 asoció dos interfaces de una mano y dos manos en un esquema de movimiento basado en teletransportación. Los resultados muestran que las señales con una sola mano se percibían como más rápidas de inicio por quienes las preferían, mientras que las señales con dos manos se consideraban más fiables, aunque el ítem habla de teletransportarse solo y no de movimiento constante, como se usa en este trabajo.

Se estableció y se utilizó como premisa para este estudio la suposición de mayor consistencia para los signos con dos manos y mayor rapidez inicial para los signos con una sola mano. También se requiere una especificación más detallada de las restricciones de evaluación tecnológica, más allá de la presentación y la disponibilidad, respecto a la formación de operadores para cumplir responsabilidades en VR22. En esta situación de formación, los paneles instruyen a los operadores a través de actividades, siendo la evaluación tecnológica un componente crucial. Además, la premisa fundamental es que la tecnología HT, si se aplica correctamente, puede aportar avances también en el ámbito tecnológico23,24. Investigaciones recientes han demostrado que los entornos virtuales no solo son útiles para evaluar servicios de dirección en silla de ruedas, sino que también tienen usos beneficiosos, incluyendo formación en servicios flexibles que resultarían difíciles o costosos de recrear en la vida real. Por ejemplo, el autor25 señala que los simuladores de VR pueden facilitar la generalización de la dirección de servicios a entornos físicos al proporcionar un entorno tecnológico hábil e inofensivo.

El investigador también destaca la aplicación de las habilidades virtuales como programa de intervención para la formación de servicios en silla de ruedas, destacando su utilidad y valor beneficioso para individualizar el ejercicio y mejorar los servicios de flexibilidad. Sin embargo, por motivos de seguridad, los usuarios son verificados y evaluados de antemano, especialmente en entornos de realidadvirtual 26,27. Esta implementación permite a las personas con discapacidades físicas practicar y perfeccionar sus habilidades de conducción en silla de ruedas en un entorno seguro ycontrolado 28. Pueden experimentar diversas pruebas y escenarios virtuales, incluyendo superar problemas difíciles, navegar en espacios reducidos o ejecutar maniobras intrincadas. Mientras tanto, los usuarios pueden recibir retroalimentación inmediata sobre su rendimiento y adquirir nuevas estrategiasde movimiento 29. Además de servir como ayuda para la formación, la realidad virtual tiene aplicaciones terapéuticas30. Ofrecer una tecnología pictórica inmersiva puede contribuir a mejorar la autoconfianza, la organización y la reintegración física. Las personas pueden desarrollar sus habilidades motoras y mejorar su estabilidad y estabilidad. Los entornos de realidad virtual son representaciones generadas por ordenador que permiten a los usuarios sentir que forman parte de ellos31.

Esta situación se visualiza con auriculares de realidad virtual u otras estrategias. Las maquetas pueden simular circunstancias de riesgo o situaciones desafiantes antes de su implementación, como eventos médicos o la aplicación de ciertas estrategias 32,33,34. Sin embargo, un beneficio adicional es la posibilidad de acoplar equipos de dispositivos, como controles, adornos detectores de movimiento, micrófonos o chalecos, para lograr una comunicación eficiente entre el empleador y el mecanismo35 en un entorno inofensivo y cuidadosamente replicado antes de su uso en entornos reales. Las sustancias virtuales pueden operarse en diferentes modos, como usando joysticks, instrucciones de voz o rastros grabados, como en un estudioKinect 36. Todas las alternativas implican aprendizaje para los usuarios, por lo que la experiencia del usuario es una consideración crítica al seleccionar el enfoquede control 37.

Aunque se han investigado gestos e interacción de voz en espacios virtuales para tareas de navegación, incluido el sistema de vista de calle que se discute en el artículo base, existe una brecha significativa en la aplicación de estas modalidades a áreas de trabajo creativas y de precisión, como el diseño inmersivo de hogares. El estudio fundamental demostró que la entrada multimodal era viable para la accesibilidad, pero solo abarcaba navegación y examen de escenas, utilizando gestos con ambas manos, emisión directa de comandos y una pequeña población de participantes. No abarcaba dificultades de manipulación de alta fidelidad, posicionamiento espacial preciso, edición de materiales ni flujos de trabajo colaborativos, que definen las actividades de diseño interior y arquitectónico. Además, las pruebas se dirigieron a un grupo reducido y homogéneo de usuarios, lo que limitó las observaciones sobre la usabilidad para poblaciones más amplias y diferentes necesidades de accesibilidad. Las herramientas actuales de diseño de VR se basan principalmente en mandos, que restringen la interacción natural y excluyen a usuarios con discapacidades motoras o de aprendizaje. Como resultado, falta el diseño y la prueba de un sistema que integre gestos y voz para la manipulación de objetos gruesos y finos, proporcione cambios numéricos controlados por voz, permita estilos de interacción con una mano y que faciliten la accesibilidad, y que se pruebe con un extenso análisis de la experiencia del usuario en tareas realesde diseño 38,39. Cerrar esta brecha puede crear un nuevo enfoque centrado en el usuario para el diseño inmersivo de viviendas que se basa en investigaciones previas en navegación multimodal en VR.

Los desarrollos recientes en interfaces multimodales hombre-máquina han explorado mecanismos avanzados de detección e interacción para mejorar la usabilidad e inmersión de VR40. El autor41 presentó un sensor triboeléctrico basado en nanofibras electretas para el reconocimiento de gestos 3D sin contacto, demostrando que se puede lograr una interpretación de alta fidelidad de gestos sin seguimiento tradicional basado en la visión y permitiendo un control VR más natural y sin contacto. Por otro lado, el investigador42 presentó un procedimiento robusto de entrenamiento conductual para sistemas de realidad virtual fija con cabeza fija en ratones. El estudio demostró cómo los entornos de RV controlados pueden soportar mediciones conductuales precisas y protocolos de interacción estables, y destacó la importancia de la repetibilidad y el diseño sistemático en los flujos de trabajo de RV. Simultáneamente, el autor43 propuso un electrodo iónico-conductor extensible y adhesivo con impedancia cutánea ultrabaja para mejorar la adquisición de señales electrofisiológicas; esto abre la puerta a la detección biointegrada que podría aumentar aún más la fidelidad de interacción entre XR y VR. De hecho, todos estos estudios muestran lo rápido que evolucionan la tecnología de sensores, los protocolos de entrenamiento y las interfaces fisiológicas, todo porque se necesitan marcos de interacción más flexibles y multimodales, como el propuesto sistema de gesto-voz en este estudio.

Este protocolo presenta una vía multimodal gesto-voz que permite gestos accesibles con una sola mano, mejoras numéricas basadas en voz y un diseño de casas basado en precisión, en contraste con los modelos actuales de interacción VR, que principalmente soportan navegación o manipulación mediante controladores. Según nuestro entendimiento, este es el primer protocolo que combina fusión gesto-voz, ajustado específicamente para precisión espacial, modificación de materiales y procesos de diseño inclusivos.

Los objetivos principales de este trabajo son crear un sistema de realidad virtual (VR) habilitado por gestos y voz, adaptado para actividades de diseño de hogares atractivas, y ampliar las capacidades de entrada multimodal para apoyar la colocación precisa de los muebles, rotación, escalado y edición de materiales o iluminación, además de las funciones típicas de navegación. Un objetivo central es desarrollar un motor de fusión multimodal que integre gestos, voces y entradas contextuales para lograr tanto un control grueso como fino durante las tareas de diseño de interiores. El sistema introduce además modos de interacción adaptativa, como gestos con una sola mano, funciones centradas en la accesibilidad y comandos de precisión habilitados por voz, para soportar una amplia variedad de grupos de usuarios.

Este trabajo también busca realizar una evaluación integral de la experiencia de usuario (UX) que combine medidas cuantitativas, incluyendo el tiempo de finalización de la tarea, la precisión en la colocación y la tasa de errores, con evaluaciones cualitativas de usabilidad, carga de trabajo y satisfacción del usuario. Se logra un avance significativo respecto a estudios previos al pasar de sistemas de navegación basados en vista de calle a un marco de diseño de interiores orientado a tareas y orientado a la precisión. La contribución clave radica en el desarrollo de un entorno de realidad virtual controlado por gestos y voz para el diseño inmersivo del hogar, ampliando el alcance de investigaciones anteriores que se centraban principalmente en la integración gesto-voz para la navegación en vista de calle.

Es importante destacar que ningún sistema previo ha combinado eficazmente la comunicación multimodal gesto-voz específicamente para operaciones de diseño de viviendas dependientes de la precisión, como la posición de objetos, el escalado, la rotación y la edición de materiales. Los enfoques existentes también carecen de alternativas de interacción adaptativa, como la entrada de gestos con una sola mano o el refinamiento numérico basado en voz. El sistema propuesto introduce un paradigma integral de interacción multimodal que fusiona el reconocimiento de gestos —logrado mediante el seguimiento de manos basado en MediaPipe Hands o en cascos de realidad virtual— con clasificadores de Red Convolucional Temporal, así como el reconocimiento de voz y la interpretación del lenguaje natural impulsados por modelos de clasificación de intención basados en Whisper ASR y transformer.

Para garantizar un funcionamiento robusto, se implementa un mecanismo de fusión multimodal a nivel de decisión con arbitraje basado en confianza, que asigna gestos a tareas de selección espacial y comandos de voz a refinamientos precisos. Este diseño permite una colocación, escalado, rotación y cambios de materiales precisos de objetos en entornos virtuales de diseño de hogares. El flujo de trabajo sigue una cadena estructurada que comienza definiendo los requisitos del sistema, diseñando léxicos de gestos y de voz, desarrollando técnicas de fusión multimodal y construyendo un entorno de realidad virtual inmersivo en Unity 3D equipado con herramientas de ajuste, superposiciones de medición y vistas previas de materiales. A esto le siguen la integración del sistema, pruebas piloto y evaluación de la experiencia de usuario mediante estudios comparativos.

El sistema ofrece una interacción multimodal de baja latencia (por debajo de 200 ms), soporte de accesibilidad adaptativa y una mejor usabilidad en comparación con los sistemas VR convencionales basados en mandos. La evaluación experimental cuantificará el tiempo de finalización de la tarea, la precisión de la ubicación, las tasas de error, las puntuaciones SUS, las métricas de carga de trabajo NASA-TLX y las calificaciones de presencia del IPQ. Los resultados esperados demuestran que la interacción multimodal mejora significativamente la precisión, la eficiencia y la satisfacción del usuario en el diseño de viviendas basadas en VR.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Este estudio fue aprobado por el Comité de Ética en la Investigación de la Universidad Taylor's, Subang Jaya, Malasia. Todos los procedimientos se ajustaron a las directrices éticas establecidas por el comité de investigación institucional y se ajustaron a la Declaración de Helsinki. Antes de la recogida de datos, se obtuvo el consentimiento informado de cada participante. Se les informó claramente sobre los objetivos del estudio, se les aseguró que la participación era voluntaria, que sus respuestas permanecerían confidenciales y que podían retirarse en cualquier momento sin consecuencias. También se obtuvo consentimiento informado por escrito para el uso de datos anonimizados de interacción y encuestas en publicaciones académicas. No se incluye información personal identificable, imágenes ni datos personales sensibles en este manuscrito.

El trabajo propuesto formula un sistema de realidad virtual (VR) basado en gestos y voz diseñado para un diseño inmersivo de hogares, superando a los métodos actuales orientados a tareas orientadas a la navegación. El enfoque comienza identificando las necesidades de los usuarios y las actividades de diseño, incluyendo el despliegue de muebles, la escalada y rotación de objetos, la edición de materiales y las mediciones precisas de las habitaciones. A continuación, se desarrolla un sistema de interacción gestual, donde los gestos manuales sin restricciones (como pellizcar, agarrar y girar) se detectan mediante seguimiento basado en auriculares o Manos MediaPipe y se identifican mediante modelos ligeros de aprendizaje automático, incluyendo Redes Convolucionales Temporales (TCN). Para complementar los gestos, se establece una gramática organizada de comandos de voz, combinada con el Reconocimiento Automático de Voz (ASR) basado en Susurros y la Comprensión del Lenguaje Natural (NLU), para derivar intenciones y parámetros para el control semántico de alto nivel. Las dos modalidades se combinan en una estrategia de fusión multimodal, donde se utilizan gestos para gestionar la selección y manipulación espacial, y comandos de voz para ofrecer refinamientos precisos, complementados por un mecanismo de arbitraje basado en confianza y recuperación de errores mediante comandos de deshacer.

El entorno de diseño inmersivo está desplegado en Unity 3D, con snapping, respuesta a colisiones, superposiciones de medición y una biblioteca interactiva de mobiliario y materiales para permitir flujos de trabajo de diseño realistas. Las pruebas piloto se realizan para asegurar la naturalidad de la interacción, estabilidad y baja latencia (<200 ms) antes de la evaluación formal.

Participantes y estrategia de muestreo
En total, se reclutaron 48 participantes para el estudio de usuarios para garantizar la diversidad y la generalización de los resultados. Las edades de los participantes oscilaban entre 19 y 62 años (M = 32,4, SD = 10,7), con 26 hombres y 22 mujeres. Para captar la variación en la familiaridad con tecnologías inmersivas, los participantes se dividieron en tres grupos de experiencia de RV: usuarios novatos (n = 18) con poca o ninguna exposición previa a la RV, usuarios intermedios (n = 17) con uso poco frecuente de la RV, y usuarios experimentados (n = 13) que usaban la RV regularmente, principalmente profesionalmente. Para garantizar la accesibilidad e inclusión de la muestra, también incluyó 6 participantes con limitaciones leves de movilidad y 4 participantes que preferían la interacción con una sola mano debido a limitaciones motoras. Todos los participantes tenían visión normal o corregida a normal, sin que ninguno reportara condiciones vestibulares o neurológicas que pudieran interferir con su uso de la VR.

A los participantes se les asignó aleatoriamente las tres condiciones de interacción utilizando una estrategia de asignación equilibrada: Gesto+Voz (n = 16), Solo Controlador (n = 16) e Híbrido (n = 16). Sus niveles de experiencia se distribuyeron de manera equitativa entre los tres grupos para evitar sesgos y asegurar una dificultad comparable en las tareas en las condiciones. Todos los participantes proporcionaron su consentimiento informado por escrito antes del inicio del experimento.

A continuación, se realiza un estudio de usuario en tres condiciones de interacción, como Voz de gesto, solo para control e híbrido, para evaluar precisión, eficiencia y experiencia de usuario. Las métricas cuantitativas incluyen la precisión de colocación, la duración de la tarea y las tasas de error, mientras que la evaluación subjetiva utiliza SUS, NASA-TLX e IPQ, respaldada por entrevistas cualitativas. Este sistema, presentado aquí, ofrece tres novedades principales: la utilización de la fusión multimodal gesto-voz para manipular objetos con precisión en VR, modos de interacción adaptativos y accesibles como gestos con una sola mano y respaldo de voz, y la provisión de un corpus reproducible de comandos de voz gestual anotados. En conjunto, estos pasos aseguran una mayor precisión, eficacia y experiencia de usuario, abordando directamente las deficiencias del artículo base y avanzando en la investigación en interacción inmersiva de realidad virtual para uso de diseño. La Figura 1 muestra la arquitectura del método propuesto.

La arquitectura del sistema del método propuesto, como se muestra en la Figura 1, comienza con las modalidades de entrada, donde los gestos se registran usando conjuntos de datos como EgoGesture e IPN Hand, e instrucciones de voz del conjunto de datos Fluent Speech Commands. Estas entradas se procesan de forma independiente utilizando módulos de reconocimiento de gestos y voz para producir datos espaciales y semánticos. Los dos flujos están fusionados dentro de una capa de fusión multimodal, que alinea las entradas de gestos y de voz para producir comandos consistentes. Estos datos fusionados se utilizan en la capa de interacción VR para facilitar a los usuarios la manipulación de objetos mediante colocación, rotación, escalado y modificación de materiales en tiempo real. Por último, las interacciones procesadas se ponen a disposición en la capa de salida, creando un espacio de diseño inmersivo centrado en la accesibilidad, precisión y interacción natural.

Requisitos del sistema y definición de tareas
El sistema previsto mejora los modelos de navegación VR con orientación a la accesibilidad para facilitar una planificación del hogar basada en la precisión. Identificamos el dominio de usuario como Ecuación 38, donde Ecuación 39 son propietarios, Ecuación 39 son profesionales en diseño y Ecuación 40 usuarios de accesibilidad (personas mayores o con discapacidad de movilidad). Cada usuario realiza un conjunto de tareas principales T = {colocar, rotar, escalar, material, luz, medir}. Una tarea t T se realiza mediante entradas multimodales: flujo de gestos Gt (manipulación espacial) y comando de voz Vt (parámetros semánticos). El sistema relaciona estos con una acción mediante una política de fusión:

Ecuación 41(1)

donde π es la función multimodal a nivel de decisión.

Las necesidades del sistema requieren interacción de baja latencia: ya sea Ecuación 42 reconocimiento de gestos, comprensión del habla y tiempos de fusión.

Ecuación 43(2)

La respuesta sumada proporciona una respuesta en tiempo real acorde con los umbrales de usabilidad inmersiva de la realidad virtual.

Para la precisión de la tarea, sea el estado de verdad fundamental del objeto (x, R, s, M, L) (posición, rotación, escala, material, longitud) y el estado Ecuación 44realizado del sistema . Las métricas de error son las siguientes:

Ecuación 45(3)

Ecuación 46(4)

Ecuación 47(5)

Ecuación 48(6)

Con Ecuación 49 por desajuste de materiales.

Ambas modalidades generan puntuaciones de confianza cg (gesto) y cv (voz), normalizadas de modo que cg + c v = 1. El arbitraje de fusión minimiza un error ponderado:

Ecuación 50(7)

Donde lg, lv son pérdidas específicas de modalidad. Si Ecuación 51, el sistema solicita una solicitud de aclaración, haciéndolo robusto para comandos poco claros.

Por último, las métricas de evaluación incluyen el tiempo de finalización de tareas Tt, las tasas de error Et y las puntuaciones de carga de trabajo de NASA-TLX, SUS e IPQ. Introducimos un índice compuesto de rendimiento de tareas:

Ecuación 52(8)

minimizar a todos los usuarios, con umbrales que requieran una puntuación SUS de ≥70 y una reducción NASA-TLX en comparación con la VR base basada en controladores.

Recogida y preprocesamiento de conjuntos de datos
El sistema propuesto se basa tanto en datos de gestos (para reconocimiento basado en TCN) como en datos de comandos de voz (para NLU/ASR). Para ello, utilizamos tres conjuntos de datos principales: EgoGesture para gestos dinámicos continuos en entornos similares a VR, IPN Hand para complementar gestos naturales de corto alcance, y Fluent SpeechCommands 44 para entrenar la comprensión semántica por voz de enunciados de diseño. Los conjuntos de datos opcionales son HaGRID para el preentrenamiento del detector de gestos estáticos y Mozilla Common Voice para el preentrenamiento general de ASR, pero ninguno de estos es necesario. Esta elección permite cubrir ambas modalidades manteniendo el alcance de los conjuntos de datos lo más razonable y reproducible posible. La Tabla 1 muestra los detalles del conjunto de datos del trabajo propuesto.

La selección del conjunto de datos en este artículo es crucial, ya que cada conjunto está diseñado para abordar un escenario distinto de interacción multimodal en VR. El conjunto de datos EgoGesture ofrece una colección a gran escala y naturalista de gestos manuales, asegurando un alto rendimiento de reconocimiento a pesar de las condiciones variables de iluminación y entorno. Dado que el conjunto de datos de manos IPN está diseñado para movimientos de mano continuos y sin restricciones, sería especialmente adecuado para operaciones de control de alta precisión y segmentación de gestos en tiempo real. Además, el conjunto de datos Fluent Speech Commands ofrece comandos de voz etiquetados con anotaciones semánticas para la detección de intención, lo cual es crucial para permitir una ejecución precisa y natural de comandos en VR. En conjunto, estos conjuntos de datos proporcionan una cobertura complementaria tanto de las modalidades de gesto como de habla, proporcionando diversidad, robustez y rendimiento cotidiano que mejoran la evaluación del sistema propuesto. Además de los conjuntos de datos públicos, también verificamos el protocolo utilizando un conjunto de datos independiente interno que comprende 312 muestras de gestos y 128 comandos de voz de 10 nuevos participantes. Esta validación independiente confirmó la reproducibilidad y robustez del protocolo.

Preprocesamiento de datos
La información recopilada se normaliza, muestrea y aumenta sistemáticamente antes del entrenamiento del modelo:

Normalización de secuencias gestuales
Una secuencia de vídeo de gestos se representa como una serie temporal multivariante de características óseas de la articulación:

Ecuación 1(9)

Donde Ti es la longitud del gesto i-ésimo y d es la dimensión de las características (por ejemplo, ubicaciones de las articulaciones de la mano). Como diferentes gestos pueden tener diferentes longitudes Ti, los remuestreamos en una secuencia constante de longitud T:

Ecuación 2(10)

Esto hace que todas las muestras de gestos, independientemente de la duración de la grabación, sean comparables a una longitud temporal estándar que puede usarse para el entrenamiento TCN.

Estandarización de características
Para eliminar diferencias de escala entre usuarios y condiciones de grabación, cada espacio de características se estandariza:

Ecuación 3(11)

Donde Ecuación 4 es la media de la característica j, y σj es su desviación estándar. La normalización de este modo garantiza que las características estén centradas con la varianza unitaria y que las diferencias individuales en el rendimiento de los gestos se minimizen.

Aumento de datos
La inclusión de perturbaciones sintéticas mejora la robustez ante la variabilidad. El jitter temporal primero desplaza aleatoriamente la alineación de la secuencia:

Ecuación 5(12)

donde δ es el jitter máximo en frames. La segunda inyección de ruido añade perturbaciones gaussianas a las características:

Ecuación 6(13)

Estas mejoras permiten que el modelo sea robusto frente a irregularidades de tiempo y ruido de sensores en interacciones reales de VR.

Preprocesamiento de voz
Cada enunciado hablado se asigna inicialmente a una representación de espectrograma log-Mel:

Ecuación 7(14)

Donde F es la cantidad de bins de frecuencia y T′ la cantidad de marcos temporales. Para compensar la variabilidad de la grabación, las características del espectrograma se normalizan como:

Ecuación 8(15)

Donde μV, σV son la media global y la desviación estándar sobre el corpus. Esto proporciona un espacio acústico estable para los modelos ASR y NLU.

Codificación por ranura de intención
Además de las características acústicas, cada comando de voz está etiquetado con ranuras semánticas estructuradas:

Ecuación 9 (16)

donde, por ejemplo, "girar la silla 15 grados" corresponde a (acción = rotar, objeto = silla, ubicación = nulo). Esta codificación sistemática permite al sistema derivar parámetros específicos de diseño y transformarlos en operaciones ejecutables de realidad virtual.

Diseño de interacción gestual con red convolucional temporal (TCN)
El Diseño de Interacción con Gestos especifica cómo los usuarios interactúan con objetos virtuales en el sistema de diseño de hogares en realidad virtual utilizando gestos naturales con las manos. El diseño comienza desarrollando un léxico gestual: una asociación de gestos con las manos con funciones del sistema. Por ejemplo, un gesto de agarre podría controlar la colocación de objetos, un gesto de pellizcar podría controlar el escalado y un gesto de rotación podría girar objetos alrededor de un eje seleccionado.

En el sistema en cuestión, EgoGesture e IPN Hand sirven como conjuntos base de datos de gestos para entrenar la Red Convolucional Temporal (TCN), mientras que los Fluid Speech Commands complementan el diseño con capacidades de interacción habilitadas por voz. Combinados, proporcionan interacción multimodal en realidad virtual.

Representaciones gestuales del conjunto de datos
Una secuencia de gestos de EgoGesture o IPN Hand es una serie temporal multivariante:

Ecuación 10(17)

Ecuación 11(18)

Aquí, T es el número predeterminado de fotogramas (tras el remuestreo), y d es el número de dimensiones de las características esqueléticas (por ejemplo, ubicaciones de articulaciones 3D). El conjunto de datos tiene etiquetas y(i)y que indican una de las clases de gestos C.

Codificación convolucional temporal
Utilizamos una Red Convolucional Temporal (TCN) para clasificar gestos en tiempo real. TCN captura dependencias a corto y largo plazo en secuencias de gestos. Los TCN, a diferencia de los RNN, utilizan convoluciones causales dilatadas, que permiten un cálculo paralelo eficiente.

El TCN aplica estas secuencias mediante convoluciones causales dilatadas para aprender dependencias a corto y largo plazo:

Ecuación 13(19)

donde dL es el factor de dilatación en la capa l, K es el tamaño del núcleo y σ es una activación no lineal (ReLU). El campo receptivo depende de:

Ecuación 14(20)

requiriendo que el TCN abarque gestos de diferentes longitudes temporales.

Clasificación de los gestos
El último estado oculto pasa por un clasificador Softmax:

Ecuación 15 (21)

con objetivo de entrenamiento definido por entropía cruzada:

Ecuación 16 (22)

Integración con comandos de voz
Mientras que las operaciones espaciales (mover, rotar, escalar) se abordan mediante el reconocimiento de gestos de EgoGesture e IPN Hand, el conjunto de datos Fluent Speech Commands se aplica para comandos semánticos. Cada enunciado se traduce en una representación estructurada de ranura: Ecuación 17 que aumenta la entrada del gesto ofreciendo parámetros (por ejemplo, "rotar la silla 15°").

Entonces ambas salidas se combinan:

Ecuación 18(23)

Donde o(i) es la primitiva de control de la VR (colocación, escalado, rotación).

La Red Convolucional Temporal (TCN) es eficaz para manejar datos secuenciales empleando convoluciones 1D dilatadas en secuencias de entrada, como señales de gesto o de voz, como se muestra en la Figura 2. A diferencia de los modelos recurrentes, las NTC utilizan filtros convolucionales para aprender tanto relaciones temporales a corto como a largo plazo. Se emplean bloques residuales con conexiones de salto para proporcionar estabilidad durante el entrenamiento y evitar gradientes nulos, mientras que el uso de capas TCN apiladas permite a la red aprender patrones temporales a múltiples escalas. En última instancia, una capa de clasificación totalmente conectada proyecta las características temporales aprendidas en etiquetas de salida, como clases de gestos o intenciones habladas. Este diseño es especialmente adecuado para el reconocimiento continuo de gestos y la comprensión de comandos de voz, ya que combina eficiencia computacional con potentes capacidades de modelado temporal.

La Tabla 2 resume el diseño arquitectónico general y la configuración de entrenamiento de la Red Convolucional Temporal utilizada en el sistema propuesto para el reconocimiento de gestos. El modelo cuenta con cuatro bloques residuales de TCN, cada uno basado en convoluciones causales dilatadas, lo que permite a la red modelar dependencias temporales tanto a corto como a largo plazo. Estas dependencias son cruciales para distinguir entre gestos dinámicos, como agarrar, rotar y pellizcar. Con un tamaño de núcleo de 3 y factores de dilatación, los factores de dilatación de [1,2,4,8] expanden eficientemente el campo receptivo temporal sin aumentar el coste computacional. Para mejorar la generalización entre usuarios y condiciones de registro, se utilizó la normalización de capas y una tasa de corte de 0,25 dentro de cada bloque. Para el entrenamiento, se utiliza un optimizador Adam con una tasa de aprendizaje de 1 × 10-3, un tamaño de lote de 32 y una secuencia de 64 tramas, que equilibra óptimamente la precisión y la respuesta en tiempo real. Durante la inferencia, una estrategia de ventana deslizante hace posible predicir gestos cada 20-25 ms, manteniendo la latencia de extremo a extremo por debajo de 120 ms. Esta combinación de arquitectura e hiperparámetros proporciona una alta precisión en la clasificación de gestos (∼94% de precisión en la colocación) mientras preserva la interacción en tiempo real, permitiendo a TCN realizar tareas inmersivas de manipulación de realidad virtual.

Diseño de Interacción de Voz (ASR+NLU)
El componente de interacción de voz complementa el control espacial basado en gestos mediante comandos de voz semánticos y parametrizados para el sistema de diseño doméstico de realidad virtual. La entrada hablada a(i) se graba primero como audio en bruto y se convierte a un espectrograma log-Mel:

Ecuación 19 (24)

Donde F es el número de bins de frecuencia T que corresponde a la duración de los intervalos de tiempo. La representación preserva tanto los patrones espectrales como temporales del habla y se normaliza para ser invariante a la variabilidad del hablante y del entorno:

Ecuación 37(25)

El espectrograma normalizado se introduce en un modelo de Reconocimiento Automático de Voz (ASR) como Whisper, que transforma las características acústicas en una secuencia de token:

Ecuación 20 (26)

donde cada uno es un token para una palabra o sub-palabra. Dicha transcripción se introduce en un modelo de Comprensión del Lenguaje Natural (NLU), que captura el significado estructurado. Más precisamente, NLU hace predicciones sobre categorías de intención y ranuras semánticas:

Ecuación 21 (27)

donde, por ejemplo, la afirmación "girar la silla quince grados" se corresponde a (acción = rotar, objeto = silla, ubicación/parámetro = 15°).

El marco de ranura de intención identificado se traduce entonces en un comando matemático que puede implementarse dentro del sistema VR:

Ecuación 22(28)

Donde u(i) puede ser una transformación numérica (por ejemplo, rotación de 15°) o un cambio categórico (por ejemplo, intercambio de materiales).

La robustez se logra finalmente mediante un mecanismo de arbitraje basado en la confianza. Si la puntuación de confianza ASR p(z) o la puntuación de confianza de NLU p(s) es menor que un umbral τ, el sistema solicita aclaración o por defecto recurre al control basado en gestos. Esto garantiza que los comandos de voz sean precisos y claros, mejorando la usabilidad para tareas de diseño que requieren precisión.

Diseño de fusión multimodal
La ventaja de la fusión multimodal en el sistema de realidad virtual propuesto es que la comprensión de la voz y la detección de gestos se integran en un único proceso de toma de decisiones, en lugar de gestionarse por separado. El módulo de gestos proporciona una salida Ecuación 23 de clasificación desde el TCN, mientras que el módulo de voz ofrece una representación s(i) con ranura de intención. Para fusionar estos sistemas, el sistema implementa fusión a nivel de decisión con arbitraje basado en la confianza.

Haz que el clasificador de gestos proporcione una distribución de probabilidad sobre clases de gestos:

Ecuación 24 (29)

y sea que el modelo NLU produzca probabilidades de ranura de intención:

Ecuación 25 (30)

Donde a, o y p se refieren a ranuras de acción, objeto y parámetros derivadas de la entrada de voz. El paso de fusión calcula una decisión conjunta combinando las dos modalidades según sus puntuaciones de confianza:

Ecuación 26 (31)

Donde α∈[0,1] se establece dinámicamente en función de la confianza del sistema (por ejemplo, más alta cuando los gestos son más seguros, menor cuando el habla es clara).

Algoritmo 1: Multimodal_Fusion (X, a):

Entrada:

X = secuencia de gestos preprocesados, a = comando de audio

Salida:

O = comando de acción VR

Paso 1: Reconocimiento de gestos

Ecuación 27  

Paso 2: Comprensión de la voz

Ecuación 28  

Ecuación 29  

Paso 3: Decisión sobre fusión

Ecuación 30  

Ecuación 31  

Ecuación 32  

Ecuación 33  

Ecuación 34  

De lo contrario:

Ecuación 35  

Paso 4: Manejo de errores

Ecuación 36 ):

Solicitar aclaración al usuario

De lo contrario:

Enviar O al sistema VR

volver O

Este Algoritmo 1 alterna entre la entrada de gestos y la entrada de voz para formular un comando potente para el diseño de VR. El módulo de gestos (TCN) interpreta primero movimientos de la mano como la rotación o la escalada y asigna una puntuación de confianza basada en la certeza del modelo. Paralelamente, el módulo de voz también realiza conversión de voz a texto con ASR (por ejemplo, Whisper) y aplica NLU para identificar la intención semántica, como "rotar la silla 15°". Ambos módulos devuelven sus predicciones junto con las puntuaciones de confianza. El paso de combinación equilibra entonces las dos salidas. Si ambas entradas son definidas, el sistema las combina proporcionalmente a sus niveles de confianza. Si una entrada es ambigua (por ejemplo, ruido en la voz o gesto incierto), el sistema prioriza más a la otra. Por último, si ninguna de las dos es definitiva, el sistema solicita aclaraciones para evitar errores. Esto hace que la fusión sea adaptativa (los pesos cambian según la calidad de entrada), robusta (que acomoda datos ruidosos o faltantes) y precisa (aprovechando las mejores fortalezas tanto del gesto como de la voz).

Participantes
Este estudio incluye a un grupo de voluntarios seleccionados tanto entre estudiantes universitarios como profesionales del diseño para recopilar opiniones diversas sobre la usabilidad de la VR. Las edades de los participantes iban desde la edad adulta temprana hasta la mediana edad, representando una mezcla de niveles previos de experiencia en realidad virtual, incluyendo principiantes, usuarios ocasionales y usuarios avanzados. Todos los participantes tenían visión normal o corregida y no se reportaron alteraciones motoras que pudieran interferir sustancialmente con la interacción basada en gestos. Las graves dificultades del habla, las limitaciones importantes de movilidad en el brazo o cualquier historial previo de mareo por movimiento inducido por la RV excluían a las personas por seguridad y consistencia en la participación. Todos los participantes proporcionaron su consentimiento informado, y los procedimientos para la evaluación fueron aprobados por el comité de revisión institucional. Esta subsección identifica claramente quién participó en la evaluación, permitiendo la reproducibilidad del estudio.

Montaje experimental
La configuración experimental propuesta incluye el sistema multimodal de realidad virtual desarrollado, que se despliega en un casco de realidad virtual de consumo equipado con capacidades integradas de seguimiento de manos y una cámara RGB para capturar gestos. Cuenta con un escritorio de alto rendimiento, que permite el procesamiento en tiempo real de técnicas de reconocimiento de gestos, ASR y fusión multimodal. El entorno de realidad virtual está construido en Unity 3D y contiene una sala de diseño del hogar que puede configurarse con muebles, materiales y elementos de iluminación. La configuración incluye ASR basado en Whisper para la transcripción de voz, y también incluye un módulo NLU basado en transformadores para detectar la intención. Esta descripción se ha trasladado desde la sección de Resultados para ofrecer una visión técnica adecuada del entorno antes de discutir los resultados.

Escenarios de pruebas subjetivas
Los participantes interactuaron con un entorno simulado de diseño de viviendas que consistía en un salón amueblado, un dormitorio y un pequeño espacio de trabajo. En cada escenario, se pidió a los usuarios que cambiaran objetos virtuales y variables ambientales en el entorno según circunstancias de diseño realistas. Por ejemplo, se pidió a los participantes que colocaran un sofá respecto a un punto de referencia, rotaran una silla en una dirección específica, redimensionaran una mesa a una dimensión objetivo o modificaran el material de la pared/perfil de luz. Estos escenarios se seleccionaron porque representan tareas típicas de diseño de interiores que desafían tanto el control basado en gestos (en términos de precisión espacial) como el control basado en voz (en términos de comandos semánticos). Esta subsección responde directamente a la pregunta del revisor sobre las condiciones subjetivas de prueba bajo las cuales los usuarios evaluaron el sistema.

Diseño de tareas
Los participantes realizaron un conjunto estructurado de ejercicios que abordaban diferentes áreas de manipulación de objetos e interacción con el diseño. Las tareas principales fueron las siguientes: 1) Colocación del mobiliario: Los participantes colocaron objetos en las coordenadas objetivo. 2) Tarea de rotación: En esta tarea, los usuarios debían cambiar la orientación para que coincidiera con un ángulo de referencia. 3) Tarea de escalado: Esto implicaba ajustar el tamaño del mobiliario a dimensiones preestablecidas. Además, 4) Edición de materiales/color: Los participantes empleaban comandos de voz para cambiar las texturas o modificar la iluminación. Se proporcionaron tareas opcionales de navegación para capturar la capacidad de conciencia espacial dentro de la sala virtual. Cada trabajo se estableció con objetivos claros, resultados cuantificables y un límite de tiempo definido, asegurando que tanto la precisión como la eficiencia pudieran evaluarse adecuadamente.

Procedimiento
Para garantizar la uniformidad entre los participantes, la evaluación se realizó en una secuencia planificada. Primero se les explicó el sistema a los usuarios y se les dio una breve demostración de las modalidades de interacción entre gestos y habla. Una fase inicial de calibración permitió adaptarse a las posturas individuales de las manos y a las características del habla. Los usuarios realizaron entonces una breve sesión de práctica para acostumbrarse a ambas modalidades. La evaluación real requería realizar todas las tareas en tres condiciones de interacción: usar solo un controlador, usar solo gestos y usar gestos más voz como entrada multimodal. El orden de condición se contrarrestó para reducir los efectos del aprendizaje. Al final, los sujetos completaron instrumentos de evaluación estandarizados, como el SUS, NASA-TLX e IPQ, y participaron en una breve entrevista de retroalimentación cualitativa.

Métricas de evaluación
Este procedimiento estructurado establece transparencia metodológica, permitiendo estudios de replicación. Se combinaron métricas objetivas y subjetivas para evaluar de forma exhaustiva el rendimiento del sistema. Las métricas objetivo incluían el tiempo de finalización de la tarea, una medida de eficiencia; precisión en la colocación, cuantificada como la desviación respecto a la posición o rotación del objetivo; y tasa de error, definida como el número de malas clasificaciones de entrada o acciones no intencionadas realizadas por el sistema. Se capturaron métricas subjetivas mediante cuestionarios validados: la Escala de Usabilidad del Sistema para medir la usabilidad percibida, la escala NASA-TLX para evaluar la carga mental y física, y el Cuestionario de Presencia del grupo I para medir la inmersión y la presencia en la VR. Estos se han trasladado adecuadamente desde la sección de Resultados para describir cómo se midió el rendimiento antes de presentar cualquier resultado.

Entorno VR, integración de sistemas y evaluación
La plataforma principal para comandos de voz y gestos es un entorno interactivo de realidad virtual donde se despliega el sistema. Se utilizan bibliotecas integradas de muebles, texturas y elementos de iluminación para crear salas virtuales en Unity 3D. Permite a los usuarios organizar, personalizar y editar elementos en tiempo real. La precisión se mejora mediante capacidades de chasque, detección de colisiones y superposiciones de medición, permitiendo que los objetos se alineen de forma natural. El renderizado en tiempo real de la iluminación y los materiales mejora la experiencia de diseño al proporcionar retroalimentación instantánea en cada interacción.

Tras validar los módulos individuales para reconocimiento de gestos, comprensión de voces y fusión multimodal, se combinan en una cadena unificada. El sistema está diseñado para tener baja latencia, por lo que los comandos del usuario aparecen casi inmediatamente en el entorno VR. Las pruebas piloto se realizan con un número reducido de miembros para perfeccionar el flujo de interacción. La iteración incluye vocabularios de gestos, validación de la gramática de comandos de voz y asegurar que el sistema se sienta natural y fiable durante un uso continuo.

Se utilizará un estudio exhaustivo que compare tres modalidades de interacción, como la fusión multimodal gesto-voz, la entrada solo con controlador y el modo híbrido, para evaluar la experiencia del usuario. Se requieren tareas, incluyendo cambio de materiales, rotación y colocación de objetos, a los participantes. Para evaluar el desempeño, se recopilan métricas objetivas, como el tiempo de logro laboral, la corrección de la colocación y los cargos de error. Las valoraciones subjetivas se obtienen de los participantes mediante cuestionarios estandarizados, como la Escala de Usabilidad del Sistema (SUS), la carga de trabajo cognitiva de la NASA-TLX y el cuestionario IPQ para inmersión, con entrevistas a los participantes que proporcionan apoyo adicional. Esta evaluación dual codifica tanto medidas de rendimiento cuantificables como experiencia subjetiva del usuario.

El avance de este sistema es aplicar la fusión multimodal a tareas de diseño de precisión más allá de la navegación o interacción básica. La técnica ofrece una forma más orgánica, precisa y accesible de interactuar al combinar el valor semántico de las instrucciones de voz con las ventajas espaciales de los gestos. Al ofrecer funciones de accesibilidad adaptables, como el respaldo solo por voz y el reconocimiento de gestos con una sola mano, el sistema también mejora la inclusión. Finalmente, el estudio ofrece un conjunto de datos multimodal metódico y anotado de interacciones voz-gesto, promoviendo futuros estudios en diseño inmersivo de interfaces y reforzando la reproducibilidad.

La Figura 3 muestra capturas de pantalla típicas del programa implementado, proporcionando una representación más vívida del sistema de diseño interior VR construido. El entorno de realidad virtual inmersiva, donde los usuarios pueden explorar y visualizar la distribución de la sala, se representa en la Figura 3A. La Figura 3B muestra cómo las interacciones naturales de las manos pueden utilizarse para seleccionar, mover y rotar muebles virtuales en un proceso de manipulación de objetos basado en gestos. La Figura 3C ilustra la interfaz de voz integrada, donde el micrófono y los símbolos de retroalimentación de voz validan los comandos de voz emitidos por el usuario para modificaciones espaciales o colocación de objetos. En conjunto, estas capturas de pantalla del sistema multimodal de realidad virtual propuesto demuestran que ha sido completamente implementado, permitiendo la interacción en tiempo real con gestos y voces.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

El sistema de diseño multimodal de hogares VR diseñado fue validado con tres conjuntos de datos fundamentales: EgoGesture (gestos dinámicos), IPN Hand (gestos continuos con la mano) y Fluent Speech Commands (comandos de voz con etiquetas de ranura de intención). En conjunto, los tres conjuntos de datos ofrecieron una base integral de entrenamiento y evaluación, abordando tanto el reconocimiento de gestos como la comprensión semántica basada en la voz. La validación establece que la integración gesto-voz mejora significat...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Los resultados de esta investigación avanzan en la tecnología del artículo base, que mostró principalmente los méritos de la navegación inmersiva en realidad virtual para la accesibilidad combinando modalidades de gesto y voz para tareas de diseño. El sistema multimodal rindió mejor en todas las medidas de rendimiento objetivo y subjetivo, con tiempos de finalización de tareas más cortos, mayor precisión en la colocación y tasas de error más bajas que los enfoques basados en controladore...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores no tienen conflictos de interés que declarar.

Agradecimientos

Los autores agradecen el apoyo institucional de la School of Architecture, Building & Design, y de The Design School de la Universidad Taylor's por proporcionar recursos y orientación académica durante esta investigación.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Conjunto de datos EgoGestureUniversidad Tecnológica de NanyangDOI: 10.1109/TMM.2018.2808769Conjunto de datos de gestos de mano egocéntricos a gran escala para entrenamiento dinámico de reconocimiento gestual.
Conjunto de datos de comandos de voz fluidosFluent.ai / Universidad de AlbertaDOI: 10.48550/arXiv.1804.04363Conjunto de datos para la intención de voz y la comprensión semántica basada en ranuras para el entrenamiento ASR/NLU.
Conjunto de datos HaGRID (opcional)Sber AI / Código Abiertov1.1Conjunto de datos opcional utilizado para el preentrenamiento estático de detectores de gestos manuales.
Cuestionario de Presencia Igroup (IPQ)igroup.orgN/AUsado para medir la inmersión y la presencia en entornos de realidad virtual.
Conjunto de datos manual IPNUniversidad VeracruzanaDOI: 10.1109/CVPRW50498.2020.00241Conjunto de datos para tareas continuas y naturales de reconocimiento de gestos manuales y segmentación.
Matplotlib / SeabornCódigo abiertoÚltima PlantillaUtilizado para la visualización de métricas de rendimiento y resultados de evaluación.
Manos de MediaPipeInvestigación en GoogleCódigo abierto (GitHub)Utilizado para el seguimiento en tiempo real de manos y gestos para el reconocimiento de entradas de gestos.
Mozilla Common Voice (opcional)Fundación MozillaVersión 17Conjunto de datos opcional para el preentrenamiento del modelo ASR en datos generales de habla.
Capa de fusión multimodalAlgoritmo personalizadoN/AFlujos de gestos y entradas de voz basados en arbitraje ponderado por la confianza.
Evaluación de la Carga de Trabajo NASA-TLXFactores Humanos de la NASAN/AUtilizado para el análisis de la carga cognitiva de los participantes.
Módulo de Comprensión del Lenguaje Natural (NLU)Personalizado (basado en BERT / RoBERTa)N/ASe utiliza para extraer intenciones semánticas y ranuras (acción, objeto, parámetro) de la entrada de voz transcrita.
NumPy / Pandas / OpenCVCódigo abiertoÚltima PlantillaUtilizado para operaciones numéricas, preprocesamiento de datos y manipulación de fotogramas de vídeo.
Lenguaje de programación PythonFundación de Software PythonVersión 3.10+Se utiliza para implementar modelos de ML (TCN, ASR, NLU, fusion).
Marco de Aprendizaje Profundo PyTorchMeta IAVersión 2.0+Se utiliza para construir y entrenar modelos de reconocimiento de gestos (TCN) y NLU.
Cámara RGBLogitech / RealSenseLogitech C920 o Intel RealSense D435Se utiliza para captura de gestos con la mano y reconocimiento de movimiento.
Cuestionario de la Escala de Usabilidad del Sistema (SUS)Herramienta estándar de evaluaciónN/AUtilizado para evaluar la usabilidad subjetiva de un sistema de realidad virtual.
Red Convolucional Temporal (TCN)Implementación personalizada (PyTorch / TensorFlow)N/AUtilizado para el reconocimiento dinámico de gestos a partir de datos esqueléticos de series temporales.
Motor 3D UnityTecnologías UnityVersión 2022.3 LTSUtilizado para desarrollar entornos inmersivos de realidad virtual con mobiliario interactivo, edición de materiales y renderizado en tiempo real.
Casco de realidad virtualOculus (Meta) / HTC ViveOculus Quest 2 o HTC Vive ProUtilizado para visualización inmersiva y seguimiento espacial durante la interacción en VR.
Modelo ASR WhisperOpenAIWhisper (modelo base)Motor de reconocimiento automático de voz para convertir voz a texto.
Estación de trabajoPC personalizadoIntel Core i7 / NVIDIA RTX 3070 / 32 GB RAMUtilizado para procesamiento en tiempo real, entrenamiento e inferencia de modelos de gestos y voz.

Referencias

  1. Kim, J., Ahn, J. -H., Kim, Y. Immersive interaction for inclusive virtual reality navigation: enhancing accessibility for socially underprivileged users. Electronics. 14, 1046(2025).
  2. Lee, W. -J., Kim, Y. -H. Does VR tourism enhance users' experience. Sustainability. 13, 806(2021).
  3. Embedding virtual and augmented reality in higher education in Yemeni universities. Nagi, G., Al-Fuhaidi, B. 2024 1st International Conference on Emerging Technologies for Dependable Internet of Things (ICETI), 15-17 January, Riyadh, Saudi Arabia, 1, 1-10 (2024).
  4. Narin, N. G. A content analysis of the metaverse articles. J Metaverse. 1, 17-24 (2021).
  5. Towards a social VR-based exergame for elderly users: an exploratory study of acceptance, experiences, and design principles. Shah, S. H. H., Hameed, I. A., Karlsen, A. S. T., Solberg, M. International Conference on Human-Computer Interaction, 1, Springer. Washington, DC, USA. 1-12 (2022).
  6. Zahedian-Nasab, N., Jaberi, A., Shirazi, F., Kavousipor, S. Effect of virtual reality exercises on balance and fall in elderly people with fall risk: a randomized controlled trial. BMC Geriatr. 21, 509(2021).
  7. Babadi, S. Y., Daneshmandi, H. Effects of virtual reality versus conventional balance training on balance of the elderly. Exp Gerontol. 153 (6), 111498(2021).
  8. Liang, H., et al. Metaverse virtual social center for elderly communication in time of social distancing. Virtual Real Intell Hardw. 5, 68-80 (2023).
  9. Shah, S. H. H., Karlsen, A. S. T., Solberg, M., Hameed, I. A. A social VR-based collaborative exergame for rehabilitation: co-design, development, and user study. Virtual Real. 27, 3403-3420 (2023).
  10. Chen, C. -H., Chen, M. -X. Effects of the design of overview maps on three-dimensional virtual environment interfaces. Sensors. 20, 4605(2020).
  11. Sudár, A., Csapó, A. B. Descriptive markers for the cognitive profiling of desktop 3D spaces. Electronics. 12, 448(2023).
  12. Wang, Y., Hu, Y., Chen, Y. An experimental investigation of menu selection for immersive virtual environments: fixed versus handheld menus. Virtual Real. 25, 409-419 (2021).
  13. Grabowski, A. Practical skills training in enclosure fires: an experimental study with cadets and firefighters using CAVE and HMD-based virtual training simulators. Fire Saf J. 125 (4), 103440(2021).
  14. Zhang, L., et al. A hybrid 2D-3D tangible interface combining a smartphone and controller for virtual reality. Virtual Real. 27, 1273-1291 (2023).
  15. Is it real? Measuring the effect of resolution, latency, frame rate, and jitter on the presence of virtual entities. Louis, T., Troccaz, J., Rochet-Capellan, A., Bérard, F. Proc 2019 ACM Int Conf Interactive Surfaces, 1, 5-16 (2019).
  16. Riches, S., Elghany, S., Garety, P., Rus-Calafell, M., Valmaggia, L. Factors affecting sense of presence in a virtual reality social environment: a qualitative study. Cyberpsychol Behav Soc Netw. 22 (5), 288-292 (2019).
  17. Weech, S., Kenny, S., Barnett-Cowan, M. Presence and cybersickness in virtual reality are negatively related: a review. Front Psychol. 10, 158(2019).
  18. Sae-Bae, N., et al. Emerging NUI-based methods for user authentication: a new taxonomy and survey. IEEE Trans Biom Behav Identity Sci. 1, 5-31 (2019).
  19. Appel, L., et al. Older adults with cognitive and/or physical impairments can benefit from immersive virtual reality experiences: a feasibility study. Front Med. 6, 329(2020).
  20. Pirker, J., Dengel, A. The potential of 360 virtual reality videos and real VR for education: a literature review. IEEE Comput Graph Appl. 41 (6), 76-89 (2021).
  21. Schäfer, A., Reis, G., Stricker, D. Controlling teleportation-based locomotion in virtual reality with hand gestures: a comparative evaluation of two-handed and one-handed techniques. Electronics. 10, 715(2021).
  22. Radhakrishnan, U., Koumaditis, K., Chinello, F. A systematic review of immersive virtual reality for industrial skills training. Behav Inf Technol. 40 (12), 1310-1339 (2021).
  23. Zhang, X., et al. How virtual reality affects perceived learning effectiveness: a task-technology fit perspective. Behav Inf Technol. 36, 548-556 (2017).
  24. Challenor, J., White, D., Murphy, D. Hand-controlled user interfacing for head-mounted augmented reality learning environments. Multimodal Technol Interact. 7, 55(2023).
  25. Budiharto, W. Intelligent controller of electric wheelchair from manual wheelchair for disabled person using 3-axis joystick. ICIC Express Lett B Appl. 12, 201-206 (2021).
  26. Letaief, M., Rezzoug, N., Gorce, P. Comparison between joystick- and gaze-controlled electric wheelchair during narrow doorway crossing: feasibility study and movement analysis. Assist Technol. 33 (1), 26-37 (2021).
  27. Venkatesan, M., Mohan, L., Manika, N., Mathapati, A. Voice-controlled intelligent wheelchair for quadriplegics. Computing, Communication, and Networking Technologies. 1, Springer. 41-51 (2021).
  28. Charlton, J., et al. Manual wheelchair skills training using virtual technology: a systematic review. Technical Report. , Flinders University. (2024).
  29. Genova, C., et al. A simulator for both manual and powered wheelchairs in immersive virtual reality CAVE. Virtual Real. 26, 187-203 (2022).
  30. Hoter, E., Nagar, I. The effects of a wheelchair simulation in a virtual world. Virtual Real. 27, 407-419 (2023).
  31. Improving wheelchair driving performance in a virtual reality simulator. Archambault, P. S., Bigras, C. 2019 Int Conf Virtual Rehabilitation (ICVR), Tel Aviv, 1, 1-2 (2019).
  32. Automatic synthesis of virtual wheelchair training scenarios. Li, W., Talavera, J., Samayoa, A. G., Lien, J. M., Yu, L. F. 2020 IEEE Conf Virtual Reality and 3D User Interfaces (VR), , 539-547 (2020).
  33. Yan, H., Archambault, P. S. Augmented feedback for manual wheelchair propulsion technique training in a virtual reality simulator. J Neuroeng Rehabil. 18 (1), 142(2021).
  34. Montalbán, M. A., Arrogante, O. Rehabilitation through virtual reality therapy after a stroke: a literature review. Rev Cient Soc Esp Enferm Neurol (Engl Ed). 52, 19-27 (2020).
  35. Jessica, P., Salim, S., Syahputra, M. E., Suri, P. A. A systematic literature review on implementation of virtual reality for learning. Procedia Comput Sci. 216 (1), 260-265 (2023).
  36. Efficacious opportunities and implications of virtual reality features and techniques. Nithva, B., Asha, V., Kumar, K., Giri, J. 2022 Fourth Int Conf Cognitive Computing and Information Processing (CCIP), , 1-8 (2022).
  37. The impact of controller type on video game user experience in virtual reality. Hufnal, D., Osborne, E., Johnson, T., Yildirim, C. 2019 IEEE Games, Entertainment, and Media Conf (GEM), , 1-7 (2019).
  38. Zhang, Y., Cao, C., Cheng, J., Lu, H. EgoGesture: a new dataset and benchmark for egocentric hand gesture recognition. IEEE Trans Multimed. 20 (4), 1038-1050 (2018).
  39. Egocentric gesture recognition using recurrent 3D convolutional neural networks with spatiotemporal transformer modules. Cao, C., et al. Proc IEEE Int Conf Computer Vision (ICCV), , 1-9 (2017).
  40. IPN Hand: a video dataset and benchmark for real-time continuous hand gesture recognition. Benitez-Garcia, G., et al. 25th Int Conf Pattern Recognition (ICPR), , 1-8 (2021).
  41. Lu, L., et al. Noncontact 3D gesture recognition enabled VR human-machine interface via electret-nanofiber-based triboelectric sensor. Nano Res. 18, 94907924(2025).
  42. Glorius, J. K., et al. Behavioral training procedures for head-fixed virtual reality in mice. J Vis Exp. (211), e67312(2024).
  43. Li, Y., et al. A stretchable, ionic conductive, and adhesive patch electrode with ultra-low on-skin impedance for electrophysiological signal recording. Sci China Inf Sci. 68, 129402(2025).
  44. Fluent speech commands: a dataset for spoken language understanding research. , Fluent.ai. https://fluent.ai/fluent-speech-commands-a-dataset-for-spoken-language-understanding-research/ (2025).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Control por gestosControl por vozInteracci n multimodalSeguimiento de manosEntrada de lenguaje naturalColocaci n precisa de mueblesAjuste espacial

Artículos relacionados