Este estudio fue aprobado por el Comité de Ética en la Investigación de la Universidad Taylor's, Subang Jaya, Malasia. Todos los procedimientos se ajustaron a las directrices éticas establecidas por el comité de investigación institucional y se ajustaron a la Declaración de Helsinki. Antes de la recogida de datos, se obtuvo el consentimiento informado de cada participante. Se les informó claramente sobre los objetivos del estudio, se les aseguró que la participación era voluntaria, que sus respuestas permanecerían confidenciales y que podían retirarse en cualquier momento sin consecuencias. También se obtuvo consentimiento informado por escrito para el uso de datos anonimizados de interacción y encuestas en publicaciones académicas. No se incluye información personal identificable, imágenes ni datos personales sensibles en este manuscrito.
El trabajo propuesto formula un sistema de realidad virtual (VR) basado en gestos y voz diseñado para un diseño inmersivo de hogares, superando a los métodos actuales orientados a tareas orientadas a la navegación. El enfoque comienza identificando las necesidades de los usuarios y las actividades de diseño, incluyendo el despliegue de muebles, la escalada y rotación de objetos, la edición de materiales y las mediciones precisas de las habitaciones. A continuación, se desarrolla un sistema de interacción gestual, donde los gestos manuales sin restricciones (como pellizcar, agarrar y girar) se detectan mediante seguimiento basado en auriculares o Manos MediaPipe y se identifican mediante modelos ligeros de aprendizaje automático, incluyendo Redes Convolucionales Temporales (TCN). Para complementar los gestos, se establece una gramática organizada de comandos de voz, combinada con el Reconocimiento Automático de Voz (ASR) basado en Susurros y la Comprensión del Lenguaje Natural (NLU), para derivar intenciones y parámetros para el control semántico de alto nivel. Las dos modalidades se combinan en una estrategia de fusión multimodal, donde se utilizan gestos para gestionar la selección y manipulación espacial, y comandos de voz para ofrecer refinamientos precisos, complementados por un mecanismo de arbitraje basado en confianza y recuperación de errores mediante comandos de deshacer.
El entorno de diseño inmersivo está desplegado en Unity 3D, con snapping, respuesta a colisiones, superposiciones de medición y una biblioteca interactiva de mobiliario y materiales para permitir flujos de trabajo de diseño realistas. Las pruebas piloto se realizan para asegurar la naturalidad de la interacción, estabilidad y baja latencia (<200 ms) antes de la evaluación formal.
Participantes y estrategia de muestreo
En total, se reclutaron 48 participantes para el estudio de usuarios para garantizar la diversidad y la generalización de los resultados. Las edades de los participantes oscilaban entre 19 y 62 años (M = 32,4, SD = 10,7), con 26 hombres y 22 mujeres. Para captar la variación en la familiaridad con tecnologías inmersivas, los participantes se dividieron en tres grupos de experiencia de RV: usuarios novatos (n = 18) con poca o ninguna exposición previa a la RV, usuarios intermedios (n = 17) con uso poco frecuente de la RV, y usuarios experimentados (n = 13) que usaban la RV regularmente, principalmente profesionalmente. Para garantizar la accesibilidad e inclusión de la muestra, también incluyó 6 participantes con limitaciones leves de movilidad y 4 participantes que preferían la interacción con una sola mano debido a limitaciones motoras. Todos los participantes tenían visión normal o corregida a normal, sin que ninguno reportara condiciones vestibulares o neurológicas que pudieran interferir con su uso de la VR.
A los participantes se les asignó aleatoriamente las tres condiciones de interacción utilizando una estrategia de asignación equilibrada: Gesto+Voz (n = 16), Solo Controlador (n = 16) e Híbrido (n = 16). Sus niveles de experiencia se distribuyeron de manera equitativa entre los tres grupos para evitar sesgos y asegurar una dificultad comparable en las tareas en las condiciones. Todos los participantes proporcionaron su consentimiento informado por escrito antes del inicio del experimento.
A continuación, se realiza un estudio de usuario en tres condiciones de interacción, como Voz de gesto, solo para control e híbrido, para evaluar precisión, eficiencia y experiencia de usuario. Las métricas cuantitativas incluyen la precisión de colocación, la duración de la tarea y las tasas de error, mientras que la evaluación subjetiva utiliza SUS, NASA-TLX e IPQ, respaldada por entrevistas cualitativas. Este sistema, presentado aquí, ofrece tres novedades principales: la utilización de la fusión multimodal gesto-voz para manipular objetos con precisión en VR, modos de interacción adaptativos y accesibles como gestos con una sola mano y respaldo de voz, y la provisión de un corpus reproducible de comandos de voz gestual anotados. En conjunto, estos pasos aseguran una mayor precisión, eficacia y experiencia de usuario, abordando directamente las deficiencias del artículo base y avanzando en la investigación en interacción inmersiva de realidad virtual para uso de diseño. La Figura 1 muestra la arquitectura del método propuesto.
La arquitectura del sistema del método propuesto, como se muestra en la Figura 1, comienza con las modalidades de entrada, donde los gestos se registran usando conjuntos de datos como EgoGesture e IPN Hand, e instrucciones de voz del conjunto de datos Fluent Speech Commands. Estas entradas se procesan de forma independiente utilizando módulos de reconocimiento de gestos y voz para producir datos espaciales y semánticos. Los dos flujos están fusionados dentro de una capa de fusión multimodal, que alinea las entradas de gestos y de voz para producir comandos consistentes. Estos datos fusionados se utilizan en la capa de interacción VR para facilitar a los usuarios la manipulación de objetos mediante colocación, rotación, escalado y modificación de materiales en tiempo real. Por último, las interacciones procesadas se ponen a disposición en la capa de salida, creando un espacio de diseño inmersivo centrado en la accesibilidad, precisión y interacción natural.
Requisitos del sistema y definición de tareas
El sistema previsto mejora los modelos de navegación VR con orientación a la accesibilidad para facilitar una planificación del hogar basada en la precisión. Identificamos el dominio de usuario como
, donde
son propietarios,
son profesionales en diseño y
usuarios de accesibilidad (personas mayores o con discapacidad de movilidad). Cada usuario realiza un conjunto de tareas principales T = {colocar, rotar, escalar, material, luz, medir}. Una tarea t ∈ T se realiza mediante entradas multimodales: flujo de gestos Gt (manipulación espacial) y comando de voz Vt (parámetros semánticos). El sistema relaciona estos con una acción mediante una política de fusión:
(1)
donde π es la función multimodal a nivel de decisión.
Las necesidades del sistema requieren interacción de baja latencia: ya sea
reconocimiento de gestos, comprensión del habla y tiempos de fusión.
(2)
La respuesta sumada proporciona una respuesta en tiempo real acorde con los umbrales de usabilidad inmersiva de la realidad virtual.
Para la precisión de la tarea, sea el estado de verdad fundamental del objeto (x, R, s, M, L) (posición, rotación, escala, material, longitud) y el estado
realizado del sistema . Las métricas de error son las siguientes:
(3)
(4)
(5)
(6)
Con
por desajuste de materiales.
Ambas modalidades generan puntuaciones de confianza cg (gesto) y cv (voz), normalizadas de modo que cg + c v = 1. El arbitraje de fusión minimiza un error ponderado:
(7)
Donde lg, lv son pérdidas específicas de modalidad. Si
, el sistema solicita una solicitud de aclaración, haciéndolo robusto para comandos poco claros.
Por último, las métricas de evaluación incluyen el tiempo de finalización de tareas Tt, las tasas de error Et y las puntuaciones de carga de trabajo de NASA-TLX, SUS e IPQ. Introducimos un índice compuesto de rendimiento de tareas:
(8)
minimizar a todos los usuarios, con umbrales que requieran una puntuación SUS de ≥70 y una reducción NASA-TLX en comparación con la VR base basada en controladores.
Recogida y preprocesamiento de conjuntos de datos
El sistema propuesto se basa tanto en datos de gestos (para reconocimiento basado en TCN) como en datos de comandos de voz (para NLU/ASR). Para ello, utilizamos tres conjuntos de datos principales: EgoGesture para gestos dinámicos continuos en entornos similares a VR, IPN Hand para complementar gestos naturales de corto alcance, y Fluent SpeechCommands 44 para entrenar la comprensión semántica por voz de enunciados de diseño. Los conjuntos de datos opcionales son HaGRID para el preentrenamiento del detector de gestos estáticos y Mozilla Common Voice para el preentrenamiento general de ASR, pero ninguno de estos es necesario. Esta elección permite cubrir ambas modalidades manteniendo el alcance de los conjuntos de datos lo más razonable y reproducible posible. La Tabla 1 muestra los detalles del conjunto de datos del trabajo propuesto.
La selección del conjunto de datos en este artículo es crucial, ya que cada conjunto está diseñado para abordar un escenario distinto de interacción multimodal en VR. El conjunto de datos EgoGesture ofrece una colección a gran escala y naturalista de gestos manuales, asegurando un alto rendimiento de reconocimiento a pesar de las condiciones variables de iluminación y entorno. Dado que el conjunto de datos de manos IPN está diseñado para movimientos de mano continuos y sin restricciones, sería especialmente adecuado para operaciones de control de alta precisión y segmentación de gestos en tiempo real. Además, el conjunto de datos Fluent Speech Commands ofrece comandos de voz etiquetados con anotaciones semánticas para la detección de intención, lo cual es crucial para permitir una ejecución precisa y natural de comandos en VR. En conjunto, estos conjuntos de datos proporcionan una cobertura complementaria tanto de las modalidades de gesto como de habla, proporcionando diversidad, robustez y rendimiento cotidiano que mejoran la evaluación del sistema propuesto. Además de los conjuntos de datos públicos, también verificamos el protocolo utilizando un conjunto de datos independiente interno que comprende 312 muestras de gestos y 128 comandos de voz de 10 nuevos participantes. Esta validación independiente confirmó la reproducibilidad y robustez del protocolo.
Preprocesamiento de datos
La información recopilada se normaliza, muestrea y aumenta sistemáticamente antes del entrenamiento del modelo:
Normalización de secuencias gestuales
Una secuencia de vídeo de gestos se representa como una serie temporal multivariante de características óseas de la articulación:
(9)
Donde Ti es la longitud del gesto i-ésimo y d es la dimensión de las características (por ejemplo, ubicaciones de las articulaciones de la mano). Como diferentes gestos pueden tener diferentes longitudes Ti, los remuestreamos en una secuencia constante de longitud T:
(10)
Esto hace que todas las muestras de gestos, independientemente de la duración de la grabación, sean comparables a una longitud temporal estándar que puede usarse para el entrenamiento TCN.
Estandarización de características
Para eliminar diferencias de escala entre usuarios y condiciones de grabación, cada espacio de características se estandariza:
(11)
Donde
es la media de la característica j, y σj es su desviación estándar. La normalización de este modo garantiza que las características estén centradas con la varianza unitaria y que las diferencias individuales en el rendimiento de los gestos se minimizen.
Aumento de datos
La inclusión de perturbaciones sintéticas mejora la robustez ante la variabilidad. El jitter temporal primero desplaza aleatoriamente la alineación de la secuencia:
(12)
donde δ es el jitter máximo en frames. La segunda inyección de ruido añade perturbaciones gaussianas a las características:
(13)
Estas mejoras permiten que el modelo sea robusto frente a irregularidades de tiempo y ruido de sensores en interacciones reales de VR.
Preprocesamiento de voz
Cada enunciado hablado se asigna inicialmente a una representación de espectrograma log-Mel:
(14)
Donde F es la cantidad de bins de frecuencia y T′ la cantidad de marcos temporales. Para compensar la variabilidad de la grabación, las características del espectrograma se normalizan como:
(15)
Donde μV, σV son la media global y la desviación estándar sobre el corpus. Esto proporciona un espacio acústico estable para los modelos ASR y NLU.
Codificación por ranura de intención
Además de las características acústicas, cada comando de voz está etiquetado con ranuras semánticas estructuradas:
(16)
donde, por ejemplo, "girar la silla 15 grados" corresponde a (acción = rotar, objeto = silla, ubicación = nulo). Esta codificación sistemática permite al sistema derivar parámetros específicos de diseño y transformarlos en operaciones ejecutables de realidad virtual.
Diseño de interacción gestual con red convolucional temporal (TCN)
El Diseño de Interacción con Gestos especifica cómo los usuarios interactúan con objetos virtuales en el sistema de diseño de hogares en realidad virtual utilizando gestos naturales con las manos. El diseño comienza desarrollando un léxico gestual: una asociación de gestos con las manos con funciones del sistema. Por ejemplo, un gesto de agarre podría controlar la colocación de objetos, un gesto de pellizcar podría controlar el escalado y un gesto de rotación podría girar objetos alrededor de un eje seleccionado.
En el sistema en cuestión, EgoGesture e IPN Hand sirven como conjuntos base de datos de gestos para entrenar la Red Convolucional Temporal (TCN), mientras que los Fluid Speech Commands complementan el diseño con capacidades de interacción habilitadas por voz. Combinados, proporcionan interacción multimodal en realidad virtual.
Representaciones gestuales del conjunto de datos
Una secuencia de gestos de EgoGesture o IPN Hand es una serie temporal multivariante:
(17)
(18)
Aquí, T es el número predeterminado de fotogramas (tras el remuestreo), y d es el número de dimensiones de las características esqueléticas (por ejemplo, ubicaciones de articulaciones 3D). El conjunto de datos tiene etiquetas y(i) ∈ y que indican una de las clases de gestos C.
Codificación convolucional temporal
Utilizamos una Red Convolucional Temporal (TCN) para clasificar gestos en tiempo real. TCN captura dependencias a corto y largo plazo en secuencias de gestos. Los TCN, a diferencia de los RNN, utilizan convoluciones causales dilatadas, que permiten un cálculo paralelo eficiente.
El TCN aplica estas secuencias mediante convoluciones causales dilatadas para aprender dependencias a corto y largo plazo:
(19)
donde dL es el factor de dilatación en la capa l, K es el tamaño del núcleo y σ es una activación no lineal (ReLU). El campo receptivo depende de:
(20)
requiriendo que el TCN abarque gestos de diferentes longitudes temporales.
Clasificación de los gestos
El último estado oculto pasa por un clasificador Softmax:
(21)
con objetivo de entrenamiento definido por entropía cruzada:
(22)
Integración con comandos de voz
Mientras que las operaciones espaciales (mover, rotar, escalar) se abordan mediante el reconocimiento de gestos de EgoGesture e IPN Hand, el conjunto de datos Fluent Speech Commands se aplica para comandos semánticos. Cada enunciado se traduce en una representación estructurada de ranura:
que aumenta la entrada del gesto ofreciendo parámetros (por ejemplo, "rotar la silla 15°").
Entonces ambas salidas se combinan:
(23)
Donde o(i) es la primitiva de control de la VR (colocación, escalado, rotación).
La Red Convolucional Temporal (TCN) es eficaz para manejar datos secuenciales empleando convoluciones 1D dilatadas en secuencias de entrada, como señales de gesto o de voz, como se muestra en la Figura 2. A diferencia de los modelos recurrentes, las NTC utilizan filtros convolucionales para aprender tanto relaciones temporales a corto como a largo plazo. Se emplean bloques residuales con conexiones de salto para proporcionar estabilidad durante el entrenamiento y evitar gradientes nulos, mientras que el uso de capas TCN apiladas permite a la red aprender patrones temporales a múltiples escalas. En última instancia, una capa de clasificación totalmente conectada proyecta las características temporales aprendidas en etiquetas de salida, como clases de gestos o intenciones habladas. Este diseño es especialmente adecuado para el reconocimiento continuo de gestos y la comprensión de comandos de voz, ya que combina eficiencia computacional con potentes capacidades de modelado temporal.
La Tabla 2 resume el diseño arquitectónico general y la configuración de entrenamiento de la Red Convolucional Temporal utilizada en el sistema propuesto para el reconocimiento de gestos. El modelo cuenta con cuatro bloques residuales de TCN, cada uno basado en convoluciones causales dilatadas, lo que permite a la red modelar dependencias temporales tanto a corto como a largo plazo. Estas dependencias son cruciales para distinguir entre gestos dinámicos, como agarrar, rotar y pellizcar. Con un tamaño de núcleo de 3 y factores de dilatación, los factores de dilatación de [1,2,4,8] expanden eficientemente el campo receptivo temporal sin aumentar el coste computacional. Para mejorar la generalización entre usuarios y condiciones de registro, se utilizó la normalización de capas y una tasa de corte de 0,25 dentro de cada bloque. Para el entrenamiento, se utiliza un optimizador Adam con una tasa de aprendizaje de 1 × 10-3, un tamaño de lote de 32 y una secuencia de 64 tramas, que equilibra óptimamente la precisión y la respuesta en tiempo real. Durante la inferencia, una estrategia de ventana deslizante hace posible predicir gestos cada 20-25 ms, manteniendo la latencia de extremo a extremo por debajo de 120 ms. Esta combinación de arquitectura e hiperparámetros proporciona una alta precisión en la clasificación de gestos (∼94% de precisión en la colocación) mientras preserva la interacción en tiempo real, permitiendo a TCN realizar tareas inmersivas de manipulación de realidad virtual.
Diseño de Interacción de Voz (ASR+NLU)
El componente de interacción de voz complementa el control espacial basado en gestos mediante comandos de voz semánticos y parametrizados para el sistema de diseño doméstico de realidad virtual. La entrada hablada a(i) se graba primero como audio en bruto y se convierte a un espectrograma log-Mel:
(24)
Donde F es el número de bins de frecuencia T que corresponde a la duración de los intervalos de tiempo. La representación preserva tanto los patrones espectrales como temporales del habla y se normaliza para ser invariante a la variabilidad del hablante y del entorno:
(25)
El espectrograma normalizado se introduce en un modelo de Reconocimiento Automático de Voz (ASR) como Whisper, que transforma las características acústicas en una secuencia de token:
(26)
donde cada uno es un token para una palabra o sub-palabra. Dicha transcripción se introduce en un modelo de Comprensión del Lenguaje Natural (NLU), que captura el significado estructurado. Más precisamente, NLU hace predicciones sobre categorías de intención y ranuras semánticas:
(27)
donde, por ejemplo, la afirmación "girar la silla quince grados" se corresponde a (acción = rotar, objeto = silla, ubicación/parámetro = 15°).
El marco de ranura de intención identificado se traduce entonces en un comando matemático que puede implementarse dentro del sistema VR:
(28)
Donde u(i) puede ser una transformación numérica (por ejemplo, rotación de 15°) o un cambio categórico (por ejemplo, intercambio de materiales).
La robustez se logra finalmente mediante un mecanismo de arbitraje basado en la confianza. Si la puntuación de confianza ASR p(z) o la puntuación de confianza de NLU p(s) es menor que un umbral τ, el sistema solicita aclaración o por defecto recurre al control basado en gestos. Esto garantiza que los comandos de voz sean precisos y claros, mejorando la usabilidad para tareas de diseño que requieren precisión.
Diseño de fusión multimodal
La ventaja de la fusión multimodal en el sistema de realidad virtual propuesto es que la comprensión de la voz y la detección de gestos se integran en un único proceso de toma de decisiones, en lugar de gestionarse por separado. El módulo de gestos proporciona una salida
de clasificación desde el TCN, mientras que el módulo de voz ofrece una representación s(i) con ranura de intención. Para fusionar estos sistemas, el sistema implementa fusión a nivel de decisión con arbitraje basado en la confianza.
Haz que el clasificador de gestos proporcione una distribución de probabilidad sobre clases de gestos:
(29)
y sea que el modelo NLU produzca probabilidades de ranura de intención:
(30)
Donde a, o y p se refieren a ranuras de acción, objeto y parámetros derivadas de la entrada de voz. El paso de fusión calcula una decisión conjunta combinando las dos modalidades según sus puntuaciones de confianza:
(31)
Donde α∈[0,1] se establece dinámicamente en función de la confianza del sistema (por ejemplo, más alta cuando los gestos son más seguros, menor cuando el habla es clara).
Algoritmo 1: Multimodal_Fusion (X, a):
Entrada:
X = secuencia de gestos preprocesados, a = comando de audio
Salida:
O = comando de acción VR
Paso 1: Reconocimiento de gestos
Paso 2: Comprensión de la voz
Paso 3: Decisión sobre fusión
De lo contrario:
Paso 4: Manejo de errores
):
Solicitar aclaración al usuario
De lo contrario:
Enviar O al sistema VR
volver O
Este Algoritmo 1 alterna entre la entrada de gestos y la entrada de voz para formular un comando potente para el diseño de VR. El módulo de gestos (TCN) interpreta primero movimientos de la mano como la rotación o la escalada y asigna una puntuación de confianza basada en la certeza del modelo. Paralelamente, el módulo de voz también realiza conversión de voz a texto con ASR (por ejemplo, Whisper) y aplica NLU para identificar la intención semántica, como "rotar la silla 15°". Ambos módulos devuelven sus predicciones junto con las puntuaciones de confianza. El paso de combinación equilibra entonces las dos salidas. Si ambas entradas son definidas, el sistema las combina proporcionalmente a sus niveles de confianza. Si una entrada es ambigua (por ejemplo, ruido en la voz o gesto incierto), el sistema prioriza más a la otra. Por último, si ninguna de las dos es definitiva, el sistema solicita aclaraciones para evitar errores. Esto hace que la fusión sea adaptativa (los pesos cambian según la calidad de entrada), robusta (que acomoda datos ruidosos o faltantes) y precisa (aprovechando las mejores fortalezas tanto del gesto como de la voz).
Participantes
Este estudio incluye a un grupo de voluntarios seleccionados tanto entre estudiantes universitarios como profesionales del diseño para recopilar opiniones diversas sobre la usabilidad de la VR. Las edades de los participantes iban desde la edad adulta temprana hasta la mediana edad, representando una mezcla de niveles previos de experiencia en realidad virtual, incluyendo principiantes, usuarios ocasionales y usuarios avanzados. Todos los participantes tenían visión normal o corregida y no se reportaron alteraciones motoras que pudieran interferir sustancialmente con la interacción basada en gestos. Las graves dificultades del habla, las limitaciones importantes de movilidad en el brazo o cualquier historial previo de mareo por movimiento inducido por la RV excluían a las personas por seguridad y consistencia en la participación. Todos los participantes proporcionaron su consentimiento informado, y los procedimientos para la evaluación fueron aprobados por el comité de revisión institucional. Esta subsección identifica claramente quién participó en la evaluación, permitiendo la reproducibilidad del estudio.
Montaje experimental
La configuración experimental propuesta incluye el sistema multimodal de realidad virtual desarrollado, que se despliega en un casco de realidad virtual de consumo equipado con capacidades integradas de seguimiento de manos y una cámara RGB para capturar gestos. Cuenta con un escritorio de alto rendimiento, que permite el procesamiento en tiempo real de técnicas de reconocimiento de gestos, ASR y fusión multimodal. El entorno de realidad virtual está construido en Unity 3D y contiene una sala de diseño del hogar que puede configurarse con muebles, materiales y elementos de iluminación. La configuración incluye ASR basado en Whisper para la transcripción de voz, y también incluye un módulo NLU basado en transformadores para detectar la intención. Esta descripción se ha trasladado desde la sección de Resultados para ofrecer una visión técnica adecuada del entorno antes de discutir los resultados.
Escenarios de pruebas subjetivas
Los participantes interactuaron con un entorno simulado de diseño de viviendas que consistía en un salón amueblado, un dormitorio y un pequeño espacio de trabajo. En cada escenario, se pidió a los usuarios que cambiaran objetos virtuales y variables ambientales en el entorno según circunstancias de diseño realistas. Por ejemplo, se pidió a los participantes que colocaran un sofá respecto a un punto de referencia, rotaran una silla en una dirección específica, redimensionaran una mesa a una dimensión objetivo o modificaran el material de la pared/perfil de luz. Estos escenarios se seleccionaron porque representan tareas típicas de diseño de interiores que desafían tanto el control basado en gestos (en términos de precisión espacial) como el control basado en voz (en términos de comandos semánticos). Esta subsección responde directamente a la pregunta del revisor sobre las condiciones subjetivas de prueba bajo las cuales los usuarios evaluaron el sistema.
Diseño de tareas
Los participantes realizaron un conjunto estructurado de ejercicios que abordaban diferentes áreas de manipulación de objetos e interacción con el diseño. Las tareas principales fueron las siguientes: 1) Colocación del mobiliario: Los participantes colocaron objetos en las coordenadas objetivo. 2) Tarea de rotación: En esta tarea, los usuarios debían cambiar la orientación para que coincidiera con un ángulo de referencia. 3) Tarea de escalado: Esto implicaba ajustar el tamaño del mobiliario a dimensiones preestablecidas. Además, 4) Edición de materiales/color: Los participantes empleaban comandos de voz para cambiar las texturas o modificar la iluminación. Se proporcionaron tareas opcionales de navegación para capturar la capacidad de conciencia espacial dentro de la sala virtual. Cada trabajo se estableció con objetivos claros, resultados cuantificables y un límite de tiempo definido, asegurando que tanto la precisión como la eficiencia pudieran evaluarse adecuadamente.
Procedimiento
Para garantizar la uniformidad entre los participantes, la evaluación se realizó en una secuencia planificada. Primero se les explicó el sistema a los usuarios y se les dio una breve demostración de las modalidades de interacción entre gestos y habla. Una fase inicial de calibración permitió adaptarse a las posturas individuales de las manos y a las características del habla. Los usuarios realizaron entonces una breve sesión de práctica para acostumbrarse a ambas modalidades. La evaluación real requería realizar todas las tareas en tres condiciones de interacción: usar solo un controlador, usar solo gestos y usar gestos más voz como entrada multimodal. El orden de condición se contrarrestó para reducir los efectos del aprendizaje. Al final, los sujetos completaron instrumentos de evaluación estandarizados, como el SUS, NASA-TLX e IPQ, y participaron en una breve entrevista de retroalimentación cualitativa.
Métricas de evaluación
Este procedimiento estructurado establece transparencia metodológica, permitiendo estudios de replicación. Se combinaron métricas objetivas y subjetivas para evaluar de forma exhaustiva el rendimiento del sistema. Las métricas objetivo incluían el tiempo de finalización de la tarea, una medida de eficiencia; precisión en la colocación, cuantificada como la desviación respecto a la posición o rotación del objetivo; y tasa de error, definida como el número de malas clasificaciones de entrada o acciones no intencionadas realizadas por el sistema. Se capturaron métricas subjetivas mediante cuestionarios validados: la Escala de Usabilidad del Sistema para medir la usabilidad percibida, la escala NASA-TLX para evaluar la carga mental y física, y el Cuestionario de Presencia del grupo I para medir la inmersión y la presencia en la VR. Estos se han trasladado adecuadamente desde la sección de Resultados para describir cómo se midió el rendimiento antes de presentar cualquier resultado.
Entorno VR, integración de sistemas y evaluación
La plataforma principal para comandos de voz y gestos es un entorno interactivo de realidad virtual donde se despliega el sistema. Se utilizan bibliotecas integradas de muebles, texturas y elementos de iluminación para crear salas virtuales en Unity 3D. Permite a los usuarios organizar, personalizar y editar elementos en tiempo real. La precisión se mejora mediante capacidades de chasque, detección de colisiones y superposiciones de medición, permitiendo que los objetos se alineen de forma natural. El renderizado en tiempo real de la iluminación y los materiales mejora la experiencia de diseño al proporcionar retroalimentación instantánea en cada interacción.
Tras validar los módulos individuales para reconocimiento de gestos, comprensión de voces y fusión multimodal, se combinan en una cadena unificada. El sistema está diseñado para tener baja latencia, por lo que los comandos del usuario aparecen casi inmediatamente en el entorno VR. Las pruebas piloto se realizan con un número reducido de miembros para perfeccionar el flujo de interacción. La iteración incluye vocabularios de gestos, validación de la gramática de comandos de voz y asegurar que el sistema se sienta natural y fiable durante un uso continuo.
Se utilizará un estudio exhaustivo que compare tres modalidades de interacción, como la fusión multimodal gesto-voz, la entrada solo con controlador y el modo híbrido, para evaluar la experiencia del usuario. Se requieren tareas, incluyendo cambio de materiales, rotación y colocación de objetos, a los participantes. Para evaluar el desempeño, se recopilan métricas objetivas, como el tiempo de logro laboral, la corrección de la colocación y los cargos de error. Las valoraciones subjetivas se obtienen de los participantes mediante cuestionarios estandarizados, como la Escala de Usabilidad del Sistema (SUS), la carga de trabajo cognitiva de la NASA-TLX y el cuestionario IPQ para inmersión, con entrevistas a los participantes que proporcionan apoyo adicional. Esta evaluación dual codifica tanto medidas de rendimiento cuantificables como experiencia subjetiva del usuario.
El avance de este sistema es aplicar la fusión multimodal a tareas de diseño de precisión más allá de la navegación o interacción básica. La técnica ofrece una forma más orgánica, precisa y accesible de interactuar al combinar el valor semántico de las instrucciones de voz con las ventajas espaciales de los gestos. Al ofrecer funciones de accesibilidad adaptables, como el respaldo solo por voz y el reconocimiento de gestos con una sola mano, el sistema también mejora la inclusión. Finalmente, el estudio ofrece un conjunto de datos multimodal metódico y anotado de interacciones voz-gesto, promoviendo futuros estudios en diseño inmersivo de interfaces y reforzando la reproducibilidad.
La Figura 3 muestra capturas de pantalla típicas del programa implementado, proporcionando una representación más vívida del sistema de diseño interior VR construido. El entorno de realidad virtual inmersiva, donde los usuarios pueden explorar y visualizar la distribución de la sala, se representa en la Figura 3A. La Figura 3B muestra cómo las interacciones naturales de las manos pueden utilizarse para seleccionar, mover y rotar muebles virtuales en un proceso de manipulación de objetos basado en gestos. La Figura 3C ilustra la interfaz de voz integrada, donde el micrófono y los símbolos de retroalimentación de voz validan los comandos de voz emitidos por el usuario para modificaciones espaciales o colocación de objetos. En conjunto, estas capturas de pantalla del sistema multimodal de realidad virtual propuesto demuestran que ha sido completamente implementado, permitiendo la interacción en tiempo real con gestos y voces.