Artículo de investigación

Diseño de marcos de interacción multimodal adaptativa para mejorar la colaboración humano-IA

DOI:

10.3791/69830

24 de febrero de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo propone un mecanismo de alineación jerárquica basado en Dynamic Time Warping (DTW) con adaptación en línea y fusión multimodal orientada a la atención, permitiendo una predicción fiable de la intención a largo plazo y seguimiento de tareas. Un módulo de explicabilidad ligero mejora la interpretabilidad, fomentando la confianza en la colaboración entre humanos e IA. El enfoque se generaliza tanto a sistemas robóticos como virtuales interactivos.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Lograr una colaboración eficaz y natural entre humanos e IA sigue siendo un gran desafío, especialmente en entornos dinámicos y reales. Los marcos existentes suelen estar limitados por las rígidas entradas monomodales o la fusión multimodal basada en reglas, lo que limita su robustez, personalización y adaptabilidad. Este estudio introduce un marco de interacción multimodal adaptativo que integra la estimación de postura basada en la visión y la comprensión de comandos basada en el habla dentro de un modelo jerárquico de previsión de intenciones humanas. El marco emplea modelos de secuencias basados en Transformers para la predicción de acciones y la Deformación Dinámica del Tiempo para alinear el comportamiento humano con los grafos estructurados de tareas para la planificación a largo plazo. A diferencia de enfoques anteriores que se basan en el cambio de modalidad estática, nuestra arquitectura aplica un mecanismo de fusión basado en la atención para ponderar dinámicamente las entradas más informativas. Además, un módulo de adaptación en línea permite un ajuste en tiempo real al comportamiento del usuario, complementado por una capa ligera de explicabilidad para fomentar la confianza del usuario. La evaluación experimental en una tarea de ensamblaje colaborativo demuestra mejoras significativas en el rendimiento de la tarea (hasta un 24%), precisión en la predicción de intenciones (hasta un 18%) y satisfacción del usuario. Estos resultados ponen de manifiesto la eficacia y versatilidad de los marcos de interacción multimodal adaptativa, apoyando su potencial para avanzar en la inteligencia colaborativa hacia sistemas de IA más fiables, transparentes y orientados al ser humano.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La colaboración humano-robot (HRC) ha sido una de las áreas importantes de investigación, especialmente porque cada vez más robots se despliegan en entornos centrados en el ser humano. Mientras que los marcos y tecnologías para la HRC a corto plazo han mejoradosignificativamente 1,2, la HRC a largo plazo aún no está tan madura3. En aplicaciones industriales, la explotación de la HRC a largo plazo puede conducir a un aumento destacado de la productividad y adaptabilidad en procesos de fabricacióncomplejos 4. Los entornos domésticos, los robots como compañeros o los agentes de cuidado de ancianos tienen el potencial de mejorar la calidad de vida a través de laHRC 5 a largo plazo. El sector médico posiciona las máquinas comunitarias como sustituto del hogar y cuidadores, cubriendo la atención hasta el rol afectado con demencia, autismo y otras enfermedades físicas omentales 6. Al mismo tiempo, los ámbitos de viajes y amabilidad utilizan robots industriales para avanzar en el conocimientodel usuario 7. En ingeniería inteligente, el objetivo es participar en la IA de forma centrada en el ser humano para recuperar competencias y crear cultivos personalizados, una etapa conocida como Industria 5.0. Los sistemas de colaboración humano-IA y humano-robot han sido explorados en diversos dominios de aplicación8, 9 y 10; Sin embargo, investigaciones recientes se han centrado cada vez más en entornos robóticos colaborativos que requieren una predicción fiable de intenciones y comprensión de tareas a largo plazo.

La IA ya está profundamente arraigada en la vida cotidiana, y sus aplicaciones autónomas o semiautónomas se manifiestan cada vez más en muchos ámbitos empresariales. Esto simplemente afirma que las funciones empresariales que funcionan bien actualmente requieren sistemas capaces de adaptarse a los cambios tecnológicos y de capacidad de respuesta a los retosorganizativos 11. Por tanto, la necesidad de mejorar la acción humana mediante la hibridación, en el proceso de adopción e implementación de la IA, facilita la superación de algunas barreras. En consecuencia, los sistemas híbridos combinan inteligencia artificial y humana para realizar tareas complejas juntos, ofrecer mejores resultados y mejorar sus habilidades aprendiendo de sus compañeros. Por ello, conceptos ampliados que incluyen sistemas inteligenteshíbridos 12, colaboración e inteligencia amplificada están moldeando informalmente la investigación y la comprensión para potenciar la colaboración mediante la integración de diversas modalidades de IA.

El término "Confianza" se derivó de estudios de relaciones interpersonales, definiendo un vínculo emocional en las relaciones humanas. Por ejemplo, el autor13 identificó que el nivel de confianza determina técnicamente aspectos de los sentimientos, el supuesto atractivo y la ética de las partes colaboradoras. Sociológicamente, las variaciones en la confianza interpersonal tienen un impacto profundo en el bienestar de los separados, la interacción comunitaria, el crecimiento socioeconómico y el comportamientopráctico 14,15,16. La HRI, en esencia, es un intento de tender puentes entre conversaciones procedimentales entre trabajadores sociales y autómatas inteligentes más allá de los obstáculos lingüísticos convencionalesde autómatas 17. Esta interacción combina las fortalezas computacionales de los sistemas autónomos con la intuición humana, permitiendo una colaboración efectiva entre diversos entornos de aplicaciones. El uso de autómatas aporta ventajas reales: disminuciones significativas en los gastos financieros, menor huella ecológica y considerablemente menor riesgohumano 10. Pero en medio de los logros, la confianza humana en los robots es un pilar, especialmente al evaluar la calidad general de lainteracción 18,19.

El nivel de confianza humana que se otorga a los robots refleja su importancia y papel central en muchas áreas. En salud, la confianza en robots influye en la distribución de recursos médicos según HRI, así como en la eficacia de la supresión de enfermedadestransmisibles 20,21,22. En aplicaciones militares, el nivel de creencia social en los autómatas controla el nivel de competencia operativa de las estrategias de dispositivos de investigación militar y el nivel de precisión de los transportes decombate 23,24. Además, la creencia en las máquinas afecta la sumisión y el uso de mecanismos de estandarización activa de creencias con IA en la formulación de políticas militaresespeculativas 25. Incluso dentro de la investigación ambiental, por ejemplo, la investigación de alto nivel sobre movimientos corporales, la racionalidad de los resultados depende del grado de creencia en elHRI 26. Sin embargo, una advertencia importante es que las crecientes dificultades de decisión pueden degradar esta confianza, poniendo en peligro la interacción. La Tabla 1 describe la visión general comparativa de varios estudios.

Papel (Año, Fuente)Objetivos principalesMétodos y modalidades clavePerspectivas
Xie & Park (2021, arXiv) [28]Personaliza las interacciones de robots con robots sociales emotivosPolítica para el aprendizaje por refuerzo basada tanto en pistas verbales como no verbales (posición corporal, habla y expresiones faciales)El comportamiento de un robot entrenado en la vida real cambia en respuesta a las emociones humanas, aumentando la simplicidad y el compromiso.
Li et al. (2022, IEEE T-IE) [29]Facilitar el apoyo proactivo para el ensamblaje de fabricaciónPredicción de intenciones, aprendizaje por transferencia y aprendizaje multimodal (visual + esquelético)Mejora de la proactividad robótica en comparación con las líneas base; Predicción de acciones más rápida y precisa durante el ensamblaje
Abdelrahman et al. (2022, IEEE Access) [30]Estimación de la implicación en tiempo real en la IRH grupalClasificación basada en reglas combinada con aprendizaje profundo y postura de mirada/cabeza basada en la visión≥90% puntuación F; gestiona varios usuarios a la vez en configuraciones físicas
Chiossi et al. (2025, arXiv) [31]Estructura para la transmisión de intención multimodal y dinámica en entornos de fabricaciónDiseño teórico multifacético: capas de transparencia SAT; Modos hápticos, auditivos y visualesEstablece el marco conceptual y explica el medio, la planificación y la intención del entorno de diseño.
McGrath et al. (2024, arXiv) [32]Modela el desarrollo de la confianza en relaciones humano-IA que sean flexibles.Fases del equipo más antecedentes de fideicomiso; Un modelo dinámico de confianza que no depende de modalidades particularesProporciona principios de diseño conscientes de la confianza para todas las etapas de la interacción y el tiempo.
Fragiadakis et al. (2024, arXiv) [33]Estandarizar la evaluación de la cooperación entre humanos e IA.Métricas seleccionadas por un árbol de decisión según el modo HAIC; Métricas de métodos mixtosEl marco ayuda a seleccionar métricas pertinentes para modalidades de interacción simbiótica centradas en IA/humanos.
Younis et al. (2023, MDPI) [34]HRI que se adapta al contexto mediante inferencia demográficaLa edad y el género se estiman mediante modelos de visión y audio, y el comportamiento de los robots se ajusta adecuadamente.La encuesta resume los enfoques y enfatiza la importancia de la adaptación personalizada en HRI.

Tabla 1: Una visión comparativa de investigaciones recientes en Colaboración Humano-IA que enfatiza los objetivos, metodologías y hallazgos clave de cada estudio. Conjuntos de datos utilizados en el estudio, sus especificaciones, tamaño, modalidades y distribución de participantes.

Aunque el actual marco jerárquico y multimodal de colaboración humano-robot (HRC) muestra un progreso impresionante en el uso de modalidades visuales y auditivas para la colaboración a largo plazo, aún existen varias lagunas en la investigación, lo que dificulta su aplicabilidad a entornos más generales de colaboración humano-IA. Por un lado, el marco actual es principalmente aplicable a la robótica física (por ejemplo, brazo KINOVA GEN3) y no transferible a agentes de IA no incorporados o virtuales que existen en entornos digitalesvariados 28. En segundo lugar, mientras que la multimodalidad se aborda mediante visión y voz, el sistema implementa una estrategia predefinida de cambio de modalidad en lugar de una fusión dinámica dependiente del contexto según el estado del usuario o la dificultadde la tarea 29. En tercer lugar, el enfoque enfatiza la eficiencia y la resiliencia de las tareas, pero no modela específicamente la confianza del usuario, la carga cognitiva o el estado afectivo, que son esenciales para la colaboración a largo plazo y la explicabilidad del sistema. Además, la interpretabilidad humana y la confianza en el comportamiento adaptativo del sistema se ven limitadas cuando los procesos de explicabilidad están ausentes en la toma de decisiones. Por último, pero no menos importante, la evaluación se restringe a un solo dominio (ensamblaje de coche de juguete) sin validación multidominio, lo que representa la variabilidad en el mundoreal 30. Estas lagunas requieren el desarrollo de un marco de interacción multimodal generalizado, adaptativo y centrado en el ser humano que combine dinámicamente canales de entrada heterogéneos y modele la intención, confianza y contexto humanos en tiempo real para potenciar la colaboración humano-IA.

El objetivo principal de este estudio es maximizar la colaboración entre humanos e IA mediante el diseño de un sistema de interacción multimodal adaptativo que unifique las modalidades de visión y habla con modelado de usuarios en tiempo real. Basándose en la sólida base de una colaboración robusta y duradera entre humanos y robots, este trabajo generalizará la arquitectura multimodal a sistemas generales de IA fuera de la robótica, como agentes virtuales e interfaces inteligentes. El énfasis principal está en la predicción dinámica de intenciones mediante mecanismos jerárquicos de planificación, que integran la comprensión de acciones a bajo nivel y el seguimiento del progreso de tareas a alto nivel. A diferencia de los sistemas basados en reglas, el marco presentado aquí utilizará métodos de aprendizaje adaptativo, incluyendo actualizaciones específicas de modelos para el usuario y fusión de modalidades conscientes del contexto, para adaptar dinámicamente el comportamiento de interacción según las preferencias del usuario, el estado cognitivo y la dinámica ambiental. Además, el marco también busca mejorar la transparencia y la confianza con razonamiento de interacción explicable, que permite a los usuarios comprender las decisiones de la IA y dar retroalimentación. Finalmente, esta investigación busca mejorar la fluidez en la interacción, la efectividad de las tareas y la satisfacción a largo plazo del usuario en diferentes contextos colaborativos.

Este artículo presenta un nuevo Marco de Interacción Multimodal Adaptativa destinado a promover la colaboración humano-IA mediante la fusión dinámica de modalidades visuales y auditivas. El sistema 'unimodal' se refiere a un modelo que utiliza únicamente una modalidad de entrada (por ejemplo, visual o de voz) para la ejecución de tareas y la predicción de intenciones, sin integrar información a través de múltiples canales. El sistema 'no adaptativo' se refiere a un sistema basado en reglas o de estrategia fija que no ajusta su comportamiento en función de las acciones o el contexto del usuario, como la línea base de Conmutación Basada en Reglas. Estas líneas de base proporcionan puntos de referencia para evaluar las ventajas de la percepción multimodal y las estrategias de interacción adaptativa implementadas en nuestro modelo propuesto de Transformer con fusión guiada por atención. Basándose en paradigmas jerárquicos deHRC 31 anteriores, nuestro método aporta varias innovaciones importantes:

Este trabajo presenta un mecanismo de alineación basado en Deformación Dinámica del Tiempo (DTW) que mapea acciones humanas de bajo nivel esperadas a nodos en un grafo jerárquico de tareas, en contraste con sistemas de interacción multimodales anteriores que se concentran principalmente en el reconocimiento de acciones a cortoplazo 32. Frente a la imprevisibilidad temporal y las entradas multimodales ruidosas, esto permite una predicción fiable de la intención a largo plazo y un seguimiento del progreso de la tarea.

Un módulo de adaptación en línea que actualiza continuamente los modelos de inferencia de intención y predicción de acciones durante la interacción está incorporado al sistema sugerido. Esto supera las desventajas de los modelos multimodales estáticos o entrenados fuera de línea al permitir que el sistema se adapte dinámicamente a comportamientos únicos, preferencias y cambios contextuales de los usuarios.

Las modalidades visuales y auditivas se ponderan dinámicamente en función de su importancia contextual en cada paso temporal, utilizando una técnica única de fusión basada en la atención. Este enfoque de fusión basado en datos mejora la robustez en diversos entornos de interacción y sustituye el cambio de modalidad basado en reglas.

Este estudio incorpora un módulo ligero de explicabilidad que convierte las decisiones de planificación jerárquica y fusión en justificaciones comprensibles para cerrar la brecha de interpretabilidad en los sistemas adaptativos humano-IA. Esto mejora la calidad de la colaboración a largo plazo y fomenta una calibración adecuada de la confianza.

El enfoque sugerido pretende generalizar más allá de los robots incorporados a agentes virtuales e interfaces inteligentes, ampliando su utilidad a muchos ámbitos de cooperación humano-IA, aunque se demostró en una actividad real de ensamblaje colaborativo utilizando una plataforma robótica.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La arquitectura propuesta para aumentar la cooperación humano-IA utiliza una cadena de interacción multimodal adaptativa que combina las modalidades de visión y habla en un marco de razonamiento dinámico y jerárquico. Este estudio utilizó datos públicos de experimentos previamente publicados. No hubo nuevos sujetos humanos involucrados y no se requirió aprobación ética adicional.

Arquitectura propuesta de interacción multimodal adaptativa

Fundamentalmente, el sistema comienza con módulos de percepción, como el flujo visual que captura la postura y el movimiento del usuario usando sensores RGB-D, y un flujo de audio analiza las entradas de voz usando un motor ASR (Reconocimiento Automático de Voz) ligero. Estas entradas en bruto se introducen en el módulo de predicción de acciones basado en Transformer, que codifica dependencias temporales en secuencias de pose y comandos para razonar sobre acciones humanas de bajo nivel. Posteriormente, para permitir una planificación colaborativa a alto nivel, un mecanismo de Distorsión Dinámica del Tiempo (DTW) alinea las acciones detectadas con nodos de un grafo de tarea predefinido para predecir los objetivos y las siguientes acciones del usuario. Un nuevo módulo de fusión basado en la atención decide, en cada paso temporal, qué modalidad (audio o imagen) proporciona la información más importante contextualmente y ajusta dinámicamente los pesos de entrada. Para individualizar la interacción, el sistema incluye adaptación de modelos en línea, adaptando predictores de acción en tiempo real al comportamiento cambiante del usuario. Un módulo de explicabilidad ligero también crea resúmenes fáciles de usar de intenciones previstas y decisiones de IA para mejorar la transparencia y la confianza. Todo el sistema se prueba en un entorno de ensamblaje cooperativo simulado pero real, permitiendo la comparación entre entornos unimodales y adaptativo-multimodales. Este enfoque facilita una colaboración más adaptable, intuitiva y fiable con agentes de IA en todas las áreas.

La Figura 1 muestra la arquitectura del Marco de Interacción Multimodal Adaptativa descrito, destinado a mejorar la colaboración humano-IA. Comienza con la fase de Adquisición de Entrada, que se basa en dos dispositivos principales de detección: una cámara RGB-D para observar información visual con mayor profundidad (por ejemplo, postura y movimiento humano) y un micrófono direccional para recoger comandos de voz. Las señales en bruto se pasan posteriormente por el módulo de Preprocesamiento, que procesa los datos audiovisuales para su análisis posterior limpiando, normalizando y formateando los flujos de entrada. Luego, la cadena avanza a la fase de Extracción de Características, donde los datos se dividen en dos flujos: el Flujo Visual, que aísla las características de pose y movimiento mediante algoritmos de estimación de pose, y el Flujo de Audio, que transcribe el habla en incrustaciones de comandos interpretables. Un codificador Transformer multimodal, que utiliza autoatención multi-cabeza y codificación posicional temporal para expresar la interdependencia a largo alcance entre secuencias de interacción, procesa la representación fusionada. El estado actual del objetivo del usuario se estima mediante un predictor de intención y progreso de tareas a largo plazo, y las acciones de bajo nivel se asignan a nodos en un grafo jerárquico de tareas para un seguimiento fiable de tareas mediante un módulo de alineación basado en DTW. Los pesos de fusión y los parámetros de predicción se actualizan continuamente mediante un bucle de adaptación de modelos en línea en respuesta a la retroalimentación de interacción, y un módulo de explicabilidad proporciona explicaciones claras para promover la apertura y la confianza. Toda la cadena permite que el sistema trabaje de forma adaptativa y eficiente junto con los usuarios en tareas y entornos dinámicos.

figure-protocol-1
Figura 1: Visión general del marco de interacción multimodal sugerido basado en transformadores. Se emplea una técnica guiada por la atención para codificar e integrar dinámicamente datos visuales y auditivos. Un módulo Transformer, que integra modelado jerárquico de tareas y adaptación en línea, procesa la representación fusionada para la predicción de intenciones a largo plazo y la estimación del progreso de la tarea. . Por favor, haz clic aquí para ver una versión ampliada de esta figura.

El sistema sugerido incorpora un módulo ligero de explicabilidad que funciona en conjunto con los componentes de fusión multimodal y planificación jerárquica para mejorar la transparencia y la confianza del usuario. El módulo obtiene pistas interpretables a partir de la alineación del grafo de tareas basada en DTW (por ejemplo, el progreso actual de la tarea y la siguiente acción anticipada) y la capa de fusión basada en la atención (por ejemplo, pesos de importancia de modalidad). Estas señales se convierten en explicaciones comprensibles para los humanos, como si las órdenes habladas o los gestos visuales afectaron principalmente a una elección del sistema y cómo encaja la acción anticipada en el plan de trabajo más amplio. Los usuarios reciben explicaciones en forma de comentarios escritos o visuales concisos, que les ayudan a comprender, predecir y, si es necesario, rectificar el comportamiento del sistema. La mejora de la satisfacción del usuario, la fluidez de la interacción y las métricas relacionadas con la confianza indicadas en la evaluación son indicadores indirectos de la percepción del usuario sobre la explicabilidad. Los hallazgos implican que, en la interacción a largo plazo entre humanos e IA, el razonamiento transparente para las decisiones de IA mejora la confianza del usuario, facilita la colaboración y aumenta la aceptación del comportamiento adaptativo del sistema.

Datos de entrada

La adquisición de entradas en el marco previsto para la colaboración humano-IA se lleva a cabo mediante un mecanismo estructurado de detección multimodal que combina las modalidades de visión y audición para realizar eficazmente las acciones e intenciones humanas. La entrada visual se adquiere con una cámara RGB-D, que captura información en tiempo real sobre la pose humana, la ubicación espacial y el contexto del entorno. Los datos visuales se procesan mediante modelos preentrenados como BlazePose para obtener puntos clave de interés en la parte superior del cuerpo para tareas de interacción. Al mismo tiempo, la información auditiva se obtiene a través de un micrófono direccional e interpretada mediante un modelo DeepSpeech preentrenado para identificar comandos de voz que desambiguan o proporcionan señales visuales inciertas suplementarias. En entornos cooperativos, el sistema de doble entrada ofrece adaptación dinámica y percepción consciente del contexto. El conjunto de datos de entrenamiento y evaluación comprende más de 5.000 trayectorias multimodales de movimiento humanopara una variedad de actividades de interacción, como comportamientos de ensamblaje y traspaso, recopiladas de cuatro usuarios en entornos controlados y semiestructurados. Para mejorar la generalización, el sistema permite la adaptación de modelos en línea en el despliegue, lo que permite actualizar sus predicciones en tiempo real como función del cambio en el comportamiento del usuario y la dinámica ambiental.

Descripción del conjunto de datos

El conjunto de datos de entrenamiento y evaluación para el marco sugerido se obtuvo a partir de experimentos reales de colaboración humano-robot bajo una tarea de ensamblaje de coches de juguete utilizando el robotKINOVA GEN3 1. El entorno experimental pretendía imitar actividades colaborativas a largo plazo que abarcan interacción multimodal, que incluía modalidades tanto visuales como auditivas. En particular, el conjunto de datos de entrenamiento está compuesto por 3.003 secuencias de trayectorias de dos usuarios, y el conjunto de datos de prueba contiene 2.088 secuencias, incluyendo datos de dos nuevos usuarios para evaluar la generalización del modelo. Cada trayectoria registra una secuencia de 5 pasos de puntos clave de postura de la parte superior del cuerpo recuperados con BlazePose, junto con los comandos de voz correspondientes transcritos porDeepSpeech 33. Los datos recopilados muestran la variación humana natural en la expresión de gestos y comandos en actividades como la entrega de objetos, el uso de herramientas y las acciones cooperativas. El conjunto de datos multimodal es la base para el aprendizaje supervisado de los modelos DLinear de acción y previsión de trayectorias, y es el punto de referencia central en los estudios de usuarios realizados bajo condiciones solo visuales, solo de audio y multimodales. Incorporar diferentes tipos de usuarios y condiciones de ruido realistas garantiza pruebas de robustez y adaptabilidad para sistemas HRC permanentes. La Tabla 2 muestra la descripción detallada del conjunto de datos.

AtributosDetalles
Nombre del conjunto de datosConjunto de datos de montaje de coches de juguete (recopilado internamente)
Entorno de la colecciónExperimento real de HRC con brazo KINOVA GEN3
Número de usuarios (formación)2 usuarios
Número de usuarios (Pruebas)4 usuarios (2 del set de entrenamiento, 2 invisibles)
Trayectorias totales (Entrenamiento)3.003 trayectorias
Trayectorias totales (pruebas)2.088 trayectorias
Modalidades capturadasVisual (RGB-D para pose), Audio (comandos de voz)
Formato de datosPuntos clave de pose (de BlazePose), comandos de conversión de voz a texto
Resolución temporalCada trayectoria incluye pasos de 5 tiempos
Tareas cubiertas3 tareas principales: Seleccionar y colocar, rotación de objetos, ensamblaje colaborativo
UsoEntrenamiento supervisado de modelos de predicción de acción/trayectoria; Estudio de usuario

Tabla 2: Descripción del conjunto de datos. Información sobre el entorno de simulación, incluyendo el marco de programación, la configuración de hardware y el entorno de evaluación.

Preprocesamiento de conjuntos de datos

Para permitir la interacción multimodal adaptativa en la colaboración humano-IA, el conjunto de datos en bruto, como los datos visuales (RGB y de profundidad), auditivos (comandos de voz) y temporales de comportamiento (puntos clave de pose), se somete a un preprocesamiento estructurado. Los datos visuales se extraen primero mediante unmodelo de estimación de pose f pose, comúnmente derivado de BlazePose u OpenPose. Para el fotograma t, el vector de pose humana se define como:

figure-protocol-2(1)

Donde k es el número de puntos clave y cada punto clave contiene coordenadas 2D. Las secuencias se normalizan por la longitud del torso y se suavizan con el tiempo con un filtro Savitzky-Golay:

figure-protocol-3(2)

donde w es el tamaño de la ventana de filtrado. En segundo lugar, los flujos de audio en bruto At se dividen en segmentos mediante un Detector de Actividad de Voz (VAD). Los segmentos creíbles se introducen en un modelo de reconocimiento devoz (por ejemplo, DeepSpeech) para extraer tokens de comando:

figure-protocol-4(3)

donde V es el vocabulario de los comandos reconocidos. Para integración, los tokens de comandos de todos se alinean en el tiempo a las marcas de tiempo de pose visual usando una función de alineamiento basada en interpolación τ:

figure-protocol-5(4)

En tercer lugar, para formar las secuencias figure-protocol-6de entrenamiento de intención temporal , definimos secuencias de trayectoria , junto con los comandos figure-protocol-7de voz asociados . Estas se organizan en ventanas en segmentos de longitud fija utilizando ventanas deslizantes de tamaño l:

figure-protocol-8(5)

figure-protocol-9(6)

Por último, las entradas se normalizan a media cero y varianza unitaria por dimensión clave para la convergencia en modelos de predicción basados en trayectorias:

figure-protocol-10(7)

donde μj, σj son la media y la desviación estándar del punto clave j completaron el conjunto de entrenamiento.

Extracción de características

En el paradigma de interacción multimodal adaptativa descrito, se habilita una cooperación fuerte y en tiempo real combinando características visuales, auditivas y contextuales de la tarea. La cadena de extracción de características comienza con la adquisición concurrente de datos de dos modalidades principales: señales figure-protocol-11 visuales y señales figure-protocol-12de audio, indexadas en el paso de tiempo t. Estas observaciones se transmiten a través de los módulos de percepción correspondientes para obtener características semánticas de alto nivel relacionadas con el comportamiento humano, la intención y el comando del habla.

Extracción de características visuales

Los datos figure-protocol-13 visuales en bruto de las cámaras RGB-D se alimentan a través de un estimador de pose humana (por ejemplo, BlazePose), proporcionando un vector figure-protocol-14de puntos clave espaciales , donde k representa el número detectado de puntos clave y cada uno contiene coordenadas 3D:

figure-protocol-15(8)

Estos puntos clave se incrustan en el tiempo en una trayectoria figure-protocol-16de pose, de la cual se extrae la dinámica del movimiento mediante descomposición tendencia-estacional:

figure-protocol-17(9)

donde ∈_t representa el ruido residual.

Extracción de características de audio

La entrada figure-protocol-18 de audio se procesa mediante un modelo de reconocimiento de voz preentrenado (por ejemplo, DeepSpeech) y produce una representación figure-protocol-19de comandos tokenizada , donde n es la longitud del token:

figure-protocol-20(10)

Fusión multimodal

Para construir un contexto de interacción unificado, combinamos las características mediante una atención ponderada por la confianza basada en la confianza y la información mutua:

figure-protocol-21(11)

donde φV y φA son las funciones de proyección de características visuales y auditivas en un espacio latente compartido, y αt∈[0,1] es un término dinámico de ponderación modal calculado en función de la entropía:

figure-protocol-22(12)

Aquí, figure-protocol-23 y figure-protocol-24 son información mutua entre el estado objetivo g y las modalidades observadas.

Planificación mediante incrustación contextual

El último vector de características multimodal Ft se enriquece con contexto de tarea y progreso Pt y se convierte en la entrada de estado del módulo de planificación adaptativa:

figure-protocol-25(13)

Esta característica extraída xt se utiliza como entrada a los modelos posteriores de predicción de intenciones y planificación de movimiento, apoyando una colaboración adaptativa y robusta entre humanos e IA en entornos dinámicos e inciertos.

Predicción de acciones y planes mediante alineación de grafos de tareas

Siguiendo el proceso de extracción de características multimodal, donde la intención del habla (audio), la trayectoria de la pose (visual) y los datos contextuales (por ejemplo, registros de tareas o emociones) se integran en el procesamiento posterior, incluye la predicción adaptativa de acciones humanas e inferencia de planes utilizando alineamiento jerárquico de grafos de tareas.

Sea el vector de características multimodal integrado en el paso de tiempo t representado como:

figure-protocol-26(14)

El sistema predice inicialmente la acción humana de bajo nivel mediante unafunción f, que a menudo se representa como un codificador-decodificador o transformador recurrente:

figure-protocol-27(15)

donde F(t-k:t) denota la secuencia de fusión de características en los últimos k pasos de tiempo, y figure-protocol-28 es la acción prevista del conjunto de acciones A. El módulo está en línea ajustado con precisión por pérdida adaptativa:

figure-protocol-29(16)

Aquí, CE es la clasificación de acción de pérdida cruzada de entropía, luego el segundo término empuja una buena predicción de trayectoria futura.

Para la predicción de planes a alto nivel, enmarcamos la tarea como una progresión a lo largo de un Grafo Jerárquico de Tarea G = (N, E), en el que cada nodo ni ∈N significa una subtarea o objetivo intermedio. El objetivo es comparar la secuencia de acciones observada con una ruta de tarea de referencia R*∈G reduciendo la distancia:

figure-protocol-30(17)

Donde Pt denota la traza de progreso actual y d(⋅) denota la distancia o métrica de alineación suave de Dynamic Time Warping (DTW).

La intención figure-protocol-31 última a nivel de plan se deriva proyectando la acción predicha a ̂_t sobre el siguiente paso más probable en la trayectoria figure-protocol-32alineada:

figure-protocol-33(18)

Esta decodificación jerárquica garantiza que, incluso con entradas sensoriales poco claras o ruidosas, el sistema elija la intención de alto nivel más relevante contextualmente y consistente con la secuencia de tareas actual. Esta planificación predictiva no solo mejora la eficiencia de la colaboración, sino que también incrementa la anticipación y la adaptabilidad dentro de la interacción humano-IA en varios turnos.

Mecanismo de fusión multimodal (basado en la atención)

En la colaboración adaptativa humano-IA, la integración multimodal de varias modalidades sensoriales (por ejemplo, visual: postura humana, trayectoria; auditiva: comandos de voz) es necesaria para una correcta interpretación de la intención del usuario. Un enfoque basado en reglas o fusión estática no puede hacer frente a interacciones humanas dinámicas en el mundo real. Para ello, aquí se presenta un mecanismo de fusión basado en la atención para ponderar dinámicamente cada modalidad según su importancia contextual en cada paso temporal.

Denotemos los vectores de características extraídos de las modalidades visual y auditiva como figure-protocol-34 y figure-protocol-35, respectivamente. Estos vectores codifican información semántica obtenida a través de procesos anteriores, por ejemplo, las características visuales pueden resultar de la estimación de la pose y la predicción de acciones, mientras que las características de audio pueden derivarse de incrustaciones de voz usando modelos como DeepSpeech o wav2vec.

El objetivo de la fusión basada en la atención es calcular pesos de atención específicos de cada modalidad que capturen la importancia relativa de cada modalidad. Esto se hace usando un mecanismo de atención suave.

Cálculo por peso de atención

En un primer paso, ambos vectores se transforman en un espacio de atención compartido mediante una transformación aprendible. Es decir, para cada modalidad i∈{V,A}, la puntuación intermedia de atención se calcula como:

figure-protocol-36(19)

donde figure-protocol-37 y figure-protocol-38 son parámetros aprendibles de la red de atención, y tanh es una función de activación no lineal. Esta conversión permite al modelo extraer correlaciones de alto nivel y la saliencia contextual de cada modalidad.

Estas puntuaciones de atención no normalizadas eV y αA se normalizan entonces con una función softmax de modo que suman 1

figure-protocol-39(20)

Aquí, αV y αA son los pesos de atención sobre las modalidades visual y auditiva, respectivamente. Los pesos son adaptativos y luego se actualizan con el tiempo dependiendo del contexto de la tarea existente, la calidad de la señal y la actividad del usuario.

figure-protocol-40(21)

La representación figure-protocol-41 fusionada resultante se obtiene como una combinación ponderada de los vectores de modalidad de entrada:

Este vector combinado codifica la semántica común de la información visual y auditiva de una manera que resalta activamente el flujo más informativo. Luego se introduce en módulos posteriores como el emparejamiento de grafos de tareas, la predicción de intenciones o el motor de planificación de movimiento de robots.

Algoritmo 1: Fusión basada en la atención multimodal

Entrada: El vector de características visuales es hVR d, el vector de características de audio es hA∈Rd

Parámetros aprendibles: W∈Rk*d, w∈R k y b∈R k

Salida: representación fundida hfusionada∈Rd.

Paso 1: Determinar representaciones intermedias calculando usando la Ecuación 19

Paso 2: Usa Softmax para normalizar las puntuaciones de atención usando la Ecuación 20

Paso 3: Calcular el vector fusionado usando la Ecuación 21

Paso 4: Devolver hfusionado

El algoritmo de Fusión Multimodal Basada en la Atención proporciona un medio para la fusión inteligente de características de diversas modalidades de entrada, como flujos visuales y de audio, de forma consciente del contexto. La fusión es esencial en sistemas en los que cada modalidad presenta información complementaria pero variable, como en entornos colaborativos humano-IA donde la visión captura gestos o la posición corporal y el audio captura comandos de voz o señales de voz.

El Algoritmo 1 comienza determinando representaciones intermedias para cada modalidad. Para calcular ambos modelos, eV para el flujo visual y eA para el flujo de audio, una capa de red neuronal compartida realiza primero una transformación no lineal sobre los vectores de características correspondientes. Luego, los pesos de atención αV y αA se calculan realizando una función softmax sobre las puntuaciones intermedias. Esto ayuda a que los pesos sean positivos y sumen 1, haciendo que las contribuciones de cada modalidad se normalizen. Cuanto más informativa sea una modalidad, tal y como se ha modelado, mayor es su peso de atención.

Finalmente, el algoritmo calcula la representaciónfusionada h fusionada mediante una combinación ponderada de los vectores de características gráficas y de audio, normalizadas con sus respectivos pesos de atención. Este vector fusionado combina ambas modalidades de forma orientada a datos y sensible al contexto, y sirve para tareas posteriores como el reconocimiento de intenciones, la toma de decisiones o la planificación del movimiento del robot. En conjunto, este algoritmo permite al sistema centrarse dinámicamente en la modalidad o combinación de modalidades más pertinente en un momento específico, en lugar de utilizar enfoques de fusión fija o basados en reglas. Esto hace que el marco sea más fuerte, flexible y receptivo en situaciones dinámicas de interacción humano-IA.

La Figura 2 ilustra el flujo de trabajo del mecanismo de Fusión Multimodal Basada en la Atención que opera en la integración contextual de entradas visuales y auditivas. La Extracción de Características Visuales, el primer paso del flujo de trabajo, implica extraer características espaciales o relacionadas con la pose de imágenes o vídeos de entrada (como cámaras RGB-D). Estos se introducen posteriormente en un módulo de Atención Visual que aprende a resaltar el contenido más informativo de la información visual. Paralelamente, los módulos de Atención de Audio procesan incrustaciones de voz o tokens de audio a partir de comandos hablados, atribuiendo importancia contextual a diferentes señales auditivas. Las características resultantes ponderadas por atención se integran a través de una capa de fusión basada en atención y se pasan a una red de alimentación por posición con conexiones residuales y normalización de capas, formando un bloque estándar de codificadores Transformer. El resultado es una incrustación multimodal unificada que soporta una predicción robusta de intenciones a largo plazo y una toma de decisiones adaptativa bajo condiciones de interacción variables. Este diseño permite al sistema concentrarse selectivamente en la modalidad más robusta en cualquier momento, mejorando la robustez y la interpretabilidad en la interacción humano-IA en tiempo real.

figure-protocol-42
Figura 2: La construcción detallada del módulo de fusión multimodal guiada por la atención. Para generar una representación fusionada consciente del contexto en cada paso temporal, los codificadores específicos de la modalidad recogen características de flujos visuales y auditivos. Estas características se ponderan dinámicamente mediante un mecanismo de atención basado en datos. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Adaptación de modelos en línea

Para garantizar una colaboración humano-IA de alta calidad bajo diferentes comportamientos y contextos de usuario, nuestro marco incorpora un mecanismo de adaptación de modelos en línea que optimiza progresivamente modelos específicos de usuario durante la interacción. El módulo rastrea señales de comportamiento en tiempo real (por ejemplo, pose, trayectorias de gestos, tono de voz) y actualiza los modelos predictivos subyacentes con algoritmos de aprendizaje incremental. En particular, los modelos de predicción de trayectorias y reconocimiento de intención se ajustan con entradas recientes mediante ajuste fino basado en gradiente o adaptación de bajo rango (LoRA), de modo que el sistema puede adaptarse al comportamiento cambiante del usuario o a los requisitos específicos de la tarea sin necesidad de ser completamente reentrenado.

La capa de retroalimentación actúa en armonía junto con la adaptación mediante retroalimentación implícita (por ejemplo, correcciones, vacilaciones, retrasos) y comandos explícitos (por ejemplo, voz o interfaz gráfica). Tiene dos propósitos: calibrar adaptativamente la relevancia de las señales multimodales y transmitir medidas de confianza/confianza a los módulos de decisión y control.

El ciclo de retroalimentación permite un rendimiento de las tareas más fluido y respuestas orientadas al usuario. Para fomentar la confianza y la transparencia, el marco integra un módulo de explicabilidad que traduce decisiones de bajo nivel en justificaciones comprensibles para las personas. Utiliza mapas de racionalización de transformadores de fusión multimodales, complementados con trazado lógico a través del grafo de tareas. Puede presentar opcionalmente esta justificación mediante una interfaz gráfica o un asistente auditivo para permitir a los usuarios comprender e incluso corregir el comportamiento del sistema.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El modelo de interacción multimodal adaptativa propuesto aquí aborda estas preocupaciones y mejora enormemente la colaboración entre humanos e IA al combinar de forma fluida las modalidades de visión y habla con procesos de adaptación en tiempo real por parte del usuario. En contraste con el sistema jerárquico multimodal de base, nuestro enfoque incluye un bucle de retroalimentación personalizado, así como una adaptación consciente de la carga cognitiva que proporciona una interacción má...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los hallazgos demuestran de forma concluyente la eficiencia de la base propuesta de interacción multimodal adaptativa para mejorar la colaboración entre humanos e IA.

Además de las puntuaciones estándar de evaluación como el Tiempo de Finalización de Tareas (TCT), la Precisión de la Predicción de la Intención Humana (HIPA), la Eficiencia de Fusión Multimodal (MFE), la Tasa de Recuperación de Errores (ERR), la Puntuación de Satisfacción del Usuario (USS) y el Í...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de interés.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen sinceramente el apoyo proporcionado por la Escuela de Diseño de la Universidad de Jiangnan, Wuxi, China.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Cámara RGB-D (Intel RealSense D435)Intel CorporationD435Resolución de profundidad 1280 y días; 720 px @ 30 fps; Resolución RGB 1920 y días; 1080 px @ 30 fps; Utilizado para capturar la postura del usuario, movimientos corporales y contexto espacial
Micrófono direccionalGenérico / Múltiples proveedoresN/AMicrófono de banda ancha con cancelación de ruido (16 kHz– 44,1 kHz); Utilizado para recoger órdenes habladas
BlazePose (modelo preentrenado)Googlehttps://developers.google.com/mediapipe/solutions/vision/poseModelo de estimación de poses con 33 puntos clave; Extracción de poses humanas en tiempo real
OpenPose (modelo preentrenado)Laboratorio de Computación Perceptual de CMUhttps://github.com/CMU-Perceptual-Computing-Lab/openposeMarco de estimación de poses multipersona utilizado para extraer trayectorias de movimiento
Motor ASR DeepSpeechMozillav0.9.3Modelo de reconocimiento automático de voz preentrenado para transcripción de voz a texto
Motor ASR wav2vec 2.0Meta IAhttps://github.com/facebookresearch/fairseqModelo de representación de voz autosupervisada para procesamiento de voz en tiempo real
Modelo de Predicción de Acciones basado en transformadores (DLinear / Seq2Seq)Implementación personalizadaN/AArquitectura codificador-decodificador temporal con atención a la predicción de acciones a corto plazo
Módulo de Distorsión Dinámica del Tiempo (DTW)Personalizado / basado en SciPyhttps://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.distance.cdist.htmlAlgoritmo de alineación suave para emparejar acciones del usuario con grafos de tareas predefinidos
Red de Fusión Multimodal Basada en la AtenciónImplementación personalizadaN/AMecanismo de atención ponderado por confianza para fusionar la visión y el habla
Módulo de Adaptación en Línea (LoRA / Basado en Gradientes)Implementación personalizadahttps://github.com/microsoft/LoRAAjuste fino ligero y eficiente en parámetros para adaptarse al comportamiento del usuario
Módulo de Explicabilidad (Basado en reglas + Mapas de Atención)Implementación personalizadaN/AProporciona una justificación interpretable de la decisión mediante reglas y visualizaciones de atención
Brazo robótico KINOVA Gen3KINOVA RobóticaGen3Manipulador robótico de 7 profundidades de profundidad con sensores de par integrados; Utilizado para el montaje colaborativo de coches de juguete
Entorno de simulación de ensamblaje cooperativoEntorno personalizadoN/AMontaje real de coches de juguete utilizado para benchmarking de colaboración multimodal
Métricas de evaluación (TCT, HIPA, MFE, Latencia, ERR, USS, ISI)Definiciones personalizadasN/AMétricas cuantitativas y centradas en el usuario para evaluar la eficiencia, precisión y confianza de la colaboración

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Yu, P., Abuduweili, A., Liu, R., Liu, C. Robustifying long-term human-robot collaboration through a hierarchical and multimodal framework. arXiv. , (2024).
  2. Cheng, Y., Sun, L., Liu, C., Tomizuka, M. Towards efficient human-robot collaboration with robust plan recognition and trajectory prediction. IEEE Robot Autom Lett. 5, 2602-2609 (2020).
  3. Abuduweili, A., Li, S., Liu, C. Adaptable human intention and trajectory prediction for human-robot collaboration. arXiv. , (2019).
  4. Amirova, A., Rakhymbayeva, N., Yadollahi, E., Sandygulova, A., Johal, W. Ten years of human-NAO interaction research: A scoping review. Front Robot AI. 8, 744526(2021).
  5. Liu, R., Liu, C. Human motion prediction using adaptable recurrent neural networks and inverse kinematics. IEEE Control Syst Lett. 5, 1651-1656 (2021).
  6. Wang, T., Zhao, Y., Chen, L., Li, Q., Xu, Y., Zhang, H. Multimodal human-robot interaction for human-centric smart manufacturing: A survey. Adv Intell Syst. 6, 2300359(2024).
  7. Ergonomic adaptation of robotic movements in human-robot collaboration. van den Broek, M. K., Moeslund, T. B. Companion Proc. ACM/IEEE Int Conf Hum-Robot Interact, 2020, 499-501 (2020).
  8. Human-robot collaboration using multimodal perception. Yang, Y., et al. Proc IEEE Int Conf Robot Biomimetics (ROBIO), , 358-363 (2021).
  9. Sawadwuthikul, G., et al. Intelligent manufacturing with deep reinforcement learning. IEEE Trans Ind Inform. 18, 1883-1894 (2022).
  10. Multimodal robotic manipulation in collaborative tasks. Huang, W., Gu, J., Duan, P., Hou, S., Zheng, Y. Proc IEEE Int Conf Robot Autom (ICRA), , 14213-14219 (2021).
  11. Dellermann, D., et al. The future of human-AI collaboration: A taxonomy of design knowledge for hybrid intelligence systems. arXiv. , (2021).
  12. Ostheimer, J., Chowdhury, S., Iqbal, S. An alliance of humans and machines for machine learning: Hybrid intelligent systems and their design principles. Technol. Soc. 66, 101647(2021).
  13. Afsar, B., Al-Ghazali, B. M., Cheema, S., Javed, F. Cultural intelligence and innovative work behavior: The role of work engagement and interpersonal trust. Eur J Innov Manag. 24, 1082-1109 (2020).
  14. Spadaro, G., Gangl, K., Van Prooijen, J. W., Van Lange, P. A. M., Mosso, C. O. Enhancing feelings of security: How institutional trust promotes interpersonal trust. PLoS ONE. 15, e0237934(2020).
  15. Pavez, I., Gómez, H., Laulié, L., González, V. A. Project team resilience: The effect of group potency and interpersonal trust. Int J Proj Manag. 39, 697-708 (2021).
  16. Yuan, H., Long, Q., Huang, G., Huang, L., Luo, S. Different roles of interpersonal trust and institutional trust in COVID-19 pandemic control. Soc Sci Med. 293, 114677(2022).
  17. Yun, Y., Ma, D., Yang, M. Human-computer interaction-based decision support systems with applications in data mining. Future Gener Comput Syst. 114, 285-289 (2021).
  18. Nazar, M., Alam, M. M., Yafi, E., Su'ud, M. M. A systematic review of human-computer interaction and explainable artificial intelligence in healthcare. IEEE Access. 9, 153316-153348 (2021).
  19. Ho, Y. H., Tsai, Y. J. Open collaborative platforms for multi-drone search and rescue operations. Drones. 6, 132(2022).
  20. VAHAK: A blockchain-based outdoor delivery scheme using UAVs for healthcare 4.0 services. Gupta, R., et al. Proc IEEE INFOCOM Workshops, , 255-260 (2020).
  21. BloCoV6: A blockchain-based 6G-assisted UAV contact tracing scheme for COVID-19. Zuhair, M., Patel, F., Navapara, D., Bhattacharya, P., Saraswat, D. Proc 2nd Int Conf. Intell Eng Manag (ICIEM), , 271-276 (2021).
  22. Sahoo, S. K., et al. Intelligent trust-based utility and reusability model using UAV-assisted sensor networks. Appl Sci. 12, 1317(2022).
  23. Ko, Y., et al. Drone secure communication protocol for future sensitive military applications. Sensors. 21, 2057(2021).
  24. Gupta, R., Kumari, A., Tanwar, S., Kumar, N. Blockchain-envisioned softwarized multi-swarming UAVs to tackle COVID-19 situations. IEEE Netw. 35, 160-167 (2020).
  25. Tomsett, R., et al. Rapid trust calibration through interpretable and uncertainty-aware. Patterns. 1, 100049(2020).
  26. Huang, R., Zhou, H., Liu, T., Sheng, H. Multi-UAV collaboration to survey Tibetan antelopes in Hoh Xil. Drones. 6, 196(2022).
  27. Seeber, I., et al. Machines as teammates: A research agenda on AI in team collaboration. Inf Manag. 57, 103174(2020).
  28. Ajoudani, A., et al. Progress and prospects of the human-robot collaboration. Auton Robots. 42, 957-975 (2018).
  29. Oviatt, S., et al. The Handbook of Multimodal-Multisensor Interfaces, Volume 1: Foundations, User Modeling, and Common Modality Combinations. , Association for Computing Machinery. New York, NY, USA. (2017).
  30. Villani, V., Pini, F., Leali, F., Secchi, C. Survey on human-robot collaboration in industrial settings. Mechatronics. 55, 248-266 (2018).
  31. Nikolaidis, S., et al. Human-robot collaboration in manufacturing: Quantitative evaluation of predictable, convergent robot behavior. Auton Robots. 41, 123-140 (2017).
  32. Roggen, D., Junker, M., Transter, G., Roques, D. L. Collecting complex activity datasets in smart environments. J Ambient Intell Humaniz Comput. 1, 1-17 (2009).
  33. Bazarevsky, V., et al. BlazePose: On-device real-time body pose tracking. arXiv. , (2020).
  34. Garcia, S., Gomez-Donoso, F., Cazorla, M. Enhancing human-robot interaction: Development of a multimodal robotic assistant for user emotion recognition. Appl Sci. 14, 11914(2024).
  35. Li, S., et al. Toward proactive human-robot collaborative assembly: A multimodal transfer-learning-enabled action prediction approach. IEEE Trans Ind Electron. 69, 8579-8588 (2021).
  36. Abdelrahman, A. A., Almotiri, J., Yaseen, Q., Alanazi, A., Alotaibi, B. Multimodal engagement prediction in multiperson human-robot interaction. IEEE Access. 10, 61980-61991 (2022).
  37. Chiossi, F., et al. Designing intent: A multimodal framework for human-robot cooperation in industrial workspaces. arXiv. , (2025).
  38. McGrath, M. J., Chen, Y., Patel, A., Smith, J., Rao, V. Collaborative human-AI trust (CHAI-T): A process framework for active management of trust in human-AI collaboration. arXiv. , (2024).
  39. Fragiadakis, G., Nikas, C., Karageorgiou, E., Papadopoulos, A. Evaluating human-AI collaboration: A review and methodological framework. arXiv. , (2024).
  40. Younis, H. A., Khan, S., Raza, M., Ahmed, F., Mahmood, T. Multimodal age and gender estimation for adaptive human-robot interaction: A systematic literature review. Processes. 11, 1488(2023).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Marcos adaptativosestimaci n de la posecomprensi n de comandos de vozprevisi n de intencionesmodelos Transformerfusi n de atenci ndeformaci n temporal din micaIA explicable

Artículos relacionados