$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
La arquitectura propuesta para aumentar la cooperación humano-IA utiliza una cadena de interacción multimodal adaptativa que combina las modalidades de visión y habla en un marco de razonamiento dinámico y jerárquico. Este estudio utilizó datos públicos de experimentos previamente publicados. No hubo nuevos sujetos humanos involucrados y no se requirió aprobación ética adicional.
Arquitectura propuesta de interacción multimodal adaptativa
Fundamentalmente, el sistema comienza con módulos de percepción, como el flujo visual que captura la postura y el movimiento del usuario usando sensores RGB-D, y un flujo de audio analiza las entradas de voz usando un motor ASR (Reconocimiento Automático de Voz) ligero. Estas entradas en bruto se introducen en el módulo de predicción de acciones basado en Transformer, que codifica dependencias temporales en secuencias de pose y comandos para razonar sobre acciones humanas de bajo nivel. Posteriormente, para permitir una planificación colaborativa a alto nivel, un mecanismo de Distorsión Dinámica del Tiempo (DTW) alinea las acciones detectadas con nodos de un grafo de tarea predefinido para predecir los objetivos y las siguientes acciones del usuario. Un nuevo módulo de fusión basado en la atención decide, en cada paso temporal, qué modalidad (audio o imagen) proporciona la información más importante contextualmente y ajusta dinámicamente los pesos de entrada. Para individualizar la interacción, el sistema incluye adaptación de modelos en línea, adaptando predictores de acción en tiempo real al comportamiento cambiante del usuario. Un módulo de explicabilidad ligero también crea resúmenes fáciles de usar de intenciones previstas y decisiones de IA para mejorar la transparencia y la confianza. Todo el sistema se prueba en un entorno de ensamblaje cooperativo simulado pero real, permitiendo la comparación entre entornos unimodales y adaptativo-multimodales. Este enfoque facilita una colaboración más adaptable, intuitiva y fiable con agentes de IA en todas las áreas.
La Figura 1 muestra la arquitectura del Marco de Interacción Multimodal Adaptativa descrito, destinado a mejorar la colaboración humano-IA. Comienza con la fase de Adquisición de Entrada, que se basa en dos dispositivos principales de detección: una cámara RGB-D para observar información visual con mayor profundidad (por ejemplo, postura y movimiento humano) y un micrófono direccional para recoger comandos de voz. Las señales en bruto se pasan posteriormente por el módulo de Preprocesamiento, que procesa los datos audiovisuales para su análisis posterior limpiando, normalizando y formateando los flujos de entrada. Luego, la cadena avanza a la fase de Extracción de Características, donde los datos se dividen en dos flujos: el Flujo Visual, que aísla las características de pose y movimiento mediante algoritmos de estimación de pose, y el Flujo de Audio, que transcribe el habla en incrustaciones de comandos interpretables. Un codificador Transformer multimodal, que utiliza autoatención multi-cabeza y codificación posicional temporal para expresar la interdependencia a largo alcance entre secuencias de interacción, procesa la representación fusionada. El estado actual del objetivo del usuario se estima mediante un predictor de intención y progreso de tareas a largo plazo, y las acciones de bajo nivel se asignan a nodos en un grafo jerárquico de tareas para un seguimiento fiable de tareas mediante un módulo de alineación basado en DTW. Los pesos de fusión y los parámetros de predicción se actualizan continuamente mediante un bucle de adaptación de modelos en línea en respuesta a la retroalimentación de interacción, y un módulo de explicabilidad proporciona explicaciones claras para promover la apertura y la confianza. Toda la cadena permite que el sistema trabaje de forma adaptativa y eficiente junto con los usuarios en tareas y entornos dinámicos.

Figura 1: Visión general del marco de interacción multimodal sugerido basado en transformadores. Se emplea una técnica guiada por la atención para codificar e integrar dinámicamente datos visuales y auditivos. Un módulo Transformer, que integra modelado jerárquico de tareas y adaptación en línea, procesa la representación fusionada para la predicción de intenciones a largo plazo y la estimación del progreso de la tarea. . Por favor, haz clic aquí para ver una versión ampliada de esta figura.
El sistema sugerido incorpora un módulo ligero de explicabilidad que funciona en conjunto con los componentes de fusión multimodal y planificación jerárquica para mejorar la transparencia y la confianza del usuario. El módulo obtiene pistas interpretables a partir de la alineación del grafo de tareas basada en DTW (por ejemplo, el progreso actual de la tarea y la siguiente acción anticipada) y la capa de fusión basada en la atención (por ejemplo, pesos de importancia de modalidad). Estas señales se convierten en explicaciones comprensibles para los humanos, como si las órdenes habladas o los gestos visuales afectaron principalmente a una elección del sistema y cómo encaja la acción anticipada en el plan de trabajo más amplio. Los usuarios reciben explicaciones en forma de comentarios escritos o visuales concisos, que les ayudan a comprender, predecir y, si es necesario, rectificar el comportamiento del sistema. La mejora de la satisfacción del usuario, la fluidez de la interacción y las métricas relacionadas con la confianza indicadas en la evaluación son indicadores indirectos de la percepción del usuario sobre la explicabilidad. Los hallazgos implican que, en la interacción a largo plazo entre humanos e IA, el razonamiento transparente para las decisiones de IA mejora la confianza del usuario, facilita la colaboración y aumenta la aceptación del comportamiento adaptativo del sistema.
Datos de entrada
La adquisición de entradas en el marco previsto para la colaboración humano-IA se lleva a cabo mediante un mecanismo estructurado de detección multimodal que combina las modalidades de visión y audición para realizar eficazmente las acciones e intenciones humanas. La entrada visual se adquiere con una cámara RGB-D, que captura información en tiempo real sobre la pose humana, la ubicación espacial y el contexto del entorno. Los datos visuales se procesan mediante modelos preentrenados como BlazePose para obtener puntos clave de interés en la parte superior del cuerpo para tareas de interacción. Al mismo tiempo, la información auditiva se obtiene a través de un micrófono direccional e interpretada mediante un modelo DeepSpeech preentrenado para identificar comandos de voz que desambiguan o proporcionan señales visuales inciertas suplementarias. En entornos cooperativos, el sistema de doble entrada ofrece adaptación dinámica y percepción consciente del contexto. El conjunto de datos de entrenamiento y evaluación comprende más de 5.000 trayectorias multimodales de movimiento humanopara una variedad de actividades de interacción, como comportamientos de ensamblaje y traspaso, recopiladas de cuatro usuarios en entornos controlados y semiestructurados. Para mejorar la generalización, el sistema permite la adaptación de modelos en línea en el despliegue, lo que permite actualizar sus predicciones en tiempo real como función del cambio en el comportamiento del usuario y la dinámica ambiental.
Descripción del conjunto de datos
El conjunto de datos de entrenamiento y evaluación para el marco sugerido se obtuvo a partir de experimentos reales de colaboración humano-robot bajo una tarea de ensamblaje de coches de juguete utilizando el robotKINOVA GEN3 1. El entorno experimental pretendía imitar actividades colaborativas a largo plazo que abarcan interacción multimodal, que incluía modalidades tanto visuales como auditivas. En particular, el conjunto de datos de entrenamiento está compuesto por 3.003 secuencias de trayectorias de dos usuarios, y el conjunto de datos de prueba contiene 2.088 secuencias, incluyendo datos de dos nuevos usuarios para evaluar la generalización del modelo. Cada trayectoria registra una secuencia de 5 pasos de puntos clave de postura de la parte superior del cuerpo recuperados con BlazePose, junto con los comandos de voz correspondientes transcritos porDeepSpeech 33. Los datos recopilados muestran la variación humana natural en la expresión de gestos y comandos en actividades como la entrega de objetos, el uso de herramientas y las acciones cooperativas. El conjunto de datos multimodal es la base para el aprendizaje supervisado de los modelos DLinear de acción y previsión de trayectorias, y es el punto de referencia central en los estudios de usuarios realizados bajo condiciones solo visuales, solo de audio y multimodales. Incorporar diferentes tipos de usuarios y condiciones de ruido realistas garantiza pruebas de robustez y adaptabilidad para sistemas HRC permanentes. La Tabla 2 muestra la descripción detallada del conjunto de datos.
| Atributos | Detalles |
| Nombre del conjunto de datos | Conjunto de datos de montaje de coches de juguete (recopilado internamente) |
| Entorno de la colección | Experimento real de HRC con brazo KINOVA GEN3 |
| Número de usuarios (formación) | 2 usuarios |
| Número de usuarios (Pruebas) | 4 usuarios (2 del set de entrenamiento, 2 invisibles) |
| Trayectorias totales (Entrenamiento) | 3.003 trayectorias |
| Trayectorias totales (pruebas) | 2.088 trayectorias |
| Modalidades capturadas | Visual (RGB-D para pose), Audio (comandos de voz) |
| Formato de datos | Puntos clave de pose (de BlazePose), comandos de conversión de voz a texto |
| Resolución temporal | Cada trayectoria incluye pasos de 5 tiempos |
| Tareas cubiertas | 3 tareas principales: Seleccionar y colocar, rotación de objetos, ensamblaje colaborativo |
| Uso | Entrenamiento supervisado de modelos de predicción de acción/trayectoria; Estudio de usuario |
Tabla 2: Descripción del conjunto de datos. Información sobre el entorno de simulación, incluyendo el marco de programación, la configuración de hardware y el entorno de evaluación.
Preprocesamiento de conjuntos de datos
Para permitir la interacción multimodal adaptativa en la colaboración humano-IA, el conjunto de datos en bruto, como los datos visuales (RGB y de profundidad), auditivos (comandos de voz) y temporales de comportamiento (puntos clave de pose), se somete a un preprocesamiento estructurado. Los datos visuales se extraen primero mediante unmodelo de estimación de pose f pose, comúnmente derivado de BlazePose u OpenPose. Para el fotograma t, el vector de pose humana se define como:
(1)
Donde k es el número de puntos clave y cada punto clave contiene coordenadas 2D. Las secuencias se normalizan por la longitud del torso y se suavizan con el tiempo con un filtro Savitzky-Golay:
(2)
donde w es el tamaño de la ventana de filtrado. En segundo lugar, los flujos de audio en bruto At se dividen en segmentos mediante un Detector de Actividad de Voz (VAD). Los segmentos creíbles se introducen en un modelo de reconocimiento devoz (por ejemplo, DeepSpeech) para extraer tokens de comando:
(3)
donde V es el vocabulario de los comandos reconocidos. Para integración, los tokens de comandos de todos se alinean en el tiempo a las marcas de tiempo de pose visual usando una función de alineamiento basada en interpolación τ:
(4)
En tercer lugar, para formar las secuencias
de entrenamiento de intención temporal , definimos secuencias de trayectoria , junto con los comandos
de voz asociados . Estas se organizan en ventanas en segmentos de longitud fija utilizando ventanas deslizantes de tamaño l:
(5)
(6)
Por último, las entradas se normalizan a media cero y varianza unitaria por dimensión clave para la convergencia en modelos de predicción basados en trayectorias:
(7)
donde μj, σj son la media y la desviación estándar del punto clave j completaron el conjunto de entrenamiento.
Extracción de características
En el paradigma de interacción multimodal adaptativa descrito, se habilita una cooperación fuerte y en tiempo real combinando características visuales, auditivas y contextuales de la tarea. La cadena de extracción de características comienza con la adquisición concurrente de datos de dos modalidades principales: señales
visuales y señales
de audio, indexadas en el paso de tiempo t. Estas observaciones se transmiten a través de los módulos de percepción correspondientes para obtener características semánticas de alto nivel relacionadas con el comportamiento humano, la intención y el comando del habla.
Extracción de características visuales
Los datos
visuales en bruto de las cámaras RGB-D se alimentan a través de un estimador de pose humana (por ejemplo, BlazePose), proporcionando un vector
de puntos clave espaciales , donde k representa el número detectado de puntos clave y cada uno contiene coordenadas 3D:
(8)
Estos puntos clave se incrustan en el tiempo en una trayectoria
de pose, de la cual se extrae la dinámica del movimiento mediante descomposición tendencia-estacional:
(9)
donde ∈_t representa el ruido residual.
Extracción de características de audio
La entrada
de audio se procesa mediante un modelo de reconocimiento de voz preentrenado (por ejemplo, DeepSpeech) y produce una representación
de comandos tokenizada , donde n es la longitud del token:
(10)
Fusión multimodal
Para construir un contexto de interacción unificado, combinamos las características mediante una atención ponderada por la confianza basada en la confianza y la información mutua:
(11)
donde φV y φA son las funciones de proyección de características visuales y auditivas en un espacio latente compartido, y αt∈[0,1] es un término dinámico de ponderación modal calculado en función de la entropía:
(12)
Aquí,
y
son información mutua entre el estado objetivo g y las modalidades observadas.
Planificación mediante incrustación contextual
El último vector de características multimodal Ft se enriquece con contexto de tarea y progreso Pt y se convierte en la entrada de estado del módulo de planificación adaptativa:
(13)
Esta característica extraída xt se utiliza como entrada a los modelos posteriores de predicción de intenciones y planificación de movimiento, apoyando una colaboración adaptativa y robusta entre humanos e IA en entornos dinámicos e inciertos.
Predicción de acciones y planes mediante alineación de grafos de tareas
Siguiendo el proceso de extracción de características multimodal, donde la intención del habla (audio), la trayectoria de la pose (visual) y los datos contextuales (por ejemplo, registros de tareas o emociones) se integran en el procesamiento posterior, incluye la predicción adaptativa de acciones humanas e inferencia de planes utilizando alineamiento jerárquico de grafos de tareas.
Sea el vector de características multimodal integrado en el paso de tiempo t representado como:
(14)
El sistema predice inicialmente la acción humana de bajo nivel mediante unafunción f, que a menudo se representa como un codificador-decodificador o transformador recurrente:
(15)
donde F(t-k:t) denota la secuencia de fusión de características en los últimos k pasos de tiempo, y
es la acción prevista del conjunto de acciones A. El módulo está en línea ajustado con precisión por pérdida adaptativa:
(16)
Aquí, CE es la clasificación de acción de pérdida cruzada de entropía, luego el segundo término empuja una buena predicción de trayectoria futura.
Para la predicción de planes a alto nivel, enmarcamos la tarea como una progresión a lo largo de un Grafo Jerárquico de Tarea G = (N, E), en el que cada nodo ni ∈N significa una subtarea o objetivo intermedio. El objetivo es comparar la secuencia de acciones observada con una ruta de tarea de referencia R*∈G reduciendo la distancia:
(17)
Donde Pt denota la traza de progreso actual y d(⋅) denota la distancia o métrica de alineación suave de Dynamic Time Warping (DTW).
La intención
última a nivel de plan se deriva proyectando la acción predicha a ̂_t sobre el siguiente paso más probable en la trayectoria
alineada:
(18)
Esta decodificación jerárquica garantiza que, incluso con entradas sensoriales poco claras o ruidosas, el sistema elija la intención de alto nivel más relevante contextualmente y consistente con la secuencia de tareas actual. Esta planificación predictiva no solo mejora la eficiencia de la colaboración, sino que también incrementa la anticipación y la adaptabilidad dentro de la interacción humano-IA en varios turnos.
Mecanismo de fusión multimodal (basado en la atención)
En la colaboración adaptativa humano-IA, la integración multimodal de varias modalidades sensoriales (por ejemplo, visual: postura humana, trayectoria; auditiva: comandos de voz) es necesaria para una correcta interpretación de la intención del usuario. Un enfoque basado en reglas o fusión estática no puede hacer frente a interacciones humanas dinámicas en el mundo real. Para ello, aquí se presenta un mecanismo de fusión basado en la atención para ponderar dinámicamente cada modalidad según su importancia contextual en cada paso temporal.
Denotemos los vectores de características extraídos de las modalidades visual y auditiva como
y
, respectivamente. Estos vectores codifican información semántica obtenida a través de procesos anteriores, por ejemplo, las características visuales pueden resultar de la estimación de la pose y la predicción de acciones, mientras que las características de audio pueden derivarse de incrustaciones de voz usando modelos como DeepSpeech o wav2vec.
El objetivo de la fusión basada en la atención es calcular pesos de atención específicos de cada modalidad que capturen la importancia relativa de cada modalidad. Esto se hace usando un mecanismo de atención suave.
Cálculo por peso de atención
En un primer paso, ambos vectores se transforman en un espacio de atención compartido mediante una transformación aprendible. Es decir, para cada modalidad i∈{V,A}, la puntuación intermedia de atención se calcula como:
(19)
donde
y
son parámetros aprendibles de la red de atención, y tanh es una función de activación no lineal. Esta conversión permite al modelo extraer correlaciones de alto nivel y la saliencia contextual de cada modalidad.
Estas puntuaciones de atención no normalizadas eV y αA se normalizan entonces con una función softmax de modo que suman 1
(20)
Aquí, αV y αA son los pesos de atención sobre las modalidades visual y auditiva, respectivamente. Los pesos son adaptativos y luego se actualizan con el tiempo dependiendo del contexto de la tarea existente, la calidad de la señal y la actividad del usuario.
(21)
La representación
fusionada resultante se obtiene como una combinación ponderada de los vectores de modalidad de entrada:
Este vector combinado codifica la semántica común de la información visual y auditiva de una manera que resalta activamente el flujo más informativo. Luego se introduce en módulos posteriores como el emparejamiento de grafos de tareas, la predicción de intenciones o el motor de planificación de movimiento de robots.
Algoritmo 1: Fusión basada en la atención multimodal
Entrada: El vector de características visuales es hV∈R d, el vector de características de audio es hA∈Rd
Parámetros aprendibles: W∈Rk*d, w∈R k y b∈R k
Salida: representación fundida hfusionada∈Rd.
Paso 1: Determinar representaciones intermedias calculando usando la Ecuación 19
Paso 2: Usa Softmax para normalizar las puntuaciones de atención usando la Ecuación 20
Paso 3: Calcular el vector fusionado usando la Ecuación 21
Paso 4: Devolver hfusionado
El algoritmo de Fusión Multimodal Basada en la Atención proporciona un medio para la fusión inteligente de características de diversas modalidades de entrada, como flujos visuales y de audio, de forma consciente del contexto. La fusión es esencial en sistemas en los que cada modalidad presenta información complementaria pero variable, como en entornos colaborativos humano-IA donde la visión captura gestos o la posición corporal y el audio captura comandos de voz o señales de voz.
El Algoritmo 1 comienza determinando representaciones intermedias para cada modalidad. Para calcular ambos modelos, eV para el flujo visual y eA para el flujo de audio, una capa de red neuronal compartida realiza primero una transformación no lineal sobre los vectores de características correspondientes. Luego, los pesos de atención αV y αA se calculan realizando una función softmax sobre las puntuaciones intermedias. Esto ayuda a que los pesos sean positivos y sumen 1, haciendo que las contribuciones de cada modalidad se normalizen. Cuanto más informativa sea una modalidad, tal y como se ha modelado, mayor es su peso de atención.
Finalmente, el algoritmo calcula la representaciónfusionada h fusionada mediante una combinación ponderada de los vectores de características gráficas y de audio, normalizadas con sus respectivos pesos de atención. Este vector fusionado combina ambas modalidades de forma orientada a datos y sensible al contexto, y sirve para tareas posteriores como el reconocimiento de intenciones, la toma de decisiones o la planificación del movimiento del robot. En conjunto, este algoritmo permite al sistema centrarse dinámicamente en la modalidad o combinación de modalidades más pertinente en un momento específico, en lugar de utilizar enfoques de fusión fija o basados en reglas. Esto hace que el marco sea más fuerte, flexible y receptivo en situaciones dinámicas de interacción humano-IA.
La Figura 2 ilustra el flujo de trabajo del mecanismo de Fusión Multimodal Basada en la Atención que opera en la integración contextual de entradas visuales y auditivas. La Extracción de Características Visuales, el primer paso del flujo de trabajo, implica extraer características espaciales o relacionadas con la pose de imágenes o vídeos de entrada (como cámaras RGB-D). Estos se introducen posteriormente en un módulo de Atención Visual que aprende a resaltar el contenido más informativo de la información visual. Paralelamente, los módulos de Atención de Audio procesan incrustaciones de voz o tokens de audio a partir de comandos hablados, atribuiendo importancia contextual a diferentes señales auditivas. Las características resultantes ponderadas por atención se integran a través de una capa de fusión basada en atención y se pasan a una red de alimentación por posición con conexiones residuales y normalización de capas, formando un bloque estándar de codificadores Transformer. El resultado es una incrustación multimodal unificada que soporta una predicción robusta de intenciones a largo plazo y una toma de decisiones adaptativa bajo condiciones de interacción variables. Este diseño permite al sistema concentrarse selectivamente en la modalidad más robusta en cualquier momento, mejorando la robustez y la interpretabilidad en la interacción humano-IA en tiempo real.

Figura 2: La construcción detallada del módulo de fusión multimodal guiada por la atención. Para generar una representación fusionada consciente del contexto en cada paso temporal, los codificadores específicos de la modalidad recogen características de flujos visuales y auditivos. Estas características se ponderan dinámicamente mediante un mecanismo de atención basado en datos. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Adaptación de modelos en línea
Para garantizar una colaboración humano-IA de alta calidad bajo diferentes comportamientos y contextos de usuario, nuestro marco incorpora un mecanismo de adaptación de modelos en línea que optimiza progresivamente modelos específicos de usuario durante la interacción. El módulo rastrea señales de comportamiento en tiempo real (por ejemplo, pose, trayectorias de gestos, tono de voz) y actualiza los modelos predictivos subyacentes con algoritmos de aprendizaje incremental. En particular, los modelos de predicción de trayectorias y reconocimiento de intención se ajustan con entradas recientes mediante ajuste fino basado en gradiente o adaptación de bajo rango (LoRA), de modo que el sistema puede adaptarse al comportamiento cambiante del usuario o a los requisitos específicos de la tarea sin necesidad de ser completamente reentrenado.
La capa de retroalimentación actúa en armonía junto con la adaptación mediante retroalimentación implícita (por ejemplo, correcciones, vacilaciones, retrasos) y comandos explícitos (por ejemplo, voz o interfaz gráfica). Tiene dos propósitos: calibrar adaptativamente la relevancia de las señales multimodales y transmitir medidas de confianza/confianza a los módulos de decisión y control.
El ciclo de retroalimentación permite un rendimiento de las tareas más fluido y respuestas orientadas al usuario. Para fomentar la confianza y la transparencia, el marco integra un módulo de explicabilidad que traduce decisiones de bajo nivel en justificaciones comprensibles para las personas. Utiliza mapas de racionalización de transformadores de fusión multimodales, complementados con trazado lógico a través del grafo de tareas. Puede presentar opcionalmente esta justificación mediante una interfaz gráfica o un asistente auditivo para permitir a los usuarios comprender e incluso corregir el comportamiento del sistema.