Esta revisión sintetiza los avances recientes en aprendizaje profundo, detección multimodal e estrategias de integración que permiten una comunicación fluida, adaptativa y centrada en el ser humano entre humanos y robots.
Review Article
Esta revisión sintetiza los avances recientes en aprendizaje profundo, detección multimodal e estrategias de integración que permiten una comunicación fluida, adaptativa y centrada en el ser humano entre humanos y robots.
La comunicación multimodal humano-robot fluida se ha vuelto esencial a medida que los robots sociales, asistenciales y educativos se trasladan a entornos cotidianos como hogares, centros sanitarios y aulas, donde necesitan integrar el habla, el gesto, la mirada, las expresiones faciales y las señales táctiles con alta precisión, baja latencia y robustez en el mundo real. Esta revisión examina sistemáticamente cómo las técnicas actuales logran la interacción multimodal recíproca humano-robot (HRI) en tiempo real, centrándose en estrategias de fusión, arquitecturas de sistemas y aplicaciones en dominios específicos. Buscamos en la Web of Science Core Collection estudios empíricos en inglés desde 2015 hasta 2025, seleccionando 148 artículos que abordan la integración comunicativa. Las ideas más importantes incluyen un claro cambio hacia la fusión híbrida y basada en la atención desde 2022 (aproximadamente el 43% de los enfoques), que maneja mejor la asincronía temporal y las interacciones incorporadas que los métodos anteriores; inconsistencia generalizada en las métricas de evaluación que dificulta las comparaciones entre estudios; y una brecha persistente entre un fuerte rendimiento en laboratorio y una menor robustez real bajo ruido, oclusión o variabilidad del usuario. Los principales desafíos incluyen el procesamiento en tiempo real, la alineación semántica, la eficiencia de los datos, la robustez en el despliegue y la integración poco explorada de señales táctiles con el afecto. De cara al futuro, la revisión sugiere priorizar políticas de fusión adaptativa, benchmarks estandarizados para sincronización y fluidez, y aprendizaje continuo para permitir una adaptación personalizada por el usuario. En última instancia, su objetivo es guiar el desarrollo de agentes robóticos más centrados en el ser humano que puedan colaborar de forma colaborativa, significativa y que sean socialmente aceptados en la vida diaria.
Los robots han evolucionado desde herramientas industriales en entornos estructurados hasta agentes socialmente integrados en hogares, hospitales y aulas. Ahora ayudan en la educación, la terapia y la compañía, reflejando un cambio de la automatización orientada a tareas a una interacción centrada en el usuario y adaptativa. En el núcleo de esta transición se encuentra la comunicación multimodal, que permite a los robots percibir y responder a las señales humanas—habla, mirada, gestos, expresiones faciales y tacto—con la precisión temporal necesaria para intercambios naturales en entornos dinámicos. Este énfasis en la coordinación y la capacidad de respuesta está alineado con preocupaciones centrales en la interacción humano-computadora y la ciencia cognitiva. En esta revisión, la comunicación multimodal fluida se refiere a interacciones que resultan fluidas e intuitivas para los usuarios, caracterizadas por tiempos de respuesta inferiores a segundos (normalmente inferiores a 300 ms), retrasos o desajustes perceptibles mínimos y una adaptación robusta a la variabilidad del mundo real. Esto lo distingue de los sistemas tradicionales basados en comandos o unimodales, donde errores de temporización, fallos de modalidad o respuestas rígidas interrumpen el flujo natural.
Dentro de la interacción humano-robot (HRI), esta revisión se centra en la comunicación humano-robot, definida como el intercambio recíproco y en tiempo real de señales multimodales entre humanos y robots. Aunque la HRI también abarca planificación, control y seguridad, la comunicación se refiere a la sincronización de percepción y acción a través de canales sensoriales. Los primeros sistemas basados en mandos priorizaban la eficiencia sobre el combate, produciendo a menudo comportamientos rígidos o retardados. El trabajo contemporáneo persigue modelos adaptativos y conscientes del contexto que acomodan el estado del usuario y laemoción 1,2. Esta evolución subraya la necesidad de marcos de interacción precisos, intuitivos y personalizados.
Los robots sociales y de asistencia iniciales solían depender de rutinas guionizadas o entradas de modalidad única como la voz o el tacto, limitando la flexibilidad3. La lógica basada en reglas y el procesamiento lento frecuentemente provocaban desajustes de tiempo entre gestos y habla, o una mala adaptación al comportamiento del usuario. Para abordar estos problemas, los investigadores emplean fusión de baja latencia, integración sensorial multimodal y aprendizaje adaptativodel usuario 4,5. Estas estrategias pueden entenderse a través de tres principios fundamentales de comunicación ampliamente reconocidos en la HRI: complementariedad (las modalidades se compensan entre sí), redundancia (la superposición mejora la robustez) y sinergia (la convergencia mejora la naturalidad).
Los avances en la detección y el aprendizaje han dado lugar a robots socialmente responsivos que integran entradas visuales, auditivas, táctiles y fisiológicas entiempo real 5,6. En lugar de scripts fijos, estos sistemas se adaptan continuamente a las señales del usuario. Las interfaces de programación accesibles y los métodos de aprendizaje a partir de la demostración permiten a educadores y terapeutas personalizar comportamientos para el cuidado y la instrucción, donde la precisión, la capacidad de respuesta y la adaptabilidad son esenciales.
Los patrones de comunicación en la IRH social pueden agruparse en modos paralelos, complementarios e interactivos (Figura 1). En interacción paralela, humanos y robots actúan de forma independiente con un intercambio mínimo. La interacción complementaria introduce prompts estructurados o apoyo basado en eventos. El modo interactivo más avanzado implica un ajuste bidireccional continuo a través de canales como el habla, el movimiento y lamirada 7.
Selección y análisis de la literatura
Metodología de revisión sistemática: Realizamos una búsqueda sistemática de la literatura en la Web of Science Core Collection, dirigida a artículos revisados por pares y actas completas de congresos de grandes editoriales (IEEE, ACM, Springer, Elsevier, Wiley, Taylor & Francis). La consulta booleana era: (((interacción humano-robot" O HRI) y (multimodal O "fusión de sensores" O gesto O mirada O habla O táctil) Y ("tiempo real" O "baja latencia" O adaptativa O robusta)). Los criterios de inclusión fueron: publicaciones en inglés desde enero de 2015 hasta 2025—un periodo que reflejó el cambio de sistemas basados en reglas y de modalidad única a arquitecturas de aprendizaje profundo que enfatizan la baja latencia, la adaptación y la interacción robusta—con un enfoque en técnicas de integración multimodal para la HRI comunicativa y la validación empírica (cuantitativa o cualitativa). Excluimos estudios limitados a la interacción unimodal, aquellos que abordan el control robótico sin intención comunicativa y trabajos no empíricos (por ejemplo, puramente teóricos o solo de simulación). La búsqueda inicial devolvió un corpus sustancial. Tras eliminar duplicados, evaluamos títulos y resúmenes según los criterios de inclusión, y luego realizamos revisiones en texto completo para evaluar la relevancia y la contribución a una fusión multimodal fiable. Este proceso de varias etapas, resumido en el diagrama de flujo al estilo PRISMA (Figura 2), produjo un corpus final de 148 artículos que constituyen la base empírica de esta revisión.
Resumen de la literatura seleccionada: La Figura 3 muestra las tendencias de publicación y la distribución disciplinaria, con la Informática y la Automatización y Robótica dominando, junto con crecientes contribuciones de las Ciencias del Comportamiento y la Neurociencia, lo que subraya la trayectoria interdisciplinar del campo. Agrupamos temáticamente la literatura por contribución técnica a la integración multimodal (Tabla 1). Esta síntesis abarcó modalidades, métodos de fusión, manejo de latencia, estrategias de robustez, adaptabilidad y métricas. Los estudios de 2019 a 2021 utilizaron predominantemente fusión temprana o tardía, a menudo enfatizando gestos y entradas táctiles. Desde 2022, las arquitecturas híbridas y basadas en la atención han ganado popularidad, especialmente en la interacción afectiva y corporal. En este corpus, la fusión híbrida representa aproximadamente el 43% de los enfoques, la fusión temprana el 29% y la fusión tardía el 28%—una distribución que sugiere una mejor tolerancia a la asincronía temporal.
Aunque la capacidad en tiempo real se afirma comúnmente en la literatura más amplia que se analiza inicialmente, solo un número limitado de estudios detalla estrategias específicas de mitigación (por ejemplo, procesamiento en búfer, modelos predictivos o optimización a nivel de sensor). La robustez suele depender de filtrado, redundancia o soluciones de respaldo basadas en reglas, mientras que la adaptación anticipatoria sigue siendo rara. Las prácticas de evaluación son inconsistentes y las evaluaciones estandarizadas de sincronización temporal o fluidez de interacción siguen siendo poco frecuentes. Las métricas varían tanto entre estudios que las comparaciones directas suelen ser difíciles. La precisión, las puntuaciones F1 y las cifras de latencia son comunes, pero provienen de diferentes conjuntos de datos, tareas y condiciones ambientales; Pocos artículos adoptan referencias compartidas para la alineación temporal o la robustez del ruido. En consecuencia, un rendimiento sólido en instalaciones limpias de laboratorio suele sobrestimar qué métodos pueden lograr entornos controlados fuera de la zona. Desarrollar marcos de evaluación consistentes—quizá incluyendo pruebas de latencia estandarizadas bajo variabilidad realista—facilitaría mucho juzgar qué enfoques realmente avanzan el campo.
Persisten brechas clave en la integración táctil-afectiva (solo seis estudios 8,9,10,11,12,13 abordan esto) y en el ajuste dinámico de latencia bajo incertidumbre temporal impulsada por el usuario. Surgen varias tensiones interesantes de la literatura. La fusión híbrida es a menudo alabada por manejar bien la desalineación temporal, pero los comportamientos verdaderamente anticipatorios o adaptativos siguen siendo raros, lo que pone en duda cuán fluido es realmente ese rendimiento en tiempo real que se afirma. Al mismo tiempo, el impresionante progreso en la visión y el reconocimiento de afectos basado en el habla contrasta notablemente con el trabajo mínimo que integra las señales táctiles con la comprensión emocional. La alta precisión en experimentos controlados también tiende a degradarse en condiciones reales, lo que pone de manifiesto los desafíos continuos en la generalización entre entornos y usuarios. La Tabla 2 resume las tendencias arquitectónicas representativas y los enfoques de evaluación, informando los desafíos tratados en las secciones posteriores.
Esta revisión ofrece una contribución clara a la literatura de HRI multimodal. Encuestas recientes, como Zhao et al.14, ofrecen amplios panoramas de la toma de decisiones guiadas por la percepción, mientras que Wang et al.15 se centran en la transmisión visual-táctil habilitada por 5G. Ambos enfatizan marcos generales o protocolos de comunicación, con una discusión limitada sobre los compromisos de fusión en tiempo real, la comparabilidad de métricas o los desafíos de despliegue. En cambio, ofrecemos un análisis más específico: comparar estrategias de fusión bajo restricciones específicas, criticar las inconsistencias de métricas entre estudios y destacar brechas prácticas, especialmente la división de rendimiento laboratorio-campo que encuestas anteriores en gran medida han pasado por alto.
Access restricted. Please log in or start a trial to view this content.
A medida que los robots se convierten en elementos habituales en hogares, aulas y entornos sanitarios, la comunicación natural y adaptativa es fundamental para su éxito. Cada vez más vistas no como herramientas, sino como socios sociales, deben percibir, interpretar y responder a señales humanas a través de diferentes modalidades. Los sistemas que capturan con precisión la intención del usuario y ofrecen retroalimentación oportuna mejoran el rendimiento de las tareas, la confianza y la comodidad emocional, especialmente al involucrar a niños, adultos mayores o personas con discapacidad. Lograr esto requiere una interacción continua e intuitiva que alinee las respuestas de los robots con el comportamiento humano en curso en lugar de interrumpirlo. Tal fluidez exige entradas multimodales—voz, mirada, gesto, expresión facial—integradas mediante mecanismos que reflejan la propia comunicaciónhumana 14,16.
Percepción y canales de comunicación
La visión sigue siendo la base de la interacción multimodal humano-robot. Señales visuales como la expresión facial, la mirada, la postura y el gesto sustentan el reconocimiento de la intención, la inferencia emocional y el seguimientode la interacción 17,18,19,20,21. Los primeros métodos artesanales que usaban detecciónde Haar 22 o sustracciónde fondo 23 a menudo fallaban bajo oclusión o cambios de iluminación16,21. Ahora predominan los sistemas de aprendizaje profundo, empleando CNN y modelos recurrentes con entradas multicámara. La Figura 4 ilustra la canalización de seguimiento HI-ROS, que reduce el error de movimiento en un 27% en la monitorización de gestos en tiempo real.
La integración de las señales de mirada, brazo y cabeza mejora la predicción de las acciones delusuario 17, mientras que la fusión propioceptiva y de profundidad mejorala precisión 24,25. La miradamutua 19 y los diseños oculares biomiméticos18 demuestran aún más el papel de las señales sutiles en la confianza y la coordinación. La Figura 5 muestra la arquitectura de la 26, donde dos Controladores de Movimiento Leap capturan el movimiento de la mano, fusionados a través de LSTM-RNN para una teleoperación quirúrgica robusta. Sistemas recientes de múltiples cámaras, como Hi-ROS20 y RPF 21,27, mejoran el seguimiento de personas en entornos no estructurados. La Figura 6 muestra el ciclo de vida adaptativo de ReID que mantiene el seguimiento bajo oclusión mediante refinamiento continuo de clasificadores. El trabajo complementario sobre el etiquetadoactivo 28 y el SLAMsemántico 26 mejora la conciencia contextual, extendiendo la percepción desde el reconocimiento de objetos hasta la comprensión conductual.
El lenguaje proporciona un canal comunicativo paralelo. Los primeros sistemas de diálogo basados en reglas tuvieron dificultades con la ambigüedad, lo que llevó a la adopción de modelos basados en datos ytransformadores 29. La respuesta emocional y social es ahora clave: los sistemas multimodales alinean las señales faciales y vocales para un diálogoadaptativo 2,30. El aprendizaje por refuerzo mejora la coordinación entre las señales afectivas yacústicas 5,31,32. Grandes modelos de lenguaje como GPT-33 y ChatGPT34 permiten el razonamiento contextual y el seguimiento de instrucciones en las tareas35, 36 y 37. Su integración con el modelado de visión y recompensa 38,39,40,41,42,43,44 apoya una interacción socialmente consciente y generalizada.
La percepción auditiva complementa la visión y el lenguaje. La prosodia, el tono y el ritmo comunican la intención cuando las señales visuales no son fiables. La extracción de características basada en refuerzo mejora la sincronización entre voz y expresión. Conjuntos de datos como AVAActiveSpeaker 45,AFFECT-HRI 5, SAVEn-Vid46, HumorHRI47 y CHiME-5 enriquecen la robustez del modelo en entornos ruidosos y afectivos. Pan et al.32 avanzan la sincronización de voz–labios para escenas con múltiples altavoces, mientras que la fusión multimodal con entradas táctiles o fisiológicas informa el comportamiento adaptativo.
Sensorial incorporado y fisiológico
La percepción táctil y fisiológica mejora la conciencia social y física. La fuerza, la presión y las bioseñales permiten inferir la intención, el estrés y el combate. Simuladores táctiles basados en visión como TACTO4 y mapeadores neuronales como FOTS48 generan datos de contacto de alta resolución a 300 fps, soportando control de baja latencia. FOTS modela la iluminación y deformación mediante una función de reflectancia aprendida R:

y proyección de sombras:

donde Ms codifica la geometría de proyección. Se han realizado pieles táctiles de alta resolución utilizando elastómeros magnetorheológicos49, matrices de sensores EtherCAT50 y materiales de efecto Hallauxéticos 51. Sistemas como DiGeTac13 unifican señales de gesto, táctiles y de distancia mediante tuberías modulares. El filtrado de los datos de distancia de tiempo de vuelo se modela como:

seguida de la clasificación por gestos neuronales y la localización de contacto basada en CNN. El control de seguridad se hace cumplir escalando la velocidad del robot con separación d. Estos módulos permiten una colaboración robusta entre humanos y robots. Los transformadores multimodales integran además señales táctiles, visuales y textuales. El TVT-Transformer6 alinea representaciones específicas de modalidad (qi, ki, vi) en matrices conjuntas:

permitir la autoatención intermodal para una comprensión unificada (Figura 7).
La detección fisiológica avanza la alineación emocional. Heinisch et al.5 sincronizan señales fisiológicas y audiovisuales para la modelización del afecto. Los sistemas basados enelectromiografía 52,53 decodifican gestos y el habla silenciosa, mientras que MetaSonic54 mejora la percepción espacial mediante la localización acústica. Conjuntos de datos a gran escala como AgiBot World Colosseo55 soportan entrenamiento multimodal con más de un millón de trayectorias táctil-visuales. Juntos, estos avances marcan una transición de la percepción unimodal a la comprensión integrada de los estados sociales, físicos e internos. La mejora de la fidelidad sensorial permite a los robots no solo medir el contacto, sino también interpretar la vacilación, tensión o incomodidad, respondiendo con sensibilidad y control adaptativo, que son bases clave para los marcos multimodales sin interrupciones que se discutirán en secciones posteriores.
Fusión multimodal y aprendizaje de representación
La fusión permite la transformación de flujos sensoriales distribuidos en un control coherente y consciente del contexto. Los enfoques suelen agruparse como fusión temprana, tardía o híbrida. La fusión temprana integra características en la etapa de entrada, soportando señales sincronizadas como el habla–gesto o la alineación facial–prosódica. El Transformador Multimodal de Tsai et al.14 ejemplifica la integración temprana basada en la atención de señales visuales, acústicas y textuales. Xue et al.56 ampliaron esto con el acoplamiento residual de los puntos de referencia faciales y los rasgos del habla, mejorando la robustez bajo variaciones de iluminación, mientras que Hu et al. Propuso MMSERNet57, una red de fusión multiescala que utiliza convolución dilatada y fusión residual para fusionar MFCC, espectrograma y características léxicas para el reconocimiento emocional. La salida fundida se expresa como:

La fusión tardía, en cambio, combina las decisiones tras un procesamiento independiente, ofreciendo una mayor tolerancia a entradas asíncronas o ruidosas. Ejemplos incluyen la combinación a nivel de decisión de señales de mirada, inercial y movimiento en el HRIsubmarino 58,59. La fusión híbrida integra ambos enfoques: mapeando modalidades heterogéneas a espacios de incrustación compartidos mientras se preserva la especificidad temporal. La Red de Fusión Multimodal Cerebro–Ordenador60 alinea las características EEG y visuales antes de la clasificación, mientras que los diseños cross-modales para estimación de poses 3D fusionan datos inerciales ymonoculares 61. Los marcos recientes combinan capas convolucional, recurrente y transformador con alineación de atención62,63, ponderando dinámicamente modalidades por contexto o relevanciade tarea 64,65,66. La elección entre fusión temprana, tardía e híbrida no es una cuestión de talla única. La fusión temprana suele funcionar bien cuando las modalidades están estrechamente sincronizadas y los niveles de ruido son bajos, lo que permite al modelo capturar relaciones intermodales ricas desde el principio. La fusión tardía, en cambio, suele ser más robusta en condiciones reales desordenadas y asíncronas porque cada modalidad puede procesarse de forma independiente antes de que se combinen las decisiones. Los enfoques híbridos, que ahora aparecen en aproximadamente el 43% de los estudios recientes, encuentran un punto intermedio útil, especialmente para interacciones afectivas y corporales, al usar la atención a entradas dinámicamente equilibradas, aunque conllevan demandas computacionales añadidas. En última instancia, la mejor estrategia depende de la tarea específica, el perfil de ruido y las limitaciones de hardware, lo que sugiere que los sistemas futuros podrían beneficiarse de cambiar los modos de fusión sobre la marcha.
La complementariedad entre modalidades también varía mucho según el contexto. La visión combinada con la háptica es especialmente eficaz en tareas físicas a corta distancia, como agarrar o entregar objetos, donde la retroalimentación táctil compensa la oclusión visual, cambios de iluminación o limitaciones de distancia y proporciona información precisa de fuerza y contacto que el audio no puede proporcionar. Por el contrario, la visión combinada con el audio funciona mejor en entornos lejanos o sociales, como el reconocimiento emocional o el diálogo en entornos ruidosos, donde la prosodia y el tono transmiten la intención y afectan cuando las señales visuales no están disponibles o son poco fiables.
Más allá del marco clásico de early, late e hybrid, el deep learning ha permitido categorizaciones más detalladas. La fusión basada en la atención permite a los modelos aprender la importancia dinámica de la modalidad por entrada, creando efectivamente caminos de integración específicos por tarea y contexto sin límites rígidos de etapa. Las estrategias de fusión aprendidas van más allá al tratar todo el proceso de fusión como un módulo diferenciable de extremo a extremo, permitiendo que la red descubra patrones de combinación óptimas directamente a partir de los datos. Estos desarrollos trasladan el paradigma de reglas predefinidas a arquitecturas totalmente adaptativas basadas en datos que abordan mejor la complejidad de la HRI multimodal en tiempo real.
Conexión visual-lenguaje
El rápido crecimiento de los grandes modelos de lenguaje ha ampliado el alcance del razonamiento multimodal, especialmente a través de modelos visión-lenguaje (VLM). Estas arquitecturas alinean información lingüística y visual para permitir a los robots interpretar comandos, percibir escenas y generar acciones sensibles al contexto. Marcos fundamentales como LXMERT64 y CLIP66 establecieron incrustaciones conjuntas para la alineación imagen–texto. Flamingo65 introdujo razonamiento multimodal de pocos disparos, mientras que el Clio39 de Maggio enlazaba dinámicamente instrucciones a grafos de escena mediante semántica CLIP. Gao et al.41 desarrollaron LAMARS para la planificación anticipatoria basada en la predicción multimodal, y Xie et al.67 aplicaron modelos convolucionales espaciotemporales para una comprensión eficiente de gestos. Arenas et al. introdujeron la personalización basada en prompts para estilos de interacciónpersonalizados 68. Estos sistemas permiten que comandos como recoger la taza roja se conecten directamente a la semántica de la escena.
La integración con el razonamiento espacial mejora aún más la navegación e interpretación robótica. El LatentBKI38 de Wilson fundamenta las instrucciones en mapas espaciales basados en voxeles, mientras que Nwankwo et al.40 fusionan grandes modelos de lenguaje con razonamiento VLM para interpretar los actos de diálogo bajo incertidumbre visual. La segmentación basada en eventos y los métodos de percepción asíncrona añaden eficiencia a las tareas dinámicas. Colectivamente, las VLM actúan como puentes entre la instrucción simbólica y la comprensión incorporada, proporcionando el sustrato cognitivo para una interacción flexible.
Aplicaciones específicas de dominio
En la sanidad y la atención a personas mayores, la comunicación multimodal permite una asistencia segura, intuitiva y empática. Las funciones básicas —detección de caídas, monitorización diaria de la actividad y respuesta a emergencias— dependen de la postura, la voz y las señalesfaciales 3. Los modelos de control jerárquico mejoran la precisión del movimiento en robots de asistencia debrazo 1, mientras que la retroalimentación propioceptiva guía a asistentes de vestidocooperativo 69. La transferencia de objetos, representada en la Figura 8, ejemplifica la percepción sincronizada y la coordinaciónmotora 70. La respuesta emocional, estudiada a través de sistemas como LOVOT, fomenta la confianza del usuario pero plantea preocupaciones éticas sobre la sobredependencia.
Los robots sociales requieren una respuesta multimodal fluida para mantener la empatía y la confianza tanto en entornos domésticos como públicos. La Figura 9 describe una arquitectura típica que integra las capas de sensación, planificación y razonamiento socioemocional. Los grandes modelos de lenguaje integrados con percepción permiten diálogos abiertos modulados por la mirada yel tono 40. Los estudios pediátricos muestran que el movimiento expresivo y la prosodia reducen la ansiedad enniños de 71 años, mientras que las encuestas destacan los comportamientos no verbales como determinantes del compromiso8. Modelos proactivos como RoboAgent37 y Optimización de Colonias de Hormigas guiadas Sub-Prior72 permiten la exploración conjunta de objetivos compartidos. Los sistemas capaces de expresar estados internos (listo, confuso)73 mejoran la transparencia y la coordinación, mientras que los agentes sociales adaptativos median la colaboracióngrupal 74,75.
Robots educativos: En educación, la HRI multimodal promueve la motivación y el aprendizaje aprovechando la incorporación y la señalizaciónsocial 76. Combinar gestos, señales faciales y verbales mejora la accesibilidad y la implicación 6,9,77,78. La adaptividad emocional apoya a los aprendices más jóvenes: los sistemas que detectan el estado afectivo y modulan el habla y el movimiento aumentan la atención y el vocabulario 7,79. La integración con la realidad virtual mejora la inmersión, pero desafía laescalabilidad 80. Colectivamente, estos sistemas cambian el papel del robot de instructor a colaborador emocionalmente sintonizado.
La personalización garantiza la relevancia y la confianza en los sistemasmultimodales 71,81,82. La personalización ética equilibra la autonomía y la empatía, adaptando las respuestas a través de la retroalimentación participativa. Maaz et al.83 demostraron tutoría afectiva guiada por señales faciales y cognitivas, mientras que Gomez-Izquierdo et al.84 modelaron las preferencias de los usuarios para comportamientos sincronizados. La adaptación personalizada puede formalizarse como:

donde wi son pesos de preferencia aprendidos. Implementaciones como RFIS logran la reidentificación de personas en tiempo real y el reconocimiento de gestos en el borde85, mientras que las interfaces táctilespropioceptivas 10 permiten una comunicación física intuitiva. Los efectos de la percepción social modulan aún más los resultados de personalización, donde la identidad del narrador desplaza el tiempo de respuesta del usuario y la duración dela expresión 86. Así, la personalización transforma a los usuarios de receptores pasivos a co-diseñadores, moldeando la interacción mediante la adaptación mutua.
Aunque gran parte del trabajo revisado sigue en prototipos de investigación, varias técnicas multimodales de IRH han pasado de prototipos de investigación a aplicaciones comerciales o industriales. El robot Pepper de SoftBank, por ejemplo, integra el reconocimiento de voz, gestos y expresiones faciales para el servicio al cliente y la educación en entornos minoristasy educativos 87. El Robot de Apoyo Humano de Toyota emplea la fusión visión-gesto para tareas de asistencia en hogares e instalacionessanitarias 88. Estas implementaciones comerciales suelen simplificar las estrategias de fusión, utilizando típicamente enfoques tardíos o híbridos con alternativas basadas en reglas para garantizar fiabilidad y bajo coste, lo que subraya la persistente brecha entre los modelos académicos avanzados y las soluciones industriales escalables. Cerrar esta brecha requerirá un mayor énfasis en el despliegue de los bordes y una validación rigurosa en el mundo real.
Desafíos para una comunicación fluida en HRI
A pesar de los avances en la detección multimodal y la fusión, mantener una comunicación humano-robot sin interrupciones fuera de entornos controlados sigue siendo difícil. Los modelos que destacan en laboratorios suelen desgradarse en medio de ruido, retraso, oclusión, cambios de intención o límites de recursos. La literatura converge en seis barreras entrelazadas: integración visión–lenguaje, sincronización en tiempo real, robustez multimodal, precisión semántica, cobertura de conjuntos de datos y restricciones de despliegue.
Integración del lenguaje visual
La comprensión visual sustenta el lenguaje y la acción anclados. Los pasos fundamentales mejoraron la consistencia espacial y la abstracción mediante SLAM visual-inercial sin inicializaciónmanual 89, reidentificación más fusión de sensores para seguimiento robusto aoclusión 16, predicción de gráficos de carril90, segmentación semi-supervisada que alinea etiquetas con utilidad de navegación, y vídeo egocéntrico con SLAM y segmentación a gran escala para lanavegabilidad 26. El mapeo consciente de la incertidumbre sigue siendo central: uPLAM fusiona localización probabilística con segmentación panóptica para escenasdinámicas 91, mientras que Clio construye de forma adaptativa grafos jerárquicos 3D de escenas basados en CLIP para semántica sensible ala tarea 30. Los enfoques de grounding evolucionaron desde descripciones estructuradas y APIs de percepción92,93 hasta codificadores y decodificadores multimodales 94,95.
Las instrucciones que se siguen en entornos abiertos integran percepción y razonamiento. RobotGPT35 yGroundingGPT 36 interpretan comandos mediante inferencia visual-lingüística acoplada; SayPlan, LFG y LLM-Planner alinean la navegación y planificación con el lenguaje de tierra34,44. Para reducir las alucinaciones e imponer la consistencia semántica, GLAM y Vtimellm introducen los objetivos de alineación96,97, mientras que los marcos adaptativos validan las salidas de LLM frente a lapercepción 98,99. El tiempo moldea críticamente la legibilidad: optimizar el gesto mejora laprevisibilidad 9; El aprendizaje por refuerzo reduce el retraso audiovisual en las canalizacionesemocionales 2; el entrainment gestual aumenta la fluidezpercibida al 100; y revisa las herramientas de LSTM, DTW y GAN para laalineación 101. En general, la fluidez exige un bucle consciente de la latencia entre percepción, fusión y respuesta, donde mimetismo30 y predicción inspirada en cerebelosos102 del tiempo de coordenadas, como también se ilustra en los bucles de temporización a nivel de sistema en la Figura 10.
Percepción en tiempo real entre modalidades
La fluidez depende de un retardo acotado de extremo a extremo a través de corrientes heterogéneas. TACTO ofrece retroalimentación táctil de alta resolución con baja latencia para manipulación responsiva. Las manos impulsadas por tendones logran un juego interactivo rápido mediante la visión de eventos y la inferencialigera 103, como se muestra en la Figura 11. Para visión–lenguaje–acción, acoplar CLIP con GraspNet acelera el agarre enclutter 104. Los transformers soportan clasificación rápida de gestos hápticossociales 11. Los modelos audiovisuales optimizados para el borde mantienen una inferenciainferior a un segundo 24. El tiempo preciso de movimiento de cabeza mejorael compromiso en 105. En conjunto, estos resultados defienden la fusión sincronizada, políticas de tampón adaptadas por modalidad y una atención ligera para preservar la coadaptación temporal. La latencia aceptable varía significativamente según el dominio de la tarea. En el diálogo social o el reconocimiento emocional, los retrasos inferiores a 200–300 ms mantienen la fluidez percibida y la interacción natural. Las tareas de asistencia como la transferencia de objetos o la detección de caídas exigen restricciones más estrictas (50–150 ms) para garantizar seguridad y capacidad de respuesta. La teleoperación o la manipulación colaborativa suelen requerir una latencia inferior a 100 ms para evitar la desorientación del operador o el mareo, mientras que las aplicaciones de navegación o monitorización pueden tolerar entre 300 y 500 ms sin impacto crítico.
Desafíos temporales y de procesamiento semántico
La desalineación y la latencia erosionan la confianza y la eficiencia de las tareas, especialmente en sistemas distribuidos teleoperador–robot–humano106. Las estrategias perceptuales e interfaciales ayudan a los usuarios a tolerar el retraso: gestos corporales y rellenos noléxicos 107, superposiciones visuales y señales adaptativas 108,109,110,111. La predicción a nivel de control acorta las brechas de respuestaen 102. Las canalizaciones de diálogo paralelas se solapan con la generación de relleno, la síntesis de voz y la edición de prompts para reducir el retraso percibido, como en112 y la Figura 12. Los estudios de sistemas descomponen la latencia acumulada a través de captura, codificación/decodificación, redes, decisión yactuación 113. Como se muestra en la Figura 13, la latencia se introduce mediante la captura del sensor, la codificación y decodificación de vídeo, la transmisión en red, el procesamiento del operador y la actuación del vehículo, formando un complejo bucle de retroalimentación bidireccional. Syntalos proporciona sincronización de milisegundos para experimentos en lazocerrado 114. En los intercambios afectivos, la imitación facial en tiempo real mejora lasincronía 23. Los dominios sensibles al retardo, como la cirugía remota, demuestran que anclar la háptica frente a la visión retardada apoya precisión y capacidadde respuesta 115. Como se muestra en la Figura 14, anclar la retroalimentación háptica llevó a un mejor rendimiento y a una mayor sensación de respuesta.
Los efectos de grano fino y el reconocimiento de intenciones siguen siendo un reto. Las microexpresiones, prosodia, mirada y movimiento anticipatorio suelen ocurrir de forma breve y asincrónica. El emo produce expresiones faciales anticipatorias alineadas con el estadodel usuario 116. El lenguaje corporal por sí solo transmite intención donde no hay rostro ni vozdisponibles. Las exhibiciones multimodales basadas en pimiento combinan clasificación verbal con gestos expresivos y emojis para la sincroníaemocional 118. El RL online refuerza la fusión de los flujos faciales yvocales 2, mientras que la imitación ligera soporta despliegue debordes 30. Las cuestiones abiertas incluyen el efecto de grupo, la variación cultural y la deriva temporal del efecto.
La generalización en dominios abiertos también es limitada. El aprendizaje por refuerzo a partir de retroalimentación humana (RLHF) presenta recompensas escasas y fragilidad bajo entradas fuera de distribución119. RoboAgent combina razonamiento espacial con fundamento lingüístico para transferencia entretareas 29. Razonamiento mediante Datos Libres de Acción (RAD) aprovecha vídeo pasivo y lenguaje para capacidades de cero toma sin etiquetasmanuales 120. Perceptor-Actor a tierra las propiedades de los objetos para manipular elementos desconocidos121. La alineación continua entre percepción y semántica en RobotGPT y GroundingGPT mejora el razonamiento adaptativo, pero aún enfrenta desafíos de retroalimentación en tiemporeal 35,36.
Robustez multimodal y variabilidad ambiental
La robustez debe abarcar la integridad de la señal y la consistencia conductual. SimuMuHRI inyecta ruido específico de la modalidad y la pérdida de combustible para probarla resiliencia 122. La simulación de luz estructurada físicamente conectada a tierra mejora la fiabilidad RGB-D bajo iluminación yoclusión 123,124. El acoplamiento latencia–háptico expone sensibilidad en manipulaciónremota 125. Los principios de redundancia y resiliencia térmica de sistemas energéticos críticos para la seguridad informan la HRItolerante a fallos 126,127.
La coherencia conductual es igualmente vital. La descoordinación voz-apariencia reducela confianza 128, y el movimiento errático pero correcto socavala cooperación 129. El control adaptativo de fuerzas basado en observadores y los controladores de interacción robusta mantienen la estabilidad bajo incertidumbres estructuradas y noestructuradas 130,131. La cobertura de conjuntos de datos también limita el progreso. Los conjuntos de datos de percepción Multiobot—OPV2V132, CoPeD133, CSE134 y AgiBot WorldColosseo 55—amplían la detección colaborativa a través de la simulación y el campo. Los recursos AV-HRI — CHiME-5135 con el desafío CHiME-8136 posterior, AVA-ActiveSpeaker45, AFFECT-HRI5 y SAVEn-Vid46 — permiten el seguimiento de ASR, actividad del hablante, afecto e instrucciones de contexto largo. Los referentes sociales a gran escala — HumorHRI47, THÖR-MAGNI137, RW4T138 e InViG139 — se dirigen al humor, la navegación, el equipo y el grounding interactivo. A pesar de la amplitud, muchos conjuntos de datos son específicos de dominio o scriptados, con una profundidad temporal limitada para evaluar la fluidez, como se resume en la Tabla 3.
Evaluación de la fluidez
Las métricas convencionales como la precisión y la latencia no capturan completamente la coadaptación, la predicción mutua ni la fluidez social. Los nuevos evaluadores califican la coherencia contextual y la colaboracióncon 140, integran la retroalimentación de los usuarios y las señales situacionales141, y añaden predictibilidad, coordinación y comodidad a la HRIfísica 84. Los marcos de equipo cuantifican la anticipación compartida74, mientras que los gemelos digitales registran la calibración de confianza y la fluidez enequipo 142. Sigue siendo una necesidad abierta un referente unificado que fusione la sincronización temporal, la alineación afectiva y la fluidez centrada en el usuario.
Los esfuerzos hacia la estandarización en la evaluación multimodal de HRI siguen siendo limitados y fragmentados. Iniciativas destacadas como los CHiMEchallenges 135.136 han avanzado en estándares para el reconocimiento audiovisual de voz, especialmente en términos de robustez acústica. Conjuntos de datos como THÖR-MAGNI137 y RW4T138 proporcionan recursos compartidos para la captura de movimiento y los comportamientos de equipo. Sin embargo, aún no existe un protocolo unificado ampliamente adoptado para la sincronización temporal entre modales, la fluidez de interacción o la alineación afectiva entre diversas modalidades y dominios. Esta ausencia de métricas estandarizadas sigue dificultando la reproducibilidad y la comparabilidad, subrayando la necesidad de establecer referencias impulsadas por la comunidad.
Del laboratorio al despliegue real
El rendimiento suele degradarse en entornos no estructurados debido a irregularidades sensoriales, cambios en la intención y cuellos de botellainformáticos 143. Esta degradación del rendimiento pone de manifiesto una brecha persistente entre entornos de laboratorio y del mundo real. En entornos controlados, la fusión híbrida y basada en la atención destaca, ofreciendo alta precisión y baja latencia para tareas como manipulación de objetos o comprensión de escenas. Sin embargo, los despliegues en el mundo real cuentan otra historia. Los robots de asistencia en el cuidado de personas mayores, los sistemas de acompañamiento en hogares y las herramientas educativas en las aulas suelen enfrentarse a ruidos, oclusión, cambios de iluminación y comportamientos impredecibles de los usuarios que erosionan la eficacia. Los enfoques de fusión tardía tienden a resultar más fiables bajo condiciones variables y asíncronas, mientras que los modelos híbridos, a pesar de sus fortalezas en adaptación afectiva y contextual, pueden verse limitados por demandas computacionales en dispositivos de borde. Muchas implementaciones de campo exitosas aún incorporan redundancias más simples o salvaguardas basadas en reglas para la fiabilidad, lo que subraya que pasar de demostraciones prometedoras en laboratorio a un rendimiento robusto en el día a día sigue siendo un desafío formidable. Las pruebas ecológicamente válidas son esenciales para identificar qué técnicas realmente tienen éxito más allá de los experimentos controlados. Los controladores adaptativos robustos mantienen la precisión de la fuerza en medio de la perturbación131. La planificación colaborativa impulsada por LLM actualiza los objetivos a medida que la intención del usuarioevoluciona 144. Las superposiciones visuales y la retroalimentación consciente de la latencia ayudan a mantener la conciencia del operador bajo enlacesdegradados 107,109. La supervisión ligera con LoRa y sombras digitales permite la monitorización en campos de bajo anchode banda 145. La experiencia en robótica espacial destaca que la autonomía debe coevolucionar con la cognición humana bajo la incertidumbre yel retraso 146.
Las limitaciones de recursos moldean la viabilidad. El reconocimiento de efectos y táctil basado en sonido funciona con menos de 1 MB y 0,7 GFLOPs para plataformas de bajapotencia 12. Añadir funciones sociales puede mejorar la presencia, pero corre el riesgo de sobrecarga cuando los retrasosaumentan 147. La programación y la selección de características deben equilibrar la demanda cognitiva conla continuidad 148. La mitigación de latencia abarca percepción, control y redes tal y como está organizada en 113. Los usuarios suelen preferir una interacción transparente y estable a la máxima eficiencia en las tareas, reforzando que la HRI sin interrupciones debe priorizar la capacidad técnica junto con la comodidadhumana 149,151. En distintos ámbitos, los despliegues en el mundo real muestran preferencias distintas: las aplicaciones sociales y educativas suelen depender de la fusión híbrida visión-audio para el diálogo afectivo, mientras que las tareas asistenciales y colaborativas favorecen combinaciones de visión-háptica con fusión tardía o temprana para una interacción física precisa. Estos patrones se alinean con las estrategias resumidas—priorizando la fusión tardía para la robustez en entornos variables y la adaptación híbrida/basada en la atención para una adaptación contextual más enriquecida—aunque la simplificación para la fiabilidad sigue siendo común.
Access restricted. Please log in or start a trial to view this content.
Esta reseña tiene varias limitaciones. Restringir la búsqueda a publicaciones en inglés en la Web of Science Core Collection puede haber introducido sesgo en el idioma y excluido trabajos relevantes que no son ingleses. Centrarse en artículos revisados por pares de 2015 a 2025 también podría reflejar sesgo de publicación, pasando por alto preprints, literatura gris o resultados emergentes no publicados. La revisión manual de los 148 artículos, aunque guiada por criterios explícitos, implica inevitablemente cierta subjeti...
Access restricted. Please log in or start a trial to view this content.
Los autores declaran que no tienen ningún conflicto de interés.
Este trabajo fue apoyado por la Universiti Sains Malaysia, subvención puente con el Proyecto Nº R501-LR-RND003-0000001342-0000.
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission