Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de recherche

Concevoir des cadres d’interaction multimodale adaptatifs pour renforcer la collaboration humain-IA

425 vues

DOI :

10.3791/69830

24 février 2026

Dans cet article

Résumé

Ce travail propose un mécanisme d’alignement hiérarchique basé sur la distorsion temporelle dynamique (DTW) avec une adaptation en ligne et une fusion multimodale axée sur l’attention, permettant une prédiction fiable de l’intention à long terme et un suivi des tâches. Un module d’explicabilité léger améliore l’interprétabilité, favorisant la confiance dans la collaboration humain-IA. Cette approche se généralise à la fois aux systèmes robotiques et interactifs virtuels.

Résumé

Atteindre une collaboration humain-IA efficace et naturelle reste un défi majeur, en particulier dans des environnements dynamiques et réels. Les cadres existants sont souvent limités par les entrées rigides monomodales ou la fusion multimodale basée sur des règles, ce qui limite leur robustesse, personnalisation et adaptabilité. Cette étude introduit un cadre d’interaction multimodale adaptative qui intègre l’estimation de la posture basée sur la vision et la compréhension des commandes par parole au sein d’un modèle hiérarchique de prévision de l’intention humaine. Le cadre utilise des modèles de séquences basés sur des transformateurs pour la prédiction d’action et la distorsion temporelle dynamique afin d’aligner le comportement humain avec les graphes de tâches structurés pour la planification à long terme. Contrairement aux approches précédentes qui reposaient sur le changement de modalité statique, notre architecture applique un mécanisme de fusion basé sur l’attention pour pondérer dynamiquement les entrées les plus informatives. De plus, un module d’adaptation en ligne permet un ajustement en temps réel du comportement de l’utilisateur, complété par une couche d’explicabilité légère pour favoriser la confiance des utilisateurs. L’évaluation expérimentale dans une tâche d’assemblage collaborative démontre des gains significatifs en performance de la tâche (jusqu’à 24 %), en la précision de la prédiction de l’intention (jusqu’à 18 %) et en la satisfaction des utilisateurs. Ces résultats mettent en lumière l’efficacité et la polyvalence des cadres d’interaction multimodale adaptative, soutenant leur potentiel à faire progresser l’intelligence collaborative vers des systèmes d’IA plus fiables, transparents et orientés vers l’humain.

Introduction

La collaboration homme-robot (HRC) a été l’un des domaines de recherche importants, d’autant plus que les robots sont de plus en plus déployés dans des environnements centrés sur l’humain. Alors que les cadres et technologies pour la CRS à court terme se sont nettementaméliorés 1,2, la CRH à long terme n’est pas encore aussimature 3. Dans les applications industrielles, l’exploitation de la HRC à long terme peut entraîner une augmentation marquée de la productivité et de l’adaptabilité dans des processus de fabricationcomplexes 4....

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

L’architecture proposée pour augmenter la coopération humain-IA utilise un pipeline d’interactions multimodales adaptatives combinant la vision et les modalités de parole dans un cadre de raisonnement dynamique et hiérarchique. Cette étude a utilisé des données publiques issues d’expériences publiées auparavant. Aucun nouveau sujet humain n’a été impliqué, et aucune approbation éthique supplémentaire n’a été requise.

Architecture d’interaction multimodale adaptative proposée

Fondamentalement, le système commence par des modules de perception, tels que le flux vis....

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Le modèle d’interaction multimodale adaptative proposé ici répond à ces préoccupations et améliore considérablement la collaboration humain-IA en combinant de manière fluide les modalités de vision et de parole avec les processus d’adaptation utilisateur en temps réel. Contrairement au système multimodal hiérarchique de base, notre approche inclut une boucle de rétroaction personnalisée ainsi qu’une adaptation consciente de la charge cognitive qui offre une interaction plus intuitive et .......

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Les résultats démontrent de manière concluante l’efficacité suggérée sur la base d’interaction multimodale adaptative pour renforcer la collaboration humain-IA.

Outre les scores standards d’évaluation tels que le temps d’achèvement de la tâche (TCT), la précision de la prédiction de l’intention humaine (HIPA), l’efficacité de la fusion multimodale (MFE), le taux de récupération des erreurs (ERR), le score de satisfaction utilisateur (USS) et l’indice de fluidi.......

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs n’ont aucun conflit d’intérêts.

Remerciements

Les auteurs reconnaissent chaleureusement le soutien apporté par l’École de Design de l’Université Jiangnan, Wuxi, Chine.

....

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Appareil photo RGB-D (Intel RealSense D435)Intel CorporationD435Résolution de profondeur 1280 et fois ; 720 px @ 30 fps ; Résolution RVB 1920 et jours ; 1080 px @ 30 fps ; Utilisé pour capturer la posture de l’utilisateur, les mouvements du corps et le contexte spatial
Microphone directionnelGénérique / Plusieurs fournisseursN/AMicrophone large bande à réduction de bruit (16 kHz&ndash ; 44,1 kHz) ; utilisé pour collecter des commandes parlées
BlazePose (modèle pré-entraîné)Googlehttps://developers.google.com/mediapipe/solutions/vision/poseModèle d’estimation de pose avec 33 points clés ; Extraction en temps réel de la pose humaine
OpenPose (modèle pré-entraîné)Laboratoire de calcul perceptif de CMUhttps://github.com/CMU-Perceptual-Computing-Lab/openposeCadre d’estimation de pose multi-personne utilisé pour extraire les trajectoires de mouvement
Moteur ASR DeepSpeechMozillav0.9.3Modèle préentraîné de reconnaissance vocale automatique pour la transcription de la reconnaissance vocale en texte
Moteur ASR wav2vec 2.0Méta IAhttps://github.com/facebookresearch/fairseqModèle de représentation vocale auto-supervisée pour le traitement de la parole en temps réel
Modèle de prédiction d’action basé sur un transformateur (DLinear / Seq2Seq)Implémentation personnaliséeN/AArchitecture encodeur-décodeur temporel avec attention à la prévision d’actions à court terme
Module de distorsion temporelle dynamique (DTW)Personnalisé / basé sur SciPyhttps://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.distance.cdist.htmlAlgorithme d’alignement doux pour associer les actions utilisateur à des graphes de tâches prédéfinis
Réseau de fusion multimodale basé sur l’attentionImplémentation personnaliséeN/AMécanisme d’attention pondéré en confiance pour fusionner la vision et la parole
Module d’adaptation en ligne (LoRA / Basé sur le gradient)Implémentation personnaliséehttps://github.com/microsoft/LoRAAjustement fin léger et efficace en termes de paramètres pour s’adapter au comportement de l’utilisateur
Module d’explicabilité (Basé sur des règles + cartes d’attention)Implémentation personnaliséeN/AFournit une justification décisionnelle interprétable à l’aide de règles et de visualisations de l’attention
Bras robotique KINOVA Gen3KINOVA RoboticsGen3Manipulateur robotisé 7-DOF avec capteurs de couple intégrés ; Utilisé pour l’assemblage collaboratif de voitures-jouets
Environnement de simulation d’assemblage coopératifEnvironnement personnaliséN/AConfiguration réelle d’assemblage de voitures-jouets utilisée pour le benchmarking collaboratif multimodal
Indicateurs d’évaluation (TCT, HIPA, MFE, Latence, ERR, USS, ISI)Définitions personnaliséesN/AIndicateurs quantitatifs et centrés sur l’utilisateur pour évaluer l’efficacité, la précision et la confiance de la collaboration

Références

  1. Yu, P., Abuduweili, A., Liu, R., Liu, C. Robustifying long-term human-robot collaboration through a hierarchical and multimodal framework. arXiv. , (2024).
  2. Cheng, Y., Sun, L., Liu, C., Tomizuka, M. Towards efficient human-robot collaborat....

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Mots-clés

Cadres adaptatifsestimation de la posecompr hension des commandes vocalespr vision de l intentionmod les Transformerfusion d attentiond formation temporelle dynamiqueIA explicable