Atteindre une collaboration humain-IA efficace et naturelle reste un défi majeur, en particulier dans des environnements dynamiques et réels. Les cadres existants sont souvent limités par les entrées rigides monomodales ou la fusion multimodale basée sur des règles, ce qui limite leur robustesse, personnalisation et adaptabilité. Cette étude introduit un cadre d’interaction multimodale adaptative qui intègre l’estimation de la posture basée sur la vision et la compréhension des commandes par parole au sein d’un modèle hiérarchique de prévision de l’intention humaine. Le cadre utilise des modèles de séquences basés sur des transformateurs pour la prédiction d’action et la distorsion temporelle dynamique afin d’aligner le comportement humain avec les graphes de tâches structurés pour la planification à long terme. Contrairement aux approches précédentes qui reposaient sur le changement de modalité statique, notre architecture applique un mécanisme de fusion basé sur l’attention pour pondérer dynamiquement les entrées les plus informatives. De plus, un module d’adaptation en ligne permet un ajustement en temps réel du comportement de l’utilisateur, complété par une couche d’explicabilité légère pour favoriser la confiance des utilisateurs. L’évaluation expérimentale dans une tâche d’assemblage collaborative démontre des gains significatifs en performance de la tâche (jusqu’à 24 %), en la précision de la prédiction de l’intention (jusqu’à 18 %) et en la satisfaction des utilisateurs. Ces résultats mettent en lumière l’efficacité et la polyvalence des cadres d’interaction multimodale adaptative, soutenant leur potentiel à faire progresser l’intelligence collaborative vers des systèmes d’IA plus fiables, transparents et orientés vers l’humain.