$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Предлагаемая архитектура для усиления сотрудничества человека и ИИ использует адаптивный мультимодальный конвейер взаимодействия, объединяющий видение и речевые модальности в динамичной, иерархической структуре рассуждения. В этом исследовании использовались общедоступные данные ранее опубликованных экспериментов. Новых человеческих субъектов не было вовлечено, и дополнительное этическое одобрение не требовалось.
Предлагаемая архитектура адаптивного мультимодального взаимодействия
В основе системы система начинается с модулей восприятия, таких как визуальный поток фиксирует позу и движение пользователя с помощью RGB-D-датчиков, а аудиопоток анализирует речевые входы с помощью легкого ASR (автоматического распознавания речи). Такие сырые входы подаются в модуль предсказания действий на базе Transformer, который кодирует временные зависимости в последовательности поз и команд для рассуждений о низкоуровневых человеческих действиях. Впоследствии, для обеспечения высокоуровневого планирования сотрудничества, механизм динамического искажения времени (DTW) выравнивает обнаруженные действия с узлами заранее определённого графа задач для прогнозирования целей пользователя и следующих действий. Новый модуль синтеза, основанный на внимании, на каждом этапе времени определяет, какой модальность (аудио или визуализация) даёт наиболее контекстно важную информацию, и динамически корректирует веса входов. Для индивидуализации взаимодействия система включает адаптацию онлайн-моделей, адаптируя предикторы действий в реальном времени к изменяющемуся поведению пользователя. Лёгкий модуль объяснимости также создаёт удобные для пользователя резюме предсказанных намерений и решений ИИ для повышения прозрачности и доверия. Вся система тестируется в симулированной, но реальной кооперативной среде сборки, что позволяет сравнивать между унимодальными и адаптивно-мультимодальными средами. Такой подход способствует более адаптивному, интуитивно понятному и надёжному сотрудничеству с агентами ИИ во всех областях.
Рисунок 1 показывает архитектуру описанной Адаптивной мультимодальной рамки взаимодействия, направленной на улучшение сотрудничества между человеком и ИИ. Она начинается с фазы получения входов, которая основана на двух основных сенсорных устройствах: RGB-D для наблюдения визуальной информации с глубиной (например, осанки и движения человека) и направленном микрофоне для сбора речевых команд. Сырые сигналы затем проходят через модуль предварительной обработки, который обрабатывает аудиовизуальные данные для последующего анализа путём очистки, нормализации и форматирования входных потоков. Затем конвейер переходит к фазе извлечения признаков, где данные делятся на два потока: визуальный поток, который выделяет признаки позы и движения с помощью алгоритмов оценки позы, и аудиопоток, транскрибирующей речь в интерпретируемые вложения команд. Мультимодальный кодировщик трансформеров, использующий многоголовное самовнимание и временное позиционное кодирование для выражения долгосрочной взаимозависимости между последовательностями взаимодействия, затем обрабатывает слитое представление. Текущее целевой состояние пользователя оценивается с помощью долгосрочного прогноза намерений и прогресса задачи, а низкоуровневые действия отображаются с узлами в иерархическом графе задач для надёжного отслеживания задач с помощью модуля выравнивания на базе DTW. Веса слияния и параметры прогноза постоянно обновляются через онлайн-цикл адаптации модели в ответ на обратную связь взаимодействия, а модуль объяснимости предоставляет чёткие объяснения для повышения открытости и уверенности. Весь конвейер позволяет системе адаптивно и эффективно работать вместе с пользователями над динамическими задачами и средами.

Рисунок 1: Обзор предлагаемой мультимодальной структуры взаимодействия на основе трансформеров. Используется техника с фокусом внимания для кодирования и динамической интеграции визуальных и слуховых данных. Модуль Transformer, интегрирующий иерархическое моделирование задач и онлайн-адаптацию, обрабатывает слитое представление для долгосрочного прогнозирования намерений и оценки прогресса задачи. . Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Предлагаемая система включает лёгкий модуль объяснимости, который работает в тандеме с компонентами мультимодального слияния и иерархического планирования для повышения прозрачности и уверенности пользователей. Модуль выводит интерпретируемые сигналы из выравнивания графов задач на основе DTW (например, текущий прогресс задачи и ожидаемое следующее действие) и слоя слияния, основанного на внимании (например, веса важности модальности). Эти сигналы преобразуются в понятные для человека объяснения, например, влияли ли в первую очередь устные команды или визуальные жесты на выбор системы и как ожидаемое действие вписывается в более широкий рабочий план. Пользователи получают объяснения в виде краткой письменной или визуальной обратной связи, что помогает им понять, предсказать и, при необходимости, исправлять поведение системы. Улучшение удовлетворенности пользователей, плавность взаимодействия и метрики, связанные с доверием, показаны в оценке, являются косвенными индикаторами восприятия объяснимости пользователями. Результаты свидетельствуют о том, что в долгосрочном взаимодействии человека и ИИ прозрачное рассуждение при принятии решений ИИ повышает уверенность пользователей, способствует сотрудничеству и повышает принятие адаптивного поведения системы.
Входные данные
Получение входных данных в задуманной структуре сотрудничества между человеком и ИИ осуществляется с помощью структурированного мультимодального сенсорного механизма, который сочетает как зрение, так и слуховые методы для эффективной реализации человеческих действий и намерений. Визуальный ввод осуществляется с помощью RGB-D-камеры, которая в реальном времени фиксирует позу человека, пространственное положение и контекст окружающей среды. Визуальные данные обрабатываются с помощью предварительно обученных моделей, таких как BlazePose, чтобы получить ключевые точки в верхней части тела для задач взаимодействия. Одновременно слуховая информация получается с направленного микрофона и интерпретируется с помощью предварительно обученной модели DeepSpeech для выявления речевых команд, которые уточняют или предоставляют дополнительные неопределённые визуальные сигналы. В кооперативных условиях система двойного входа обеспечивает динамическую адаптацию и восприятие контекста. Набор данных по обучению и оценке включает более 5 000 мультимодальных траекторий движения человека, 1 для различных взаимодействий, таких как сборка и передача поведения, собранных у четырёх пользователей в контролируемых и полуструктурированных условиях. Для улучшения обобщения система обеспечивает онлайн-адаптацию модели при развертывании, что позволяет модели обновлять свои прогнозы в реальном времени в зависимости от меняющегося поведения пользователя и динамики окружающей среды.
Описание набора данных
Набор данных для обучения и оценки предложенной структуры был получен в результате реальных экспериментов по совместной работе человека и робота в рамках задачи сборки игрушечного автомобиля с использованием робота KINOVAGEN3 1. Экспериментальная среда была направлена на имитирование долгосрочных совместных действий, включающих мультимодальное взаимодействие, включающее как визуальные, так и слуховые модальности. В частности, обучающий набор данных состоит из 3003 последовательностей траекторий от двух пользователей, а тестовый набор содержит 2088 последовательностей, включая данные двух новых пользователей для оценки обобщения моделей. Каждая траектория фиксирует пятишаговую последовательность ключевых точек поз верхней части тела, полученных с помощью BlazePose, а также соответствующие команды речи, расшифрованные DeepSpeech33. Собранные данные отражают естественные человеческие вариации в выражении жестов и команд при действиях, включая доставку объектов, использование инструментов и совместные действия. Мультимодальный набор данных служит основой для контролируемого обучения моделей прогнозирования действия и траектории DLinear и является центральным ориентиром в пользовательских исследованиях, проводимых в условиях только зрения, аудио и мультимодальных режимов. Включение различных типов пользователей и реалистичных условий шума гарантирует надёжность и адаптивность тестирования для постоянных систем HRC. В таблице 2 приведено подробное описание набора данных.
| Атрибуты | Подробности |
| Название набора данных | Набор данных по сборке игрушечных автомобилей (собран внутри компании) |
| Среда коллекции | Реальный эксперимент HRC с рукой KINOVA GEN3 |
| Количество пользователей (обучение) | 2 пользователя |
| Количество пользователей (тестирование) | 4 пользователя (2 из тренировочного набора, 2 невидимых) |
| Общие траектории (тренировки) | 3 003 траектории |
| Общие траектории (тестирование) | 2 088 траекторий |
| Захваченные методы | Визуальный (RGB-D для позы), аудио (команды речи) |
| Формат данных | Ключевые точки позы (из BlazePose), команды преобразования речи в текст |
| Временное разрешение | Каждая траектория включает 5-временные шаги |
| Выполненные задачи | 3 основные задачи: выбор и размещение, вращение объектов, совместная сборка |
| Использование | Контролируемое обучение моделей прогнозирования действий/траекторий; Пользовательское исследование |
Таблица 2: Описание набора данных. Информация о среде симуляции, включая фреймворк программирования, настройки аппаратного обеспечения и среду оценки.
Предварительная обработка набора данных
Для обеспечения адаптивного мультимодального взаимодействия в сотрудничестве человека и ИИ, исходный набор данных, такой как визуальные (RGB и глубинные изображения), слуховые (речевые команды) и временные данные поведения (ключевые точки положения), подвергается структурированной предварительной обработке. Визуальные данные сначала извлекаются моделлюоценки позы f pose, обычно полученной из BlazePose или OpenPose. Для кадра t вектор позы человека определяется как:
(1)
где k — количество ключевых точек, а каждая ключевая точка содержит двумерные координаты. Последовательности нормализуются по длине торса и со временем сглаживаются фильтром Савицкого-Голея:
(2)
где w — размер окна фильтрации. Во-вторых, сырые аудиопотоки At разрезываются на сегменты с помощью детектора голосовой активности (VAD). Достоверные сегменты подаются в модель распознаванияречи (например, DeepSpeech) для извлечения командных токенов:
(3)
где V — словарный запас распознанных команд. Для интеграции командные токены для всех выравниваются по времени с визуальными временными метками поз с помощью функции выравнивания на основе интерполяции τ:
(4)
В-третьих, для формирования последовательностей
тренировки временного намерения мы определяем последовательности траектории , а также связанные речевые команды
. Они разделены на сегменты фиксированной длины с использованием скользящих окон размера l:
(5)
(6)
Наконец, входные данные нормализуются до нуля среднего и единичного дисперсии на ключевую точку для сходимости в моделях предсказания на основе траекторий:
(7)
где μj, σj — среднее и стандартное отклонение ключевой точки j, завершившей обучающий набор.
Извлечение признаков
В очерченной парадигме адаптивного мультимодального взаимодействия возможно сильное и в реальном времени сотрудничество за счёт сочетания визуальных, аудио и контекстных характеристик задачи. Конвейер извлечения признаков начинается с одновременного сбора данных из двух основных модальностей: визуальных
и аудиосигналов
, индексируемых на шаге времени t. Эти наблюдения проходят через соответствующие модули восприятия для получения высокоуровневых семантических признаков, относящихся к человеческому поведению, намерению и команде речи.
Извлечение визуальных признаков
Исходные визуальные данные
с RGB-D-камер подаются через оценщик позы человека (например, BlazePose), предоставляющий пространственный вектор
ключевых точек , где k представляет обнаруженное количество ключевых точек, а каждая содержит 3D-координаты:
(8)
Эти ключевые точки встраиваются во время в траекторию
позы, из которой динамика движения извлекается посредством декомпозиции по тренду и сезону:
(9)
где ∈_t представляет остаточный шум.
Извлечение аудиофункций
Аудиовход
обрабатывается через заранее обученную модель распознавания речи (например, DeepSpeech) и создаёт токенизированное представление
команды , где n — длина токена:
(10)
Мультимодальное слияние
Для построения единого контекста взаимодействия мы объединяем признаки с помощью доверительно взвешенного внимания, основанного на уверенности и взаимной информации:
(11)
где φV и φA — функции проекции для визуальных и слуховых признаков в общем латентном пространстве, а αt∈[0,1] — динамический модально-весительный термин, вычисляемый на основе энтропии:
(12)
Здесь
и
— взаимная информация между целевым состоянием g и наблюдаемыми модальностями.
Планирование с использованием контекстного вложения
Последний мультимодальный вектор признаков Ft обогащается контекстом задачи ипрогрессом задачи P t и становится входным состоянием для модуля адаптивного планирования:
(13)
Эта извлечённая функция xt используется как входные данные для моделей дальнейшего прогнозирования намерений и планирования движения, поддерживая адаптивное и надёжное сотрудничество человека и ИИ в динамических и неопределённых условиях.
Прогнозирование действий и планов с помощью выравнивания графа задач
После мультимодального процесса извлечения признаков, при котором в последующей обработке интегрируются намерения речи (аудио), траектория позы (визуальная) и контекстная (например, журналы задач или эмоции), адаптивное предсказание человеческих действий и вывод плана с использованием иерархического выравнивания графов задач.
Пусть интегрированный мультимодальный вектор признаков на шаге времени t будет представлен как:
(14)
Система изначально прогнозирует низкоуровневое действие человека с помощью функцииfact, которая часто представлена как рекуррентный энкодер-декодер или трансформатор:
(15)
где F(t-k:t) обозначает последовательность слияния признаков в последних k временных шагах, а
— прогнозируемое действие из множества действий A. Модуль онлайн настраивается с помощью адаптивных потерь:
(16)
Здесь CE — это кросс-энтропийная потеря классификации действий, тогда второй член подталкивает к хорошему прогнозированию будущей траектории.
Для высокоуровневого прогнозирования плана мы формулируем задачу как прогрессию вдоль иерархического графа задачи G = (N, E), где каждый узел ni ∈N обозначает подзадачу или промежуточную цель. Цель — сопоставить наблюдаемую последовательность действий с эталонным путём задачи R*∈G, уменьшая расстояние:
(17)
Где Pt обозначает текущий след прогресса, а d(⋅) — метрику динамического искажения времени (DTW) или метрику мягкого выравнивания.
Конечный намерение на уровне
плана затем выводится путем проекции предсказанного действия a ̂_t на наиболее вероятный следующий шаг в выровненном пути
:
(18)
Такое иерархическое декодирование гарантирует, что даже при неясном или шумном сенсорном вводе система выбирает наиболее контекстно релевантное высокоуровневое намерение, соответствующее текущей последовательности задач. Такое предиктивное планирование не только повышает эффективность сотрудничества, но и повышает ожидание и адаптивность в многоповоротном взаимодействии человека и ИИ.
Мультимодальный слияние (основанный на внимании) механизм
В адаптивном сотрудничестве человека и ИИ мультимодальная интеграция нескольких сенсорных модальностей (например, визуальная: человеческая поза, траектория; слуховая — речевые команды) необходима для правильной интерпретации намерения пользователя. Подход, основанный на правилах или статическом слиянии, не справляется с реальными динамичными человеческими взаимодействиями. Для этого здесь представлен механизм слияния, основанный на внимании, который динамически взвешивает каждую модальность в зависимости от её контекстуальной важности на каждом этапе времени.
Обозначает извлеченные векторы признаков из визуальной и аудиомодальности как
и
, соответственно. Эти векторы кодируют семантическую информацию, полученную через более ранние процессорные конвейеры, например, визуальные признаки могут возникать в результате оценки позы и предсказания действий, а аудиопризнаки — из вложений речи с помощью моделей, таких как DeepSpeech или wav2vec.
Цель слияния, основанного на внимании, — рассчитать специфические по модальности веса внимания, отражающие относительную значимость каждой модальности. Это делается с помощью механизма мягкого внимания.
Вычисление по весу внимания
На первом этапе оба вектора трансформируются в пространство общего внимания через обучаемую трансформацию. То есть для каждой модальности i∈{V,A} промежуточный балл внимания рассчитывается как:
(19)
где
и
— параметры, изучаемые по сети внимания, а Tanh — нелинейная функция активации. Это преобразование позволяет модели извлекать высокоуровневые корреляции и контекстную значимость каждой модальности.
Эти ненормированные оценки внимания eV иα A затем нормализуются с помощью функции softmax, так что сумма составляет 1
(20)
Здесь αV и αA — это вес внимания над визуальными и аудиомодальностями соответственно. Веса адаптивны и обновляются со временем в зависимости от текущего контекста задачи, качества сигнала и активности пользователя.
(21)
Полученное слитое представление
получается в виде взвешенной комбинации векторов входной модальности:
Этот комбинированный вектор кодирует общую семантику визуальной и слуховой информации таким образом, что активно выделяет наиболее информативный поток. Затем он подаётся в последующие модули, такие как сопоставление графов задач, предсказание намерений или движок планирования движения роботов.
Алгоритм 1: слияние на основе мультимодального внимания
Вход: вектор визуальных признаков — hV∈R d, вектор аудиоэлементов — hA∈R d
Обучаемые параметры: W∈R k*d,w∈R k и b∈R k
Выход: сплавленное представление hfused∈rd.
Шаг 1: Определить промежуточные представления с помощью вычислений с помощью уравнения 19
Шаг 2: Используйте Softmax для нормализации оценок внимания с помощью уравнения 20
Шаг 3: Вычислите вектор слияния с помощью уравнения 21
Шаг 4: Вернутьh-сплавленный
Алгоритм Attention-Based Multimodal Fusion обеспечивает умное слияние функций различных входных модальностей, таких как визуальные и аудиопотоки, в контекстно-ориентированной форме. Слияние необходимо в системах, где каждая модальность представляет дополняющую, но вариативную информацию, например, в совместных условиях человека и ИИ, где зрение фиксирует жесты или положение тела, а аудио — речевые команды или голосовые сигналы.
Алгоритм 1 начинается с определения промежуточных представлений для каждой модальности. Для вычисления обеих моделей — eV для визуального потока и eA для аудиопотока — слой общей нейронной сети сначала выполняет нелинейное преобразование соответствующих векторов признаков. Затем веса внимания αV и αA рассчитываются с помощью функции softmax над промежуточными баллами. Это помогает весам быть положительными и суммироваться в 1, фактически нормализуя вклад каждой модальности. Чем более информативна модальность, как это смоделировано, тем выше её внимание.
В конечном итоге алгоритм вычисляет слитое изображение h,сплавленное через взвешенную комбинацию графических и аудиовекторов признаков, нормализованную с учетом соответствующих весов внимания. Этот сплавленный вектор объединяет оба режима в контекстно-ориентированном на данные и используется для последующих задач, таких как распознавание намерений, принятие решений или планирование движений роботов. В целом этот алгоритм позволяет системе динамически фокусироваться на наиболее релевантной модальности или комбинации модальностей в конкретный момент, вместо использования фиксированных или основанных на правилах методов слияния. Это делает фреймворк более прочным, гибким и отзывчивым в динамических ситуациях взаимодействия человека и ИИ.
Рисунок 2 иллюстрирует рабочий процесс механизма мультимодального слияния на основе внимания, который работает в контекстно-зависимой интеграции визуальных и слуховых входов. Визуальное извлечение признаков, первый этап в рабочем процессе, включает извлечение пространственных или связанных с позами признаков из входных изображений или видео (например, RGB-D-камер). Затем они вводятся в модуль визуального внимания, который учится выделять наиболее информативное содержание визуальной информации. Параллельно модули Audio Attention обрабатывают вложения речи или аудиотокены из устных команд, придавая контекстное значение различным слуховым сигналам. Полученные элементы, взвешенные по уровню внимания, интегрируются через слой синтеза на основе внимания и передаются в позиционную сеть с остаточными соединениями и нормализацией слоёв, формируя стандартный блок кодировщика трансформатора. Результат представляет собой унифицированное мультимодальное вложение, поддерживающее надежное прогнозирование намерений с долгосрочным горизонтом и адаптивное принятие решений при различных условиях взаимодействия. Такая конструкция позволяет системе избирательно концентрироваться на более надёжной модальности в любой момент, повышая устойчивость и интерпретируемость в реальном времени взаимодействия человека и ИИ.

Рисунок 2: Детальная конструкция мультимодального модуля термоядерного синтеза с фокусом внимания. Для создания контекстно-ориентированного слияного представления на каждом этапе времени модально-специфические энкодеры собирают признаки из визуальных и звуковых потоков. Эти признаки затем динамически взвешиваются с помощью механизма внимания, основанного на данных. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Адаптация онлайн-моделей
Для обеспечения высококачественного сотрудничества человека и ИИ в различных моделях поведения и контекстах пользователей наш фреймворк включает онлайн-механизм адаптации моделей, который постепенно оптимизирует пользовательские модели во время взаимодействия. Модуль отслеживает поведенческие сигналы в реальном времени (например, поза, траектории жестов, тон речи) и обновляет базовые предиктивные модели с помощью алгоритмов инкрементального обучения. В частности, модели предсказания траектории и распознавания намерений тонко настраиваются с учётом последних данных с помощью градиентной тонкой настройки или низкоранговой адаптации (LoRA), чтобы система могла адаптироваться к изменяющемуся поведению пользователя или требованиям конкретных задач без полного переобучения.
Слой обратной связи взаимодействует с адаптацией как через неявную обратную связь (например, исправления, задержки, задержки), так и явные команды (например, речь или графический интерфейс). У него две цели: адаптивная калибровка значимости мультимодальных сигналов и передача мер доверия/доверия модулям принятия решений и управления.
Цикл обратной связи обеспечивает более плавное выполнение задач и ориентированные на пользователя ответы. Для укрепления доверия и прозрачности фреймворк интегрирует модуль объяснимости, который превращает низкоуровневые решения моделей в понятные человеку обоснования. Он использует отображения рационализации из мультимодального термотрансформатора, дополненные логическим трассированием через граф задач. По желанию он может представить это обоснование через графический интерфейс или аудиопомощник, чтобы пользователи могли понять и, возможно, даже скорректировать поведение системы.