Этот обзор обобщает последние достижения в области глубокого обучения, мультимодального сенсора и стратегий интеграции, которые обеспечивают бесшовную, адаптивную и ориентированную на человека коммуникацию между людьми и роботами.
Обзорная статья
Этот обзор обобщает последние достижения в области глубокого обучения, мультимодального сенсора и стратегий интеграции, которые обеспечивают бесшовную, адаптивную и ориентированную на человека коммуникацию между людьми и роботами.
Бесшовная мультимодальная коммуникация между человеком и роботом стала необходимой, поскольку социальные, вспомогательные и образовательные роботы появляются в повседневных условиях, таких как дома, медицинские учреждения и классы, где им необходимо интегрировать речь, жест, взгляд, мимику и тактильные сигналы с высокой точностью, низкой задержкой и реальной надёжностью. В этом обзоре систематически анализируется, как современные методы достигают взаимного мультимодального взаимодействия человека и робота (HRI) в реальном времени, с акцентом на стратегиях слияния, архитектурах систем и приложениях в конкретных областях. С 2015 по 2025 год мы искали в основной коллекции Web of Science эмпирические исследования на английском языке, выбрав 148 статей, посвящённых коммуникативной интеграции. Наиболее важные открытия включают явный сдвиг в сторону гибридного и внимания-ориентированного слияния с 2022 года (около 43% подходов), который лучше справляется со временной асинхронностью и воплощёнными взаимодействиями, чем предыдущие методы; широкое несоответствие в метриках оценки, мешающее сравнению перекрёстных исследований; и устойчивый разрыв между сильными лабораторными показателями и более слабой реальной устойчивостью под шумом, окклюзией или изменчивостью пользователя. Ключевые задачи включают обработку в реальном времени, семантическое выравнивание, эффективность данных, надёжность развертывания и малоизученную интеграцию тактильных сигналов с аффектом. Смотря в будущее, обзор предлагает приоритизировать политики адаптивного слияния, стандартизированные бенчмарки синхронизации и беглости владения, а также постоянное обучение для обеспечения персонализированной адаптации пользователя. В конечном итоге её цель — направлять развитие более ориентированных на человека роботизированных агентов, которые могут взаимодействовать совместно, значимо и быть социально приемлемыми в повседневной жизни.
Роботы эволюционировали от промышленных инструментов в структурированных условиях до социально встроенных агентов в домах, больницах и классах. Теперь они помогают в обучении, терапии и общении, отражая переход от автоматизации, ориентированной на задачи, к ориентированному на пользователя адаптивному взаимодействию. В основе этого перехода лежит мультимодальная коммуникация, позволяющая роботам воспринимать и реагировать на человеческие сигналы — речь, взгляд, жесты, мимику и осязания — с временной точностью, необходимой для естественных обменов в динамичных условиях. Этот акцент на координации и отзывчивости соответствует ключевым вопросам взаимодействия человека и компьютера и когнитивной науки. В данном обзоре бесшовная мультимодальная коммуникация относится к взаимодействиям, которые кажутся пользователям плавными и интуитивными, характеризуются временем отклика менее секунды (обычно менее 300 мс), минимальными заметными задержками или несоответствиями, а также надёжной адаптацией к реальной вариативности. Это отличает её от традиционных командных или унимодальных систем, где ошибки в тайминге, сбои модальности или жёсткие реакции нарушают естественный поток.
В рамках взаимодействия человека и робота (HRI) этот обзор сосредоточен на коммуникации между человеком и роботом, определяемой как взаимный, в реальном времени обмен мультимодальными сигналами между людьми и роботами. Хотя HRI также включает планирование, контроль и безопасность, коммуникация связана с синхронизацией восприятия и действий через сенсорные каналы. Ранние командные системы ставили эффективность выше боя, часто вызывая жёсткое или задерживаемое поведение. Современные работы используют адаптивные, контекстно-ориентированные модели, учитывающие состояние пользователя иэмоции 1,2. Эта эволюция подчёркивает необходимость точных, интуитивно понятных и персонализированных рамок взаимодействия.
Начальные социальные и ассистентные роботы обычно опирались на скриптовые рутины или одномодальные входы, такие как голос или касание, что ограничивалогибкость 3. Логика, основанная на правилах, и медленная обработка часто приводили к несоответствию времени между жестами и речью или к плохой адаптации к поведению пользователя. Для решения этих проблем исследователи применяют синтез с низкой задержкой, мультимодальную сенсорную интеграцию и адаптивное к пользователю обучение 4,5. Эти стратегии можно понять через три основных принципа коммуникации, широко признанных в HRI: комплементарность (модальности компенсируют друг друга), избыточность (перекрытие повышает устойчивость) и синергия (сходимость повышает естественность).
Достижения в области восприятия и обучения привели к созданию социально отзывчивых роботов, которые интегрируют визуальные, слуховые, тактильные и физиологические сигналы в реальном времени 5,6. Вместо фиксированных скриптов эти системы постоянно адаптируются к пользовательским сигналам. Доступные программные интерфейсы и методы обучения на демонстрациях позволяют педагогам и терапевтам настраивать поведение для ухода и обучения, где необходимы точность, отзывчивость и адаптивность.
Модели коммуникации в социальном HRI можно сгруппировать на параллельные, дополняющие и интерактивные режимы (рисунок 1). В параллельном взаимодействии люди и роботы действуют независимо с минимальным обменом. Взаимодополняющее взаимодействие вводит структурированные подсказки или поддержку, основанную на событиях. Самый продвинутый, интерактивный режим включает непрерывную двунаправленную регулировку по каналам, таким как речь, движение и взгляд7.
Отбор и анализ литературы
Методология систематического обзора: Мы провели систематический поиск литературы в Web of Science Core Collection, ориентируясь на рецензируемые статьи и полные материалы конференций ведущих издательств (IEEE, ACM, Springer, Elsevier, Wiley, Taylor & Francis). Булевый запрос был: (("взаимодействие человека и робота" ИЛИ HRI) И (мультимодальный ИЛИ "слияние сенсоров" ИЛИ жест ИЛИ взгляд ИЛИ речь ИЛИ тактильный) И ("в реальном времени" ИЛИ "низкозадержка" ИЛИ адаптивный ИЛИ устойчивый)). Критерии включения: англоязычные публикации с января 2015 по 2025 год — период, посвящённый переходу от правилоориентированных систем с одной модальностью к архитектурам глубокого обучения с акцентом на низкое задержка, адаптивное и надёжное взаимодействие — с акцентом на мультимодальные методы интеграции для коммуникативного HRI и эмпирической валидации (количественной или качественной). Мы исключили исследования, ограниченные унимодальными взаимодействиями, те, что касались управления роботами без коммуникативного намерения, а также неэмпирические работы (например, чисто теоретические или только симуляционные). Первоначальный поиск дал значительный корпус. После удаления дубликатов мы отбирали заголовки и аннотации по критериям включения, а затем проводили полнотекстовые обзоры для оценки релевантности и вклада в надежное мультимодальное слияние. Этот многоэтапный процесс, суммированный в блок-схеме в стиле PRISMA (рисунок 2), дал итоговый корпус из 148 статей, которые составляют эмпирическую основу данного обзора.
Обзор избранной литературы: Рисунок 3 показывает тенденции публикаций и распределение дисциплин, при этом доминируют информатика и автоматизация и робототехника, а также растущий вклад поведенческих наук и нейронаук, что подчеркивает междисциплинарный путь отрасли. Мы тематически сгруппировали литературу по техническому вкладу в мультимодальную интеграцию (Таблица 1). Этот синтез охватывал методы, методы слияния, обработку задержек, стратегии устойчивости, адаптивность и метрики. Исследования с 2019 по 2021 год преимущественно использовали раннее или позднее слияние, часто делая акцент на жестах и тактильных сигналах. С 2022 года гибридные и ориентированные на внимание архитектуры получили популярность, особенно для аффективного и воплощённого взаимодействия. В этом корпусе гибридное слияние составляет примерно 43% подходов, раннее слияние — 29%, позднее слияние — 28% — распределение, свидетельствующее о повышенной толерантности к временной асинхронности.
Хотя в более широкой литературе, изначально отборованной, часто утверждается возможность реального времени, лишь ограниченное число исследований подробно описывает конкретные стратегии смягчения последствий (например, буферная обработка, прогнозные модели или оптимизация на уровне сенсоров). Устойчивость обычно основана на фильтрации, избыточности или резервных вариантах, основанных на правилах, тогда как предвосхищающая адаптация остаётся редкой. Методы оценки непоследовательны, а стандартизированные оценки временной синхронизации или беглости взаимодействия остаются редкими. Метрики настолько сильно различаются в разных исследованиях, что прямые сравнения часто бывают затруднены. Точность, показатели F1 и показатели задержки распространены, но они обусловлены разными наборами данных, задачами и условиями окружающей среды; Немногие статьи используют общие ориентиры временного выравнивания или устойчивости к шуму. В результате высокая производительность в чистых лабораторных установках часто преувеличивает, какие методы можно достичь вне контролируемых условий. Разработка последовательных систем оценки — возможно, включая стандартизированные тесты на задержку при реальных вариативностях — значительно упростила бы оценку, какие подходы действительно продвигают область.
Ключевые пробелы сохраняются в тактильной и аффективной интеграции (только шестьисследований 8,9,10,11,12,13 рассматривают эту проблему) и динамической корректировке задержки при пользовательской временной неопределённости. Из литературы выделяется несколько интересных напряжённостей. Гибридное слияние часто хвалят за то, что он хорошо справляется со временными несоответствиями, однако действительно предвосхищающие или адаптивные поведения остаются редкостью, что ставит под сомнение бесшовность заявленной производительности в реальном времени. В то же время впечатляющий прогресс в распознавании аффектов на основе зрения и речи резко контрастирует с минимальной работой по интеграции тактильных сигналов с пониманием эмоций. Высокая точность в контролируемых экспериментах также склонна ухудшаться в реальных условиях, подчёркивая постоянные трудности в обобщении между средами и пользователями. Таблица 2 обобщает репрезентативные архитектурные тенденции и подходы к оценке, что объясняет проблемы, обсуждаемые в последующих разделах.
Этот обзор вносит особый вклад в мультимодальную литературу по HRI. Недавние опросы, такие как Zhao et al.14, дают широкие обзоры принятия решений, основанных на восприятии, в то время как Wang и др.15 сосредоточены на визуально-тактильной передаче с поддержкой 5G. Оба акцентируют внимание на общих фреймворках или протоколах коммуникации, с ограниченным обсуждением компромиссов в реальном времени слияния, сопоставимости метрик или сложностей развертывания. В отличие от этого, мы предлагаем более целенаправленный анализ: сравнивая стратегии синтеза при определённых ограничениях, критикуя несоответствия метрик между исследованиями и выявляя практические пробелы — особенно разрыв между лабораториями и полями, который ранее в значительной степени упускали из виду.
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Поскольку роботы становятся неотъемлемой частью дома, классов и медицинских учреждений, естественная и адаптивная коммуникация становится критически важной для их успеха. Их всё чаще рассматривают не как инструменты, а как социальные партнёры, и они должны воспринимать, интерпретировать и реагировать на человеческие сигналы в разных форматах. Системы, которые точно фиксируют намерение пользователя и предоставляют своевременную обратную связь, повышают выполнение задач, доверие и эмоциональный комфорт — особенно при взаимодействии с детьми, пожилыми людьми или людьми с ограниченными возможностями. Для достижения этого требуется непрерывное, интуитивное взаимодействие, которое согласует реакции роботов с текущим поведением человека, а не прерывает его. Такая беглость требует мультимодальных входов — голоса, взгляда, жеста, мимики — интегрированных через механизмы, отражающие само человеческоеобщение 14,16.
Каналы восприятия и коммуникации
Зрение остаётся основой мультимодального взаимодействия человека и робота. Визуальные сигналы, такие как мимика, взгляд, осанка и жесты, лежат в основе распознавания намерения, вывода эмоций и отслеживаниявовлечённости 17,18,19,20,21. Ранние ручные методы с использованием обнаруженияХаара 22 или фоновоговычитания 23 часто не сдавались из-за изменений окклюзии илиосвещения 16,21. Теперь доминируют системы глубокого обучения, использующие CNN и повторяющиеся модели с многокамерными входами. Рисунок 4 иллюстрирует конвейер отслеживания HI-ROS, который снижает ошибку движения на 27% при мониторинге жестов в реальном времени.
Интеграция сигналов взгляда, рук и головы улучшает предсказание действийпользователя 17, а проприоцептивное и глубинное синтез повышаютточность 24,25. Взаимный взгляд19 и биомиметические дизайны глаз18 дополнительно демонстрируют роль тонких сигналов в доверии и координации. Рисунок 5 показывает архитектуру из 26, где двойные контроллеры движения с прыжками фиксируют движение руки, объединённые с LSTM-RNN для надёжной хирургической телеоперации. Современные многокамерные системы, такие как Hi-ROS20 иRPF 21,27, улучшают возможность следовать за человеком в неструктурированных условиях. Рисунок 6 показывает адаптивный жизненный цикл ReID, который поддерживает отслеживание под окклюзией за счёт непрерывного уточнения классификаторов. Дополнительная работа по активному метированию28 и семантическому SLAM26 улучшает контекстную осведомлённость, расширяя восприятие от распознавания объектов до поведенческого понимания.
Язык обеспечивает параллельный канал коммуникации. Ранние системы диалога на основе правил испытывали трудности с неоднозначностью, что привело к внедрению моделей, основанных на данных итрансформаторах. Эмоциональная и социальная реактивность теперь играют ключевую роль: мультимодальные системы согласовывают лицевые и голосовые сигналы для адаптивногодиалога 2,30. Обучение с подкреплением улучшает координацию между аффективными и акустическимисигналами 5,31,32. Крупные языковые модели, такие как GPT-333 иChatGPT 34, позволяют контекстное мышление и следование инструкциям позадачам 35, 36, 37. Их интеграция с моделированием видения и вознаграждения38, 39, 40, 41, 42, 43, 44 поддерживает социально осознанное, обобщённое взаимодействие.
Слуховое восприятие дополняет зрение и язык. Просодия, высота звука и ритм передают намерение, когда визуальные сигналы ненадёжны. Выделение признаков на основе подкрепления улучшает синхронизацию речи и выражения. Наборы данных, такие как AVAActiveSpeaker 45, AFFECT-HRI5, SAVEn-Vid46, HumorHRI47 и CHiME-5, обогащают устойчивость модели в шумных, эмоциональных средах. Пан и др.32 продвигают синхронизацию речи и губ для многоговорящих сцен, тогда как мультимодальное слияние с тактильными или физиологическими входами формирует адаптивное поведение.
Воплощённые и физиологические ощущения
Тактильное и физиологическое восприятие усиливают социальную и физическую осведомлённость. Сила, давление и биосигналы позволяют определить намерение, стресс и взаимодействие. Тактильные симуляторы на основе зрения, такие какTACTO 4 , и нейронные картографы, например FOTS48 , генерируют контактные данные высокого разрешения с частотой 300 кадров в секунду, поддерживая управление низкой задержкой. FOTS моделирует освещение и деформацию с помощью изученной функции отражения R:

и теневую проекцию:

где Ms кодирует геометрию проекции. Высокоразрешающие тактильные оболочки были реализованы с использованием магнитореологических эластомеров49, сенсорных массивEtherCAT 50 и вспомогательных материалов по эффектуХолла 51. Системы, такие какDiGeTac 13 , объединяют жесты, тактильные и дальние сигналы через модульные конвейеры. Фильтрация данных о расстояниях по времени полёта моделируется следующим образом:

затем последовала классификация нейронных жестов и локализация контактов на основе CNN. Контроль безопасности обеспечивается масштабированием скорости робота с разделением d. Эти модули обеспечивают надёжное сотрудничество между человеком и роботом. Мультимодальные трансформаторы дополнительно интегрируют тактильные, визуальные и текстовые сигналы. ТрансформаторTVT-6 выравнивает модально-специфические представления (qi, ki, vi) в матрицы суставов:

обеспечение кроссмодального самосознания для единого понимания (рисунок 7).
Физиологические ощущения способствуют эмоциональному выравниванию. Хайниш и др. синхронизируют физиологические и аудиовизуальные сигналы для моделирования аффекта. Системы на основеэлектромиографии 52,53 декодируют жесты и беззвучную речь, аMetaSonic 54 улучшает пространственное восприятие за счёт акустической локализации. Крупномасштабные наборы данных, такие как AgiBot WorldColosseo 55, поддерживают мультимодальное обучение с более чем миллионом тактильных визуальных траекторий. Вместе эти достижения знаменуют переход от унимодального восприятия к интегрированному пониманию социальных, физических и внутренних состояний. Улучшенная точность восприятия позволяет роботам не только измерять контакт, но и интерпретировать колебания, напряжение или дискомфорт, реагируя с помощью чувствительности и адаптивного контроля, которые являются ключевыми основами для бесшовных мультимодальных рамок, рассмотренных в следующих разделах.
Мультимодальное слияние и обучение представления
Синтез позволяет преобразовывать распределённые сенсорные потоки в когерентный, контекстно-ориентированный контроль. Подходы обычно относятся к раннему, позднему или гибридному слиянию. Раннее слияние интегрирует функции на входной стадии, поддерживая синхронизированные сигналы, такие как речь–жест или выравнивание лица–просод. Мультимодальный трансформатор Цай и др. 14 иллюстрирует раннюю интеграцию визуальных, акустических и текстовых сигналов с помощью внимания. Сюэ и др.56 расширили это за счёт остаточного соединения лицевых ориентиров и речевых особенностей, что улучшило устойчивость при вариациях освещения, в то время как Ху и др. ПредложилMMSERNet 57 — многомасштабную термоядерную сеть с использованием расширенной свёртки и остаточного слияния для объединения MFCC, спектрограммы и лексических признаков для распознавания эмоций. Выходной сигнал выражается следующим образом:

Поздний синтез, напротив, объединяет решения после самостоятельной обработки, обеспечивая более высокую толерантность к асинхронным или шумным входам. Примеры включают комбинацию сигналов взгляда, инерции и движения на уровне принятия решений в подводномHRI 58,59. Гибридное слияние объединяет оба подхода — сопоставляя гетерогенные модальности с общими пространствами вложения при сохранении временной специфичности. Multimodal Brain–Computer FusionNetwork 60 выравнивает ЭЭГ и визуальные признаки до классификации, в то время как кроссмодальные конструкции для 3D-оценки поз объединяют инерциальные и монокулярныеданные 61. Современные фреймворки объединяют сверточные, повторяющиеся и трансформаторные слои с выравниванием внимания62,63, динамически взвешивая модальности по контексту или релевантности задачи 64,65,66. Выбор между ранним, поздним и гибридным слиянием — это не вопрос универсального подхода. Раннее слияние обычно хорошо работает, когда модальности тесно синхронизированы и уровень шума низкий, что позволяет модели с самого начала фиксировать богатые межмодальные отношения. Поздний синтез, напротив, обычно более устойчив в сложных асинхронных реальных условиях, поскольку каждая модальность может быть обработана независимо до объединения решений. Гибридные подходы, которые сейчас встречаются примерно в 43% недавних исследований, находят полезный компромисс, особенно для аффективных и воплощённых взаимодействий, используя внимание к динамически сбалансированным входным данным, хотя и сопровождаются дополнительными вычислительными требованиями. В конечном итоге лучшая стратегия зависит от конкретной задачи, профиля шума и аппаратных ограничений, что говорит о том, что будущие системы могут получить выгоду от мгновенного переключения режимов термоядерного синтеза.
Комплементарность между модальностями также сильно варьируется в зависимости от контекста. Зрение в сочетании с тактильными эффектами особенно эффективно при физических задачах на ближнем расстоянии, таких как захват или передача объекта, где тактильная обратная связь компенсирует зрительную окклюзию, изменения освещения или ограничения расстояния и предоставляет точную информацию о силе и контакте, которую аудио не может передать. В то же время зрение в сочетании со звуком лучше работает в удалённых или социальных ситуациях, таких как распознавание эмоций или диалог в шумных условиях, где просодия и тон несут намерение и влияют на то, когда визуальные сигналы недоступны или ненадёжны.
Помимо классической системы ранних, поздних и гибридных моделей, глубокое обучение позволило создавать более детализированные категоризации. Слияние на основе внимания позволяет моделям изучать динамическую важность модальности для каждого входа, эффективно создавая пути интеграции, специфичные для задачи и контекста, без жёстких границ этапов. Изученные стратегии слияния идут дальше, рассматривая весь процесс слияния как сквозной дифференцируемый модуль, позволяющий сети напрямую находить оптимальные схемы комбинаций на основе данных. Эти разработки переносят парадигму от заранее определённых правил к полностью ориентированным на данные, адаптивным архитектурам, которые лучше решают сложность мультимодальных HRI в реальном времени.
Основание на языке видения
Быстрый рост крупных языковых моделей расширил охват мультимодального мышления, особенно через модели зрения–язык (VLM). Эти архитектуры выравнивают лингвистическую и визуальную информацию, позволяя роботам интерпретировать команды, воспринимать сцены и генерировать контекстно-зависимые действия. Фундаментальные фреймворки, такие какLXMERT 64 и CLIP66 , создали совместные вложения для выравнивания изображения и текста. Flamingo 65 ввела мультимодальное рассуждение с несколькими выстрелами, а Clio39 от Maggio динамически связывает инструкции с графами сцен с помощью семантики CLIP. Гао и др.41 разработали LAMARS для предвосхищающего планирования на основе мультимодального прогнозирования, а Се и др.67 применили пространственно-временные сверточные модели для эффективного понимания жестов. Arenas и др. ввели кастомизацию на основе подсказок для персонализированных стилейвзаимодействия 68. Эти системы позволяют напрямую закреплять команды вроде «поднимать красную чашку » в семантике сцены.
Интеграция с пространственным мышлением дополнительно улучшает навигацию и интерпретацию роботов. LatentBKI 38 Уилсона основывает инструкции на воксельных пространственных картах, тогда как Нванкво и др.40 объединяют крупные языковые модели с рассуждением VLM для интерпретации диалоговых действий в условиях визуальной неопределённости. Методы сегментации на основе событий и асинхронного восприятия повышают эффективность динамических задач. В совокупности VLM выступают мостами между символическим обучением и воплощённым пониманием, предоставляя когнитивную основу для гибкого взаимодействия.
Специализированные области применения
В здравоохранении и уходе за пожилыми мультимодальная коммуникация обеспечивает безопасную, интуитивную и эмпатичную помощь. Основные функции — обнаружение падения, ежедневный мониторинг активности, реагирование на экстренные ситуации — зависят от осанки, голоса и сигналовлица 3. Иерархические модели управления повышают точность движения в роботах-ассистентахруки 1, а проприоцептивная обратная связь направляет кооперативных помощников поперевязке 69. Передача объекта, изображённая на рисунке 8, демонстрирует синхронизированное восприятие и моторнуюкоординацию 70. Эмоциональная реакция, изучаемая с помощью таких систем, как LOVOT, способствует доверию пользователей, но вызывает этические сомнения по поводу чрезмерной зависимости.
Социальные роботы требуют гибкой мультимодальной реакции для поддержания эмпатии и доверия в домашних и общественных условиях. Рисунок 9 описывает типичную архитектуру, объединяющую слои сенсорного, планирования и социально-эмоционального мышления. Крупные языковые модели, интегрированные с восприятием, позволяют вести открытый диалог, модулируемый взглядом итоном 40. Педиатрические исследования показывают, что экспрессивные движения и просодия снижают тревожность у детей71 года, в то время как опросы выделяют невербальное поведение как факторывовлечённости 8. Проактивные модели, такие какRoboAgent 37 и Sub-Prior-guided Ant ColonyOptimization 72, позволяют совместно исследовать общие цели. Системы, способные выражать внутренние состояния (готовые, запутанные)73 повышают прозрачность и координацию, а адаптивные социальные агенты опосредуют групповоесотрудничество 74,75.
Образовательные роботы: в образовании мультимодальный HRI способствует мотивации и обучению, используя воплощение и социальнуюсигнализацию 76. Сочетание жестов, лицевых и словесных сигналов повышает доступность и вовлечённость 6,9,77,78. Эмоциональная адаптивность поддерживает младших учеников: системы, которые чувствуют аффективное состояние и модулируют речь и движение, увеличивают внимание исловарный запас 7,79. Интеграция с виртуальной реальностью улучшает погружение, но ставит под угрозумасштабируемость 80. В совокупности эти системы меняют роль робота с инструктора на эмоционально настроенного соавтора.
Персонализация обеспечивает релевантность и доверие в мультимодальныхсистемах 71, 81, 82. Этическая персонализация балансирует между автономией и эмпатией, адаптируя реакции через партисипативную обратную связь. Мааз и др.83 продемонстрировали аффективное репетиторство, основанное на лицевых и когнитивных сигналах, тогда как Гомес-Искьердо и др.84 моделировали предпочтения пользователя по синхронизированному поведению. Персонализированная адаптация может быть формализована следующим образом:

где wi — изученные предпочтительные веса. Реализации, такие как RFIS, обеспечивают реидентификацию человека в реальном времени и распознавание жестов награнице 85, а проприоцептивные сенсорныеинтерфейсы 10 обеспечивают интуитивно понятную физическую коммуникацию. Влияние социального восприятия дополнительно модулирует результаты персонализации, при этом идентичность рассказчика меняет время реакции пользователя и длинувысказывания на 86. Таким образом, персонализация превращает пользователей из пассивных получателей в со-дизайнеров, формируя взаимодействие через взаимную адаптацию.
Хотя большая часть рассмотренных работ остаётся в исследовательских прототипах, несколько мультимодальных методов HRI перешли из исследовательских прототипов в коммерческие или промышленные приложения. Например, робот Pepper от SoftBank интегрирует распознавание речи, жестов и мимики для обслуживания клиентов и образования в розничной торговле иобразовательных учреждениях 87. Робот поддержки человека от Toyota использует слияние зрения и жестов для вспомогательных задач в домах и медицинскихучреждениях 88. Эти коммерческие реализации часто упрощают стратегии слияния, обычно используя поздние или гибридные подходы с правилами, основанными на запасных вариантах, чтобы обеспечить надёжность и низкую стоимость, подчёркивая устойчивый разрыв между продвинутыми академическими моделями и масштабируемыми промышленными решениями. Преодоление этого разрыва потребует большего внимания к развертыванию edge и строгой валидации в реальной жизни.
Проблемы бесшовной коммуникации в HRI
Несмотря на достижения в мультимодальных сенсорах и синтезе, поддерживать бесшовную коммуникацию между человеком и роботом вне контролируемых условий остаётся сложно. Модели, которые отлично работают в лабораториях, часто деградируют из-за шума, задержки, окклюзии, изменения намерения или ограничений ресурсов. Литература объединяется вокруг шести взаимосвязанных барьеров: интеграция зения и языка, синхронизация в реальном времени, мультимодальная устойчивость, семантическая точность, охват наборов данных и ограничения по развертыванию.
Интеграция языков зрения
Визуальное понимание лежит в основе приземлённого языка и действий. Фундаментальные шаги улучшили пространственную согласованность и абстракцию с помощью визуально-инерциального SLAM без ручной инициализации89, повторной идентификации плюс слияния сенсоров для отслеживания с устойчивостью кокклюзии 16, прогнозированию графаполос 90, полуконтролируемой сегментации, выравнивающей метки с навигационной полезностью, эгоцентричного видео с SLAM и масштабной сегментацией дляпроходимости 26. Отображение с учётом неопределённости остаётся центральным: uPLAM объединяет вероятностную локализацию с паноптической сегментацией для динамических сцен91, а Clio адаптивно строит иерархические 3D-графы сцен на основе CLIP для чувствительной к задачесемантики 30. Подходы к заземлению развивались от структурированных описаний и API восприятия92,93 до мультимодальных энкодеров и декодеров94,95.
Инструкции, следующие в открытой среде, интегрируют восприятие и рассуждение. RobotGPT 35 иGroundingGPT 36 интерпретируют команды с помощью связанного визуально-лингвистического вывода; SayPlan, LFG и LLM-Planner согласовывают навигацию и планирование на основании34,44. Для снижения галлюцинаций и обеспечения семантической согласованности GLAM и Vtimellm вводят целивыравнивания 96,97, а адаптивные фреймворки проверяют результаты LLM повосприятию 98,99. Время критически влияет на читаемость: оптимизированное время жестов улучшаетпредсказуемость 9; обучение с подкреплением снижает аудиовизуальную задержку в эмоциональныхконвейерах 2; Захват жестов повышает воспринимаемуюбеглость на 100; а также рассматривает объединение инструментов LSTM, DTW и GAN длявыравнивания 101. В целом, бесшовность требует цикла с учётом задержки между восприятием, слиянием и реакцией, гдемимикрия 30 и предсказание102, вдохновлённое мозжечком, координируют тайминг, что также показано системными временными циклами на рисунке 10.
Восприятие в реальном времени между модальностями
Беглость владения языком зависит от ограниченной задержки между гетерогенными потоками. TACTO обеспечивает тактильную обратную связь высокого разрешения с низкой задержкой для адаптивной обработки. Руки, управляемые сухожилиями, обеспечивают быструю интерактивную игру через event vision и лёгкий вывод103, как показано на рисунке 11. Для зрения–языка–действия связывание CLIP с GraspNet ускоряет захват впомехах 104. Трансформеры поддерживают быструю социальную тактильную классификациюжестов 11. Аудиовизуальные модели, оптимизированные по краям, поддерживают вывод нижесекунды 24. Точное время движения головы улучшаетзацепление на 105. Вместе эти результаты подтверждают необходимость синхронизированного слияния, буферных политик, адаптированных по модальности, и легкого внимания для сохранения временной коадаптации. Допустимая задержка значительно варьируется в зависимости от области задачи. В социальном диалоге или распознавании эмоций задержки менее 200–300 мс поддерживают воспринимаемую беглость и естественное взаимодействие. Вспомогательные задачи, такие как передача объектов или обнаружение падения, требуют более строгих ограничений (50–150 мс) для обеспечения безопасности и оперативности. Телеоперация или совместная обработка часто требуют задержки менее 100 мс для предотвращения дезориентации оператора или укачивания, тогда как навигационные или мониторинговые приложения могут выдерживать 300–500 мс без критического воздействия.
Временные и семантические задачи обработки
Несогласованность и задержки подрывают доверие и эффективность задач, особенно в распределённых системах телеоператор–робот–человек106. Перцептивные и интерфейсные стратегии помогают пользователям переносить задержки: телесные жесты и нелексическиефиллеры 107, визуальные наложения и адаптивныесигналы 108, 109, 110, 111. Прогнозирование на уровне контроля сокращает пробелы вответах 102. Параллельные диалоговые конвейеры пересекаются с генерацией заполнителей, синтезом речи и редактированием подсказок, чтобы уменьшить воспринимаемую задержку, как в112 и рисунке 12. Системные исследования разлагают накопленную задержку между захватом, кодированием/декодированием, сетями, принятием решений иактуацией 113. Как показано на рисунке 13, задержка вводится через захват датчиков, кодирование и декодирование видео, сетевую передачу, обработку оператором и движение транспортного средства, формируя сложную двустороннюю обратную связь. Syntalos обеспечивает миллисекундную синхронизацию для замкнутыхэкспериментов 114. В эмоциональных обменах имитация лица в реальном времени усиливаетсинхронность 23. Домены, чувствительные к задержке, такие как дистанционная хирургия, показывают, что закрепление тактильных эффектов против задержки зрения поддерживает точность иотзывчивость 115. Как показано на рисунке 14, закрепление тактильной обратной связи приводило к лучшей производительности и более сильному ощущению отзывчивости.
Тонкие эффекты и распознавание намерений остаются сложными. Микроэкспрессии, просодия, взгляд и предвосхищающее движение часто происходят кратковременно и асинхронно. Эмо создаёт предвкушающие мимики, соответствующие состоянию пользователя116. Только язык тела передаёт намерение там, где лицо или голоснедоступны 117. Мультимодальные дисплеи на основе перца сочетают вербальную классификацию с выразительными жестами и эмодзи для эмоциональнойсинхронности 118. Онлайн RL усиливает слияние лицевых и голосовыхпотоков 2, а лёгкая имитация поддерживает развертывание edge30. Открытые вопросы включают групповой эффект, культурные вариации и дрейф временного эффекта.
Обобщение в открытых областях также ограничено. Подкрепляющее обучение на основе человеческой обратной связи (RLHF) демонстрирует скудные вознаграждения и хрупкость при внераспределенныхвходах 119. RoboAgent сочетает пространственное мышление с языковым заземлением для передачи междузадачами 29. Reasoning Through Action-free Data (RAD) использует пассивное видео и язык для возможностей zero shot без ручных меток120. Perceiver-Actor заземляет свойства объекта для манипулирования незнакомымиобъектами 121. Постоянное согласование восприятия и семантики в RobotGPT и GroundingGPT улучшает адаптивное мышление, но всё равно сталкивается с проблемами обратной связи в реальномвремени 35,36.
Многомодальная устойчивость и изменчивость окружающей среды
Надёжность должна охватывать целостность сигнала и поведенческую последовательность. SimuMuHRI вводит специфический для модальности шум и дроп-аут для проверкиустойчивости 122. Физически заземленное моделирование структурированного света повышает надёжность RGB-D при освещении и окклюзии123,124. Задержка–тактическая связь выявляет чувствительность при удалённойобработке 125. Принципы избыточности и тепловой устойчивости из систем критически важных для безопасности служат в основе отказоустойчивого HRI126,127.
Поведенческая когерентность столь же важна. Несоответствие голоса и внешнего вида снижаетдоверие 128, а непредсказуемое, но правильное движение подрываетсотрудничество 129. Адаптивное управление силами на основе наблюдателей и надёжные контроллеры взаимодействия обеспечивают устойчивость при структурированных и неструктурированныхнеопределённостях 130,131. Покрытие наборами данных также ограничивает прогресс. Наборы данных по восприятию мультиоботов — OPV2V132,CoPeD 133,CSE 134 и AgiBot World Colosseo55 — расширяют совместное сенсорирование как в моделировании, так и в полевых условиях. Ресурсы AV-HRI — CHiME-5135 с последующим вызовом CHiME-8136, AVA-ActiveSpeaker45, AFFECT-HRI5 и SAVEn-Vid46 — позволяют выполнять ASR, активность спикера, аффект и инструкции в длительном контексте. Крупномасштабные социальные ориентиры —HumorHRI 47, THÖR-MAGNI137, RW4T138 и InViG139 — нацелены на юмор, навигацию, командное взаимодействие и интерактивное заземление. Несмотря на широту, многие наборы данных являются специализированными или скриптированными, с ограниченной временной глубиной оценки бесшовности, как изложено в таблице 3.
Оценка бесшовности
Обычные метрики, такие как точность и задержка, не полностью отражают коадаптацию, взаимное предсказание или социальную беглость. Новые оценщики оценивают контекстную согласованность исотрудничество на 140, интегрируют отзывы пользователей и ситуационныесигналы 141, а также добавляют предсказуемость, координацию и комфорт к физическомуHRI 84. Командные рамки количественно оценивают общееожидание 74, а цифровые двойники отслеживают калибровку доверия и беглостькоманды 142. Единый бенчмарк, объединяющий временную синхронизацию, аффективное выравнивание и беглость, ориентированную на пользователя, остаётся открытой потребностью.
Усилия по стандартизации в мультимодальной оценке HRI остаются ограниченными и фрагментированными. Значимые инициативы, такие как CHiMEChallenges 135 136, имеют продвинутые эталоны по аудиовизуальному распознаванию речи, особенно в плане устойчивости шума. Наборы данных, такие как THÖR-MAGNI137 и RW4T138, предоставляют общие ресурсы для захвата движения и командного поведения. Однако до сих пор не существует широко принятого единого протокола для межмодальной временной синхронизации, беглости взаимодействия или аффективного выравнивания между различными модальностями и доменами. Отсутствие стандартизированных метрик продолжает препятствовать воспроизводимости и сопоставимости, подчёркивая необходимость в эталонах, управляемых сообществом.
От лаборатории к реальному развертыванию
Производительность часто ухудшается в неструктурированных условиях из-за сенсорных аномалий, изменения намерений и узких мест ввычислениях 143. Это снижение производительности подчёркивает устойчивое разделение между лабораторными и реальными условиями. В контролируемых условиях гибридный и ориентированный на внимание синтез отлично работает, обеспечивая высокую точность и низкую задержку для таких задач, как работа с объектами или понимание сцены. Однако реальные развертывания говорят совсем другое. Ассистентные роботы в уходе за пожилыми, компаньонные системы в домах и образовательные инструменты в классах регулярно сталкиваются с шумом, окклюзией, изменениями освещения и непредсказуемым поведением пользователей, снижающим эффективность. Поздние методы синтеза, как правило, оказываются более надёжными при таких переменных, асинхронных условиях, тогда как гибридные модели, несмотря на свои преимущества в аффективной и контекстной адаптации, могут быть ограничены вычислительными требованиями к периферийным устройствам. Многие успешные полевые реализации по-прежнему включают более простую избыточность или правила, гарантии надёжности, что подчёркивает, что переход от перспективных лабораторных демонстраций к надёжной повседневной производительности остаётся серьёзной задачей. Экологически обоснованное тестирование необходимо для определения, какие методы действительно успешны за пределами контролируемых экспериментов. Адаптивные надёжные контроллеры сохраняют точность силы привозмущении 131. Совместное планирование на основе LLM обновляет цели по мере развития намерения пользователя144. Визуальные наложения и обратная связь с учётом задержки помогают поддерживать осведомлённость операторов при деградированныхсвязях 107,109. Лёгкий надзор с помощью LoRa и цифровых теней позволяет проводить мониторинг в полях с низкой пропускнойспособностью 145. Опыт космической робототехники показывает, что автономия должна эволюционировать вместе с человеческим когнитивным восприятием в условиях неопределённости изадержки 146.
Ограничения ресурсов формируют осуществимость. Звуковое распознавание аффектов и сенсорных сигналов работают менее 1 МБ и 0,7 GFLOP для маломощных платформ12. Добавление социальных функций может улучшить присутствие, но рискует перегрузка, когда задержкивырастают до 147. Расписание и выбор признаков должны балансировать когнитивные требования снепрерывностью 148. Снижение задержек охватывает восприятие, контроль и сети, организованные в 113. Пользователи часто предпочитают прозрачное, стабильное взаимодействие максимальной эффективности задач, подчёркивая, что бесшовное HRI должно ставить в приоритет технические возможности наряду с человеческимкомфортом 149 151. В разных областях реальные внедрения демонстрируют разные предпочтения: социальные и образовательные приложения часто используют гибридное слияние зрения и аудио для аффективного диалога, тогда как ассистентные и коллективные задачи предпочитают сочетания зрения и гаптики с поздним или ранним слиянием для точного физического взаимодействия. Эти закономерности совпадают с обобщёнными стратегиями — приоритетом позднего слияния для устойчивости в переменных условиях и гибридном/ориентированном на внимание для более богатой контекстуальной адаптации — хотя упрощение для надежности остаётся обычным.
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
У этого обзора есть несколько ограничений. Ограничение поиска публикациями на английском языке в Web of Science Core Collection могло привести к языковой предвзятости и исключению релевантных неанглоязычных работ. Фокус на рецензируемых статьях с 2015 по 2025 год также может отражать предвзятость публикаций, возможно упускание препринтов, серую литературу или новые неопубликованные результаты. Ручной отбор 148 статей, хотя и руководствуется явными критериями, неизбежно связан с определённой субъективностью. Наконец, тема...
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Авторы заявляют, что у них нет конфликта интересов.
Эта работа была поддержана грантом Universiti Sains Malaysia, Bridging Grant с проектом No R501-LR-RND003-0000001342-0000.
Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.
Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE
Запросить разрешение