Исследовательская статья

Разработка адаптивных мультимодальных рамок взаимодействия для улучшения сотрудничества человека и ИИ

DOI:

10.3791/69830

24 февраля 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данной работе предлагается иерархический механизм выравнивания на основе динамического искажения времени (DTW) с онлайн-адаптацией и мультимодальным синтезом, ориентированным на внимание, что позволяет надёжно предсказывать долгосрочные намерения и отслеживать задачи. Лёгкий модуль объяснимости повышает интерпретируемость, способствуя доверию к сотрудничеству человека и ИИ. Подход распространяется как на роботизированные, так и на виртуальные интерактивные системы.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Достижение эффективного и естественного сотрудничества между человеком и ИИ остаётся серьёзной задачей, особенно в динамичных реальных условиях. Существующие фреймворки часто ограничены жёсткими одномодальными входами или мультимодальным слиянием на основе правил, что ограничивает их надёжность, персонализацию и адаптивность. Это исследование вводит адаптивную мультимодальную рамку взаимодействия, интегрирующую оценку позы на основе зрения и понимание команд на основе речи в иерархическую модель прогнозирования человеческих намерений. Фреймворк использует модели последовательностей на основе трансформеров для прогнозирования действий и динамического искажения времени для согласования человеческого поведения со структурированными графами задач для долгосрочного планирования. В отличие от предыдущих подходов, основанных на статическом переключении модальности, наша архитектура применяет механизм слияния, основанный на внимании, для динамического взвешивания наиболее информативных входов. Кроме того, онлайн-модуль адаптации позволяет в реальном времени корректировать поведение пользователя, дополняясь лёгким слоем объяснимости для укрепления доверия пользователя. Экспериментальная оценка в совместной сборочной задаче демонстрирует значительные улучшения в производительности задачи (до 24%), точности прогнозирования намерений (до 18%) и удовлетворённости пользователей. Эти результаты подчёркивают эффективность и универсальность адаптивных мультимодальных взаимодействий, поддерживая их потенциал для продвижения совместного интеллекта к более надёжным, прозрачным и ориентированным на человека системам ИИ.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сотрудничество между человеком и роботом (HRC) является одной из важных областей исследований, особенно учитывая, что роботы всё чаще используются в средах, ориентированных на человека. В то время как рамки и технологии для краткосрочных HRC значительноулучшились 1,2, долгосрочная HRC пока не достигла такого уровня3. В промышленных приложениях использование долгосрочного HRC может привести к значительному росту производительности и адаптивности в сложныхпроизводственных процессах 4. Домашние условия, роботы в качестве компаньонов или агенты по уходу за пожилыми могут повысить качество жизни благодаря долгосрочномуHRC 5. Медицинские учреждения рассматривают общественные машины как замену домашних и сиделков, покрывая помощь пострадавшим от деменции, аутизма и других физических или психических заболеваний6. В то же время сферы путешествий и дружелюбия используют промышленных роботов для повышения знанийпользователей 7. В интеллектуальной инженерии цель — вовлекать ИИ в ориентированный на человека способ, чтобы восстановить компетенции и создать персонализированные культуры, что называется Индустрия 5.0. Системы сотрудничества человек-ИИ и человек-робот были исследованы в различных областяхприменения: 8, 9, 10; Однако недавние исследования всё больше сосредоточены на совместных роботизированных настройках, требующих надёжного прогнозирования намерений и понимания задач с долгосрочными горизонтами.

ИИ уже глубоко интегрирован в повседневную жизнь, а его самоуправляемые или полуавтономные приложения всё чаще проявляются во многих сферах бизнеса. Это просто означает, что хорошо работающие бизнес-функции в настоящее время требуют систем, способных адаптироваться к изменениям в технологиях и оперативно реагировать на организационныезадачи 11. Таким образом, необходимость улучшения человеческой деятельности путем гибридизации в процессе внедрения и внедрения ИИ помогает преодолеть некоторые барьеры. В результате гибридные системы объединяют искусственный и человеческий интеллект для совместного выполнения сложных задач, повышения результатов и повышения квалификации через обучение у коллег. Поэтому расширенные концепции, включающие гибридные интеллектуальныесистемы, сотрудничество и усиленный интеллект, неформально формируют исследования и понимание способов усилить сотрудничество через интеграцию различных модальностей ИИ.

Термин «Доверие» возник из исследований межличностных отношений, определяющих эмоциональную связь в человеческих отношениях. Например, авторотметил, что уровень доверия технически определяет аспекты чувств, предполагаемой привлекательности и этики сотрудничающих сторон. С социологической точки зрения различия в межличностном доверии оказывают глубокое влияние на отдельное благополучие, коллективное взаимодействие, социально-экономический рост и практическоеповедение 14,15,16. HRI, по сути, — это попытка преодолеть процедурные диалоги между социальными работниками и умными автоматами за рамки традиционных языковых барьеровавтоматов 17. Такое взаимодействие сочетает вычислительные возможности автономных систем с человеческой интуицией, обеспечивая эффективное сотрудничество между различными условиями применения. Использование автоматов приносит реальные преимущества: значительное снижение финансовых расходов, уменьшение экологического следа и значительно меньший риск для людей10. Но среди достижений доверие человека к роботам является столпом, особенно при оценке общего качествавзаимодействия 18,19.

Уровень человеческого доверия роботам отражает их важность и центральную роль во многих сферах. В здравоохранении доверие роботов влияет на распределение медицинских ресурсов согласно HRI, а также на эффективность подавления передающихся заболеваний 20,21,22. В военных применениях уровень социальной веры в автоматы определяет уровень оперативной компетентности стратегий военно-исследовательских устройств и точность боевыхтранспортных средств 23,24. Кроме того, вера в машины влияет на подчинение и использование механизмов активной стандартизации убеждений ИИ в спекулятивной военнойполитике 25. Даже в рамках экологических исследований, например, высокоуровневых исследований движений тела, рациональность результатов зависит от степени веры вHRI 26. Однако важное предупреждение — растущие трудности с принятием решений могут подорвать это доверие, ставя под угрозувзаимодействие 27. Таблица 1 описывает сравнительный обзор нескольких исследований.

Газета (год, источник)Основные целиКлючевые методы и методыИнсайты
Се и Пак (2021, arXiv) [28]Настраивайте взаимодействие роботов с эмоциональными социальными роботамиПолитика подкрепляющего обучения, основанная как на вербальном, так и на невербальных подсказках (положение тела, речь и мимика)Поведение робота, обученного RL, меняется в ответ на человеческие эмоции, повышая простоту и вовлечённость.
Li и др. (2022, IEEE T-IE) [29]Облегчить проактивную поддержку сборки в производствеПрогнозирование намерений, трансферное обучение и мультимодальное обучение (визуальное + скелетное)Улучшенная проактивность роботов по сравнению с исходными показателями; Более быстрое и точное предсказание действий во время сборки
Абдельрахман и др. (2022, доступ к IEEE) [30]Оценка вовлечённости в реальном времени в групповой HRIКлассификация на основе правил в сочетании с глубоким обучением и взглядом/головой, основанной на зрении≥90% F; управляет несколькими пользователями одновременно в физических конфигурациях
Chiossi и др. (2025, arXiv) [31]Структура для мультимодальной, динамической передачи намерений в производственных условияхТеоретическая многогранная компоновка: слои прозрачности SAT; Тактильные, слуховые и зрительные режимыУстанавливает концептуальную основу и объясняет среду, планирование и намерение дизайнерской среды.
МакГрат и др. (2024, arXiv) [32]Покажите пример развития доверия к взаимоотношениям человека и ИИ, которые адаптируются.Фазы команды плюс предшественники доверия; динамическая модель доверия, не зависящая от конкретных модальностейПредоставляет принципы проектирования, основанные на доверии, для всех этапов взаимодействия и времени.
Фрагиадакис и др. (2024, arXiv) [33]Стандартизировать оценку сотрудничества между человеком и ИИ.Метрики, выбранные деревом решений в соответствии с режимом HAIC; Метрики смешанного методаЭта структура помогает выбирать соответствующие метрики для симбиотических взаимодействий, ориентированных на ИИ и человека.
Юнис и др. (2023, MDPI) [34]HRI, который адаптируется к контексту с помощью демографических выводовВозраст и пол оцениваются с помощью визуальных и аудиомоделей, а поведение роботов корректируется соответствующим образом.Опрос подводит итог подходов и подчеркивает важность индивидуальной адаптации в HRI.

Таблица 1: Сравнительный обзор недавних исследований в области сотрудничества человека и ИИ, подчеркивающий ключевые цели, методологии и результаты каждого исследования . Наборы данных, использованные в исследовании, их спецификации, размер, модальности и распределение участников.

Хотя нынешняя иерархическая и мультимодальная структура сотрудничества человек-робот (HRC) демонстрирует впечатляющий прогресс в использовании визуальных и аудио-модальностей для долгосрочного сотрудничества, ряд исследовательских пробелов всё ещё существует, что затрудняет её применимость к более общим условиям сотрудничества между человеком и ИИ. Во-первых, текущая структура в основном применима к физической робототехнике (например, руке KINOVA GEN3) и непереносимым к нереализованным или виртуальным агентам ИИ, существующим в различных цифровыхсредах 28. Во-вторых, хотя мультимодальность решается через зрение и речь, система реализует заранее определённую стратегию переключения модальности вместо динамичного, контекстно-зависимого слияния в зависимости от состояния пользователя или сложностизадачи 29. В-третьих, подход акцентирует внимание на эффективности и устойчивости задач, но не моделирует конкретно доверие пользователей, когнитивное бремя или эмоциональное состояние, что необходимо для долгосрочного сотрудничества и объяснимости системы. Кроме того, человеческая интерпретируемость и уверенность в адаптивном поведении системы ограничены, когда процессы объяснимости отсутствуют при принятии решений. И, наконец, оценка ограничена одной областью (сборка игрушечных автомобилей) без многодоменной валидации, что отражает вариабельность вреальном мире 30. Такие пробелы требуют разработки обобщённой, адаптивной и ориентированной на человека мультимодальной структуры взаимодействия, которая динамически объединяет разнородные каналы входа и моделирует человеческие намерения, доверие и контекст в реальном времени для усиления сотрудничества человека и ИИ.

Главная цель этого исследования — максимизировать сотрудничество человека и ИИ через создание адаптивной мультимодальной системы взаимодействия, объединяющей модальности зрения и речи с моделированием пользователя в реальном времени. Опираясь на прочную основу устойчивого долгосрочного сотрудничества между человеком и роботом, эта работа обобщит мультимодальную архитектуру на общие системы ИИ вне робототехники, такие как виртуальные агенты и интеллектуальные интерфейсы. Основной акцент делается на динамическом прогнозировании намерений с помощью иерархических механизмов планирования, которые интегрируют низкоуровневое понимание действий и высокоуровневое отслеживание прогресса задач. В отличие от систем, основанных на правилах, представленная здесь структура будет использовать адаптивные методы обучения, включая обновления моделей, специфичных для пользователя, и контекстно-ориентированное слияние модальностей, для динамической адаптации поведения взаимодействия в соответствии с предпочтениями пользователя, когнитивным статусом и динамикой окружающей среды. Кроме того, фреймворк стремится повысить прозрачность и доверие с помощью объяснимого рассуждения взаимодействия, что позволяет пользователям понимать выборы ИИ и давать обратную связь. Наконец, это исследование нацелено повысить беглость взаимодействия, эффективность выполнения задач и долгосрочное удовлетворение пользователей в различных коллективных контекстах.

В этой статье представлена новая адаптивная мультимодальная рамка взаимодействия, предназначенная для стимулирования сотрудничества человека и ИИ путём динамического объединения визуальных и аудиомодальностей. «Унимодальная» система относится к модели, которая использует только одну вводную модальность (например, визуальную или речь) для выполнения задачи и прогнозирования намерений, не интегрируя информацию по нескольким каналам. «Неадаптивная» система относится к системе на основе правил или фиксированной стратегии, которая не корректирует своё поведение в зависимости от действий пользователя или контекста, например, базовый уровень переключения на основе правил. Эти базовые линии служат ориентирами для оценки преимуществ мультимодального восприятия и адаптивных стратегий взаимодействия, реализованных в предлагаемом нами Transformer с моделей синтеза, ориентированного на внимание. Основываясь на предыдущих иерархических парадигмахHRC 31, наш метод привносит несколько важных инноваций:

В данной работе представлен механизм выравнивания на основе динамического искажения времени (DTW), который отображает ожидаемые низкоуровневые человеческие действия в узлы в иерархическом графе задач, в отличие от предыдущих мультимодальных систем взаимодействия, которые в основном сосредоточены на краткосрочном распознавании действий32. В условиях временной непредсказуемости и шумных мультимодальных входов это позволяет надёжно предсказывать долгосрочные намерения и отслеживать прогресс задач.

В предлагаемую систему интегрирован онлайн-модуль адаптации, который постоянно обновляет модели вывода намерений и прогнозирования действий во время взаимодействия. Это преодолевает недостатки статических или офлайн-обученных мультимодальных моделей, позволяя системе динамически адаптироваться к уникальному поведению, предпочтениям и контекстным изменениям пользователя.

Визуальные и слуховые методы динамически взвешиваются в зависимости от их контекстуальной важности на каждом этапе времени с помощью уникальной техники слияния, основанного на внимании. Этот подход слияния, основанный на данных, повышает устойчивость в различных условиях взаимодействия и заменяет его переключение модальностей на основе правил.

Это исследование включает лёгкий модуль объяснимости, который преобразует иерархическое планирование и решения по слиянию в понятные обоснования для устранения разрыва в интерпретируемости в адаптивных системах человека и ИИ. Это повышает качество долгосрочного сотрудничества и способствует правильной откалибровке доверия.

Предлагаемый подход направлен на обобщение за пределы воплощённых роботов на виртуальные агенты и интеллектуальные интерфейсы, расширяя его полезность во многих областях сотрудничества человека и ИИ, несмотря на то, что он был доказан в реальной совместной сборке с использованием роботизированной платформы.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Предлагаемая архитектура для усиления сотрудничества человека и ИИ использует адаптивный мультимодальный конвейер взаимодействия, объединяющий видение и речевые модальности в динамичной, иерархической структуре рассуждения. В этом исследовании использовались общедоступные данные ранее опубликованных экспериментов. Новых человеческих субъектов не было вовлечено, и дополнительное этическое одобрение не требовалось.

Предлагаемая архитектура адаптивного мультимодального взаимодействия

В основе системы система начинается с модулей восприятия, таких как визуальный поток фиксирует позу и движение пользователя с помощью RGB-D-датчиков, а аудиопоток анализирует речевые входы с помощью легкого ASR (автоматического распознавания речи). Такие сырые входы подаются в модуль предсказания действий на базе Transformer, который кодирует временные зависимости в последовательности поз и команд для рассуждений о низкоуровневых человеческих действиях. Впоследствии, для обеспечения высокоуровневого планирования сотрудничества, механизм динамического искажения времени (DTW) выравнивает обнаруженные действия с узлами заранее определённого графа задач для прогнозирования целей пользователя и следующих действий. Новый модуль синтеза, основанный на внимании, на каждом этапе времени определяет, какой модальность (аудио или визуализация) даёт наиболее контекстно важную информацию, и динамически корректирует веса входов. Для индивидуализации взаимодействия система включает адаптацию онлайн-моделей, адаптируя предикторы действий в реальном времени к изменяющемуся поведению пользователя. Лёгкий модуль объяснимости также создаёт удобные для пользователя резюме предсказанных намерений и решений ИИ для повышения прозрачности и доверия. Вся система тестируется в симулированной, но реальной кооперативной среде сборки, что позволяет сравнивать между унимодальными и адаптивно-мультимодальными средами. Такой подход способствует более адаптивному, интуитивно понятному и надёжному сотрудничеству с агентами ИИ во всех областях.

Рисунок 1 показывает архитектуру описанной Адаптивной мультимодальной рамки взаимодействия, направленной на улучшение сотрудничества между человеком и ИИ. Она начинается с фазы получения входов, которая основана на двух основных сенсорных устройствах: RGB-D для наблюдения визуальной информации с глубиной (например, осанки и движения человека) и направленном микрофоне для сбора речевых команд. Сырые сигналы затем проходят через модуль предварительной обработки, который обрабатывает аудиовизуальные данные для последующего анализа путём очистки, нормализации и форматирования входных потоков. Затем конвейер переходит к фазе извлечения признаков, где данные делятся на два потока: визуальный поток, который выделяет признаки позы и движения с помощью алгоритмов оценки позы, и аудиопоток, транскрибирующей речь в интерпретируемые вложения команд. Мультимодальный кодировщик трансформеров, использующий многоголовное самовнимание и временное позиционное кодирование для выражения долгосрочной взаимозависимости между последовательностями взаимодействия, затем обрабатывает слитое представление. Текущее целевой состояние пользователя оценивается с помощью долгосрочного прогноза намерений и прогресса задачи, а низкоуровневые действия отображаются с узлами в иерархическом графе задач для надёжного отслеживания задач с помощью модуля выравнивания на базе DTW. Веса слияния и параметры прогноза постоянно обновляются через онлайн-цикл адаптации модели в ответ на обратную связь взаимодействия, а модуль объяснимости предоставляет чёткие объяснения для повышения открытости и уверенности. Весь конвейер позволяет системе адаптивно и эффективно работать вместе с пользователями над динамическими задачами и средами.

figure-protocol-1
Рисунок 1: Обзор предлагаемой мультимодальной структуры взаимодействия на основе трансформеров. Используется техника с фокусом внимания для кодирования и динамической интеграции визуальных и слуховых данных. Модуль Transformer, интегрирующий иерархическое моделирование задач и онлайн-адаптацию, обрабатывает слитое представление для долгосрочного прогнозирования намерений и оценки прогресса задачи. . Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Предлагаемая система включает лёгкий модуль объяснимости, который работает в тандеме с компонентами мультимодального слияния и иерархического планирования для повышения прозрачности и уверенности пользователей. Модуль выводит интерпретируемые сигналы из выравнивания графов задач на основе DTW (например, текущий прогресс задачи и ожидаемое следующее действие) и слоя слияния, основанного на внимании (например, веса важности модальности). Эти сигналы преобразуются в понятные для человека объяснения, например, влияли ли в первую очередь устные команды или визуальные жесты на выбор системы и как ожидаемое действие вписывается в более широкий рабочий план. Пользователи получают объяснения в виде краткой письменной или визуальной обратной связи, что помогает им понять, предсказать и, при необходимости, исправлять поведение системы. Улучшение удовлетворенности пользователей, плавность взаимодействия и метрики, связанные с доверием, показаны в оценке, являются косвенными индикаторами восприятия объяснимости пользователями. Результаты свидетельствуют о том, что в долгосрочном взаимодействии человека и ИИ прозрачное рассуждение при принятии решений ИИ повышает уверенность пользователей, способствует сотрудничеству и повышает принятие адаптивного поведения системы.

Входные данные

Получение входных данных в задуманной структуре сотрудничества между человеком и ИИ осуществляется с помощью структурированного мультимодального сенсорного механизма, который сочетает как зрение, так и слуховые методы для эффективной реализации человеческих действий и намерений. Визуальный ввод осуществляется с помощью RGB-D-камеры, которая в реальном времени фиксирует позу человека, пространственное положение и контекст окружающей среды. Визуальные данные обрабатываются с помощью предварительно обученных моделей, таких как BlazePose, чтобы получить ключевые точки в верхней части тела для задач взаимодействия. Одновременно слуховая информация получается с направленного микрофона и интерпретируется с помощью предварительно обученной модели DeepSpeech для выявления речевых команд, которые уточняют или предоставляют дополнительные неопределённые визуальные сигналы. В кооперативных условиях система двойного входа обеспечивает динамическую адаптацию и восприятие контекста. Набор данных по обучению и оценке включает более 5 000 мультимодальных траекторий движения человека, 1 для различных взаимодействий, таких как сборка и передача поведения, собранных у четырёх пользователей в контролируемых и полуструктурированных условиях. Для улучшения обобщения система обеспечивает онлайн-адаптацию модели при развертывании, что позволяет модели обновлять свои прогнозы в реальном времени в зависимости от меняющегося поведения пользователя и динамики окружающей среды.

Описание набора данных

Набор данных для обучения и оценки предложенной структуры был получен в результате реальных экспериментов по совместной работе человека и робота в рамках задачи сборки игрушечного автомобиля с использованием робота KINOVAGEN3 1. Экспериментальная среда была направлена на имитирование долгосрочных совместных действий, включающих мультимодальное взаимодействие, включающее как визуальные, так и слуховые модальности. В частности, обучающий набор данных состоит из 3003 последовательностей траекторий от двух пользователей, а тестовый набор содержит 2088 последовательностей, включая данные двух новых пользователей для оценки обобщения моделей. Каждая траектория фиксирует пятишаговую последовательность ключевых точек поз верхней части тела, полученных с помощью BlazePose, а также соответствующие команды речи, расшифрованные DeepSpeech33. Собранные данные отражают естественные человеческие вариации в выражении жестов и команд при действиях, включая доставку объектов, использование инструментов и совместные действия. Мультимодальный набор данных служит основой для контролируемого обучения моделей прогнозирования действия и траектории DLinear и является центральным ориентиром в пользовательских исследованиях, проводимых в условиях только зрения, аудио и мультимодальных режимов. Включение различных типов пользователей и реалистичных условий шума гарантирует надёжность и адаптивность тестирования для постоянных систем HRC. В таблице 2 приведено подробное описание набора данных.

АтрибутыПодробности
Название набора данныхНабор данных по сборке игрушечных автомобилей (собран внутри компании)
Среда коллекцииРеальный эксперимент HRC с рукой KINOVA GEN3
Количество пользователей (обучение)2 пользователя
Количество пользователей (тестирование)4 пользователя (2 из тренировочного набора, 2 невидимых)
Общие траектории (тренировки)3 003 траектории
Общие траектории (тестирование)2 088 траекторий
Захваченные методыВизуальный (RGB-D для позы), аудио (команды речи)
Формат данныхКлючевые точки позы (из BlazePose), команды преобразования речи в текст
Временное разрешениеКаждая траектория включает 5-временные шаги
Выполненные задачи3 основные задачи: выбор и размещение, вращение объектов, совместная сборка
ИспользованиеКонтролируемое обучение моделей прогнозирования действий/траекторий; Пользовательское исследование

Таблица 2: Описание набора данных. Информация о среде симуляции, включая фреймворк программирования, настройки аппаратного обеспечения и среду оценки.

Предварительная обработка набора данных

Для обеспечения адаптивного мультимодального взаимодействия в сотрудничестве человека и ИИ, исходный набор данных, такой как визуальные (RGB и глубинные изображения), слуховые (речевые команды) и временные данные поведения (ключевые точки положения), подвергается структурированной предварительной обработке. Визуальные данные сначала извлекаются моделлюоценки позы f pose, обычно полученной из BlazePose или OpenPose. Для кадра t вектор позы человека определяется как:

figure-protocol-2(1)

где k — количество ключевых точек, а каждая ключевая точка содержит двумерные координаты. Последовательности нормализуются по длине торса и со временем сглаживаются фильтром Савицкого-Голея:

figure-protocol-3(2)

где w — размер окна фильтрации. Во-вторых, сырые аудиопотоки At разрезываются на сегменты с помощью детектора голосовой активности (VAD). Достоверные сегменты подаются в модель распознаванияречи (например, DeepSpeech) для извлечения командных токенов:

figure-protocol-4(3)

где V — словарный запас распознанных команд. Для интеграции командные токены для всех выравниваются по времени с визуальными временными метками поз с помощью функции выравнивания на основе интерполяции τ:

figure-protocol-5(4)

В-третьих, для формирования последовательностей figure-protocol-6тренировки временного намерения мы определяем последовательности траектории , а также связанные речевые команды figure-protocol-7. Они разделены на сегменты фиксированной длины с использованием скользящих окон размера l:

figure-protocol-8(5)

figure-protocol-9(6)

Наконец, входные данные нормализуются до нуля среднего и единичного дисперсии на ключевую точку для сходимости в моделях предсказания на основе траекторий:

figure-protocol-10(7)

где μj, σj — среднее и стандартное отклонение ключевой точки j, завершившей обучающий набор.

Извлечение признаков

В очерченной парадигме адаптивного мультимодального взаимодействия возможно сильное и в реальном времени сотрудничество за счёт сочетания визуальных, аудио и контекстных характеристик задачи. Конвейер извлечения признаков начинается с одновременного сбора данных из двух основных модальностей: визуальных figure-protocol-11 и аудиосигналов figure-protocol-12, индексируемых на шаге времени t. Эти наблюдения проходят через соответствующие модули восприятия для получения высокоуровневых семантических признаков, относящихся к человеческому поведению, намерению и команде речи.

Извлечение визуальных признаков

Исходные визуальные данные figure-protocol-13 с RGB-D-камер подаются через оценщик позы человека (например, BlazePose), предоставляющий пространственный вектор figure-protocol-14ключевых точек , где k представляет обнаруженное количество ключевых точек, а каждая содержит 3D-координаты:

figure-protocol-15(8)

Эти ключевые точки встраиваются во время в траекторию figure-protocol-16позы, из которой динамика движения извлекается посредством декомпозиции по тренду и сезону:

figure-protocol-17(9)

где ∈_t представляет остаточный шум.

Извлечение аудиофункций

Аудиовход figure-protocol-18 обрабатывается через заранее обученную модель распознавания речи (например, DeepSpeech) и создаёт токенизированное представление figure-protocol-19команды , где n — длина токена:

figure-protocol-20(10)

Мультимодальное слияние

Для построения единого контекста взаимодействия мы объединяем признаки с помощью доверительно взвешенного внимания, основанного на уверенности и взаимной информации:

figure-protocol-21(11)

где φV и φA — функции проекции для визуальных и слуховых признаков в общем латентном пространстве, а αt∈[0,1] — динамический модально-весительный термин, вычисляемый на основе энтропии:

figure-protocol-22(12)

Здесь figure-protocol-23 и figure-protocol-24 — взаимная информация между целевым состоянием g и наблюдаемыми модальностями.

Планирование с использованием контекстного вложения

Последний мультимодальный вектор признаков Ft обогащается контекстом задачи ипрогрессом задачи P t и становится входным состоянием для модуля адаптивного планирования:

figure-protocol-25(13)

Эта извлечённая функция xt используется как входные данные для моделей дальнейшего прогнозирования намерений и планирования движения, поддерживая адаптивное и надёжное сотрудничество человека и ИИ в динамических и неопределённых условиях.

Прогнозирование действий и планов с помощью выравнивания графа задач

После мультимодального процесса извлечения признаков, при котором в последующей обработке интегрируются намерения речи (аудио), траектория позы (визуальная) и контекстная (например, журналы задач или эмоции), адаптивное предсказание человеческих действий и вывод плана с использованием иерархического выравнивания графов задач.

Пусть интегрированный мультимодальный вектор признаков на шаге времени t будет представлен как:

figure-protocol-26(14)

Система изначально прогнозирует низкоуровневое действие человека с помощью функцииfact, которая часто представлена как рекуррентный энкодер-декодер или трансформатор:

figure-protocol-27(15)

где F(t-k:t) обозначает последовательность слияния признаков в последних k временных шагах, а figure-protocol-28 — прогнозируемое действие из множества действий A. Модуль онлайн настраивается с помощью адаптивных потерь:

figure-protocol-29(16)

Здесь CE — это кросс-энтропийная потеря классификации действий, тогда второй член подталкивает к хорошему прогнозированию будущей траектории.

Для высокоуровневого прогнозирования плана мы формулируем задачу как прогрессию вдоль иерархического графа задачи G = (N, E), где каждый узел ni ∈N обозначает подзадачу или промежуточную цель. Цель — сопоставить наблюдаемую последовательность действий с эталонным путём задачи R*∈G, уменьшая расстояние:

figure-protocol-30(17)

Где Pt обозначает текущий след прогресса, а d(⋅) — метрику динамического искажения времени (DTW) или метрику мягкого выравнивания.

Конечный намерение на уровне figure-protocol-31 плана затем выводится путем проекции предсказанного действия a ̂_t на наиболее вероятный следующий шаг в выровненном пути figure-protocol-32:

figure-protocol-33(18)

Такое иерархическое декодирование гарантирует, что даже при неясном или шумном сенсорном вводе система выбирает наиболее контекстно релевантное высокоуровневое намерение, соответствующее текущей последовательности задач. Такое предиктивное планирование не только повышает эффективность сотрудничества, но и повышает ожидание и адаптивность в многоповоротном взаимодействии человека и ИИ.

Мультимодальный слияние (основанный на внимании) механизм

В адаптивном сотрудничестве человека и ИИ мультимодальная интеграция нескольких сенсорных модальностей (например, визуальная: человеческая поза, траектория; слуховая — речевые команды) необходима для правильной интерпретации намерения пользователя. Подход, основанный на правилах или статическом слиянии, не справляется с реальными динамичными человеческими взаимодействиями. Для этого здесь представлен механизм слияния, основанный на внимании, который динамически взвешивает каждую модальность в зависимости от её контекстуальной важности на каждом этапе времени.

Обозначает извлеченные векторы признаков из визуальной и аудиомодальности как figure-protocol-34 и figure-protocol-35, соответственно. Эти векторы кодируют семантическую информацию, полученную через более ранние процессорные конвейеры, например, визуальные признаки могут возникать в результате оценки позы и предсказания действий, а аудиопризнаки — из вложений речи с помощью моделей, таких как DeepSpeech или wav2vec.

Цель слияния, основанного на внимании, — рассчитать специфические по модальности веса внимания, отражающие относительную значимость каждой модальности. Это делается с помощью механизма мягкого внимания.

Вычисление по весу внимания

На первом этапе оба вектора трансформируются в пространство общего внимания через обучаемую трансформацию. То есть для каждой модальности i∈{V,A} промежуточный балл внимания рассчитывается как:

figure-protocol-36(19)

где figure-protocol-37 и figure-protocol-38 — параметры, изучаемые по сети внимания, а Tanh — нелинейная функция активации. Это преобразование позволяет модели извлекать высокоуровневые корреляции и контекстную значимость каждой модальности.

Эти ненормированные оценки внимания eV иα A затем нормализуются с помощью функции softmax, так что сумма составляет 1

figure-protocol-39(20)

Здесь αV и αA — это вес внимания над визуальными и аудиомодальностями соответственно. Веса адаптивны и обновляются со временем в зависимости от текущего контекста задачи, качества сигнала и активности пользователя.

figure-protocol-40(21)

Полученное слитое представление figure-protocol-41 получается в виде взвешенной комбинации векторов входной модальности:

Этот комбинированный вектор кодирует общую семантику визуальной и слуховой информации таким образом, что активно выделяет наиболее информативный поток. Затем он подаётся в последующие модули, такие как сопоставление графов задач, предсказание намерений или движок планирования движения роботов.

Алгоритм 1: слияние на основе мультимодального внимания

Вход: вектор визуальных признаков — hVR d, вектор аудиоэлементов — hAR d

Обучаемые параметры: W∈R k*d,wR k и b∈R k

Выход: сплавленное представление hfused∈rd.

Шаг 1: Определить промежуточные представления с помощью вычислений с помощью уравнения 19

Шаг 2: Используйте Softmax для нормализации оценок внимания с помощью уравнения 20

Шаг 3: Вычислите вектор слияния с помощью уравнения 21

Шаг 4: Вернутьh-сплавленный

Алгоритм Attention-Based Multimodal Fusion обеспечивает умное слияние функций различных входных модальностей, таких как визуальные и аудиопотоки, в контекстно-ориентированной форме. Слияние необходимо в системах, где каждая модальность представляет дополняющую, но вариативную информацию, например, в совместных условиях человека и ИИ, где зрение фиксирует жесты или положение тела, а аудио — речевые команды или голосовые сигналы.

Алгоритм 1 начинается с определения промежуточных представлений для каждой модальности. Для вычисления обеих моделей — eV для визуального потока и eA для аудиопотока — слой общей нейронной сети сначала выполняет нелинейное преобразование соответствующих векторов признаков. Затем веса внимания αV и αA рассчитываются с помощью функции softmax над промежуточными баллами. Это помогает весам быть положительными и суммироваться в 1, фактически нормализуя вклад каждой модальности. Чем более информативна модальность, как это смоделировано, тем выше её внимание.

В конечном итоге алгоритм вычисляет слитое изображение h,сплавленное через взвешенную комбинацию графических и аудиовекторов признаков, нормализованную с учетом соответствующих весов внимания. Этот сплавленный вектор объединяет оба режима в контекстно-ориентированном на данные и используется для последующих задач, таких как распознавание намерений, принятие решений или планирование движений роботов. В целом этот алгоритм позволяет системе динамически фокусироваться на наиболее релевантной модальности или комбинации модальностей в конкретный момент, вместо использования фиксированных или основанных на правилах методов слияния. Это делает фреймворк более прочным, гибким и отзывчивым в динамических ситуациях взаимодействия человека и ИИ.

Рисунок 2 иллюстрирует рабочий процесс механизма мультимодального слияния на основе внимания, который работает в контекстно-зависимой интеграции визуальных и слуховых входов. Визуальное извлечение признаков, первый этап в рабочем процессе, включает извлечение пространственных или связанных с позами признаков из входных изображений или видео (например, RGB-D-камер). Затем они вводятся в модуль визуального внимания, который учится выделять наиболее информативное содержание визуальной информации. Параллельно модули Audio Attention обрабатывают вложения речи или аудиотокены из устных команд, придавая контекстное значение различным слуховым сигналам. Полученные элементы, взвешенные по уровню внимания, интегрируются через слой синтеза на основе внимания и передаются в позиционную сеть с остаточными соединениями и нормализацией слоёв, формируя стандартный блок кодировщика трансформатора. Результат представляет собой унифицированное мультимодальное вложение, поддерживающее надежное прогнозирование намерений с долгосрочным горизонтом и адаптивное принятие решений при различных условиях взаимодействия. Такая конструкция позволяет системе избирательно концентрироваться на более надёжной модальности в любой момент, повышая устойчивость и интерпретируемость в реальном времени взаимодействия человека и ИИ.

figure-protocol-42
Рисунок 2: Детальная конструкция мультимодального модуля термоядерного синтеза с фокусом внимания. Для создания контекстно-ориентированного слияного представления на каждом этапе времени модально-специфические энкодеры собирают признаки из визуальных и звуковых потоков. Эти признаки затем динамически взвешиваются с помощью механизма внимания, основанного на данных. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Адаптация онлайн-моделей

Для обеспечения высококачественного сотрудничества человека и ИИ в различных моделях поведения и контекстах пользователей наш фреймворк включает онлайн-механизм адаптации моделей, который постепенно оптимизирует пользовательские модели во время взаимодействия. Модуль отслеживает поведенческие сигналы в реальном времени (например, поза, траектории жестов, тон речи) и обновляет базовые предиктивные модели с помощью алгоритмов инкрементального обучения. В частности, модели предсказания траектории и распознавания намерений тонко настраиваются с учётом последних данных с помощью градиентной тонкой настройки или низкоранговой адаптации (LoRA), чтобы система могла адаптироваться к изменяющемуся поведению пользователя или требованиям конкретных задач без полного переобучения.

Слой обратной связи взаимодействует с адаптацией как через неявную обратную связь (например, исправления, задержки, задержки), так и явные команды (например, речь или графический интерфейс). У него две цели: адаптивная калибровка значимости мультимодальных сигналов и передача мер доверия/доверия модулям принятия решений и управления.

Цикл обратной связи обеспечивает более плавное выполнение задач и ориентированные на пользователя ответы. Для укрепления доверия и прозрачности фреймворк интегрирует модуль объяснимости, который превращает низкоуровневые решения моделей в понятные человеку обоснования. Он использует отображения рационализации из мультимодального термотрансформатора, дополненные логическим трассированием через граф задач. По желанию он может представить это обоснование через графический интерфейс или аудиопомощник, чтобы пользователи могли понять и, возможно, даже скорректировать поведение системы.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Предлагаемая здесь адаптивная мультимодальная модель взаимодействия решает эти проблемы и значительно улучшает сотрудничество человека и ИИ, органично сочетая визуальные и речевые модальности с процессами адаптации пользователя в реальном времени. В отличие от базовой иерархической мультимодальной системы, наш подход включает персонализированную обратную связь, а также адаптацию с учётом когнитивной нагрузки, что обеспечивает более интуитивное, контекстно-ориентированное взаимодействие. ...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Результаты убедительно демонстрируют эффективность предлагаемой адаптивной мультимодальной основы взаимодействия для улучшения сотрудничества человека и ИИ.

Помимо стандартных оценочных показателей, таких как время выполнения задачи (TCT), точность прогнозирования человеческих намерений (HIPA), эффективность мультимодального синтеза (MFE), коэффициент восстановления ошибок (ERR), оценка удовлетворённости пользователя (USS) и индекс плавности взаимодействия (IS...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конфликтов интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы с благодарностью выражают благодарность за поддержку, оказанную Школой дизайна Университета Цзяннань в Уси, Китай.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Камера RGB-D (Intel RealSense D435)Intel CorporationD435Разрешение глубины 1280 и больше раз; 720 пикселей @ 30 кадров в секунду; RGB разрешение 1920 и больше раз; 1080 пикселей @ 30 кадров в секунду; используется для фиксации позы пользователя, движений тела и пространственного контекста
Направленный микрофонУниверсальные / Несколько поставщиковН/ДШирокополосный, шумоподавляющий микрофон (16 кГц, панель приборов; 44,1 кГц); Используется для сбора устных команд
BlazePose (предобученная модель)Googlehttps://developers.google.com/mediapipe/solutions/vision/poseМодель оценки позы с 33 ключевыми точками; Извлечение поз человека в реальном времени
OpenPose (предобученная модель)Лаборатория перцептивных вычислений CMUhttps://github.com/CMU-Perceptual-Computing-Lab/openposeМультиперсональная система оценки поз, используемая для извлечения траекторий движения
Движок ASR DeepSpeechMozillav0.9.3Предварительно обученная модель автоматического распознавания речи для транскрипции речи в текст
Двигатель wav2vec 2.0 ASRMeta AIhttps://github.com/facebookresearch/fairseqМодель самоконтролируемого представления речи для обработки речи в реальном времени
Модель прогнозирования действий на основе трансформаторов (DLinear / Seq2Seq)Пользовательская реализацияН/ДАрхитектура временного энкодера-декодера с вниманием к краткосрочному прогнозированию действий
Модуль динамического искажения времени (DTW)Пользовательский / SciPyhttps://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.distance.cdist.htmlАлгоритм мягкого выравнивания для сопоставления действий пользователя с заранее определёнными графами задач
Мультимодальная сеть слияния на основе вниманияПользовательская реализацияН/ДМеханизм внимания, взвешенного по довериям, для объединения зрения и речи
Онлайн-модуль адаптации (LoRA / на основе градиента)Пользовательская реализацияhttps://github.com/microsoft/LoRAЛёгкая, параметрически эффективная настройка для адаптации к поведению пользователя
Модуль объяснимости (правила + карты внимания)Пользовательская реализацияН/ДПредоставляет интерпретируемое обоснование принятия решений с помощью правил и визуализаций внимания
Роботизированная рука KINOVA Gen3KINOVA RoboticsGen3роботизированный манипулятор 7-ступени с интегрированными датчиками крутящего момента; Используется для совместной сборки игрушечных автомобилей
Среда симуляции кооперативной сборкиПользовательская средаН/ДРеальная сборка игрушечных машинок, используемая для мультимодального совместного бенчмаркинга
Метрики оценки (TCT, HIPA, MFE, Latency, ERR, USS, ISI)Пользовательские определенияН/ДКоличественные и ориентированные на пользователя метрики для оценки эффективности, точности и доверия сотрудничества

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Yu, P., Abuduweili, A., Liu, R., Liu, C. Robustifying long-term human-robot collaboration through a hierarchical and multimodal framework. arXiv. , (2024).
  2. Cheng, Y., Sun, L., Liu, C., Tomizuka, M. Towards efficient human-robot collaboration with robust plan recognition and trajectory prediction. IEEE Robot Autom Lett. 5, 2602-2609 (2020).
  3. Abuduweili, A., Li, S., Liu, C. Adaptable human intention and trajectory prediction for human-robot collaboration. arXiv. , (2019).
  4. Amirova, A., Rakhymbayeva, N., Yadollahi, E., Sandygulova, A., Johal, W. Ten years of human-NAO interaction research: A scoping review. Front Robot AI. 8, 744526(2021).
  5. Liu, R., Liu, C. Human motion prediction using adaptable recurrent neural networks and inverse kinematics. IEEE Control Syst Lett. 5, 1651-1656 (2021).
  6. Wang, T., Zhao, Y., Chen, L., Li, Q., Xu, Y., Zhang, H. Multimodal human-robot interaction for human-centric smart manufacturing: A survey. Adv Intell Syst. 6, 2300359(2024).
  7. Ergonomic adaptation of robotic movements in human-robot collaboration. van den Broek, M. K., Moeslund, T. B. Companion Proc. ACM/IEEE Int Conf Hum-Robot Interact, 2020, 499-501 (2020).
  8. Human-robot collaboration using multimodal perception. Yang, Y., et al. Proc IEEE Int Conf Robot Biomimetics (ROBIO), , 358-363 (2021).
  9. Sawadwuthikul, G., et al. Intelligent manufacturing with deep reinforcement learning. IEEE Trans Ind Inform. 18, 1883-1894 (2022).
  10. Multimodal robotic manipulation in collaborative tasks. Huang, W., Gu, J., Duan, P., Hou, S., Zheng, Y. Proc IEEE Int Conf Robot Autom (ICRA), , 14213-14219 (2021).
  11. Dellermann, D., et al. The future of human-AI collaboration: A taxonomy of design knowledge for hybrid intelligence systems. arXiv. , (2021).
  12. Ostheimer, J., Chowdhury, S., Iqbal, S. An alliance of humans and machines for machine learning: Hybrid intelligent systems and their design principles. Technol. Soc. 66, 101647(2021).
  13. Afsar, B., Al-Ghazali, B. M., Cheema, S., Javed, F. Cultural intelligence and innovative work behavior: The role of work engagement and interpersonal trust. Eur J Innov Manag. 24, 1082-1109 (2020).
  14. Spadaro, G., Gangl, K., Van Prooijen, J. W., Van Lange, P. A. M., Mosso, C. O. Enhancing feelings of security: How institutional trust promotes interpersonal trust. PLoS ONE. 15, e0237934(2020).
  15. Pavez, I., Gómez, H., Laulié, L., González, V. A. Project team resilience: The effect of group potency and interpersonal trust. Int J Proj Manag. 39, 697-708 (2021).
  16. Yuan, H., Long, Q., Huang, G., Huang, L., Luo, S. Different roles of interpersonal trust and institutional trust in COVID-19 pandemic control. Soc Sci Med. 293, 114677(2022).
  17. Yun, Y., Ma, D., Yang, M. Human-computer interaction-based decision support systems with applications in data mining. Future Gener Comput Syst. 114, 285-289 (2021).
  18. Nazar, M., Alam, M. M., Yafi, E., Su'ud, M. M. A systematic review of human-computer interaction and explainable artificial intelligence in healthcare. IEEE Access. 9, 153316-153348 (2021).
  19. Ho, Y. H., Tsai, Y. J. Open collaborative platforms for multi-drone search and rescue operations. Drones. 6, 132(2022).
  20. VAHAK: A blockchain-based outdoor delivery scheme using UAVs for healthcare 4.0 services. Gupta, R., et al. Proc IEEE INFOCOM Workshops, , 255-260 (2020).
  21. BloCoV6: A blockchain-based 6G-assisted UAV contact tracing scheme for COVID-19. Zuhair, M., Patel, F., Navapara, D., Bhattacharya, P., Saraswat, D. Proc 2nd Int Conf. Intell Eng Manag (ICIEM), , 271-276 (2021).
  22. Sahoo, S. K., et al. Intelligent trust-based utility and reusability model using UAV-assisted sensor networks. Appl Sci. 12, 1317(2022).
  23. Ko, Y., et al. Drone secure communication protocol for future sensitive military applications. Sensors. 21, 2057(2021).
  24. Gupta, R., Kumari, A., Tanwar, S., Kumar, N. Blockchain-envisioned softwarized multi-swarming UAVs to tackle COVID-19 situations. IEEE Netw. 35, 160-167 (2020).
  25. Tomsett, R., et al. Rapid trust calibration through interpretable and uncertainty-aware. Patterns. 1, 100049(2020).
  26. Huang, R., Zhou, H., Liu, T., Sheng, H. Multi-UAV collaboration to survey Tibetan antelopes in Hoh Xil. Drones. 6, 196(2022).
  27. Seeber, I., et al. Machines as teammates: A research agenda on AI in team collaboration. Inf Manag. 57, 103174(2020).
  28. Ajoudani, A., et al. Progress and prospects of the human-robot collaboration. Auton Robots. 42, 957-975 (2018).
  29. Oviatt, S., et al. The Handbook of Multimodal-Multisensor Interfaces, Volume 1: Foundations, User Modeling, and Common Modality Combinations. , Association for Computing Machinery. New York, NY, USA. (2017).
  30. Villani, V., Pini, F., Leali, F., Secchi, C. Survey on human-robot collaboration in industrial settings. Mechatronics. 55, 248-266 (2018).
  31. Nikolaidis, S., et al. Human-robot collaboration in manufacturing: Quantitative evaluation of predictable, convergent robot behavior. Auton Robots. 41, 123-140 (2017).
  32. Roggen, D., Junker, M., Transter, G., Roques, D. L. Collecting complex activity datasets in smart environments. J Ambient Intell Humaniz Comput. 1, 1-17 (2009).
  33. Bazarevsky, V., et al. BlazePose: On-device real-time body pose tracking. arXiv. , (2020).
  34. Garcia, S., Gomez-Donoso, F., Cazorla, M. Enhancing human-robot interaction: Development of a multimodal robotic assistant for user emotion recognition. Appl Sci. 14, 11914(2024).
  35. Li, S., et al. Toward proactive human-robot collaborative assembly: A multimodal transfer-learning-enabled action prediction approach. IEEE Trans Ind Electron. 69, 8579-8588 (2021).
  36. Abdelrahman, A. A., Almotiri, J., Yaseen, Q., Alanazi, A., Alotaibi, B. Multimodal engagement prediction in multiperson human-robot interaction. IEEE Access. 10, 61980-61991 (2022).
  37. Chiossi, F., et al. Designing intent: A multimodal framework for human-robot cooperation in industrial workspaces. arXiv. , (2025).
  38. McGrath, M. J., Chen, Y., Patel, A., Smith, J., Rao, V. Collaborative human-AI trust (CHAI-T): A process framework for active management of trust in human-AI collaboration. arXiv. , (2024).
  39. Fragiadakis, G., Nikas, C., Karageorgiou, E., Papadopoulos, A. Evaluating human-AI collaboration: A review and methodological framework. arXiv. , (2024).
  40. Younis, H. A., Khan, S., Raza, M., Ahmed, F., Mahmood, T. Multimodal age and gender estimation for adaptive human-robot interaction: A systematic literature review. Processes. 11, 1488(2023).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи