Это исследование было одобрено Комитетом по этике исследований Университета Тейлора, Субанг-Джая, Малайзия. Все процедуры соответствовали этическим нормам, установленным институциональным исследовательским комитетом, и соответствовали Хельсинкской декларации. До сбора данных от каждого участника получалось информированное согласие. Им были четко проинформированы о целях исследования, заверили, что участие добровольное, что их ответы останутся конфиденциальными и что они могут отказаться в любой момент без каких-либо последствий. Письменное информированное согласие также было получено для использования анонимных данных взаимодействия и опросов в академических публикациях. В этой рукописи не включена личная информация, изображения или конфиденциальные персональные данные.
Предлагаемая работа разрабатывает систему виртуальной реальности (VR) на основе жестов и голоса, предназначенную для иммерсивного домашнего проектирования, превосходящей современные методы, ориентированные на навигационные задачи. Подход начинается с определения потребностей пользователей и проектных задач, включая размещение мебели, масштабирование и вращение объектов, редактирование материалов и точные измерения помещения. Затем разрабатывается система взаимодействия жестов, в которой неограниченные жесты рук (такие как щипка, захват и поворот) обнаруживаются с помощью отслеживания на гарнитурах или MediaPipe Hands и определяются с помощью лёгких моделей машинного обучения, включая временные сверточные сети (TCN). В дополнение к жестам устанавливается организованная грамматика голосовых команд, сочетаемая с автоматическим распознаванием речи на основе шёпота (ASR) и пониманием естественного языка (NLU), чтобы вывести намерения и параметры для высокоуровневого семантического контроля. Обе модальности объединены в мультимодальную стратегию слияния, где жесты используются для управления пространственным выбором и манипуляцией, а голосовые команды — для точных доработок, дополненных механизмом арбитража, основанным на доверии, и восстановлением ошибок с помощью команд отмены.
Иммерсивная среда дизайна реализована в Unity 3D, включающая кнопки snapping, реакцию на столкновения, наложения измерений и интерактивную библиотеку мебели и материалов для реалистичных рабочих процессов проектирования. Пилотные испытания проводятся для обеспечения естественности взаимодействия, стабильности и низкой задержки (<200 мс) перед формальной оценкой.
Участники и стратегия выборки
Всего для пользовательского исследования было привлечено 48 участников, чтобы обеспечить разнообразие и обобщаемость результатов. Возраст участников варьировался от 19 до 62 лет (M = 32,4, SD = 10,7), из них 26 мужчин и 22 женщины. Чтобы зафиксировать разнообразие в знакомстве с иммерсивными технологиями, участников делили на три группы VR-опыта: начинающих пользователей (n = 18) с минимальным или отсутствующим опытом VR, пользователей среднего уровня (n = 17) с редким использованием VR и опытных пользователей (n = 13), которые регулярно использовали VR, в основном профессионально. Для обеспечения доступности и инклюзивности выборки также были включены 6 участников с лёгкими ограничениями подвижности и 4 участника, предпочитающих взаимодействие одной рукой из-за моторных ограничений. У всех участников было либо нормальное, либо скорректированное до нормы зрение, при этом никто не сообщал о вестибулярных или неврологических заболеваниях, которые могли бы мешать использованию VR.
Участников случайным образом распределяли по трём условиям взаимодействия с использованием сбалансированной стратегии распределения: жест + голос (n = 16), только с контроллером (n = 16) и гибрид (n = 16). Их уровень опыта был равномерно распределен между тремя группами, чтобы избежать предвзятости и обеспечить сопоставимую сложность выполнения задач в разных условиях. Все участники предоставили письменное информированное согласие перед началом эксперимента.
Затем проводится исследование пользователей по трём условиям взаимодействия, таким как голос жестов, только для контроллера и гибрид, чтобы оценить точность, эффективность и пользовательский опыт. Количественные показатели включают точность размещения, продолжительность задачи и уровень ошибок, тогда как субъективная оценка использует SUS, NASA-TLX и IPQ, поддерживаемые качественными интервью. Эта система, представленная здесь, предлагает три основных новшества: использование мультимодального слияния жеста и голоса для точной обработки объектов в VR, адаптивных и доступных режимов взаимодействия, таких как жесты одной руки и голоса, а также предоставление воспроизводимого корпуса аннотированных команд жест-голос. В сочетании эти шаги обеспечивают повышенную точность, эффективность и пользовательский опыт, напрямую устраняя недостатки базового документа и продвигая исследования в области иммерсивного VR-взаимодействия для дизайна. Рисунок 1 показывает архитектуру предлагаемого метода.
Архитектура системы предлагаемого метода, как показано на рисунке 1, начинается с входных модальностей, где жесты записываются с помощью наборов данных, таких как EgoGesture и IPN Hand, а голосовые инструкции — из набора данных Fluent Speech Commands. Эти входные данные обрабатываются независимо с помощью модулей распознавания жестов и голосового распознавания для получения пространственных и семантических данных. Оба потока объединены в мультимодальный слой слияния, который выравнивает жесты и голосовые вводы для создания последовательных команд. Эти объединённые данные используются в слое взаимодействия VR для облегчения пользователей в манипуляции объектами с помощью размещения, вращения, масштабирования и модификации материалов в реальном времени. Наконец, обработанные взаимодействия доступны в выходном слое, создавая погружающее пространство для дизайна дома, ориентированное на доступность, точность и естественное взаимодействие.
Требования к системе и определение задач
Задуманная система улучшает модели VR-навигации с ориентацией на доступность для обеспечения точного планирования дома. Мы определяем пользовательский домен как
, где
являются домовладельцы,
профессионалы в области дизайна и
пользователи доступности (пожилые или с ограниченной подвижностью). Каждый пользователь выполняет набор основных задач T = {разместить, вращать, масштабировать, масштабировать, материалить, светить, измерять}. Задача t ∈ T выполняется с помощью мультимодальных входов: поток жестов G t (пространственная обработка) и голосовая команда Vt (семантические параметры). Система связывает это с действием через политику слияния:
(1)
где π — мультимодальная функция на уровне принятия решения.
Системные потребности требуют взаимодействия с низкой задержкой: распознавание
жестов, понимание речи и время слияния.
(2)
Суммарный отклик обеспечивает оперативную реакцию в реальном времени в соответствии с погружёнными порогами удобства VR.
Для точности задачи пусть состояние объекта с основной истинностью будет (x, R, s, M, L) (положение, вращение, масштаб, материал, длина), а реализованное состояние системы —
. Метрики ошибок следующие:
(3)
(4)
(5)
(6)
С материальным
несоответствием.
Обе модальности генерируют оценки доверия cg (жест) и cv (голос), нормализованные так, что cg + c v = 1. Арбитраж по слиянию минимизирует взвешенную ошибку:
(7)
Где lg,l v — это потери, специфичные для модальности. Если
, система запрашивает уточнение, что делает её устойчивой для неясных команд.
Наконец, метрики оценки включают время выполнения задачи tt, уровень ошибок Et и оценки нагрузки от NASA-TLX, SUS и IPQ. Мы вводим составный индекс производительности задач:
(8)
чтобы быть минимизированным среди пользователей, с порогами, требующими SUS-рейтинга ≥70 и снижением NASA-TLX по сравнению с базовой VR на базе контроллеров.
Сбор и предобработка наборов данных
Предлагаемая система основана как на данных жестов (для распознавания на основе TCN), так и на данных голосовых команд (для NLU/ASR). Для этой цели мы используем три основных набора данных: EgoGesture для динамических непрерывных жестов в VR-подобных средах, IPN Hand для дополнения естественных коротких жестов и Fluent SpeechCommands 44 для обучения голосового семантического понимания дизайн-высказываний. Дополнительные наборы данных — HaGRID для предварительного обучения детектора статических жестов и Mozilla Common Voice для общего предварительного обучения ASR, но ни один из них не является обязательным. Такой выбор позволяет охватить обе модальности, сохраняя при этом максимально разумный и воспроизводимый объем наборов данных. Таблица 1 показывает детали набора данных предлагаемой работы.
Выбор набора данных в этой статье имеет решающее значение, поскольку каждый набор данных разработан для рассмотрения уникального сценария мультимодального VR-взаимодействия. Набор данных EgoGesture предоставляет крупномасштабную, натуралистическую коллекцию жестов рук, обеспечивая высокую эффективность распознавания несмотря на разные условия освещения и окружающей среды. Поскольку набор данных IPN Hand предназначен для неограниченных, непрерывных движений рук, он особенно подходит для операций высокого контроля и сегментации жестов в реальном времени. Кроме того, набор данных Fluent Speech Commands предлагает маркированные голосовые команды с семантическими аннотациями для обнаружения намерений, что крайне важно для обеспечения точного и естественного выполнения команд в VR. В совокупности эти наборы данных обеспечивают дополнительное покрытие как жестов, так и речевых модальностей, обеспечивая разнообразие, надёжность и повседневную эффективность, улучшая оценку предлагаемой системы. Помимо публичных наборов данных, мы также проверили протокол с помощью независимого внутреннего набора данных, включающего 312 образцов жестов и 128 голосовых команд от 10 новых участников. Эта независимая проверка подтвердила воспроизводимость и надёжность протокола.
Предварительная обработка данных
Собранная информация систематически нормализуется, отбирается и дополняется перед обучением модели:
Нормализация последовательности жестов
Видеопоследовательность жестов представлена как многомерный временной ряд признаков скелетных суставов:
(9)
Где Ti — длина i-го жеста, а d — размерность признаков (например, расположение суставов руки). Поскольку разные жесты могут иметь разную длину Ti, мы пересэмплируем их в постоянную длину последовательности T:
(10)
Это делает все сэмплы жестов, независимо от длительности записи, сопоставимы со стандартной временной длиной, которая может использоваться для тренировки TCN.
Стандартизация признаков
Чтобы устранить различия в масштабе между пользователями и условиями записи, каждое пространство функций стандартизируется:
(11)
Где
— среднее значение признака j, а σj — её стандартное отклонение. Нормализация таким образом гарантирует, что признаки центрируются с дисперсией единиц, а индивидуальные различия в производительности жестов минимизированы.
Дополнение данных
Включение синтетических возмущений повышает устойчивость к вариабельности. Временной джиттер сначала случайным образом смещает выравнивание последовательности:
(12)
где δ — максимальный джиттер в кадрах. Впрыск шума вторая секунда добавляет гауссовские возмущения к особенностям:
(13)
Эти улучшения позволяют модели быть устойчивой к отрывам времени и шуму датчиков в реальных VR-взаимодействиях.
Предварительная обработка голоса
Каждое произнесённое высказывание изначально отображается в лог-мел-спектрограмме:
(14)
где F — количество частотных блоков, а T′ — количество временных систем. Для компенсации изменчивости записи признаки спектрограммы нормализуются следующим образом:
(15)
Где μV, σV — глобальное среднее и стандартное отклонение над корпусом. Это обеспечивает стабильное акустическое пространство для моделей ASR и NLU.
Кодирование слотов в интенте
Помимо акустических особенностей, каждая голосовая команда обозначена структурированными семантическими слотами:
(16)
где, например, «повернуть стул на 15 градусов» соответствует (действие = вращать, объект = кресло, местоположение = ноль). Это систематическое кодирование позволяет системе получать специфические параметры дизайна и превращать их в исполняемые VR-операции.
Проектирование взаимодействия жестов с временной сверточной сетью (TCN)
Дизайн взаимодействия жестов определяет, как пользователи взаимодействуют с виртуальными объектами в системе домашнего дизайна VR с использованием естественных жестов рук. Дизайн начинается с разработки жестового лексикона — ассоциации жестов с функциями системы. Например, жест захвата мог управлять расположением объектов, щипка — масштабированием, а жест вращения — поворачивать объекты вокруг выбранной оси.
В рассматриваемой системе EgoGesture и IPN Hand служат базовыми наборами данных жестов для обучения Временной сверточной сети (TCN), а команды плавной речи дополняют дизайн возможностями голосового взаимодействия. В совокупности они обеспечивают мультимодальное VR-взаимодействие.
Жестовые представления из набора данных
Последовательность жестов из EgoGesture или IPN Hand представляет собой многомерный временной ряд:
(17)
(18)
Здесь T — это заранее определённое количество кадров (после перевыборки), а d — количество размеров скелетных признаков (например, расположения трёхмерных соединений). В наборе данных есть метки y(i) ∈ y , указывающие на один из классов жестов C.
Временное сверточное кодирование
Мы используем Временную сверточную сеть (TCN) для классификации жестов в реальном времени. TCN фиксирует краткосрочные и долгосрочные зависимости в последовательностях жестов. ТКН, в отличие от РНН, используют расширенные причинные свёртки, которые обеспечивают эффективные параллельные вычисления.
TCN применяет эти последовательности через причинно-расширённые свёртки для изучения краткосрочных и долгосрочных зависимостей:
(19)
где dL — коэффициент расширения в слое l, K — размер ядра, а σ — нелинейная активация (ReLU). Рецептивное поле зависит от:
(20)
требуя от TCN охватывать жесты разной временной длины.
Классификация жестов
Последнее скрытое состояние проходит через классификатор Softmax:
(21)
с целью обучения, определяемой кросс-энтропией:
(22)
Интеграция с голосовыми командами
В то время как пространственные операции (движение, вращение, масштабирование) реализуются распознаванием жестов с помощью EgoGesture и IPN Hand, для семантических команд применяется набор данных Fluent Speech Commands. Каждое высказывание преобразуется в структурированное представление слота:
которое усиливает ввод жеста, предлагая параметры (например, «повернуть стул на 15°»).
Тогда оба выхода объединяются:
(23)
Где o(i) — примитив управления VR (размещение, масштабирование, вращение).
Временная сверточная сеть (TCN) эффективна для обработки последовательных данных, используя расширенные одномерные свёртки на входных последовательностях, таких как жестовые или речевые сигналы, как показано на рисунке 2. В отличие от повторяющихся моделей, ТКН используют сверточные фильтры для изучения как краткосрочных, так и долгосрочных временных связей. Остаточные блоки с пропускающими соединениями используются для обеспечения стабильности во время обучения и предотвращения нулевых градиентов, тогда как использование слоёв TCN позволяет сети изучать многомасштабные временные паттерны. В конечном итоге полностью связанный слой классификации проецирует изученные временные признаки в выходные метки, такие как классы жестов или устные намерения. Эта конструкция особенно подходит для непрерывного распознавания жестов и понимания голосовых команд, поскольку сочетает вычислительную эффективность с сильными возможностями временного моделирования.
Таблица 2 обобщает общий архитектурный дизайн и обучающую конфигурацию Временной сверточной сети, используемой в предлагаемой системе распознавания жестов. Модель включает четыре остаточных блока TCN, каждый из которых основан на расширенных причинных свертках, позволяя сети моделировать как краткосрочные, так и дальние временные зависимости. Эти зависимости крайне важны для различия динамических жестов, таких как захват, вращение и щипкание. При размере ядра 3 и коэффициентах дилатации коэффициенты дилатации [1,2,4,8] эффективно расширяют временное рецептивное поле без увеличения вычислительных затрат. Для улучшения обобщения между пользователями и условиями записи в каждом блоке использовалась нормализация слоёв и частота выбывания 0,25. Для обучения используется оптимизатор Adam со скоростью обучения 1 × 10-3, размером партии 32 и длиной последовательности 64 кадра, что оптимально балансирует точность и отзывчивость в реальном времени. Во время вывода стратегия скользящего окна делает возможным предсказание жестов каждые 20-25 мс, при этом сохраняя сквозную задержку менее 120 мс. Это сочетание архитектуры и гиперпараметров обеспечивает высокую точность классификации жестов (∼94% точности размещения), сохраняя при этом взаимодействие в реальном времени, что позволяет TCN выполнять погружающие задачи по манипуляции VR.
Дизайн голосового взаимодействия (ASR+NLU)
Компонент голосового взаимодействия дополняет пространственное управление на основе жестов с помощью семантических и параметризованных голосовых команд для VR-системы домашнего дизайна. Устный вход a(i) сначала записывается как сырой аудио и преобразуется в лог-мел-спектрограмму:
(24)
Где F — количество частотных бинов T , длина временных интервалов. Представление сохраняет как спектральные, так и временные паттерны речи и нормализуется как инвариантное к изменчивости говорящего и окружающей среды:
(25)
Нормализованная спектрограмма подаётся в модель автоматического распознавания речи (ASR), такую как Whisper, которая преобразует акустические признаки в последовательность токенов:
(26)
где каждое — это жетон для слова или подсловной единицы. Такая транскрипция реализуется в модели понимания естественного языка (NLU), которая фиксирует структурированный смысл. Точнее, NLU делает прогнозы категорий намерений и семантических слотов:
(27)
где, например, утверждение «повернуть стул на пятнадцать градусов» соответствует (действие = вращать, объект = кресло, местоположение/параметр = 15°).
Идентифицированный фреймворк слотов интента затем преобразуется в математическую команду, которую можно реализовать внутри VR-системы:
(28)
Где u(i) может быть численным преобразованием (например, вращение на 15°) или категорическим изменением (например, обмен материалами).
Надёжность в конечном итоге достигается благодаря механизму арбитража, основанному на доверии. Если рейтинг доверия ASR p(z) или NLU p(s) меньше порога τ, система либо запрашивает разъяснения, либо по умолчанию переходит на управление на основе жестов. Это обеспечивает точность и чёткость голосовых команд, повышая удобство для проектирования, требующих точности.
Проектирование мультимодального синтеза
Преимущество мультимодального слияния в предлагаемой VR-системе заключается в том, что понимание голоса и обнаружение жестов интегрированы в единый процесс принятия решений, а не обрабатываются отдельно. Модуль жестов даёт классификационный вывод
из TCN, тогда как голосовой модуль предоставляет представление слотов намерения s(i). Для объединения этих систем реализует интеграцию на уровне принятия решений с арбитражем на основе доверия.
Пусть классификатор жестов предоставляет вероятностное распределение по классам жестов:
(29)
и пусть модель NLU даёт вероятности слотов намерений:
(30)
Где a, o и p относятся к слотам действия, объекта и параметров, полученным из речевых ввода. Этап слияния вычисляет совместное решение, объединяя обе модальности в соответствии с их доверительными показателями:
(31)
где α∈[0,1] устанавливается динамически на основе уверенности в системе (например, выше, когда жесты более уверены, и ниже, когда речь ясна).
Алгоритм 1: Multimodal_Fusion (X, a):
Вводные данные:
X = заранее обработанная последовательность жестов, a = аудиокоманда
Результаты:
O = команда действия VR
Шаг 1: Распознавание жестов
Шаг 2: Понимание голоса
Шаг 3: Решение о термоядерном синтезе
Еще:
Шаг 4: Обработка ошибок
):
Запрос уточнения пользователя
Еще:
Отправьте O в VR-систему
Вернуться О
Этот алгоритм 1 переключается между вводом жестов и голосовым вводом, формулируя мощную команду для VR-проектирования. Модуль жестов (TCN) сначала интерпретирует движения руки, такие как вращение или масштабирование, и присваивает оценку уверенности на основе уверенности модели. Параллельно голосовой модуль также выполняет преобразование речи в текст с помощью ASR (например, Whisper) и применяет NLU для определения семантического замысла, например, «повернуть стул на 15°». Оба модуля возвращают свои прогнозы вместе с оценками уверенности. Затем шаг комбинирования уравновешивает два выхода. Если оба входа определёны, система объединяет их пропорционально их уровням уверенности. Если один вход неоднозначен (например, шум в голосе или неопределённый жест), система больше приоритизирует другой. Наконец, если ни одно из них не однозначно, система запрашивает уточнение для предотвращения ошибок. Это делает слияние адаптивным (веса меняются в зависимости от качества входа), надёжным (учитывая шумные или отсутствующие данные) и точным (используя лучшие преимущества жеста и голоса).
Участники
В этом исследовании участвует группа волонтёров, отобранных как из университетов, так и среди специалистов, связанных с дизайном, для сбора разнообразных мнений о удобстве использования VR. Возраст участников варьировался от ранней взрослой до средней возрастной группы, представляя собой смесь предыдущих уровней опыта в VR, включая новичков, редких пользователей и продвинутых пользователей. У всех участников было либо нормальное, либо скорректированное зрение, и не было зарегистрированных моторных нарушений, которые могли бы существенно мешать взаимодействию на основе жестов. Тяжёлые нарушения речи, серьёзные ограничения подвижности рук или любая предыдущая история укачивания, вызванной VR, исключали людей ради безопасности и стабильности в участии. Все участники предоставили информированное согласие, а процедуры оценки были утверждены институциональным контрольным советом. Этот подраздел чётко определяет, кто участвовал в оценке, что позволяет воспроизводить исследование.
Экспериментальная установка
Предлагаемая экспериментальная система включает разработанную мультимодальную VR-систему, которая устанавливается на потребительскую VR-гарнитуру с интегрированными возможностями отслеживания рук и RGB-камерой для захвата жестов. Он оснащён высокопроизводительным рабочим столом, позволяющим в реальном времени обрабатывать распознавание жестов, ASR и мультимодальные методы слияния. VR-среда построена на Unity 3D и содержит комнату для домашнего дизайна, которую можно настраивать с помощью мебели, материалов и элементов освещения. Система включает ASR на основе Whisper для транскрипции речи, а также модуль NLU на базе трансформатора для обнаружения намерения. Это описание было перемещено из раздела «Результаты» для предоставления соответствующего обзора технической среды перед обсуждением результатов.
Субъективные сценарии тестирования
Участники взаимодействовали с имитацией домашнего дизайна, включающей меблированную гостиную, спальню и небольшое рабочее пространство. В каждом сценарии пользователям предлагалось менять виртуальные объекты и переменные окружающей среды в окружении в соответствии с реалистичными дизайнерскими условиями. Например, участников просили расположить диван относительно точки отсчёта, повернуть стул в определённом направлении, изменить размер стола до нужного размера или изменить материал/профиль света стены. Эти сценарии были выбраны потому, что представляют собой типичные задачи по дизайну интерьера, которые бросают вызов как жестовому контролю (пространственной точности), так и голосовому контролю (с точки зрения семантических команд). Этот подраздел напрямую отвечает на вопрос рецензента о субъективных условиях тестирования, при которых пользователи оценивали систему.
Проектирование задач
Участники провели структурированный набор упражнений, охватывающих различные области управления элементами и взаимодействия с дизайном. Основные задачи были следующими: 1) Размещение мебели: участники размещали объекты на целевых координатах. 2) Задача вращения: В этой задаче пользователям нужно было изменить ориентацию так, чтобы она совпадала с опорным углом. 3) Задача масштабирования: Это включало изменение размера мебели до заранее установленных размеров. Кроме того, 4) Редактирование материалов и цветов: участники использовали голосовые команды для изменения текстур или освещения. Были предусмотрены дополнительные навигационные задачи для захвата возможности пространственного восприятия в виртуальной комнате. Каждая работа была реализована с чёткими целями, количественными результатами и установленным временным лимитом, обеспечивая правильную оценку точности и эффективности.
Процедура
Для обеспечения единообразия среди участников оценка проводилась в плановой последовательности. Пользователям сначала объясняли систему и кратко демонстрировали модальности взаимодействия жестов и речи. Начальная фаза калибровки позволяла адаптировать индивидуальные положения рук и речевые характеристики. Затем пользователи проходили короткую тренировочную сессию, чтобы привыкнуть к обеим методам. Фактическая оценка требовала выполнения всех задач в трёх условиях взаимодействия: использование только контроллера, использование только жестов и использование жестов вместе с голосом в качестве мультимодального входа. Порядок условий был уравновешен для снижения эффектов обучения. В конце участники проходили стандартизированные инструменты оценки, такие как SUS, NASA-TLX и IPQ, и проходили краткое качественное интервью с обратной связью.
Метрики оценки
Эта структурированная процедура обеспечивает методологическую прозрачность, позволяя проводить репликационные исследования. Объективные и субъективные метрики были объединены для всесторонней оценки эффективности системы. Целевыми метриками были время выполнения задачи — показатель эффективности; точность размещения, количественно определяемая как отклонение от положения или вращения цели; и уровень ошибок, определяемый как количество неправильных классификаций входных данных или непреднамеренных действий, совершённых системой. Субъективные метрики были собраны с помощью проверенных анкет: шкала удобства использования системы для оценки воспринимаемой удобства, шкала NASA-TLX для оценки умственной и физической нагрузки и анкета присутствия группы I для измерения погружения и присутствия в VR. Они были уместно перемещены из раздела «Результаты» для описания того, как измерялась производительность перед представлением каких-либо результатов.
VR-среда, интеграция системы и оценка
Основная платформа для команд речи и жестов — это интерактивная среда виртуальной реальности, в которой разворачивается система. Интегрированные библиотеки мебельных, текстурных и световых элементов используются для создания виртуальных комнат в Unity 3D. Он позволяет пользователям организовывать, настраивать и редактировать элементы в реальном времени. Точность повышается благодаря возможностям щёлкания, обнаружению столкновений и наложениям измерений, что позволяет объектам естественным путём выравниваться. Рендеринг освещения и материалов в реальном времени улучшает опыт дизайна, обеспечивая мгновенную обратную связь при каждом взаимодействии.
После проверки отдельных модулей для распознавания жестов, понимания голоса и мультимодального слияния они объединяются в единый конвейер. Система разработана с низкой задержкой, поэтому пользовательские команды появляются почти сразу в VR-среде. Пилотные испытания проводятся с небольшим числом участников для отточения процесса взаимодействия. Версия включает словарные языки жестов, проверку грамматики голосовых команд и обеспечение естественности и надёжности системы при непрерывном использовании.
Для оценки пользовательского опыта будет использовано комплексное исследование, сравнивающее три режима взаимодействия, такие как мультимодальное слияние жестов и голоса, ввод только через контроллер и гибридный режим. От участников требуются задачи, включая переключение материалов, вращение и размещение объектов. Для оценки эффективности собираются объективные метрики, такие как время выполнения работы, правильность трудоустройства и штрафы за ошибки. Субъективные оценки получаются от участников с помощью стандартизированных опросников, таких как System Useability Scale (SUS), NASA-TLX когнитивная нагрузка и IPQ-анкета для погружения, при этом интервью с участниками оказывают дополнительную поддержку. Эта двойная оценка кодирует как количественно измеримые показатели производительности, так и субъективный пользовательский опыт.
Прогресс этой системы заключается в применении мультимодального синтеза для задач точного проектирования, выходящих за рамки базовой навигации или взаимодействия. Техника предлагает более органичный, точный и доступный способ взаимодействия, сочетая семантическую ценность голосовых инструкций с пространственными преимуществами жестов. Благодаря адаптивным функциям доступности, таким как запасной вариант только голоса и распознавание жестов одной рукой, система также повышает инклюзивность. Наконец, исследование предлагает методичный, аннотированный мультимодальный набор данных о взаимодействиях голоса и жестов, способствуя будущим исследованиям в области иммерсивного дизайна интерфейсов и усиливая воспроизводимость.
На рисунке 3 показаны типичные скриншоты реализованной программы, что позволяет более ярко представить встроенную VR-систему дизайна интерьера. Иммерсивная среда виртуальной реальности, где пользователи могут исследовать и просматривать планировку комнаты, изображена на рисунке 3A. Рисунок 3B показывает, как естественные взаимодействия рук могут использоваться для выбора, перемещения и вращения виртуальных предметов мебели в процессе манипуляции объектами на основе жестов. Рисунок 3C иллюстрирует интегрированный голосовой интерфейс, где символы микрофона и обратной связи подтверждают пользовательские голосовые команды для пространственных изменений или размещения объектов. В совокупности эти скриншоты предлагаемой мультимодальной VR-системы демонстрируют, что она полностью реализована, позволяя в реальном времени взаимодействовать с жестами и голосом.