Исследовательская статья

Система виртуальной реальности, управляемая жестами и голосом, для иммерсивного домашнего проектирования: системный дизайн и анализ пользовательского опыта

409 просмотров

DOI:

10.3791/70051

3 марта 2026 г.

В этой статье

Краткое содержание

В данной статье представлена система виртуальной реальности, управляемая жестами и голосом, для погружения в домашний дизайн, которая повышает точность, удобство использования и доступность благодаря мультимодальному слиянию жестов и речи. Экспериментальные результаты показывают сокращение времени выполнения задач, повышенную точность размещения и повышение удовлетворённости пользователей по сравнению с традиционной практикой.

Аннотация

Взаимодействие на основе жестов и голоса в VR показало перспективы в различных приложениях; Однако существующие системы страдают из-за акцента на навигационных задачах, зависимости от двуручных жестов, отсутствия детализированной точности и тестирования на небольших, однородных популяциях. Эти ограничения ограничивают применимость к сложным, ориентированным на дизайн рабочим процессам. Чтобы преодолеть эти ограничения, мы вводим систему виртуальной реальности с управлением жестами и голосом для погружения в дизайн дома, которая сочетает в себе мультимодальное сочетание вручную отслеживаемого жеста и инструкций на естественном языке для точного размещения мебели, выбора материалов и пространственной корректировки. Три аспекта новизны в системе: (i) адаптивные режимы взаимодействия для поддержки одноручного использования, числовые голосовые команды и корректировка точности от грубой к точной; (ii) мультимодальная архитектура слияния, объединяющая информацию о жестах, речи и контексте для субсантиметровой точности; и (iii) структура оценки пользовательского опыта, ориентированная на задачи, адаптированная к процессам домашнего проектирования. Процесс разработки проходит по систематическому конвейеру: от анализа требований и проектирования жестовых и голосовых лексиконов до мультимодального распознавания намерений, сборки VR-сцен с помощью snapping и выравнивания, а также итеративного тестирования. Экспериментальные результаты на широком спектре групп участников показывают снижение ошибок размещения на 30% и значительное улучшение удобства использования и оценки нагрузки по сравнению с взаимодействием с контроллерами. Результаты свидетельствуют о потенциале мультимодального VR для создания доступных и увлекательных домашних дизайнерских впечатлений.

Введение

Виртуальная реальность (VR) — это интерактивная компьютерная среда, создающая трёхмерный опыт, в котором пользователи могут видеть, взаимодействовать и общаться с технологиями так, будто они действительно присутствуют. В контексте данного исследования виртуальная реальность рассматривается как мультимодальная среда взаимодействия, а не просто как визуальная техника отображения. Новейшие VR-системы интегрируют визуальное взаимодействие с распознаванием жестов, пространственными ощущениями и естественным голосовым вводом, позволяя пользователям управлять симулированными объектами с высокой точностью. Это понимание соответствует современным исследованиям в области VR, которые ставят приоритет на погружение, вовлечённость и естественный пользовательский опыт. Области применения включают выполнение,преподавание 2, медицинскоелечение 3 ипутешествия 4. VR позволяет людям взаимодействовать и устанавливать связь с мирами, которые невозможно было бы достичь в реальной жизни, имитируя реальные условия. Для процессов домашнего проектирования, где пользователям необходимо воспринимать пространственные планировки, управлять объектами и получать обратную связь в реальном времени без необходимости физического движения, такие функции погружения особенно полезны. Эти функции могут открывать новые возможности, особенно пользователям с неполными физическими движениями. Представители неформально неблагополучных групп, особенно пожилые люди и люди с минимальной буквенно-цифровой грамотностью, будут испытывать ограничения для активного отдыха по нескольким причинам, таким как физические ограничения, проблемы с мобильностью и трудности с доступом к цифровым технологиям из-за возрастных ограничений. Поэтому необходимо постоянно уделять внимание исследованиям, которые косвенно сделают внешний мир доступным для этих людей через VR-экспертизу. Эта потребность в постоянном исследовании не только поддерживает создание VR-опытов, ориентированных на доступность, но и стимулирует развитие систем, выходящих за рамки базовых навигационных задач. Действительно, иммерсивные домашние дизайнерские среды — при контроле ими с помощью естественных жестов и голоса — могут предоставить пожилым пользователям, людям с моторными нарушениями и цифрово уязвимым группам интуитивные способы взаимодействия со сложными пространственными средами. Обеспечивая косвенный доступ к внешним пространствам и творческим задачам, такие системы способствуют как функциональной независимости, так и эмоциональному благополучию. Именно на этих основаниях в этом исследовании будет введена мультимодальная VR-система домашнего проектирования. Следовательно, именно стремление к постоянному вниманию к исследованиям помогает сделать внешний мир косвенно доступным для этих людей, использующих VR-технологии. Исследования показали, что вмешательства на основе VR, разработанные для пожилых людей, могут иметь ряд преимуществ, таких как снижение риска падений за счёт улучшения осанки и гибкости6, а также улучшение общей осанки и упругости7. Кроме того, растёт доступность VR-материалов, специально ориентированных на пожилуюаудиторию, 8,9. Несмотря на прогресс в VR-взаимодействии, большинство современных систем в основном опираются на контроллеры и жесты двумя руками, что ограничивает доступность и точность задач, требующих дизайна. Расширяя эти функции мобильности, наша работа расширяет VR за рамки простого наблюдения, позволяя активно управлять элементами интерьера с помощью жестов и речи

VR обладает тремя связанными свойствами: коммуникация, вовлечённость имысли 10. Уровень вовлечённости и сила взаимодействия с симулируемыми объектами напрямую влияют на воображение пользователя в виртуальной атмосфере. В зависимости от этапов погружения схемы VR делятся на неиммерсивный VR, полуиммерсивный VR и полностью иммерсивный VR, каждая из которых использует различные комбинации методов коммуникации, стратегий и границ. 11 Неиммерсивная VR позволяет общаться с виртуальным окружением на рабочем столе или сенсорных экранах портативных устройств с помощью мыши, а такжезнаки 12, 13 и 14. Полу-иммерсивный VR обычно включает большой экран, организацию и экраны, обеспечивая кинематографический опыт, но часто отсутствует отслеживание позиции при использовании в группах. Связи на основе жестов изучались с начала VR15, чтобы сделать использование VR комфортным и привычным. В интерфейсе, основанном на жестах, физические знаки тела, такие как движения рук, используются для общения с компьютерной системой.

Граница жестов — это распространённая реализация более общего принципа естественного пользовательского интерфейса (NUI), который может применяться для достижения прозрачности интерфейса в VR на базе HMD. Аспекты, способствующие появлению в VR, были изучены ранее 16,17; тем не менее, существует мало исследований по появлению на фоне жестового интерфейса. Понимание влияний, которые могут повлиять на появление VR с помощью интерфейса на основе жестов, может быть полезно при разработке будущих иммерсивных технологий. Поэтому, с точки зрения коммуникации на основе событий и жестов, мы исследовали пользовательский опыт иммерсивного VR-взаимодействия на основе интерфейса на основе жестов. Для социально уязвимых материалов для оценки 360° автомагистрали — подраздел виртуальной реальности (VR) может быть эффективным инструментом. С такой технологией пользователи могут виртуально исследовать земной шар без физических перемещений, путешествовать в разные места и участвовать в социальных коммуникациях с другими пользователями, включая многостороннюю функцию. Для людей с физическими и экологическими ограничениями такое участие может стать полезным дополнением к активному отдыху. Помимо простой навигации, образовательные возможности, предоставляемые технологиями 360° мнений, охватывают множество сфер образования.

Систематический обзор литературы, включающий 64 обучающих сессии, подчеркнул информативное применение, преимущества и коммуникационные свойства 360° VR видео и реальной VR. Результаты показывают, что 360° VR может улучшить презентацию, мотивацию и запоминание информации у учащихся, способствуя большему погружению. Исследователь 21 объединил два одноручных и двухручных интерфейса в схеме передвижения на основе телепортации. Результаты показывают, что одноручные сигналы воспринимались как более быстрые в начале теми, кто их предпочитал, в то время как двуручные жесты считались более надёжными, хотя в предмете обсуждается самостоятельная телепортация, а не постоянное движение, как это используется в этой работе.

Было установлено и использовано предположение о большей последовательности двуручных жестов и более высокой начальной скорости для одноручных жестов. Также требуется более подробное описание ограничений оценки технологий, помимо презентации и пригодности к обслуживанию, касающихся обучения операторов выполнению обязанностей в VR22. В такой ситуации обучающие панели обучают операторов по вопросам деятельности, при этом оценка технологий является ключевым элементом. Кроме того, основная предпосылка заключается в том, что технология HT, если её правильно применить, может обеспечить прогресс и в областитехнологий 23,24. Недавние исследования показали, что виртуальные среды полезны не только для оценки услуг рулевого управления на инвалидной коляске, но и обладают полезными свойствами, включая обучение гибким услугам, воссоздание которых в реальной жизни может быть сложно или дорого. Например, автор25 отмечает, что VR-симуляторы могут облегчить обобщение сервисов управления на физические условия, обеспечивая умелую и безопасную технологическую среду.

Исследователь также подчёркивает применение виртуальных навыков как программы вмешательства в обучение услугам инвалидных колясок, подчёркивая их полезность и полезность для индивидуализации физических упражнений и повышения гибкости услуг. Тем не менее, в целях безопасности пользователи проходят проверку и проверку заранее, особенно в виртуальнойреальности 26,27. Такое внедрение позволяет людям с физическими ограничениями практиковать и совершенствовать свои навыки вождения на инвалидной коляске в безопасной и контролируемойсреде 28. Они могут пройти различные виртуальные испытания и сценарии, включая преодоление сложных задач, перемещение в тесных пространствах или выполнение сложных манёвров. Тем временем пользователи могут получать мгновенную обратную связь о своей работе и приобретать новые стратегии движения29. Помимо того, что виртуальная реальность служит учебным средством, имеет терапевтическиеприложения. Предоставление иммерсивных изображений может способствовать повышению уверенности в себе, организации и физической реинтеграции. Люди могут развивать свои моторные навыки, улучшать стабильность и устойчивость. Среды виртуальной реальности — это компьютерно сгенерированные представления, которые позволяют пользователям чувствовать себя частью её31.

Эта ситуация визуализируется с помощью наушников виртуальной реальности или других методов. Макеты могут моделировать рискованные или сложные ситуации до их внедрения, такие как медицинские события или применение определённыхстратегий 32, 33, 34. Кроме того, дополнительное преимущество — возможность устанавливать оборудование устройств, такое как органы управления, декоративные приборы для обнаружения движения, микрофоны или жилеты, чтобы обеспечить эффективную связь между работодателем имеханизмом 35 в безвредной и тщательно воспроизведённой обстановке до его использования в реальных условиях. Виртуальные вещества могут работать в различных режимах, например, с помощью джойстиков, речевых инструкций или записанных трасс, как в исследованииKinect 36. Все альтернативы требуют обучения пользователями, поэтому опыт пользователя является ключевым фактором при выборе подхода управления37.

Хотя жесты и голосовое взаимодействие в виртуальных пространствах исследовались для навигационных задач, включая систему уличного вида, обсуждаемую в базовой работе, существует значительный разрыв в применении этих модальностей к точным и творческим направлениям работы, таким как иммерсивный дизайн домов. Фундаментальное исследование доказало эффективность мультимодального входа для доступности, но включало только навигацию и исследование сцены, используя двуручные жесты, простую отдачу команд и небольшое количество участников. Он не охватывал сложности высокоточной обработки, точного пространственного позиционирования, редактирования материалов или совместных рабочих процессов, которые определяют деятельность в интерьерном и архитектурном дизайне. Кроме того, тестирование было ориентировано на узкую, однородную группу пользователей, что ограничивало наблюдения о удобстве использования для более широкой аудитории и различных потребностей в доступности. Современные инструменты VR-дизайна в основном основаны на контроллерах, которые ограничивают естественное взаимодействие и исключают пользователей с моторными или учебными нарушениями. В результате не хватает проектирования и тестирования системы, которая интегрирует жесты и речь для грубой и тонкой обработки объектов, обеспечивает голосовое управление числовыми изменениями, поддерживает стили взаимодействия одной рукой и способствующую доступности, а также тестируется с помощью обширного анализа пользовательского опыта в реальных проектныхзадачах 38,39. Преодоление этого разрыва может создать новый, ориентированный на пользователя подход к иммерсивному дизайну дома, который опирается на предыдущие исследования в мультимодальной VR-навигации.

Недавние достижения в мультимодальных интерфейсах человек-машина исследовали передовые механизмы сенсора и взаимодействия для повышения удобства использования и погружения VR40. Автор41 представил трибоэлектрический сенсор на основе электретноволокна для бесконтактного 3D-распознавания жестов, демонстрируя, что высокоточная интерпретация жестов может быть достигнута без традиционного визуального отслеживания и обеспечивает более естественное, бесконтактное управление VR. С другой стороны, исследовательпредставил надёжную процедуру поведенческого обучения для VR-систем с фиксированной головой у мышей. Исследование показало, как контролируемые VR-среды могут поддерживать точное измерение поведения и стабильные протоколы взаимодействия, а также подчеркнуло важность повторяемости и систематического проектирования в рабочих процессах VR. Одновременно авторпредложил растягиваемый и адгезивный ионно-проводящий электрод с ультранизким импедансом кожи для улучшения электрофизиологического приёма сигнала; это открывает путь к биоинтегрированному сенсору, который может ещё больше повысить точность взаимодействия между XR и VR. Фактически, все эти исследования показывают, как быстро развиваются сенсорные технологии, протоколы обучения и физиологические интерфейсы — всё это потому, что существует необходимость в более гибких, мультимодальных рамках взаимодействия, таких как предложенная в данном исследовании система жест-голос.

Этот протокол представляет собой мультимодальный путь жест-голос, который позволяет использовать доступные жесты одной рукой, улучшения числа на основе голоса и точный дизайн дома, в отличие от современных VR-моделей взаимодействия, которые в основном поддерживают навигацию или управление контроллером. Насколько нам известно, это первый протокол, сочетающий слияние жеста и голоса, специально настроенный на пространственную точность, модификацию материалов и инклюзивные процессы проектирования.

Основные цели этой работы — создать систему виртуальной реальности (VR) с поддержкой жестов и голоса, адаптированной для увлекательных домашних проектных задач, а также расширить возможности мультимодального ввода для точного размещения мебели, вращения, масштабирования, а также редактирования материалов или освещения, помимо типичных навигационных функций. Одна из главных целей — разработать мультимодальный движок слияния, который интегрирует жесты, голос и контекстные входы для достижения как грубого, так и тонкого управления при проектировании интерьера. Система также вводит адаптивные режимы взаимодействия, такие как жесты одной рукой, функции, ориентированные на доступность, и голосовые точные команды, чтобы поддерживать широкий спектр групп пользователей.

Эта работа также направлена на проведение комплексной оценки пользовательского опыта (UX), которая сочетает количественные показатели, включая время выполнения задач, точность размещения и уровень ошибок, с качественными оценками удобства использования, нагрузки и удовлетворённости пользователей. Значительный прогресс по сравнению с предыдущими исследованиями достигнут за счёт перехода от навигационных систем на основе уличного обзора к ориентированной на задачи и точной концепции интерьерного дизайна. Ключевой вклад заключается в разработке VR-среды, управляемой жестами и голосом, для погружения в дизайн дома, расширяя область предыдущих исследований, которые в основном были сосредоточены на интеграции жестов и голоса для навигации по уличному виду.

Важно отметить, что ни одна предыдущая система эффективно не сочетала мультимодальную коммуникацию жест-голос специально для операций по проектированию дома, зависящей от точности, таких как позиционирование объектов, масштабирование, вращение и редактирование материалов. Существующие подходы также отсутствуют альтернативы адаптивного взаимодействия, включая одноручный ввод жестов или голосовое числовое уточнение. Предлагаемая система вводит комплексную мультимодальную парадигму взаимодействия, которая объединяет распознавание жестов — достигаемое с помощью MediaPipe Hands или VR-гарнитурного отслеживания рук — с классификаторами Temporal Convolutional Network, а также распознаванием речи и интерпретацией естественного языка, основанными на Whisper ASR и моделях классификации намерений на основе трансформаторов.

Для обеспечения надёжной работы реализован мультимодальный механизм слияния на уровне принятия решений с арбитражем, основанным на доверии, сопоставляющий жесты с задачами пространственного выбора, а голосовые команды — с точными уточнениями. Эта конструкция позволяет точно размещать, масштабировать, вращать и менять материалы объектов в виртуальных домашних средах. Рабочий процесс строится по структурированному конвейеру, который начинается с определения системных требований, проектирования жестовых и голосовых лексиконов, разработки мультимодальных методов слияния и создания иммерсивной VR-среды в Unity 3D, оснащённой инструментами для снимков, наложениями измерений и предвариями материалов. Далее следуют интеграция системы, пилотное тестирование и оценка пользовательского опыта с помощью сравнительных исследований.

Система предлагает мультимодальное взаимодействие с низкой задержкой (менее 200 мс), поддержку адаптивной доступности и улучшенную удобство использования по сравнению с традиционными VR-системами на базе контроллеров. Экспериментальная оценка будет количественно определять время выполнения задач, точность размещения, уровень ошибок, баллы SUS, метрики нагрузки NASA-TLX и рейтинги присутствия IPQ. Ожидаемые результаты показывают, что мультимодальное взаимодействие значительно повышает точность, эффективность и удовлетворённость пользователей в проектировании домов на базе VR.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Это исследование было одобрено Комитетом по этике исследований Университета Тейлора, Субанг-Джая, Малайзия. Все процедуры соответствовали этическим нормам, установленным институциональным исследовательским комитетом, и соответствовали Хельсинкской декларации. До сбора данных от каждого участника получалось информированное согласие. Им были четко проинформированы о целях исследования, заверили, что участие добровольное, что их ответы останутся конфиденциальными и что они могут отказаться в любой момент без каких-либо последствий. Письменное информированное согласие также было получено для использования анонимных данных взаимодействия и опросов в академических публикациях. В этой рукописи не включена личная информация, изображения или конфиденциальные персональные данные.

Предлагаемая работа разрабатывает систему виртуальной реальности (VR) на основе жестов и голоса, предназначенную для иммерсивного домашнего проектирования, превосходящей современные методы, ориентированные на навигационные задачи. Подход начинается с определения потребностей пользователей и проектных задач, включая размещение мебели, масштабирование и вращение объектов, редактирование материалов и точные измерения помещения. Затем разрабатывается система взаимодействия жестов, в которой неограниченные жесты рук (такие как щипка, захват и поворот) обнаруживаются с помощью отслеживания на гарнитурах или MediaPipe Hands и определяются с помощью лёгких моделей машинного обучения, включая временные сверточные сети (TCN). В дополнение к жестам устанавливается организованная грамматика голосовых команд, сочетаемая с автоматическим распознаванием речи на основе шёпота (ASR) и пониманием естественного языка (NLU), чтобы вывести намерения и параметры для высокоуровневого семантического контроля. Обе модальности объединены в мультимодальную стратегию слияния, где жесты используются для управления пространственным выбором и манипуляцией, а голосовые команды — для точных доработок, дополненных механизмом арбитража, основанным на доверии, и восстановлением ошибок с помощью команд отмены.

Иммерсивная среда дизайна реализована в Unity 3D, включающая кнопки snapping, реакцию на столкновения, наложения измерений и интерактивную библиотеку мебели и материалов для реалистичных рабочих процессов проектирования. Пилотные испытания проводятся для обеспечения естественности взаимодействия, стабильности и низкой задержки (<200 мс) перед формальной оценкой.

Участники и стратегия выборки
Всего для пользовательского исследования было привлечено 48 участников, чтобы обеспечить разнообразие и обобщаемость результатов. Возраст участников варьировался от 19 до 62 лет (M = 32,4, SD = 10,7), из них 26 мужчин и 22 женщины. Чтобы зафиксировать разнообразие в знакомстве с иммерсивными технологиями, участников делили на три группы VR-опыта: начинающих пользователей (n = 18) с минимальным или отсутствующим опытом VR, пользователей среднего уровня (n = 17) с редким использованием VR и опытных пользователей (n = 13), которые регулярно использовали VR, в основном профессионально. Для обеспечения доступности и инклюзивности выборки также были включены 6 участников с лёгкими ограничениями подвижности и 4 участника, предпочитающих взаимодействие одной рукой из-за моторных ограничений. У всех участников было либо нормальное, либо скорректированное до нормы зрение, при этом никто не сообщал о вестибулярных или неврологических заболеваниях, которые могли бы мешать использованию VR.

Участников случайным образом распределяли по трём условиям взаимодействия с использованием сбалансированной стратегии распределения: жест + голос (n = 16), только с контроллером (n = 16) и гибрид (n = 16). Их уровень опыта был равномерно распределен между тремя группами, чтобы избежать предвзятости и обеспечить сопоставимую сложность выполнения задач в разных условиях. Все участники предоставили письменное информированное согласие перед началом эксперимента.

Затем проводится исследование пользователей по трём условиям взаимодействия, таким как голос жестов, только для контроллера и гибрид, чтобы оценить точность, эффективность и пользовательский опыт. Количественные показатели включают точность размещения, продолжительность задачи и уровень ошибок, тогда как субъективная оценка использует SUS, NASA-TLX и IPQ, поддерживаемые качественными интервью. Эта система, представленная здесь, предлагает три основных новшества: использование мультимодального слияния жеста и голоса для точной обработки объектов в VR, адаптивных и доступных режимов взаимодействия, таких как жесты одной руки и голоса, а также предоставление воспроизводимого корпуса аннотированных команд жест-голос. В сочетании эти шаги обеспечивают повышенную точность, эффективность и пользовательский опыт, напрямую устраняя недостатки базового документа и продвигая исследования в области иммерсивного VR-взаимодействия для дизайна. Рисунок 1 показывает архитектуру предлагаемого метода.

Архитектура системы предлагаемого метода, как показано на рисунке 1, начинается с входных модальностей, где жесты записываются с помощью наборов данных, таких как EgoGesture и IPN Hand, а голосовые инструкции — из набора данных Fluent Speech Commands. Эти входные данные обрабатываются независимо с помощью модулей распознавания жестов и голосового распознавания для получения пространственных и семантических данных. Оба потока объединены в мультимодальный слой слияния, который выравнивает жесты и голосовые вводы для создания последовательных команд. Эти объединённые данные используются в слое взаимодействия VR для облегчения пользователей в манипуляции объектами с помощью размещения, вращения, масштабирования и модификации материалов в реальном времени. Наконец, обработанные взаимодействия доступны в выходном слое, создавая погружающее пространство для дизайна дома, ориентированное на доступность, точность и естественное взаимодействие.

Требования к системе и определение задач
Задуманная система улучшает модели VR-навигации с ориентацией на доступность для обеспечения точного планирования дома. Мы определяем пользовательский домен как Уравнение 38, где Уравнение 39 являются домовладельцы, Уравнение 39 профессионалы в области дизайна и Уравнение 40 пользователи доступности (пожилые или с ограниченной подвижностью). Каждый пользователь выполняет набор основных задач T = {разместить, вращать, масштабировать, масштабировать, материалить, светить, измерять}. Задача t T выполняется с помощью мультимодальных входов: поток жестов G t (пространственная обработка) и голосовая команда Vt (семантические параметры). Система связывает это с действием через политику слияния:

Уравнение 41(1)

где π — мультимодальная функция на уровне принятия решения.

Системные потребности требуют взаимодействия с низкой задержкой: распознавание Уравнение 42 жестов, понимание речи и время слияния.

Уравнение 43(2)

Суммарный отклик обеспечивает оперативную реакцию в реальном времени в соответствии с погружёнными порогами удобства VR.

Для точности задачи пусть состояние объекта с основной истинностью будет (x, R, s, M, L) (положение, вращение, масштаб, материал, длина), а реализованное состояние системы — Уравнение 44. Метрики ошибок следующие:

Уравнение 45(3)

Уравнение 46(4)

Уравнение 47(5)

Уравнение 48(6)

С материальным Уравнение 49 несоответствием.

Обе модальности генерируют оценки доверия cg (жест) и cv (голос), нормализованные так, что cg + c v = 1. Арбитраж по слиянию минимизирует взвешенную ошибку:

Уравнение 50(7)

Где lg,l v — это потери, специфичные для модальности. Если Уравнение 51, система запрашивает уточнение, что делает её устойчивой для неясных команд.

Наконец, метрики оценки включают время выполнения задачи tt, уровень ошибок Et и оценки нагрузки от NASA-TLX, SUS и IPQ. Мы вводим составный индекс производительности задач:

Уравнение 52(8)

чтобы быть минимизированным среди пользователей, с порогами, требующими SUS-рейтинга ≥70 и снижением NASA-TLX по сравнению с базовой VR на базе контроллеров.

Сбор и предобработка наборов данных
Предлагаемая система основана как на данных жестов (для распознавания на основе TCN), так и на данных голосовых команд (для NLU/ASR). Для этой цели мы используем три основных набора данных: EgoGesture для динамических непрерывных жестов в VR-подобных средах, IPN Hand для дополнения естественных коротких жестов и Fluent SpeechCommands 44 для обучения голосового семантического понимания дизайн-высказываний. Дополнительные наборы данных — HaGRID для предварительного обучения детектора статических жестов и Mozilla Common Voice для общего предварительного обучения ASR, но ни один из них не является обязательным. Такой выбор позволяет охватить обе модальности, сохраняя при этом максимально разумный и воспроизводимый объем наборов данных. Таблица 1 показывает детали набора данных предлагаемой работы.

Выбор набора данных в этой статье имеет решающее значение, поскольку каждый набор данных разработан для рассмотрения уникального сценария мультимодального VR-взаимодействия. Набор данных EgoGesture предоставляет крупномасштабную, натуралистическую коллекцию жестов рук, обеспечивая высокую эффективность распознавания несмотря на разные условия освещения и окружающей среды. Поскольку набор данных IPN Hand предназначен для неограниченных, непрерывных движений рук, он особенно подходит для операций высокого контроля и сегментации жестов в реальном времени. Кроме того, набор данных Fluent Speech Commands предлагает маркированные голосовые команды с семантическими аннотациями для обнаружения намерений, что крайне важно для обеспечения точного и естественного выполнения команд в VR. В совокупности эти наборы данных обеспечивают дополнительное покрытие как жестов, так и речевых модальностей, обеспечивая разнообразие, надёжность и повседневную эффективность, улучшая оценку предлагаемой системы. Помимо публичных наборов данных, мы также проверили протокол с помощью независимого внутреннего набора данных, включающего 312 образцов жестов и 128 голосовых команд от 10 новых участников. Эта независимая проверка подтвердила воспроизводимость и надёжность протокола.

Предварительная обработка данных
Собранная информация систематически нормализуется, отбирается и дополняется перед обучением модели:

Нормализация последовательности жестов
Видеопоследовательность жестов представлена как многомерный временной ряд признаков скелетных суставов:

Уравнение 1(9)

Где Ti — длина i-го жеста, а d — размерность признаков (например, расположение суставов руки). Поскольку разные жесты могут иметь разную длину Ti, мы пересэмплируем их в постоянную длину последовательности T:

Уравнение 2(10)

Это делает все сэмплы жестов, независимо от длительности записи, сопоставимы со стандартной временной длиной, которая может использоваться для тренировки TCN.

Стандартизация признаков
Чтобы устранить различия в масштабе между пользователями и условиями записи, каждое пространство функций стандартизируется:

Уравнение 3(11)

Где Уравнение 4 — среднее значение признака j, а σj — её стандартное отклонение. Нормализация таким образом гарантирует, что признаки центрируются с дисперсией единиц, а индивидуальные различия в производительности жестов минимизированы.

Дополнение данных
Включение синтетических возмущений повышает устойчивость к вариабельности. Временной джиттер сначала случайным образом смещает выравнивание последовательности:

Уравнение 5(12)

где δ — максимальный джиттер в кадрах. Впрыск шума вторая секунда добавляет гауссовские возмущения к особенностям:

Уравнение 6(13)

Эти улучшения позволяют модели быть устойчивой к отрывам времени и шуму датчиков в реальных VR-взаимодействиях.

Предварительная обработка голоса
Каждое произнесённое высказывание изначально отображается в лог-мел-спектрограмме:

Уравнение 7(14)

где F — количество частотных блоков, а T′ — количество временных систем. Для компенсации изменчивости записи признаки спектрограммы нормализуются следующим образом:

Уравнение 8(15)

Где μV, σV — глобальное среднее и стандартное отклонение над корпусом. Это обеспечивает стабильное акустическое пространство для моделей ASR и NLU.

Кодирование слотов в интенте
Помимо акустических особенностей, каждая голосовая команда обозначена структурированными семантическими слотами:

Уравнение 9 (16)

где, например, «повернуть стул на 15 градусов» соответствует (действие = вращать, объект = кресло, местоположение = ноль). Это систематическое кодирование позволяет системе получать специфические параметры дизайна и превращать их в исполняемые VR-операции.

Проектирование взаимодействия жестов с временной сверточной сетью (TCN)
Дизайн взаимодействия жестов определяет, как пользователи взаимодействуют с виртуальными объектами в системе домашнего дизайна VR с использованием естественных жестов рук. Дизайн начинается с разработки жестового лексикона — ассоциации жестов с функциями системы. Например, жест захвата мог управлять расположением объектов, щипка — масштабированием, а жест вращения — поворачивать объекты вокруг выбранной оси.

В рассматриваемой системе EgoGesture и IPN Hand служат базовыми наборами данных жестов для обучения Временной сверточной сети (TCN), а команды плавной речи дополняют дизайн возможностями голосового взаимодействия. В совокупности они обеспечивают мультимодальное VR-взаимодействие.

Жестовые представления из набора данных
Последовательность жестов из EgoGesture или IPN Hand представляет собой многомерный временной ряд:

Уравнение 10(17)

Уравнение 11(18)

Здесь T — это заранее определённое количество кадров (после перевыборки), а d — количество размеров скелетных признаков (например, расположения трёхмерных соединений). В наборе данных есть метки y(i) ∈ y , указывающие на один из классов жестов C.

Временное сверточное кодирование
Мы используем Временную сверточную сеть (TCN) для классификации жестов в реальном времени. TCN фиксирует краткосрочные и долгосрочные зависимости в последовательностях жестов. ТКН, в отличие от РНН, используют расширенные причинные свёртки, которые обеспечивают эффективные параллельные вычисления.

TCN применяет эти последовательности через причинно-расширённые свёртки для изучения краткосрочных и долгосрочных зависимостей:

Уравнение 13(19)

где dL — коэффициент расширения в слое l, K — размер ядра, а σ — нелинейная активация (ReLU). Рецептивное поле зависит от:

Уравнение 14(20)

требуя от TCN охватывать жесты разной временной длины.

Классификация жестов
Последнее скрытое состояние проходит через классификатор Softmax:

Уравнение 15 (21)

с целью обучения, определяемой кросс-энтропией:

Уравнение 16 (22)

Интеграция с голосовыми командами
В то время как пространственные операции (движение, вращение, масштабирование) реализуются распознаванием жестов с помощью EgoGesture и IPN Hand, для семантических команд применяется набор данных Fluent Speech Commands. Каждое высказывание преобразуется в структурированное представление слота: Уравнение 17 которое усиливает ввод жеста, предлагая параметры (например, «повернуть стул на 15°»).

Тогда оба выхода объединяются:

Уравнение 18(23)

Где o(i) — примитив управления VR (размещение, масштабирование, вращение).

Временная сверточная сеть (TCN) эффективна для обработки последовательных данных, используя расширенные одномерные свёртки на входных последовательностях, таких как жестовые или речевые сигналы, как показано на рисунке 2. В отличие от повторяющихся моделей, ТКН используют сверточные фильтры для изучения как краткосрочных, так и долгосрочных временных связей. Остаточные блоки с пропускающими соединениями используются для обеспечения стабильности во время обучения и предотвращения нулевых градиентов, тогда как использование слоёв TCN позволяет сети изучать многомасштабные временные паттерны. В конечном итоге полностью связанный слой классификации проецирует изученные временные признаки в выходные метки, такие как классы жестов или устные намерения. Эта конструкция особенно подходит для непрерывного распознавания жестов и понимания голосовых команд, поскольку сочетает вычислительную эффективность с сильными возможностями временного моделирования.

Таблица 2 обобщает общий архитектурный дизайн и обучающую конфигурацию Временной сверточной сети, используемой в предлагаемой системе распознавания жестов. Модель включает четыре остаточных блока TCN, каждый из которых основан на расширенных причинных свертках, позволяя сети моделировать как краткосрочные, так и дальние временные зависимости. Эти зависимости крайне важны для различия динамических жестов, таких как захват, вращение и щипкание. При размере ядра 3 и коэффициентах дилатации коэффициенты дилатации [1,2,4,8] эффективно расширяют временное рецептивное поле без увеличения вычислительных затрат. Для улучшения обобщения между пользователями и условиями записи в каждом блоке использовалась нормализация слоёв и частота выбывания 0,25. Для обучения используется оптимизатор Adam со скоростью обучения 1 × 10-3, размером партии 32 и длиной последовательности 64 кадра, что оптимально балансирует точность и отзывчивость в реальном времени. Во время вывода стратегия скользящего окна делает возможным предсказание жестов каждые 20-25 мс, при этом сохраняя сквозную задержку менее 120 мс. Это сочетание архитектуры и гиперпараметров обеспечивает высокую точность классификации жестов (∼94% точности размещения), сохраняя при этом взаимодействие в реальном времени, что позволяет TCN выполнять погружающие задачи по манипуляции VR.

Дизайн голосового взаимодействия (ASR+NLU)
Компонент голосового взаимодействия дополняет пространственное управление на основе жестов с помощью семантических и параметризованных голосовых команд для VR-системы домашнего дизайна. Устный вход a(i) сначала записывается как сырой аудио и преобразуется в лог-мел-спектрограмму:

Уравнение 19 (24)

Где F — количество частотных бинов T , длина временных интервалов. Представление сохраняет как спектральные, так и временные паттерны речи и нормализуется как инвариантное к изменчивости говорящего и окружающей среды:

Уравнение 37(25)

Нормализованная спектрограмма подаётся в модель автоматического распознавания речи (ASR), такую как Whisper, которая преобразует акустические признаки в последовательность токенов:

Уравнение 20 (26)

где каждое — это жетон для слова или подсловной единицы. Такая транскрипция реализуется в модели понимания естественного языка (NLU), которая фиксирует структурированный смысл. Точнее, NLU делает прогнозы категорий намерений и семантических слотов:

Уравнение 21 (27)

где, например, утверждение «повернуть стул на пятнадцать градусов» соответствует (действие = вращать, объект = кресло, местоположение/параметр = 15°).

Идентифицированный фреймворк слотов интента затем преобразуется в математическую команду, которую можно реализовать внутри VR-системы:

Уравнение 22(28)

Где u(i) может быть численным преобразованием (например, вращение на 15°) или категорическим изменением (например, обмен материалами).

Надёжность в конечном итоге достигается благодаря механизму арбитража, основанному на доверии. Если рейтинг доверия ASR p(z) или NLU p(s) меньше порога τ, система либо запрашивает разъяснения, либо по умолчанию переходит на управление на основе жестов. Это обеспечивает точность и чёткость голосовых команд, повышая удобство для проектирования, требующих точности.

Проектирование мультимодального синтеза
Преимущество мультимодального слияния в предлагаемой VR-системе заключается в том, что понимание голоса и обнаружение жестов интегрированы в единый процесс принятия решений, а не обрабатываются отдельно. Модуль жестов даёт классификационный вывод Уравнение 23 из TCN, тогда как голосовой модуль предоставляет представление слотов намерения s(i). Для объединения этих систем реализует интеграцию на уровне принятия решений с арбитражем на основе доверия.

Пусть классификатор жестов предоставляет вероятностное распределение по классам жестов:

Уравнение 24 (29)

и пусть модель NLU даёт вероятности слотов намерений:

Уравнение 25 (30)

Где a, o и p относятся к слотам действия, объекта и параметров, полученным из речевых ввода. Этап слияния вычисляет совместное решение, объединяя обе модальности в соответствии с их доверительными показателями:

Уравнение 26 (31)

где α∈[0,1] устанавливается динамически на основе уверенности в системе (например, выше, когда жесты более уверены, и ниже, когда речь ясна).

Алгоритм 1: Multimodal_Fusion (X, a):

Вводные данные:

X = заранее обработанная последовательность жестов, a = аудиокоманда

Результаты:

O = команда действия VR

Шаг 1: Распознавание жестов

Уравнение 27  

Шаг 2: Понимание голоса

Уравнение 28  

Уравнение 29  

Шаг 3: Решение о термоядерном синтезе

Уравнение 30  

Уравнение 31  

Уравнение 32  

Уравнение 33  

Уравнение 34  

Еще:

Уравнение 35  

Шаг 4: Обработка ошибок

Уравнение 36 ):

Запрос уточнения пользователя

Еще:

Отправьте O в VR-систему

Вернуться О

Этот алгоритм 1 переключается между вводом жестов и голосовым вводом, формулируя мощную команду для VR-проектирования. Модуль жестов (TCN) сначала интерпретирует движения руки, такие как вращение или масштабирование, и присваивает оценку уверенности на основе уверенности модели. Параллельно голосовой модуль также выполняет преобразование речи в текст с помощью ASR (например, Whisper) и применяет NLU для определения семантического замысла, например, «повернуть стул на 15°». Оба модуля возвращают свои прогнозы вместе с оценками уверенности. Затем шаг комбинирования уравновешивает два выхода. Если оба входа определёны, система объединяет их пропорционально их уровням уверенности. Если один вход неоднозначен (например, шум в голосе или неопределённый жест), система больше приоритизирует другой. Наконец, если ни одно из них не однозначно, система запрашивает уточнение для предотвращения ошибок. Это делает слияние адаптивным (веса меняются в зависимости от качества входа), надёжным (учитывая шумные или отсутствующие данные) и точным (используя лучшие преимущества жеста и голоса).

Участники
В этом исследовании участвует группа волонтёров, отобранных как из университетов, так и среди специалистов, связанных с дизайном, для сбора разнообразных мнений о удобстве использования VR. Возраст участников варьировался от ранней взрослой до средней возрастной группы, представляя собой смесь предыдущих уровней опыта в VR, включая новичков, редких пользователей и продвинутых пользователей. У всех участников было либо нормальное, либо скорректированное зрение, и не было зарегистрированных моторных нарушений, которые могли бы существенно мешать взаимодействию на основе жестов. Тяжёлые нарушения речи, серьёзные ограничения подвижности рук или любая предыдущая история укачивания, вызванной VR, исключали людей ради безопасности и стабильности в участии. Все участники предоставили информированное согласие, а процедуры оценки были утверждены институциональным контрольным советом. Этот подраздел чётко определяет, кто участвовал в оценке, что позволяет воспроизводить исследование.

Экспериментальная установка
Предлагаемая экспериментальная система включает разработанную мультимодальную VR-систему, которая устанавливается на потребительскую VR-гарнитуру с интегрированными возможностями отслеживания рук и RGB-камерой для захвата жестов. Он оснащён высокопроизводительным рабочим столом, позволяющим в реальном времени обрабатывать распознавание жестов, ASR и мультимодальные методы слияния. VR-среда построена на Unity 3D и содержит комнату для домашнего дизайна, которую можно настраивать с помощью мебели, материалов и элементов освещения. Система включает ASR на основе Whisper для транскрипции речи, а также модуль NLU на базе трансформатора для обнаружения намерения. Это описание было перемещено из раздела «Результаты» для предоставления соответствующего обзора технической среды перед обсуждением результатов.

Субъективные сценарии тестирования
Участники взаимодействовали с имитацией домашнего дизайна, включающей меблированную гостиную, спальню и небольшое рабочее пространство. В каждом сценарии пользователям предлагалось менять виртуальные объекты и переменные окружающей среды в окружении в соответствии с реалистичными дизайнерскими условиями. Например, участников просили расположить диван относительно точки отсчёта, повернуть стул в определённом направлении, изменить размер стола до нужного размера или изменить материал/профиль света стены. Эти сценарии были выбраны потому, что представляют собой типичные задачи по дизайну интерьера, которые бросают вызов как жестовому контролю (пространственной точности), так и голосовому контролю (с точки зрения семантических команд). Этот подраздел напрямую отвечает на вопрос рецензента о субъективных условиях тестирования, при которых пользователи оценивали систему.

Проектирование задач
Участники провели структурированный набор упражнений, охватывающих различные области управления элементами и взаимодействия с дизайном. Основные задачи были следующими: 1) Размещение мебели: участники размещали объекты на целевых координатах. 2) Задача вращения: В этой задаче пользователям нужно было изменить ориентацию так, чтобы она совпадала с опорным углом. 3) Задача масштабирования: Это включало изменение размера мебели до заранее установленных размеров. Кроме того, 4) Редактирование материалов и цветов: участники использовали голосовые команды для изменения текстур или освещения. Были предусмотрены дополнительные навигационные задачи для захвата возможности пространственного восприятия в виртуальной комнате. Каждая работа была реализована с чёткими целями, количественными результатами и установленным временным лимитом, обеспечивая правильную оценку точности и эффективности.

Процедура
Для обеспечения единообразия среди участников оценка проводилась в плановой последовательности. Пользователям сначала объясняли систему и кратко демонстрировали модальности взаимодействия жестов и речи. Начальная фаза калибровки позволяла адаптировать индивидуальные положения рук и речевые характеристики. Затем пользователи проходили короткую тренировочную сессию, чтобы привыкнуть к обеим методам. Фактическая оценка требовала выполнения всех задач в трёх условиях взаимодействия: использование только контроллера, использование только жестов и использование жестов вместе с голосом в качестве мультимодального входа. Порядок условий был уравновешен для снижения эффектов обучения. В конце участники проходили стандартизированные инструменты оценки, такие как SUS, NASA-TLX и IPQ, и проходили краткое качественное интервью с обратной связью.

Метрики оценки
Эта структурированная процедура обеспечивает методологическую прозрачность, позволяя проводить репликационные исследования. Объективные и субъективные метрики были объединены для всесторонней оценки эффективности системы. Целевыми метриками были время выполнения задачи — показатель эффективности; точность размещения, количественно определяемая как отклонение от положения или вращения цели; и уровень ошибок, определяемый как количество неправильных классификаций входных данных или непреднамеренных действий, совершённых системой. Субъективные метрики были собраны с помощью проверенных анкет: шкала удобства использования системы для оценки воспринимаемой удобства, шкала NASA-TLX для оценки умственной и физической нагрузки и анкета присутствия группы I для измерения погружения и присутствия в VR. Они были уместно перемещены из раздела «Результаты» для описания того, как измерялась производительность перед представлением каких-либо результатов.

VR-среда, интеграция системы и оценка
Основная платформа для команд речи и жестов — это интерактивная среда виртуальной реальности, в которой разворачивается система. Интегрированные библиотеки мебельных, текстурных и световых элементов используются для создания виртуальных комнат в Unity 3D. Он позволяет пользователям организовывать, настраивать и редактировать элементы в реальном времени. Точность повышается благодаря возможностям щёлкания, обнаружению столкновений и наложениям измерений, что позволяет объектам естественным путём выравниваться. Рендеринг освещения и материалов в реальном времени улучшает опыт дизайна, обеспечивая мгновенную обратную связь при каждом взаимодействии.

После проверки отдельных модулей для распознавания жестов, понимания голоса и мультимодального слияния они объединяются в единый конвейер. Система разработана с низкой задержкой, поэтому пользовательские команды появляются почти сразу в VR-среде. Пилотные испытания проводятся с небольшим числом участников для отточения процесса взаимодействия. Версия включает словарные языки жестов, проверку грамматики голосовых команд и обеспечение естественности и надёжности системы при непрерывном использовании.

Для оценки пользовательского опыта будет использовано комплексное исследование, сравнивающее три режима взаимодействия, такие как мультимодальное слияние жестов и голоса, ввод только через контроллер и гибридный режим. От участников требуются задачи, включая переключение материалов, вращение и размещение объектов. Для оценки эффективности собираются объективные метрики, такие как время выполнения работы, правильность трудоустройства и штрафы за ошибки. Субъективные оценки получаются от участников с помощью стандартизированных опросников, таких как System Useability Scale (SUS), NASA-TLX когнитивная нагрузка и IPQ-анкета для погружения, при этом интервью с участниками оказывают дополнительную поддержку. Эта двойная оценка кодирует как количественно измеримые показатели производительности, так и субъективный пользовательский опыт.

Прогресс этой системы заключается в применении мультимодального синтеза для задач точного проектирования, выходящих за рамки базовой навигации или взаимодействия. Техника предлагает более органичный, точный и доступный способ взаимодействия, сочетая семантическую ценность голосовых инструкций с пространственными преимуществами жестов. Благодаря адаптивным функциям доступности, таким как запасной вариант только голоса и распознавание жестов одной рукой, система также повышает инклюзивность. Наконец, исследование предлагает методичный, аннотированный мультимодальный набор данных о взаимодействиях голоса и жестов, способствуя будущим исследованиям в области иммерсивного дизайна интерфейсов и усиливая воспроизводимость.

На рисунке 3 показаны типичные скриншоты реализованной программы, что позволяет более ярко представить встроенную VR-систему дизайна интерьера. Иммерсивная среда виртуальной реальности, где пользователи могут исследовать и просматривать планировку комнаты, изображена на рисунке 3A. Рисунок 3B показывает, как естественные взаимодействия рук могут использоваться для выбора, перемещения и вращения виртуальных предметов мебели в процессе манипуляции объектами на основе жестов. Рисунок 3C иллюстрирует интегрированный голосовой интерфейс, где символы микрофона и обратной связи подтверждают пользовательские голосовые команды для пространственных изменений или размещения объектов. В совокупности эти скриншоты предлагаемой мультимодальной VR-системы демонстрируют, что она полностью реализована, позволяя в реальном времени взаимодействовать с жестами и голосом.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Разработанная мультимодальная система домашнего проектирования VR была проверена тремя базовыми наборами данных: EgoGesture (динамические жесты), IPN Hand (постоянные жесты руки) и Fluent Speech Commands (голосовые команды с метками слотов намерений). В совокупности три набора данных предоставляли комплексную базу обучения и оценки, охватывающую как распознавание жестов, так и голосовое семантическое понимание. Валидация показывает, что интеграция жестов и голоса значительно повышает точность выполнения задач и снижает н...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Результаты этого исследования продвигают технологию базового документа, который в основном демонстрировал преимущества иммерсивной VR-навигации для доступности путём сочетания жестов и голосовых модальностей для задач дизайна. Мультимодальная система показала лучшие результаты по всем объективным и субъективным показателям производительности, с более коротким сроком выполнения задач, более высокой точностью размещения и более низким уровнем ошибок по сравнению с контроллерами и гибридным...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

У авторов нет конфликта интересов, которые можно было бы заявлять.

Благодарности

Авторы с благодарностью выражают институциональную поддержку Школы архитектуры, строительства и дизайна, а также Школе дизайна Университета Тейлора за предоставленные ресурсы и академическое руководство в ходе этого исследования.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Набор данных EgoGestureТехнологический университет НаньянDOI: 10.1109/TMM.2018.2808769Крупномасштабный набор данных по эгоцентричным жестам рук для обучения динамическому распознаванию жестов.
Набор данных команд беглой речиFluent.ai / Университет АльбертыDOI: 10.48550/arXiv.1804.04363Набор данных для голосового намерения и семантического понимания слотов для обучения ASR/NLU.
Набор данных HaGRID (опционально)Sber AI / Открытый исходный кодv1.1Опциональный набор данных, используемый для предварительного обучения детектора статических жестов рук.
Анкета присутствия igroup (IPQ)igroup.orgН/ДИспользуется для измерения погружения и присутствия в VR-среде.
Ручной набор данных IPNУниверситет ВеракрусаныDOI: 10.1109/CVPRW50498.2020.00241Набор данных для непрерывных, естественных задач распознавания и сегментации жестов руками.
Матплотлиб / СиборнОткрытый исходный кодПоследняя конюшняИспользуется для визуализации показателей эффективности и результатов оценки.
MediaPipe HandsGoogle ResearchОткрытый исходный код (GitHub)Используется для отслеживания рук и жестов в реальном времени, чтобы распознавать ввод жестов.
Mozilla Common Voice (опционально)Mozilla FoundationВерсия 17Необязательный набор данных для предварительного обучения модели ASR на общих речевых данных.
Мультимодальный слой слиянияПользовательский алгоритмН/ДОбъединяет потоки жестов и голосового ввода на основе арбитража с доверительным весом.
Оценка нагрузки NASA-TLXЧеловеческий фактор NASAН/ДИспользуется для анализа когнитивной нагрузки участников.
Модуль понимания естественного языка (NLU)Custom (на основе BERT / RoBERTa)Н/ДИспользуется для извлечения семантических намерений и слотов (действие, объект, параметр) из транскрибированного голосового входа.
NumPy / Pandas / OpenCVОткрытый исходный кодПоследняя конюшняИспользуется для численных операций, предварительной обработки данных и обработки видеокадров.
Язык программирования PythonФонд программного обеспечения PythonВерсия 3.10+Используется для реализации моделей машинного обучения (TCN, ASR, NLU, FUSION).
Фреймворк глубокого обучения PyTorchMeta AIВерсия 2.0+Используется для построения и обучения распознавания жестов (TCN) и моделей NLU.
RGB-камераLogitech / RealSenseLogitech C920 или Intel RealSense D435Используется для захвата жестов руками и распознавания движений.
Анкета по шкале удобства использования системы (SUS)Инструмент оценки стандартовН/ДИспользуется для оценки субъективной удобности VR-системы.
Временная сверточная сеть (TCN)Пользовательская реализация (PyTorch / TensorFlow)Н/ДИспользуется для динамического распознавания жестов на основе скелетных данных временных рядов.
Unity 3D-движокUnity TechnologiesВерсия 2022.3 LTSИспользуется для создания погружающей VR-среды с интерактивной мебелью, редактирования материалов и рендеринга в реальном времени.
VR-гарнитураOculus (Meta) / HTC ViveOculus Quest 2 или HTC Vive ProИспользуется для иммерсивной визуализации и пространственного отслеживания во время VR-взаимодействия.
Модель Whisper ASROpenAIWhisper (базовая модель)Автоматический движок распознавания речи для преобразования речи в текст.
Рабочая станцияКастомный ПКIntel Core i7 / NVIDIA RTX 3070 / 32 ГБ оперативной памятиИспользуется для обработки в реальном времени, обучения и вывода жестовых и голосовых моделей.

Ссылки

  1. Kim, J., Ahn, J. -H., Kim, Y. Immersive interaction for inclusive virtual reality navigation: enhancing accessibility for socially underprivileged users. Electronics. 14, 1046(2025).
  2. Lee, W. -J., Kim, Y. -H. Does VR tourism enhance users' experience. Sustainability. 13, 806(2021).
  3. Embedding virtual and augmented reality in higher education in Yemeni universities. Nagi, G., Al-Fuhaidi, B. 2024 1st International Conference on Emerging Technologies for Dependable Internet of Things (ICETI), 15-17 January, Riyadh, Saudi Arabia, 1, 1-10 (2024).
  4. Narin, N. G. A content analysis of the metaverse articles. J Metaverse. 1, 17-24 (2021).
  5. Towards a social VR-based exergame for elderly users: an exploratory study of acceptance, experiences, and design principles. Shah, S. H. H., Hameed, I. A., Karlsen, A. S. T., Solberg, M. International Conference on Human-Computer Interaction, 1, Springer. Washington, DC, USA. 1-12 (2022).
  6. Zahedian-Nasab, N., Jaberi, A., Shirazi, F., Kavousipor, S. Effect of virtual reality exercises on balance and fall in elderly people with fall risk: a randomized controlled trial. BMC Geriatr. 21, 509(2021).
  7. Babadi, S. Y., Daneshmandi, H. Effects of virtual reality versus conventional balance training on balance of the elderly. Exp Gerontol. 153 (6), 111498(2021).
  8. Liang, H., et al. Metaverse virtual social center for elderly communication in time of social distancing. Virtual Real Intell Hardw. 5, 68-80 (2023).
  9. Shah, S. H. H., Karlsen, A. S. T., Solberg, M., Hameed, I. A. A social VR-based collaborative exergame for rehabilitation: co-design, development, and user study. Virtual Real. 27, 3403-3420 (2023).
  10. Chen, C. -H., Chen, M. -X. Effects of the design of overview maps on three-dimensional virtual environment interfaces. Sensors. 20, 4605(2020).
  11. Sudár, A., Csapó, A. B. Descriptive markers for the cognitive profiling of desktop 3D spaces. Electronics. 12, 448(2023).
  12. Wang, Y., Hu, Y., Chen, Y. An experimental investigation of menu selection for immersive virtual environments: fixed versus handheld menus. Virtual Real. 25, 409-419 (2021).
  13. Grabowski, A. Practical skills training in enclosure fires: an experimental study with cadets and firefighters using CAVE and HMD-based virtual training simulators. Fire Saf J. 125 (4), 103440(2021).
  14. Zhang, L., et al. A hybrid 2D-3D tangible interface combining a smartphone and controller for virtual reality. Virtual Real. 27, 1273-1291 (2023).
  15. Is it real? Measuring the effect of resolution, latency, frame rate, and jitter on the presence of virtual entities. Louis, T., Troccaz, J., Rochet-Capellan, A., Bérard, F. Proc 2019 ACM Int Conf Interactive Surfaces, 1, 5-16 (2019).
  16. Riches, S., Elghany, S., Garety, P., Rus-Calafell, M., Valmaggia, L. Factors affecting sense of presence in a virtual reality social environment: a qualitative study. Cyberpsychol Behav Soc Netw. 22 (5), 288-292 (2019).
  17. Weech, S., Kenny, S., Barnett-Cowan, M. Presence and cybersickness in virtual reality are negatively related: a review. Front Psychol. 10, 158(2019).
  18. Sae-Bae, N., et al. Emerging NUI-based methods for user authentication: a new taxonomy and survey. IEEE Trans Biom Behav Identity Sci. 1, 5-31 (2019).
  19. Appel, L., et al. Older adults with cognitive and/or physical impairments can benefit from immersive virtual reality experiences: a feasibility study. Front Med. 6, 329(2020).
  20. Pirker, J., Dengel, A. The potential of 360 virtual reality videos and real VR for education: a literature review. IEEE Comput Graph Appl. 41 (6), 76-89 (2021).
  21. Schäfer, A., Reis, G., Stricker, D. Controlling teleportation-based locomotion in virtual reality with hand gestures: a comparative evaluation of two-handed and one-handed techniques. Electronics. 10, 715(2021).
  22. Radhakrishnan, U., Koumaditis, K., Chinello, F. A systematic review of immersive virtual reality for industrial skills training. Behav Inf Technol. 40 (12), 1310-1339 (2021).
  23. Zhang, X., et al. How virtual reality affects perceived learning effectiveness: a task-technology fit perspective. Behav Inf Technol. 36, 548-556 (2017).
  24. Challenor, J., White, D., Murphy, D. Hand-controlled user interfacing for head-mounted augmented reality learning environments. Multimodal Technol Interact. 7, 55(2023).
  25. Budiharto, W. Intelligent controller of electric wheelchair from manual wheelchair for disabled person using 3-axis joystick. ICIC Express Lett B Appl. 12, 201-206 (2021).
  26. Letaief, M., Rezzoug, N., Gorce, P. Comparison between joystick- and gaze-controlled electric wheelchair during narrow doorway crossing: feasibility study and movement analysis. Assist Technol. 33 (1), 26-37 (2021).
  27. Venkatesan, M., Mohan, L., Manika, N., Mathapati, A. Voice-controlled intelligent wheelchair for quadriplegics. Computing, Communication, and Networking Technologies. 1, Springer. 41-51 (2021).
  28. Charlton, J., et al. Manual wheelchair skills training using virtual technology: a systematic review. Technical Report. , Flinders University. (2024).
  29. Genova, C., et al. A simulator for both manual and powered wheelchairs in immersive virtual reality CAVE. Virtual Real. 26, 187-203 (2022).
  30. Hoter, E., Nagar, I. The effects of a wheelchair simulation in a virtual world. Virtual Real. 27, 407-419 (2023).
  31. Improving wheelchair driving performance in a virtual reality simulator. Archambault, P. S., Bigras, C. 2019 Int Conf Virtual Rehabilitation (ICVR), Tel Aviv, 1, 1-2 (2019).
  32. Automatic synthesis of virtual wheelchair training scenarios. Li, W., Talavera, J., Samayoa, A. G., Lien, J. M., Yu, L. F. 2020 IEEE Conf Virtual Reality and 3D User Interfaces (VR), , 539-547 (2020).
  33. Yan, H., Archambault, P. S. Augmented feedback for manual wheelchair propulsion technique training in a virtual reality simulator. J Neuroeng Rehabil. 18 (1), 142(2021).
  34. Montalbán, M. A., Arrogante, O. Rehabilitation through virtual reality therapy after a stroke: a literature review. Rev Cient Soc Esp Enferm Neurol (Engl Ed). 52, 19-27 (2020).
  35. Jessica, P., Salim, S., Syahputra, M. E., Suri, P. A. A systematic literature review on implementation of virtual reality for learning. Procedia Comput Sci. 216 (1), 260-265 (2023).
  36. Efficacious opportunities and implications of virtual reality features and techniques. Nithva, B., Asha, V., Kumar, K., Giri, J. 2022 Fourth Int Conf Cognitive Computing and Information Processing (CCIP), , 1-8 (2022).
  37. The impact of controller type on video game user experience in virtual reality. Hufnal, D., Osborne, E., Johnson, T., Yildirim, C. 2019 IEEE Games, Entertainment, and Media Conf (GEM), , 1-7 (2019).
  38. Zhang, Y., Cao, C., Cheng, J., Lu, H. EgoGesture: a new dataset and benchmark for egocentric hand gesture recognition. IEEE Trans Multimed. 20 (4), 1038-1050 (2018).
  39. Egocentric gesture recognition using recurrent 3D convolutional neural networks with spatiotemporal transformer modules. Cao, C., et al. Proc IEEE Int Conf Computer Vision (ICCV), , 1-9 (2017).
  40. IPN Hand: a video dataset and benchmark for real-time continuous hand gesture recognition. Benitez-Garcia, G., et al. 25th Int Conf Pattern Recognition (ICPR), , 1-8 (2021).
  41. Lu, L., et al. Noncontact 3D gesture recognition enabled VR human-machine interface via electret-nanofiber-based triboelectric sensor. Nano Res. 18, 94907924(2025).
  42. Glorius, J. K., et al. Behavioral training procedures for head-fixed virtual reality in mice. J Vis Exp. (211), e67312(2024).
  43. Li, Y., et al. A stretchable, ionic conductive, and adhesive patch electrode with ultra-low on-skin impedance for electrophysiological signal recording. Sci China Inf Sci. 68, 129402(2025).
  44. Fluent speech commands: a dataset for spoken language understanding research. , Fluent.ai. https://fluent.ai/fluent-speech-commands-a-dataset-for-spoken-language-understanding-research/ (2025).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи