Artykuł badawczy

System wirtualnej rzeczywistości sterowany gestami i głosem do immersyjnego projektowania domów: projektowanie systemu i analiza doświadczeń użytkownika

407 wyświetleń

DOI:

10.3791/70051

3 marca 2026

W tym artykule

Podsumowanie

Niniejszy artykuł przedstawia system rzeczywistości wirtualnej sterowany gestami i głosem do immersyjnego projektowania domów, który poprawia dokładność, użyteczność i dostępność dzięki multimodalnemu połączeniu gestów i wejść mowy. Wyniki eksperymentów wskazują na krótsze czasy pracy, lepszą dokładność rozmieszczania oraz lepsze zadowolenie użytkownika w porównaniu z tradycyjną praktyką.

Streszczenie

Interakcja oparta na gestach i głosie w VR wykazuje obiecujące zastosowania; Jednak istniejące systemy są ograniczone przez nacisk na zadania nawigacyjne, zależność od gestów dwuręcznych, brak precyzyjnej precyzji oraz testy na małych, jednorodnych populacjach. Te ograniczenia ograniczają zastosowanie do skomplikowanych, projektowych procesów pracy. Aby złagodzić te ograniczenia, wprowadzamy system wirtualnej rzeczywistości sterowanej gestami i głosem do immersyjnego projektowania domów, który łączy multimodalne połączenie ręcznie śledzonego wprowadzania gestów oraz instrukcji w języku naturalnym do precyzyjnego rozmieszczenia mebli, wyboru materiałów i dostosowania przestrzennego. Trzy aspekty nowości w systemie to: (i) adaptacyjne tryby interakcji wspierające użycie jedną ręką, numeryczne polecenia głosowe oraz gruba do precyzyjnej korekty precyzji; (ii) wielomodalna architektura fuzji łącząca gesty, mowy i informacje kontekstowe dla precyzji poniżej centymetra; oraz (iii) ramy oceny doświadczeń użytkownika uwzględniające zadania, dostosowane do procesów projektowania domów. Proces tworzenia przebiega systematycznie, od analizy wymagań i projektowania leksykonów gestów oraz głosu, przez multimodalne rozpoznawanie intencji, montaż scen VR z utrzymywaniem i wyrównaniem, aż po testy iteracyjne. Wyniki eksperymentalne dotyczące szerokiej gamy grup uczestników wykazują 30% zmniejszenie błędu przydzielania oraz znaczną poprawę użyteczności i obciążenia w porównaniu z interakcją opartą na kontrolerze. Wyniki sugerują potencjał multimodalnej VR do tworzenia przystępnych i angażujących doświadczeń projektowania domów.

Wprowadzenie

Wirtualna rzeczywistość (VR) to interaktywne środowisko generowane komputerowo, które tworzy trójwymiarowe doświadczenie, w którym użytkownicy mogą widzieć, wchodzić w interakcje i komunikować się z technologią, jakby faktycznie byli obecni. W kontekście tego badania rzeczywistość wirtualna jest postrzegana jako środowisko interakcji multimodalnej, a nie jedynie jako technika wizualnego wyświetlania. Najnowsze systemy VR integrują interakcję wizualną z rozpoznawaniem gestów, zmysłami przestrzennymi i naturalnym wejściem głosowym, pozwalając użytkownikom na precyzyjne obsługiwanie symulowanych przedmiotów. To zrozumienie jest zgodne z aktualnymi badaniami VR, które sta....

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Badanie to zostało zatwierdzone przez Komitet ds. Etyki Badań Uniwersytetu Taylora w Subang Jaya, Malezja. Wszystkie procedury były zgodne z wytycznymi etycznymi ustanowionymi przez instytucjonalny komitet badawczy i zgodne z Deklaracją Helsińską. Przed zebraniem danych uzyskiwano świadomą zgodę każdego uczestnika. Zostali wyraźnie poinformowani o celach badania, zapewnieni, że udział jest dobrowolny, ich odpowiedzi pozostaną poufne i że mogą się wycofać w dowolnym momencie bez żadnych konsekwencji. Uzyskano również pisemną świadomą zgodę na wykorzystanie anonimowych danych interakcji i ankiet w publikacjach naukowych. W rękopisie nie uwzględniono żadnych danych osobo....

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Zaprojektowany wielomodalny system projektowania VR został zweryfikowany za pomocą trzech podstawowych zbiorów danych: EgoGesture (gesty dynamiczne), IPN Hand (ciągłe gesty ręką) oraz Fluent Speech Commands (polecenia głosowe z etykietami slotów intencyjnych). Łącznie trzy zbiory danych oferowały kompleksową bazę szkoleniową i ewaluacyjną, obejmującą zarówno rozpoznawanie gestów, jak i semantyczne rozumienie głosowe. Weryfikacja potwierdza, że integracja gestów i głosu znacząco zwiększa dokładność zadań i zmniejsza obcią.......

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Wyniki tych badań rozwijają technologię artykułu bazowego, który głównie pokazał zalety immersyjnej nawigacji VR dla dostępności poprzez łączenie modalności gestów i głosu do zadań projektowych. System multimodalny osiągał lepsze wyniki we wszystkich obiektywnych i subiektywnych miarach wydajności, dzięki krótszym czasom realizacji zadań, wyższej dokładności umieszczania i niższym wskaźnikom błędów niż podejścia oparte na kontrolerze i hybrydowe. Ponadto wskaźniki użyteczności takie jak SUS, NASA-TLX i IPQ odnotowały wię.......

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy nie mają żadnych konfliktów interesów do zgłoszenia.

Podziękowania

Autorzy z wdzięcznością doceniają instytucjonalne wsparcie ze strony School of Architecture, Building & Design oraz The Design School, Taylor's University, za zapewnienie zasobów i doradztwa naukowego podczas tych badań.

....

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Zbiór danych EgoGestureUniwersytet Technologiczny NanyangDOI: 10.1109/TMM.2018.2808769Duży, egocentryczny zbiór danych o gestach dłoni do treningu dynamicznego rozpoznawania gestów.
Zestaw danych poleceń płynnej mowyFluent.ai / Uniwersytet AlbertyDOI: 10.48550/arXiv.1804.04363Zbiór danych do intencji głosu i semantycznego rozumienia opartego na slotach do treningu ASR/NLU.
Zbiór danych HaGRID (opcjonalnie)Sber AI / Open Sourcev1.1Opcjonalny zbiór danych używany do statycznego wstępnego treningu detektora gestów dłoni.
Kwestionariusz obecności Igroup (IPQ)igroup.orgNie maUżywany do pomiaru immersji i obecności w środowisku VR.
Zestaw danych ręcznych IPNUniversidad VeracruzanaDOI: 10.1109/CVPRW50498.2020.00241Zbiór danych do ciągłego, naturalnego rozpoznawania gestów dłoni i zadań segmentacji.
Matplotlib / SeabornOpen SourceNajnowsza stabilnośćWykorzystywane do wizualizacji metryk wydajności i wyników oceny.
MediaPipe HandsGoogle ResearchOpen-source (GitHub)Wykorzystywane do śledzenia rąk i gestów w czasie rzeczywistym, aby rozpoznać dane wejściowe gestów.
Mozilla Common Voice (opcjonalnie)Mozilla FoundationWersja 17Opcjonalny zbiór danych do pretrenowania modelu ASR na ogólnych danych mowy.
Warstwa fuzji multimodalnejAlgorytm niestandardowyNie maŁączy strumienie gestów i głosu oparte na arbitrażu ważonym zaufaniem.
Ocena obciążenia NASA-TLXCzynniki ludzkie NASANie maWykorzystywane do analizy obciążenia poznawczego uczestników.
Moduł Natural Language Understanding (NLU)Custom (oparty na BERT / RoBERTa)Nie maUżywany do wyodrębniania semantycznych intencji i slotów (akcja, obiekt, parametr) z transkrypcji wejścia głosowego.
NumPy / Pandas / OpenCVOpen SourceNajnowsza stabilnośćWykorzystywane do operacji numerycznych, wstępnego przetwarzania danych oraz manipulacji klatkami wideo.
Język programowania PythonPython Software FoundationWersja 3.10+Wykorzystywane do implementacji modeli ML (TCN, ASR, NLU, fuzja).
Ramy Głębokiego Uczenia PyTorchMeta AIWersja 2.0+Wykorzystywane do budowania i trenowania modeli rozpoznawania gestów (TCN) oraz NLU.
Kamera RGBLogitech / RealSenseLogitech C920 lub Intel RealSense D435Wykorzystywane do rejestrowania gestów dłonią i rozpoznawania ruchu.
Kwestionariusz dotyczący skali użyteczności systemu (SUS)Standardowe narzędzie ewaluacyjneNie maUżywany do oceny subiektywnej użyteczności systemu VR.
Temporal Convolucional Network (TCN)Niestandardowa implementacja (PyTorch / TensorFlow)Nie maWykorzystywane do dynamicznego rozpoznawania gestów na podstawie szkieletowych danych szeregów czasowych.
Unity 3D EngineUnity TechnologiesWersja 2022.3 LTSWykorzystywany do tworzenia immersyjnego środowiska VR z interaktywnymi meblami, edycją materiałów i renderowaniem w czasie rzeczywistym.
Zestaw VROculus (Meta) / HTC ViveOculus Quest 2 lub HTC Vive ProWykorzystywane do immersyjnej wizualizacji i śledzenia przestrzennego podczas interakcji VR.
Whisper ASR ModelOpenAIWhisper (model bazowy)Automatyczny silnik rozpoznawania mowy do konwersji mowy na tekst.
Stacja roboczaKomputer zbudowany na zamówienieIntel Core i7 / NVIDIA RTX 3070 / 32 GB RAMWykorzystywane do przetwarzania w czasie rzeczywistym, treningu oraz wnioskowania modeli gestów i głosu.

Bibliografia

  1. Kim, J., Ahn, J. -H., Kim, Y. Immersive interaction for inclusive virtual reality navigation: enhancing accessibility for socially underprivileged users. Electronics. 14, 1046(2025).
  2. Lee, W. -J., Kim, Y. -H. Does VR tourism enhance users' experience....

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Sterowanie gestamisterowanie g osoweinterakcja multimodalnaledzenie d oniwej cie w j zyku naturalnymprecyzyjne rozmieszczanie mebliregulacja przestrzenna

Powiązane artykuły