Forschungsartikel

Ein Gesten- und Sprachgesteuertes Virtual-Reality-System für immersives Wohndesign: Systemdesign und Analyse der Benutzererfahrung

DOI:

10.3791/70051

3. März 2026

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dieses Papier präsentiert ein Virtual-Reality-System, das durch Gesten und Stimme für immersives Wohndesign gesteuert wird und die Genauigkeit, Benutzerfreundlichkeit und Zugänglichkeit durch die multimodale Verschmelzung von Gesten- und Spracheingaben verbessert. Experimentelle Ergebnisse zeigen kürzere Aufgabenzeiten, eine verbesserte Platzierungsgenauigkeit und eine höhere Nutzerzufriedenheit im Vergleich zur traditionellen Praxis.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gesten- und Sprachinteraktion in VR hat sich in verschiedenen Anwendungen als vielversprechend erwiesen; Bestehende Systeme werden jedoch durch ihren Schwerpunkt auf Navigationsaufgaben, die Abhängigkeit von beidhändigen Gesten, mangelnde feinkörnige Präzision und Tests an kleinen, homogenen Populationen behindert. Diese Einschränkungen schränken die Anwendbarkeit auf komplexe, designzentrierte Arbeitsabläufe ein. Um diese Einschränkungen zu beheben, führen wir ein Gesten- und Sprachgesteuertes Virtual-Reality-System für immersives Wohndesign ein, das die multimodale Fusion von handgetrackter Gesteneingabe und natürlichen Sprachanweisungen für präzise Möbelplatzierung, Materialauswahl und räumliche Anpassung integriert. Drei Aspekte der Neuheit im System sind (i) adaptive Interaktionsmodi zur Unterstützung der einhändigen Nutzung, numerische Sprachbefehle und eine grobe bis feine Anpassung der Präzision; (ii) multimodale Fusionsarchitektur, die Gesten-, Sprach- und Kontextinformationen für eine Genauigkeit unter Zentimeter zusammenführt; und (iii) ein aufgabenorientiertes Bewertungsmodell für Benutzererfahrung, das auf Hausdesignprozesse zugeschnitten ist. Der Entwicklungsprozess folgt einer systematischen Pipeline, von der Anforderungsanalyse und dem Design von Gesten- und Sprachlexikons über multimodale Absichtserkennung, VR-Szenenmontage mit Snapping und Ausrichtung bis hin zu iterativen Tests. Experimentelle Ergebnisse bei einer Vielzahl von Teilnehmerpopulationen zeigen einen 30%igen Rückgang des Platzierungsfehlers und erhebliche Verbesserungen bei der Benutzerfreundlichkeit und Arbeitsbelastungsbewertung gegenüber der Interaktion mit Controllern. Die Ergebnisse deuten auf das Potenzial multimodaler VR hin, um zugängliche und ansprechende Wohndesign-Erlebnisse zu schaffen.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Virtual Reality (VR) ist eine interaktive, computergenerierte Umgebung, die ein dreidimensionales Erlebnis erzeugt, in dem Nutzer Technologie sehen, mit ihr interagieren und mit ihr kommunizieren können, als wären sie tatsächlich anwesend. Im Kontext dieser Studie wird Virtual Reality als multimodale Interaktionsumgebung betrachtet und nicht nur als visuelle Darstellungstechnik. Die neuesten VR-Systeme integrieren visuelle Interaktion mit Gestenerkennung, räumlichen Sinnen und natürlicher Spracheingabe, sodass Nutzer simulierte Objekte mit hoher Präzision bedienen können. Dieses Verständnis stimmt mit der aktuellen VR-Forschung überein, die Immersion, Engagement und natürliche Nutzererfahrungen priorisiert. Zu den Anwendungsbereichen gehören Aufführung, Lehre2, medizinische Behandlung3 und Reisen4. VR ermöglicht es Menschen, mit Welten zu interagieren und sich zu verbinden, die im echten Leben nicht erreichbar wären, indem reale Umgebungen simuliert werden. Für Hausdesignprozesse, bei denen Nutzer räumliche Layouts wahrnehmen, Objekte steuern und Echtzeit-Feedback erhalten müssen, ohne dass physische Bewegung erforderlich ist, sind solche Immersionsfunktionen besonders hilfreich. Diese Funktionen können neue Möglichkeiten bieten, insbesondere für Nutzer mit unvollständiger körperlicher Bewegung. Mitglieder informell benachteiligter Gruppen, insbesondere ältere Menschen und solche mit minimaler alphanumerischer Lesefähigkeit, werden durch verschiedene Faktoren wie körperliche Einschränkungen, Mobilitätsprobleme und Schwierigkeiten beim Zugang zu digitaler Technologie aufgrund altersbedingter Einschränkungen eingeschränkt. Es ist daher notwendig, kontinuierliche Aufmerksamkeit auf Forschung zu richten, die indirekt die Außenwelt durch VR-Expertise für diese Menschen zugänglich macht. Dieser Bedarf an kontinuierlicher Forschungsaufmerksamkeit unterstützt nicht nur die Schaffung barrierefreiheitsorientierter VR-Erlebnisse, sondern treibt auch die Entwicklung von Systemen voran, die über grundlegende Navigationsaufgaben hinausgehen. Tatsächlich können immersive Wohnumgebungen – wenn sie durch natürliche Gesten und Stimmen gesteuert werden – älteren Nutzern, Menschen mit motorischen Beeinträchtigungen und digital verletzlichen Bevölkerungsgruppen intuitive Möglichkeiten bieten, mit komplexen räumlichen Umgebungen zu interagieren. Indem sie indirekten Zugang zu externen Räumen und kreativen Aufgaben ermöglichen, tragen solche Systeme sowohl zur funktionalen Unabhängigkeit als auch zum emotionalen Wohlbefinden bei. Auf dieser Grundlage wird diese Studie ein multimodales VR-Home-Design-System einführen. Daher ist es der Wunsch nach ständiger Aufmerksamkeit für Forschung, der dazu beiträgt, die Außenwelt für Menschen mit VR-Erfahrung indirekt zugänglich zu machen. Untersuchungen haben gezeigt, dass VR-basierte Interventionen für ältere Erwachsene mehrere Vorteile haben können, wie etwa die Verringerung des Sturzrisikos durch Verbesserung der Haltungskontrolle und -flexibilität6 sowie die Verbesserung der allgemeinen Haltungsregulation und Festigkeit7. Außerdem gibt es eine zunehmende Verfügbarkeit von VR-Material, das speziell für die ältere erwachseneBevölkerung maßgeschneidert ist. 8,9. Auch wenn die VR-Interaktion weiterentwickelt hat, basieren die meisten aktuellen Systeme hauptsächlich auf Controller und beidhändigen Gesten, die die Zugänglichkeit und Genauigkeit für Aufgaben einschränken, die Design erfordern. Erweiternd auf diesen Mobilitätsmerkmalen erweitert unsere Arbeit VR über das bloße Beobachten hinaus, indem wir aktives, präzises und realistisches Management von Innenarchitekturelementen mittels Gesten- und Sprachmethoden ermöglichen

VR hat drei verwandte Eigenschaften: Kommunikation, Beteiligung und Gedanken10. Das Maß an Engagement und die Stärke der Interaktion mit simulierten Objekten beeinflussen direkt die Vorstellungskraft der Nutzer in der virtuellen Atmosphäre. Je nach Immersionsstufe werden VR-Schemata in nicht-immersive VR, semi-immersive VR und vollständig immersive VR unterteilt, die jeweils unterschiedliche Kombinationen von Kommunikationsmethoden, Strategien und Grenzen nutzen. 11 Nicht-immersive VR ermöglicht die Kommunikation mit virtuellen Umgebungen auf dem Desktop oder Touchscreens auf Handheld-Geräten per Maus und zeichnet12, 13, 14. Halb-immersive VR besteht häufig aus einem großen Bildschirm, einer Organisation und Bildschirmen, was ein filmisches Erlebnis bietet, aber bei Gruppennutzung oft an Positionsverfolgung fehlt. Gestenbasierte Verbindungen werden seit Beginn von VR15 erforscht, um die Nutzung von VR-Technologie komfortabel und vertraut zu machen. In einer gestenbasierten Schnittstelle werden physische Körperzeichen wie Handbewegungen verwendet, um mit einem Computersystem zu kommunizieren.

Ein Gestenrahmen ist eine gängige Umsetzung des allgemeineren Prinzips einer natürlichen Benutzeroberfläche (NUI), das angewendet werden kann, um Schnittstellentransparenz in HMD-basierter VR zu erreichen. Die Aspekte, die das Auftreten in VR fördern, wurden zuvor untersucht 16,17; dennoch gibt es nur wenige Studien zum Auftreten im Hintergrund gestenbasierter Benutzeroberfläche. Das Verständnis der Einflüsse, die das Auftreten von VR beeinflussen können, mit einer gestenbasierten Benutzeroberfläche kann bei der Entwicklung kommender immersiver Technologien von Vorteil sein. Daher haben wir aus der Perspektive von Vorkommen und gestenbasierter Kommunikation das Nutzererlebnis einer immersiven VR-Interaktion auf Basis einer gestenbasierten Benutzeroberfläche untersucht. Für sozial gefährdete Menschen kann ein Teilbereich der virtuellen Realität (VR) ein effektives Instrument sein. Mit dieser Technologie können Nutzer virtuell die Welt erkunden, ohne sich zu bewegen, an verschiedene Orte reisen und soziale Interaktionen mit anderen Nutzern pflegen, komplett mit Mehrparteien-Funktionalität. Für körperlich und umweltlich Beeinträchtigte kann diese Beteiligung eine nützliche Ergänzung zur Outdoor-Aktivität sein. Über die einfache Navigation hinaus erstrecken sich die durch 360°-Meinungstechnologie ermöglichten Bildungsmöglichkeiten auf mehrere Bildungsbereiche.

Eine systematische Literaturübersicht mit 64 Trainingseinheiten betonte die informativen Anwendungen, Vorteile und Kommunikationseigenschaften von 360°-VR-Videos und tatsächlicher VR. Die Ergebnisse zeigen, dass 360°-VR die Präsentation, Motivation und Informationsspeicherung der Lernenden verbessern kann und so die Immersion fördert. Der Forscher21 verknüpfte zwei einhändige und zweihändige Benutzeroberflächen in einem teleportationsbasierten Bewegungsschema. Die Ergebnisse zeigen, dass einhändige Signale von denjenigen, die sie bevorzugten, als schneller zu starten wahrgenommen wurden, während zweihändige Zeichen als zuverlässiger galten, obwohl das Element nur Teleportation und nicht die ständige Bewegung behandelt, wie in diesem Werk verwendet.

Die Annahme einer höheren Konsistenz bei den Zweihandzeichen und der höheren Anfangsschnelligkeit bei den einhändigen Zeichen wurde als Grundlage für diese Studie aufgestellt und herangezogen. Eine detailliertere Spezifikation der technischen Bewertungsbeschränkungen, über Präsentation und Servicefähigkeit hinaus, bezüglich der Schulung von Bedienern zur Erfüllung der Verantwortlichkeiten in VR22 ist ebenfalls erforderlich. Für diese Trainingssituation unterrichten die Panels die Bediener durch Aktivitäten, wobei die Technologiebewertung ein entscheidender Bestandteil ist. Darüber hinaus ist die grundlegende Prämisse, dass die HT-Technologie, wenn sie richtig angewendet wird, auch im Bereich der Technologie Fortschritte bringenkann 23,24. In neueren Forschungen wurde gezeigt, dass virtuelle Umgebungen nicht nur für die Bewertung von Rollstuhlsteuerungsdiensten nützlich sind, sondern auch nützliche Anwendungen besitzen, einschließlich der Ausbildung in flexiblen Diensten, die im echten Leben schwierig oder teuer nachzubilden wären. So weist der Autor25 darauf hin, dass VR-Simulatoren die Verallgemeinerung von Steuerdiensten auf physische Umgebungen erleichtern können, indem sie eine geschickte und harmlose technologische Umgebung bieten.

Der Forscher hebt außerdem die Anwendung virtueller Fähigkeiten als Interventionsprogramm für die Ausbildung von Rollstuhldiensten hervor und betont deren Nutzen und Nutzen bei der individuellen Bewegungsanpassung und der Verbesserung der Flexibilitätsleistungen. Aus Sicherheitsgründen werden die Nutzer jedoch im Voraus überprüft und überprüft, insbesondere in Virtual-Reality-Umgebungen26,27. Eine solche Umsetzung ermöglicht es Menschen mit körperlichen Behinderungen, ihre Rollstuhlfahrfähigkeiten in einer sicheren und kontrolliertenUmgebung zu üben und zu verfeinern. Sie können verschiedene virtuelle Tests und Szenarien erleben, darunter das Überwinden schwieriger Probleme, das Navigieren in engen Räumen oder das Ausführen komplexer Manöver. Gleichzeitig können Nutzer sofortiges Feedback zu ihrer Leistung erhalten und neue Bewegungsstrategienerwerben. Neben der Funktion als Trainingshilfe hat Virtual Reality therapeutische Anwendungen30. Das Angebot einer immersiven Bildtechnologie kann dazu beitragen, Selbstsicherheit, Organisation und körperliche Wiedereingliederung zu verbessern. Individuen können ihre motorischen Fähigkeiten entwickeln und ihre Stabilität sowie Stabilität verbessern. Virtual-Reality-Umgebungen sind computergenerierte Darstellungen, die es den Nutzern ermöglichen, das Gefühl zu haben, Teil von ihnenzu sein 31.

Diese Situation wird mit Virtual-Reality-Kopfhörern oder anderen Strategien visualisiert. Mockups können Risikosituationen oder herausfordernde Situationen vor ihrer Umsetzung simulieren, wie medizinische Ereignisse oder den Einsatz bestimmter Strategien 32,33,34. Ein weiterer Vorteil ist jedoch die Möglichkeit, Gerätegeräte wie Bedienelemente, bewegungsmessende Ornamente, Mikrofone oder Westen anzubringen, um eine effiziente Kommunikation zwischen Arbeitgeber und Mechanismus35 in einem harmlosen und sorgfältig nachgebildeten Umfeld vor dem Einsatz in den tatsächlichen Umgebungen zu ermöglichen. Virtuelle Substanzen können in verschiedenen Modi betrieben werden, wie zum Beispiel mit Joysticks, Sprachanweisungen oder gefilmten Spuren, wie in einer Kinect-Studie36. Alle Alternativen erfordern Lernen für die Nutzer, daher ist die Erfahrung des Nutzers ein entscheidender Faktor bei der Wahl des Kontrollansatzes37.

Obwohl Gesten und Sprachinteraktion in virtuellen Räumen für Navigationsaufgaben untersucht wurden, einschließlich des im Grundpapier diskutierten Street-View-Systems, gibt es eine erhebliche Lücke in der Anwendung dieser Modalitäten auf präzisionsgetriebene und kreative Arbeitsbereiche, wie zum Beispiel immersives Wohndesign. Die grundlegende Studie bewies, dass multimodale Eingaben für die Zugänglichkeit geeignet sind, umfassten jedoch nur Navigation und Szenenuntersuchung, wobei beidhändige Gesten, einfache Befehle und eine kleine Teilnehmergruppe verwendet wurden. Es umfasste keine Schwierigkeiten wie hochpräzise Manipulation, präzise räumliche Positionierung, Materialbearbeitung oder kollaborative Arbeitsabläufe, die Innen- und Architekturdesignaktivitäten definieren. Darüber hinaus richteten sich die Tests auf eine enge, homogene Nutzergruppe, was die Beobachtungen zur Benutzerfreundlichkeit für breitere Bevölkerungsgruppen und unterschiedliche Zugänglichkeitsbedürfnisse einschränkte. Aktuelle VR-Designtools basieren hauptsächlich auf Controllern, die natürliche Interaktion einschränken und Nutzer mit motorischen oder Lernbehinderungen ausschließen. Daher fehlt es an der Entwicklung und Prüfung eines Systems, das Gesten und Sprache für grobe und feine Objektmanipulation integriert, sprachgesteuerte numerische Änderungen ermöglicht, einhändige und barrierefreiheitsfördernde Interaktionsstile ermöglicht und mit umfangreicher Nutzererfahrungsanalyse in tatsächlichen Designaufgaben getestet wird38,39. Das Schließen dieser Lücke kann einen neuen, nutzerzentrierten Ansatz für immersives Hausdesign schaffen, der auf früheren Forschungen zur multimodalen VR-Navigation aufbaut.

Jüngste Entwicklungen bei multimodalen Mensch-Maschine-Schnittstellen haben fortschrittliche Sensor- und Interaktionsmechanismen erforscht, um die Benutzerfreundlichkeit und Immersion von VR40 zu verbessern. Der Autor41 stellte einen auf Elektret-Nanofaser basierenden triboelektrischen Sensor für kontaktlose 3D-Gestenerkennung vor und zeigte, dass eine hochpräzise Interpretation von Gesten auch ohne traditionelle visuelle Verfolgung erreicht werden kann und eine natürlichere, berührungslose VR-Steuerung ermöglicht. Andererseits präsentierte der Forscher42 ein robustes Verhaltenstrainingsverfahren für kopffixierte VR-Systeme bei Mäusen. Die Studie zeigte, wie kontrollierte VR-Umgebungen präzise Verhaltensmessungen und stabile Interaktionsprotokolle unterstützen können, und hob die Bedeutung von Wiederholbarkeit und systematischem Design in VR-Workflows hervor. Gleichzeitig schlug der Autor43 eine dehnbare und klesbare ionisch-leitfähige Elektrode mit ultraniedriger Hautimpedanz zur verbesserten elektrophysiologischen Signalaufnahme vor; dies öffnet den Weg für biointegrierte Sensoren, die die Interaktionstreue von XR und VR weiter steigern könnten. Tatsächlich zeigen all diese Studien, wie schnell sich Sensortechnologie, Trainingsprotokolle und physiologische Schnittstellen entwickeln – alles nur, weil flexiblere, multimodale Interaktionsrahmenwerke benötigt werden, wie etwa das in dieser Studie vorgeschlagene Gesten-Stimm-System.

Dieses Protokoll bietet einen multimodalen Gesten-Sprachweg, der einhändige, zugängliche Gesten, sprachbasierte numerische Verbesserungen und präzisionsgesteuertes Hausdesign ermöglicht, im Gegensatz zu aktuellen VR-Interaktionsmodellen, die hauptsächlich Navigation oder controllerbasierte Manipulation unterstützen. Soweit wir wissen, ist dies das erste Protokoll, das Gesten-Stimm-Fusion kombiniert und speziell auf räumliche Präzision, Materialmodifikation und inklusive Designprozesse abgestimmt ist.

Die Hauptziele dieser Arbeit sind es, ein gesten- und sprachgestütztes Virtual-Reality-(VR)-System zu schaffen, das speziell für ansprechende Hausdesignaktivitäten zugeschnitten ist, und die multimodalen Eingabemöglichkeiten zu erweitern, um eine genaue Möbelplatzierung, Rotation, Skalierung sowie Material- oder Lichtbearbeitung zusätzlich zu den üblichen Navigationsfunktionen zu unterstützen. Ein zentrales Ziel ist die Entwicklung einer multimodalen Fusions-Engine, die Gesten, Stimme und kontextuelle Eingaben integriert, um sowohl grobe als auch feinkörnige Steuerung während der Innenarchitektur zu erreichen. Das System führt zudem adaptive Interaktionsmodi ein, wie einhändige Gesten, barrierefreiheitsorientierte Funktionen und sprachgesteuerte Präzisionsbefehle, um eine breite Palette von Benutzergruppen zu unterstützen.

Diese Arbeit zielt außerdem darauf ab, eine umfassende User-Experience-(UX)-Bewertung durchzuführen, die quantitative Messgrößen wie Aufgabenabschlusszeit, Platzierungsgenauigkeit und Fehlerquote mit qualitativen Bewertungen von Benutzerfreundlichkeit, Arbeitsbelastung und Nutzerzufriedenheit verbindet. Ein bedeutender Fortschritt gegenüber früheren Studien wird durch den Wechsel von Straßenansichts-basierten Navigationssystemen zu einem aufgabenorientierten und präzisionsorientierten Innenarchitekturrahmen erzielt. Der wichtigste Beitrag liegt in der Entwicklung einer gesten- und sprachgesteuerten VR-Umgebung für immersives Hausdesign, die den Umfang früherer Forschung erweitert, die sich hauptsächlich auf Gesten-Sprach-Integration für die Straßenansichtsnavigation konzentrierte.

Wichtig ist, dass kein vorheriges System multimodale Gesten-Sprech-Kommunikation speziell für präzisionsabhängige Hausdesign-Operationen wie Objektpositionierung, Skalierung, Rotation und Materialbearbeitung effektiv kombiniert hat. Bestehende Ansätze fehlen auch Alternativen zur adaptiven Interaktion, einschließlich einhändiger Gesteneingabe oder sprachbasierter numerischer Verfeinerung. Das vorgeschlagene System führt ein umfassendes multimodales Interaktionsparadigma ein, das Gestenerkennung – erreicht durch MediaPipe Hands oder VR-Headset-basierte Handverfolgung – mit Temporal Convolutional Network-Klassifikatoren sowie Spracherkennung und natürlicher Sprachinterpretation, gesteuert von Whisper ASR und transformerbasierten Absichtsklassifikationsmodellen, verbindet.

Um einen robusten Betrieb zu gewährleisten, wird ein entscheidungsbasierter multimodaler Fusionsmechanismus mit konfidenzbasierter Schiedsgerichtsbarkeit implementiert, der Gesten auf räumliche Auswahlaufgaben und Sprachbefehle auf präzise Verfeinerungen abbildet. Dieses Design ermöglicht eine präzise Platzierung, Skalierung, Rotation und Materialwechsel von Objekten in virtuellen Hausdesign-Umgebungen. Der Workflow folgt einer strukturierten Pipeline, die mit der Definition von Systemanforderungen, dem Entwerfen von Gesten- und Sprachlexikonen, der Entwicklung multimodaler Fusionstechniken und dem Aufbau einer immersiven VR-Umgebung in Unity 3D beginnt, die mit Schnappwerkzeugen, Messüberlagerungen und Materialvorschauen ausgestattet ist. Darauf folgen Systemintegration, Pilottests und Bewertung der Nutzererfahrung durch vergleichende Studien.

Das System bietet latenzarme multimodale Interaktion (unter 200 ms), Unterstützung für adaptive Barrierefreiheit und eine verbesserte Benutzerfreundlichkeit im Vergleich zu herkömmlichen controllerbasierten VR-Systemen. Die experimentelle Bewertung wird die Abschlusszeit der Aufgaben, die Genauigkeit der Platzierung, Fehlerraten, SUS-Werte, NASA-TLX-Arbeitslastmetriken und IPQ-Präsenzbewertungen quantifizieren. Die erwarteten Ergebnisse zeigen, dass multimodale Interaktionen die Präzision, Effizienz und Nutzerzufriedenheit im auf VR basierenden Hausdesign deutlich steigern.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Studie wurde vom Forschungsethikkomitee der Taylor's University, Subang Jaya, Malaysia, genehmigt. Alle Verfahren folgten den ethischen Richtlinien des institutionellen Forschungsausschusses und der Erklärung von Helsinki. Vor der Datenerhebung wurde von jedem Teilnehmer eine informierte Zustimmung eingeholt. Sie wurden eindeutig über die Ziele der Studie informiert, versichert, dass die Teilnahme freiwillig sei, ihre Antworten vertraulich bleiben würden und sie jederzeit ohne Konsequenzen zurücktreten konnten. Für die Verwendung anonymisierter Interaktions- und Umfragedaten in wissenschaftlichen Publikationen wurde auch eine schriftliche informierte Zustimmung eingeholt. In diesem Manuskript sind keine personenbezogenen Informationen, Bilder oder sensiblen personenbezogenen Daten enthalten.

Die vorgeschlagene Arbeit formuliert ein Gesten- und Sprachbasiertes Virtual-Reality-(VR)-System, das für immersive Hausgestaltung konzipiert ist und damit aktuelle Methoden für navigationsorientierte Aufgaben übertrifft. Der Ansatz beginnt mit der Identifizierung von Nutzerbedürfnissen und Designaktivitäten, einschließlich Möbeleinteilung, Objektskalierung und -rotation, Materialbearbeitung und präzisen Raummessungen. Anschließend wird ein Gesteninteraktionssystem entwickelt, bei dem uneingeschränkte Handgesten (wie Kneifen, Greifen und Drehen) mittels headsetbasiertem Tracking oder MediaPipe Hands erkannt und von leichtgewichtigen Machine-Learning-Modellen, einschließlich Temporal Convolutional Networks (TCN), identifiziert werden. Zur Ergänzung der Gesten wird eine organisierte Sprachbefehlsgrammatik etabliert, kombiniert mit Whisper-basierter automatischer Spracherkennung (ASR) und natürlichem Sprachverständnis (NLU), um Absichten und Parameter für eine höhere semantische Kontrolle abzuleiten. Die beiden Modalitäten werden in einer multimodalen Fusionsstrategie kombiniert, bei der Gesten zur räumlichen Auswahl und Manipulation verwendet werden und Sprachbefehle präzise Verfeinerungen bieten, ergänzt durch einen vertrauensbasierten Arbitrationsmechanismus und Fehlerbehebung durch Rückgängigmachbefehle.

Die immersive Designumgebung wird in Unity 3D bereitgestellt und bietet Snapping, Kollisionsreaktion, Messüberlagerungen sowie eine interaktive Möbel- und Materialbibliothek, um realistische Designabläufe zu ermöglichen. Pilottests werden durchgeführt, um die Natürlichkeit der Interaktion, Stabilität und geringe Latenz (<200 ms) vor der formellen Bewertung sicherzustellen.

Teilnehmer und Stichprobenstrategie
Insgesamt wurden 48 Teilnehmer für die Nutzerstudie rekrutiert, um Vielfalt und die Verallgemeinerbarkeit der Ergebnisse sicherzustellen. Das Alter der Teilnehmer reichte von 19 bis 62 Jahren (M = 32,4, SD = 10,7), mit 26 Männern und 22 Frauen. Um Variationen in der Vertrautheit mit immersiven Technologien zu erfassen, wurden die Teilnehmer in drei Gruppen von VR-Erfahrungen eingeteilt: Anfänger (n = 18) mit wenig oder keiner vorherigen VR-Exposition, fortgeschrittene Nutzer (n = 17) mit seltener VR-Nutzung und erfahrene Nutzer (n = 13), die VR regelmäßig, hauptsächlich beruflich, nutzten. Um die Zugänglichkeit und Inklusivität der Stichprobe zu gewährleisten, wurden außerdem 6 Teilnehmer mit leichten Mobilitätseinschränkungen und 4 Teilnehmer, die aufgrund motorischer Einschränkungen eine einhändige Interaktion bevorzugten. Alle Teilnehmer hatten entweder normales oder korrigiertes auf normales Sehvermögen, und keiner berichtete von vestibulären oder neurologischen Erkrankungen, die die Nutzung der VR beeinträchtigen könnten.

Die Teilnehmer wurden zufällig den drei Interaktionsbedingungen unter Verwendung einer ausgewogenen Zuteilungsstrategie zugeordnet: Geste+Stimme (n = 16), nur Controller (n = 16) und Hybrid (n = 16). Ihre Erfahrungsstufen wurden gleichmäßig auf die drei Gruppen verteilt, um Vorurteile zu vermeiden und eine vergleichbare Schwierigkeit der Aufgaben unter den Bedingungen zu gewährleisten. Alle Teilnehmer gaben vor Beginn des Experiments eine schriftliche informierte Einwilligung.

Anschließend wird eine Nutzerstudie über drei Interaktionsbedingungen durchgeführt, wie Gestensprache, Controller-only und Hybrid, um Präzision, Effizienz und Nutzererfahrung zu bewerten. Quantitative Kennzahlen umfassen Platzierungsgenauigkeit, Aufgabendauer und Fehlerquoten, während subjektive Bewertung SUS, NASA-TLX und IPQ nutzt, unterstützt durch qualitative Interviews. Dieses hier vorgestellte System bietet drei Hauptneuheiten: die Nutzung multimodaler Gesten-Stimm-Fusion für präzise Objektmanipulation in VR, adaptive und zugängliche Interaktionsmodi wie Einhandgesten und Sprachrückgriff sowie die Bereitstellung eines reproduzierbaren Korpus annotierter Gestensprachebefehle. In Kombination sorgen diese Schritte für erhöhte Genauigkeit, Effektivität und Benutzererfahrung, gehen direkt auf die Schwächen des Grundsatzes ein und fördern die Forschung zur immersiven VR-Interaktion für Designzwecke. Abbildung 1 zeigt die Architektur der vorgeschlagenen Methode.

Die Systemarchitektur der vorgeschlagenen Methode, wie in Abbildung 1 dargestellt, beginnt mit Eingabemodalitäten, bei denen Gesten mit Datensätzen wie EgoGesture und IPN Hand sowie Sprachbefehlen aus dem Datensatz Fluent Speech Commands aufgezeichnet werden. Diese Eingaben werden unabhängig mit Gestenerkennungs- und Spracherkennungsmodulen verarbeitet, um räumliche und semantische Daten zu erzeugen. Die beiden Ströme sind in einer multimodalen Fusionsschicht verschmolzen, die Gesten- und Spracheingaben ausrichtet, um konsistente Befehle zu erzeugen. Diese fusionierten Daten werden in der VR-Interaktionsschicht genutzt, um den Nutzern die Manipulation von Objekten durch Platzierung, Rotation, Skalierung und Materialmodifikation in Echtzeit zu erleichtern. Schließlich werden die verarbeiteten Interaktionen in der Ausgabeschicht bereitgestellt, wodurch ein immersiver Wohnraumdesign entsteht, der auf Zugänglichkeit, Genauigkeit und natürliche Interaktion ausgerichtet ist.

Systemanforderungen und Aufgabendefinition
Das geplante System verbessert VR-Navigationsmodelle mit barrierefreiheitsorientierter Ausrichtung, um eine präzise Hausplanung zu ermöglichen. Wir identifizieren die Nutzerdomäne als Gleichung 38, wo Gleichung 39 Hausbesitzer tätig sind, Gleichung 39 Designfachleute sind und Gleichung 40 Barrierefreiheitsnutzer (im Alter oder mit Mobilitätseinschränkungen). Jeder Nutzer führt eine Reihe von Kernaufgaben aus: T = {platzieren, drehen, skalieren, materialisieren, leuchten, messen}. Eine Aufgabe t T wird über multimodale Eingaben ausgeführt: Gestenstrom Gt (räumliche Manipulation) und Sprachbefehl Vt (semantische Parameter). Das System bezieht diese auf eine Aktion durch eine Fusionspolitik:

Gleichung 41(1)

wobei π die multimodale Funktion auf Entscheidungsebene ist.

Systembedürfnisse erfordern Interaktion mit geringer Latenz: sei Gleichung 42 Gestenerkennung, Sprachverständnis und Fusionszeiten.

Gleichung 43(2)

Die Summenantwort sorgt für eine Echtzeitreaktion entsprechend den Schwellenwerten für immersive VR-Nutzbarkeit.

Für die Genauigkeit der Aufgabe sei der Grundwahrheitszustand des Objekts (x, R, s, M, L) (Position, Rotation, Skalierung, Material, Länge) und der realisierte Zustand des Systems . Gleichung 44 Die Fehlermetriken sind wie folgt:

Gleichung 45(3)

Gleichung 46(4)

Gleichung 47(5)

Gleichung 48(6)

Mit Material-Mismatch Gleichung 49 .

Beide Modalitäten erzeugen die Konfidenzwerte cg (Geste) und cv (Stimme), die so normalisiert werden, dass cg + cv = 1 gilt. Das Fusionsarbitration minimiert einen gewichteten Fehler:

Gleichung 50(7)

Wobei lg, lv modalitätsspezifische Verluste sind. Wenn Gleichung 51, fordert das System eine Klarstellungsaufforderung an, was es robust für unklare Befehle macht.

Schließlich umfassen die Evaluationsmetriken Aufgabenabschlusszeit Tt, Fehlerraten Et und Workload-Scores von NASA-TLX, SUS und IPQ. Wir führen einen zusammengesetzten Leistungsindex für Aufgaben ein:

Gleichung 52(8)

um über die Nutzer hinweg minimiert zu werden, mit Schwellenwerten, die einen SUS-Wert von ≥70 und eine NASA-TLX-Reduktion im Vergleich zur grundlegenden controllerbasierten VR erfordern.

Datensatzsammlung und -vorverarbeitung
Das vorgeschlagene System basiert sowohl auf Gestendaten (für TCN-basierte Erkennung) als auch auf Sprachbefehlsdaten (für NLU/ASR). Zu diesem Zweck nutzen wir drei Hauptdatensätze: EgoGesture für dynamische, kontinuierliche Gesten in VR-ähnlichen Umgebungen, IPN Hand zur Ergänzung natürlicher Kurzstreckengesten und Fluent SpeechCommands 44 , um das stimmgesteuerte semantische Verständnis von Design-Äußerungen zu trainieren. Optionale Datensätze sind HaGRID für statisches Gestendetektor-Pretraining und Mozilla Common Voice für das allgemeine ASR-Pretraining, aber keine dieser Fälle ist notwendig. Eine solche Wahl ermöglicht es, beide Modalitäten abzudecken, während der Umfang der Datensätze so vernünftig und reproduzierbar wie möglich gehalten wird. Tabelle 1 zeigt die Datensatzdetails der vorgeschlagenen Arbeit.

Die Auswahl des Datensatzes in diesem Artikel ist entscheidend, da jeder Datensatz darauf ausgelegt ist, ein bestimmtes Szenario multimodaler VR-Interaktion abzudecken. Der EgoGesture-Datensatz bietet eine groß angelegte, naturalistische Handgestensammlung, die trotz wechselnder Licht- und Umweltbedingungen eine hohe Erkennungsleistung gewährleistet. Da der IPN-Handdatensatz für uneingeschränkte, kontinuierliche Handbewegungen konzipiert ist, eignet er sich besonders gut für hochpräzise Steuerungsoperationen und Echtzeit-Gestensegmentierung. Zusätzlich bietet der Datensatz Fluent Speech Commands beschriftete Sprachbefehle mit semantischen Annotationen zur Absichtserkennung, was entscheidend ist, um eine präzise und natürliche Befehlsausführung in VR zu ermöglichen. Zusammen bieten diese Datensätze eine ergänzende Abdeckung sowohl der Gesten- als auch der Sprachmodalität, was Vielfalt, Robustheit und alltägliche Leistung ermöglicht, die die Bewertung des vorgeschlagenen Systems verbessern. Zusätzlich zu öffentlichen Datensätzen haben wir das Protokoll auch mit einem unabhängigen internen Datensatz aus 312 Gestenproben und 128 Sprachbefehlen von 10 neuen Teilnehmern überprüft. Diese unabhängige Validierung bestätigte die Reproduzierbarkeit und Robustheit des Protokolls.

Datenvorverarbeitung
Die gesammelten Informationen werden vor dem Modelltraining systematisch normalisiert, gesampelt und ergänzt:

Gestensequenz-Normalisierung
Eine Gestenvideosequenz wird als multivariate Zeitreihe von Skelettgelenkmerkmalen dargestellt:

Gleichung 1(9)

Dabei ist Ti die Länge der i-ten Geste und d die Merkmalsdimension (z. B. Handverbindungspositionen). Da verschiedene Gesten unterschiedliche Länge Ti haben können, nehmen wir sie in eine konstante Sequenzlänge T um:

Gleichung 2(10)

Dadurch sind alle Gestenproben, unabhängig von der Aufzeichnungslänge, mit einer Standardzeitlänge vergleichbar, die für TCN-Training verwendet werden kann.

Feature-Standardisierung
Um Skalierungsunterschiede zwischen Nutzern und Aufzeichnungsbedingungen zu eliminieren, ist jeder Feature-Raum standardisiert:

Gleichung 3(11)

Wobei Gleichung 4 der Mittelwert von Merkmal j ist und σj seine Standardabweichung ist. Die Normalisierung stellt auf diese Weise sicher, dass die Merkmale mit der Einheitsvarianz zentriert sind und individuelle Unterschiede in der Gestenleistung minimiert werden.

Datenaugmentation
Die Einbeziehung synthetischer Störungen verbessert die Robustheit gegenüber Variabilität. Temporaler Jitter verschiebt zunächst zufällig die Sequenzausrichtung:

Gleichung 5(12)

wobei δ der maximale Jitter in Frames ist. Die Rauschinjektion fügt Gaußsche Störungen zu Merkmalen hinzu:

Gleichung 6(13)

Diese Erweiterungen ermöglichen es dem Modell, gegen Zeitunregelmäßigkeiten und Sensorrauschen in tatsächlichen VR-Interaktionen robust zu sein.

Sprachvorverarbeitung
Jede gesprochene Äußerung wird zunächst auf eine log-Mel-Spektrogramm-Darstellung abgebildet:

Gleichung 7(14)

Dabei ist F die Menge der Frequenzbins und T′ die Menge der Zeitrahmen. Zur Kompensation der Aufzeichnungsvariabilität werden die Spektrogrammmerkmale wie folgt normalisiert:

Gleichung 8(15)

Wobei μV σV der globale Mittelwert und die Standardabweichung über dem Korpus sind. Dies bietet einen stabilen akustischen Feature-Raum für ASR- und NLU-Modelle.

Intent-Slot-Codierung
Zusätzlich zu den akustischen Funktionen ist jeder Sprachbefehl mit strukturierten semantischen Slots beschriftet:

Gleichung 9 (16)

wobei zum Beispiel "Stuhl um 15 Grad drehen" entspricht (Aktion = Drehen, Objekt = Stuhl, Standort = Null). Diese systematische Codierung ermöglicht es dem System, designspezifische Parameter abzuleiten und diese in ausführbare VR-Operationen umzuwandeln.

Gesteninteraktionsdesign mit temporalem Faltungsnetzwerk (TCN)
Gesteninteraktionsdesign legt fest, wie Nutzer mit virtuellen Objekten im VR-Heimdesignsystem mit natürlichen Handgesten interagieren. Das Design beginnt mit der Entwicklung eines Gestenlexikons – einer Zuordnung von Handgesten zu Systemfunktionen. Zum Beispiel könnte eine Greifgeste die Platzierung von Objekten steuern, eine Kneifgeste die Skalierung und eine Rotationsgeste könnte Objekte um eine ausgewählte Achse drehen.

Im betrachteten System dienen EgoGesture und IPN Hand als Basisdatensätze für Gesten, um das Temporal Convolutional Network (TCN) zu trainieren, während Fluent Speech Commands das Design durch sprachgesteuerte Interaktionsfunktionen ergänzen. Zusammen bieten sie eine multimodale VR-Interaktion.

Gestendarstellungen aus dem Datensatz
Eine Abfolge von Gesten aus entweder EgoGesture oder IPN Hand ist eine multivariate Zeitreihe:

Gleichung 10(17)

Gleichung 11(18)

Hier ist T die vorgegebene Anzahl der Frames (nach Neubefangen) und d die Anzahl der Skelettmerkmale-Dimensionen (z. B. 3D-Gelenkspositionen). Der Datensatz enthält die Bezeichnungen y(i)y , die eine der C-Gestenklassen anzeigen.

Zeitliche Faltungskodierung
Wir nutzen ein Temporal Convolutional Network (TCN), um Gesten in Echtzeit zu klassifizieren. TCN erfasst kurz- und langfristige Abhängigkeiten in Gestensequenzen. TCNs nutzen im Gegensatz zu RNNs dilatierte kausale Faltungen, die eine effiziente parallele Berechnung ermöglichen.

Die TCN wendet diese Sequenzen durch kausale dilatierte Faltungen an, um kurzfristige und langfristige Abhängigkeiten zu erlernen:

Gleichung 13(19)

wobei dL der Dilatationsfaktor in der Schicht l, K die Kerngröße und σ eine nichtlineare Aktivierung (ReLU) ist. Das rezeptive Feld hängt ab von:

Gleichung 14(20)

wodurch der TCN Gesten unterschiedlicher zeitlicher Längen überspannen muss.

Klassifikation der Gesten
Der letzte versteckte Zustand wird durch einen Softmax-Klassifikator geleitet:

Gleichung 15 (21)

mit Trainingsziel definiert durch Kreuzentropie:

Gleichung 16 (22)

Integration mit Sprachbefehlen
Während räumliche Operationen (bewegen, drehen, skalieren) durch Gestenerkennung von EgoGesture und IPN Hand gelöst werden, wird der Datensatz Fluent Speech Commands für semantische Befehle verwendet. Jede Äußerung wird in eine strukturierte Slot-Darstellung übersetzt, Gleichung 17 die die Gesteneingabe durch Parameter ergänzt (z. B. "Stuhl um 15° drehen").

Dann werden beide Ausgänge kombiniert:

Gleichung 18(23)

Wobei o(i) das VR-Steuerprimitiv ist (Platzierung, Skalierung, Rotation).

Das temporale Faltungsnetzwerk (TCN) ist effektiv bei der Verarbeitung sequentieller Daten, indem es dilatierte 1D-Faltungen auf Eingabesequenzen wie Gesten- oder Sprachsignalen verwendet, wie in Abbildung 2 dargestellt. Im Gegensatz zu rekurrenten Modellen verwenden TCNs Faltungsfilter, um sowohl kurzfristige als auch langfristige zeitliche Beziehungen zu erlernen. Residualblöcke mit Skip-Verbindungen werden eingesetzt, um während des Trainings Stabilität zu gewährleisten und verschwindende Gradienten zu verhindern, während die Verwendung gestapelter TCN-Schichten es dem Netzwerk ermöglicht, zeitliche Muster in mehreren Skalen zu lernen. Letztlich projiziert eine vollständig verbundene Klassifikationsschicht die erlernten zeitlichen Merkmale in Ausgabelabels wie Gestenklassen oder gesprochene Absichten. Dieses Design eignet sich besonders gut für kontinuierliche Gestenerkennung und Sprachbefehlsverständnis, da es Recheneffizienz mit starken temporalen Modellierungsfähigkeiten kombiniert.

Tabelle 2 fasst das gesamte architektonische Design und die Trainingskonfiguration des temporalen Faltungsnetzwerks zusammen, das im vorgeschlagenen System zur Gestenerkennung verwendet wird. Das Modell verfügt über vier Rest-TCN-Blöcke, die jeweils auf dilatierten kausalen Faltungen basieren, was es dem Netzwerk ermöglicht, sowohl kurz- als auch langfristige zeitliche Abhängigkeiten zu modellieren. Diese Abhängigkeiten sind entscheidend, um zwischen dynamischen Gesten wie Greifen, Drehen und Kneifen zu unterscheiden. Bei einer Kerngröße von 3 und Dilatationsfaktoren erweitern die Dilatationsfaktoren von [1,2,4,8] effizient das temporale Rezeptivfeld, ohne die Rechenkosten zu erhöhen. Um die Verallgemeinerung zwischen den Benutzern und den Aufzeichnungsbedingungen zu verbessern, wurden innerhalb jedes Blocks eine Schichtnormalisierung und eine Dropout-Rate von 0,25 verwendet. Für das Training wird ein Adam-Optimierer mit einer Lernrate von 1 × 10-3, einer Batchgröße von 32 und einer Sequenzlänge von 64 Bildern verwendet, was optimale Genauigkeit und Echtzeit-Responsivität ausbalanciert. Während der Inferenz macht eine Schiebefenster-Strategie die Vorhersage von Gesten alle 20–25 ms möglich, während die End-to-End-Latenz unter 120 ms bleibt. Diese Kombination aus Architektur und Hyperparameter sorgt für eine hohe Genauigkeit bei der Gestenklassifikation (∼94 % Platzierungsgenauigkeit), während gleichzeitig die Echtzeitinteraktion erhalten bleibt, sodass TCN immersive VR-Manipulationsaufgaben ausführen kann.

Sprachinteraktionsdesign (ASR+NLU)
Die Sprachinteraktionskomponente ergänzt die gestenbasierte räumliche Steuerung durch semantische und parametrisierte Sprachbefehle für das VR-Hausdesignsystem. Der gesprochene Eingang a(i) wird zunächst als Rohton aufgezeichnet und in ein log-Mel-Spektrogramm umgewandelt:

Gleichung 19 (24)

Dabei ist F die Anzahl der Frequenz-T-Bins und die Länge der Zeitintervalle. Die Repräsentation bewahrt sowohl spektrale als auch zeitliche Sprachmuster und wird so normalisiert, dass sie invariant gegenüber Sprecher- und Umweltvariabilität ist:

Gleichung 37(25)

Das normalisierte Spektrogramm wird in ein Modell der automatischen Spracherkennung (ASR) wie Whisper eingespeist, das die akustischen Merkmale in eine Token-Sequenz umwandelt:

Gleichung 20 (26)

wobei jedes ein Token für ein Wort oder eine Unterworteinheit ist. Diese Transkription wird in ein Natural Language Understanding (NLU)-Modell eingespeist, das strukturierte Bedeutung erfasst. Genauer gesagt macht die NLU Vorhersagen von Absichtskategorien und semantischen Slots:

Gleichung 21 (27)

wobei beispielsweise die Aussage "Stuhl um fünfzehn Grad drehen" auf (Aktion = Drehen, Objekt = Stuhl, Position/Parameter = 15°) abgeordnet wird.

Das identifizierte Intent-Slot-Framework wird dann in einen mathematischen Befehl übersetzt, der im VR-System implementiert werden kann:

Gleichung 22(28)

Wobei u(i) eine numerische Transformation (z. B. 15° Rotation) oder eine kategorische Änderung (z. B. Materialaustausch) sein kann.

Robustheit wird schließlich durch einen vertrauensbasierten Schlichtungsmechanismus erreicht. Wenn der ASR-Konfidenzwert p(z) oder der NLU-Konfidenzwert p(s) unter einem Schwellenwert τ liegt, fordert das System entweder eine Klarstellung an oder greift standardmäßig auf gestenbasierte Steuerung zurück. Dies stellt sicher, dass Sprachbefehle präzise und klar sind, was die Benutzerfreundlichkeit für Designaufgaben verbessert, die Präzision erfordern.

Multimodales Fusionsdesign
Der Vorteil der multimodalen Fusion im vorgeschlagenen VR-System besteht darin, dass Sprachverständnis und Gestenerkennung in einem einzigen Entscheidungsprozess integriert werden, anstatt getrennt behandelt zu werden. Das Gestenmodul liefert eine Klassifikationsausgabe Gleichung 23 vom TCN, während das Sprachmodul eine Intent-Slot-Darstellung s(i) liefert. Um diese zu verschmelzen, implementiert das System eine Entscheidungsebene-Fusion mit konfidenzbasiertem Schiedsverfahren.

Lassen Sie den Gestenklassifikator eine Wahrscheinlichkeitsverteilung über Gestenklassen liefern:

Gleichung 24 (29)

und das NLU-Modell soll Absichts-Slot-Wahrscheinlichkeiten liefern:

Gleichung 25 (30)

Dabei beziehen sich a, o und p auf Aktions-, Objekt- und Parameter-Slots, die aus Spracheingaben abgeleitet sind. Der Fusionsschritt berechnet eine gemeinsame Entscheidung, indem die beiden Modalitäten entsprechend ihren Konfidenzwerten kombiniert werden:

Gleichung 26 (31)

Wobei α∈[0,1] dynamisch basierend auf Systemkonfidenz gesetzt wird (z. B. höher, wenn Gesten sicherer sind, niedriger, wenn die Sprache klar ist).

Algorithmus 1: Multimodal_Fusion (X, a):

Eingabe:

X = vorbearbeitete Gestensequenz, a = Audiobefehl

Ausgabe:

O = VR-Aktionsbefehl

Schritt 1: Gestenerkennung

Gleichung 27  

Schritt 2: Sprachverständnis

Gleichung 28  

Gleichung 29  

Schritt 3: Fusionsentscheidung

Gleichung 30  

Gleichung 31  

Gleichung 32  

Gleichung 33  

Gleichung 34  

sonst:

Gleichung 35  

Schritt 4: Fehlerbehandlung

Gleichung 36 ):

Nutzererklärung anfordern

sonst:

O an das VR-System senden

Rückkehr O

Dieser Algorithmus 1 wechselt zwischen Gesteneingabe und Spracheingabe, um einen leistungsstarken Befehl für VR-Designarbeiten zu formulieren. Das Gestenmodul (TCN) interpretiert zunächst Handbewegungen wie Rotation oder Skalierung und vergibt einen Konfidenzwert basierend auf der Gewissheit des Modells. Parallel dazu führt das Sprachmodul auch Sprach-zu-Text-Konvertierung mit ASR (z. B. Whisper) durch und wendet NLU an, um semantische Absicht zu identifizieren, wie zum Beispiel "Stuhl um 15° drehen". Beide Module liefern ihre Vorhersagen zusammen mit den Konfidenzwerten zurück. Der Kombinationsschritt gleicht dann die beiden Ausgänge aus. Wenn beide Eingaben eindeutig sind, kombiniert das System sie proportional zu ihrem Konfidenzniveau. Wenn eine Eingabe mehrdeutig ist (z. B. Rauschen in der Stimme oder unsichere Gesten), priorisiert das System die andere. Schließlich, wenn keiner von beiden definitiv ist, bittet das System um Klarstellung, um Fehler zu vermeiden. Dadurch wird die Fusion adaptiv (Gewichte ändern sich je nach Eingabequalität), robust (mit Berücksichtigung von verrauschten oder fehlenden Daten) und genau (wobei die besten Stärken von Gestik und Stimme genutzt werden).

Teilnehmer
Diese Studie umfasst eine Gruppe von Freiwilligen, die sowohl aus Studierenden als auch aus designbezogenen Fachleuten ausgewählt werden, um unterschiedliche Meinungen zur VR-Nutzbarkeit einzuholen. Das Alter der Teilnehmer reichte vom frühen Erwachsenenalter bis zum mittleren Alter und repräsentierte eine Mischung aus früheren VR-Erfahrungsstufen, darunter Anfänger, gelegentliche Nutzer und fortgeschrittene Nutzer. Alle Teilnehmer hatten entweder normales oder korrigiertes Sehvermögen und keine gemeldeten motorischen Beeinträchtigungen, die die gestenbasierte Interaktion wesentlich beeinträchtigen könnten. Schwere Sprachstörungen, schwerwiegende Armbeweglichkeitseinschränkungen oder jegliche vorherige Vorgeschichte von VR-induzierter Reisekrankheit schlossen die Personen aus Sicherheitsgründen und der Konsistenz der Teilnahme aus. Alle Teilnehmer gaben eine informierte Einwilligung, und die Verfahren für die Bewertung wurden vom institutionellen Überprüfungsgremium genehmigt. Dieser Unterabschnitt gibt klar an, wer an der Bewertung teilgenommen hat, was die Reproduzierbarkeit der Studie ermöglicht.

Experimenteller Aufbau
Das vorgeschlagene experimentelle Setup verfügt über das entwickelte multimodale VR-System, das auf einem VR-Headset für Verbraucher mit integrierter Handverfolgung und einer RGB-Kamera zur Erfassung von Gesten eingesetzt wird. Es verfügt über einen Hochleistungs-Desktop, der die Echtzeitverarbeitung von Gestenerkennung, ASR und multimodalen Fusionstechniken ermöglicht. Die VR-Umgebung ist in Unity 3D aufgebaut und enthält einen Wohnraum, der mit Möbeln, Materialien und Lichtelementen konfiguriert werden kann. Das Setup umfasst Whisper-basierte ASR für Sprachtranskription und außerdem ein transformatorbasiertes NLU-Modul zur Absichtserkennung. Diese Beschreibung wurde aus dem Ergebnisbereich verschoben, um vor der Diskussion der Ergebnisse eine angemessene technische Übersicht zu geben.

Subjektive Testszenarien
Die Teilnehmer interagierten mit einer simulierten Wohnumgebung, die aus einem möblierten Wohnzimmer, einem Schlafzimmer und einem kleinen Arbeitsbereich bestand. In jedem Szenario wurden die Nutzer gebeten, virtuelle Objekte und Umweltvariablen in der Umgebung entsprechend realistischen Designbedingungen zu verändern. Beispielsweise wurden die Teilnehmer gebeten, ein Sofa in Bezug auf einen Referenzpunkt zu positionieren, einen Stuhl in eine bestimmte Richtung zu drehen, einen Tisch auf eine Zielgröße anzupassen oder das Wandmaterial-/Lichtprofil anzupassen. Diese Szenarien wurden ausgewählt, weil sie typische Innenarchitekturaufgaben darstellen, die sowohl gestenbasierte Steuerung (in Bezug auf räumliche Präzision) als auch sprachbasierte Steuerung (in Bezug auf semantische Befehle) herausfordern. Dieser Unterabschnitt behandelt direkt die Frage des Prüfers zu den subjektiven Testbedingungen, unter denen Nutzer das System bewerteten.

Aufgabendesign
Die Teilnehmer führten eine strukturierte Reihe von Übungen durch, die verschiedene Bereiche der Item-Manipulation und Design-Interaktion behandelten. Die Hauptaufgaben waren wie folgt: 1) Möbelplatzierung: Die Teilnehmer positionierten Objekte an Zielkoordinaten. 2) Rotationsaufgabe: Bei dieser Aufgabe mussten die Nutzer die Ausrichtung so ändern, dass sie mit einem Referenzwinkel übereinstimmt. 3) Skalierungsaufgabe: Diese beinhaltete das Anpassen der Größe der Möbel auf voreingestellte Maße. Außerdem 4) Material-/Farbbearbeitung: Die Teilnehmer nutzten Sprachbefehle, um die Texturen oder die Beleuchtung zu verändern. Optionale Navigationsaufgaben wurden bereitgestellt, um die räumliche Wahrnehmungsfähigkeit im virtuellen Raum zu erfassen. Jede Arbeit wurde mit klaren Zielen, quantifizierbaren Ergebnissen und einem definierten Zeitrahmen festgelegt, um sicherzustellen, dass sowohl Genauigkeit als auch Effizienz ordnungsgemäß bewertet werden konnten.

Vorgehen
Um Einheitlichkeit unter den Teilnehmern zu gewährleisten, wurde die Bewertung in einer geplanten Reihenfolge durchgeführt. Den Nutzern wurde zunächst das System erklärt und eine kurze Demonstration der Gesten- und Sprachinteraktionsmodalitäten präsentiert. Eine anfängliche Kalibrierungsphase ermöglichte eine Anpassung an individuelle Handhaltungen und Sprachmerkmale. Die Nutzer hatten dann eine kurze Übungssitzung, um sich an beide Modalitäten zu gewöhnen. Die eigentliche Bewertung erforderte die Ausführung aller Aufgaben unter drei Interaktionsbedingungen: ausschließlich mit einem Controller, nur mit Gesten und mit Gesten plus Stimme als multimodalen Eingaben. Die Bedingungsanordnung wurde ausgeglichen, um die Lerneffekte zu verringern. Am Ende füllten die Probanden standardisierte Bewertungsinstrumente wie SUS, NASA-TLX und IPQ aus und nahmen an einem kurzen qualitativen Feedback-Interview teil.

Bewertungsmetriken
Dieses strukturierte Verfahren schafft methodologische Transparenz und ermöglicht Replikationsstudien. Objektive und subjektive Kennzahlen wurden kombiniert, um die Systemleistung umfassend zu bewerten. Objektive Kennzahlen umfassten die Abschlusszeit der Aufgaben, ein Maß für Effizienz; Platzierungsgenauigkeit, quantifiziert als Abweichung von der Zielposition oder Rotation; und die Fehlerrate, definiert als die Anzahl der Eingabefehler oder unbeabsichtigten Aktionen, die vom System ausgeführt werden. Subjektive Kennzahlen wurden mit validierten Fragebögen erfasst: die System Usability Scale zur Messung der wahrgenommenen Benutzerfreundlichkeit, die NASA-TLX-Skala zur Bewertung der mentalen und physischen Arbeitsbelastung sowie der I Group Presence Questionnaire zur Messung von Immersion und Präsenz in VR. Diese wurden passend aus dem Ergebnisabschnitt verschoben, um zu beschreiben, wie die Leistung vor der Präsentation von Ergebnissen gemessen wurde.

VR-Umgebung, Systemintegration und Bewertung
Die Hauptplattform für Sprach- und Gestenbefehle ist eine interaktive Virtual-Reality-Umgebung, in der das System bereitgestellt wird. Integrierte Bibliotheken aus Möbeln, Texturen und Lichtelementen werden verwendet, um virtuelle Räume in Unity 3D zu erstellen. Es ermöglicht den Nutzern, Elemente in Echtzeit zu organisieren, anzupassen und zu bearbeiten. Die Genauigkeit wird durch Schnappfunktionen, Kollisionserkennung und Messüberlagerungen verbessert, sodass Objekte sich natürlich ausrichten können. Echtzeit-Darstellung von Licht und Materialien verbessert das Designerlebnis, indem es sofortiges Feedback zu jeder Interaktion liefert.

Nach der Validierung der einzelnen Module für Gestenerkennung, Sprachverständnis und multimodale Fusion werden sie zu einer einheitlichen Pipeline zusammengeführt. Das System ist so konzipiert, dass es eine geringe Latenz aufweist, sodass Benutzerbefehle fast sofort in der VR-Umgebung erscheinen. Pilottests werden mit einer kleinen Anzahl von Mitgliedern durchgeführt, um den Wechselfluss zu schärfen. Die Iteration umfasst Gestenwortsätze, die Validierung der Sprachbefehlsgrammatik und die Sicherstellung, dass sich das System während kontinuierlicher Nutzung natürlich und zuverlässig anfühlt.

Eine umfassende Studie, die drei Interaktionsmodalitäten vergleicht, wie multimodale Gesten-Stimm-Fusion, Controller-only Input und Hybridmodus, wird zur Bewertung der Nutzererfahrung verwendet. Aufgaben wie Materialwechsel, Rotation und Objektplatzierung sind von den Teilnehmern verlangt. Zur Leistungsbewertung werden objektive Kennzahlen erhoben, wie zum Beispiel die Erreichungszeit der Arbeit, die Korrektheit der Vermittlung und Fehlerquoten. Subjektive Bewertungen werden von Teilnehmern mit standardisierten Fragebögen wie der System Usability Scale (SUS), NASA-TLX kognitiver Arbeitsbelastung und dem IPQ-Fragebogen zur Immersion ermittelt, wobei Teilnehmerinterviews zusätzliche Unterstützung bieten. Diese doppelte Bewertung kodiert sowohl quantifizierbare Leistungskennzahlen als auch subjektive Nutzererfahrung.

Der Fortschritt dieses Systems besteht darin, multimodale Fusion auf präzise Designaufgaben anzuwenden, die über grundlegende Navigation oder Interaktion hinausgehen. Die Technik bietet eine organischere, genauere und zugänglichere Interaktionsmöglichkeit, indem sie den semantischen Wert von Sprachanweisungen mit den räumlichen Vorteilen von Gesten kombiniert. Durch anpassungsfähige Barrierefreiheitsfunktionen wie reine Sprach-Rückfallbacks und einhändige Gestenerkennung erhöht das System zudem die Inklusivität. Abschließend bietet die Studie einen methodischen, annotierten multimodalen Datensatz zu Sprach-Gesten-Interaktionen, der zukünftige Studien zum immersiven Schnittstellendesign fördert und die Reproduzierbarkeit stärkt.

Abbildung 3 zeigt typische Screenshots des implementierten Programms und bietet eine lebendigere Darstellung des gebauten VR-Innenarchitektursystems. Die immersive Virtual-Reality-Umgebung, in der die Nutzer den Raumaufbau erkunden und sehen können, ist in Abbildung 3A dargestellt. Abbildung 3B zeigt, wie natürliche Handinteraktionen genutzt werden können, um virtuelle Möbelstücke in einem gestenbasierten Objektmanipulationsprozess auszuwählen, zu bewegen und zu drehen. Abbildung 3C zeigt die integrierte Sprachschnittstelle, bei der Mikrofon- und Sprachfeedback-Symbole benutzerdefinierte Sprachbefehle für räumliche Änderungen oder Objektplatzierung validieren. Zusammengenommen zeigen diese Screenshots des vorgeschlagenen multimodalen VR-Systems, dass es vollständig implementiert wurde und eine Echtzeitinteraktion mit Gesten- und Sprachinteraktion ermöglicht.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Das entworfene multimodale VR-Heimdesignsystem wurde mit drei grundlegenden Datensätzen validiert: EgoGesture (dynamische Gesten), IPN Hand (fortlaufende Handgesten) und Fluent Speech Commands (Sprachbefehle mit Intent-Slot-Labels). Zusammen boten die drei Datensätze eine umfassende Schulungs- und Bewertungsbasis, die sowohl Gestenerkennung als auch sprachbasierte semantische Verständnis behandelt. Die Validierung zeigt, dass die Integration von Gestenstimme die Aufgabengenauigkeit erheblich verbessert und die Arbeitsbel...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Ergebnisse dieser Forschung bringen die Technologie des Basispapiers voran, das vor allem die Vorzüge der immersiven VR-Navigation für die Barrierefreiheit durch die Kombination von Gesten- und Sprachmodalitäten für Designaufgaben aufzeigte. Das multimodale System schnitt bei allen objektiven und subjektiven Leistungskennzahlen besser ab, mit kürzeren Aufgabenabschlusszeiten, höherer Platzierungsgenauigkeit und niedrigeren Fehlerraten als controllerbasierte und hybride Ansätze. Darüb...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren haben keine Interessenkonflikte zu erklären.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren danken dankbar für die institutionelle Unterstützung der School of Architecture, Building & Design und The Design School, Taylor's University, für die Bereitstellung von Ressourcen und akademischer Beratung während dieser Forschung.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
EgoGesture DatasetNanyang Technologische UniversitätDOI: 10.1109/TMM.2018.2808769Groß angelegter egozentrischer Handgesten-Datensatz für dynamisches Training zur Gestenerkennung.
Datensatz für fließende SprachbefehleFluent.ai / Universität von AlbertaDOI: 10.48550/arXiv.1804.04363Datensatz für Sprachabsicht und slotbasiertes semantisches Verständnis für ASR/NLU-Training.
HaGRID-Datensatz (optional)Sber KI / Open Sourcev1.1Optionaler Datensatz für das Vortraining des statischen Handgestendetektors.
Igroup Präsenzfragebogen (IPQ)igroup.orgN/AVerwendet zur Messung von Immersion und Präsenz in einer VR-Umgebung.
IPN-HanddatensatzUniversidad VeracruzanaDOI: 10.1109/CVPRW50498.2020.00241Datensatz für kontinuierliche, natürliche Handgestenerkennung und Segmentierungsaufgaben.
Matplotlib / SeabornOpen SourceNeueste StableVerwendet zur Visualisierung von Leistungskennzahlen und Bewertungsergebnissen.
MediaPipe-HändeGoogle ResearchOpen-Source (GitHub)Verwendet für Echtzeit-Hand- und Gestenverfolgung zur Gesteneingabeerkennung.
Mozilla Common Voice (optional)Mozilla StiftungVersion 17Optionaler Datensatz zum Vortraining des ASR-Modells auf allgemeinen Sprachdaten.
Multimodale FusionsschichtBenutzerdefinierter AlgorithmusN/AFusioniert Gesten- und Spracheingabeströme basierend auf konfidenzgewichtetem Schiedsgericht.
NASA-TLX ArbeitslastbewertungNASA Human FactorsN/AVerwendet zur kognitiven Arbeitsbelastungsanalyse der Teilnehmer.
Modul Natürliches Sprachverständnis (NLU)Custom (basierend auf BERT / RoBERTa)N/AVerwendet zur Extraktion semantischer Absichten und Slots (Aktion, Objekt, Parameter) aus transkribierten Spracheingaben.
NumPy / Pandas / OpenCVOpen SourceNeueste StableVerwendet für numerische Operationen, Datenvorverarbeitung und Videoframe-Manipulation.
Python-ProgrammiersprachePython Software FoundationVersion 3.10+Verwendet zur Implementierung von ML-Modellen (TCN, ASR, NLU, Fusion).
PyTorch Deep-Learning-FrameworkMeta-KIVersion 2.0+Verwendet zum Aufbau und Training von Gestenerkennung (TCN) und NLU-Modellen.
RGB-KameraLogitech / RealSenseLogitech C920 oder Intel RealSense D435Wird für Handgestenerfassung und Bewegungserkennung verwendet.
System Usability Scale (SUS) FragebogenStandard-BewertungswerkzeugN/AVerwendet zur Bewertung der subjektiven Nutzbarkeit von VR-Systemen.
Zeitliches Faltungsnetzwerk (TCN)Benutzerdefinierte Implementierung (PyTorch / TensorFlow)N/AVerwendet zur dynamischen Gestenerkennung aus Zeitreihenskelettdaten.
Unity 3D EngineUnity-TechnologienVersion 2022.3 LTSVerwendet zur Entwicklung einer immersiven VR-Umgebung mit interaktiven Möbeln, Materialbearbeitung und Echtzeit-Rendering.
VR-HeadsetOculus (Meta) / HTC ViveOculus Quest 2 oder HTC Vive ProWird für immersive Visualisierung und räumliches Tracking während der VR-Interaktion verwendet.
Whisper ASR-ModellOpenAIWhisper (Basismodell)Automatische Spracherkennungs-Engine zur Umwandlung von Sprache in Text.
ArbeitsstationMaßgeschneiderter PCIntel Core i7 / NVIDIA RTX 3070 / 32 GB RAMVerwendet für Echtzeitverarbeitung, Training und Inferenz von Gesten- und Sprachmodellen.

Referenzen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Kim, J., Ahn, J. -H., Kim, Y. Immersive interaction for inclusive virtual reality navigation: enhancing accessibility for socially underprivileged users. Electronics. 14, 1046(2025).
  2. Lee, W. -J., Kim, Y. -H. Does VR tourism enhance users' experience. Sustainability. 13, 806(2021).
  3. Embedding virtual and augmented reality in higher education in Yemeni universities. Nagi, G., Al-Fuhaidi, B. 2024 1st International Conference on Emerging Technologies for Dependable Internet of Things (ICETI), 15-17 January, Riyadh, Saudi Arabia, 1, 1-10 (2024).
  4. Narin, N. G. A content analysis of the metaverse articles. J Metaverse. 1, 17-24 (2021).
  5. Towards a social VR-based exergame for elderly users: an exploratory study of acceptance, experiences, and design principles. Shah, S. H. H., Hameed, I. A., Karlsen, A. S. T., Solberg, M. International Conference on Human-Computer Interaction, 1, Springer. Washington, DC, USA. 1-12 (2022).
  6. Zahedian-Nasab, N., Jaberi, A., Shirazi, F., Kavousipor, S. Effect of virtual reality exercises on balance and fall in elderly people with fall risk: a randomized controlled trial. BMC Geriatr. 21, 509(2021).
  7. Babadi, S. Y., Daneshmandi, H. Effects of virtual reality versus conventional balance training on balance of the elderly. Exp Gerontol. 153 (6), 111498(2021).
  8. Liang, H., et al. Metaverse virtual social center for elderly communication in time of social distancing. Virtual Real Intell Hardw. 5, 68-80 (2023).
  9. Shah, S. H. H., Karlsen, A. S. T., Solberg, M., Hameed, I. A. A social VR-based collaborative exergame for rehabilitation: co-design, development, and user study. Virtual Real. 27, 3403-3420 (2023).
  10. Chen, C. -H., Chen, M. -X. Effects of the design of overview maps on three-dimensional virtual environment interfaces. Sensors. 20, 4605(2020).
  11. Sudár, A., Csapó, A. B. Descriptive markers for the cognitive profiling of desktop 3D spaces. Electronics. 12, 448(2023).
  12. Wang, Y., Hu, Y., Chen, Y. An experimental investigation of menu selection for immersive virtual environments: fixed versus handheld menus. Virtual Real. 25, 409-419 (2021).
  13. Grabowski, A. Practical skills training in enclosure fires: an experimental study with cadets and firefighters using CAVE and HMD-based virtual training simulators. Fire Saf J. 125 (4), 103440(2021).
  14. Zhang, L., et al. A hybrid 2D-3D tangible interface combining a smartphone and controller for virtual reality. Virtual Real. 27, 1273-1291 (2023).
  15. Is it real? Measuring the effect of resolution, latency, frame rate, and jitter on the presence of virtual entities. Louis, T., Troccaz, J., Rochet-Capellan, A., Bérard, F. Proc 2019 ACM Int Conf Interactive Surfaces, 1, 5-16 (2019).
  16. Riches, S., Elghany, S., Garety, P., Rus-Calafell, M., Valmaggia, L. Factors affecting sense of presence in a virtual reality social environment: a qualitative study. Cyberpsychol Behav Soc Netw. 22 (5), 288-292 (2019).
  17. Weech, S., Kenny, S., Barnett-Cowan, M. Presence and cybersickness in virtual reality are negatively related: a review. Front Psychol. 10, 158(2019).
  18. Sae-Bae, N., et al. Emerging NUI-based methods for user authentication: a new taxonomy and survey. IEEE Trans Biom Behav Identity Sci. 1, 5-31 (2019).
  19. Appel, L., et al. Older adults with cognitive and/or physical impairments can benefit from immersive virtual reality experiences: a feasibility study. Front Med. 6, 329(2020).
  20. Pirker, J., Dengel, A. The potential of 360 virtual reality videos and real VR for education: a literature review. IEEE Comput Graph Appl. 41 (6), 76-89 (2021).
  21. Schäfer, A., Reis, G., Stricker, D. Controlling teleportation-based locomotion in virtual reality with hand gestures: a comparative evaluation of two-handed and one-handed techniques. Electronics. 10, 715(2021).
  22. Radhakrishnan, U., Koumaditis, K., Chinello, F. A systematic review of immersive virtual reality for industrial skills training. Behav Inf Technol. 40 (12), 1310-1339 (2021).
  23. Zhang, X., et al. How virtual reality affects perceived learning effectiveness: a task-technology fit perspective. Behav Inf Technol. 36, 548-556 (2017).
  24. Challenor, J., White, D., Murphy, D. Hand-controlled user interfacing for head-mounted augmented reality learning environments. Multimodal Technol Interact. 7, 55(2023).
  25. Budiharto, W. Intelligent controller of electric wheelchair from manual wheelchair for disabled person using 3-axis joystick. ICIC Express Lett B Appl. 12, 201-206 (2021).
  26. Letaief, M., Rezzoug, N., Gorce, P. Comparison between joystick- and gaze-controlled electric wheelchair during narrow doorway crossing: feasibility study and movement analysis. Assist Technol. 33 (1), 26-37 (2021).
  27. Venkatesan, M., Mohan, L., Manika, N., Mathapati, A. Voice-controlled intelligent wheelchair for quadriplegics. Computing, Communication, and Networking Technologies. 1, Springer. 41-51 (2021).
  28. Charlton, J., et al. Manual wheelchair skills training using virtual technology: a systematic review. Technical Report. , Flinders University. (2024).
  29. Genova, C., et al. A simulator for both manual and powered wheelchairs in immersive virtual reality CAVE. Virtual Real. 26, 187-203 (2022).
  30. Hoter, E., Nagar, I. The effects of a wheelchair simulation in a virtual world. Virtual Real. 27, 407-419 (2023).
  31. Improving wheelchair driving performance in a virtual reality simulator. Archambault, P. S., Bigras, C. 2019 Int Conf Virtual Rehabilitation (ICVR), Tel Aviv, 1, 1-2 (2019).
  32. Automatic synthesis of virtual wheelchair training scenarios. Li, W., Talavera, J., Samayoa, A. G., Lien, J. M., Yu, L. F. 2020 IEEE Conf Virtual Reality and 3D User Interfaces (VR), , 539-547 (2020).
  33. Yan, H., Archambault, P. S. Augmented feedback for manual wheelchair propulsion technique training in a virtual reality simulator. J Neuroeng Rehabil. 18 (1), 142(2021).
  34. Montalbán, M. A., Arrogante, O. Rehabilitation through virtual reality therapy after a stroke: a literature review. Rev Cient Soc Esp Enferm Neurol (Engl Ed). 52, 19-27 (2020).
  35. Jessica, P., Salim, S., Syahputra, M. E., Suri, P. A. A systematic literature review on implementation of virtual reality for learning. Procedia Comput Sci. 216 (1), 260-265 (2023).
  36. Efficacious opportunities and implications of virtual reality features and techniques. Nithva, B., Asha, V., Kumar, K., Giri, J. 2022 Fourth Int Conf Cognitive Computing and Information Processing (CCIP), , 1-8 (2022).
  37. The impact of controller type on video game user experience in virtual reality. Hufnal, D., Osborne, E., Johnson, T., Yildirim, C. 2019 IEEE Games, Entertainment, and Media Conf (GEM), , 1-7 (2019).
  38. Zhang, Y., Cao, C., Cheng, J., Lu, H. EgoGesture: a new dataset and benchmark for egocentric hand gesture recognition. IEEE Trans Multimed. 20 (4), 1038-1050 (2018).
  39. Egocentric gesture recognition using recurrent 3D convolutional neural networks with spatiotemporal transformer modules. Cao, C., et al. Proc IEEE Int Conf Computer Vision (ICCV), , 1-9 (2017).
  40. IPN Hand: a video dataset and benchmark for real-time continuous hand gesture recognition. Benitez-Garcia, G., et al. 25th Int Conf Pattern Recognition (ICPR), , 1-8 (2021).
  41. Lu, L., et al. Noncontact 3D gesture recognition enabled VR human-machine interface via electret-nanofiber-based triboelectric sensor. Nano Res. 18, 94907924(2025).
  42. Glorius, J. K., et al. Behavioral training procedures for head-fixed virtual reality in mice. J Vis Exp. (211), e67312(2024).
  43. Li, Y., et al. A stretchable, ionic conductive, and adhesive patch electrode with ultra-low on-skin impedance for electrophysiological signal recording. Sci China Inf Sci. 68, 129402(2025).
  44. Fluent speech commands: a dataset for spoken language understanding research. , Fluent.ai. https://fluent.ai/fluent-speech-commands-a-dataset-for-spoken-language-understanding-research/ (2025).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

GestensteuerungSprachsteuerungmultimodale InteraktionHand Trackingnat rliche Spracheingabepr zise M belplatzierungr umliche Anpassung

Verwandte Artikel