本論文では、ジェスチャーと音声で制御されるバーチャルリアリティシステムを提案し、ジェスチャーと音声入力のマルチモーダル融合により精度、使いやすさ、アクセス性を向上させます。実験結果は、従来の手法に比べて作業時間が短縮され、配置精度が向上し、ユーザー満足度が向上していることを示しています。
本論文では、ジェスチャーと音声で制御されるバーチャルリアリティシステムを提案し、ジェスチャーと音声入力のマルチモーダル融合により精度、使いやすさ、アクセス性を向上させます。実験結果は、従来の手法に比べて作業時間が短縮され、配置精度が向上し、ユーザー満足度が向上していることを示しています。
VRにおけるジェスチャーおよび音声ベースのインタラクションは、さまざまな応用で可能性を示しています。しかし、既存のシステムはナビゲーション作業に重点を置き、両手のジェスチャーに依存し、細かい精度の欠如、そして小規模で均質な集団でのテストが難しいため、制約を受けています。これらの制約により、複雑で設計中心のワークフローに適用範囲が制限されています。これらの制約に対応するため、手作業によるジェスチャー入力と自然言語の指示を組み合わせた、家具の正確な配置、素材選択、空間調整のためのジェスチャー・音声制御バーチャルリアリティシステムを導入しました。システムの新規性の3つの側面は、(i) 片手での使用をサポートする適応型インタラクションモード、数値音声コマンド、そして粗い精度から細かい精度の調整;(ii) ジェスチャー、音声、コンテキスト情報を統合し、サブセンチメートル精度を実現するマルチモーダル融合アーキテクチャ;(iii) 住宅設計プロセスに特化したタスク認識型ユーザーエクスペリエンス評価フレームワーク。開発プロセスは、ジェスチャーやボイス語彙の要件分析や設計から、マルチモーダルの意図認識、スナップやアライメントを伴うVRシーンアセンブリ、反復テストに至るまで、体系的なパイプラインに沿って進みます。多様な参加者集団を対象とした実験結果では、配置誤差が30%減少し、コントローラーベースの相互作用に比べてユーザビリティや作業負荷評価が大幅に向上していることが示されています。その結果は、マルチモーダルVRがアクセスしやすく魅力的な住宅デザイン体験を生み出す可能性を示唆しています。
バーチャルリアリティ(VR)は、ユーザーが実際にその場にいるかのように技術を見て、交流し、コミュニケーションできるインタラクティブなコンピュータ生成環境です。本研究の文脈では、バーチャルリアリティは単なる視覚的表示技術ではなく、マルチモーダルな相互作用環境として捉えられています。最新のVRシステムは視覚的な関与とジェスチャー認識、空間感覚、自然な音声入力を統合し、ユーザーは高精度でシミュレートされたアイテムを操作できます。この理解は、没入感、エンゲージメント、自然なユーザー体験を重視する現在のVR研究と一致しています。応用分野は演奏、教育2、医療治療3、旅行4を含みます。VRは、現実世界では実現できない世界と交流し、つながることを可能にします。ユーザーが空間配置を把握し、オブジェクトを操作し、物理的な動きを必要とせずにリアルタイムのフィードバックを受け取るホームデザインプロセスにおいて、このような没入機能は特に役立ちます。これらの機能は、特に身体の動きが不完全なユーザーに新たな可能性をもたらします。非公式に不利な立場にあるグループ、特に高齢者や英数字リテラシーがほとんどない人々は、身体的制約、移動の困難、年齢に伴う制限によるデジタル技術へのアクセスの困難など、さまざまな要因により屋外活動が制限されます。したがって、VRの専....
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この研究はマレーシアのスバンジャヤにあるテイラーズ大学の研究倫理委員会によって承認されました。すべての手続きは機関研究委員会が定めた倫理指針に従い、ヘルシンキ宣言に準拠していました。データ収集前に、各参加者からインフォームド・コンセントが取得されました。彼らは研究の目的について明確に説明され、参加は任意であること、回答は機密保持されること、そしていつでも何の処分もなく辞退できることが保証されていました。また、学術論文における匿名化されたやり取りや調査データの利用については、書面によるインフォームドコンセントも取得されました。本原稿には個人を特定できる情報、画像、機密個人データは一切含まれていません。
提案された研究は、現在のナビゲーション重視の手法を凌駕し、没入型住宅デザインのためのジェスチャーと音声ベースのバーチャルリアリティ(VR)システムを構築します。このアプローチは、ユーザーのニーズを特定し、家具の配置、オブジェクトのスケールと回転、素材編集、正確な部屋の寸法など、デザイン活動を特定することから始まります。その後、ジェスチャーインタラクションシステムが開発され、ヘッドセットベースのトラッキングやMediaPipe Handsを介して制約のない手のジェスチャー(つまみ、掴み、回転など)を検出し、時間畳み込みネットワーク(TCN)を含む軽量な機械学習モデルで識別します。ジェスチャーを補完するために、組織化された音声コマンド文法が確立され、Whisperベースの自動音声認識....
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
設計されたマルチモーダルVRホームデザインシステムは、EgoGesture(動的ジェスチャー)、IPN Hand(継続的な手のジェスチャー)、Fluent Speech Commands(意図スロットラベル付きの音声コマンド)の3つの基本データセットで検証されました。これら3つのデータセットは、ジェスチャー認識と音声に基づく意味理解の両方に対応する包括的なトレーニングと評価基盤を提供しました。この検証により、ジェスチャーと音声の統合がコントローラーのみやハイブリッド入力方式と比較してタスクの精度を大幅に向上させ、作業負荷を軽減することが示されました。
実験テストにより、マルチモーダル融合システムは配置精度を約30%向上させ、作業実行時間と誤差率の削減につながったことが示されました。標準化された指標(SUS、NASA-TLX、IPQ)を用いた主観的評価では、ユーザビリティ評価の向上、認知負荷の減少、没入感の上昇が示されました。これらすべての発見は、空間操作のためのジェスチャーと意味的・数値的調整のための音声コマンドの組み合わせが、VRベースの住宅設計においてより自然で効果的なインタラ.......
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この研究の結果は、ジェスチャーと音声のモダリティを組み合わせてデザインタスクに活用した没入型VRナビゲーションの有効性を示す基礎論文の技術を進展させました。マルチモーダルシステムは、すべての客観的および主観的な性能指標でより良い性能を示し、タスク完了時間が短く、配置精度が高く、誤差率も低いと、コントローラーベースやハイブリッド方式よりも優れていました。さらに、SUS、NASA-TLX、IPQなどのユーザビリティ指標では、ユーザー満足度の向上、作業負荷の減少、没入感の向上が認められました。ナビリティに関する基礎論文とは異なり、この研究はマルチモーダルVRインタラクションが仮想デザインタスクの実行において精度、創造性、包摂性を高めることを証明しています。しかし、暗照度でのジェスチャーの誤分類や騒がしい音声誤認識といった問題は依然として存在しており、さらなる洗練の余地があることを示唆しています。一般的に、この研究はマルチモーダルインタラクションがVRの使いやすさ、アクセシビリティ、包摂性を高める可能性を再確認しています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者には利益相反を主張するものはありません。
著者らは、本研究において資源と学術指導を提供してくれた建築・建築・デザイン学部およびテイラーズ大学デザイン学部の機関的支援に感謝の意を表します。
....アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| EgoGesture データセット | 南洋理工大学 | DOI: 10.1109/TMM.2018.2808769 | 動的ジェスチャー認識トレーニングのための大規模自己中心的な手のジェスチャーデータセット。 |
| 流暢な音声コマンドデータセット | Fluent.ai / アルバータ大学 | DOI: 10.48550/arXiv.1804.04363 | ASR/NLUトレーニングのための音声意図およびスロットベースの意味理解のためのデータセット。 |
| HaGRIDデータセット(任意) | Sber AI / オープンソース | v1.1 | 静的な手のジェスチャー検出器の事前学習に使用される任意のデータセット。 |
| Igroup プレゼンス質問票(IPQ) | igroup.org | 該当なし | VR環境での没入感とプレゼンスを測定するために使用されます。 |
| IPNハンドデータセット | ベラクルサナ大学 | DOI: 10.1109/CVPRW50498.2020.00241 | 連続的で自然な手のジェスチャー認識およびセグメンテーションタスクのためのデータセット。 |
| Matplotlib / Seaborn | オープンソース | 最新ユニット | パフォーマンス指標や評価結果の可視化に使用されます。 |
| メディアパイプ・ハンズ | Googleリサーチ | オープンソース(GitHub) | ジェスチャー入力認識のためのリアルタイムの手・ジェスチャー追跡に使用されます。 |
| Mozilla Common Voice(オプション) | モジラ財団 | バージョン17 | 一般的な音声データに基づくASRモデルの事前学習用オプションデータセット。 |
| マルチモーダル融合層 | カスタムアルゴリズム | 該当なし | 信頼度加重仲裁に基づくジェスチャーや音声入力ストリームを融合させます。 |
| NASA-TLXワークロード評価 | NASAヒューマンファクター | 該当なし | 参加者の認知負荷分析に使用されます。 |
| 自然言語理解(NLU)モジュール | カスタム(BERT / RoBERTaベース) | 該当なし | 文字起こしされた音声入力から意味的な意図やスロット(アクション、オブジェクト、パラメータ)を抽出するために使用されます。 |
| NumPy / Pandas / OpenCV | オープンソース | 最新ユニット | 数値演算、データ前処理、ビデオフレーム操作に使用されます。 |
| Pythonプログラミング言語 | Pythonソフトウェア財団 | バージョン3.10+ | MLモデル(TCN、ASR、NLU、FUSION)の実装に使用されます。 |
| PyTorch ディープラーニングフレームワーク | メタAI | バージョン 2.0+ | ジェスチャー認識(TCN)およびNLUモデルの構築と訓練に使用されます。 |
| RGBカメラ | ロジクール / リアルセンス | Logitech C920 または Intel RealSense D435 | 手のジェスチャーキャプチャやモーション認識入力に使用されます。 |
| システムユーザビリティスケール(SUS)アンケート | 標準評価ツール | 該当なし | VRシステムの主観的な使いやすさを評価するために使用されます。 |
| 時間畳み込みネットワーク(TCN) | カスタム実装(PyTorch / TensorFlow) | 該当なし | 時系列骨格データからの動的ジェスチャー認識に使用されます。 |
| Unity 3Dエンジン | ユニティ・テクノロジーズ | バージョン 2022.3 LTS | インタラクティブな家具、マテリアル編集、リアルタイムレンダリングを備えた没入型VR環境の開発に使用。 |
| VRヘッドセット | Oculus(Meta)/HTC Vive | Oculus Quest 2 または HTC Vive Pro | VRインタラクション中の没入型ビジュアライゼーションや空間トラッキングに使用されます。 |
| ウィスパーASRモデル | OpenAI | ウィスパー(ベースモデル) | 音声をテキストに変換するための自動音声認識エンジン。 |
| ワークステーション | カスタムビルドPC | Intel Core i7 / NVIDIA RTX 3070 / 32GB RAM | ジェスチャーやボイスモデルのリアルタイム処理、訓練、推論に使用されます。 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト