本論文では、ジェスチャーと音声で制御されるバーチャルリアリティシステムを提案し、ジェスチャーと音声入力のマルチモーダル融合により精度、使いやすさ、アクセス性を向上させます。実験結果は、従来の手法に比べて作業時間が短縮され、配置精度が向上し、ユーザー満足度が向上していることを示しています。
本論文では、ジェスチャーと音声で制御されるバーチャルリアリティシステムを提案し、ジェスチャーと音声入力のマルチモーダル融合により精度、使いやすさ、アクセス性を向上させます。実験結果は、従来の手法に比べて作業時間が短縮され、配置精度が向上し、ユーザー満足度が向上していることを示しています。
VRにおけるジェスチャーおよび音声ベースのインタラクションは、さまざまな応用で可能性を示しています。しかし、既存のシステムはナビゲーション作業に重点を置き、両手のジェスチャーに依存し、細かい精度の欠如、そして小規模で均質な集団でのテストが難しいため、制約を受けています。これらの制約により、複雑で設計中心のワークフローに適用範囲が制限されています。これらの制約に対応するため、手作業によるジェスチャー入力と自然言語の指示を組み合わせた、家具の正確な配置、素材選択、空間調整のためのジェスチャー・音声制御バーチャルリアリティシステムを導入しました。システムの新規性の3つの側面は、(i) 片手での使用をサポートする適応型インタラクションモード、数値音声コマンド、そして粗い精度から細かい精度の調整;(ii) ジェスチャー、音声、コンテキスト情報を統合し、サブセンチメートル精度を実現するマルチモーダル融合アーキテクチャ;(iii) 住宅設計プロセスに特化したタスク認識型ユーザーエクスペリエンス評価フレームワーク。開発プロセスは、ジェスチャーやボイス語彙の要件分析や設計から、マルチモーダルの意図認識、スナップやアライメントを伴うVRシーンアセンブリ、反復テストに至るまで、体系的なパイプラインに沿って進みます。多様な参加者集団を対象とした実験結果では、配置誤差が30%減少し、コントローラーベースの相互作用に比べてユーザビリティや作業負荷評価が大幅に向上していることが示されています。その結果は、マルチモーダルVRがアクセスしやすく魅力的な住宅デザイン体験を生み出す可能性を示唆しています。
バーチャルリアリティ(VR)は、ユーザーが実際にその場にいるかのように技術を見て、交流し、コミュニケーションできるインタラクティブなコンピュータ生成環境です。本研究の文脈では、バーチャルリアリティは単なる視覚的表示技術ではなく、マルチモーダルな相互作用環境として捉えられています。最新のVRシステムは視覚的な関与とジェスチャー認識、空間感覚、自然な音声入力を統合し、ユーザーは高精度でシミュレートされたアイテムを操作できます。この理解は、没入感、エンゲージメント、自然なユーザー体験を重視する現在のVR研究と一致しています。応用分野は演奏、教育2、医療治療3、旅行4を含みます。VRは、現実世界では実現できない世界と交流し、つながることを可能にします。ユーザーが空間配置を把握し、オブジェクトを操作し、物理的な動きを必要とせずにリアルタイムのフィードバックを受け取るホームデザインプロセスにおいて、このような没入機能は特に役立ちます。これらの機能は、特に身体の動きが不完全なユーザーに新たな可能性をもたらします。非公式に不利な立場にあるグループ、特に高齢者や英数字リテラシーがほとんどない人々は、身体的制約、移動の困難、年齢に伴う制限によるデジタル技術へのアクセスの困難など、さまざまな要因により屋外活動が制限されます。したがって、VRの専門知識を通じて間接的に外部の世界へのアクセスを可能にする研究に常に注力する必要があります。この継続的な研究の必要性は、アクセシビリティ志向のVR体験の創出を支えるだけでなく、基本的なナビゲーション作業を超えたシステム開発を推進しています。実際、自然なジェスチャーや音声で制御される没入型住宅デザイン環境は、高齢者、運動障害者、デジタルに弱い立場の人々に複雑な空間環境と直感的に関わる手段を提供します。外部空間や創造的な作業への間接的アクセスを可能にするこれらのシステムは、機能的自立と感情的な健康の両方に貢献します。この理由に基づき、本研究はマルチモーダルVRホームデザインシステムを導入します。したがって、研究への継続的な関心が、VR技術を活用する人々に間接的に外部の世界へのアクセスを可能にする助けとなるでしょう。研究により、高齢者向けに作成されたVRベースの介入は、姿勢のコントロールと柔軟性を高めることで転倒リスクを減らし、姿勢の調整や硬さを改善するなど、いくつかの利点があることが示されています7。さらに、高齢者向けにカスタマイズされたVR教材の入手可能性も増えています。VRのインタラクションは進歩しましたが、現在の多くのシステムは主にコントローラーや両手のジェスチャーに依存しており、デザインを必要とする作業のアクセス性や精度を制限しています。これらの移動機能を拡張し、私たちの仕事は単なる観察を超え、ジェスチャーや音声手法を用いたインテリアデザイン要素の能動的で正確かつリアルな管理を可能にします
VRにはコミュニケーション、関与、思考という3つの関連特性があります。シミュレーション対象との関わりのレベルや相互作用の強さは、仮想空間におけるユーザーの想像力に直接影響を与えます。没入の段階に応じて、VRスキームは非没入型VR、セミイマーシブ型VR、完全没入型VRに分類され、それぞれ異なるコミュニケーション方法、戦略、境界の組み合わせを利用しています。11 非没入型VRは、マウスを通じてデスクトップ上の仮想環境やハンドヘルドデバイスのタッチスクリーンと通信し、12、13、14のサインを表示します。セミイマーシブVRは、一般的に大きなスクリーン、組織、スクリーンで構成され、映画のような体験を提供しますが、グループで使用する場合には位置追跡機能が欠けていることが多いです。VR15 の開始から、VR技術の使い方を快適かつ親しみやすいものにするために、ジェスチャーベースの接続が研究されています。ジェスチャーベースのインターフェースでは、手の動きなどの身体のサインを使ってコンピューターシステムとコミュニケーションを取っています。
ジェスチャーボーダーは、より一般的な自然ユーザーインターフェース(NUI)の原則の一般的な実現であり、HMDベースのVRでインターフェースの透明性を実現するために応用できます。VRの発生を促進する要因は 16、17に調査されました。しかしながら、ジェスチャーベースのUIの背景での発生についてはほとんど研究がありません。ジェスチャーベースのUIを用いたVRの実現に影響を与える要因を理解することは、今後の没入型技術の設計において有益です。したがって、発生量とジェスチャーベースのコミュニケーションの観点から、ジェスチャーベースのUIに基づく没入型VRエンゲージメントのユーザー体験を調査しました。社会的に脆弱な人々にとって、バーチャルリアリティ(VR)の一分野である360°高速道路評価教材は効果的なツールとなり得ます。このような技術により、ユーザーは物理的な移動なしで世界を仮想的に探索し、異なる場所へ移動し、多人数者連携機能を備えた他のユーザーとソーシャルコミュニケーションを取ることができます。身体的・環境的に困難な方にとって、この参加は屋外活動の有用な補助となり得ます。単純なナビゲーションを超えて、360度意見技術による教育の可能性は教育の多分野にまで及びます。
64回のトレーニングセッションを検証した文献の体系的レビューでは、360° VR動画と実際のVRの情報活用、利点、コミュニケーション特性が強調されました。結果は、360°VRが学習者のプレゼンテーション、動機付け、情報保持を向上させ、より深い没入を促進することを示しています。研究者21 は、テレポーテーションに基づく移動スキームにおいて片手と両手のUIを関連付けました。結果は、片手の合図は好む人からはより早く始まると認識され、一方で両手の合図はより信頼できると考えられていることが示されています。ただし、この研究では単独のテレポートを扱い、本研究で用いられているような絶え間ない移動について述べています。
両手の手話の一貫性が高いという仮定と、片手手話の初期速度が高いという仮定が確立され、本研究の前提として用いられた。また、プレゼンテーションや運用可能性を超えた技術評価制限のより詳細な仕様も求められます。これは、VR22における責任を果たすためのオペレーター訓練に関するものです。この訓練状況では、パネルが活動を通じてオペレーターに指導を行い、技術評価が重要な要素となります。さらに、基本的な前提は、HT技術が適切に適用されれば、技術の分野にも進歩をもたらす可能性があるということです。最近の研究で、仮想環境は車椅子操舵サービスの評価に役立つだけでなく、現実で再現するのは困難または高額な柔軟なサービスのトレーニングなど、有益な用途も持っていることが示されています。例えば、著者25はVRシミュレーターが技術的で無害な技術環境を提供することで、操作サービスを物理的な環境に一般化できると指摘しています。
また、バーチャルスキルを車椅子サービス研修の介入プログラムとして活用していることを強調し、その有用性と個別化運動や柔軟性向上への有益な価値を強調しています。しかし、安全の観点から、特に仮想現実環境では事前に確認・検査が行われます。このような導入により、身体障害のある人々が安全かつ管理された環境で車椅子運転の技術を練習し、磨くことができます彼らは困難な問題の克服、狭い空間の移動、複雑な操作の実行など、さまざまな仮想テストやシナリオを体験できます。一方で、ユーザーは自分のパフォーマンスに関する即時フィードバックを受け取り、新しい動きの戦略を習得できます。バーチャルリアリティはトレーニング補助として機能するだけでなく、治療的な応用もあります。没入型の画像技術を提供することで、自己肯定感、整理整頓、身体的な再統合の向上に寄与します。個人は運動能力を発達させ、安定性や安定感を向上させることができます。バーチャルリアリティ環境は、ユーザーがその一部であるかのように感じられるコンピューター生成の表現です。
この状況は、バーチャルリアリティヘッドホンやその他の戦略で視覚化されます。モックアップは、医療事象や特定の戦略の運用など、実施前にリスク状況や困難な状況をシミュレートできます。32、33、34。さらに、操作装置、モーション検知オーナメント、マイク、ベストなどの機器を取り付けることで、雇用主とメカニズム35 間が無害かつ慎重に再現された環境で効率的な通信を可能にできる点も利点があります。バーチャル物質は、ジョイスティックの使用、音声指示、または映像化されたトレールなど、Kinectの研究36のように様々なモードで操作可能です。すべての代替案はユーザーの学習を伴うため、制御アプローチを選ぶ際にはユーザーの体験が重要な考慮事項となります。
仮想空間におけるジェスチャーや音声の相互作用は、ベースペーパーで論じたストリートビューシステムを含むナビゲーションタスクとして研究されていますが、これらのモダリティを没入型住宅デザインのような精密かつ創造的な作業分野への応用には大きなギャップがあります。基礎研究では、アクセス性においてマルチモーダル入力が実現可能であることが証明されましたが、それはナビゲーションとシーン検査のみを含み、両手のジェスチャー、簡単なコマンド発信、そして少数の参加者で構成されていました。高忠実度の操作、正確な空間配置、素材編集、協働ワークフローといったインテリアや建築デザイン活動を定義する困難は含まれていませんでした。さらに、このテストは狭く均質なユーザー層を対象としており、より広い集団や異なるアクセシビリティニーズのユーザビリティに関する観察が制限されていました。現在のVR設計ツールは主にコントローラーに基づいており、自然な交流を制限し、運動障害や学習障害のあるユーザーを除外しています。その結果、粗いオブジェクト操作と細かいオブジェクト操作のためのジェスチャーと音声を統合し、音声制御の数値変更を提供し、片手操作やアクセシビリティに優しいインタラクションスタイルに対応し、実際の設計タスクで広範なユーザー体験分析を行ってテストするシステムの設計とテストが不足しています38,39.このギャップを埋めることで、マルチモーダルVRナビゲーションの先行研究を基盤とした、ユーザー中心の新しい没入型住宅デザインのアプローチが生まれます。
マルチモーダルの人間-機械インターフェースの最近の発展では、VR40の使いやすさと没入感を高めるための高度なセンシングおよびインタラクションメカニズムが探求されています。著者41 は、非接触型3Dジェスチャー認識のためのエレクトレット・ナノファイバーベースのトライボエレクトルセンサーを発表し、従来の視覚ベースのトラッキングを使わずに高精度なジェスチャー解釈が実現できることを示し、より自然で非接触的なVR制御を可能にすることを示しました。一方、研究者42 はマウスの頭部固定型VRシステムに対する堅牢な行動訓練手順を提示しました。この研究は、制御されたVR環境が正確な行動測定と安定したインタラクションプロトコルを支える方法を示し、VRワークフローにおける再現性と体系的な設計の重要性を概説しました。同時に、著者43 は電気生理学的信号取得の改善のために、超低スキンインピーダンスを持つ伸縮性かつ粘着性のイオン伝導電極を提案しました。これにより、XRとVRのインタラクション精度をさらに向上させる生体統合センシングへの道が開かれます。実際、これらすべての研究は、センサー技術、訓練プロトコル、生理的インターフェースがいかに急速に進化するかを示しています。これは、本研究で提案されたジェスチャー・ボイスシステムのような、より柔軟で多モーダルなインタラクションフレームワークの必要性があるからです。
このプロトコルは、片手でのアクセシブルジェスチャー、音声ベースの数値的改良、精密制御型住宅設計を可能にするマルチモーダルなジェスチャー-ボイスパスウェイを提供します。これは、主にナビゲーションやコントローラーベースの操作をサポートする現在のVRインタラクションモデルとは対照的です。私たちの理解では、これは空間的精度、素材修正、包括的なデザインプロセスに特化したジェスチャーとボイスの融合を組み合わせた初のプロトコルです。
本作の主な目的は、ジェスチャーと音声対応のバーチャルリアリティ(VR)システムを作り出し、家具の配置、回転、スケーリング、素材や照明の編集を通常のナビゲーション機能に加え、正確な配置、回転、スケーリング、素材や照明の編集をサポートするマルチモーダル入力機能を拡張することです。中心的な目標は、ジェスチャー、音声、コンテキスト入力を統合し、インテリアデザイン作業において粗い制御と細かい制御の両方を実現するマルチモーダル融合エンジンを開発することです。さらに、片手ジェスチャー、アクセシビリティ重視の機能、音声対応の精密コマンドなど、幅広いユーザーグループをサポートする適応型インタラクションモードも導入しています。
この作業では、タスク完了時間、配置精度、エラー率などの定量的指標と、使いやすさ、作業負荷、ユーザー満足度の定性的評価を組み合わせた包括的なユーザーエクスペリエンス(UX)評価も実施することを目指しています。これまでの研究に比べて大きな進歩は、ストリートビューベースのナビゲーションシステムからタスク志向で精密に駆動されたインテリアデザインフレームワークへの転換によって達成されました。主な貢献は、没入型住宅設計のためのジェスチャーと音声制御によるVR環境の開発にあり、主にストリートビューナビゲーションのためのジェスチャーと音声統合に焦点を当てた以前の研究の範囲を拡大しました。
重要なのは、これまでのシステムが、オブジェクトの位置決め、スケーリング、回転、マテリアル編集など、精密に依存した住宅デザイン操作のために、ジェスチャーボイスマルチモーダルコミュニケーションを効果的に組み合わせたことはなかったことです。既存のアプローチには、片手のジェスチャー入力や音声ベースの数値調整などの適応的インタラクションの代替手段も欠けています。提案されたシステムは、MediaPipe HandsやVRヘッドセットベースの手追跡によるジェスチャー認識と、時間畳み込みネットワーク分類器、さらにWhisper ASRやトランスフォーマーベースの意図分類モデルによる音声認識および自然言語解釈を融合させた包括的なマルチモーダルインタラクションパラダイムを導入します。
堅牢な運用を確保するために、意思決定レベルのマルチモーダル融合メカニズムと信頼に基づく仲裁が実装されており、ジェスチャーを空間選択タスクに、音声コマンドを精密な調整にマッピングします。この設計により、仮想住宅デザイン環境においてオブジェクトの正確な配置、スケーリング、回転、素材の変更が可能になります。ワークフローは構造化されたパイプラインに沿っており、システム要件の定義、ジェスチャーやボイスの語彙設計、マルチモーダル融合技術の開発、そしてスナッピングツール、測定オーバーレイ、マテリアルプレビューを備えたUnity 3Dでの没入型VR環境構築から始まります。その後、システム統合、パイロットテスト、比較研究を通じたユーザー体験評価が行われます。
このシステムは低遅延のマルチモーダルインタラクション(200ms未満)、適応型アクセシビリティのサポート、従来のコントローラーベースのVRシステムと比べて向上した使いやすさを提供します。実験評価では、タスク完了時間、配置精度、エラー率、SUSスコア、NASA-TLXワークロード指標、IPQプレゼンス評価を定量化します。期待される結果は、マルチモーダルインタラクションがVRベースの住宅設計において精度、効率、ユーザー満足度を大幅に向上させることを示しています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この研究はマレーシアのスバンジャヤにあるテイラーズ大学の研究倫理委員会によって承認されました。すべての手続きは機関研究委員会が定めた倫理指針に従い、ヘルシンキ宣言に準拠していました。データ収集前に、各参加者からインフォームド・コンセントが取得されました。彼らは研究の目的について明確に説明され、参加は任意であること、回答は機密保持されること、そしていつでも何の処分もなく辞退できることが保証されていました。また、学術論文における匿名化されたやり取りや調査データの利用については、書面によるインフォームドコンセントも取得されました。本原稿には個人を特定できる情報、画像、機密個人データは一切含まれていません。
提案された研究は、現在のナビゲーション重視の手法を凌駕し、没入型住宅デザインのためのジェスチャーと音声ベースのバーチャルリアリティ(VR)システムを構築します。このアプローチは、ユーザーのニーズを特定し、家具の配置、オブジェクトのスケールと回転、素材編集、正確な部屋の寸法など、デザイン活動を特定することから始まります。その後、ジェスチャーインタラクションシステムが開発され、ヘッドセットベースのトラッキングやMediaPipe Handsを介して制約のない手のジェスチャー(つまみ、掴み、回転など)を検出し、時間畳み込みネットワーク(TCN)を含む軽量な機械学習モデルで識別します。ジェスチャーを補完するために、組織化された音声コマンド文法が確立され、Whisperベースの自動音声認識(ASR)および自然言語理解(NLU)と組み合わせて、高レベルの意味制御のための意図とパラメータを導出します。この2つのモダリティはマルチモーダル融合戦略として組み合わされており、ジェスチャーを用いて空間選択や操作を管理し、音声コマンドで正確な調整を行い、信頼度に基づく仲裁メカニズムや元戻しコマンドによるエラー回復が補強されます。
没入型デザイン環境はUnity 3Dで展開されており、スナップ、衝突応答、測定オーバーレイ、インタラクティブな家具・素材ライブラリを備え、リアルなデザインワークフローを実現します。パイロットテストは、正式評価前に相互作用の自然さ、安定性、低遅延(<200ms)を確保するために実施されます。
参加者とサンプリング戦略
合計で48名の参加者がユーザースタディのために募集され、結果の多様性と一般化可能性を確保しました。参加者の年齢は19歳から62歳(M = 32.4、SD = 10.7)で、男性26人、女性22人でした。没入型技術への親しみの差を捉えるために、参加者はVR体験の3つのグループに分けられました。VRへの接触がほとんどない初心者ユーザー(n=18)、VRの使用頻度が低い中級者(n=17)、そして主に職業的にVRを定期的に使用する経験者(n=13)です。サンプルのアクセス性と包括性を確保するため、軽度の可動性制限のある6名と、運動制限のために片手での操作を好む4名の参加者も含まれました。すべての参加者は正常または矯正された視力を持ち、VRの使用に支障をきたす前庭や神経学的状態を報告した者はいませんでした。
参加者はバランスの取れた割り当て戦略を用いて、ジェスチャー+ボイス(n = 16)、コントローラーのみ(n = 16)、ハイブリッド(n = 16)の3つの相互作用条件にランダムに割り当てられました。経験レベルは3グループに均等に配分され、バイアスを避け、条件間で課題難易度を同等にしました。すべての参加者は実験開始前に書面によるインフォームドコンセントを提供しました。
その後、ジェスチャーボイス、コントローラーのみ、ハイブリッドの3つのインタラクション条件でユーザースタディを実施し、精度、効率、ユーザー体験を評価します。定量的な指標には配置精度、タスクの持続時間、エラー率が含まれ、主観的評価はSUS、NASA-TLX、IPQを用い、質的インタビューを用いています。ここで紹介するこのシステムは、VRにおける正確なオブジェクト操作のためのマルチモーダルジェスチャーとボイス融合の活用、片手ジェスチャーや音声フォールバックなどの適応的かつアクセスしやすいインタラクションモード、そして注釈付きジェスチャーボイスコマンドの再現可能なコーパスの提供です。これらのステップを組み合わせることで、精度、効果、ユーザー体験が向上し、基礎論文の欠点に直接対応し、デザイン利用のための没入型VRインタラクションの研究を前進させます。 図1 は提案された手法のアーキテクチャを示しています。
図1に示されるように、提案された手法のシステムアーキテクチャは、入力モダリティから始まります。ジェスチャーはEgoGestureやIPN Handなどのデータセットを用いて記録され、Fluent Speech Commandsデータセットの音声指令も使われます。これらの入力はジェスチャー認識と音声認識モジュールを用いて独立して処理され、空間的および意味的データを生成します。この2つのストリームはマルチモーダルフュージョンレイヤー内で融合されており、ジェスチャーと音声入力を整合させて一貫したコマンドを生成します。この融合データはVRインタラクション層で活用され、ユーザーが配置、回転、スケーリング、素材の修正などリアルタイムでオブジェクトを操作できるようにします。最後に、処理されたインタラクションは出力層で利用可能となり、アクセシビリティ、正確さ、自然なインタラクションに焦点を当てた没入型住宅デザイン空間が創出されます。
システム要件とタスク定義
このシステムは、アクセシビリティ志向を導入し、VRナビゲーションモデルを強化し、精密な住宅計画を促進します。ユーザードメインは
と特定しており、
は住宅所有者、
デザインの専門家、
はアクセシビリティユーザー(高齢者または移動障害者)です。各ユーザーは一連のコアタスクを実行します T = {配置、回転、スケール、素材、照明、測定}。タスクt∈Tは、ジェスチャーストリームG(空間操作)と音声コマンドVt(意味パラメータ)というマルチモーダル入力を通じて実行されます。システムはこれらをフュージョンポリシーを通じてアクションに関連付けます:
(1)
ここでπ は意思決定レベルのマルチモーダル関数です。
システムのニーズは低遅延の相互作用を必要とします。ジェスチャー認識、音声理解、フリュー
時間などです。
(2)
このサムレスポンスは、没入型VRの使いやすさの閾値に応じたリアルタイムの応答性を提供します。
タスクの精度を高めるために、地底真実の対象状態を(x, R, s, M, L)(位置、回転、スケール、材料、長さ)とし、システムの実現状態を
とします。誤差指標は以下の通りです:
(3)
(4)
(5)
(6)
材料の不一致については
。
両モダリティは信頼度スコアcg(ジェスチャー)とcv(声)を生成し、cg + cv = 1となるように正規化されます。融合仲裁は重み誤差を最小化します:
(7)
ここで lg、lv はモーダリティ特異的損失です。
した場合、システムは明確化プロンプトを要求し、不明瞭なコマンドに対しても堅牢にします。
最後に、評価指標にはタスク完了時間T、エラー率Et、NASA-TLX、SUS、IPQのワークロードスコアが含まれます。複合タスクパフォーマンス指数を紹介します。
(8)
ユーザー間で最小化され、閾値にはSUSスコアが≥70とNASA-TLXの削減が必要で、基準となるコントローラーベースのVRと比べて減少します。
データセットの収集と前処理
提案されたシステムは、ジェスチャーデータ(TCNベースの認識用)と音声コマンドデータ(NLU/ASR用)の両方に基づいています。この目的のために、私たちは主に3つのデータセットを利用しています。EgoGestureはVR類似環境での動的連続ジェスチャー、IPN Handは自然な短距離ジェスチャーを補完し、Fluent SpeechCommands 44 は音声主導のセマンティックな理解を設計発話の学習に使います。オプションのデータセットとしては、静的ジェスチャー検出器の事前学習用にHaGRID、一般的なASR前学習用のMozilla Common Voiceがありますが、どちらも必須ではありません。この選択により、両方のモダリティをカバーしつつ、データセットの範囲を合理的かつ再現性に保つことができます。 表1は 提案された研究のデータセット詳細を示しています。
本論文のデータセット選択は非常に重要です。なぜなら、各データセットはマルチモーダルVRインタラクションの異なるシナリオに対応するよう設計されているからです。EgoGestureデータセットは大規模で自然な手のジェスチャーコレクションを提供し、異なる照明や環境条件にもかかわらず高い認識性能を保証します。IPNハンドデータセットは制限のない連続的な手の動きのために設計されているため、高精度な制御操作やリアルタイムのジェスチャー分割に特に適しています。さらに、Fluent Speech Commandsデータセットは、意図検出のための意味論的注釈付きのラベル付き音声コマンドを提供しており、VRでの正確かつ自然なコマンド実行を可能にする上で重要です。これらのデータセットを組み合わせることで、ジェスチャーと音声のモダリティの両方を補完的にカバーし、多様性、堅牢性、日常的なパフォーマンスを提供し、提案システムの評価を向上させます。公開データセットに加え、10人の新規参加者から312のジェスチャーサンプルと128の音声コマンドからなる独立した社内データセットを用いてプロトコルを検証しました。この独立した検証により、プロトコルの再現性と堅牢性が確認されました。
データ前処理
収集された情報は、モデルトレーニング前に体系的に正規化、サンプリング、増強されます。
ジェスチャーシーケンス正規化
ジェスチャービデオシーケンスは、骨格関節の特徴の多変量時系列として表されます。
(9)
ここで Ti は第i番目のジェスチャーの長さ、d は特徴寸法(例:手の関節位置)です。異なるジェスチャーの長さが異なるTiを持つこと があるため、それらを一定の長さの列Tに再サンプリングします。
(10)
これにより、録画長に関係なくすべてのジェスチャーサンプルが、TCNトレーニングに使用できる標準的な時間長と同等になります。
機能標準化
ユーザー間のスケール差や記録条件の違いを排除するため、各特徴空間は標準化されています:
(11)
ここで
は特徴 j の平均、 σj は標準偏差です。このように正規化することで、特徴が単位分散で中心に位置し、ジェスチャー性能の個別差が最小限に抑えられます。
データ拡張
合成摂動の包含は、変動に対する堅牢性を向上させます。時間的ジッターはまずシーケンスアラインメントをランダムにずらします:
(12)
ここでδはフレーム単位の最大ジッターです。ノイズ注入2番目は特徴量にガウス摂動を加えます:
(13)
これらの拡張により、モデルは実際のVRインタラクションにおけるタイミングの不規則性やセンサーノイズに対しても堅牢です。
音声前処理
各発話は最初に対数メルスペクトログラム表現にマッピングされます。
(14)
ここでFは周波数ビンの数、T′は時間的フレームの数です。変動の記録を補うために、スペクトログラムの特徴は次のように正規化されます。
(15)
ここで V μ、σV はコーパス全体の平均と標準偏差です。これにより、ASRおよびNLUモデルに対して安定した音響特徴空間が提供されます。
インテンスロット符号化
音響機能に加え、各音声コマンドには構造化された意味スロットがラベル付けされています:
(16)
例えば、「椅子を15度回転する」は(action = rotate、object = chair、location = null)に対応します。この体系的なエンコーディングにより、システムは設計固有のパラメータを導き出し、実行可能なVR操作に変換することが可能になります。
時間畳み込みネットワーク(TCN)を用いたジェスチャーインタラクションデザイン
ジェスチャー・インタラクション・デザインは、ユーザーがVRホームデザインシステム内で自然な手のジェスチャーを使って仮想オブジェクトとどのように関わるかを指定します。デザインはジェスチャー語彙の開発から始まります。これは手のジェスチャーをシステム機能と関連付けることです。例えば、掴むジェスチャーはオブジェクトの配置を制御でき、つまむジェスチャーはスケーリングを制御でき、回転ジェスチャーは選択した軸の周りにオブジェクトを回転させることができました。
検討中のシステムでは、EgoGestureとIPN Handが時間畳み込みネットワーク(TCN)の学習のためのベースジェスチャーデータセットとして機能し、Fluent Speech Commandsは音声対応のインタラクション機能で設計を補完しています。これらを組み合わせることで、マルチモーダルVRインタラクションを提供します。
データセットからのジェスチャー表現
EgoGestureまたはIPN Handのいずれかのジェスチャーの連続は多変量の時系列です。
(17)
(18)
ここで、Tはあらかじめ決められたフレーム数(リサンプリング後のもの)、dは骨格特徴寸法の数(例:3次元ジョイント位置)です。データセットには y(i)∈ y というラベルがあり、Cのジェスチャークラスのいずれかを示しています。
時間畳み込み符号化
リアルタイムでジェスチャーを分類するために、時間畳み込みネットワーク(TCN)を利用しています。TCNはジェスチャーシーケンスにおける短期的および長期的な依存関係を捉えます。TCNはRNNとは異なり、拡張された因果畳み込みを利用し、効率的な並列計算を可能にします。
TCNはこれらのシーケンスを因果的な拡張畳み込みを通じて適用し、短期および長期の依存関係を学習します。
(19)
ここで dL は層 l の膨張係数、K は核サイズ、σ は非線形活性化(ReLU)です。受容野は以下に依存します:
(20)
これにより、TCNは異なる時間の長さのジェスチャーをまたぐ必要があります。
ジェスチャーの分類
最後の隠れた状態はSoftmax分類器に通されます:
(21)
クロスエントロピーによって定義された訓練目的:
(22)
音声コマンドとの統合
空間操作(移動、回転、スケール)はEgoGestureのジェスチャー認識とIPN Handで処理されますが、セマンティックコマンドにはFluent Speech Commandsデータセットが適用されます。すべての発話は構造化されたスロット表現に翻訳されます。
はジェスチャー入力をパラメータ(例:「椅子を15°回転」)として補強します。
その後、両方の出力が結合されます:
(23)
ここで o(i) はVRコントロールのプリミティブ(配置、スケーリング、回転)です。
時間畳み込みネットワーク(TCN)は、ジェスチャーや音声信号などの入力シーケンスに対して拡張された1次元畳み込みを用いることで、逐次データを効果的に扱うことができます( 図2参照)。再帰モデルとは異なり、TCNは畳み込みフィルターを用いて短期および長期の時間的関係を学習します。スキップ接続を持つ残留ブロックは、訓練中の安定性を提供し、勾配の消失を防ぐために用いられます。一方、スタックされたTCNレイヤーの使用により、ネットワークは多スケールの時間パターンを学習できます。最終的に、完全接続された分類層は、学習された時間的特徴をジェスチャークラスや音声意図などの出力ラベルに投影します。この設計は、計算効率と強力な時間モデリング機能を兼ね備えているため、連続ジェスチャー認識や音声コマンド理解に特に適しています。
表2は 、提案されたジェスチャー認識システムで使用される時間畳み込みネットワークの全体的なアーキテクチャ設計および訓練構成をまとめています。このモデルは、拡張された因果畳み込みに基づく4つの残留TCNブロックを特徴とし、ネットワークは短距離および長期の時間的依存関係の両方をモデル化できます。これらの依存関係は、掴む、回転する、つまむなどの動的なジェスチャーを区別する上で非常に重要です。核サイズが3で、拡張因子が含まれる場合、[1,2,4,8]の拡張因子は計算コストを増加させることなく時間的受容野を効率的に拡大します。ユーザー間や記録条件間の一般化を促進するために、各ブロック内でレイヤー正規化と0.25のドロップアウト率が採用されました。トレーニングには、学習率1×10-3、バッチサイズ32、シーケンス長64フレームのAdam optimizerが使用され、精度とリアルタイム応答性の最適なバランスを取っています。推論時には、スライディングウィンドウ戦略により、20〜25msごとのジェスチャー予測が可能になり、エンドツーエンドの遅延を120ms未満に抑えます。このアーキテクチャとハイパーパラメータの組み合わせにより、ジェスチャー分類において高い精度(約94%の配置精度)を実現しつつ、リアルタイムのインタラクションを保持し、TCNは没入型のVR操作タスクを実行可能にしています。
音声インタラクション設計(ASR+NLU)
音声インタラクションコンポーネントは、VRホームデザインシステム向けの意味的かつパラメータ化された音声コマンドを通じてジェスチャーベースの空間制御を補完します。音声入力 a(i) は最初に生の音声として記録され、対数メルスペクトログラムに変換されます。
(24)
ここでFは周波数 T ビンの数、時間間隔の長さを表します。この表現はスペクトルパターンと時間パターンの両方を保持し、話者や環境の変動に不変であるように正規化されています。
(25)
正規化されたスペクトログラムはWhisperのような自動音声認識(ASR)モデルに入力され、音響特徴をトークンシーケンスに変換します。
(26)
ここで、各は単語またはサブワード単位のトークンです。このような転写は自然言語理解(NLU)モデルに入力され、構造化された意味を捉えます。より正確には、NLUは意図圏と意味スロットの予測を行います。
(27)
例えば、「椅子を15度回転する」という文は(action = rotate、object = chair、location/パラメータ = 15°)に対応します。
特定された意図スロットフレームワークは、VRシステム内で実装可能な数学的コマンドに変換されます。
(28)
ここで u(i)は数値変換(例:15°回転)またはカテゴリ変換(例:物質交換)である。
最終的には信頼に基づく仲裁メカニズムによって堅牢性が達成されます。ASR信頼度スコアp(z)またはNLU信頼度スコアp(s)が閾値τ未満の場合、システムは明確化を求めるか、ジェスチャーベースの制御にデフォルト化します。これにより音声コマンドは正確かつ明確になり、精密さを要する設計作業での使いやすさが向上します。
マルチモーダル融合設計
提案されたVRシステムにおけるマルチモーダル融合の利点は、音声理解とジェスチャー検出が個別に扱われるのではなく、単一の意思決定プロセスに統合される点です。ジェスチャーモジュールはTCNからの分類出力
を与え、音声モジュールは意図スロット表現 s(i)を提供します。これらを融合させるために、システムは意思決定レベルの融合と信頼に基づく仲裁を実装しています。
ジェスチャー分類器にジェスチャークラスに対する確率分布を提供するようにします:
(29)
NLUモデルから意図スロット確率を得ます:
(30)
ここでa、o、pは音声入力から導かれるアクション、オブジェクト、パラメータスロットを指します。融合ステップは、信頼度スコアに基づいて2つのモダリティを組み合わせて共同決定を計算します。
(31)
ここでα∈[0,1]はシステムの信頼度に基づいて動的に設定されます(例:ジェスチャーが確実なほど高く、話し言葉が明確なほど低くなります)。
アルゴリズム1:Multimodal_Fusion(X, a):
入力:
X = 前処理されたジェスチャーシーケンス、a = オーディオコマンド
出力:
O = VRアクションコマンド
ステップ1:ジェスチャー認識
ステップ2:声の理解
ステップ3:融合の決定
その他:
ステップ4:エラー処理
):
ユーザーへの説明を求める
その他:
OをVRシステムに送る
戻し O
このアルゴリズム1はジェスチャー入力と音声入力を切り替え、VR設計作業のための強力なコマンドを作成します。ジェスチャーモジュール(TCN)はまず回転やスケーリングなどの手の動きを解釈し、モデルの確実性に基づいて信頼度スコアを割り当てます。これと並行して、音声モジュールはASR(例:Whisper)を用いた音声からテキストへの変換も行い、「椅子を15°回転させる」などの意味的意図を識別するためにNLUを適用します。両モジュールとも予測と信頼度スコアを返します。組み合わせステップで2つの出力がバランスを取ります。両方の入力が定数であれば、システムはそれらを信頼度に比例して結合します。もし一つの入力が曖昧(例:声のノイズや不確かなジェスチャー)であれば、システムはもう一方をより優先します。最後に、どちらも確定でない場合、システムはエラーを防ぐために説明を求めます。これにより、フュージョンは適応的(入力品質に応じて重みが変わります)、頑健(ノイズや欠損データにも対応)、正確(ジェスチャーと音声の最良の強みを活かす)を実現します。
参加者
この研究には、大学生とデザイン関連の専門家から選ばれたボランティアグループが含まれ、VRの使いやすさに関する多様な意見を集めています。参加者の年齢は成人初期から中年まで幅広く、初心者、偶発的なユーザー、上級者など、これまでのVR経験レベルが混在していました。すべての参加者は正常または矯正された視力を持ち、ジェスチャーに基づく相互作用に著しく支障をきたす運動障害は報告されていませんでした。重度の言語障害、腕の可動域の重大な制限、またはVR誘発性の乗り物酔いの既往歴は、安全性と一貫性の理由で除外されました。すべての参加者がインフォームド・コンセントを提供し、評価の手続きは機関審査委員会によって承認されました。この小節は評価に参加した人物を明確に示し、研究の再現性を確保しています。
実験装置
提案された実験装置は、開発されたマルチモーダルVRシステムを特徴とし、統合されたハンドトラッキング機能とジェスチャーを捕捉するRGBカメラを備えた消費者向けVRヘッドセットに搭載されます。高性能デスクトップを搭載し、ジェスチャー認識、ASR、マルチモーダル融合技術のリアルタイム処理を可能にします。VR環境はUnity 3Dで構築されており、家具、素材、照明要素で設定可能なホームデザインルームが含まれています。この構成には、音声の文字起こしのためのWhisperベースのASRと、意図を検出するためのトランスフォーマーベースのNLUモジュールが含まれています。この説明は、成果を議論する前に適切な技術環境の概要を提供するため、結果セクション内から移されました。
主観的な試験シナリオ
参加者は家具付きのリビングルーム、寝室、小さな作業スペースからなる模擬住宅デザイン環境と交流しました。あらゆるシナリオで、ユーザーは現実的な設計状況に応じて周囲の仮想オブジェクトや環境変数を変更するよう求められました。例えば、参加者はソファを基準点に対して配置したり、椅子を特定の方向に回転させたり、テーブルのサイズを目標の寸法に調整したり、壁の素材や光のプロファイルを変更したりするよう求められました。これらのシナリオは、ジェスチャーベースの制御(空間的精度の観点から)と音声ベースの制御(意味指令の観点から)の両方に挑戦する典型的なインテリアデザインの課題を表しているため選ばれました。この小節は、ユーザーがシステムを評価した主観的なテスト条件に関するレビュアーの質問に直接答えています。
タスク設計
参加者は、アイテム操作やデザインの相互作用の異なる分野に取り組んだ構造化された演習を行いました。主な課題は以下の通りです:1) 家具の配置:参加者は対象物を目標座標に配置しました。2) 回転タスク:このタスクでは、ユーザーが基準角度に合わせる方向を変更する必要がありました。3) スケーリングタスク:これは家具をあらかじめ設定した寸法にサイズ調整することを含みます。さらに、4) マテリアル/カラー編集:参加者はテクスチャの変更やライティングの変更に音声コマンドを用いました。仮想空間内の空間認識能力を捉えるためのオプションのナビゲーションタスクも提供されました。各作業は明確な目標、定量的な成果、そして定められた期限を設定し、正確さと効率性の両方を適切に評価できるようにしました。
手続き
参加者間の均一性を確保するため、評価は計画された順序で実施されました。まずユーザーにシステムの説明を受け、ジェスチャーや音声の相互作用のモダリティを簡単にデモンストレーションしました。初期の校正段階では、個々の手の姿勢や発話特性に適応することが可能となりました。その後、ユーザーは両方のモダリティに慣れるための短い練習セッションを行いました。実際の評価では、コントローラーのみ、ジェスチャーのみ、ジェスチャーと音声をマルチモーダル入力として使う3つのインタラクション条件ですべてのタスクを実行する必要がありました。学習効果を減らすために条件順序は相殺されました。最後に、被験者はSUS、NASA-TLX、IPQなどの標準化された評価ツールを回答し、簡単な質的フィードバック面接に参加しました。
評価指標
この構造化された手順により方法論的透明性が確立され、再現研究が可能になります。客観的および主観的な指標を組み合わせてシステム性能を包括的に評価しました。客観的な指標には、効率の指標であるタスク完了時間、ターゲット位置や回転からのずれとして数値化された位置精度;エラー率は、システムが入力の誤分類や意図しない動作を行う回数として定義されます。主観的な指標は、認知されたユーザビリティを測定するシステムユーザビリティスケール、精神的・身体的負荷を評価するNASA-TLXスケール、VRでの没入感とプレゼンスを測定するIグループのプレゼンス質問票を用いて収集しました。これらは結果セクションから適切に移動され、成果発表前にパフォーマンスがどのように測定されたかを説明しています。
VR環境、システム統合、評価
音声およびジェスチャーコマンドの主なプラットフォームは、システムが展開されるインタラクティブなバーチャルリアリティ環境です。家具、テクスチャ、照明要素の統合ライブラリを使ってUnity 3Dで仮想部屋を作成します。ユーザーはリアルタイムでアイテムを整理、カスタマイズ、編集することが可能です。スナップ機能、衝突判定、測定オーバーレイにより、物体が自然に揃うように精度が向上します。リアルタイムレンダリングによる照明や素材のレンダリングは、あらゆるやり取りに対して即時のフィードバックを提供することでデザイン体験を向上させます。
ジェスチャー認識、音声理解、マルチモーダルフュージョンの個別モジュールを検証した後、それらを統合して統合されたパイプラインにまとめます。システムは低遅延を意図して設計されているため、ユーザーのコマンドはVR環境にほぼ即座に表示されます。パイロットテストは少数のメンバーで行われ、相互作用の流れを磨きます。この反復にはジェスチャー語彙、音声コマンド文法の検証、そして連続使用中にシステムが自然で信頼できるように感じられることが含まれます。
マルチモーダルジェスチャー-ボイスフュージョン、コントローラー単独入力、ハイブリッドモードなど、3つの相互作用モダリティを比較した包括的な研究がユーザー体験を評価するために用いられます。材料の入れ替え、回転、オブジェクトの配置などの作業は参加者に求められます。パフォーマンスを評価するために、職務達成時間、配置の正確性、誤り率などの客観的な指標が収集されます。参加者からは、システムユーザビリティスケール(SUS)、NASA-TLX認知負荷、IPQ没入型質問票などの標準化されたアンケートを用いて主観的な評価を得られ、参加者インタビューも追加の支援を提供します。この二重評価は、定量的なパフォーマンス指標と主観的なユーザー体験の両方を符号化しています。
このシステムの進展は、基本的なナビゲーションやインタラクションを超えた精密設計作業にマルチモーダルフュージョンを適用することです。この技術は、音声指示の意味的価値とジェスチャーの空間的利点を組み合わせることで、より有機的で正確かつ親しみやすいやり取りの方法を提供します。音声のみのフォールバックや片手ジェスチャー認識などの柔軟なアクセシビリティ機能を提供することで、包摂性も高めています。最後に、本研究は音声とジェスチャーの相互作用に関する体系的で注釈付きのマルチモーダルデータセットを提供し、没入型インターフェース設計の今後の研究を促進し、再現性を強化します。
図3 は実装されたプログラムの典型的なスクリーンショットを示しており、構築されたVRインテリアデザインシステムのより鮮明な表現を提供しています。ユーザーが部屋のレイアウトを探索・閲覧できる没入型バーチャルリアリティ環境は 図3Aに示されています。 図3B は、ジェスチャーベースのオブジェクト操作プロセスにおいて、自然な手の操作を用いて仮想家具の選択、移動、回転に活用する方法を示しています。 図3C は統合音声インターフェースを示しており、マイクと音声フィードバック記号が空間的変更やオブジェクト配置のためのユーザー発信音声コマンドを検証します。これらの提案されたマルチモーダルVRシステムのスクリーンショットを総合すると、リアルタイムのジェスチャーや音声操作が可能に完全に実装されていることが示されています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
設計されたマルチモーダルVRホームデザインシステムは、EgoGesture(動的ジェスチャー)、IPN Hand(継続的な手のジェスチャー)、Fluent Speech Commands(意図スロットラベル付きの音声コマンド)の3つの基本データセットで検証されました。これら3つのデータセットは、ジェスチャー認識と音声に基づく意味理解の両方に対応する包括的なトレーニングと評価基盤を提供しました。この検証により、ジェスチャーと音声の統合がコントローラーのみやハイブリッド入力方式と比較してタスクの精度を大幅に向上させ、作業負荷を軽減することが示されました。
実験テストにより、マルチモーダル融合システムは配置精度を約30%向上させ、作業実行時間と誤差率の削減につながったことが示されました。標準化された指標(SUS、NASA-TLX、IPQ)を用いた主観的評価では、ユーザビリティ評価の向上、認知負荷の減少、没入感の上昇が示されました。これらすべての発見は、空間操作のためのジェスチャーと意味的・数値的調整のための音声コマンドの組み合わせが、VRベースの住宅設計においてより自然で効果的なインタラ...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この研究の結果は、ジェスチャーと音声のモダリティを組み合わせてデザインタスクに活用した没入型VRナビゲーションの有効性を示す基礎論文の技術を進展させました。マルチモーダルシステムは、すべての客観的および主観的な性能指標でより良い性能を示し、タスク完了時間が短く、配置精度が高く、誤差率も低いと、コントローラーベースやハイブリッド方式よりも優れていました。さらに、SUS、NASA-TLX、IPQなどのユーザビリティ指標では、ユーザー満足度の向上、作業負荷の減少、没入感の向上が認められました。ナビリティに関する基礎論文とは異なり、この研究はマルチモーダルVRインタラクションが仮想デザインタスクの実行において精度、創造性、包摂性を高めることを証明しています。しかし、暗照度でのジェスチャーの誤分類や騒がしい音声誤認識といった問題は依然として存在しており、さらなる洗練の余地があることを示唆しています。一般的に、この研究はマルチモーダルインタラクションがVRの使いやすさ、アクセシビリティ、包摂性を高める可能性を再確認しています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者には利益相反を主張するものはありません。
著者らは、本研究において資源と学術指導を提供してくれた建築・建築・デザイン学部およびテイラーズ大学デザイン学部の機関的支援に感謝の意を表します。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| EgoGesture データセット | 南洋理工大学 | DOI: 10.1109/TMM.2018.2808769 | 動的ジェスチャー認識トレーニングのための大規模自己中心的な手のジェスチャーデータセット。 |
| 流暢な音声コマンドデータセット | Fluent.ai / アルバータ大学 | DOI: 10.48550/arXiv.1804.04363 | ASR/NLUトレーニングのための音声意図およびスロットベースの意味理解のためのデータセット。 |
| HaGRIDデータセット(任意) | Sber AI / オープンソース | v1.1 | 静的な手のジェスチャー検出器の事前学習に使用される任意のデータセット。 |
| Igroup プレゼンス質問票(IPQ) | igroup.org | 該当なし | VR環境での没入感とプレゼンスを測定するために使用されます。 |
| IPNハンドデータセット | ベラクルサナ大学 | DOI: 10.1109/CVPRW50498.2020.00241 | 連続的で自然な手のジェスチャー認識およびセグメンテーションタスクのためのデータセット。 |
| Matplotlib / Seaborn | オープンソース | 最新ユニット | パフォーマンス指標や評価結果の可視化に使用されます。 |
| メディアパイプ・ハンズ | Googleリサーチ | オープンソース(GitHub) | ジェスチャー入力認識のためのリアルタイムの手・ジェスチャー追跡に使用されます。 |
| Mozilla Common Voice(オプション) | モジラ財団 | バージョン17 | 一般的な音声データに基づくASRモデルの事前学習用オプションデータセット。 |
| マルチモーダル融合層 | カスタムアルゴリズム | 該当なし | 信頼度加重仲裁に基づくジェスチャーや音声入力ストリームを融合させます。 |
| NASA-TLXワークロード評価 | NASAヒューマンファクター | 該当なし | 参加者の認知負荷分析に使用されます。 |
| 自然言語理解(NLU)モジュール | カスタム(BERT / RoBERTaベース) | 該当なし | 文字起こしされた音声入力から意味的な意図やスロット(アクション、オブジェクト、パラメータ)を抽出するために使用されます。 |
| NumPy / Pandas / OpenCV | オープンソース | 最新ユニット | 数値演算、データ前処理、ビデオフレーム操作に使用されます。 |
| Pythonプログラミング言語 | Pythonソフトウェア財団 | バージョン3.10+ | MLモデル(TCN、ASR、NLU、FUSION)の実装に使用されます。 |
| PyTorch ディープラーニングフレームワーク | メタAI | バージョン 2.0+ | ジェスチャー認識(TCN)およびNLUモデルの構築と訓練に使用されます。 |
| RGBカメラ | ロジクール / リアルセンス | Logitech C920 または Intel RealSense D435 | 手のジェスチャーキャプチャやモーション認識入力に使用されます。 |
| システムユーザビリティスケール(SUS)アンケート | 標準評価ツール | 該当なし | VRシステムの主観的な使いやすさを評価するために使用されます。 |
| 時間畳み込みネットワーク(TCN) | カスタム実装(PyTorch / TensorFlow) | 該当なし | 時系列骨格データからの動的ジェスチャー認識に使用されます。 |
| Unity 3Dエンジン | ユニティ・テクノロジーズ | バージョン 2022.3 LTS | インタラクティブな家具、マテリアル編集、リアルタイムレンダリングを備えた没入型VR環境の開発に使用。 |
| VRヘッドセット | Oculus(Meta)/HTC Vive | Oculus Quest 2 または HTC Vive Pro | VRインタラクション中の没入型ビジュアライゼーションや空間トラッキングに使用されます。 |
| ウィスパーASRモデル | OpenAI | ウィスパー(ベースモデル) | 音声をテキストに変換するための自動音声認識エンジン。 |
| ワークステーション | カスタムビルドPC | Intel Core i7 / NVIDIA RTX 3070 / 32GB RAM | ジェスチャーやボイスモデルのリアルタイム処理、訓練、推論に使用されます。 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト