このコンテンツを表示するには、JoVEへの購読が必要です。 または、無料トライアルをお申し込みください。

方法論記事

拡張現実のためのフォトリアリスティックな学習風景

1K 閲覧数

DOI:

10.3791/68386

2025年6月27日

* These authors contributed equally

この記事について

サマリー

この論文では、360度画像、ガウススプラッティング、およびバーチャルリアリティ統合を使用したフォトリアリスティックな3D再構成のシステムを紹介します。このアプローチは、教育、学習環境のシミュレーションなど、さまざまなアプリケーションに適用できます。建設、オフサイトの作業をシミュレートし、メトリックを取得するため。またはヘルスケア、日常生活のタスクで自閉症の人々を訓練するために。

要約

標準的なカラー画像から現実世界の環境をフォトリアリスティックに再現した3D画像を作成する能力は、ヘルスケア、教育、産業などの分野で多くの用途があります。この論文では、Structure from Motion、インクリメンタルシーンレジストレーション、ガウススプラッティングなどの高度な技術を統合して詳細な3Dモデルを再構築する新しいシステムを紹介します。これらのモデルは、仮想現実環境にシームレスに統合され、没入型のインタラクションを可能にします。パイプラインは、マトリックスベースのパターンを使用して360度画像をキャプチャすることから始まり、包括的なカバレッジを実現します。画像はCOLMAPを使用して処理され、カメラの姿勢を推定し、スパース点群を生成します。ガウス スプラッティングは、ポイントの位置、形状、外観を最適化することで再構築を洗練し、非常にリアルな 3D 環境を作り出します。その後、これらのモデルは Unity でレンダリングされ、VR ヘッドセットによるインタラクションが可能になり、大規模な言語モデルによって駆動されるアバターなどの追加機能をサポートします。1つのユースケースは、システムの汎用性を示しています。ヘルスケアでは、このアプローチは、制御された身近な治療のための仮想空間を作り出し、特に自閉症スペクトラム障害の人々にとって有益です。没入型環境とインタラクティブなアバターは、パーソナライズされた治療のための安全で快適な環境を提供します。このシステムには、高い視覚的忠実度、画像取得の容易さ、没入型のユーザーエクスペリエンスなど、大きな利点があります。ただし、ガウススプラッティングの計算コストや、正確なカメラ姿勢推定への依存など、課題が残っています。これらの制限を克服することにより、この方法は、治療的介入から工業デザインや文化保存に至るまで、さまざまな分野でのアプリケーションを変革する可能性を秘めています。

概要

3Dランドスケープを再現し、操作する能力は、最新のテクノロジーアプリケーションのさまざまな分野で重要になっています。実際の場所の仮想表現を作成するための従来の手法は、労働集約的で厳格なモデルと手動測定に依存することがあります1。高度なコンピュータビジョン技術は、これらの制限を克服するために、自動化された3D再構成とインタラクションの実行可能なオプションとして浮上しています2

360度写真から複雑な3Dモデルを開発することは、この進歩の注目すべき特徴です。COLMAP3などの最新鋭のツールで撮影された正確なエリアを特定することで、正確な空間情報を得ることができます。このプロセスは、ガウススプラッティング4によってさらに強化され、複雑な設定を高品質で3Dで再現できます。

これらの 3D モデルをバーチャル リアリティ (VR) システムに組み込むことで、再構築を超えた探索とエンゲージメントの新たな道が開かれます。エンゲージメントを高めるために、ユーザーはドアやテーブルなどの現実世界のオブジェクトを測定したり、仮想空間内を移動したり、デジタルオブジェクトやアバターを追加したりすることもできます。これらのアバターは、大規模言語モデル(LLM)を使用して動的でインタラクティブな応答を生成することができ、没入型の体験を実現します5

この作品は、通常のカラー画像を使用して現実世界の環境を3次元的に表現し、それらを仮想現実のセットアップ内に表示するための方法論を提示します。このシステムは、汎用の Structure-from-Motion パイプラインとガウス スプラッティング パイプラインに依存しています。このシステムは、建設やヘルスケアにおけるさらなるアプリケーションの作成に適しています。

提案されたパイプラインは、その主な利点である実際の環境の視覚的にリアルで魅力的な3次元表現を生成します。さらに、カラー画像を使用するため、LiDARやストラクチャードライトカメラ6などの高価なセンサーを必要とする他のアプローチと比較して非常に便利です。この提案の背後にある理論的根拠は、視覚的に魅力的な3次元表現を簡単に作成する能力には多くのアプリケーションがあるということです。これは、品質管理のための建設、既知の制御された環境で自閉症の人々を治療するためのヘルスケア、またはビデオゲーム内の実際の場所の正確な表現を含めるためのエンターテイメントで使用できます。

近年、コンピュータビジョン、機械学習、バーチャルリアリティ技術2の統合により、3D再構成や仮想環境とのインタラクションのためのシステムの開発が大きく進んでいます。この作業に関連する主要なコンポーネントと方法論の概要を以下に示します。

正確な3D再構成は、画像処理に依存して空間情報と幾何学的情報を抽出します。Structure from Motion(SfM)7 やMulti-View Stereo(MVS)8 などの従来の手法は、カメラの姿勢を推定し、高密度の点群を生成するために広く使用されています。COLMAPのようなツールは、SfMとMVSを組み合わせて画像データセットから高精度な3Dモデルを生成することで、これらのタスクを実行する堅牢性が認められています。ただし、複雑な照明、テクスチャ、および非常に動的な環境に対処するには、依然として制限があります。

最近の進歩には、ポイントベースの表現を使用して、従来のメッシュベースの方法よりも効率的にフォトリアリスティックな再構成を生成するGaussian Splatting9が含まれます。ガウス スプラッティングは、特に複雑なディテールを持つシーンで、よりスムーズな視覚化とより正確な空間表現を可能にします。

3Dモデルが再構築されたら、それらをVR互換形式に変換することは、没入型のインタラクションにとって非常に重要です。VRシステムの利用は、エンターテインメントにとどまらず、教育、ヘルスケア10、インダストリアルデザインなどの分野に広がっています。最新のVRフレームワークは、シームレスなナビゲーション、デジタルオブジェクトとのインタラクション、リアリズムの向上を可能にし、高いユーザーエンゲージメントを必要とするアプリケーションに適しています。

仮想オブジェクトやアバターなどのインタラクティブ機能の統合により、仮想現実(VR)システムの機能と深さが大幅に向上します。大規模言語モデル(LLM)を搭載したアバターは、現実的な会話インタラクションを促進し、ダイナミックで適応性の高いユーザーエクスペリエンスを可能にします。特に、これらの技術は治療の文脈で可能性を示しており、ユーザーの行動や感情状態に基づいてカスタマイズされたインタラクションを可能にします。例えば、この研究11 では、自閉症の人々に職業コミュニケーションスキルを訓練するために、LLMを搭載したチャットボットとしてアバターを使用するVRアプリケーションを開発し、LLMを利用したアバターのセラピーにおける適応性を強調しました。さらに、LLMは拡張現実環境に埋め込まれてインクルージョンとエンゲージメントを促進し、LLM主導のアバターの治療可能性をさらにサポートしました。

仮想環境は、特に自閉症スペクトラム障害(ASD)の個人にとって、治療現場でますます使用されています。研究によると、慣れ親しんだ制御された仮想空間は、治療セッション中の不安を軽減し、エンゲージメントを高めることができることが示されています11。これらの環境のアバターは、ファシリテーターとして機能し、患者にとって安全でアクセスしやすい方法で治療を提供できます。

進歩はあるものの、3D再構築の計算コスト、仮想環境での高い忠実度の維持、システム間のスムーズな統合の確保など、課題が残っています。しかし、より効率的なアルゴリズムとハードウェアの継続的な開発、およびAI駆動型ツールの進歩は、この分野でのさらなるイノベーションの機会を提供します。この論文では、360度画像を使用した3D再構築と仮想環境との相互作用のための新しいシステムを紹介します。このアプローチでは、COLMAP を使用した画像位置推定、ガウス スプラッティングを使用した高品質な再構成、没入型探索のための VR 互換性などの手法を統合しています。このシステムは、デジタルオブジェクトとLLMを搭載したインタラクティブアバターを組み込むことで、ASDの個人化治療や建設プロジェクトの検証への応用を可能にします。これらのツールは、治療と産業の両方の実践を強化する適応型仮想環境を作成するための包括的なフレームワークを提供します。 図 1 は、プロポーザル パイプラインを示しています。

figure-introduction-1
図 1: システム パイプライン。 実環境、360°画像、得られた投影法、SfMプロセス、ガウススプラッティングプロセス、およびバーチャルリアリティとの統合で構成される環境のフォトリアリスティックな再構築のための提案されたパイプラインの図。 この図の拡大版を表示するには、ここをクリックしてください。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

1.画像キャプチャ

  1. 360°カメラを高さを調節できる三脚に置きます。スキャンする環境内の一連の位置を、各エッジが1.5m間隔で配置された正方形のメッシュパターンに従って選択します。
  2. メッシュの各選択したポイントで、約 0.4 m、1.2 m、2 m の 3 つの異なる高さで画像をキャプチャします。
  3. 360°画像をエクイレクタングラー形式の画像に変換します。たとえば、Ista360アプリを使用します。 画像を選択し、 輸出 ボタンをクリックして、 360 度写真のエクスポート モードを選択し、2:1 の比率の画像としてエクスポートします。
  4. 水平視野が 90° の各正距円筒図法画像から 16:9 形式の遠近法画像を抽出します。すべての画像に水平角度は、0、45、90、135、180、225、270、315 を使用します。0.4 mの高さで撮影された画像の場合は、垂直角度0、50を使用します。1.2 mの高さで撮影された画像の場合は、対頂角-50、0、50を使用します。2 mの高さで撮影した画像の場合は、対頂角-50、0を使用します。抽出プロセスには、Equi2Pers.py Python スクリプト (Supplementary Coding File 1; 図 2)。

figure-protocol-1
図2:正距円筒図法の画像と投影法。 正距円筒図法のイメージがキューブマップ投影法にどのように変換されるかを示す図。 この図の拡大版を表示するには、ここをクリックしてください。

2. COLMAPによるカメラ姿勢推定

  1. [ファイル] > [新規プロジェクト] をクリックして新しい COLMAP プロジェクトを作成し、イメージへのパスを指定して新しいデータベースを作成します。
  2. 各画像の特徴を抽出するには 、[処理] > [特徴抽出] をクリックし、カメラ モデルとして PINHOLE を選択し、すべての画像を共有します。残りのパラメータはデフォルトのままにします。テクスチャーの多い領域では、max_num_featuresを減らしてメソッドの効率を高めることができます。
  3. デフォルトのパラメーターを使用して 、[処理] > [フィーチャ一致] をクリックして、フィーチャ一致を実行します。
  4. SfM を計算するには、[ Reconstruction] > [Start Reconstruction ] をクリックし、デフォルトの COLMAP パラメータを使用してカメラの位置と向きを取得します。
  5. バンドル調整を使用して再投影エラーを最小限に抑えるには 、[再構築] > [バンドル調整] をクリックします。
  6. [ 再構築] > [高密度再構築] をクリックして、シーンの高密度 3D 表現を生成し、カメラ ポーズや再構築されたポイントなどの出力を表示します。

3. ガウススプラッティング(GS)によるフォトリアリスティックな3Dシーンの再構築

  1. パラメータ -s、-m、および -r を指定して train.py ファイルを実行します。ここで、-s は COLMAP プロジェクトパスを指定し、-m はガウススプラッティングの出力パスを定義し (指定しない場合はデフォルトのパスが生成されます)、-r は画像を再スケールします。通常は 2 から 4 の間で設定されます。
    注: ファイル train.py は、Gaussian Splatting の公式リポジトリ https://github.com/graphdeco-inria/gaussian-splatting にあります。
  2. Gaussian Splatting によって生成された .ply ファイルを出力パスで見つけ、後で Unity で使用します。

4. Unityとガウススプラッティングによるバーチャルリアリティでのレンダリング

  1. VRヘッドセットをコンピューターに接続します。この方法は、使用するVRヘッドセットによって異なります。
  2. Unity Hub を使用して、バージョン 2022.3.44f1 の 3D プロジェクトを作成します。必要に応じて、Unityバージョン2022.3.44f1をインストールします。[ プロジェクト] > [新しいプロジェクト] に移動し、バージョン 2022.3.44f1 3D (Core) テンプレートを選択し、プロジェクトの名前と場所を設定して、[ プロジェクトの作成 ] をクリックしてデフォルト設定で生成します。
  3. プラグインをインストールしてVRヘッドセットを管理し、ジョイスティックへのアクセスやアイトラッキングなどのタスクを含むアプリケーション開発を簡素化します。これを行うには、Unity Asset Store で Package Manager の Window > Package Manager をクリックします。
  4. UnityGaussianSplatting プラグインを使用して、Gaussian Splatting 出力からアセットを生成します。これは、Unity Asset Store のパッケージマネージャーを使用して行います。このアセットを生成するには、[ツール] > [GaussianSplats] > [Create GaussianSplatAsset ] に移動し、Gaussian Splatting によって生成された .ply ファイルを提供します。
  5. UltraLeap プラグインを使用して、手の検出を改善し、ユーザーの操作を強化します。これをインストールするには、 Unity Asset Store > Package Manager に移動し、 Window > Package Manager をクリックします。
  6. whisper.unityプラグインを使用して、VRヘッドセットのマイクでキャプチャされたオーディオを文字起こしします。ステップ 4.5 の説明に従って、これをインストールします。
  7. LLM モデルを使用して応答を生成します。LLMUnityプラグインをインストールして、このLLMを使用できるようにします。ステップ 4.5 の説明に従って、これをインストールします。
    1. 空のゲームオブジェクトを作成し、LLM スクリプトを追加し、 ダウンロードモデル ボタンをクリックしてデフォルトモデルを選択します。文字には、空のオブジェクトを追加し、名前とロールを指定できるLLMCharacterスクリプトをアタッチします。
  8. Meta - Voice SDK を使用して、LLM によって生成された応答からオーディオを生成します。これを実現するには、Unity アセットストアから Package Manager を使用して Text-to-Speech プラグインをインストールし、 Window > Package Manager をクリックします。
  9. VRヘッドセットを使用して、没入型のインタラクションを可能にします。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

このセクションでは、提案されたパイプラインの代表的な結果、長所、および制限について説明します。提案手法を適用した結果は以下の通りです。 図 3 は、カメラの位置 (赤) と密集した点群を示しています。共通の原点を持つカメラのグループは、同じ正距円筒図法イメージからの投影を表します。

figure-results-1
図3:COLMAP点群の結果とカメラのポーズ。 COLMAPを適用した結果、生成された点群とカメラの位置が赤色の特徴で表されます。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

この研究では、360度画像と高度なレンダリング技術を使用したフォトリアリスティックな3D再構成と仮想環境インタラクションの新しい方法論を提示します。提案されたシステムの重要なステップ、課題、および影響については、以下で説明します。

重要なステップ
提案されたパイプラインの重要なステップの 1 つは、画像キャプチャです。さまざまな高さと場所に配置された360度カメラを使用して、環境を最大限にカバーするための包括的なデータセットが生成されます。このステップでは、3D再構成の精度と完全性を確保しますが、オクルージョンや死角を避けるために慎重な計画が必要です。また、取得した画像の量と質は、最終的な出力に重要な役割を果たします。一部の領域を見逃す画像の数が不十分であったり、画像の品質が低かったりすると、スプラットの特性が不十分であるために、領域がぼやけたりぼやけたりするなどの再構築エラーが発生する可能性があります。もう1つの重要なステップは、COLMAPを使用したカメラの姿勢推定です。...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

著者らは、この論文で報告された研究に影響を与えたと思われる可能性のある既知の競合する金銭的利益や個人的な関係がないことを宣言します。

謝辞

この論文は、MICIU/AEI/ 10.13039/501100011033およびERDF A way of making Europeが資金提供する助成金PID2022-138453OB-I00の一部です。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
GPU NVIDIA GeForce RTX 2080エヌビディアTU104-400A画像処理・再構成装置 
インスタ360×4インスタ360シンサブマ-H再構成用データ収集装置
メタクエストIIIメタ899-00582-01再構成を可視化し、再構成と対話するための装置
メモリーカード Evo Plus 128 GBサムスンMB-MC128KA/EU360度用メモリーカード。写真の保存

参考文献

  1. Zollmann, S., et al. Augmented Reality for Construction Site Monitoring and Documentation. Proceedings IEEE. 102 (2), 137-154 (2012).
  2. Zhou, L., Wu, G., Zuo, Y., Chen, X., Hu, H. A comprehensive review of vision-based 3d reconstruction methods. Sensors. 24 (7), 2314(2024).
  3. Structure-from-motion revisited. Schonberger, J. L., Frahm, J. M. IEEE Conf Comp Vis Pattern Recog, , 4104-4113 (2016).
  4. Kerbl, B., Kopanas, G., Leimkühler, T., Drettakis, G. 3d gaussian splatting for real-time radiance field rendering. ACM Trans. Graph. 42 (4), 139-141 (2023).
  5. Embedding large language models into extended reality: Opportunities and challenges for inclusion, engagement, and privacy. Bozkir, E., et al. Proc 6th ACM Conf Conversat User Interf, , 1-7 (2024).
  6. Remondino, F., El-Hakim, S. Image-based 3D modelling: A review. Photogrammet Record. 21 (115), 269-291 (2006).
  7. Özyeşil, O., Voroninski, V., Basri, R., Singer, A. A survey of structure from motion. Acta Numerica. 26, 305-364 (2017).
  8. Structure from motion using full spherical panoramic cameras. Pagani, A., Stricker, D. IEEE Int Conf Comp Vision Workshops, , 375-382 (2011).
  9. Dalal, A., Hagen, D., Robbersmyr, K. G., Knausgård, K. M. Gaussian Splatting: 3D Reconstruction and Novel View Synthesis: A Review. IEEE Access. 12, 96797-96820 (2024).
  10. Zhang, M., Ding, H., Naumceska, M., Zhang, Y. Virtual Reality Technology as an Educational and Intervention Tool for Children with Autism Spectrum Disorder: Current Perspectives and Future Directions. Behav Sci. 12 (5), 138(2023).
  11. Failla, C., et al. Virtual reality for autism: unlocking learning and growth. Front Psychol. 15, 1417717(2024).
  12. Huang, B., Yu, Z., Chen, A., Geiger, A., Gao, S. 2D Gaussian Splatting for Geometrically Accurate Radiance. arXiv. , (2024).
  13. Zhang, Y., et al. Evaluating Human Perception of Novel View Synthesis: Subjective Quality Assessment of Gaussian Splatting and NeRF in Dynamic Scenes. arXiv. , (2025).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

タグ

3D Structure from Motion 360 COLMAP Unity