需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

用于增强现实的基于学习的逼真景观

1K 次观看

DOI:

10.3791/68386

2025年6月27日

* These authors contributed equally

本文内容

摘要

本文介绍了一种利用360度图像、高斯点阵渲染和虚拟现实集成进行逼真三维重建的系统。该方法可应用于多种场景,例如教育领域用于模拟学习环境;建筑领域用于模拟异地施工和获取测量数据;或医疗领域用于训练自闭症患者完成日常生活任务。

摘要

利用标准彩色图像创建真实世界环境的逼真三维重建具有广泛的应用前景,涵盖医疗健康、教育和工业等多个领域。本文介绍了一种新颖的系统,该系统融合了运动结构恢复(structure from motion)、增量式场景配准(incremental scene registration)和高斯点阵渲染(Gaussian Splatting)等先进技术,以重建高细节的三维模型,并将这些模型无缝集成到虚拟现实环境中,实现沉浸式交互。该流程首先采用基于矩阵模式的360度图像采集方法,确保全面覆盖场景。采集的图像通过COLMAP进行处理,以估计相机位姿并生成稀疏点云。随后,高斯点阵渲染技术通过优化点的位置、形状和外观,进一步提升重建质量,生成高度逼真的三维环境。这些模型最终在Unity中渲染,支持VR头显交互,并可集成由大语言模型驱动的虚拟化身等附加功能。其中一个应用案例展示了该系统的多功能性:在医疗健康领域,该方法可构建受控且熟悉的虚拟空间用于治疗,尤其适用于自闭症谱系障碍人群。沉浸式环境与交互式虚拟化身共同为个性化治疗提供了安全、舒适的环境。该系统具有诸多优势,包括高视觉保真度、图像采集简便以及沉浸式用户体验。然而,仍存在一些挑战,例如高斯点阵渲染的计算开销较大,且其效果依赖于精确的相机位姿估计。通过克服这些局限性,该方法有望在治疗干预、工业设计及文化遗产保护等多个领域带来变革性应用。

引言

重建并交互操作三维场景的能力在现代技术应用的诸多领域中已变得至关重要。传统上用于创建真实地点虚拟表示的方法有时依赖于劳动密集型、僵化的模型以及人工测量1。为了克服这些局限性,先进的计算机视觉技术已成为实现自动化三维重建与交互的可行选择2

利用360度照片构建复杂的三维模型是这一进展的显著特征。通过使用COLMAP3等先进工具精确定位照片拍摄的具体位置,可以获得准确的空间信息。该过程进一步得益于高斯点阵化技术(Gaussian Splatting)4,该技术能够以高质量将复杂场景重建为三维模型。

将这些三维模型整合到虚拟现实(VR)系统中,为超越重建的探索与互动开辟了新的途径。为了增强互动性,用户可以测量现实世界中的物体(如门和桌子),在虚拟空间中自由移动,甚至添加数字物体和虚拟形象。这些虚拟形象能够利用大语言模型(LLMs)产生动态且具有交互性的响应,从而实现沉浸式体验5

本研究提出一种利用常规彩色图像创建真实环境三维模型并在虚拟现实系统中展示的方法。该系统基于通用的运动恢复结构和三维高斯溅射技术框架构建,适用于建筑与医疗保健等领域的进一步应用开发。

该方案所提出的流程能够生成视觉上逼真且具有吸引力的三维环境模型,这是其主要优势。此外,该方法使用彩色图像,相较于需要昂贵传感器(如激光雷达或结构光相机)的其他方法更为便捷6。提出该方案的依据在于,便捷地创建视觉上吸引人的三维模型具有广泛的应用前景。例如,可在建筑领域用于质量控制,在医疗健康领域用于在熟悉且可控的环境中治疗自闭症患者,或在娱乐产业中将真实场景的精确模型融入电子游戏中。

近年来,随着计算机视觉、机器学习和虚拟现实技术的融合,三维重建系统及与虚拟环境交互系统的发展取得了显著进展2。以下概述了与本研究相关的关键组成部分和方法。

精确的三维重建依赖于图像处理来提取空间与几何信息。传统方法如运动恢复结构(SfM)7 和多视角立体视觉(MVS)8 已广泛用于估计相机位姿并生成稠密点云。COLMAP 等工具因其在执行这些任务中的鲁棒性而受到认可,通过结合运动恢复结构(SfM)与多视图立体视觉(MVS),可从图像数据集生成高精度的三维模型。然而,在处理复杂光照、纹理以及高度动态环境时仍存在局限性。

最近的进展包括高斯点阵化9,该方法采用基于点的表示形式,比传统的基于网格的方法更高效地生成逼真的重建结果。高斯点阵化能够实现更平滑的可视化效果以及更精确的空间表达,尤其适用于细节复杂的场景。

三维模型重建完成后,将其转换为兼容虚拟现实(VR)的格式对于实现沉浸式交互至关重要。虚拟现实系统的应用已超越娱乐领域,扩展到教育、医疗保健10和工业设计等领域。现代VR框架支持无缝导航、与数字对象的交互以及增强的真实感,使其适用于需要高度用户参与的应用场景。

虚拟对象和虚拟形象等交互功能的整合显著增强了虚拟现实(VR)系统的功能性和沉浸感。由大语言模型(LLM)驱动的虚拟形象能够实现逼真的对话交互,从而提供动态且自适应的用户体验。特别是在治疗场景中,这些技术展现出巨大潜力,能够根据用户的行为或情绪状态提供个性化的交互。例如, 本研究11开发了一款基于虚拟形象作为LLM驱动聊天机器人的VR应用,用于训练自闭症个体的职业沟通技能,凸显了LLM驱动虚拟形象在治疗中的适应性。此外,LLM还被嵌入增强现实环境中,以促进包容性与参与度,进一步支持了LLM驱动虚拟形象在治疗领域的应用潜力。

虚拟环境正越来越多地应用于治疗场景中,尤其适用于自闭症谱系障碍(ASD)个体。研究表明,熟悉且可控的虚拟空间能够在治疗过程中降低焦虑水平,并提高患者的参与度11。这些环境中的虚拟形象可作为辅助者,以让患者感到安全且易于接受的方式提供治疗。

尽管已取得进展,但仍存在一些挑战,包括三维重建的计算成本、在虚拟环境中保持高保真度,以及确保系统之间的平滑集成。然而,更高效算法与硬件的持续发展,以及人工智能驱动工具的进步,为该领域的进一步创新提供了机遇。本文提出了一种利用360度图像进行三维重建及与虚拟环境交互的新系统。该方法融合了多种技术,例如使用COLMAP进行图像定位、采用高斯点阵化(Gaussian splatting)实现高质量重建,以及支持虚拟现实(VR)以实现沉浸式探索。通过整合数字对象和由大语言模型(LLMs)驱动的交互式虚拟化身,该系统可应用于自闭症谱系障碍(ASD)个体的个性化治疗以及建筑项目验证。这些工具为创建可适应的虚拟环境提供了综合框架,从而提升治疗和工业实践的效果。图1展示了本方案的流程。

figure-introduction-1
图1:系统流程。 所提出的环境照片级真实感重建流程示意图,包括真实环境、360°图像、获得的投影、SfM过程、高斯点阵化过程以及与虚拟现实的集成。请点击此处查看此图的放大版本。

访问受限。请登录或开始试用以查看此内容。

方案

1. 图像采集

  1. 将360°相机安装在具有可调节高度的三脚架上。在待扫描的环境中选择一系列位置,按照边长为1.5 m的方形网格模式进行布点。
  2. 在网格的每个选定位置,分别在三个不同高度拍摄图像:约0.4 m、1.2 m和2 m。
  3. 将360°图像转换为等距柱状投影图像。例如,可使用Ista360应用程序。选择图像,按下导出按钮,选择导出360照片模式,并以2:1比例导出图像。
  4. 从每张等距柱状投影图像中提取水平视场为90°的16:9格式透视图像。所有图像的水平角度依次为:0、45、90、135、180、225、270、315。对于在0.4 m高度拍摄的图像,使用垂直角度0、50;对于在1.2 m高度拍摄的图像,使用垂直角度-50、0、50;对于在2 m高度拍摄的图像,使用垂直角度-50、0。提取过程可使用Equi2Pers.py Python脚本(补充代码文件1图2)。

figure-protocol-1
图 2: 等距长方投影图像转换为立方体投影。 等距长方投影图像转换为立方体贴图投影的示意图。请点击此处查看该图的放大版本。

2. 使用 COLMAP 进行相机位姿估计

  1. 通过点击 文件 > 新建项目 创建一个新的 COLMAP 项目,然后指定图像的路径并创建一个新的数据库。
  2. 通过点击 处理 > 特征提取,选择 PINHOLE 作为相机模型,并对所有图像使用相同的设置,从而为每张图像提取特征。其余参数保持默认。在纹理丰富的区域,可减少 max_num_features 以提高方法的效率。
  3. 通过点击 处理 > 特征匹配 进行特征匹配,使用默认参数。
  4. 通过点击 重建 > 开始重建 计算 SfM,以获得相机的位置和姿态,使用默认的 COLMAP 参数。
  5. 通过点击 重建 > 光束法平差,利用光束法平差最小化重投影误差。
  6. 通过点击 重建 > 稠密重建 生成场景的稠密三维表示,输出包括相机位姿和重建的点云。

使用高斯点阵(GS)进行逼真三维场景重建

  1. 使用参数 -s、-m 和 -r 执行 train.py 文件,其中 -s 指定 COLMAP 项目路径,-m 定义高斯点阵(Gaussian Splatting)的输出路径(若未指定,则会生成默认路径),-r 用于图像重缩放,通常设置为 2 到 4 之间。
    注意:train.py 文件位于高斯点阵官方代码仓库 https://github.com/graphdeco-inria/gaussian-splatting。
  2. 在输出路径中找到由高斯点阵生成的 .ply 文件,供后续在 Unity 中使用。

4. 使用 Unity 和高斯点阵渲染虚拟现实

  1. 将VR头戴式显示器连接到计算机。此方法取决于所使用的VR头戴式显示器。
  2. 使用Unity Hub创建一个版本为2022.3.44f1的3D项目。如有必要,请先安装Unity 2022.3.44f1版本。进入Projects > New Project,选择版本2022.3.44f13D (Core)模板,设置项目名称和存储位置,然后点击Create Project以默认设置生成项目。
  3. 通过Unity资源商店使用包管理器安装插件,以管理VR头戴式显示器并简化应用程序开发,包括访问操纵杆和眼动追踪等功能。操作路径为点击Window > Package Manager
  4. 使用UnityGaussianSplatting插件从高斯点阵输出生成资源。通过Unity资源商店的包管理器完成安装。为生成该资源,请进入Tools > GaussianSplats > Create GaussianSplatAsset,并提供由高斯点阵生成的.ply文件。
  5. 使用UltraLeap插件提升手部检测精度,从而增强用户交互体验。安装方式为进入Unity Asset Store > Package Manager,然后点击Window > Package Manager
  6. 使用whisper.unity插件转录由VR头戴式显示器麦克风采集的音频。安装方法如步骤4.5所述。
  7. 使用大语言模型(LLM)生成回复。安装LLMUnity插件以启用该LLM功能。安装方式如步骤4.5所述。
    1. 创建一个空的GameObject,并添加LLM脚本,然后点击download model按钮以选择默认模型。对于角色,添加一个空对象并附加LLMCharacter脚本,在其中可指定名称和角色。
  8. 使用Meta - Voice SDK将大语言模型生成的回复转换为语音输出。为此,需通过Unity资源商店使用包管理器安装文本转语音(Text-to-Speech)插件,操作路径为点击Window > Package Manager
  9. 使用VR headsets实现沉浸式交互。

访问受限。请登录或开始试用以查看此内容。

结果

本节讨论了所提出流程的代表性结果、优点和局限性。所提出方法的应用结果如下。图3展示了相机位置(以红色表示)和稠密点云。具有相同原点的相机组代表来自同一等距矩形图像的投影。

figure-results-1
图3: COLMAP 点云结果与相机位姿 应用COLMAP的结果展示了生成的点云以及由红色特征表示的相机位置。 请点击此处以查看此图的放大版本。

在使用高斯点阵化进行...

访问受限。请登录或开始试用以查看此内容。

讨论

本研究提出了一种利用360度图像和先进渲染技术进行逼真三维重建及虚拟环境交互的新方法。下文将讨论该系统的关键步骤、面临的挑战及其意义。

关键步骤
所提出流程中的一个关键步骤是图像采集。通过在不同高度和位置放置360度相机,生成全面的数据集,以最大程度覆盖环境。此步骤可确保三维重建的准确性和完整性,但需要精心规划,以避免遮挡和盲区。此外,所获取图像的数量和质量对最终结果起着至关重要的作用。若图像数量不足导致某些区域缺失,或图像质量较差,则可能因对splat的表征不充分,造成重建错误,例如出现模糊或弥散的区域。另一个关键步骤是使用COLMAP进行相机位姿估计。该过程高度依赖输入图像的质量以及是否存在显著的视觉特征,因为此阶段的任何不准确都可能逐级传递,导致重建中的误差。

高斯点阵化是重建过程的核心,可将稀疏的三维点转换为详细的逼真模型。该方法能够优化高斯分布与输入图像的对齐,从而最小化光度误差,非常适合用于创建高度逼真的环境。此外,将重建后的模型集成到基于 Unity 的虚拟现实系统中...

访问受限。请登录或开始试用以查看此内容。

披露

作者声明,他们不存在任何已知的相互竞争的经济利益或可能被认为影响本文所报告工作的个人关系。

致谢

本文由 MICIU/AEI/10.13039/501100011033 资助,项目编号为 PID2022-138453OB-I00,并由欧洲区域发展基金(ERDF)“欧洲发展之路”计划支持。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
GPU NVIDIA GeForce RTX 2080NVIDIATU104-400A用于图像处理与重建的设备 
Insta360 X4Insta360CINSABMA-H用于重建的数据采集设备
Meta Quest IIIMeta899-00582-01用于可视化和交互式查看重建结果的设备
存储卡 Evo Plus 128 GBSamsungMB-MC128KA/EU用于360°照片存储的存储卡

参考文献

  1. Zollmann, S., et al. Augmented Reality for Construction Site Monitoring and Documentation. Proceedings IEEE. 102 (2), 137-154 (2012).
  2. Zhou, L., Wu, G., Zuo, Y., Chen, X., Hu, H. A comprehensive review of vision-based 3d reconstruction methods. Sensors. 24 (7), 2314(2024).
  3. Structure-from-motion revisited. Schonberger, J. L., Frahm, J. M. IEEE Conf Comp Vis Pattern Recog, , 4104-4113 (2016).
  4. Kerbl, B., Kopanas, G., Leimkühler, T., Drettakis, G. 3d gaussian splatting for real-time radiance field rendering. ACM Trans. Graph. 42 (4), 139-141 (2023).
  5. Embedding large language models into extended reality: Opportunities and challenges for inclusion, engagement, and privacy. Bozkir, E., et al. Proc 6th ACM Conf Conversat User Interf, , 1-7 (2024).
  6. Remondino, F., El-Hakim, S. Image-based 3D modelling: A review. Photogrammet Record. 21 (115), 269-291 (2006).
  7. Özyeşil, O., Voroninski, V., Basri, R., Singer, A. A survey of structure from motion. Acta Numerica. 26, 305-364 (2017).
  8. Structure from motion using full spherical panoramic cameras. Pagani, A., Stricker, D. IEEE Int Conf Comp Vision Workshops, , 375-382 (2011).
  9. Dalal, A., Hagen, D., Robbersmyr, K. G., Knausgård, K. M. Gaussian Splatting: 3D Reconstruction and Novel View Synthesis: A Review. IEEE Access. 12, 96797-96820 (2024).
  10. Zhang, M., Ding, H., Naumceska, M., Zhang, Y. Virtual Reality Technology as an Educational and Intervention Tool for Children with Autism Spectrum Disorder: Current Perspectives and Future Directions. Behav Sci. 12 (5), 138(2023).
  11. Failla, C., et al. Virtual reality for autism: unlocking learning and growth. Front Psychol. 15, 1417717(2024).
  12. Huang, B., Yu, Z., Chen, A., Geiger, A., Gao, S. 2D Gaussian Splatting for Geometrically Accurate Radiance. arXiv. , (2024).
  13. Zhang, Y., et al. Evaluating Human Perception of Novel View Synthesis: Subjective Quality Assessment of Gaussian Splatting and NeRF in Dynamic Scenes. arXiv. , (2025).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

360 COLMAP Unity