Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Методическая статья

Фотореалистичные изученные пейзажи для дополненной реальности

1K просмотров

DOI:

10.3791/68386

27 июня 2025 г.

* These authors contributed equally

В этой статье

Краткое содержание

В данной статье представлена система фотореалистичной 3D-реконструкции с использованием 360-градусных изображений, гауссова сплаттинга и интеграции виртуальной реальности. Этот подход может быть применен к различным приложениям, таким как образование, моделирование учебной среды; строительство, для моделирования работ за пределами площадки и получения метрик; или здравоохранение, чтобы обучить аутичных людей повседневным задачам.

Аннотация

Возможность создания фотореалистичных 3D-реконструкций реального мира на основе стандартных цветных изображений имеет множество применений в таких областях, как здравоохранение, образование и промышленность. В этой статье представлена новая система, которая объединяет передовые методы, такие как структура из движения, инкрементальная регистрация сцены и гауссово сплаттинг для реконструкции детализированных 3D-моделей. Эти модели легко интегрируются в среды виртуальной реальности для обеспечения иммерсивного взаимодействия. Конвейер начинается с получения 360-градусных изображений с использованием матричного шаблона для всестороннего охвата. Изображения обрабатываются с помощью COLMAP для оценки положения камеры и создания разреженного облака точек. Гауссов сплаттинг уточняет реконструкцию, оптимизируя положение, формы и внешний вид точек для создания высокореалистичных 3D-сред. Затем эти модели визуализируются в Unity, что позволяет взаимодействовать с гарнитурами виртуальной реальности и поддерживает дополнительные функции, такие как аватары, управляемые большими языковыми моделями. Один из вариантов использования демонстрирует универсальность системы. В здравоохранении этот подход создает контролируемые, знакомые виртуальные пространства для терапии, особенно полезные для людей с расстройствами аутистического спектра. Иммерсивная среда и интерактивные аватары обеспечивают безопасную и комфортную среду для персонализированной терапии. Эта система обладает значительными преимуществами, включая высокую визуальную точность, простоту получения изображений и захватывающий пользовательский опыт. Тем не менее, остаются проблемы, такие как вычислительные затраты гауссова сплаттинга и его зависимость от точной оценки положения камеры. Преодолевая эти ограничения, этот метод может трансформировать приложения в различных областях, начиная от терапевтических вмешательств и заканчивая промышленным дизайном и сохранением культуры.

Введение

Возможность воссоздания и взаимодействия с 3D-ландшафтами стала критически важной во многих различных областях применения современных технологий. Традиционные методы создания виртуальных представлений реальных мест иногда опираются на трудоемкие, жесткие модели и ручные измерения1. Передовые методы компьютерного зрения стали жизнеспособными вариантами автоматизированной 3D-реконструкции и взаимодействия с целью преодоления этих ограничений.

Разработка сложных 3D-моделей на основе 360-градусных фотографий является заметной особенностью этого прогресса. Точную пространственную информацию можно получить, точно определив районы, в которых были сделаны фотографии, с помощью современных инструментов, таких как COLMAP3. Этот процесс еще больше улучшен с помощью Gaussian Splatting4, который позволяет воссоздавать сложные настройки в 3D с хорошим качеством.

Включение этих 3D-моделей в системы виртуальной реальности (VR) открывает новые возможности для исследований и взаимодействия, выходящих за рамки реконструкции. Чтобы повысить вовлеченность, пользователи могут измерять объекты реального мира, такие как двери и столы, перемещаться по виртуальному пространству и даже добавлять цифровые объекты и аватары. Эти аватары могут создавать динамические и интерактивные ответы с помощью больших языковых моделей (LLM), что приводит к иммерсивному опыту5.

В этой работе представлена методология создания трехмерных представлений реальной среды с использованием обычных цветных изображений и отображения их в виртуальной реальности. Система опирается на универсальные трубопроводы «структура из движения» и гауссовы трубопроводы. Система подходит для создания дальнейших приложений в строительстве или здравоохранении.

Предлагаемый конвейер позволяет создавать визуально реалистичные и привлекательные трехмерные представления реальных сред, что является его главным преимуществом. Кроме того, он использует цветные изображения, которые очень удобны по сравнению с другими подходами, требующими дорогостоящих сенсоров, таких как лидарыили камеры со структурированным светом. Обоснование этого предложения заключается в том, что возможность легко создавать визуально привлекательные трехмерные представления имеет множество применений. Он может быть использован в строительстве для контроля качества, в здравоохранении для лечения аутичных людей в известной и контролируемой среде или в развлечениях для точного представления реального места в видеоигре.

В последние годы значительно продвинулась разработка систем для 3D-реконструкции и взаимодействия с виртуальными средами, что обусловлено интеграцией технологий компьютерного зрения, машинного обучения и виртуальной реальности2. Ключевые компоненты и методологии, имеющие отношение к этой работе, изложены ниже.

Точная 3D-реконструкция основана на обработке изображений для извлечения пространственной и геометрической информации. Традиционные методы, такие как Structure from Motion (SfM)7 и Multi-View Stereo (MVS)8 , широко используются для оценки положения камеры и создания плотных облаков точек. Такие инструменты, как COLMAP, известны своей надежностью в выполнении этих задач, сочетая SfM и MVS для создания высокоточных 3D-моделей на основе наборов данных изображений. Тем не менее, остаются ограничения при работе со сложным освещением, текстурами и высокодинамичными средами.

К последним достижениям относится Gaussian Splatting9, который использует точечное представление для создания фотореалистичных реконструкций с большей эффективностью, чем традиционные методы на основе сетки. Гауссово сплаттинг обеспечивает более плавную визуализацию и более точное пространственное представление, особенно в сценах со сложными деталями.

После реконструкции 3D-моделей их преобразование в VR-совместимые форматы имеет решающее значение для иммерсивного взаимодействия. Использование систем виртуальной реальности вышло за рамки развлечений и затронуло такиеобласти, как образование, здравоохранение и промышленный дизайн. Современные VR-фреймворки обеспечивают бесшовную навигацию, взаимодействие с цифровыми объектами и повышенный реализм, что делает их подходящими для приложений, требующих высокой вовлеченности пользователей.

Интеграция интерактивных функций, таких как виртуальные объекты и аватары, значительно расширяет функциональность и глубину систем виртуальной реальности (VR). Аватары на базе больших языковых моделей (LLM) обеспечивают реалистичное диалоговое взаимодействие, обеспечивая динамичный и адаптивный пользовательский опыт. В частности, эти технологии показали потенциал в терапевтических контекстах, позволяя адаптировать взаимодействия на основе поведения или эмоционального состояния пользователя. Например, в этом исследовании11 было разработано приложение виртуальной реальности с использованием аватаров в качестве чат-ботов на базе LLM для обучения аутичных людей профессиональным навыкам общения, подчеркивая адаптивность аватаров с поддержкой LLM в терапии. Кроме того, LLM были встроены в среды дополненной реальности для продвижения инклюзивности и вовлеченности, что еще больше поддерживает терапевтический потенциал аватаров, управляемых LLM.

Виртуальная среда все чаще используется в терапевтических условиях, особенно для людей с расстройствами аутистического спектра (РАС). Исследования показывают, что знакомые и контролируемые виртуальные пространства могут снизить тревожность и повысить вовлеченность во время сеансовтерапии. Аватары в этих средах могут выступать в качестве фасилитаторов, проводя терапию таким образом, чтобы пациент чувствовал себя безопасным и доступным.

Несмотря на достигнутый прогресс, сохраняются проблемы, в том числе связанные с вычислительными затратами на 3D-реконструкцию, поддержанием высокой точности в виртуальных средах и обеспечением плавной интеграции между системами. Тем не менее, продолжающаяся разработка более эффективных алгоритмов и оборудования, а также достижения в области инструментов на основе искусственного интеллекта открывают возможности для дальнейших инноваций в этой области. В данной работе представлена новая система для 3D-реконструкции и взаимодействия с виртуальными средами с использованием 360-градусных изображений. Этот подход объединяет такие методы, как локализация изображений с помощью COLMAP, высококачественная реконструкция с использованием гауссова сплаттинга и совместимость с виртуальной реальностью для иммерсивного исследования. Объединяя цифровые объекты и интерактивные аватары на базе LLM, система позволяет применять их в персонализированной терапии для людей с РАС и верификации строительных проектов. Эти инструменты обеспечивают комплексную основу для создания адаптивных виртуальных сред, которые улучшают как терапевтические, так и промышленные практики. На рисунке 1 показан конвейер предложений.

figure-introduction-1
Рисунок 1: Конвейер системы. Схема предлагаемого конвейера фотореалистичной реконструкции окружающей среды, состоящей из реальной окружающей среды, изображений на 360°, полученных проекций, процесса SfM, процесса Гауссова сплаттинга и интеграции с виртуальной реальностью. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

1. Захват изображения

  1. Поместите камеру на 360° на штатив с регулируемой высотой. Выберите ряд позиций в сканируемой среде в соответствии с квадратной сеткой, где каждая кромка расположена на расстоянии 1,5 м друг от друга.
  2. Захватывайте изображения на трех разных высотах в каждой выбранной точке сетки: примерно 0,4 м, 1,2 м и 2 м.
  3. Преобразуйте изображения на 360° в изображения равноугольного формата. Например, используйте приложение Ista360. Выберите изображение, нажмите кнопку «Экспорт », выберите режим «Экспорт фото 360 » и экспортируйте его как изображение с соотношением сторон 2:1.
  4. Извлекайте перспективные изображения в формате 16:9 из каждого равнопрямоугольного изображения с горизонтальным углом обзора 90°. Используйте следующие горизонтальные углы для всех изображений: 0, 45, 90, 135, 180, 225, 270, 315. Для изображений, сделанных на высоте 0,4 м, используйте вертикальные углы 0, 50. Для снимков, сделанных на высоте 1,2 м, используйте вертикальные углы -50, 0, 50. Для снимков, сделанных на высоте 2 м, используйте вертикальные углы -50, 0. Для процесса извлечения используйте Equi2Pers.py скрипт Python (Supplementary Coding File 1; Рисунок 2).

figure-protocol-1
Рисунок 2: Равноугольные изображения в проекциях. Диаграмма преобразования равнопрямоугольного изображения в проекцию кубической карты. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

2. Оценка положения камеры с помощью COLMAP

  1. Создайте новый проект COLMAP, нажав «Файл» > «Новый проект», затем укажите путь к изображениям и создайте новую базу данных.
  2. Чтобы извлечь элементы для каждого изображения, нажмите «Обработка» > «Извлечение признаков», выберите PINHOLE в качестве модели камеры и поделитесь ими для всех изображений. Остальные параметры оставьте по умолчанию. В областях с большим количеством текстуры max_num_features можно уменьшить, чтобы повысить эффективность метода.
  3. Выполните сопоставление объектов, щелкнув Обработка > Сопоставление объектов, используя параметры по умолчанию.
  4. Рассчитайте SfM, щелкнув Реконструкция > Начать реконструкцию , чтобы получить положения и ориентацию камеры, используя параметры COLMAP по умолчанию.
  5. Сведите к минимуму ошибки репроекции с помощью уравнивания жгута, щелкнув Реконструкция > Уравнивание жгута.
  6. Создайте плотное 3D-представление сцены, щелкнув Реконструкция > Плотная реконструкция, с выходными данными, включая позы камеры и реконструированные точки.

3. Фотореалистичная 3D реконструкция сцены с использованием гауссова сплаттинга (GS)

  1. Запустите файл train.py с параметрами -s, -m и -r, где -s указывает путь к проекту COLMAP, -m определяет выходной путь для Gaussian Splatting (если не указан, генерируется путь по умолчанию), а -r изменяет масштаб изображений, обычно устанавливаемый от 2 до 4.
    ПРИМЕЧАНИЕ: Файл train.py находится в официальном репозитории Gaussian Splatting https://github.com/graphdeco-inria/gaussian-splatting.
  2. Найдите файл .ply, сгенерированный с помощью Gaussian Splatting, в выходном тракте для последующего использования в Unity.

4. Рендеринг в виртуальной реальности с помощью Unity и гауссова сплаттинга

  1. Подключите гарнитуру виртуальной реальности к компьютеру. Этот способ зависит от используемой VR-гарнитуры.
  2. Используйте Unity Hub для создания 3D-проекта с версией 2022.3.44f1. При необходимости установите Unity версии 2022.3.44f1. Перейдите в раздел «Проекты» > «Новый проект», выберите версию 2022.3.44f1 и шаблон 3D (Core), задайте имя и местоположение проекта, а затем нажмите «Создать проект », чтобы создать его с настройками по умолчанию.
  3. Установите плагин для управления VR-гарнитурой и упрощения разработки приложений, включая такие задачи, как доступ к джойстику и отслеживание взгляда. Сделайте это в Unity Asset Store с помощью Package Manager, нажав Window > Package Manager.
  4. Используйте подключаемый модуль UnityGaussianSplatting для создания актива из выходных данных Gaussian Splatting. Сделайте это через Unity Asset Store с помощью менеджера пакетов. Чтобы создать этот ресурс, перейдите в раздел Инструменты > GaussianSplats > Создать GaussianSplatAsset и предоставьте файл .ply, созданный Gaussian Splatting.
  5. Используйте плагин UltraLeap для улучшения распознавания рук, улучшая взаимодействие с пользователем. Чтобы установить его, перейдите в Unity Asset Store > Package Manager и нажмите Window > Package Manager.
  6. Используйте плагин whisper.unity для расшифровки звука, захваченного микрофоном гарнитуры виртуальной реальности. Установите его, как описано в шаге 4.5.
  7. Используйте модель LLM для генерации ответов. Установите плагин LLMUnity, чтобы включить использование этого LLM. Установите его, как описано в шаге 4.5.
    1. Создайте пустой GameObject и добавьте LLM-скрипт, затем нажмите на кнопку загрузки модели , чтобы выбрать модель по умолчанию. Для персонажей добавьте пустой объект и прикрепите к нему скрипт LLMCharacter, где можно указать имя и роль.
  8. Используйте Meta - Voice SDK для генерации звука на основе ответа, созданного LLM. Для этого установите плагин преобразования текста в речь через Unity Asset Store с помощью менеджера пакетов, нажав «Окно» > «Диспетчер пакетов».
  9. Используйте гарнитуры виртуальной реальности для иммерсивного взаимодействия.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

В этом разделе обсуждаются репрезентативные результаты, сильные стороны и ограничения предлагаемого конвейера. Результаты применения предложенного метода заключаются в следующем. На рисунке 3 показано положение камеры (выделено красным цветом) и плотное облако точек. Группы камер с общим происхождением представляют проекции из одного и того же равноугольного изображения.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

В этом исследовании представлена новая методология фотореалистичной 3D-реконструкции и взаимодействия с виртуальной средой с использованием 360-градусных изображений и передовых методов рендеринга. Ниже обсуждаются важнейшие шаги, проблемы и последствия предлагаемой системы.

Критические шаги
Одним из ключевых этапов предлагаемого конвейера является захват изображений. С помощью 360-градусной камеры, расположенной на разной высоте и в различ...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Авторы заявляют, что у них нет известных конкурирующих финансовых интересов или личных отношений, которые могли бы повлиять на работу, описанную в этой статье.

Благодарности

Эта статья является частью гранта PID2022-138453OB-I00, финансируемого MICIU/AEI/10.13039/501100011033 и ERDF A way of make Europe.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Графические процессоры NVIDIA GeForce RTX 2080НДВОТУ104-400АУстройство для обработки и реконструкции изображений 
Инста360 Х4Инста360ЦИНСАБМА-НУстройство сбора данных для реконструкции
Мета Квест IIIМета899-00582-01Устройство для визуализации и взаимодействия с реконструкцией
Карта памяти Evo Plus 128 ГБСамсунгMB-MC128KA/ЕСкарта памяти для 360° Хранение фотографий

Ссылки

  1. Zollmann, S., et al. Augmented Reality for Construction Site Monitoring and Documentation. Proceedings IEEE. 102 (2), 137-154 (2012).
  2. Zhou, L., Wu, G., Zuo, Y., Chen, X., Hu, H. A comprehensive review of vision-based 3d reconstruction methods. Sensors. 24 (7), 2314(2024).
  3. Structure-from-motion revisited. Schonberger, J. L., Frahm, J. M. IEEE Conf Comp Vis Pattern Recog, , 4104-4113 (2016).
  4. Kerbl, B., Kopanas, G., Leimkühler, T., Drettakis, G. 3d gaussian splatting for real-time radiance field rendering. ACM Trans. Graph. 42 (4), 139-141 (2023).
  5. Embedding large language models into extended reality: Opportunities and challenges for inclusion, engagement, and privacy. Bozkir, E., et al. Proc 6th ACM Conf Conversat User Interf, , 1-7 (2024).
  6. Remondino, F., El-Hakim, S. Image-based 3D modelling: A review. Photogrammet Record. 21 (115), 269-291 (2006).
  7. Özyeşil, O., Voroninski, V., Basri, R., Singer, A. A survey of structure from motion. Acta Numerica. 26, 305-364 (2017).
  8. Structure from motion using full spherical panoramic cameras. Pagani, A., Stricker, D. IEEE Int Conf Comp Vision Workshops, , 375-382 (2011).
  9. Dalal, A., Hagen, D., Robbersmyr, K. G., Knausgård, K. M. Gaussian Splatting: 3D Reconstruction and Novel View Synthesis: A Review. IEEE Access. 12, 96797-96820 (2024).
  10. Zhang, M., Ding, H., Naumceska, M., Zhang, Y. Virtual Reality Technology as an Educational and Intervention Tool for Children with Autism Spectrum Disorder: Current Perspectives and Future Directions. Behav Sci. 12 (5), 138(2023).
  11. Failla, C., et al. Virtual reality for autism: unlocking learning and growth. Front Psychol. 15, 1417717(2024).
  12. Huang, B., Yu, Z., Chen, A., Geiger, A., Gao, S. 2D Gaussian Splatting for Geometrically Accurate Radiance. arXiv. , (2024).
  13. Zhang, Y., et al. Evaluating Human Perception of Novel View Synthesis: Subjective Quality Assessment of Gaussian Splatting and NeRF in Dynamic Scenes. arXiv. , (2025).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

3DGaussian SplattingStructure From Motion360COLMAPUnity