Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł metodologiczny

Fotorealistyczne poznane krajobrazy dla rzeczywistości rozszerzonej

1K wyświetleń

DOI:

10.3791/68386

27 czerwca 2025

* These authors contributed equally

W tym artykule

Podsumowanie

W artykule przedstawiono system do fotorealistycznej rekonstrukcji 3D z wykorzystaniem obrazów 360 stopni, Splattingu Gaussa i integracji z rzeczywistością wirtualną. Podejście to można zastosować do różnych zastosowań, takich jak edukacja, symulacja środowisk uczenia się; budownictwo, w celu symulacji prac poza placem budowy i pobierania metryk; lub opieki zdrowotnej, aby szkolić osoby z autyzmem w codziennych zadaniach.

Streszczenie

Możliwość tworzenia fotorealistycznych rekonstrukcji 3D rzeczywistych środowisk ze standardowych kolorowych obrazów ma wiele zastosowań w takich dziedzinach jak opieka zdrowotna, edukacja i przemysł. W tym artykule przedstawiono nowatorski system, który integruje zaawansowane techniki, takie jak struktura na podstawie ruchu, przyrostowa rejestracja sceny i Splatting Gaussa w celu rekonstrukcji szczegółowych modeli 3D. Modele te są płynnie zintegrowane ze środowiskami rzeczywistości wirtualnej, aby umożliwić wciągającą interakcję. Proces produkcyjny rozpoczyna się od przechwytywania obrazów 360 stopni przy użyciu wzorca opartego na matrycy w celu uzyskania kompleksowego pokrycia. Obrazy są przetwarzane przy użyciu COLMAP w celu oszacowania ułożenia kamery i wygenerowania rzadkiej chmury punktów. Splatting Gaussowski udoskonala rekonstrukcję, optymalizując położenie, kształty i wygląd punktów, aby uzyskać wysoce realistyczne środowiska 3D. Modele te są następnie renderowane w środowisku Unity, co umożliwia interakcję za pomocą zestawów słuchawkowych VR i obsługuje dodatkowe funkcje, takie jak awatary obsługiwane przez duże modele językowe. Jeden przypadek użycia pokazuje wszechstronność systemu. W opiece zdrowotnej podejście to tworzy kontrolowane, znajome wirtualne przestrzenie do terapii, szczególnie korzystne dla osób z zaburzeniami ze spektrum autyzmu. Wciągające środowiska i interaktywne awatary zapewniają bezpieczne i wygodne środowisko do spersonalizowanej terapii. System ten oferuje znaczące korzyści, w tym wysoką wierność wizualną, łatwość pozyskiwania obrazu i wciągające wrażenia użytkownika. Pozostają jednak wyzwania, takie jak koszt obliczeniowy rozpylania Gaussa i jego zależność od dokładnego szacowania pozycji kamery. Pokonując te ograniczenia, metoda ta ma potencjał do przekształcenia zastosowań w różnych dziedzinach, począwszy od interwencji terapeutycznych, a skończywszy na wzornictwie przemysłowym i ochronie kultury.

Wprowadzenie

Zdolność do odtwarzania i interakcji z trójwymiarowymi krajobrazami stała się kluczowa w wielu różnych obszarach zastosowań nowoczesnych technologii. Tradycyjne techniki tworzenia wirtualnych reprezentacji rzeczywistych lokalizacji opierają się czasem na pracochłonnych, sztywnych modelach i pomiarach manualnych1. Zaawansowane techniki komputerowego rozpoznawania obrazu pojawiły się jako możliwe do zastosowania opcje automatycznej rekonstrukcji 3D i interakcji w celu przezwyciężenia tych ograniczeń2.

Istotnym elementem tego postępu jest opracowanie złożonych modeli 3D na podstawie zdjęć 360 stopni. Dokładne informacje przestrzenne można uzyskać poprzez precyzyjne określenie obszarów, w których wykonano zdjęcia, z wykorzystaniem nowoczesnych narzędzi, takich jak COLMAP3. Proces ten jest dodatkowo usprawniany przez technikę Gaussian Splatting4, która umożliwia odtworzenie skomplikowanych otoczeń w 3D przy zachowaniu wysokiej jakości.

Wprowadzenie tych modeli 3D do systemów wirtualnej rzeczywistości (VR) otwiera nowe możliwości eksploracji i interakcji wykraczające poza samą rekonstrukcję. Aby zwiększyć zaangażowanie, użytkownicy mogą mierzyć obiekty świata rzeczywistego, takie jak drzwi i stoły, poruszać się w przestrzeni wirtualnej, a nawet dodawać obiekty cyfrowe i awatary. Awatary te mogą generować dynamiczne i interaktywne odpowiedzi przy użyciu dużych modeli językowych (LLM), co przekłada się na immersyjne doświadczenia5.

Niniejsza praca przedstawia metodologię tworzenia trójwymiarowych reprezentacji rzeczywistego środowiska przy użyciu zwykłych obrazów kolorowych oraz ich wyświetlania w środowisku rzeczywistości wirtualnej. System opiera się na ogólnych potokach przetwarzania structure-from-motion oraz Gaussian splatting. System ten nadaje się do tworzenia dalszych aplikacji w budownictwie lub opiece zdrowotnej.

Zaproponowany schemat pozwala na generowanie wizualnie realistycznych i atrakcyjnych trójwymiarowych reprezentacji rzeczywistych środowisk, co stanowi jego główną zaletę. Ponadto wykorzystuje on obrazy kolorowe, które są znacznie wygodniejsze w porównaniu z innymi podejściami wymagającymi kosztownych sensorów, takich jak LiDAR-y czy kamery światła strukturalnego6. Uzasadnieniem dla niniejszej propozycji jest fakt, że możliwość łatwego tworzenia atrakcyjnych wizualnie reprezentacji trójwymiarowych znajduje wiele zastosowań. Może być ona wykorzystywana w budownictwie do kontroli jakości, w ochronie zdrowia do terapii osób z autyzmem w znanym i kontrolowanym środowisku, a także w rozrywce w celu włączenia dokładnej reprezentacji rzeczywistej lokalizacji do gry wideo.

Rozwój systemów do rekonstrukcji 3D i interakcji z wirtualnymi środowiskami znacząco postąpił w ostatnich latach, napędzany integracją wizji komputerowej, uczenia maszynowego oraz technologii wirtualnej rzeczywistości2. Kluczowe komponenty i metodologie istotne dla niniejszej pracy zostały przedstawione poniżej.

Dokładna rekonstrukcja 3D opiera się na przetwarzaniu obrazów w celu wyodrębnienia informacji przestrzennych i geometrycznych. Tradycyjne metody, takie jak Structure from Motion (SfM)7 oraz Multi-View Stereo (MVS)8, są powszechnie stosowane do szacowania pozycji kamery i generowania gęstych chmur punktów. Narzędzia takie jak COLMAP są cenione za niezawodność w wykonywaniu tych zadań, łącząc SfM i MVS w celu tworzenia wysoce precyzyjnych modeli 3D z zestawów obrazów. Niemniej jednak wciąż istnieją ograniczenia w przypadku złożonego oświetlenia, tekstur oraz środowisk o wysokiej dynamice.

Ostatnie osiągnięcia obejmują metodę Gaussian Splatting9, która wykorzystuje reprezentację opartą na punktach do tworzenia fotorealistycznych rekonstrukcji z większą wydajnością niż tradycyjne metody oparte na siatkach. Gaussian Splatting umożliwia płynniejszą wizualizację i dokładniejszą reprezentację przestrzenną, szczególnie w scenach o dużym stopniu szczegółowości.

Po zrekonstruowaniu modeli 3D kluczowe dla imersyjnej interakcji jest przekształcenie ich w formaty kompatybilne z VR. Zastosowanie systemów VR rozszerzyło się poza rozrywkę na takie obszary jak edukacja, opieka zdrowotna10 oraz projektowanie przemysłowe. Nowoczesne środowiska VR umożliwiają płynną nawigację, interakcję z obiektami cyfrowymi oraz zwiększony realizm, co czyni je odpowiednimi do zastosowań wymagających wysokiego zaangażowania użytkownika.

Integracja funkcji interaktywnych, takich jak obiekty wirtualne i awatary, znacząco zwiększa funkcjonalność i głębię systemów rzeczywistości wirtualnej (VR). Awatary oparte na dużych modelach językowych (LLM) ułatwiają realistyczne interakcje konwersacyjne, umożliwiając dynamiczne i adaptacyjne doświadczenia użytkownika. W szczególności technologie te wykazały potencjał w kontekstach terapeutycznych, umożliwiając dostosowanie interakcji do zachowania lub stanu emocjonalnego użytkownika. Na przykład, w tej pracy11 opracowano aplikację VR wykorzystującą awatary jako chatboty oparte na LLM w celu szkolenia osób z autyzmem w zakresie zawodowych umiejętności komunikacyjnych, co podkreśla zdolność adaptacyjną awatarów sterowanych przez LLM w terapii. Ponadto modele LLM zostały zaimplementowane w środowiskach rzeczywistości rozszerzonej, aby promować inkluzywność i zaangażowanie, co dodatkowo potwierdza potencjał terapeutyczny awatarów opartych na LLM.

Środowiska wirtualne są coraz częściej wykorzystywane w ustawieniach terapeutycznych, szczególnie w przypadku osób z zaburzeniami spektrum autyzmu (ASD). Badania wykazują, że znane i kontrolowane przestrzenie wirtualne mogą zmniejszać lęk i zwiększać zaangażowanie podczas sesji terapeutycznych11. Awatary w tych środowiskach mogą pełnić rolę facylitatorów, prowadząc terapię w sposób, który jest dla pacjenta bezpieczny i dostępny.

Mimo postępów nadal istnieją wyzwania, w tym koszt obliczeniowy rekonstrukcji 3D, utrzymanie wysokiej wierności w środowiskach wirtualnych oraz zapewnienie płynnej integracji między systemami. Jednak ciągły rozwój bardziej wydajnych algorytmów i sprzętu, a także postępy w narzędziach opartych na sztucznej inteligencji, stwarzają możliwości dalszych innowacji w tej dziedzinie. Niniejsza praca przedstawia nowatorski system rekonstrukcji 3D i interakcji ze środowiskami wirtualnymi z wykorzystaniem obrazów 360 stopni. Podejście to integruje techniki takie jak lokalizacja obrazów przy użyciu COLMAP, wysokiej jakości rekonstrukcja z wykorzystaniem Gaussian splatting oraz kompatybilność z VR w celu imersyjnej eksploracji. Poprzez włączenie obiektów cyfrowych i interaktywnych awatarów zasilanych przez LLM, system umożliwia zastosowania w spersonalizowanej terapii osób z ASD oraz w weryfikacji projektów budowlanych. Narzędzia te stanowią kompleksowe ramy do tworzenia adaptacyjnych środowisk wirtualnych, które usprawniają zarówno praktyki terapeutyczne, jak i przemysłowe. Rycina 1 przedstawia proponowany schemat procesu.

figure-introduction-1
Rysunek 1: Schemat systemu. Diagram proponowanego procesu fotorealistycznej rekonstrukcji środowiska, składający się z rzeczywistego otoczenia, obrazów 360°, uzyskanych projekcji, procesu SfM, procesu Gaussian Splatting oraz integracji z wirtualną rzeczywistością. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

1. Rejestracja obrazu

  1. Umieść kamerę 360° na statywie z regulowaną wysokością. Wyznacz serię pozycji w środowisku przeznaczonym do skanowania, stosując wzór siatki kwadratowej, w której krawędzie są oddalone od siebie o 1,5 m.
  2. Wykonaj zdjęcia na trzech różnych wysokościach w każdym wybranym punkcie siatki: około 0,4 m, 1,2 m i 2 m.
  3. Konwertuj obrazy 360° na obrazy w formacie równiktraktangularnym. W tym celu można wykorzystać np. aplikację Insta360. Wybierz Image, naciśnij przycisk Export, wybierz tryb Export 360 photo i wyeksportuj obraz w proporcjach 2:1.
  4. Wyodrębnij z każdego obrazu równiktraktangularnego obrazy perspektywiczne w formacie 16:9 z poziomym polem widzenia 90°. Dla wszystkich obrazów zastosuj następujące kąty poziome: 0, 45, 90, 135, 180, 225, 270, 315. Dla zdjęć wykonanych na wysokości 0,4 m zastosuj kąty pionowe 0 i 50. Dla zdjęć wykonanych na wysokości 1,2 m zastosuj kąty pionowe -50, 0 i 50. Dla zdjęć wykonanych na wysokości 2 m zastosuj kąty pionowe -50 i 0. W procesie ekstrakcji wykorzystaj skrypt Pythona Equi2Pers.py (Supplementary Coding File 1; Figure 2).

figure-protocol-1
Rysunek 2: Obrazy równikierunkowe do projekcji. Schemat konwersji obrazu równikierunkowego na projekcję mapy sześcianu (cube-map). Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

2. Estymacja pozy kamery za pomocą COLMAP

  1. Utwórz nowy projekt w programie COLMAP, klikając File > New Project, następnie określ ścieżkę do obrazów i utwórz nową bazę danych.
  2. Wyodrębnij cechy dla każdego obrazu, klikając Processing > Feature Extraction, wybierając PINHOLE jako model kamery oraz opcję współdzielenia dla wszystkich obrazów. Pozostałe parametry pozostaw domyślne. W obszarach o dużej teksturze wartość max_num_features można zmniejszyć w celu zwiększenia wydajności metody.
  3. Wykonaj dopasowanie cech, klikając Processing > Feature Matching, korzystając z parametrów domyślnych.
  4. Oblicz SfM, klikając Reconstruction > Start Reconstruction, aby uzyskać pozycje i orientacje kamer, korzystając z domyślnych parametrów COLMAP.
  5. Zminimalizuj błędy reprojekcji za pomocą wiązkowej korekty (bundle adjustment), klikając Reconstruction > Bundle Adjustment.
  6. Wygeneruj gęstą reprezentację 3D sceny, klikając Reconstruction > Dense Reconstruction; wyniki obejmują pozy kamer oraz zrekonstruowane punkty.

3. Fotorealistyczna rekonstrukcja sceny 3D przy użyciu splatowania gaussowskiego (GS)

  1. Uruchom plik train.py z parametrami -s, -m i -r, gdzie -s określa ścieżkę do projektu COLMAP, -m definiuje ścieżkę wyjściową dla Gaussian Splatting (jeśli nie zostanie określona, zostanie wygenerowana ścieżka domyślna), a -r zmienia skalę obrazów, zazwyczaj w zakresie od 2 do 4.
    UWAGA: Plik train.py znajduje się w oficjalnym repozytorium Gaussian Splatting https://github.com/graphdeco-inria/gaussian-splatting.
  2. Zlokalizuj plik .ply wygenerowany przez Gaussian Splatting w ścieżce wyjściowej, aby móc go później wykorzystać w Unity.

4. Renderowanie w rzeczywistości wirtualnej z wykorzystaniem Unity i Gaussian splattingu

  1. Podłącz gogle VR do komputera. Metoda połączenia zależy od używanego modelu gogli VR.
  2. Użyj Unity Hub do utworzenia projektu 3D w wersji 2022.3.44f1. W razie potrzeby zainstaluj wersję Unity 2022.3.44f1. Przejdź do Projects > New Project, wybierz wersję 2022.3.44f1 oraz szablon 3D (Core), ustaw nazwę i lokalizację projektu, a następnie kliknij Create Project , aby wygenerować go z domyślnymi ustawieniami.
  3. Zainstaluj wtyczkę do zarządzania goglami VR i uproszczenia tworzenia aplikacji, obejmującą zadania takie jak dostęp do dżojstika i śledzenie wzroku. Zrób to poprzez Unity Asset Store za pomocą Menedżera Pakietów, klikając Window > Package Manager.
  4. Użyj wtyczki UnityGaussianSplatting, aby wygenerować zasób z danych wyjściowych Gaussian Splatting. Zrób to poprzez Unity Asset Store za pomocą Menedżera Pakietów. Aby wygenerować ten zasób, przejdź do Tools > GaussianSplats > Create GaussianSplatAsset i wskaż plik .ply wygenerowany przez Gaussian Splatting.
  5. Użyj wtyczki UltraLeap, aby poprawić detekcję dłoni, co zwiększy interakcję użytkownika. Aby ją zainstalować, przejdź do Unity Asset Store > Package Manager i kliknij Window > Package Manager.
  6. Użyj wtyczki whisper.unity do transkrypcji dźwięku przechwyconego przez mikrofon gogli VR. Zainstaluj ją zgodnie z opisem w kroku 4.5.
  7. Użyj modelu LLM do generowania odpowiedzi. Zainstaluj wtyczkę LLMUnity, aby umożliwić korzystanie z tego LLM. Zainstaluj ją zgodnie z opisem w kroku 4.5.
    1. Utwórz pusty obiekt GameObject i dodaj skrypt LLM, a następnie kliknij przycisk download model , aby wybrać domyślny model. W przypadku postaci dodaj pusty obiekt i przypisz do niego skrypt LLMCharacter, w którym można określić imię i rolę.
  8. Użyj Meta - Voice SDK do generowania dźwięku z odpowiedzi wyprodukowanej przez LLM. Aby to osiągnąć, zainstaluj wtyczkę Text-to-Speech poprzez Unity Asset Store za pomocą Menedżera Pakietów, klikając Window > Package Manager.
  9. Użyj gogli VR, aby umożliwić immersyjną interakcję.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

W tej sekcji omówiono reprezentatywne wyniki, mocne strony oraz ograniczenia proponowanego procesu. Wyniki zastosowania proponowanej metody przedstawiają się następująco. Rycina 3 przedstawia pozycję kamery (na czerwono) oraz gęstą chmurę punktów. Grupy kamer o wspólnych punktach początkowych reprezentują projekcje z tego samego obrazu równikaptagularnego.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

W badaniu przedstawiono nowatorską metodologię fotorealistycznej rekonstrukcji 3D i interakcji ze środowiskiem wirtualnym przy użyciu obrazów 360 stopni i zaawansowanych technik renderowania. Poniżej omówiono kluczowe kroki, wyzwania i implikacje proponowanego systemu.

Kroki krytyczne
Jednym z kluczowych kroków w proponowanym procesie jest przechwytywanie obrazu. Korzystając z kamery 360 stopni umieszczonej na różnych wysokościach i w różnych lokalizacjach, generowany jes...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy oświadczają, że nie są im znane żadne konkurencyjne interesy finansowe ani powiązania osobiste, które mogłyby mieć wpływ na pracę opisaną w tym artykule.

Podziękowania

Niniejszy artykuł jest częścią grantu PID2022-138453OB-I00 finansowanego przez MICIU/AEI/ 10.13039/501100011033 oraz przez EFRR A way of making Europe.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Karty graficzne: NVIDIA GeForce RTX 2080Technologia NVIDIATU104-400AUrządzenie do przetwarzania i rekonstrukcji obrazu 
Insta360 X4Insta360 powiedział:CINSABMA-HUrządzenie do akwizycji danych do rekonstrukcji
Meta Quest IIIMeta899-00582-01Urządzenie do wizualizacji i interakcji z rekonstrukcją
Karta pamięci Evo Plus 128 GBFirma SamsungMB-MC128KA/UEkarta pamięci do 360° Przechowywanie zdjęć

Bibliografia

  1. Zollmann, S., et al. Augmented Reality for Construction Site Monitoring and Documentation. Proceedings IEEE. 102 (2), 137-154 (2012).
  2. Zhou, L., Wu, G., Zuo, Y., Chen, X., Hu, H. A comprehensive review of vision-based 3d reconstruction methods. Sensors. 24 (7), 2314(2024).
  3. Structure-from-motion revisited. Schonberger, J. L., Frahm, J. M. IEEE Conf Comp Vis Pattern Recog, , 4104-4113 (2016).
  4. Kerbl, B., Kopanas, G., Leimkühler, T., Drettakis, G. 3d gaussian splatting for real-time radiance field rendering. ACM Trans. Graph. 42 (4), 139-141 (2023).
  5. Embedding large language models into extended reality: Opportunities and challenges for inclusion, engagement, and privacy. Bozkir, E., et al. Proc 6th ACM Conf Conversat User Interf, , 1-7 (2024).
  6. Remondino, F., El-Hakim, S. Image-based 3D modelling: A review. Photogrammet Record. 21 (115), 269-291 (2006).
  7. Özyeşil, O., Voroninski, V., Basri, R., Singer, A. A survey of structure from motion. Acta Numerica. 26, 305-364 (2017).
  8. Structure from motion using full spherical panoramic cameras. Pagani, A., Stricker, D. IEEE Int Conf Comp Vision Workshops, , 375-382 (2011).
  9. Dalal, A., Hagen, D., Robbersmyr, K. G., Knausgård, K. M. Gaussian Splatting: 3D Reconstruction and Novel View Synthesis: A Review. IEEE Access. 12, 96797-96820 (2024).
  10. Zhang, M., Ding, H., Naumceska, M., Zhang, Y. Virtual Reality Technology as an Educational and Intervention Tool for Children with Autism Spectrum Disorder: Current Perspectives and Future Directions. Behav Sci. 12 (5), 138(2023).
  11. Failla, C., et al. Virtual reality for autism: unlocking learning and growth. Front Psychol. 15, 1417717(2024).
  12. Huang, B., Yu, Z., Chen, A., Geiger, A., Gao, S. 2D Gaussian Splatting for Geometrically Accurate Radiance. arXiv. , (2024).
  13. Zhang, Y., et al. Evaluating Human Perception of Novel View Synthesis: Subjective Quality Assessment of Gaussian Splatting and NeRF in Dynamic Scenes. arXiv. , (2025).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

Fotorealistyczna rekonstrukcja 3DGaussian SplattingStructure From Motionrodowiska rzeczywisto ci wirtualnejobrazowanie 360 stopnichmura punkt w COLMAPestymacja pozy kameryg sta rekonstrukcja scenyintegracja z Unityterapia imersyjna