Ein Abonnement von JoVE ist erforderlich, um diesen Inhalt anzuzeigen. Melden Sie sich an oder beginnen Sie noch heute mit einer kostenlosen Testphase.

Methodenartikel

Fotorealistische Lernlandschaften für Augmented Reality

1K Ansichten

DOI:

10.3791/68386

27. Juni 2025

* These authors contributed equally

In diesem Artikel

Zusammenfassung

In diesem Beitrag wird ein System für die fotorealistische 3D-Rekonstruktion unter Verwendung von 360-Grad-Bildern, Gaußscher Splatting und Virtual-Reality-Integration vorgestellt. Der Ansatz kann auf verschiedene Anwendungen angewendet werden, z. B. in der Bildung, bei der Simulation von Lernumgebungen; Bauwesen, um Arbeiten außerhalb der Baustellen zu simulieren und Metriken abzurufen; oder im Gesundheitswesen, um autistische Menschen in Aufgaben des täglichen Lebens zu schulen.

Zusammenfassung

Die Möglichkeit, fotorealistische 3D-Rekonstruktionen realer Umgebungen aus Standardfarbbildern zu erstellen, hat zahlreiche Anwendungen in Bereichen wie Gesundheitswesen, Bildung und Industrie. In diesem Artikel wird ein neuartiges System vorgestellt, das fortschrittliche Techniken wie Struktur aus Bewegung, inkrementelle Szenenregistrierung und Gaußsches Splatting integriert, um detaillierte 3D-Modelle zu rekonstruieren. Diese Modelle lassen sich nahtlos in Virtual-Reality-Umgebungen integrieren, um eine immersive Interaktion zu ermöglichen. Die Pipeline beginnt mit der Aufnahme von 360-Grad-Bildern unter Verwendung eines matrixbasierten Musters für eine umfassende Abdeckung. Die Bilder werden mit COLMAP verarbeitet, um Kameraposen zu schätzen und eine Punktwolke mit geringer Dichte zu erzeugen. Das Gaußsche Splatting verfeinert die Rekonstruktion, indem die Positionen, Formen und das Aussehen der Punkte optimiert werden, um hochrealistische 3D-Umgebungen zu erzeugen. Diese Modelle werden dann in Unity gerendert, was die Interaktion durch VR-Headsets ermöglicht und zusätzliche Funktionen wie Avatare unterstützt, die von großen Sprachmodellen gesteuert werden. Ein Anwendungsfall zeigt die Vielseitigkeit des Systems. Im Gesundheitswesen schafft der Ansatz kontrollierte, vertraute virtuelle Räume für die Therapie, was besonders für Menschen mit Autismus-Spektrum-Störungen von Vorteil ist. Die immersiven Umgebungen und interaktiven Avatare bieten eine sichere und komfortable Umgebung für eine personalisierte Therapie. Dieses System bietet erhebliche Vorteile, darunter eine hohe visuelle Wiedergabetreue, eine einfache Bildaufnahme und ein beeindruckendes Benutzererlebnis. Es bleiben jedoch Herausforderungen bestehen, wie z. B. der Rechenaufwand für Gaußsches Splatting und die Abhängigkeit von einer genauen Schätzung der Kamerapose. Durch die Überwindung dieser Einschränkungen hat diese Methode das Potenzial, Anwendungen in verschiedenen Bereichen zu verändern, die von therapeutischen Interventionen über Industriedesign bis hin zur Kulturerhaltung reichen.

Einleitung

Die Fähigkeit, 3D-Landschaften nachzubilden und mit ihnen zu interagieren, ist in vielen verschiedenen Bereichen moderner Technologieanwendungen von entscheidender Bedeutung geworden. Herkömmliche Techniken zur Erstellung virtueller Darstellungen realer Standorte beruhen manchmal auf arbeitsintensiven, starren Modellen und manuellen Messungen1. Fortschrittliche Computer-Vision-Techniken haben sich als praktikable Optionen für die automatisierte 3D-Rekonstruktion und -Interaktion herausgestellt, um diese Einschränkungen zu überwinden2.

Die Entwicklung komplexer 3D-Modelle aus 360-Grad-Fotografien ist ein bemerkenswertes Merkmal dieses Fortschritts. Genaue räumliche Informationen können erhalten werden, indem die genauen Bereiche, in denen die Fotos aufgenommen wurden, mit modernsten Werkzeugen wie COLMAP3 lokalisiert werden. Das Verfahren wird durch das Gaußsche Splatting4 weiter verbessert, mit dem komplizierte Einstellungen in 3D in guter Qualität nachgebildet werden können.

Die Integration dieser 3D-Modelle in Virtual-Reality-Systeme (VR) eröffnet neue Wege der Erkundung und des Engagements über die Rekonstruktion hinaus. Um das Engagement zu erhöhen, können Benutzer reale Objekte wie Türen und Tische messen, sich im virtuellen Raum bewegen und sogar digitale Objekte und Avatare hinzufügen. Diese Avatare können mithilfe von Large Language Models (LLMs) dynamische und interaktive Reaktionen hervorrufen, was zu immersiven Erlebnissen führt5.

In dieser Arbeit wird eine Methodik vorgestellt, um dreidimensionale Darstellungen einer realen Umgebung unter Verwendung normaler Farbbilder zu erstellen und diese in einem Virtual-Reality-Setup darzustellen. Das System basiert auf universellen Structure-from-Motion- und Gaußschen Splatting-Rohrleitungen. Das System eignet sich für die Schaffung weiterer Anwendungen im Bauwesen oder im Gesundheitswesen.

Die vorgeschlagene Pipeline erzeugt visuell realistische und ansprechende dreidimensionale Darstellungen realer Umgebungen, was ihr Hauptvorteil ist. Darüber hinaus werden Farbbilder verwendet, die im Vergleich zu anderen Ansätzen, die kostspielige Sensoren wie LiDARs oder Streifenlichtkameras erfordern, sehr praktisch sind6. Der Grundgedanke hinter dem Vorschlag ist, dass die Möglichkeit, auf einfache Weise visuell ansprechende dreidimensionale Darstellungen zu erstellen, viele Anwendungen hat. Es kann im Bauwesen zur Qualitätskontrolle, im Gesundheitswesen zur Behandlung autistischer Menschen in einer bekannten und kontrollierten Umgebung oder in der Unterhaltung verwendet werden, um eine genaue Darstellung eines realen Ortes in einem Videospiel zu ermöglichen.

Die Entwicklung von Systemen zur 3D-Rekonstruktion und Interaktion mit virtuellen Umgebungen hat in den letzten Jahren erhebliche Fortschritte gemacht, angetrieben durch die Integration von Computer Vision, maschinellem Lernen und Virtual-Reality-Technologien2. Die für diese Arbeit relevanten Schlüsselkomponenten und Methoden werden im Folgenden skizziert.

Eine genaue 3D-Rekonstruktion beruht auf der Bildverarbeitung, um räumliche und geometrische Informationen zu extrahieren. Herkömmliche Methoden wie Structure from Motion (SfM)7 und Multi-View Stereo (MVS)8 werden häufig verwendet, um Kameraposen zu schätzen und dichte Punktwolken zu erzeugen. Tools wie COLMAP sind für ihre Robustheit bei der Ausführung dieser Aufgaben bekannt und kombinieren SfM und MVS, um hochpräzise 3D-Modelle aus Bilddatensätzen zu erstellen. Es gibt jedoch Einschränkungen im Umgang mit komplexer Beleuchtung, Texturen und hochdynamischen Umgebungen.

Zu den jüngsten Fortschritten gehört das Gaußsche Splatting9, das eine punktbasierte Darstellung verwendet, um fotorealistische Rekonstruktionen mit größerer Effizienz als herkömmliche netzbasierte Methoden zu erstellen. Gaußsches Splatting ermöglicht eine flüssigere Visualisierung und eine genauere räumliche Darstellung, insbesondere in Szenen mit komplizierten Details.

Sobald die 3D-Modelle rekonstruiert sind, ist die Umwandlung in VR-kompatible Formate entscheidend für die immersive Interaktion. Der Einsatz von VR-Systemen hat sich über die Unterhaltung hinaus auf Bereiche wie Bildung, Gesundheitswesen10 und Industriedesign ausgeweitet. Moderne VR-Frameworks ermöglichen eine nahtlose Navigation, Interaktion mit digitalen Objekten und einen verbesserten Realismus, wodurch sie sich für Anwendungen eignen, die eine hohe Benutzerbeteiligung erfordern.

Die Integration von interaktiven Features wie virtuellen Objekten und Avataren erhöht die Funktionalität und Tiefe von Virtual Reality (VR)-Systemen erheblich. Avatare, die auf Large Language Models (LLMs) basieren, ermöglichen realistische Konversationsinteraktionen und ermöglichen dynamische und anpassungsfähige Benutzererlebnisse. Insbesondere in therapeutischen Kontexten haben diese Technologien Potenzial gezeigt, da sie maßgeschneiderte Interaktionen auf der Grundlage des Nutzerverhaltens oder des emotionalen Zustands ermöglichen. Zum Beispiel entwickelte diese Studie11 eine VR-Anwendung, die Avatare als Chatbots verwendet, um autistische Personen in beruflichen Kommunikationsfähigkeiten zu schulen, was die Anpassungsfähigkeit von LLM-gestützten Avataren in der Therapie hervorhebt. Darüber hinaus wurden LLMs in Augmented-Reality-Umgebungen eingebettet, um Inklusion und Engagement zu fördern und das therapeutische Potenzial von LLM-gesteuerten Avataren weiter zu unterstützen.

Virtuelle Umgebungen werden zunehmend in therapeutischen Umgebungen eingesetzt, insbesondere für Menschen mit Autismus-Spektrum-Störung (ASS). Studien zeigen, dass vertraute und kontrollierte virtuelle Räume Ängste abbauen und das Engagement während der Therapiesitzungen erhöhen können11. Avatare in diesen Umgebungen können als Vermittler fungieren und die Therapie auf eine Weise durchführen, die sich für den Patienten sicher und zugänglich anfühlt.

Trotz der Fortschritte gibt es nach wie vor Herausforderungen, darunter die Rechenkosten für die 3D-Rekonstruktion, die Aufrechterhaltung einer hohen Wiedergabetreue in virtuellen Umgebungen und die Gewährleistung einer reibungslosen Integration zwischen Systemen. Die kontinuierliche Entwicklung effizienterer Algorithmen und Hardware sowie Fortschritte bei KI-gesteuerten Tools bieten jedoch Möglichkeiten für weitere Innovationen in diesem Bereich. In diesem Beitrag wird ein neuartiges System zur 3D-Rekonstruktion und Interaktion mit virtuellen Umgebungen anhand von 360-Grad-Bildern vorgestellt. Der Ansatz integriert Techniken wie Bildlokalisierung mit COLMAP, hochwertige Rekonstruktion mit Gaußscher Splatting und VR-Kompatibilität für eine immersive Erkundung. Durch die Integration digitaler Objekte und interaktiver Avatare, die von LLMs unterstützt werden, ermöglicht das System Anwendungen in der personalisierten Therapie für Personen mit ASD und die Überprüfung von Bauprojekten. Diese Tools bieten einen umfassenden Rahmen für die Schaffung adaptiver virtueller Umgebungen, die sowohl therapeutische als auch industrielle Praktiken verbessern. Abbildung 1 zeigt die Angebotspipeline.

figure-introduction-1
Abbildung 1: Systempipeline. Diagramm der vorgeschlagenen Pipeline für die fotorealistische Rekonstruktion der Umgebung, bestehend aus der realen Umgebung, den 360°-Bildern, den erhaltenen Projektionen, dem SfM-Prozess, dem Gaußschen Splatting-Prozess und der Integration mit Virtual Reality. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

1. Bilderfassung

  1. Stellen Sie die 360°-Kamera auf ein höhenverstellbares Stativ. Wählen Sie eine Reihe von Positionen in der zu scannenden Umgebung aus, wobei Sie einem quadratischen Netzmuster folgen, bei dem jede Kante einen Abstand von 1,5 m hat.
  2. Nehmen Sie Bilder in drei verschiedenen Höhen an jedem ausgewählten Punkt des Netzes auf: ca. 0,4 m, 1,2 m und 2 m.
  3. Konvertieren Sie die 360°-Bilder in Bilder im äquirektangulären Format. Nutzen Sie zum Beispiel die Ista360 App. Wählen Sie das Bild aus, drücken Sie die Schaltfläche Exportieren , wählen Sie den Fotomodus 360° exportieren und exportieren Sie es als Bild im Verhältnis 2:1.
  4. Extrahieren Sie perspektivische Bilder im 16:9-Format aus jedem äquirektangulären Bild mit einem horizontalen Sichtfeld von 90°. Verwenden Sie für alle Bilder die folgenden horizontalen Winkel: 0, 45, 90, 135, 180, 225, 270, 315. Für Bilder, die in einer Höhe von 0,4 m aufgenommen wurden, verwenden Sie die vertikalen Winkel 0, 50. Für Bilder, die in einer Höhe von 1,2 m aufgenommen wurden, verwenden Sie die vertikalen Winkel -50, 0, 50. Für Bilder, die in einer Höhe von 2 m aufgenommen wurden, verwenden Sie einen vertikalen Winkel von -50, 0. Verwenden Sie für den Extraktionsprozess das Equi2Pers.py Python-Skript (Supplementary Coding File 1; Abbildung 2).

figure-protocol-1
Abbildung 2: Gleichwinklige Bilder zu Projektionen. Diagramm, das zeigt, wie ein äquirektanguläres Bild in eine Cube-Map-Projektion konvertiert wird. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

2. Schätzung der Kamerapose mit COLMAP

  1. Erstellen Sie ein neues COLMAP-Projekt, indem Sie auf Datei > Neues Projekt klicken, dann den Pfad zu den Bildern angeben und eine neue Datenbank erstellen.
  2. Extrahieren Sie Features für jedes Bild, indem Sie auf Verarbeitung > Feature-Extraktion klicken, PINHOLE als Kameramodell auswählen und für alle Bilder freigeben. Behalten Sie die restlichen Parameter als Standard bei. In Bereichen mit viel Textur können max_num_features reduziert werden, um die Effizienz der Methode zu erhöhen.
  3. Führen Sie einen Feature-Abgleich durch, indem Sie unter Verwendung der Standardparameter auf Verarbeitung > Feature-Abgleich klicken.
  4. Berechnen Sie SfM, indem Sie auf Rekonstruktion > Rekonstruktion starten klicken, um die Kamerapositionen und -ausrichtungen unter Verwendung der standardmäßigen COLMAP-Parameter zu erhalten.
  5. Minimieren Sie die Reprojektionsfehler mithilfe der Bündelanpassung, indem Sie auf Rekonstruktion > Bündelanpassung klicken.
  6. Generieren Sie eine dichte 3D-Darstellung der Szene, indem Sie auf Rekonstruktion > Dichte Rekonstruktion klicken, mit Ausgaben wie Kameraposen und rekonstruierten Punkten.

3. Fotorealistische 3D-Szenenrekonstruktion mittels Gaußscher Splatting (GS)

  1. Führen Sie die train.py Datei mit den Parametern -s, -m und -r aus, wobei -s den COLMAP-Projektpfad angibt, -m den Ausgabepfad für Gaußsches Splatting definiert (wenn nicht angegeben, wird ein Standardpfad generiert) und -r die Bilder neu skaliert, die normalerweise zwischen 2 und 4 eingestellt sind.
    HINWEIS: Die train.py Datei befindet sich im offiziellen Repository von Gaussian Splatting https://github.com/graphdeco-inria/gaussian-splatting.
  2. Suchen Sie die von Gaußian Splatting generierte .ply-Datei im Ausgabepfad für die spätere Verwendung in Unity.

4. Rendern in der virtuellen Realität mit Unity und Gaußscher Splatting

  1. Verbinden Sie das VR-Headset mit dem Computer. Diese Methode hängt vom verwendeten VR-Headset ab.
  2. Verwenden Sie Unity Hub, um ein 3D-Projekt mit der Version 2022.3.44f1 zu erstellen. Installieren Sie bei Bedarf die Unity-Version 2022.3.44f1. Gehen Sie zu Projekte > Neues Projekt, wählen Sie Version 2022.3.44f1 und die Vorlage 3D (Core) aus, legen Sie einen Projektnamen und einen Projektspeicherort fest und klicken Sie auf Projekt erstellen , um es mit den Standardeinstellungen zu generieren.
  3. Installieren Sie ein Plugin, um das VR-Headset zu verwalten und die Anwendungsentwicklung zu vereinfachen, einschließlich Aufgaben wie dem Zugriff auf den Joystick und der Augenverfolgung. Tun Sie dies über den Unity Asset Store mit dem Paket-Manager, indem Sie auf Fenster > Paket-Manager klicken.
  4. Verwenden Sie das UnityGaussianSplatting-Plug-In, um ein Medienobjekt aus der Gaußschen Splatting-Ausgabe zu generieren. Tun Sie dies über den Unity Asset Store mit dem Paket-Manager. Um dieses Asset zu generieren, gehen Sie zu Tools > GaussianSplats > GaussianSplatAsset erstellen und stellen Sie die von Gaussian Splatting generierte .ply-Datei bereit.
  5. Verwenden Sie das UltraLeap-Plugin, um die Handerkennung zu verbessern und die Benutzerinteraktion zu verbessern. Um dies zu installieren, gehen Sie zum Unity Asset Store > Package Manager und klicken Sie auf Fenster > Package Manager.
  6. Verwenden Sie das whisper.unity-Plug-in, um Audio zu transkribieren, das vom Mikrofon des VR-Headsets aufgenommen wurde. Installieren Sie diese wie in Schritt 4.5 beschrieben.
  7. Verwenden Sie ein LLM-Modell, um Antworten zu generieren. Installieren Sie das LLMUnity-Plugin, um die Verwendung dieses LLM zu ermöglichen. Installieren Sie diese wie in Schritt 4.5 beschrieben.
    1. Erstellen Sie ein leeres GameObject, fügen Sie ein LLM-Skript hinzu, und klicken Sie dann auf die Schaltfläche Modell herunterladen , um ein Standardmodell auszuwählen. Fügen Sie für die Zeichen ein leeres Objekt hinzu und fügen Sie das LLMCharacter-Skript hinzu, in dem der Name und die Rolle angegeben werden können.
  8. Verwende das Meta – Voice SDK, um Audio aus der von LLM erzeugten Antwort zu generieren. Um dies zu erreichen, installieren Sie ein Text-to-Speech-Plug-In über den Unity Asset Store mithilfe des Paket-Managers, indem Sie auf Fenster > Paket-Manager klicken.
  9. Verwenden Sie VR-Headsets , um eine immersive Interaktion zu ermöglichen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

In diesem Abschnitt werden repräsentative Ergebnisse, Stärken und Grenzen der vorgeschlagenen Pipeline diskutiert. Die Anwendung der vorgeschlagenen Methode ergibt sich wie folgt. Abbildung 3 zeigt die Kameraposition (in rot) und die dichte Punktwolke. Gruppen von Kameras mit gemeinsamem Ursprung stellen Projektionen desselben äquirektangulären Bildes dar.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Diese Studie stellt eine neuartige Methodik für die fotorealistische 3D-Rekonstruktion und Interaktion mit virtuellen Umgebungen unter Verwendung von 360-Grad-Bildern und fortschrittlichen Rendering-Techniken vor. Die kritischen Schritte, Herausforderungen und Auswirkungen des vorgeschlagenen Systems werden im Folgenden erörtert.

Kritische Schritte
Einer der wichtigsten Schritte in der vorgeschlagenen Pipeline ist die Bilderfassung. Mit ein...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Die Autoren erklären, dass ihnen keine konkurrierenden finanziellen Interessen oder persönlichen Beziehungen bekannt sind, die die in diesem Artikel berichtete Arbeit beeinflusst haben könnten.

Danksagungen

Dieses Papier ist Teil des Stipendiums PID2022-138453OB-I00, das von MICIU/AEI/ 10.13039/501100011033 und vom EFRE A way of making Europe finanziert wird.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Grafikprozessoren NVIDIA GeForce RTX 2080NVIDIATU104-400AGerät zur Bildverarbeitung und -rekonstruktion 
Insta360 X4Insta360CINSABMA-HDatenerfassungsgerät zur Rekonstruktion
Meta Quest IIIMeta899-00582-01Vorrichtung zur Visualisierung und Interaktion mit der Rekonstruktion
Speicherkarte Evo Plus 128 GBSamsung (Englisch)MB-MC128KA/EUSpeicherkarte für 360°; Aufbewahrung von Fotos

Referenzen

  1. Zollmann, S., et al. Augmented Reality for Construction Site Monitoring and Documentation. Proceedings IEEE. 102 (2), 137-154 (2012).
  2. Zhou, L., Wu, G., Zuo, Y., Chen, X., Hu, H. A comprehensive review of vision-based 3d reconstruction methods. Sensors. 24 (7), 2314(2024).
  3. Structure-from-motion revisited. Schonberger, J. L., Frahm, J. M. IEEE Conf Comp Vis Pattern Recog, , 4104-4113 (2016).
  4. Kerbl, B., Kopanas, G., Leimkühler, T., Drettakis, G. 3d gaussian splatting for real-time radiance field rendering. ACM Trans. Graph. 42 (4), 139-141 (2023).
  5. Embedding large language models into extended reality: Opportunities and challenges for inclusion, engagement, and privacy. Bozkir, E., et al. Proc 6th ACM Conf Conversat User Interf, , 1-7 (2024).
  6. Remondino, F., El-Hakim, S. Image-based 3D modelling: A review. Photogrammet Record. 21 (115), 269-291 (2006).
  7. Özyeşil, O., Voroninski, V., Basri, R., Singer, A. A survey of structure from motion. Acta Numerica. 26, 305-364 (2017).
  8. Structure from motion using full spherical panoramic cameras. Pagani, A., Stricker, D. IEEE Int Conf Comp Vision Workshops, , 375-382 (2011).
  9. Dalal, A., Hagen, D., Robbersmyr, K. G., Knausgård, K. M. Gaussian Splatting: 3D Reconstruction and Novel View Synthesis: A Review. IEEE Access. 12, 96797-96820 (2024).
  10. Zhang, M., Ding, H., Naumceska, M., Zhang, Y. Virtual Reality Technology as an Educational and Intervention Tool for Children with Autism Spectrum Disorder: Current Perspectives and Future Directions. Behav Sci. 12 (5), 138(2023).
  11. Failla, C., et al. Virtual reality for autism: unlocking learning and growth. Front Psychol. 15, 1417717(2024).
  12. Huang, B., Yu, Z., Chen, A., Geiger, A., Gao, S. 2D Gaussian Splatting for Geometrically Accurate Radiance. arXiv. , (2024).
  13. Zhang, Y., et al. Evaluating Human Perception of Novel View Synthesis: Subjective Quality Assessment of Gaussian Splatting and NeRF in Dynamic Scenes. arXiv. , (2025).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Schlagwörter

Fotorealistische 3D RekonstruktionGaussian SplattingStructure from MotionVirtual Reality Umgebungen360 Grad BildgebungCOLMAP PunktwolkeKameraposen Sch tzungdichte SzenenrekonstruktionUnity Integrationimmersive Therapie