La capacidad de recrear e interactuar con paisajes 3D se ha vuelto crítica en muchas áreas diferentes de las aplicaciones de tecnología moderna. Las técnicas tradicionales para crear representaciones virtuales de ubicaciones reales a veces se basan en modelos rígidos y laboriososy mediciones manuales. Las técnicas avanzadas de visión artificial han surgido como opciones viables para la reconstrucción e interacción automatizada en 3D con el fin de superar estas limitaciones2.
El desarrollo de modelos 3D complejos a partir de fotografías de 360 grados es una característica notable de este progreso. Se puede obtener información espacial precisa identificando las áreas exactas en las que se tomaron las fotos utilizando herramientas de última generación como COLMAP3. El proceso se mejora aún más con Gaussian Splatting4, que permite recrear escenarios complicados en 3D con buena calidad.
La incorporación de estos modelos 3D en sistemas de realidad virtual (RV) abre nuevas vías de exploración y participación más allá de la reconstrucción. Para aumentar la participación, los usuarios pueden medir objetos del mundo real, como puertas y mesas, moverse por el espacio virtual e incluso agregar objetos digitales y avatares. Estos avatares pueden producir respuestas dinámicas e interactivas utilizando Grandes Modelos de Lenguaje (LLM), lo que da lugar a experiencias inmersivas5.
Este trabajo presenta una metodología para crear representaciones tridimensionales de un entorno del mundo real utilizando imágenes regulares en color y mostrarlas dentro de una configuración de realidad virtual. El sistema se basa en tuberías de estructura a partir del movimiento y de splatting gaussiano de propósito general. El sistema es adecuado para la creación de otras aplicaciones en la construcción o la atención médica.
El proyecto propuesto produce representaciones tridimensionales visualmente realistas y atractivas de entornos reales, que es su principal ventaja. Además, utiliza imágenes en color, que son muy convenientes en comparación con otros enfoques que requieren sensores costosos como LiDAR o cámaras de luz estructurada6. La razón de ser de la propuesta es que la capacidad de crear fácilmente representaciones tridimensionales visualmente atractivas tiene muchas aplicaciones. Se puede utilizar en la construcción para el control de calidad, en la atención médica para tratar a personas autistas en un entorno conocido y controlado, o en el entretenimiento para incluir una representación precisa de una ubicación real en un videojuego.
El desarrollo de sistemas para la reconstrucción 3D y la interacción con entornos virtuales ha avanzado significativamente en los últimos años, impulsado por la integración de tecnologías de visión artificial, aprendizaje automático y realidad virtual2. A continuación se describen los componentes y metodologías clave pertinentes para este trabajo.
La reconstrucción 3D precisa se basa en el procesamiento de imágenes para extraer información espacial y geométrica. Los métodos tradicionales como Structure from Motion (SfM)7 y Multi-View Stereo (MVS)8 se han utilizado ampliamente para estimar las poses de la cámara y generar densas nubes de puntos. Herramientas como COLMAP son reconocidas por su robustez en la realización de estas tareas, combinando SfM y MVS para producir modelos 3D de alta precisión a partir de conjuntos de datos de imágenes. Sin embargo, siguen existiendo limitaciones a la hora de lidiar con iluminación compleja, texturas y entornos altamente dinámicos.
Los avances recientes incluyen Gaussian Splatting9, que utiliza una representación basada en puntos para producir reconstrucciones fotorrealistas con mayor eficiencia que los métodos tradicionales basados en malla. El salpicado gaussiano permite una visualización más suave y una representación espacial más precisa, especialmente en escenas con detalles intrincados.
Una vez que se han reconstruido los modelos 3D, transformarlos a formatos compatibles con la realidad virtual es crucial para la interacción inmersiva. El uso de sistemas de realidad virtual se ha expandido más allá del entretenimiento a áreas como la educación, la atención médicay el diseño industrial. Los marcos de realidad virtual modernos permiten una navegación fluida, la interacción con objetos digitales y un realismo mejorado, lo que los hace adecuados para aplicaciones que requieren una alta participación del usuario.
La integración de características interactivas como objetos virtuales y avatares mejora significativamente la funcionalidad y la profundidad de los sistemas de realidad virtual (VR). Los avatares impulsados por Grandes Modelos de Lenguaje (LLM) facilitan interacciones conversacionales realistas, lo que permite experiencias de usuario dinámicas y adaptables. En particular, estas tecnologías han demostrado potencial en contextos terapéuticos, permitiendo interacciones personalizadas basadas en el comportamiento o el estado emocional del usuario. Por ejemplo, este estudio11 desarrolló una aplicación de realidad virtual que utiliza avatares como chatbots impulsados por LLM para entrenar a personas autistas en habilidades de comunicación vocacional, lo que destaca la adaptabilidad de los avatares impulsados por LLM en la terapia. Además, los LLM se integraron en entornos de realidad aumentada para promover la inclusión y el compromiso, respaldando aún más el potencial terapéutico de los avatares impulsados por LLM.
Los entornos virtuales se utilizan cada vez más en entornos terapéuticos, especialmente para las personas con Trastorno del Espectro Autista (TEA). Los estudios demuestran que los espacios virtuales familiares y controlados pueden reducir la ansiedad y aumentar la participación durante las sesiones de terapia11. Los avatares en estos entornos pueden actuar como facilitadores, administrando la terapia de una manera que se sienta segura y accesible para el paciente.
A pesar de los avances, persisten desafíos, incluido el costo computacional de la reconstrucción 3D, el mantenimiento de la alta fidelidad en entornos virtuales y la garantía de una integración fluida entre sistemas. Sin embargo, el desarrollo continuo de algoritmos y hardware más eficientes, así como los avances en las herramientas impulsadas por la IA, brindan oportunidades para una mayor innovación en esta área. Este artículo presenta un sistema novedoso para la reconstrucción 3D y la interacción con entornos virtuales utilizando imágenes de 360 grados. El enfoque integra técnicas como la localización de imágenes mediante COLMAP, la reconstrucción de alta calidad mediante salpicaduras gaussianas y la compatibilidad con la realidad virtual para la exploración inmersiva. Al incorporar objetos digitales y avatares interactivos impulsados por LLM, el sistema permite aplicaciones en terapia personalizada para personas con TEA y verificación de proyectos de construcción. Estas herramientas proporcionan un marco integral para crear entornos virtuales adaptativos que mejoran las prácticas terapéuticas e industriales. En la figura 1 se muestra la canalización de la propuesta.

Figura 1: Canalización del sistema. Diagrama de la tubería propuesta para la reconstrucción fotorrealista del entorno compuesto por el entorno real, las imágenes 360°, las proyecciones obtenidas, el proceso SfM, el proceso de Splatting Gaussiano y la integración con Realidad Virtual. Haga clic aquí para ver una versión más grande de esta figura.