이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.

방법 논문

증강 현실을 위한 사실적인 학습된 풍경

1K 조회수

DOI:

10.3791/68386

2025년 6월 27일

* These authors contributed equally

이 논문에서

요약

이 논문은 360도 이미지, 가우시안 스플래팅 및 가상 현실 통합을 사용하여 사실적인 3D 재구성 시스템을 제시합니다. 이 접근 방식은 교육, 학습 환경 시뮬레이션과 같은 다양한 응용 프로그램에 적용할 수 있습니다. 건설, 현장 밖에서 작업을 시뮬레이션하고 메트릭을 검색합니다. 또는 건강 관리, 자폐증 환자에게 일상 생활 과제를 훈련시킵니다.

초록

표준 컬러 이미지에서 실제 환경을 사실적인 3D로 재구성하는 기능은 의료, 교육 및 산업과 같은 분야에서 수많은 응용 분야에 적용됩니다. 이 논문은 움직임의 구조, 증분 장면 정합 및 가우스 스플래팅과 같은 고급 기술을 통합하여 상세한 3D 모델을 재구성하는 새로운 시스템을 제시합니다. 이러한 모델은 가상 현실 환경에 원활하게 통합되어 몰입형 상호 작용을 가능하게 합니다. 파이프라인은 포괄적인 적용 범위를 위해 매트릭스 기반 패턴을 사용하여 360도 이미지를 캡처하는 것으로 시작됩니다. 이미지는 COLMAP을 사용하여 처리되어 카메라 포즈를 추정하고 희소 포인트 클라우드를 생성합니다. 가우시안 스플래팅은 점의 위치, 모양 및 모양을 최적화하여 매우 사실적인 3D 환경을 생성함으로써 재구성을 구체화합니다. 그런 다음 이러한 모델은 Unity에서 렌더링되어 VR 헤드셋의 상호 작용을 가능하게 하고 대규모 언어 모델로 구동되는 아바타와 같은 추가 기능을 지원합니다. 한 가지 사용 사례는 시스템의 다양성을 보여줍니다. 의료 분야에서 이 접근 방식은 치료를 위한 통제되고 친숙한 가상 공간을 만들며, 특히 자폐 스펙트럼 장애가 있는 사람들에게 유용합니다. 몰입형 환경과 인터랙티브 아바타는 맞춤형 치료를 위한 안전하고 편안한 환경을 제공합니다. 이 시스템은 높은 시각적 충실도, 이미지 획득 용이성, 몰입형 사용자 경험 등 상당한 이점을 제공합니다. 그러나 가우스 스플래팅의 계산 비용과 정확한 카메라 포즈 추정에 대한 의존도와 같은 과제가 남아 있습니다. 이러한 한계를 극복함으로써 이 방법은 치료 개입에서 산업 디자인 및 문화 보존에 이르기까지 다양한 영역에서 응용 프로그램을 변화시킬 수 있는 잠재력을 가지고 있습니다.

서론

3D 풍경을 재현하고 상호 작용하는 기능은 현대 기술 응용 프로그램의 다양한 영역에서 매우 중요해졌습니다. 실제 위치를 가상으로 표현하는 전통적인 기술은 때때로 노동 집약적이고 경직된 모델과 수동 측정에 의존합니다1. 이러한 한계를 극복하기 위해 고급 컴퓨터 비전 기술이 자동화된 3D 재구성 및 상호 작용을 위한 실행 가능한 옵션으로 부상했습니다2.

360도 사진에서 복잡한 3D 모델을 개발하는 것은 이러한 발전의 주목할 만한 특징입니다. COLMAP3과 같은 최첨단 도구를 사용하여 사진이 촬영된 정확한 영역을 정확히 찾아내어 정확한 공간 정보를 얻을 수 있습니다. 이 프로세스는 복잡한 설정을 좋은 품질의 3D로 재현할 수 있는 Gaussian Splatting4에 의해 더욱 향상되었습니다.

이러한 3D 모델을 가상 현실(VR) 시스템에 통합하면 재구성을 넘어 탐험과 참여를 위한 새로운 길이 열립니다. 참여도를 높이기 위해 사용자는 문과 테이블과 같은 실제 물체를 측정하고, 가상 공간을 이동하고, 디지털 물체와 아바타를 추가할 수도 있습니다. 이러한 아바타는 대규모 언어 모델(LLM)을 사용하여 역동적이고 상호 작용적인 응답을 생성할 수 있으므로 몰입형 경험을 제공할 수 있습니다5.

이 작업은 일반 컬러 이미지를 사용하여 실제 환경을 3차원으로 표현하고 이를 가상 현실 설정 내에 표시하는 방법론을 제시합니다. 이 시스템은 범용 Structure-from-Motion 및 Gaussian 스플래팅 파이프라인에 의존합니다. 이 시스템은 건설 또는 의료 분야의 추가 응용 프로그램을 만드는 데 적합합니다.

제안된 파이프라인은 실제 환경을 시각적으로 사실적이고 매력적인 3차원으로 표현하는 것이 주요 이점입니다. 또한 컬러 이미지를 사용하는데, 이는 LiDAR 또는 구조광 카메라와 같은 고가의 센서가 필요한 다른 접근 방식에 비해 매우 편리합니다6. 이 제안의 근거는 시각적으로 매력적인 3차원 표현을 쉽게 만들 수 있는 능력이 많은 응용 분야가 있다는 것입니다. 품질 관리를 위한 건설, 알려지고 통제된 환경에서 자폐증 환자를 치료하기 위한 의료 서비스 또는 비디오 게임에서 실제 위치를 정확하게 표현하는 엔터테인먼트에 사용할 수 있습니다.

3D 재구성 및 가상 환경과의 상호 작용을 위한 시스템의 개발은 컴퓨터 비전, 머신 러닝 및 가상 현실 기술의 통합에 의해 최근 몇 년 동안 크게 발전했습니다2. 이 작업과 관련된 주요 구성 요소와 방법론은 다음과 같습니다.

정확한 3D 재구성은 공간 및 기하학적 정보를 추출하기 위해 이미지 처리에 의존합니다. SfM(Structure from Motion)7 및 MVS(Multi-View Stereo)8 와 같은 기존 방법은 카메라 포즈를 추정하고 조밀한 포인트 클라우드를 생성하는 데 널리 사용되었습니다. COLMAP과 같은 도구는 SfM과 MVS를 결합하여 이미지 데이터 세트에서 매우 정확한 3D 모델을 생성하여 이러한 작업을 수행하는 데 있어 견고함으로 인정받고 있습니다. 그러나 복잡한 조명, 텍스처 및 매우 동적인 환경을 처리하는 데는 한계가 남아 있습니다.

최근에는 가우시안 스플래팅 9(Gaussian Splatting9)가 개발되었는데, 이 기능은 포인트 기반 표현을 사용하여 기존의 메시 기반 방법보다 더 효율적으로 사실적인 재구성을 생성합니다. 가우시안 스플래팅을 사용하면 특히 복잡한 디테일이 있는 장면에서 더 부드러운 시각화와 더 정확한 공간 표현이 가능합니다.

3D 모델을 재구성한 후에는 몰입형 상호 작용을 위해 VR 호환 형식으로 변환하는 것이 중요합니다. VR 시스템의 사용은 엔터테인먼트를 넘어 교육, 의료10 및 산업 디자인과 같은 분야로 확장되었습니다. 최신 VR 프레임워크는 원활한 탐색, 디지털 개체와의 상호 작용 및 향상된 현실감을 가능하게 하여 높은 사용자 참여가 필요한 애플리케이션에 적합합니다.

가상 개체 및 아바타와 같은 대화형 기능의 통합은 가상 현실(VR) 시스템의 기능과 깊이를 크게 향상시킵니다. 대규모 언어 모델(LLM)로 구동되는 아바타는 사실적인 대화 상호 작용을 촉진하여 역동적이고 적응력이 뛰어난 사용자 경험을 가능하게 합니다. 특히, 이러한 기술은 사용자 행동이나 감정 상태에 따라 맞춤화된 상호 작용을 가능하게 하여 치료 맥락에서 잠재력을 보여주었습니다. 예를 들어, 이 연구11 는 LLM으로 구동되는 챗봇으로 아바타를 사용하여 자폐증 환자에게 직업 의사 소통 기술을 교육하는 VR 애플리케이션을 개발하여 LLM 기반 아바타의 치료 적응력을 강조했습니다. 또한 LLM은 증강 현실 환경에 내장되어 포용성과 참여를 촉진하여 LLM 기반 아바타의 치료 잠재력을 더욱 지원했습니다.

가상 환경은 특히 자폐 스펙트럼 장애(ASD)가 있는 개인을 위한 치료 환경에서 점점 더 많이 사용되고 있습니다. 연구에 따르면 친숙하고 통제된 가상 공간은 치료 세션 중 불안을 줄이고 참여도를 높일 수 있습니다11. 이러한 환경에서 아바타는 조력자 역할을 하여 환자가 안전하고 접근할 수 있다고 느끼는 방식으로 치료를 제공할 수 있습니다.

진전에도 불구하고 3D 재구성의 계산 비용, 가상 환경에서 높은 충실도 유지, 시스템 간의 원활한 통합 보장 등 과제가 남아 있습니다. 그러나 보다 효율적인 알고리즘 및 하드웨어의 지속적인 개발과 AI 기반 도구의 발전은 이 분야에서 더 많은 혁신을 위한 기회를 제공합니다. 이 백서는 360도 이미지를 사용하여 3D 재구성 및 가상 환경과의 상호 작용을 위한 새로운 시스템을 제시합니다. 이 접근 방식은 COLMAP을 사용한 이미지 현지화, 가우스 스플래팅을 사용한 고품질 재구성, 몰입형 탐색을 위한 VR 호환성과 같은 기술을 통합합니다. LLM으로 구동되는 디지털 개체와 대화형 아바타를 통합함으로써 이 시스템은 ASD 및 건설 프로젝트 검증을 가진 개인을 위한 맞춤형 치료에 적용할 수 있도록 합니다. 이러한 도구는 치료 및 산업 관행을 모두 향상시키는 적응형 가상 환경을 만들기 위한 포괄적인 프레임워크를 제공합니다. 그림 1 은 제안 파이프라인을 보여줍니다.

figure-introduction-1
그림 1: 시스템 파이프라인. 실제 환경, 360° 이미지, 얻은 투영, SfM 프로세스, 가우시안 스플래팅 프로세스 및 가상 현실과의 통합으로 구성된 환경의 사실적인 재구성을 위해 제안된 파이프라인의 다이어그램. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

1. 이미지 캡처

  1. 높이 조절이 가능한 삼각대에 360° 카메라를 놓습니다. 각 가장자리가 1.5m 떨어진 정사각형 메쉬 패턴을 따라 스캔할 환경 내에서 일련의 위치를 선택합니다.
  2. 메시의 선택한 각 지점에서 약 0.4m, 1.2m 및 2m의 세 가지 높이로 이미지를 캡처합니다.
  3. 360° 이미지를 등장방형 형식 이미지로 변환합니다. 예를 들어 Ista360 앱을 사용하십시오. 이미지를 선택하고 내보내기 버튼을 누른 다음 360 사진 내보내기 모드를 선택하고 2:1 비율 이미지로 내보냅니다.
  4. 90° 수평 시야각을 가진 각 등장방형 이미지에서 16:9 형식의 투시 이미지를 추출합니다. 모든 이미지에 0, 45, 90, 135, 180, 225, 270, 315 수평 각도를 사용합니다. 0.4m 높이에서 촬영한 이미지의 경우 수직각 0, 50을 사용합니다. 1.2m 높이에서 촬영한 이미지의 경우 수직 각도 -50, 0, 50을 사용합니다. 2m 높이에서 촬영한 이미지의 경우 수직각 -50, 0을 사용합니다. 추출 프로세스의 경우 Equi2Pers.py Python 스크립트(Supplementary Coding File 1; 그림 2).

figure-protocol-1
그림 2: 등장방형 이미지를 투영으로. 등장방형 이미지가 큐브 맵 투영으로 변환되는 방법을 보여 주는 다이어그램입니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

2. COLMAP을 사용한 카메라 포즈 추정

  1. 파일 > 새 프로젝트를 클릭하여 새 COLMAP 프로젝트를 만든 다음 이미지 경로를 지정하고 새 데이터베이스를 만듭니다.
  2. 처리 > 기능 추출을 클릭하고, PINHOLE을 카메라 모델로 선택하고, 모든 이미지에 대해 공유하여 각 이미지에 대한 특징을 추출합니다. 나머지 매개변수는 기본값으로 둡니다. 질감이 많은 영역에서는 max_num_features을 줄여 방법의 효율성을 높일 수 있습니다.
  3. 기본 매개변수를 사용하여 Processing > Feature Matching을 클릭하여 피처 일치를 수행합니다.
  4. 기본 COLMAP 매개변수를 사용하여 카메라 위치와 방향을 구하기 위해 재구성 > 재구성 시작을 클릭하여 SfM을 계산합니다.
  5. Reconstruction(재구성) > Bundle Adjustment(번들 조정)를 클릭하여 번들 조정을 사용하여 재투영 오류를 최소화합니다.
  6. Reconstruction(재구성) > Dense Reconstruction(고밀도 재구성)을 클릭하여 카메라 포즈 및 재구성된 점을 포함한 출력과 함께 장면의 조밀한 3D 표현을 생성합니다.

3. 가우시안 스플래팅(GS)을 이용한 사실적인 3D 장면 재구성

  1. -s, -m 및 -r 매개변수를 사용하여 train.py 파일을 실행하며, 여기서 -s는 COLMAP 프로젝트 경로를 지정하고, -m은 가우스 스플래팅에 대한 출력 경로를 정의하고(지정하지 않으면 기본 경로가 생성됨), -r은 일반적으로 2와 4 사이로 설정되는 이미지의 크기를 다시 조정합니다.
    참고: 파일 train.py 는 Gaussian Splatting 공식 저장소 https://github.com/graphdeco-inria/gaussian-splatting 에 있습니다.
  2. 나중에 Unity에서 사용할 수 있도록 출력 경로에서 가우스 스플래팅으로 생성된 .ply 파일을 찾습니다.

4. Unity 및 Gaussian splatting을 사용한 가상 현실 렌더링

  1. VR 헤드셋을 컴퓨터에 연결합니다. 이 방법은 사용하는 VR 헤드셋에 따라 다릅니다.
  2. Unity Hub를 사용하여 버전 2022.3.44f1의 3D 프로젝트를 만듭니다. 필요한 경우 Unity 버전 2022.3.44f1을 설치합니다. 프로젝트 > 새 프로젝트로 이동하여 버전 2022.3.44f1 3D(코어) 템플릿을 선택하고 프로젝트 이름과 위치를 설정한 다음 프로젝트 생성을 클릭하여 기본 설정으로 생성합니다.
  3. 플러그인을 설치하여 VR 헤드셋을 관리하고 조이스틱 및 시선 추적에 액세스하는 것과 같은 작업을 포함한 애플리케이션 개발을 단순화합니다. Unity 에셋 스토어의 Package Manager에서 Window > Package Manager를 클릭하여 이 작업을 수행합니다.
  4. UnityGaussianSplatting 플러그인을 사용하여 가우시안 스플래팅 출력에서 에셋을 생성합니다. Unity 에셋 스토어에서 패키지 매니저를 사용하여 이 작업을 수행합니다. 이 에셋을 생성하려면 Tools > GaussianSplats > Create GaussianSplatAsset 으로 이동하여 Gaussian Splatting에서 생성된 .ply 파일을 제공합니다.
  5. UltraLeap 플러그인을 사용하여 손 감지를 개선하고 사용자 상호 작용을 향상시킬 수 있습니다. 이 기능을 설치하려면 Unity 에셋 스토어> Package Manager 로 이동하여 Window > Package Manager를 클릭합니다.
  6. whisper.unity 플러그인을 사용하여 VR 헤드셋의 마이크에서 캡처한 오디오를 전사합니다. 4.5단계에 설명된 대로 설치합니다.
  7. LLM 모델을 사용하여 응답을 생성합니다. 이 LLM을 사용할 수 있도록 LLMUnity 플러그인을 설치합니다. 4.5단계에 설명된 대로 설치합니다.
    1. 빈 게임 오브젝트를 생성하고 LLM 스크립트를 추가한 다음 모델 다운로드 버튼을 클릭하여 기본 모델을 선택합니다. 캐릭터의 경우, 빈 오브젝트를 추가하고 LLMCharacter 스크립트를 첨부하여 이름과 역할을 지정할 수 있습니다.
  8. Meta - Voice SDK를 사용하여 LLM에서 생성된 응답에서 오디오를 생성합니다. 이를 위해 Unity 에셋 스토어를 통해 Window > Package Manager를 클릭하여 Text-to-Speech 플러그인을 설치하십시오.
  9. VR 헤드셋을 사용하여 몰입형 상호 작용을 가능하게 합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

이 섹션에서는 제안된 파이프라인의 대표적인 결과, 강점 및 제한 사항에 대해 설명합니다. 제안된 방법을 적용한 결과는 다음과 같습니다. 그림 3 은 카메라 위치(빨간색)와 밀집된 포인트 클라우드를 보여줍니다. 공통 원점을 가진 카메라 그룹은 동일한 등장방형 이미지의 투영을 나타냅니다.

figure-results-1
그림 3: COLMAP 포인트 클라우드 결과 및 카메라 포즈. COLMAP을 적용한 결과에는 생성된 포인트 클라우드와 카메라 위치가 빨간색 기능으로 표시됩니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

본 연구는 360도 이미지와 고급 렌더링 기법을 사용하여 사실적인 3D 재구성 및 가상 환경 상호 작용에 대한 새로운 방법론을 제시합니다. 제안된 시스템의 중요한 단계, 과제 및 의미는 아래에 설명되어 있습니다.

중요한 단계
제안된 파이프라인의 주요 단계 중 하나는 이미지 캡처입니다. 다양한 높이와 위치에 배치된 360도 카메라를 사용하여 포괄적인 데이터 세트를 생성하여 환경 범위를 극대화합니다. 이 단계는 3D 재구성의 정확성과 완전성을 보장하지만 폐색과 사각 지대를 방지하기 위해 신중한 계획이 필요합니다. 또한 획득한 이미지의 양과 품질은 최종 출력에서 중요한 역할을 합니다. 일부 영역을 놓치는 이미지 수가 부족하거나 품질이 좋지 않은 이미지는 스플랫의 부적절한 특성화로 인해 흐릿하거나 모호한 영역과 같은 재구성 오류로 이어질 수 있습니다. 또 다른 중요한 단계는 COLMAP을 사...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

저자들은 이 논문에 보고된 연구에 영향을 미칠 수 있는 경쟁적인 재정적 이해관계나 개인적 관계를 알려진 바가 없다고 선언합니다.

감사의 글

이 논문은 MICIU/AEI/ 10.13039/501100011033 및 ERDF A way of making Europe에서 자금을 지원하는 보조금 PID2022-138453OB-I00의 일부입니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
GPU NVIDIA GeForce RTX 2080엔비디아TU104-400A이미지 처리 및 재구성을 위한 장치 
인스타360 X4인스타360신사브마-H재구성을 위한 데이터 수집 장치
메타 퀘스트 III메타899-00582-01재구성을 시각화하고 상호 작용하는 장치
메모리 카드 Evo Plus 128GB삼성MB-MC128KA/EU360도 메모리 카드; 사진 저장

참고문헌

  1. Zollmann, S., et al. Augmented Reality for Construction Site Monitoring and Documentation. Proceedings IEEE. 102 (2), 137-154 (2012).
  2. Zhou, L., Wu, G., Zuo, Y., Chen, X., Hu, H. A comprehensive review of vision-based 3d reconstruction methods. Sensors. 24 (7), 2314(2024).
  3. Structure-from-motion revisited. Schonberger, J. L., Frahm, J. M. IEEE Conf Comp Vis Pattern Recog, , 4104-4113 (2016).
  4. Kerbl, B., Kopanas, G., Leimkühler, T., Drettakis, G. 3d gaussian splatting for real-time radiance field rendering. ACM Trans. Graph. 42 (4), 139-141 (2023).
  5. Embedding large language models into extended reality: Opportunities and challenges for inclusion, engagement, and privacy. Bozkir, E., et al. Proc 6th ACM Conf Conversat User Interf, , 1-7 (2024).
  6. Remondino, F., El-Hakim, S. Image-based 3D modelling: A review. Photogrammet Record. 21 (115), 269-291 (2006).
  7. Özyeşil, O., Voroninski, V., Basri, R., Singer, A. A survey of structure from motion. Acta Numerica. 26, 305-364 (2017).
  8. Structure from motion using full spherical panoramic cameras. Pagani, A., Stricker, D. IEEE Int Conf Comp Vision Workshops, , 375-382 (2011).
  9. Dalal, A., Hagen, D., Robbersmyr, K. G., Knausgård, K. M. Gaussian Splatting: 3D Reconstruction and Novel View Synthesis: A Review. IEEE Access. 12, 96797-96820 (2024).
  10. Zhang, M., Ding, H., Naumceska, M., Zhang, Y. Virtual Reality Technology as an Educational and Intervention Tool for Children with Autism Spectrum Disorder: Current Perspectives and Future Directions. Behav Sci. 12 (5), 138(2023).
  11. Failla, C., et al. Virtual reality for autism: unlocking learning and growth. Front Psychol. 15, 1417717(2024).
  12. Huang, B., Yu, Z., Chen, A., Geiger, A., Gao, S. 2D Gaussian Splatting for Geometrically Accurate Radiance. arXiv. , (2024).
  13. Zhang, Y., et al. Evaluating Human Perception of Novel View Synthesis: Subjective Quality Assessment of Gaussian Splatting and NeRF in Dynamic Scenes. arXiv. , (2025).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

태그

3DSfM Structure From Motion360COLMAPUnity