이 논문은 제스처와 음성으로 제어되는 몰입형 주택 설계를 위한 가상현실 시스템을 제시하며, 제스처와 음성 입력의 다중 모드 융합을 통해 정확성, 사용성, 접근성을 향상시킵니다. 실험 결과는 전통적인 관행에 비해 작업 시간이 짧아지고, 배치 정확도가 향상되었으며, 사용자 만족도가 향상됨을 보여줍니다.
연구 논문
이 논문은 제스처와 음성으로 제어되는 몰입형 주택 설계를 위한 가상현실 시스템을 제시하며, 제스처와 음성 입력의 다중 모드 융합을 통해 정확성, 사용성, 접근성을 향상시킵니다. 실험 결과는 전통적인 관행에 비해 작업 시간이 짧아지고, 배치 정확도가 향상되었으며, 사용자 만족도가 향상됨을 보여줍니다.
VR에서 제스처 및 음성 기반 상호작용은 다양한 응용 분야에서 가능성을 보여주고 있습니다; 그러나 기존 시스템은 내비게이션 작업에 대한 강조, 양손 제스처에 의존하는 점, 세밀한 정밀도의 부족, 그리고 소규모 동질적 집단에 대한 테스트로 인해 제약을 받고 있습니다. 이러한 한계는 복잡하고 설계 중심의 워크플로우에만 적용할 수 있는 범위를 제한합니다. 이러한 한계를 해결하기 위해, 우리는 손으로 추적되는 제스처 입력과 자연어 지시가 결합된 다중 모드 결합을 통해 가구 배치, 재료 선택, 공간 조정을 위한 몰입형 주택 디자인을 위한 제스처 및 음성 제어 가상현실 시스템을 도입했습니다. 시스템에서 새로움의 세 가지 측면은 (i) 한 손 사용을 지원하는 적응형 상호작용 모드, 수치 음성 명령, 그리고 대략적부터 미세한 정밀도 조정까지; (ii) 제스처, 음성 및 맥락 정보를 결합하여 서브센티미터 정밀도를 달성하는 다중 모달 융합 아키텍처; 그리고 (iii) 주택 설계 프로세스에 맞춘 작업 인지 사용자 경험 평가 프레임워크. 개발 과정은 요구사항 분석과 제스처 및 음성 어휘 설계부터 다중 모달 의도 인식, 스냅 및 정렬이 포함된 VR 장면 조립, 반복 테스트에 이르기까지 체계적인 파이프라인을 따릅니다. 다양한 참가자 집단을 대상으로 한 실험 결과는 배치 오류가 30% 감소하고 사용성 및 작업 부하 평가가 컨트롤러 기반 상호작용에 비해 크게 향상됨을 보여주었습니다. 결과는 멀티모달 VR이 접근하기 쉽고 몰입감 있는 주택 디자인 경험을 창출할 잠재력을 시사합니다.
가상현실(VR)은 사용자가 실제로 존재하는 것처럼 기술과 상호작용하고 소통할 수 있는 3차원 경험을 제공하는 상호작용형 컴퓨터 생성 환경입니다. 본 연구의 맥락에서 가상현실은 단순한 시각적 디스플레이 기법이 아니라 다중 모달 상호작용 환경으로 간주됩니다. 최신 VR 시스템은 시각적 참여와 제스처 인식, 공간 감각, 자연스러운 음성 입력을 통합하여 사용자가 시뮬레이션 아이템을 고정밀도로 조작할 수 있게 합니다. 이러한 이해는 몰입, 몰입, 자연스러운 사용자 경험을 우선시하는 현재 VR 연구와도 일치합니다. 적용 분야는 공연, 교육2, 의학 치료3, 여행4를 포함합니다. VR은 사람들이 현실에서는 도달할 수 없는 세계와 상호작용하고 연결할 수 있도록 해줍니다. 사용자가 공간 배치를 인지하고, 객체를 제어하며, 물리적 움직임 없이도 실시간 피드백을 받아야 하는 주택 디자인 과정에서는 이러한 몰입 기능이 특히 유용합니다. 이러한 기능들은 특히 신체 움직임이 불완전한 사용자에게 새로운 가능성을 제공합니다. 비공식적으로 불리한 계층, 특히 노인과 최소한의 알파벳 숫자 문해력을 가진 사람들은 신체적 제약, 이동성 문제, 연령 관련 제한으로 인한 디지털 기술 접근의 어려움 등 여러 요인으로 인해 야외 활동이 제한됩니다. 따라서 VR 전문성을 통해 외부 세계를 간접적으로 접근할 수 있도록 연구에 지속적으로 관심을 기울여야 합니다. 이러한 지속적인 연구 관심의 필요성은 접근성 지향적인 VR 경험 개발을 지원할 뿐만 아니라 기본적인 내비게이션 작업을 넘어서는 시스템 개발을 촉진합니다. 실제로 몰입형 주택 디자인 환경은 자연스러운 제스처와 음성으로 제어될 때, 노인 사용자, 운동 장애인, 디지털 취약 계층 모두에게 복잡한 공간 환경과 직관적으로 상호작용할 수 있는 수단을 제공할 수 있습니다. 외부 공간과 창의적 작업에 간접적으로 접근할 수 있게 하여, 이러한 시스템은 기능적 독립성과 정서적 안녕에 기여합니다. 이러한 근거에서 본 연구는 다중 모달 VR 주택 디자인 시스템을 도입할 것입니다. 따라서 연구에 대한 지속적인 관심 욕구가 VR 경험을 통해 외부 세계를 간접적으로 접근할 수 있도록 돕는 데 기여할 것입니다. 연구에 따르면 노인을 위해 개발된 VR 기반 중재는 자세 조절과 유연성을 향상시켜 낙상 위험을 줄이고, 전반적인 자세 조절과 단단함을 개선하는 등 여러 가지 장점이 있음이 밝혀졌습니다. 또한, 노인 인구를 위해 맞춤 제작된 VR 자료의 가용성도 증가하고 있습니다 8,9. VR 상호작용이 발전했음에도 불구하고, 대부분의 현재 시스템은 주로 컨트롤러와 양손 제스처에 의존하여 설계가 필요한 작업에 접근성과 정확성을 제한합니다. 이러한 이동성 기능을 확장하여, 우리의 작업은 제스처와 음성 기법을 활용해 인테리어 디자인 요소를 능동적이고 정밀하며 현실적으로 관리할 수 있게 하여 단순한 관찰을 넘어 VR을 확장합니다
VR에는 세 가지 관련된 특성이 있습니다: 소통, 참여, 그리고 사고10. 시뮬레이션된 객체와의 참여 수준과 상호작용의 강도는 가상 환경에서 사용자의 상상력에 직접적인 영향을 미칩니다. 몰입 단계에 따라 VR 방식은 비몰입형 VR, 반몰입형 VR, 완전 몰입형 VR로 분류되며, 각각은 다양한 소통 방법, 전략, 경계 조합을 사용합니다. 11 비몰입형 VR은 데스크톱의 가상 환경이나 휴대용 기기의 터치 스크린과 마우스를 통해 소통할 수 있으며, 서명12, 13, 14. 반몰입형 VR은 일반적으로 대형 스크린, 조직, 스크린으로 구성되어 영화 같은 경험을 제공하지만, 그룹으로 사용할 때는 위치 추적이 없는 경우가 많습니다. VR15 초기부터 제스처 기반 연결이 연구되어 VR 기술의 사용이 편안하고 익숙하게 느껴질 수 있도록 설계되었습니다. 제스처 기반 인터페이스에서는 손 움직임과 같은 신체 신호를 컴퓨터 시스템과 소통하는 데 사용됩니다.
제스처 테두리는 HMD 기반 VR에서 인터페이스 투명성을 달성하기 위해 적용할 수 있는 자연 사용자 인터페이스(NUI)라는 보다 일반적인 원리의 일반적인 구현입니다. VR에서 발생을 촉진하는 요인들은 16,17에 조사되었습니다; 그럼에도 불구하고 제스처 기반 UI의 배경에서 발생하는 연구에 대한 연구는 거의 없습니다. 제스처 기반 UI를 이용한 VR의 등장에 영향을 미치는 요인을 이해하는 것은 다가오는 몰입형 기술 설계 시 유익할 수 있습니다. 따라서 발생 및 제스처 기반 커뮤니케이션의 관점에서 제스처 기반 UI를 기반으로 한 몰입형 VR 참여의 사용자 경험을 조사했습니다. 사회적으로 취약한 이들을 위해, 가상현실(VR)의 하위 섹션인 360° 고속도로 평가 자료는 효과적인 도구가 될 수 있습니다. 이러한 기술을 통해 사용자는 물리적 이동 없이도 가상으로 전 세계를 탐험하고, 다양한 장소로 이동하며, 다자 기능을 갖춘 다른 사용자와 소셜 커뮤니케이션을 할 수 있습니다. 신체적, 환경적 어려움이 있는 사람들에게 이러한 참여는 야외 활동의 유용한 보조 수단이 될 수 있습니다. 단순한 탐색을 넘어, 360° 의견 기술이 제공하는 교육 가능성은 교육 분야의 여러 영역으로 확장됩니다.
64개의 교육 세션을 검토한 문헌을 체계적으로 검토한 결과, 360° VR 영상과 실제 VR의 정보 활용, 이점 및 소통 특성이 강조되었습니다. 결과는 360° VR이 학습자의 발표, 동기 부여, 정보 유지를 향상시켜 몰입도를 높일 수 있음을 보여줍니다. 연구원21 은 텔레포트 기반 이동 방식에서 두 개의 한 손 및 양손 UI를 연관지었다. 결과는 한 손 신호가 선호하는 사람들에게 더 빠르게 시작된다고 인식된 반면, 양손 신호는 더 신뢰할 만하다고 여겨졌음을 보여주는데, 이는 이 연구에서 사용된 지속적인 이동이 아니라 단독 순간이동을 다루고 있음에도 불구하고 그렇다.
양손 수화의 일관성과 한 손 수화의 초기 속도 증가를 가정하여 본 연구의 전제로 활용하였습니다. VR22에서 책임을 수행하기 위한 훈련 운영자에 관한 기술 평가 제한 사항, 즉 프레젠테이션과 서비스 가능성 외에 보다 상세한 명세도 필요합니다. 이 교육 상황에서 패널들은 운영자에게 활동을 지도하며, 기술 평가가 중요한 요소입니다. 더 나아가, HT 기술이 적절히 적용될 경우 기술 분야에서도 발전을 가져올 수 있다는 기본 전제가 있습니다23,24. 최근 연구에 따르면 가상 환경은 휠체어 조향 서비스 평가에 유용할 뿐만 아니라, 실제 생활에서 재현하기 어렵거나 비용이 많이 드는 유연한 서비스 교육과 같은 유익한 활용도 가지고 있습니다. 예를 들어, 저자25는 VR 시뮬레이터가 숙련되고 무해한 기술 환경을 제공함으로써 조향 서비스를 물리적 환경에 일반화할 수 있다고 지적합니다.
연구자는 또한 가상 기술을 휠체어 서비스 교육에 개입 프로그램으로 적용하며, 운동 개개인화와 유연성 서비스 향상에 있어 유용성과 유익함을 강조합니다. 하지만 안전을 위해 특히 가상현실 환경에서 사용자는 사전 확인과 심사를 거칩니다26,27. 이러한 구현은 신체 장애인들이 안전하고 통제된 환경에서 휠체어 운전 기술을 연습하고 연마할 수 있도록 합니다28. 이들은 도전적인 문제 극복, 좁은 공간을 탐색하는 법, 복잡한 동작 수행 등 다양한 가상 시험과 시나리오를 경험할 수 있습니다. 한편, 사용자는 자신의 성과에 대한 즉각적인 피드백을 받고 새로운 이동 전략을 습득할 수 있습니다. 가상현실은 훈련 보조 도구로서의 역할 외에도 치료적 용도가 있습니다. 몰입형 영상 기술을 제공하는 것은 자신감, 조직력, 신체적 재통합을 향상시키는 데 기여할 수 있습니다. 개인은 운동 능력을 개발하고 안정성과 안정감을 향상시킬 수 있습니다. 가상현실 환경은 사용자가 자신이 그 일부인 것처럼 느끼게 하는 컴퓨터 생성 표현입니다.
이 상황은 가상현실 헤드폰이나 다른 방법으로 시각화됩니다. 목업은 의료 사건이나 특정 전략의 운영 등 실행 전에 위험 상황이나 도전적인 상황을 시뮬레이션할 수 있습니다.32, 33, 34. 또한 추가 이점으로는 제어 장치, 모션 감지 장식품, 마이크 또는 조끼 등 장치 장비를 부착하여 고용주와 메커니즘35 간에 무해하고 신중하게 복제된 환경에서 효율적인 통신을 할 수 있다는 점이 있습니다. 가상 물질은 조이스틱, 음성 지시, 또는 촬영된 트레일 등 다양한 방식으로 조작될 수 있으며, 이는 Kinect 연구36에서 볼 수 있습니다. 모든 대안은 사용자의 학습을 포함하므로, 사용자의 경험이제어 접근법 선택 시 매우 중요한 고려 사항입니다.
가상 공간에서의 제스처와 음성 상호작용은 기본 논문에서 논의된 스트리트 뷰 시스템을 포함한 내비게이션 작업에 연구되었지만, 몰입형 주택 디자인과 같은 정밀하고 창의적인 작업 영역에 이러한 방식을 적용하는 데에는 상당한 공백이 존재합니다. 기초 연구는 접근성을 위한 다중 모드 입력이 실현 가능함을 입증했지만, 이는 양손 제스처, 직관적인 명령 발령, 소규모 참여자 수를 포함한 내비게이션과 현장 검사만을 포함했습니다. 고충실도 조작, 정밀한 공간 위치 지정, 재료 편집, 협업 워크플로우 등 인테리어 및 건축 디자인 활동을 정의하는 난이도는 포함하지 않았습니다. 또한, 이 테스트는 좁고 동질적인 사용자 집단을 대상으로 하여, 더 넓은 집단과 다양한 접근성 요구에 대한 사용성 관찰이 제한되었습니다. 현재의 VR 설계 도구들은 주로 컨트롤러에 기반하고 있으며, 이는 자연스러운 상호작용을 제한하고 운동 또는 학습 장애가 있는 사용자를 배제합니다. 그 결과, 거친 및 미세한 객체 조작을 위한 제스처와 음성 통합, 음성 제어 수치 변경, 한 손 및 접근성 상호작용 스타일을 수용하고 실제 설계 작업에서 광범위한 사용자 경험 분석을 통해 테스트하는 시스템 설계 및 테스트가 부족하다38,39. 이 격차를 해소하면 멀티모달 VR 내비게이션 연구를 기반으로 한 새로운 사용자 중심 몰입형 주택 디자인 접근법을 창출할 수 있습니다.
최근 멀티모달 인간-기계 인터페이스의 발전은 VR40의 사용성과 몰입감을 높이기 위한 첨단 감지 및 상호작용 메커니즘을 탐구하고 있습니다. 저자41 은 비접촉 3D 제스처 인식을 위한 일렉트렛-나노파이버 기반 트라이보일렉트릭 센서를 발표하여, 전통적인 시각 기반 추적 없이도 고화질 제스처 해석이 가능하며, 보다 자연스럽고 비터치 VR 제어를 가능하게 함을 입증했습니다. 반면, 연구자42 는 마우스를 대상으로 한 고정형 VR 시스템에 대한 강력한 행동 훈련 절차를 제시했습니다. 이 연구는 통제된 VR 환경이 정밀한 행동 측정과 안정적인 상호작용 프로토콜을 지원할 수 있음을 보여주었으며, VR 워크플로우에서 반복성과 체계적 설계의 중요성을 강조했습니다. 동시에, 저자43 은 전기생리학적 신호 획득 향상을 위해 초저 피부 임피던스를 가진 신축성 및 접착성 이온 전도성 전극을 제안했으며; 이는 XR과 VR의 상호작용 정확도를 더욱 높일 수 있는 생체 통합 센싱의 길을 열어줍니다. 사실 이 모든 연구는 센서 기술, 훈련 프로토콜, 생리학적 인터페이스가 얼마나 빠르게 진화하는지를 보여줍니다. 이는 이 연구에서 제안된 제스처-음성 시스템과 같은 보다 유연하고 다중 모달 상호작용 프레임워크가 필요하기 때문입니다.
이 프로토콜은 한 손으로 접근 가능한 제스처, 음성 기반 수치 개선, 정밀 기반 주택 설계를 가능하게 하는 다중 모달 제스처-음성 경로를 제시하며, 주로 내비게이션이나 컨트롤러 기반 조작을 지원하는 현재의 VR 상호작용 모델과 대조적입니다. 우리가 이해하기로는, 이 프로토콜은 공간적 정밀도, 재료 수정, 포용적 디자인 프로세스에 특화된 제스처-보이스 융합을 결합한 최초의 프로토콜입니다.
이 작업의 주요 목표는 제스처 및 음성 기능이 있는 가상현실(VR) 시스템을 개발하는 것이고, 복잡한 가구 배치, 회전, 축소, 재료 또는 조명 편집을 지원하는 멀티모달 입력 기능을 확장하는 것입니다. 주요 목표는 제스처, 음성, 맥락 입력을 통합하여 인테리어 디자인 작업 중 거친 제어와 세밀한 제어를 모두 달성하는 멀티모달 퓨전 엔진을 개발하는 것입니다. 또한 한 손 제스처, 접근성 중심 기능, 음성 지원 정밀 명령 등 적응형 상호작용 모드를 도입하여 다양한 사용자 그룹을 지원합니다.
이 작업은 또한 작업 완료 시간, 배치 정확도, 오류율 등 정량적 지표와 사용성, 작업 부하, 사용자 만족도에 대한 정성적 평가를 결합한 포괄적인 사용자 경험(UX) 평가를 수행하고자 합니다. 이전 연구들보다 중요한 진전은 스트리트 뷰 기반 내비게이션 시스템에서 작업 지향적이고 정밀한 인테리어 디자인 프레임워크로 전환함으로써 이루어졌습니다. 주요 기여는 몰입형 주택 디자인을 위한 제스처 및 음성 제어 VR 환경 개발에 있으며, 이는 주로 스트리트 뷰 내비게이션을 위한 제스처-음성 통합에 초점을 맞춘 이전 연구의 범위를 확장한 것입니다.
중요한 점은, 이전 어떤 시스템도 객체 위치, 축소, 회전, 재료 편집과 같은 정밀도에 의존하는 주택 설계 작업을 위해 제스처-음성 다중 모드 커뮤니케이션을 효과적으로 결합한 적이 없다는 것입니다. 기존 접근법은 한 손 제스처 입력이나 음성 기반 수치 정제화 등 적응형 상호작용 대안도 부족합니다. 제안된 시스템은 MediaPipe Hands 또는 VR 헤드셋 기반 손 추적을 통해 달성된 제스처 인식과 시간 합성곱 네트워크 분류기, 그리고 Whisper ASR 및 트랜스포머 기반 의도 분류 모델에 기반한 음성 인식 및 자연어 해석을 융합한 포괄적인 다중 모달 상호작용 패러다임을 도입합니다.
견고한 운영을 보장하기 위해, 신뢰 기반 중재가 적용된 의사결정 수준의 다중 모드 융합 메커니즘이 구현되어 제스처를 공간 선택 작업에 매핑하고 음성 명령을 정밀 세정에 매핑합니다. 이 설계는 가상 주택 디자인 환경에서 객체의 정확한 배치, 축소, 회전 및 재료 변화를 가능하게 합니다. 워크플로우는 시스템 요구사항 정의, 제스처 및 음성 어휘 설계, 다중 모달 융합 기법 개발, 스냅 도구, 측정 오버레이, 재질 미리보기가 포함된 Unity 3D의 몰입형 VR 환경 구축으로 시작하는 구조화된 파이프라인을 따릅니다. 이후 시스템 통합, 파일럿 테스트, 비교 연구를 통한 사용자 경험 평가가 이어집니다.
이 시스템은 저지연 멀티모달 상호작용(200ms 미만), 적응형 접근성 지원, 기존 컨트롤러 기반 VR 시스템에 비해 향상된 사용성을 제공합니다. 실험 평가는 작업 완료 시간, 배치 정확도, 오류율, SUS 점수, NASA-TLX 작업 부하 지표, IPQ 존재 평가를 정량화합니다. 기대되는 결과는 멀티모달 상호작용이 VR 기반 주택 설계에서 정밀도, 효율성, 사용자 만족도를 크게 향상시킨다는 것을 보여줍니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구는 말레이시아 수방자야에 위치한 테일러스 대학교 연구 윤리 위원회의 승인을 받았습니다. 모든 절차는 기관 연구 위원회가 정한 윤리 지침을 준수했으며 헬싱키 선언에 부합하였습니다. 데이터 수집 전에 각 참가자로부터 사전 동의를 받았습니다. 그들은 연구 목적에 대해 명확히 설명받았고, 참여가 자발적이며, 답변이 비밀로 유지될 것이며, 언제든지 아무런 제재 없이 철회할 수 있다는 보장을 받았다. 익명화된 상호작용 및 설문 데이터 사용에 대해서는 서면 동의서도 확보되었습니다. 이 원고에는 개인 식별 가능한 정보, 이미지, 민감한 개인정보는 포함되어 있지 않습니다.
제안된 연구는 몰입형 주택 설계를 위한 제스처 및 음성 기반 가상현실(VR) 시스템을 개발하며, 현재의 내비게이션 지향 작업을 능가하는 방법을 뛰어넘습니다. 이 접근법은 가구 배치, 오브젝트 크기 및 회전, 재료 편집, 정확한 방 치수 등 사용자 요구와 디자인 활동을 파악하는 것부터 시작합니다. 그 후 제스처 상호작용 시스템이 개발되어, 제약이 없는 손 제스처(집기, 잡기, 회전 등)를 헤드셋 기반 트래킹이나 MediaPipe Hands를 통해 감지하고, Temporal Convolutional Networks(TCN)를 포함한 경량 머신러닝 모델로 식별합니다. 제스처를 보완하기 위해 조직화된 음성 명령 문법이 구축되고, 속삭임 기반 자동 음성 인식(ASR) 및 자연어 이해(NLU)를 결합하여 고수준 의미 제어를 위한 의도와 매개변수를 도출합니다. 두 모달리티는 다중 모달 융합 전략으로 결합되어, 제스처를 이용해 공간 선택과 조작을 관리하고, 음성 명령은 신뢰도 기반 중재 메커니즘과 실행 취소 명령을 통한 오류 복구를 통해 정밀한 조정을 제공합니다.
몰입형 디자인 환경은 Unity 3D로 배포되며, 스냅, 충돌 반응, 측정 오버레이, 그리고 현실적인 디자인 워크플로우를 가능하게 하는 인터랙티브 가구 및 재료 라이브러리를 제공합니다. 파일럿 테스트는 상호작용의 자연스러움, 안정성, 낮은 지연 시간(<200ms)을 보장하기 위해 공식 평가 전에 수행됩니다.
참가자와 표본 추출 전략
총 48명의 참가자가 사용자 연구에 모집되어 다양성과 결과의 일반화 가능성을 보장하였습니다. 참가자들의 나이는 19세에서 62세(M = 32.4, SD = 10.7)였으며, 남성 26명, 여성 22명이었습니다. 몰입형 기술에 대한 친숙도의 차이를 포착하기 위해 참가자들은 VR 경험의 세 그룹으로 나뉘었습니다: VR 노출이 거의 없거나 전혀 없는 초보 사용자(n = 18), VR 사용을 드문 중간 사용자(n = 17), 그리고 주로 전문적으로 정기적으로 VR을 사용하는 숙련자 사용자(n = 13)입니다. 표본의 접근성과 포용성을 보장하기 위해, 경미한 이동성 제한이 있는 6명과 운동 제약으로 인해 한 손으로 상호작용을 선호하는 4명을 포함했습니다. 모든 참가자는 정상 또는 정상으로 교정된 시력을 보였으며, VR 사용에 지장을 줄 수 있는 전정 또는 신경학적 질환을 보고한 사람은 없었습니다.
참가자들은 균형 잡힌 할당 전략을 사용하여 세 가지 상호작용 조건에 무작위로 배정되었습니다: 제스처+음성 (n = 16), 컨트롤러 전용 (n = 16), 하이브리드 (n = 16). 편향을 피하고 조건 간 과제 난이도를 비슷하게 하기 위해 경험 수준을 세 그룹에 고르게 분배했습니다. 모든 참가자는 실험 시작 전에 서면 동의서를 제공했습니다.
사용자 연구는 제스처 보이스, 컨트롤러 단독, 하이브리드 등 세 가지 상호작용 조건에서 수행되어 정밀도, 효율성, 사용자 경험을 평가합니다. 정량적 지표로는 배치 정밀도, 작업 지속 시간, 오류율이 포함되며, 주관적 평가는 SUS, NASA-TLX, IPQ를 활용하고 질적 인터뷰로 뒷받침됩니다. 여기서 소개된 이 시스템은 세 가지 주요 혁신을 제공합니다: VR에서 정확한 객체 조작을 위한 다중 모달 제스처-음성 융합 활용, 한 손 제스처 및 음성 폴백과 같은 적응적이고 접근 가능한 상호작용 모드, 그리고 주석이 달린 제스처-음성 명령의 재현 가능한 말뭉치 제공입니다. 이러한 단계들이 결합되어 정확성, 효과성, 사용자 경험이 향상되어 기본 논문의 한계를 직접적으로 해결하고 디자인 활용을 위한 몰입형 VR 상호작용 연구를 진전시킵니다. 그림 1 은 제안된 방법의 아키텍처를 보여줍니다.
그림 1에 보이는 제안된 방법의 시스템 아키텍처는 입력 모달리티에서 시작되며, EgoGesture, IPN Hand와 같은 데이터셋을 사용해 제스처를 기록하고, Fluent Speech Commands 데이터셋의 음성 지시를 사용합니다. 이러한 입력은 제스처 인식과 음성 인식 모듈을 사용하여 독립적으로 처리되어 공간 및 의미 데이터를 생성합니다. 두 스트림은 다중 모달 퓨전 계층 내에서 융합되어 제스처와 음성 입력을 정렬하여 일관된 명령을 생성합니다. 이 융합된 데이터는 VR 상호작용 계층에서 활용되어, 사용자가 배치, 회전, 스케일링, 재료 수정 등을 실시간으로 조작할 수 있도록 돕습니다. 마지막으로, 처리된 상호작용은 출력 계층에서 제공되어, 접근성, 정확성, 자연스러운 상호작용에 중점을 둔 몰입형 주택 디자인 공간을 만듭니다.
시스템 요구사항 및 작업 정의
구상된 시스템은 접근성 지향을 통해 VR 내비게이션 모델을 강화하여 정밀한 주택 계획을 지원합니다. 사용자 도메인
은 ,
주택 소유자,
디자인 전문가,
접근성 사용자(노령 또는 이동 장애 사용자)를 식별합니다. 각 사용자는 핵심 작업 세트 T = {배치, 회전, 축소, 재료, 조명, 측정}을 수행합니다. 작업 t∈ T는 다중 모달 입력을 통해 수행됩니다: 제스처 스트림 G t(공간 조작)와 음성 명령 Vt(의미 매개변수). 시스템은 이를 융합 정책을 통해 행동과 연관시킵니다:
(1)
여기서 π 는 의사결정 수준의 다중 모달 함수입니다.
시스템 요구는 저지연 상호작용을 요구합니다: 예를 들어
제스처 인식, 음성 이해, 융합 시간 등이 포함됩니다.
(2)
합 응답은 몰입형 VR 사용성 임계값에 부합하는 실시간 반응성을 제공합니다.
작업 정확도를 위해, 실제 대상 상태를 (x, R, s, M, L)(위치, 회전, 축척, 재료, 길이)이고, 시스템의 실현 상태를 로
한다. 오차 지표는 다음과 같습니다:
(3)
(4)
(5)
(6)
재료 불일치 때문
에.
두 모달리션 모두 신뢰 점수 cg(제스처)와 cv(음성 포함)를 생성하며, cg + cv = 1로 정규화됩니다. 융합 중재는 가중 오차를 최소화합니다:
(7)
여기서 lg, lv는 양상별 손실입니다. 만약 이 이면
, 시스템은 명확한 명령에 대해 명확한 안내문을 요청합니다.
마지막으로, 평가 지표에는 작업 완료 시간 Tt, 오류율 Et, NASA-TLX, SUS, IPQ 작업 점수가 포함됩니다. 우리는 복합 과제 성과 지수를 소개합니다:
(8)
사용자 간 최소화를 위해 SUS 점수가 ≥70이고 NASA-TLX 점수가 기준 컨트롤러 기반 VR에 비해 감소하는 임계값을 요구합니다.
데이터셋 수집 및 전처리
제안된 시스템은 제스처 데이터(TCN 기반 인식용)와 음성 명령 데이터(NLU/ASR용)를 모두 기반으로 합니다. 이를 위해 우리는 세 가지 주요 데이터셋을 활용합니다: VR과 유사한 환경에서 동적인 연속 제스처를 위한 EgoGesture, 자연스러운 단거리 제스처를 보완하는 IPN Hand, 그리고 디자인 발화의 음성 주도 의미론적 이해를 훈련하는 Fluent SpeechCommands 44 입니다. 선택 데이터셋으로는 정적 제스처 검출기 사전 학습을 위한 HaGRID와 일반 ASR 사전 학습을 위한 Mozilla Common Voice가 있지만, 이 둘 다 필수는 아닙니다. 이러한 선택은 두 가지 방식을 모두 포함하면서도 데이터셋의 범위를 최대한 합리적이고 재현 가능하게 유지할 수 있게 합니다. 표 1은 제안된 연구의 데이터셋 세부 정보를 보여줍니다.
이 논문에서 데이터셋 선택은 매우 중요한데, 각 데이터셋은 다중 모달 VR 상호작용의 독특한 시나리오를 다루도록 설계되었기 때문입니다. EgoGesture 데이터셋은 광도와 환경 조건의 차이에도 불구하고 높은 인식 성능을 보장하는 대규모 자연스러운 손동작 모음을 제공합니다. IPN 핸드 데이터셋은 제한 없는 연속적인 손 동작을 위해 설계되었기 때문에, 고정밀 제어 작업과 실시간 제스처 분할에 특히 적합합니다. 또한, Fluent Speech Commands 데이터셋은 의도 감지를 위한 의미 주석이 포함된 라벨이 붙은 음성 명령을 제공하여 VR에서 정확하고 자연스러운 명령 실행을 가능하게 합니다. 이 데이터셋을 결합하면 제스처와 음성 양측을 상호 보완적으로 커버하여 다양성, 견고성, 일상적인 성능을 제공하여 제안된 시스템 평가를 향상시킵니다. 공개 데이터셋 외에도, 10명의 신규 참가자로부터 312개의 제스처 샘플과 128개의 음성 명령으로 구성된 독립적인 자체 데이터셋을 사용해 프로토콜을 검증했습니다. 이 독립적인 검증은 프로토콜의 재현 가능성과 견고성을 확인시켜 주었습니다.
데이터 전처리
수집된 정보는 모델 훈련 전에 체계적으로 정규화, 샘플링, 보강됩니다:
제스처 시퀀스 정규화
제스처 비디오 시퀀스는 골격 관절 특징들의 다변량 시계열로 표현됩니다:
(9)
여기서 Ti 는 i번째 제스처의 길이이고 d는 특징 차원(예: 손 관절 위치)입니다. 서로 다른 제스처가 Ti 길이가 다양할 수 있으므로, 이를 일정한 시퀀스 길이 T로 재샘플링합니다:
(10)
이로 인해 녹화 길이와 관계없이 모든 제스처 샘플이 TCN 훈련에 사용할 수 있는 표준 시간 길이와 비교할 수 있습니다.
기능 표준화
사용자와 녹화 조건 간의 축척 차이를 없애기 위해 각 특징 공간은 표준화됩니다:
(11)
여기서
는 특징 j의 평균이고, σ j는 표준편차이다. 이러한 정규화는 특징이 단위 분산에 맞춰 중심에 위치하도록 보장하고, 제스처 수행 개인의 차이를 최소화합니다.
데이터 증강
합성 섭동 포함은 변동성에 대한 강인성을 향상시킵니다. 시간적 지터는 먼저 순서 정렬을 무작위로 어긋납니다:
(12)
여기서 δ는 프레임 단위의 최대 지터입니다. 두 번째 노이즈 주입은 특징에 가우시안 섭동을 추가합니다:
(13)
이러한 보강은 실제 VR 상호작용에서 타이밍 불규칙성과 센서 노이즈에 견고하게 대응할 수 있게 합니다.
음성 전처리
각 발화는 처음에 로그-멜 스펙트로그램 표현에 매핑됩니다:
(14)
여기서 F는 주파수 빈의 수이고 T′는 시간적 프레임의 수입니다. 변동성 기록을 보정하기 위해 스펙트로그램 특징은 다음과 같이 정규화됩니다:
(15)
여기서 μ V, σV 는 코퍼스에 대한 전역 평균과 표준편차입니다. 이는 ASR 및 NLU 모델에 안정적인 음향 특징 공간을 제공합니다.
의도 슬롯 인코딩
음향 기능 외에도, 각 음성 명령은 구조화된 의미 슬롯으로 라벨링됩니다:
(16)
예를 들어, "의자를 15도 회전"은 (action = rotate, object = chair, location = null)에 해당합니다. 이 체계적인 인코딩은 시스템이 설계 특정 매개변수를 도출하고 이를 실행 가능한 VR 작업으로 변환할 수 있게 합니다.
시간 합성곱 네트워크(TCN)를 이용한 제스처 상호작용 설계
제스처 상호작용 디자인은 사용자가 VR 주택 디자인 시스템에서 자연스러운 손짓을 사용해 가상 객체와 어떻게 상호작용하는지 명시합니다. 디자인은 제스처 어휘를 개발하는 것에서 시작됩니다. 이는 손짓을 시스템 기능과 연관시키는 것입니다. 예를 들어, 잡기 제스처는 물체 배치를 조절할 수 있고, 집기 제스처는 스케일링을 조절할 수 있으며, 회전 제스처는 선택한 축 주위를 중심으로 물체를 돌릴 수 있습니다.
고려 중인 시스템에서는 EgoGesture와 IPN Hand가 시간 합성곱 네트워크(TCN) 학습을 위한 기본 제스처 데이터셋 역할을 하며, Fluent Speech Commands는 음성 기반 상호작용 기능을 보완합니다. 이 둘이 결합되어 다중 모달 VR 상호작용을 제공합니다.
데이터셋의 제스처 표현
EgoGesture 또는 IPN Hand에서 나온 제스처 연속은 다변량 시계열입니다:
(17)
(18)
여기서 T는 미리 정해진 프레임 수(재샘플링 후)이고, d는 골격 특징 치수(예: 3D 관절 위치)의 개수입니다. 데이터셋에는 y(i) ∈ y 라벨이 있어 C 제스처 클래스 중 하나를 나타냅니다.
시간 합성곱 인코딩
우리는 실시간으로 제스처를 분류하기 위해 시간적 합성곱 네트워크(TCN)를 활용합니다. TCN은 제스처 시퀀스의 단기 및 장기 의존성을 포착합니다. TCN은 RNN과 달리 확장된 인과 합성곱을 활용하여 효율적인 병렬 계산을 가능하게 합니다.
TCN은 인과적 확장된 합성곱을 통해 이러한 수열을 적용하여 단기 및 장기 의존성을 학습합니다:
(19)
여기서 dL은 계층 l의 지연 인자, K는 핵 크기, σ는 비선형 활성화(ReLU)입니다. 수용 야는 다음 조건에 따라 달라집니다:
(20)
TCN이 서로 다른 시간적 길이의 제스처를 아우르도록 요구합니다.
제스처 분류
마지막 숨겨진 상태는 Softmax 분류기를 통해 전달됩니다:
(21)
교차엔트로피로 정의된 훈련 목표:
(22)
음성 명령과의 통합
공간 조작(이동, 회전, 축소)은 EgoGesture와 IPN Hand의 제스처 인식으로 처리되지만, 의미 명령에는 Fluent Speech Commands 데이터셋이 적용됩니다. 모든 발화는 구조화된 슬롯 표현으로 번역되며,
이는 제스처 입력에 매개변수를 제공해 보완합니다(예: "의자를 15° 회전").
그 다음 두 출력을 결합합니다:
(23)
여기서 o(i) 는 VR 컨트롤 원시(위치, 스케일링, 회전)입니다.
시간 합성 네트워크(TCN)는 그림 2에 보이듯이 제스처나 음성 신호와 같은 입력 시퀀스에 확장된 1차원 컨볼루션을 사용하여 순차 데이터를 효과적으로 처리합니다. 반복 모델과 달리, TCN은 컨볼루션 필터를 이용해 단기 및 장기 시간 관계를 학습합니다. 스킵 연결이 있는 잔류 블록은 훈련 중 안정성을 제공하고 사라지는 구배를 방지하기 위해 사용되며, 스택된 TCN 계층을 사용하면 네트워크가 다중 스케일 시간 패턴을 학습할 수 있습니다. 궁극적으로 완전 연결된 분류 계층은 학습된 시간적 특징을 제스처 클래스나 음성 의도와 같은 출력 라벨에 투사합니다. 이 설계는 연속적인 제스처 인식과 음성 명령 이해에 특히 적합하며, 계산 효율성과 강력한 시간 모델링 기능을 결합합니다.
표 2는 제안된 제스처 인식 시스템에 사용되는 시간 컨볼루션 네트워크의 전반적인 아키텍처 설계 및 학습 구성을 요약합니다. 이 모델은 확장된 인과 합성곱을 기반으로 한 네 개의 잔류 TCN 블록을 특징으로 하여 네트워크가 단기 및 장기 시간 의존성을 모두 모델링할 수 있게 합니다. 이러한 의존성은 잡기, 회전하기, 집기 같은 동적 제스처를 구분하는 데 매우 중요합니다. 핵 크기가 3이고 확장 인자가 있을 때, [1,2,4,8]의 지연 인자는 계산 비용을 증가시키지 않고 시간적 수용장을 효율적으로 확장합니다. 사용자 및 기록 조건 간 일반화를 개선하기 위해 각 블록 내에서 레이어 정규화와 0.25의 드롭아웃률이 사용되었습니다. 학습에는 학습률 1 × 10-3, 배치 크기가 32, 시퀀스 길이 64프레임의 Adam 최적화기가 사용되며, 정확성과 실시간 반응성을 최적으로 균형 있게 유지합니다. 추론 과정에서 슬라이딩 윈도우 전략은 20-25ms마다 제스처를 예측할 수 있게 하며, 종단 간 지연 시간을 120ms 이하로 유지합니다. 이러한 아키텍처와 하이퍼파라미터의 조합은 제스처 분류에서 높은 정확도(약 94% 배치 정확도)를 제공하며, 실시간 상호작용을 유지함으로써 TCN이 몰입형 VR 조작 작업을 수행할 수 있게 합니다.
음성 상호작용 설계 (ASR+NLU)
음성 상호작용 요소는 VR 홈 디자인 시스템의 의미론적이고 매개변수화된 음성 명령을 통해 제스처 기반 공간 제어를 보완합니다. 음성 입력 a(i) 는 먼저 원시 오디오로 녹음된 후 로그-멜 스펙트로그램으로 변환됩니다:
(24)
여기서 F는 주파수 T 빈의 수, 시간 간격의 길이입니다. 이 표현은 스펙트럼과 시간적 음성 패턴을 모두 보존하며, 화자와 환경 변동성에 따라 정규화됩니다:
(25)
정규화된 스펙트로그램은 Whisper와 같은 자동 음성 인식(ASR) 모델에 입력되어, 음향 특징을 토큰 시퀀스로 변환합니다:
(26)
여기서 각각은 단어 또는 하위 단어 단위의 토큰이다. 이러한 전사는 구조화된 의미를 포착하는 자연어 이해(NLU) 모델에 입력됩니다. 더 정확히 말하면, NLU는 의도 범주와 의미 슬롯에 대한 예측을 합니다:
(27)
예를 들어, "의자 15도 회전"이라는 문장은 (action = rotate, object = chair, location/parameter = 15°)에 대응합니다.
식별된 의도-슬롯 프레임워크는 VR 시스템 내에서 구현 가능한 수학적 명령으로 변환됩니다:
(28)
여기서 u(i)는 수치 변환(예: 15° 회전)일 수도 있고, 범주 변환(예: 물질 교환)일 수도 있습니다.
견고성은 결국 신뢰 기반 중재 메커니즘을 통해 달성됩니다. ASR 신뢰 점수 p(z) 또는 NLU 신뢰 점수 p(s)가 임계값 τ 미만이면, 시스템은 명확한 설명을 요청하거나 제스처 기반 제어를 기본값으로 선택합니다. 이로 인해 음성 명령이 정확하고 명확하게 전달되어, 정밀함이 필요한 설계 작업에 사용성이 향상됩니다.
다중 모드 핵융합 설계
제안된 VR 시스템에서 다중 모달 융합의 장점은 음성 이해와 제스처 감지가 각각 따로 처리되지 않고 단일 의사결정 과정에 통합된다는 점입니다. 제스처 모듈은 TCN에서 분류 출력
을 제공하는 반면, 음성 모듈은 의도-슬롯 표현 s(i)를 제공합니다. 이를 융합하기 위해 시스템은 신뢰 기반 중재와 의사결정 수준의 융합을 구현합니다.
제스처 분류기가 제스처 클래스에 대한 확률 분포를 제공하도록 합니다:
(29)
NLU 모델이 의도-슬롯 확률을 산출한다고 하자:
(30)
여기서 a, o, p는 음성 입력에서 파생된 동작, 객체, 매개변수 슬롯을 의미합니다. 융합 단계는 두 모달리티를 신뢰도 점수에 따라 결합하여 공동 결정을 계산합니다:
(31)
여기서 α∈[0,1]는 시스템 신뢰도를 기반으로 동적으로 설정됩니다(예: 제스처가 더 확실할 때는 높고, 말이 명확할 때는 낮음).
알고리즘 1: Multimodal_Fusion (X, a):
입력:
X = 사전 처리된 제스처 시퀀스, a = 오디오 명령어
결과물:
O = VR 액션 명령어
1단계: 제스처 인식
2단계: 음성 이해
3단계: 융합 결정
기체:
4단계: 오류 처리
):
사용자 명확한 설명 요청
기체:
O 보내기 → VR 시스템
반환 O
이 알고리즘 1은 제스처 입력과 음성 입력을 전환하여 VR 디자인 작업에 강력한 명령을 생성합니다. 제스처 모듈(TCN)은 먼저 회전이나 스케일링과 같은 손 움직임을 해석하고 모델의 확실성에 따라 신뢰도 점수를 부여합니다. 이와 병행하여 음성 모듈은 ASR(예: Whisper)을 이용한 음성-텍스트 변환도 수행하며, '의자를 15° 회전시키기'와 같은 의미적 의도를 식별하기 위해 NLU를 적용합니다. 두 모듈 모두 예측과 신뢰도 점수를 반환합니다. 조합 단계는 두 출력을 균형 있게 맞춥니다. 두 입력이 모두 확정된 경우, 시스템은 신뢰 수준에 비례하여 결합합니다. 한 입력이 모호하면(예: 음성 잡음이나 불확실한 제스처), 시스템은 다른 입력을 더 우선시합니다. 마지막으로, 둘 다 확실하지 않으면, 시스템은 오류를 방지하기 위해 명확한 설명을 요청합니다. 이로 인해 퓨전은 적응형(입력 품질에 따라 가중치가 변함), 견고함(노이즈나 누락된 데이터를 수용), 그리고 정확하게(제스처와 음성 모두의 장점을 활용함) 갖게 됩니다.
참가자
이 연구에는 대학생과 디자인 관련 전문가 중에서 선발된 자원봉사자 그룹이 포함되어 VR 사용성에 대한 다양한 의견을 수집합니다. 참가자들의 연령은 초기부터 중년까지 다양했으며, 초보자, 가끔 사용하는 사용자, 고급 사용자 등 이전 VR 경험 수준이 혼합되어 있었습니다. 모든 참가자는 정상 또는 교정된 시력을 보였으며, 제스처 기반 상호작용에 실질적으로 지장을 줄 수 있는 운동 장애가 보고되지 않았습니다. 심각한 언어 장애, 주요 팔 이동성 제한, 또는 VR로 인한 멀미 병력이 있는 사람은 안전성과 참여 일관성을 위해 제외되었습니다. 모든 참가자는 사전 동의를 제공했으며, 평가 절차는 기관심사 위원회의 승인을 받았습니다. 이 하위절은 평가에 참여한 인물을 명확히 식별하여 연구의 재현성을 보장합니다.
실험 장치
제안된 실험 장치는 개발된 멀티모달 VR 시스템을 포함하며, 이는 손 추적 기능과 제스처 캡처를 위한 RGB 카메라가 장착된 소비자용 VR 헤드셋에 탑재되어 있습니다. 고성능 데스크톱을 탑재하여 제스처 인식, ASR, 다중 모달 융합 기술의 실시간 처리가 가능합니다. VR 환경은 Unity 3D로 구축되었으며, 가구, 재료, 조명 요소로 구성할 수 있는 홈 디자인 룸을 포함하고 있습니다. 이 구성은 음성 전사를 위한 Whisper 기반 ASR과 의도 감지를 위한 트랜스포머 기반 NLU 모듈을 포함합니다. 이 설명은 결과를 논의하기 전에 적절한 기술 환경 개요를 제공하기 위해 결과 섹션에서 이동되었습니다.
주관적 시험 시나리오
참가자들은 가구가 갖춰진 거실, 침실, 작은 작업 공간으로 구성된 모의 주택 디자인 환경에서 상호작용했습니다. 모든 시나리오에서 사용자는 현실적인 설계 상황에 따라 가상 객체와 주변 환경 변수를 변경하도록 요청받았습니다. 예를 들어, 참가자들은 소파를 기준점에 대해 위치시키거나, 의자를 특정 방향으로 회전시키거나, 테이블을 목표 크기로 조정하거나, 벽 재질/조명 프로필을 수정하도록 요청받았습니다. 이 시나리오들은 제스처 기반 제어(공간적 정밀도 측면에서)와 음성 기반 제어(의미 명령 측면에서) 모두에 도전하는 전형적인 인테리어 디자인 작업을 대표하기 때문에 선택되었습니다. 이 하위 섹션은 사용자가 시스템을 평가할 때 어떤 주관적 테스트 조건에서 이루어졌는지에 관한 리뷰어의 질문에 직접 답변합니다.
과제 설계
참가자들은 문항 조작과 디자인 상호작용의 다양한 영역을 다루는 체계적인 연습 과제를 수행했습니다. 주요 과제는 다음과 같았습니다: 1) 가구 배치: 참가자들은 목표 좌표에 물체를 배치했습니다. 2) 회전 작업: 이 작업에서는 사용자가 기준 각도에 맞게 방향을 변경해야 했습니다. 3) 확장 작업: 가구를 미리 설정된 크기로 크기 조정하는 작업이 포함되었습니다. 더불어, 4) 재질/색상 편집: 참가자들은 음성 명령을 사용해 텍스처를 변경하거나 조명을 수정했습니다. 가상 공간 인식 기능을 포착하기 위한 선택적 내비게이션 작업이 제공되었습니다. 각 작업은 명확한 목표, 정량화된 결과, 정해진 시간 제한을 가지고 설정되어 정확성과 효율성을 적절히 평가할 수 있도록 했습니다.
절차
참가자 간의 균일성을 보장하기 위해 평가는 계획된 순서대로 진행되었습니다. 사용자들은 먼저 시스템을 설명하고 제스처와 말 상호작용 방식에 대한 간단한 시연을 받았습니다. 초기 교정 단계를 통해 개별 손 자세와 음성 특성에 맞게 조정할 수 있었습니다. 사용자들은 두 모달리션에 익숙해지기 위해 짧은 연습 세션을 가졌습니다. 실제 평가는 컨트롤러 전용, 제스처만, 그리고 제스처와 음성 합쳐 멀티모달 입력 세 가지 상호작용 조건에서 모든 작업을 수행해야 했습니다. 학습 효과를 줄이기 위해 조건 순서가 균형 조정되었습니다. 마지막에 피험자들은 SUS, NASA-TLX, IPQ 등 표준화된 평가 도구를 완료하고 간단한 질적 피드백 인터뷰에 참여했습니다.
평가 지표
이 구조화된 절차는 방법론적 투명성을 확보하여 재현 연구를 가능하게 합니다. 객관적 및 주관적 지표를 결합하여 시스템 성능을 포괄적으로 평가하였습니다. 객관적 지표로는 효율성의 척도인 작업 완료 시간; 배치 정확도는 목표 위치나 회전에서 벗어난 정도로 정량화됩니다; 그리고 오류가 발생률은 시스템이 수행한 입력 오분류나 의도치 않은 행동의 수로 정의됩니다. 주관적 지표는 검증된 설문지를 사용하여 수집하였다: 인지된 사용성을 측정하는 시스템 사용성 척도, 정신적·신체적 작업량을 평가하는 NASA-TLX 척도, 그리고 VR 내 몰입도와 존재감을 측정하는 I 그룹 프레즌스 설문지. 이 내용은 결과 섹션에서 적절히 옮겨져 성과가 어떻게 측정되었는지 설명하기 위해 결과가 제시되었습니다.
VR 환경, 시스템 통합 및 평가
음성 및 제스처 명령의 주요 플랫폼은 시스템이 배치되는 인터랙티브 가상현실 환경입니다. 가구, 텍스처, 조명 요소의 통합 라이브러리를 사용해 Unity 3D에서 가상 방을 만듭니다. 사용자가 실시간으로 항목을 정리, 맞춤화, 편집할 수 있게 해줍니다. 정확도는 스냅 기능, 충돌 감지, 측정 오버레이를 통해 자연스럽게 정렬될 수 있게 합니다. 조명과 재질의 실시간 렌더링은 모든 상호작용에 즉각적인 피드백을 제공하여 디자인 경험을 향상시킵니다.
제스처 인식, 음성 이해, 멀티모달 융합을 위한 개별 모듈을 검증한 후, 이들은 통합된 파이프라인으로 통합됩니다. 시스템은 지연 시간이 낮도록 설계되어 사용자 명령이 VR 환경에서 거의 즉시 나타납니다. 소수의 회원으로 시범 시험을 진행하여 상호작용 흐름을 다듬고 있습니다. 이 과정에는 제스처 어휘, 음성 명령 문법 검증, 그리고 시스템이 지속적으로 사용할 때 자연스럽고 신뢰할 수 있게 느껴지도록 보장합니다.
다중 모달 제스처-음성 융합, 컨트롤러 전용 입력, 하이브리드 모드 등 세 가지 상호작용 방식을 비교한 종합 연구가 사용자 경험을 평가하는 데 사용될 예정입니다. 재료 교체, 회전, 물체 배치 등의 과제가 참가자들에게 요구됩니다. 성과 평가를 위해 직무 달성 시간, 배치 정확성, 오류 발생률과 같은 객관적인 지표를 수집합니다. 시스템 사용성 척도(SUS), NASA-TLX 인지 작업 부하, 몰입을 위한 IPQ 설문지와 같은 표준화된 설문지를 사용하여 참가자들로부터 주관적 평가를 도출하며, 참가자 인터뷰가 추가 지원을 제공합니다. 이 이중 평가는 정량화된 성과 측정과 주관적인 사용자 경험을 모두 포함합니다.
이 시스템의 발전은 멀티모달 퓨전을 기본 내비게이션이나 상호작용을 넘어 정밀 설계 작업에 적용하는 것입니다. 이 기법은 음성 지시의 의미적 가치와 제스처의 공간적 이점을 결합하여 보다 자연스럽고 정확하며 접근하기 쉬운 상호작용 방식을 제공합니다. 음성 전용 백업과 단일 손 제스처 인식 같은 유연한 접근성 기능을 제공함으로써 포용성을 강화합니다. 마지막으로, 이 연구는 음성-제스처 상호작용에 대한 체계적이고 주석이 달린 다중 모달 데이터셋을 제공하여 몰입형 인터페이스 설계의 향후 연구를 촉진하고 재현성을 강화합니다.
그림 3 은 구현된 프로그램의 일반적인 스크린샷을 보여주어, 구축된 VR 인테리어 디자인 시스템을 보다 생생하게 보여줍니다. 사용자가 방의 배치를 탐색하고 볼 수 있는 몰입형 가상현실 환경은 그림 3A에 묘사되어 있습니다. 그림 3B 는 자연스러운 손 상호작용을 통해 제스처 기반 객체 조작 과정에서 가상 가구를 선택, 이동, 회전시키는 방법을 보여줍니다. 그림 3C 는 통합 음성 인터페이스를 보여주며, 마이크와 음성 피드백 기호가 공간 변경이나 객체 배치를 위해 사용자가 발언한 음성 명령을 검증합니다. 이 제안된 다중 모달 VR 시스템의 스크린샷을 종합해 보면, 이 시스템이 완전히 구현되어 실시간 제스처와 음성 상호작용이 가능함을 보여줍니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
설계된 다중 모달 VR 홈 디자인 시스템은 세 가지 기본 데이터셋으로 검증되었습니다: EgoGesture(동적 제스처), IPN Hand(지속적인 손 제스처), Fluent Speech Commands(의도 슬롯 라벨이 있는 음성 명령). 세 데이터셋은 모두 합쳐 제스처 인식과 음성 기반 의미 이해를 모두 다루는 포괄적인 훈련 및 평가 기반을 제공했습니다. 검증 결과, 제스처-음성 통합이 컨트롤러 전용 및 하이브리드 입력 방식에 비해 작업 정확도를 크게 높이고 작업 부담을 줄인다는 점이 입증되었습니다.
실험 테스트 결과 다중 모달 융합 시스템이 배치 정확도를 약 30% 향상시켜 작업 실행 시간과 오류율을 감소시켰습니다. 표준화된 측정 지표(SUS, NASA-TLX, IPQ)를 사용한 주관적 평가는 사용성 평가 향상, 인지 부하 감소, 몰입 등급 향상을 보여주었습니다. 이 모든 발견은 공간 조작을 위한 제스처와 의미적/수치 조정을 위한 음성 명령의 조합이 VR 기반 주택 설계에 더...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구 결과는 기본 논문의 기술을 발전시켰으며, 이 논문은 제스처와 음성 모드를 결합해 디자인 작업을 통해 접근성을 위한 몰입형 VR 내비게이션의 장점을 주로 보여주었습니다. 멀티모달 시스템은 모든 객관적 및 주관적 성능 지표에서 더 우수한 성능을 보였으며, 제어 기반 및 하이브리드 방식보다 작업 완료 시간이 짧고, 배치 정확도가 높으며, 오류율이 낮았습니다. 더불어 SUS, NASA-TLX, IPQ와 같은 사용성 지표들은 사용자 만족도가 높아지고, 작업량이 감소하며, 몰입도 향상을 보여주었습니다. 기본 논문이 내비게이션 접근성에 초점을 맞춘 것과 달리, 이 연구는 다중 모달 VR 상호작용이 가상 디자인 작업을 수행할 때 정밀도, 창의성, 포용성을 높인다는 것을 증명합니다. 그럼에도 불구하고 저조도 제스처 분류 오류나 소음 섞인 음성 인식 문제도 여전히 존재해 더 다듬어질 여지가 있음을 시사합니다. 전반적으로 이 연구는 다중 모달 상호작용이 VR의 사용성, 접근성, ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이해 상충을 선언할 필요가 없습니다.
저자들은 이 연구 과정에서 자원과 학술 지도를 제공해 준 건축·건축·건축·디자인 스쿨과 테일러스 대학교 디자인 스쿨의 기관적 지원에 깊이 감사드립니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| EgoGesture 데이터셋 | 난양공업대학교 | DOI: 10.1109/TMM.2018.2808769 | 동적 제스처 인식 훈련을 위한 대규모 자기중심적 손동작 데이터셋. |
| 유창한 음성 명령 데이터셋 | Fluent.ai / 앨버타 대학교 | DOI: 10.48550/arXiv.1804.04363 | ASR/NLU 교육을 위한 음성 의도 및 슬롯 기반 의미 이해를 위한 데이터셋. |
| HaGRID 데이터셋 (선택 사항) | Sber AI / 오픈 소스 | 버전 1.1 | 정적 손 제스처 감지기 사전 학습에 사용되는 선택적 데이터셋입니다. |
| I그룹 존재 설문지(IPQ) | igroup.org | 해당 없음 | VR 환경에서 몰입도와 존재감을 측정하는 데 사용됩니다. |
| IPN 핸드 데이터셋 | 베라크루자나 대학교 | DOI: 10.1109/CVPRW50498.2020.00241 | 연속적이고 자연스러운 손짓 인식 및 세분화 작업을 위한 데이터셋. |
| 매트플롯립 / 씨본 | 오픈 소스 | 최신 멤버 | 성과 지표와 평가 결과의 시각화에 사용됩니다. |
| 미디어파이프 핸즈 | 구글 리서치 | 오픈소스 (GitHub) | 실시간 손 및 제스처 추적에 사용되어 제스처 입력 인식을 지원합니다. |
| 모질라 공통 음성 (선택 사항) | 모질라 재단 | 버전 17 | 일반 음성 데이터를 대상으로 ASR 모델을 사전 학습하기 위한 선택적 데이터셋입니다. |
| 다중 모달 융합층 | 맞춤형 알고리즘 | 해당 없음 | 신뢰도 가중 중재를 기반으로 제스처와 음성 입력 스트림을 융합합니다. |
| NASA-TLX 업무량 평가 | NASA 인간공학 | 해당 없음 | 참가자의 인지 업무량 분석에 사용됩니다. |
| 자연어 이해(NLU) 모듈 | 커스텀 (BERT / RoBERTa 기반) | 해당 없음 | 전사된 음성 입력에서 의미적 의도와 슬롯(동작, 객체, 매개변수)을 추출하는 데 사용됩니다. |
| 넘피 / 판다스 / 오픈CV | 오픈 소스 | 최신 멤버 | 수치 연산, 데이터 전처리, 비디오 프레임 조작에 사용됩니다. |
| 파이썬 프로그래밍 언어 | 파이썬 소프트웨어 재단 | 버전 3.10+ | 머신러닝 모델 구현(TCN, ASR, NLU, FUSION)에 사용됩니다. |
| PyTorch 딥러닝 프레임워크 | 메타 AI | 버전 2.0+ | 제스처 인식(TCN) 및 NLU 모델 구축 및 훈련에 사용됩니다. |
| RGB 카메라 | 로지텍 / 리얼센스 | 로지텍 C920 또는 인텔 리얼센스 D435 | 손 제스처 캡처와 모션 인식 입력에 사용됩니다. |
| 시스템 사용성 척도(SUS) 설문지 | 표준 평가 도구 | 해당 없음 | VR 시스템의 주관적 사용성 평가에 사용됩니다. |
| 시간 합성곱 네트워크(TCN) | 커스텀 구현 (PyTorch / TensorFlow) | 해당 없음 | 시계열 골격 데이터에서 동적 제스처 인식에 사용됩니다. |
| Unity 3D 엔진 | 유니티 테크놀로지스 | 버전 2022.3 LTS | 인터랙티브 가구, 재질 편집, 실시간 렌더링이 포함된 몰입형 VR 환경 개발에 사용됩니다. |
| VR 헤드셋 | Oculus (메타) / HTC Vive | Oculus Quest 2 또는 HTC Vive Pro | VR 상호작용 중 몰입형 시각화와 공간 추적에 사용됩니다. |
| 위스퍼 ASR 모델 | 오픈AI | 위스퍼 (기본 모델) | 음성 인식 엔진, 즉 음성 인식 엔진을 텍스트로 변환합니다. |
| 워크스테이션 | 맞춤 제작 PC | 인텔 코어 i7 / NVIDIA RTX 3070 / 32GB RAM | 제스처 및 음성 모델의 실시간 처리, 훈련 및 추론에 사용됩니다. |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청