Review Article

원활한 다중 모달 인간-로봇 통신: 인간-컴퓨터 상호작용에서의 통합 기법

DOI:

10.3791/70218

June 9th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 리뷰는 인간과 로봇 간의 원활하고 적응적이며 인간 중심적인 소통을 가능하게 하는 딥러닝, 다중 모달 센싱, 통합 전략의 최근 발전을 종합합니다.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

사회적, 보조적, 교육용 로봇이 가정, 의료 시설, 교실 등 일상 환경으로 진입함에 따라, 말, 몸짓, 시선, 표정, 촉각 신호를 고정밀도, 낮은 지연, 그리고 현실 세계의 견고함으로 통합해야 하는 상황에서 원활한 다중 모드 인간-로봇 통신이 필수적이 되었습니다. 본 리뷰는 현재 기법들이 실시간으로 상호적으로 다중 모달 인간-로봇 상호작용(HRI)을 어떻게 달성하는지 체계적으로 검토하며, 융합 전략, 시스템 아키텍처 및 특정 영역에서의 응용에 초점을 맞춥니다. 우리는 2015년부터 2025년까지 Web of Science Core Collection에서 영어 실증 연구를 검색하여 의사소통 통합을 다루는 148편의 논문을 선정했습니다. 가장 중요한 통찰은 2022년 이후 하이브리드 및 주의 기반 융합으로의 명확한 전환(약 43%)으로, 이는 이전 방법보다 시간 비동기와 체화된 상호작용을 더 잘 다룬다는 점입니다; 교차 연구 비교를 방해하는 평가 지표의 광범위한 불일치; 그리고 잡음, 가림, 사용자 변동성에 따른 강한 실험실 성능과 실제 강인성 사이의 지속적인 격차가 존재합니다. 주요 과제로는 실시간 처리, 의미론적 정렬, 데이터 효율성, 배포의 견고성, 그리고 촉각 신호와 영향력 간의 충분히 탐구되지 않은 통합이 포함됩니다. 앞으로는 적응형 융합 정책, 동기화 및 유창성에 대한 표준화된 벤치마크, 그리고 사용자 맞춤형 적응을 가능하게 하는 지속적인 학습을 우선시할 것을 제안합니다. 궁극적으로, 협업적이고 의미 있게 참여할 수 있으며 일상생활에서 사회적으로 수용 가능한 보다 인간 중심의 로봇 에이전트 개발을 안내하는 것을 목표로 합니다.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

로봇은 구조화된 환경에서의 산업 도구에서 가정, 병원, 교실 등 사회적으로 내재된 행위자로 진화해 왔습니다. 이들은 이제 교육, 치료, 동반자 관계에 도움을 주며, 작업 지향적 자동화에서 사용자 중심의 적응형 상호작용으로의 전환을 반영합니다. 이 전환의 핵심에는 다중 모드 커뮤니케이션이 있어, 로봇이 인간의 신호—말, 시선, 몸짓, 표정, 촉각 등—에 대해 시간적 정밀함으로 인식하고 반응할 수 있게 합니다. 이는 역동적인 환경에서 자연스러운 교환을 가능하게 합니다. 이러한 조정과 반응성에 대한 강조는 인간-컴퓨터 상호작용과 인지과학의 중심적 관심사와 일치합니다. 본 리뷰에서 원활한 다중 모달 통신은 사용자에게 유연하고 직관적으로 느껴지는 상호작용을 의미하며, 응답 시간은 1초 미만(보통 300ms 미만), 인지할 수 있는 지연이나 불일치가 최소화되어 있으며, 실제 세계 변동성에 대한 강력한 적응이 특징입니다. 이는 타이밍 오류, 모달리티 실패, 경직된 응답이 자연스러운 흐름을 방해하는 전통적인 명령 기반 또는 유니모달 시스템과 구별됩니다.

인간-로봇 상호작용(HRI) 내에서 본 리뷰는 인간-로봇 통신, 즉 인간과 로봇 간의 상호 실시간 다중 모달 신호 교환에 초점을 맞춥니다. HRI는 계획, 통제, 안전도 포함하지만, 의사소통은 감각 채널 전반에 걸친 지각과 행동의 동기화에 관한 것입니다. 초기 명령 기반 시스템은 교전보다 효율성을 우선시하여 경직되거나 지연된 행동을 초래하는 경우가 많았습니다. 현대 연구는 사용자 상태와 감정을 수용하는 적응적이고 맥락 인식 모델을 추구합니다 1,2. 이러한 진화는 정밀하고 직관적이며 개인화된 상호작용 프레임워크의 필요성을 강조합니다.

초기 사회 및 보조 로봇은 일반적으로 스크립트화된 루틴이나 음성 또는 터치와 같은 단일 모달리티 입력에 의존하여 유연성을 제한했습니다. 규칙 기반 논리와 느린 처리 때문에 제스처와 음성 간의 타이밍 불일치나 사용자 행동에 대한 적응 부족이 자주 발생했습니다. 이러한 문제를 해결하기 위해 연구자들은 저지연 융합, 다중 모달 감각 통합, 사용자 적응 학습을 활용합니다 4,5. 이 전략들은 HRI에서 널리 인정받는 세 가지 기본 의사소통 원칙을 통해 이해할 수 있습니다: 상보성(모달리즘이 서로를 보완), 중복성(중첩이 견고성을 향상시키며), 시너지(수렴이 자연성을 증진)입니다.

감지와 학습의 발전으로 시각, 청각, 촉각, 생리적 입력을 실시간으로 통합하는 사회적 반응형 로봇이 탄생했습니다 5,6. 고정된 스크립트 대신, 이 시스템들은 사용자 신호에 지속적으로 적응합니다. 접근 가능한 프로그래밍 인터페이스와 시연 학습 방법 덕분에 교육자와 치료사는 정밀함, 반응성, 적응력이 필수적인 돌봄과 지도에 맞춰 행동을 맞춤화할 수 있습니다.

사회적 HRI에서의 의사소통 패턴은 병렬, 보완, 상호작용 모드로 분류할 수 있다(그림 1). 병렬 상호작용에서는 인간과 로봇이 최소한의 교환으로 독립적으로 행동합니다. 상호작용은 구조화된 프롬프트나 이벤트 기반 지원을 도입합니다. 가장 발전된 상호작용 모드는 음성 전환, 움직임, 시선7 등 채널 간 지속적인 양방향 조정을 포함합니다.

문헌 선정 및 분석

체계적 문헌고찰 방법론: 우리는 Web of Science Core Collection에서 동료 검토를 거친 학술지 논문과 주요 출판사(IEEE, ACM, Springer, Elsevier, Wiley, Taylor & Francis)의 전체 학술 논문집을 대상으로 체계적인 문헌 검색을 수행했습니다. 불리언 쿼리는 다음과 같았습니다: (("인간-로봇 상호작용" 또는 HRI) 그리고 (멀티모달 또는 "센서 융합" 또는 제스처 또는 시선, 음성 또는 촉각) 그리고 ("실시간" 또는 "저지연" 또는 적응형 또는 견고함)). 포함 기준은 다음과 같습니다: 2015년 1월부터 2025년까지의 영어 출판물로, 이는 규칙 기반의 단일 모달리티 시스템에서 저지연, 적응형, 견고한 상호작용을 강조하는 딥러닝 아키텍처로의 전환을 포착한 시기로, 의사소통적 HRI와 경험적 검증(정량적 또는 정성적)을 위한 다중 모달 통합 기법에 중점을 두었습니다. 우리는 단일 모달 상호작용에 한정된 연구, 의사소통적 의도 없이 로봇 제어를 다루는 연구, 그리고 순수 이론적 또는 시뮬레이션 전용으로 비실증적 연구를 제외하였습니다. 초기 수색에서는 상당한 자료가 나왔다. 중복 항목을 제거한 후, 제목과 초록을 포함 기준에 따라 선별한 후, 신뢰할 수 있는 다중 모달 융합에 대한 관련성과 기여도를 평가하기 위해 전체 텍스트 검토를 실시하였습니다. 이 다단계 과정은 PRISMA 스타일 플로우차트(그림 2)로 요약되었으며, 이 리뷰의 실증적 기초를 이루는 148편의 논문으로 구성된 최종 코퍼스를 완성했습니다.

선정된 문헌 개요: 그림 3 은 출판 동향과 학문 분야별 분포를 보여주며, 컴퓨터 과학과 자동화 및 로보틱스가 주도하고 행동과학과 신경과학의 기여가 증가하고 있어 이 분야의 학제간 궤적을 강조합니다. 우리는 다중양식 통합에 대한 기술적 기여에 따라 문헌을 주제별로 군집화했습니다(표 1). 이 종합은 모달리티, 융합 방법, 지연 처리, 견고성 전략, 적응성, 지표를 다루었습니다. 2019년부터 2021년까지의 연구들은 주로 초기 또는 후기 융합을 사용했으며, 종종 제스처와 촉각 입력에 중점을 두었습니다. 2022년 이후, 하이브리드 및 주의 기반 아키텍처가 특히 감정적이고 체화된 상호작용에서 인기를 얻고 있습니다. 이 말뭉치에서 하이브리드 융합은 약 43%, 초기 융합이 29%, 후기 융합이 28%를 차지하는데, 이는 시간적 비동기에 대한 내성이 향상되었음을 시사합니다.

실시간 능력은 초기 검토된 광범위한 문헌에서 일반적으로 주장되지만, 구체적인 완화 전략(예: 버퍼 처리, 예측 모델, 센서 수준 최적화)을 상세히 다룬 연구는 소수에 불과합니다. 강인성은 일반적으로 필터링, 중복, 또는 규칙 기반 대체 장치에 의존하는 반면, 예측적 적응은 드물다. 평가 관행은 일관성이 없으며, 시간적 동기화나 상호작용 유창성에 대한 표준화된 평가는 여전히 드물다. 연구 간에 지표가 너무 다양해 직접 비교가 어렵습니다. 정확도, F1 점수, 지연 수치는 흔하지만, 이는 서로 다른 데이터셋, 과제, 환경 조건에서 비롯됩니다; 시간적 정렬이나 노이즈 강인성에 대한 공유 벤치마크를 채택하는 논문은 드뭅니다. 따라서 클린랩 환경에서 강한 성능은 외부 제어 환경에서 달성할 수 있는 방법을 과대평가하는 경우가 많습니다. 일관된 평가 체계—현실적인 변동성 하에서의 표준화된 지연 검사를 포함하여—을 개발하면 어떤 접근법이 이 분야를 진정으로 발전시키는지 판단하기가 훨씬 쉬워질 것입니다.

촉각-정서 통합(8,9,10,11,12,13 연구만 다루었음)과 사용자 주도 시간 불확실성 하에서의 동적 지연 조정에서 주요 격차가 남아 있습니다. 문헌에서 몇 가지 흥미로운 긴장이 드러난다. 하이브리드 핵융합은 시간적 불정렬을 잘 다룬다는 점에서 종종 칭찬받지만, 진정으로 예측적이거나 적응적인 행동은 드물어, 그 실시간 성능이 얼마나 매끄럽게 작동하는지 의문이 제기됩니다. 동시에, 시각 및 음성 기반 감정 인식에서의 인상적인 진전은 촉각 신호와 감정 이해를 통합하는 최소한의 연구와는 극명한 대조를 이룹니다. 통제된 실험에서의 높은 정확도는 실제 환경에서도 저하되는 경향이 있어, 환경과 사용자 간 일반화에 지속적인 어려움이 있음을 보여줍니다. 표 2는 대표적인 아키텍처 경향과 평가 접근법을 요약하여 이후 섹션에서 논의하는 도전 과제를 설명합니다.

이 리뷰는 다중 모드 HRI 문헌에 뚜렷한 기여를 합니다. 최근 설문조사, 예를 들어 Zhao 등14는 지각 기반 의사결정에 대한 폭넓은 개요를 제공하며, Wang 등(15 )은 5G 기반 시각-촉각 전송에 초점을 맞춥니다. 두 경우 모두 일반적인 프레임워크나 통신 프로토콜을 강조하며, 실시간 핵융합의 트레이드오프, 지표 비교 가능성, 배포 문제에 대한 논의는 제한적입니다. 반면, 우리는 보다 목표 있는 분석을 제공합니다: 특정 제약 조건 하에서 융합 전략을 비교하고, 교차 연구 지표 불일치를 비판하며, 이전 설문조사에서 대체로 간과했던 실험실과 현장 간 성과 격차를 강조합니다.

Access restricted. Please log in or start a trial to view this content.

Review and Perspective

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

로봇이 가정, 교실, 의료 환경에서 필수적인 존재가 됨에 따라, 자연스럽고 적응적인 의사소통이 성공에 매우 중요합니다. 점점 더 도구로서가 아니라 사회적 파트너로 인식되는 이들은 다양한 양상에 걸쳐 인간의 신호를 인지하고 해석하며 반응해야 합니다. 사용자의 의도를 정확히 포착하고 시기적절한 피드백을 제공하는 시스템은 특히 아동, 노인, 장애인과 교류할 때 업무 수행, 신뢰, 정서적 편안함을 향상시킵니다. 이를 달성하려면 로봇의 반응을 인간의 지속적인 행동과 일치시키는 직관적이고 지속적인 상호작용이 필요합니다. 이러한 유창성은 인간의 의사소통 자체를 반영하는 메커니즘을 통해 통합된 다중 모드 입력—음성, 시선, 몸짓, 얼굴 표정—을 요구한다14,16.

인식 및 소통 채널
시각은 다중 모달 인간-로봇 상호작용의 기초로 남아 있습니다. 얼굴 표정, 시선, 자세, 제스처와 같은 시각적 단서가 의도 인식, 감정 추론, 참여 추적 17,18,19,20,21의 기반이 됩니다. 초기 수작업으로 하르 검출22 또는 배경 감산23을 사용한 방법들은 종종 가림막이나 조명 변화 시 실패했습니다16,21. 딥러닝 시스템이 현재 주류를 이루고 있으며, CNN과 다중 카메라 입력을 가진 반복 모델을 활용하고 있습니다. 그림 4는 실시간 제스처 모니터링에서 모션 오차를 27% 줄여주는 HI-ROS 트래킹 파이프라인을 보여줍니다.

시선, 팔, 머리 신호의 통합은 사용자 행동 예측을 향상시키며(17), 고유수용감각과 깊이 융합은 정밀도를 높입니다(24,25). 상호 시선19와 생체 모방 눈 설계18은 신뢰와 조정에서 미묘한 신호의 역할을 더욱 입증합니다. 그림 526의 아키텍처를 보여주며, 이중 Leap 모션 컨트롤러가 손의 움직임을 포착하고, LSTM-RNN을 통해 견고한 외과적 원격 수술을 가능하게 합니다. 최근 멀티카메라 시스템인 Hi-ROS20, RPF21, 27은 비구조화된 환경에서 사람 추적을 향상시킵니다. 그림 6은 연속 분류기 세분화를 통해 차단 상태에서도 추적을 유지하는 적응형 ReID 수명 주기를 보여줍니다. 능동적 라벨링28과 의미 기반 SLAM26에 대한 보완 연구는 맥락 인식을 향상시키며, 지각을 객체 인식에서 행동 이해로 확장합니다.

언어는 병렬 의사소통 채널을 제공합니다. 초기 규칙 기반 대화 시스템은 모호성 문제로 어려움을 겪었고, 데이터 기반 및 트랜스포머 기반 모델의 채택을 촉진했습니다29. 감정적·사회적 반응성이 이제 핵심입니다: 다중 모달 시스템은 적응적 대화를 위해 얼굴과 음성 신호를 정렬합니다 2,30. 강화 학습은 정서적 신호와 음향적 신호 5,31,32 간의 조정을 향상시킵니다. GPT-333, ChatGPT34와 같은 대형 언어 모델은 35,36,37 작업 전반에 걸쳐 맥락적 추론과 지시 추론을 가능하게 합니다. 이들은 38,39,40,41,42,43,44 비전 및 보상 모델링과 통합되어 사회적 인식이 있고 일반화된 상호작용을 지원합니다.

청각 지각은 시각과 언어를 보완합니다. 운율, 음정, 리듬은 시각적 단서가 신뢰할 수 없을 때 의도를 전달합니다. 강화 기반 특징 추출은 말과 표현 간의 동기화를 향상시킵니다. AVA ActiveSpeaker45, AFFECT-HRI5, SAVEn-Vid46, HumorHRI47, CHiME-5와 같은 데이터셋은 소음이 많은 정서적 환경에서 모델의 견고성을 풍부하게 합니다. Pan 등은 다중 화자 장면에서 말-입술 동기화를 발전시키 고, 촉각 또는 생리적 입력과의 다중 모드 융합은 적응 행동에 영향을 준다.

신체적 및 생리적 감각
촉각적·생리적 인식은 사회적·신체적 인식을 향상시킵니다. 힘, 압력, 생체 신호는 의도, 스트레스, 참여를 추론할 수 있게 합니다. TACTO4 와 같은 비전 기반 촉각 시뮬레이터와 FOTS48 과 같은 신경 매퍼는 300fps의 고해상도 접촉 데이터를 생성하여 저지연 제어를 지원합니다. FOTS는 학습된 반사 함수 R을 통해 조명과 변형을 모델링합니다:

방정식 1

그리고 그림자 투사:

방정식 2

여기서 Ms 는 투영 기하학을 인코딩한다. 자기유변 탄성체49, EtherCAT 센서배열 50, 보조 홀 효과 재료51을 사용하여 고해상도 촉각 피부가 구현되었습니다. DiGeTac13 과 같은 시스템은 모듈식 파이프라인을 통해 제스처, 촉각, 거리 신호를 통합합니다. 비행 시간 거리 데이터 필터링은 다음과 같이 모델링됩니다:

방정식 3

그 다음으로 신경 제스처 분류와 CNN 기반 접촉 위치 파악이 이어집니다. 안전 제어는 분리 d에 따라 로봇 속도를 조절하여 시행됩니다. 이 모듈들은 견고한 인간-로봇 협업을 가능하게 합니다. 멀티모달 변압기는 촉각, 시각, 텍스트 신호를 추가로 통합합니다. TVT-Transformer6 는 모달리티별 표현(qi, ki, vi)을 결합 행렬에 정렬합니다:

방정식 4

통합된 이해를 위한 교차 모달 자기 주의를 가능하게 합니다(그림 7).

생리적 감각은 감정적 정렬을 향상시킵니다. Heinisch 등5는 정서 모델링을 위해 생리적 및 청각적 신호를 동기화합니다. 근전도(electromyography) 기반 시스템52,53은 제스처와 무음 음성 해독을 담당하며, MetaSonic54는 음향 위치 파악을 통해 공간 인식을 향상시킵니다. AgiBot World Colosseo55와 같은 대규모 데이터셋은 100만 개 이상의 촉각-시각 궤적을 가진 다중 모달 훈련을 지원합니다. 이러한 진전들은 단일양식 지각에서 사회적, 물리적, 내적 상태에 대한 통합적 이해로의 전환을 의미합니다. 향상된 감지 정확도는 로봇이 접촉을 측정하는 것뿐만 아니라 망설임, 긴장, 불편함을 해석하여 민감도와 적응적 제어로 반응할 수 있게 하며, 이는 이후 섹션에서 논의하는 원활한 다중 모드 프레임워크의 핵심 기반입니다.

다중 모달 융합 및 표현 학습
융합은 분산된 감각 흐름을 일관되고 맥락 인식 있는 제어로 변환할 수 있게 합니다. 접근법은 일반적으로 초기 핵융합, 후기 핵융합, 하이브리드 핵융합으로 분류됩니다. 초기 융합은 입력 단계에서 특징을 통합하여 말-제스처나 얼굴-요율 정렬과 같은 동기화된 단서를 지원합니다. Tsai 등의 멀티모달 트랜스포머14 는 시각, 음향, 텍스트 신호의 주의 기반 초기 통합을 잘 보여줍니다. Xue 등은 얼굴 랜드마크와 음성 특징의 잔존 결합을 통해 이를 확장하여 조명 변화 하에서의 견고성을 향상시켰고, Hu 등은 MMSERNet57을 제안하는데, 이는 확장된 합성곱과 잔류 융합을 이용해 MFCC, 스펙트로그램, 어휘 특징을 결합하여 감정 인식을 위한 다중 규모 융합 네트워크입니다. 퓨즈 출력은 다음과 같이 표현됩니다:

방정식 5

반면 후기 융합은 독립적인 처리 후 결정을 결합하여 비동기 또는 잡음이 많은 입력에 대한 더 높은 내성을 제공합니다. 예로는 수중 HRI58,59에서 시선, 관성, 운동 신호의 의사결정 수준 조합이 있습니다. 하이브리드 융합은 두 접근법을 통합하여 이질적 모달리를 공유 임베딩 공간에 매핑하면서 시간적 특이성을 유지합니다. 멀티모달 뇌-컴퓨터 융합 네트워크60은 분류 전에 EEG와 시각적 특징을 정렬하며, 3D 자세 추정을 위한 교차 모달 설계는 관성 데이터와 단안경 데이터를 결합합니다61. 최근 프레임워크는 컨볼루션, 재발, 트랜스포머 층을 결합하여 주의 정렬62,63을 사용하며, 맥락 또는 과제 관련성에 따라 모달리티를 동적으로 가중치로 가중치합니다64,65,66. 조기, 후기 핵융합, 하이브리드 핵융합 중 선택은 모두에게 똑같이 적용되는 문제가 아닙니다. 초기 융합은 모달리티가 밀접하게 동기화되고 잡음 수준이 낮을 때 잘 작동하여, 모델이 처음부터 풍부한 교차 모달 관계를 포착할 수 있게 합니다. 반면 후기 핵융합은 각 모달리티가 독립적으로 처리되어 결정이 결합되기 전에 혼란스럽고 비동기적인 실제 환경에서 일반적으로 더 견고합니다. 최근 연구의 약 43%에 등장하는 하이브리드 접근법은 특히 감정적 상호작용과 체체적 상호작용에서 동적으로 균형 잡힌 입력에 주의를 기울임으로써 유용한 중간 지점을 찾지만, 계산 요구량이 증가합니다. 궁극적으로 최선의 전략은 구체적인 작업, 노이즈 프로파일, 하드웨어 제약에 따라 달라지므로, 미래 시스템에서는 융합 모드를 실시간으로 전환하는 것이 도움이 될 수 있습니다.

양상 간 상보성도 맥락에 따라 크게 달라집니다. 시각과 촉각이 결합된 경우, 촉각 피드백이 시각적 가림, 조명 변화, 거리 제한을 보완하고 오디오가 제공할 수 없는 정확한 힘과 접촉 정보를 제공하는 근거리 물리적 작업, 예를 들어 잡기나 물체 전달과 같은 근거리 물리적 작업에서 특히 효과적입니다. 반대로, 시각과 오디오가 결합된 경우, 시끄러운 환경에서의 감정 인식이나 대화와 같은 먼 거리나 사회적 환경에서 더 잘 작동합니다. 이때 운율과 음조가 의도를 담고 시각 단서가 불가능하거나 신뢰할 수 없을 때 영향을 미칩니다.

고전적인 초기 및 후기 및 하이브리드 프레임워크를 넘어, 딥러닝은 보다 세분화된 분류를 가능하게 했습니다. 주의 기반 융합은 모델이 입력별로 동적 양상 중요성을 학습할 수 있게 하여, 엄격한 단계 경계 없이 작업 및 맥락별 통합 경로를 효과적으로 생성합니다. 학습된 융합 전략은 전체 융합 과정을 종단 간 미분 가능한 모듈로 다루어, 네트워크가 데이터로부터 직접 최적의 조합 패턴을 발견하도록 합니다. 이러한 발전은 미리 정의된 규칙에서 실시간 다중 모달 HRI의 복잡성을 더 잘 다루는 완전한 데이터 기반의 적응형 아키텍처로 패러다임을 이동시킵니다.

시각-언어 기반
대형 언어 모델의 급속한 성장은 특히 시각-언어 모델(VLM)을 통해 다중 양식 추론의 범위를 확장시켰습니다. 이러한 아키텍처는 언어적·시각적 정보를 정렬하여 로봇이 명령을 해석하고, 장면을 인지하며, 문맥에 민감한 행동을 생성할 수 있도록 합니다. LXMERT64 와 CLIP66 과 같은 기초 프레임워크는 이미지-텍스트 정렬을 위한 공동 임베딩을 확립했습니다. 플라밍고65 는 소수 샷 멀티모달 추론을 도입했고, Maggio의 Clio39 는 CLIP 의미론을 통해 명령어를 씬 그래프에 동적으로 연결합니다. Gao 등은 다중 모달 예측을 기반으로 한 예측 계획용 LAMARS를 개발했고 , Xie 등은 효율적인 제스처 이해를 위한 시공간 합성곱 모델을 적용했습니다 . Arenas 등은 개인화된 상호작용 스타일을 위한 프롬프트 기반 맞춤화를 도입했습니다. 이 시스템들은 빨간 컵을 집어 들 기 같은 명령어를 장면 의미론에 직접 적용할 수 있게 해줍니다.

공간 추론과의 통합은 로봇의 내비게이션과 해석을 더욱 향상시킵니다. Wilson의 LatentBKI38 은 복셀 기반 공간 지도에 지시를 기반화하며, Nwankwo 등은 대규모 언어 모델과 VLM 추론을 융합 하여 시각적 불확실성 하에서 대화 행위를 해석합니다. 이벤트 기반 세분화와 비동기 지각 방법은 동적 작업에 효율성을 높입니다. 전체적으로 VLM은 상징적 지시와 체화된 이해 사이의 다리 역할을 하며, 유연한 상호작용을 위한 인지 기반을 제공합니다.

도메인 특화 응용
의료 및 노인 돌봄 분야에서 다중 모드 의사소통은 안전하고 직관적이며 공감 어린 도움을 가능하게 합니다. 핵심 기능인 낙상 감지, 일상 활동 모니터링, 응급 대응은 자세, 목소리, 얼굴 신호에 의존합니다. 계층적 제어 모델은 팔 보조 로봇의 움직임 정밀도를향상시키며, 고유수용감각은 협동 착용 보조자를 안내합니다69. 그림 8에 묘사된 객체 핸드오버는 동기화된 지각과 운동 협응의 예시입니다70. LOVOT와 같은 시스템을 통해 연구된 감정적 반응성은 사용자 신뢰를 촉진하지만 과도한 의존에 대한 윤리적 우려를 제기합니다.

사회적 로봇은 가정과 공공장소에서 공감과 신뢰를 유지하기 위해 유연하고 다중 모드의 반응성을 필요로 합니다. 그림 9는 감지, 계획, 사회정서적 추론 층을 통합한 전형적인 아키텍처를 제시합니다. 지각과 통합된 대형 언어 모델은 시선과 톤40에 의해 조절된 개방형 대화를 가능하게 합니다. 소아 연구들은 표현적 움직임과 운율이 아동의 불안을 감소시킨다는 것을 보여주며,문조사에서는 비언어적 행동이 참여의 결정 요인으로 강조된다고 합니다8. RoboAgent37과 Sub-Prior-guided Ant Colony Optimization72와 같은 능동적 모델은 공동 목표 탐색을 가능하게 합니다. 내부 상태(준비, 혼란)를 표현할 수 있는 시스템73은 투명성과 조정을 향상시키며, 적응적 사회적 행위자는 집단 협업을 매개합니다74,75.

교육 로봇: 교육에서 다중 모달 HRI는 신체 및 사회적 신호를 활용하여 동기와 학습을 촉진합니다. 제스처, 얼굴, 언어 신호를 결합하면 접근성과 참여도가향상됩니다 6,9,77,78. 감정 적응력은 어린 학습자를 지원합니다: 정서 상태를 감지하고 말과 움직임을 조절하는 시스템은 주의력과 어휘력을 증가시킵니다 7,79. 가상현실과의 통합은 몰입감을 높이지만확장성에 도전이 됩니다. 이 시스템들은 로봇의 역할을 강사에서 감정적으로 민감한 협력자로 전환시킵니다.

개인화는 멀티모달 시스템에서 관련성과 신뢰를 보장합니다71, 81, 82. 윤리적 개인화는 자율성과 공감의 균형을 맞추며, 참여 피드백을 통해 맞춤형 답변을 제공합니다. Maaz 등은 얼굴 및 인지 신호에 따라 정서적 튜터링을 입증했고, Gomez-Izquierdo 등은 동기화된 행동에 대한 사용자 선호도를 모델링했습니다. 개인 맞춤형 적응은 다음과 같이 공식화할 수 있습니다:

식은 6

여기서 w는 학습된 선호 가중치입니다. RFIS와 같은 구현은 엣지85에서 실시간 사람 재식별과 제스처 인식을 달성하며, 고유수용 터치 인터페이스10은 직관적인 물리적 통신을 가능하게 합니다. 사회적 인식 효과는 개인화 결과를 더욱 조절하며, 내레이터 정체성이 사용자 반응 타이밍과 발화 길이를 변화시킵니다86. 개인화는 사용자를 수동적인 수혜자에서 공동 설계자로 변화시키며, 상호 적응을 통해 상호작용을 형성합니다.

검토된 많은 연구가 연구 프로토타입 상태에 남아 있지만, 여러 다중 모달 HRI 기법은 연구 프로토타입에서 상업적 또는 산업적 응용으로 전환되었습니다. 예를 들어, 소프트뱅크의 페퍼 로봇은 소매 및 교육 환경에서 고객 서비스와 교육을 위해 음성 인식, 제스처, 얼굴 인식을 통합합니다87. 토요타의 휴먼 서포트 로봇은 가정과 의료 시설에서 보조 작업을 위해 시각-제스처 융합을 적용합니다88. 이러한 상업적 구현은 종종 융합 전략을 단순화하며, 신뢰성과 저비용 보장을 위해 규칙 기반 후속 또는 하이브리드 방식을 사용하여 첨단 학술 모델과 확장 가능한 산업 솔루션 간의 지속적인 격차를 강조합니다. 이 격차를 메우려면 엣지 배포와 엄격한 실제 검증에 더 큰 비중을 둘 필요가 있습니다.

HRI에서 원활한 소통의 도전 과제
다중 모달 감지와 핵융합의 발전에도 불구하고, 통제된 환경 밖에서 인간-로봇 통신을 원활하게 유지하는 것은 여전히 어렵습니다. 실험실에서 뛰어난 모델들은 노이즈, 지연, 가림, 의도 변화, 자원 한계 등으로 인해 종종 성능이 저하됩니다. 문헌은 시각-언어 통합, 실시간 동기화, 다중 모달의 견고성, 의미적 정밀도, 데이터셋 커버리지, 배포 제약 등 여섯 가지 얽힌 장벽에 수렴합니다.

시각 언어 통합
시각적 이해는 현실적인 언어와 행동의 기반을 다집니다. 기본 단계는 수동 초기화 없이 시각-관성 SLAM을 통한 공간 일관성과 추상화 개선, 재식별 및 센서 융합을 통한 폐쇄 강성 추적16, 레인 그래프 예측90, 라벨과 내비게이션 유틸리티를 정렬하는 반감독 분할, SLAM과 대규모 분할을 통한 자기중심적 비디오탐색 26. 불확실성 인식 매핑이 여전히 핵심입니다: uPLAM은 확률적 위치 지정과 파놉틱 분할을 결합해 동적 장면91을 구현하고, Clio는 작업 민감 의미론30을 위해 CLIP 기반 계층적 3D 장면 그래프를 적응적으로 구축합니다. 그라운딩 접근법은 구조화된 설명 및 인식 API 92,93에서 멀티모달 인코더 및 디코더 94,95로 발전했습니다.

개방 환경에서 따르는 지시는 지각과 추론을 통합합니다. RobotGPT35와 GroundingGPT36은 결합된 시각-언어 추론을 통해 명령을 해석합니다; SayPlan, LFG, LLM-Planner는 내비게이션과 계획을34,44에 맞춰 정렬합니다. 환각을 줄이고 의미적 일관성을 강제하기 위해 GLAM과 Vtimellm은 정렬 목표96,97을 도입하며, 적응형 프레임워크는 LLM 출력을 지각에 대해 검증합니다98,99. 타이밍은 가독성을 결정적으로 만듭니다: 최적화된 제스처 타이밍은 예측 가능성을 향상시킵니다9; 강화 학습은 감정 파이프라인에서 시청각 지연을 줄여줍니다2; 제스처 동조는 인지된 유창성100을 증가시키고; 정렬101을 위한 LSTM, DTW, GAN 도구를 통합하는 검토 등이 있습니다. 전반적으로 매끄럽게 하려면 지각, 융합, 반응 전반에 걸쳐 지연 인식 루프가 필요하며, 모방30과 소뇌 영감을 받은 예측102가 좌표 타이밍을 맞춥니다. 이는 그림 10의 시스템 수준 타이밍 루프에서도 잘 드러납니다.

모달리티 전반의 실시간 지각
유창성은 이질적인 스트림 간에 경계가 있는 종단 간 지연에 의존합니다. TACTO는 응답형 조작을 위한 낮은 지연 시간의 고해상도 촉각 피드백을 제공합니다. 힘줄 구동 손은 그림 11에 나타난 것처럼 이벤트 시각과 가벼운 추론103을 통해 빠른 상호작용 플레이를 달성합니다. 시각-언어-행동의 경우, CLIP과 GraspNet을 결합하면 클러터104에서 잡기를 가속화합니다. 트랜스포머는 빠른 사회적 햅틱 제스처 분류를 지원합니다.11. 엣지 최적화된 시청각 모델은 초도 이하의 추론을 유지합니다24. 정밀한 머리 움직임 타이밍은 참여105를 향상시킵니다. 이 결과들은 동기화된 핵융합, 모달리스에 맞춘 완충 정책, 그리고 시간적 공적응을 보존하기 위한 경량 주의를 주장합니다. 허용 가능한 지연 시간은 작업 영역에 따라 크게 다릅니다. 사회적 대화나 감정 인식에서는 200–300ms 미만의 지연이 인지된 유창성과 자연스러운 상호작용을 유지합니다. 물체 인수인계나 낙상 감지와 같은 보조 작업은 안전성과 반응성을 보장하기 위해 더 엄격한 제약(50–150ms)을 요구합니다. 원격 조작이나 협업 조작은 조작자의 방향 감각 상실이나 멀미를 방지하기 위해 100ms 미만의 지연이 필요한 경우가 많지만, 항법 또는 모니터링 애플리케이션은 300–500ms 정도를 치명적인 영향 없이 견딜 수 있습니다.

시간적 및 의미적 처리 과제
불균형과 지연은 신뢰와 작업 효율성을 약화시키며, 특히 분산된 텔레오퍼레이터–로봇–인간 시스템에서 그렇다106. 지각 및 인터페이스 전략은 사용자가 지연을 견디는 데 도움을 줍니다: 신체 제스처와 비어휘적 채우기107, 시각적 오버레이와 적응 신호108, 109, 110, 111. 대조군 수준의 예측은 응답 간격을 단축합니다102. 병렬 대화 파이프라인은112그림 12처럼 채우기 생성, 음성 합성, 프롬프트 편집과 겹쳐 지연을 줄입니다. 시스템 연구는 캡처, 인코딩/디코딩, 네트워크, 의사결정, 작동 전반에 걸친 누적 지연 시간을 분해합니다. 그림 13에서 보듯이, 지연은 센서 캡처, 비디오 인코딩 및 디코딩, 네트워크 전송, 운영자 처리, 차량 작동을 통해 도입되어 복잡한 양방향 피드백 루프를 형성합니다. 신탈로스는 폐쇄 루프 실험114에 밀리초 동기화를 제공합니다. 정서 교환에서는 실시간 얼굴 모방이 동기화를 강화합니다. 원격 수술과 같은 지연 민감 영역에서는 지연된 시각에 대한 햅틱 고정이 정밀도와 반응성을 지원한다는 것을 보여준다115. 그림 14에서 보듯, 햅틱 피드백을 고정하면 더 나은 성능과 더 강한 반응성을 얻을 수 있었습니다.

세밀한 효과와 의도 인식은 여전히 도전적입니다. 미세 표정, 운율, 시선, 예측적 움직임은 종종 짧고 비동기적으로 일어납니다. 이모는 사용자 상태에 맞춰 예측 가능한 표정을 만들어냅니다116. 얼굴이나 목소리가 보이지 않는 곳에서는 몸짓만으로도 의도를 전달합니다117. 페퍼 기반 멀티모달 디스플레이는 언어 분류와 표현적 제스처, 이모지를 결합하여 감정 동기화118. 온라인 RL은 얼굴과 음성 스트림의 융합을 강화하며, 경량 모방은 엣지 배치30을 지원합니다. 미해결 이슈로는 집단 효과, 문화적 변이, 시간적 효과 드리프트가 있습니다.

오픈 도메인에서의 일반화도 제한적입니다. 인간 피드백을 통한 강화 학습(RLHF)은 분포 외 입력에서 희소한 보상과 취약성을 보인다119. RoboAgent는 공간적 추론과 언어 기반을 결합하여 작업 간 전송을 지원합니다29. 액션 없는 데이터(RAD)를 통한 추론은 수동 영상과 언어를 활용해 수동 라벨 없이 제로 샷 기능을 제공합니다120. Perceiver-Actor는 낯선 객체를 조작하기 위해 객체 속성을 그라운드링합니다.121. RobotGPT와 GroundingGPT에서 지각과 의미론 간의 지속적인 정렬은 적응적 추론을 개선하지만 실시간 피드백 문제에도 직면합니다35,36.

다중 모드의 견고성과 환경 변동성
견고함은 신호 무결성과 동작 일관성을 아우르는 데 필수적이어야 합니다. SimuMuHRI는 모달리티별 노이즈와 드롭아웃을 주입하여 회복력122를 테스트합니다. 물리적으로 접지된 구조광 시뮬레이션은 조명 및 폐쇄 상태에서 RGB-D 신뢰성을 향상시킵니다123,124. 지연-햅틱 결합은 원격 조작에서 감도를 노출시킵니다125. 안전성에 중요한 에너지 시스템의 이중화 및 열 복원력 원리는 내결함성 HRI126,127에 영향을 미칩니다.

행동의 일관성도 똑같이 중요합니다. 목소리와 외모 불일치는 신뢰128을 감소시키고, 불규칙하지만 올바른 동작은 협력129를 약화시킵니다. 관찰자 기반 적응력 제어와 강인한 상호작용 제어기는 구조적 및 비구조적 불확실성 하에서 안정성을 유지합니다130,131. 데이터셋 커버리지도 진전을 제약합니다. 멀티오봇 지각 데이터셋—OPV2V132, CoPeD133, CSE134, AgiBot World Colosseo55—은 시뮬레이션과 필드 전반에 걸친 협업 센싱을 확장합니다. AV-HRI 자원—CHiME-5135와 이후 CHiME-8 챌린지136, AVA-ActiveSpeaker45, AFFECT-HRI5, SAVEn-Vid46—은 ASR, 화자 활동, 정서 및 장기 문맥 지시 추적을 가능하게 합니다. 대규모 사회적 벤치마크인 HumorHRI47, THÖR-MAGNI137, RW4T138, InViG139는 유머, 내비게이션, 팀 활동, 그리고 상호작용적 접지성을 목표로 합니다. 폭넓음에도 불구하고, 많은 데이터셋이 도메인 특화나 스크립트화되어 있어 매끄럽음을 평가하기 위한 시간적 깊이가 제한적이며, 이는 표 3에 요약된 바와 같습니다.

매끄럽음 평가
정확성과 지연 시간과 같은 기존의 지표는 공동적응, 상호 예측, 사회적 유창성을 완전히 포착하지 못합니다. 새로운 평가자들은 맥락적 일관성과 협업을140점을 평가하고, 사용자 피드백과 상황 신호를 통합하며, 물리적 HRI84에 예측 가능성, 조정성, 편안함을 추가했습니다. 팀 프레임워크는 공유기대를 정량화하며, 디지털 트윈은 신뢰 보정과 팀 유창성142를 추적합니다. 시간 동기화, 정서적 정렬, 사용자 중심 유창성을 융합한 통합 벤치마크는 여전히 열린 필요로 남아 있습니다.

다중 모달 HRI 평가의 표준화 노력은 여전히 제한적이고 단편적입니다. CHiME 챌린지135,136과 같은 주목할 만한 이니셔티브는 특히 노이즈 견고성 측면에서 오디오-비주얼 음성 인식 벤치마크를 발전시켰습니다. THÖR-MAGNI137과 RW4T138과 같은 데이터셋은 모션 캡처와 팀 행동을 위한 공유 자원을 제공합니다. 그러나 다양한 모달과 영역 간 교차 모달 시간 동기화, 상호작용 유창성, 또는 정서적 정렬을 위한 널리 채택된 통합 프로토콜은 아직 존재하지 않습니다. 이러한 표준화된 지표의 부재는 재현성과 비교 가능성을 계속 저해하며, 커뮤니티 주도 벤치마크의 필요성을 강조합니다.

실험실에서 실제 배치로의
감각의 불규칙성, 의도 변화, 컴퓨팅 병목 현상으로 인해 비구조화된 환경에서 성능이 자주 저하됩니다143. 이러한 성능 저하는 실험실과 실제 환경 간의 지속적인 간극을 부각시킵니다. 통제된 환경에서는 하이브리드 및 주의 기반 퓨전이 뛰어난 성능을 발휘하여 객체 조작이나 장면 이해와 같은 작업에 높은 정확도와 낮은 지연을 제공합니다. 하지만 실제 배치는 다른 이야기를 전합니다. 노인 돌봄용 보조 로봇, 가정의 동반 시스템, 교실의 교육 도구들은 소음, 폐색, 조명 변화, 예측 불가능한 사용자 행동 등으로 인해 효과를 저하시키는 문제에 일상적으로 대응합니다. 후기 융합 접근법은 이러한 가변적이고 비동기적인 조건에서 더 신뢰할 수 있는 경향이 있으며, 하이브리드 모델은 정서적·맥락적 적응에 강점이 있음에도 불구하고 엣지 장치에 대한 계산 요구에 의해 제약받을 수 있습니다. 많은 성공적인 현장 구현은 여전히 신뢰성을 위한 단순한 중복성이나 규칙 기반 안전장치를 포함하고 있어, 유망한 실험실 시연에서 견고한 일상 성능으로 전환하는 것이 여전히 어려운 과제임을 강조합니다. 통제된 실험을 넘어 진정으로 성공하는 기술을 식별하는 데 생태학적으로 타당한 테스트가 필수적입니다. 적응형 강인한 컨트롤러는 교란131 중에서도 전력의 정확도를 유지합니다. LLM 기반 협업 계획은 사용자 의도가 진화함에 따라 목표를 업데이트합니다144. 시각적 오버레이와 지연 인식 피드백은 저하된 링크 상태에서 운영자의 인식을 유지하는 데 도움을 줍니다107,109. LoRa와 디지털 섀도우를 이용한 경량 감시는 저대역폭 영역에서의 모니터링을 가능하게 합니다145. 우주 로봇공학의 경험은 자율성이 불확실성과 지연 하에서 인간 인지와 공동진화해야 함을 강조합니다146.

자원 제약이 실현 가능성을 형성합니다. 사운드 기반 감정 및 터치 인식은 1MB 이하, 저전력 플랫폼에서는 0.7 GFLOP 이하로 동작합니다.12. 사회적 기능을 추가하면 존재감이 향상될 수 있지만, 지연이 증가하면 과부하 위험이 있습니다147. 스케줄과 기능 선택은 인지 요구와 연속성의 균형을 맞춰야 합니다148. 지연 완화는 113에서 조직된 인식, 제어, 네트워크를 아우릅니다. 사용자들은 최대 작업 효율성보다 투명하고 안정적인 상호작용을 선호하는 경우가 많아, 원활한 HRI는 기술적 역량과 인간의 편안함을 우선시해야 함을 강조합니다149,151. 영역별로 실제 배치는 뚜렷한 선호도를 보인다: 사회적·교육적 응용은 감정적 대화를 위해 하이브리드 시각-오디오 융합에 의존하는 반면, 보조 및 협업 작업은 정밀 물리적 상호작용을 위해 시각-햅틱과 늦은 또는 초기 융합을 선호한다. 이러한 패턴은 요약된 전략들—가변 환경에서의 견고성을 위해 후기 융합을 우선시하고, 더 풍부한 맥락적 적응을 위해 하이브리드/주의 기반을 우선시하는 것—과 일치하지만, 신뢰성을 위한 단순화는 여전히 흔하다.

Access restricted. Please log in or start a trial to view this content.

Conclusions

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 리뷰에는 몇 가지 제한이 있습니다. Web of Science Core Collection에서 영어 출판물로 검색을 제한한 것은 언어 편향을 초래하고 관련 비영어 연구를 배제했을 수 있습니다. 2015년부터 2025년까지의 동료 검토 논문에 집중하는 것은 출판 편향을 반영하여 프리프린트, 회색 문헌, 또는 새롭게 나오는 미출판 결과를 간과할 수 있습니다. 148편의 논문에 대한 수동 심사는 명시적 기준에 따라 진행되지만, 필연적으로 어느 정도 주관성을 수반합니다. 마지막으로, 트렌드의 주제적 해석은 빠르게 변화하는 분야에서 우리의 관점을 반영합니다.

이러한 한계에도 불구하고, 이 검토는 원활한 다중 모드 HRI 발전을 위한 명확한 우선순위를 제시합니다. 실시간 동기화와 비구조화 환경에서의 견고성은 여전히 가장 중요한 과제로, 배포 신뢰성과 사용자 신뢰에 직접적인 영향을 미칩니다. 앞으로 이 분야는 세 가지 상호 연결된 영역을 우선시해야 합니다: 잡음과 동기 수준을 기반으로 동...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 이해 상충이 없다고 선언한다.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 말레이시아 과학대학교의 브리징 그랜트(프로젝트 번호: R501-LR-RND003-0000001342-0000)의 지원을 받았습니다.

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Multimodal Human RobotHuman Robot CommunicationHuman Computer InteractionFusion StrategiesSystem ArchitecturesReal Time ProcessingSemantic AlignmentAdaptive FusionContinual LearningSocially Assistive Robots

Related Articles