연구 논문

인간-AI 협업을 강화하기 위한 적응형 다중 모달 상호작용 프레임워크 설계

DOI:

10.3791/69830

2026년 2월 24일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 온라인 적응과 주의 기반 다중 모달 융합을 결합한 동적 시간 왜곡(DTW) 기반 계층적 정렬 메커니즘을 제안하여, 신뢰할 수 있는 장기 의도 예측과 작업 추적을 가능하게 합니다. 가벼운 설명 모듈은 해석 가능성을 높이고 인간-AI 협업에 대한 신뢰를 증진합니다. 이 접근법은 로봇 및 가상 상호작용 시스템 모두에 일반화됩니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

효과적이고 자연스러운 인간-AI 협업을 달성하는 것은 특히 역동적인 현실 환경에서 여전히 큰 도전 과제입니다. 기존 프레임워크는 경직된 단일 모달 입력이나 규칙 기반 다중 모달 융합에 의해 제한되어 견고성, 개인화, 적응성이 제한됩니다. 본 연구는 계층적 인간 의도 예측 모델 내에서 시각 기반 자세 추정과 음성 기반 명령 이해를 통합한 적응형 다중 모달 상호작용 프레임워크를 소개합니다. 이 프레임워크는 행동 예측을 위한 트랜스포머 기반 시퀀스 모델과 장기 계획을 위한 동적 시간 왜곡(Dynamic Time Warping)을 사용하여 인간 행동을 구조화된 작업 그래프와 일치시킵니다. 정적인 모달리티 전환에 의존하는 이전 접근법과 달리, 우리의 아키텍처는 주의 기반 융합 메커니즘을 적용하여 가장 유익한 입력을 동적으로 가중치화합니다. 더 나아가, 온라인 적응 모듈은 사용자 행동에 대한 실시간 조정을 가능하게 하며, 사용자 신뢰를 증진하는 가벼운 설명 계층과 함께 제공됩니다. 협업 조립 과제에서의 실험 평가는 작업 수행 성과(최대 24%), 의도 예측 정확도(최대 18%), 사용자 만족도에서 유의미한 향상을 보였습니다. 이 결과들은 적응형 다중 모달 상호작용 프레임워크의 효과성과 다재다능함을 강조하며, 협력적 지능을 보다 신뢰할 수 있고 투명하며 인간 중심적인 AI 시스템으로 발전시킬 잠재력을 뒷받침합니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

인간-로봇 협업(HRC)은 특히 로봇이 인간 중심 환경에서 점점 더 많이 배치되고 있기 때문에 중요한 연구 분야 중 하나가 되었습니다. 단기 HRC를 위한 프레임워크와기술은 크게 개선되었지만, 장기 HRC는 아직 성숙하지 않았습니다. 산업 분야에서 장기 HRC의 활용은 복잡한제조 공정에서 생산성과 적응력을 크게 향상시킬 수 있습니다. 가정 환경, 동반자로서의 로봇 또는 노인 돌봄 요원은 장기적인 HRC5를 통해 삶의 질을 향상시킬 잠재력을 가지고 있습니다. 의료진은 가정 및 돌봄 제공자를 대체하는 지역사회 기계를 제공하며, 치매, 자폐증 및 추가적인 신체적 또는 정신적 질환을 가진 영향을 받은 역할을 돌보았습니다. 6. 동시에 여행 및 친환경 분야는 산업용 로봇을 활용해사용자 지식을 발전시킵니다. 지능형 공학의 목적은 인간 중심적으로 AI를 참여시켜 역량을 회복하고 개인화된 작물을 만드는 것으로, 이를 Industry 5.0으로 알려져 있습니다. 인간-AI 및 인간-로봇 협업 시스템은 다양한 응용 분야에서 탐구되었습니다 8, 9, 10; 하지만 최근 연구는 신뢰할 수 있는 의도 예측과 장기 과제 이해가 필요한 협력적 로봇 환경에 점점 더 집중되고 있습니다.

AI는 이미 일상생활에 깊이 뿌리내려져 있으며, 자율적이거나 반자율적인 응용이 비즈니스 여러 분야에서 점점 더 나타날 것입니다. 이는 단순히 잘 작동하는 비즈니스 기능이 현재 기술 변화에 적응하고조직 도전에 대응할 수 있는 시스템이 필요하다는 것을 의미합니다. 따라서 AI 도입과 구현 과정에서 인간의 행동을 하이브리드화하여 개선해야 할 필요성이 일부 장벽을 극복하는 데 도움이 됩니다. 따라서 하이브리드 시스템은 인공지능과 인간 지능을 결합하여 복잡한 작업을 함께 수행하고, 더 나은 결과를 제공하며, 동료들로부터 배우며 기술을 향상시키는 역할을 합니다. 따라서 하이브리드 지능형 시스템12, 협업, 증폭된 지능 등 확장된 개념들이 다양한 AI 방식을 통합하여 협업을 증진하는 연구와 이해를 비공식적으로 형성하고 있습니다.

"신뢰"라는 용어는 인간관계 연구에서 유래했으며, 인간관계에서 감정적 유대를 정의했습니다. 예를 들어, 저자13은 신뢰 수준이 협력 당사자들의 감정, 호소력, 윤리의 측면을 기술적으로 결정한다고 밝혔습니다. 사회학적으로 대인 신뢰 변동은 개인의 웰빙, 공동체 상호작용, 사회경제적 성장, 실질적 행동에 깊은 영향을 미친다 14,15,16. 본질적으로 HRI는 사회복지사와 영리한 오토마타 간의 절차적 대화를 기존 오토마톤의 언어적 장벽을 넘어 다리를 놓으려는 시도입니다. 이러한 상호작용은 자율 시스템의 계산 능력과 인간의 직관을 결합하여 다양한 응용 환경 간 효과적인 협업을 가능하게 합니다. 오토마타의 사용은 재정적 비용 절감, 생태 발자국 감소, 그리고 인간 위험 감소라는 실질적인 이점을 가져옵니다. 하지만 성취 속에서 인간의 로봇에 대한 신뢰는 특히 상호작용의 전반적인 질을 평가할 때 기둥이 됩니다18,19.

로봇에 부여되는 인간의 신뢰 수준은 로봇의 중요성과 여러 분야에서 중심적 역할을 반영합니다. 보건 분야에서 로봇 신뢰는 HRI에 따른 의료 자원 분배와 전파성 질병 억제의 효율성에 영향을 미친다 20,21,22. 군인 적용에서는 오토마타에 대한 사회적 신뢰 수준이 군인 조사 장치 전략의 작전 능력 수준과 수송 전투의 정확도 수준을 결정한다23,24. 또한, 기계에 대한 믿음은 투기적 군인 정책 결정에서 AI의 적극적 신념 표준화 메커니즘의 복종과 사용에 영향을 미친다. 환경 조사, 예를 들어 고수준 신체 움직임 연구에서도 결과의 합리성은 HRI26에 대한 신뢰 정도에 달려 있습니다. 하지만 중요한 경고는, 의사결정 난이도가 증가하면 이 신뢰가 약화되어 상호작용이 위태로워질 수 있다는 점입니다. 1은 여러 연구의 비교 개요를 설명합니다.

논문 (연도, 출처)주요 목표주요 방법 및 치료통찰
셰 & 박 (2021, arXiv) [28]감성적인 소셜 로봇과 로봇 상호작용을 맞춤화하세요언어적 및 비언어적 단서(신체 위치, 말하기, 표정 등)를 모두 기반으로 한 강화 학습 정책강화학습 학습 로봇의 행동은 인간의 감정에 반응하여 단순화와 몰입도를 높입니다.
Li 외 (2022, IEEE T-IE) [29]제조 조립에 대한 선제적 지원을 촉진합니다의도 예측, 전이 학습, 그리고 다중 모달 학습(시각 + 골격)기본 대비 로봇 능동성 향상; 조립 중 더 빠르고 정확한 동작 예측
Abdelrahman 외 (2022, IEEE Access) [30]그룹 HRI에서 실시간 참여 추정규칙 기반 분류와 딥러닝 및 시각 기반 시선/머리 자세의 결합≥90% F 점수; 물리적 구성에서 여러 사용자를 동시에 관리함
Chiossi 외 (2025, arXiv) [31]제조 환경에서 다중 모드, 동적 의도 전달을 위한 구조이론적 다면적 레이아웃: SAT 투명 계층; 햅틱, 청각, 시각 모드개념적 틀을 확립하고 디자인 환경의 매체, 계획 및 의도를 설명합니다.
McGrath 외 (2024, arXiv) [32]적응 가능한 인간-AI 연관성에 대한 신뢰 형성을 모델링하세요.팀 단계와 신뢰 선례; 특정 모달리티에 의존하지 않는 동적 신뢰 모델입니다상호작용과 시간의 모든 단계에 대해 신뢰 인식 설계 원칙을 제공합니다.
프라지아다키스 외 (2024, arXiv) [33]인간과 AI 간 협력 평가를 표준화하라.HAIC 모드에 따라 결정 트리가 선택한 메트릭; 혼합 방법 지표이 프레임워크는 AI/인간 중심의 공생 상호작용 방식에 적합한 지표를 선정하는 데 도움을 줍니다.
Younis 외 (2023, MDPI) [34]인구통계학적 추론을 이용해 맥락에 적응하는 HRI나이와 성별은 시각 및 청각 모델을 사용해 추정되며, 로봇 행동은 적절히 조정됩니다.설문조사는 접근법을 요약하고 HRI에서 맞춤형 적응의 중요성을 강조합니다.

표 1: 인간-AI 협업 분야의 최근 연구를 비교 개관하며, 각 연구의 주요 목표, 방법론 및 결과를 강조합니다. 연구에 사용된 데이터셋, 그 사양, 크기, 모달리티, 참여자 분포.

현재의 계층적이고 다중 모달 인간-로봇 협업(HRC) 프레임워크는 장기적인 협업을 위한 시각 및 청각 모달리션 활용에서 인상적인 진전을 보여주고 있지만, 여전히 여러 연구 공백이 존재하여 보다 일반적인 인간-AI 협업 환경에서의 적용을 방해하고 있습니다. 우선, 현재의 프레임워크는 주로 물리적 로봇공학(예: KINOVA GEN3 팔)에 적용 가능하며, 다양한 디지털 환경에 존재하는 비신체 또는 가상 AI 에이전트에는 적용되지 않는다28. 둘째, 다중 모달리티는 시각과 음성으로 다루지만, 시스템은 사용자 상태 또는 작업 난이도에 따라 동적이고 맥락 의존적인 융합 대신 미리 정의된 모달리티 전환 전략을 구현한다29. 셋째, 이 접근법은 작업 효율성과 회복력에 중점을 두지만, 장기적인 협업과 시스템 설명 가능성에 필수적인 사용자 신뢰, 인지 부담, 정서 상태를 구체적으로 모델링하지 않습니다. 또한, 의사결정에서 설명 가능성 과정이 부재할 때 인간의 해석 가능성과 시스템의 적응적 행동에 대한 신뢰도는 제한됩니다. 마지막으로, 평가는 단일 도메인(장난감 자동차 조립)에 한정되어 다중 도메인 검증이 이루어지지 않아실제 세계의 변동성을 나타냅니다. 이러한 격차는 이질적인 입력 채널을 동적으로 결합하고 인간의 의도, 신뢰, 맥락을 실시간으로 모델링하여 인간-AI 협업을 보완하는 일반화되고 적응적이며 인간 중심의 다중 모달 상호작용 프레임워크 개발을 필요로 합니다.

이 연구의 최우선 목표는 시각과 음성 모달을 실시간 사용자 모델링과 통합하는 적응형 다중 모달 상호작용 시스템 설계를 통해 인간-AI 협업을 극대화하는 것입니다. 견고한 장기 인간-로봇 협력의 탄탄한 토대를 바탕으로, 이 연구는 멀티모달 아키텍처를 가상 에이전트나 지능형 인터페이스와 같은 로봇 외의 일반 AI 시스템으로 일반화할 것입니다. 주요 중점은 저수준 행동 이해와 고수준 작업 진행 추적을 통합한 계층적 계획 메커니즘 을 통한 동적 의도 예측입니다. 규칙 기반 시스템과 달리, 여기 제시된 프레임워크는 사용자 전용 모델 업데이트와 맥락 인식 모달리티 융합 등 적응형 학습 방법을 활용하여 사용자 선호도, 인지 상태, 환경 역학에 따라 상호작용 행동을 동적으로 조정합니다. 더불어, 이 프레임워크는 설명 가능한 상호작용 추론을 통해 투명성과 신뢰를 높이는 것도 목표로 하며, 사용자가 AI 선택을 이해하고 피드백을 제공할 수 있게 합니다. 마지막으로, 이 연구는 다양한 협업 환경에서 상호작용 유창성, 작업 효율성, 장기적인 사용자 만족도를 향상시키고자 합니다.

본 논문은 시각과 청각 모드를 동적으로 융합하여 인간-AI 협업을 촉진하기 위한 새로운 적응형 다중 모달 상호작용 프레임워크를 소개합니다. '유니모달' 시스템은 여러 채널에 걸쳐 정보를 통합하지 않고 작업 수행과 의도 예측을 위해 단일 입력 모달리티(예: 시각 또는 음성)만을 사용하는 모델을 의미합니다. '비적응형' 시스템은 규칙 기반 또는 고정 전략 시스템을 의미하며, 사용자 행동이나 맥락에 따라 행동을 조정하지 않는 경우, 예를 들어 규칙 기반 전환 기준선(Rule-Based Switching baseline)을 의미합니다. 이 기준선들은 주력 유도 융합 모델이 적용된 트랜스포머에서 구현된 다중 모달 지각 및 적응 상호작용 전략의 장점을 평가하는 데 참고점을 제공합니다. 이전 계층적 HRC 패러다임31을 바탕으로, 우리의 방법은 여러 중요한 혁신을 가져왔습니다:

이 연구는 예상되는 저수준 인간 행동을 계층적 작업 그래프의 노드에 매핑하는 동적 시간 왜곡(DTW) 기반 정렬 메커니즘을 제시하는데, 이는 주로 단기 행동 인식에 집중했던 이전 다중 모달 상호작용 시스템과 대조적입니다. 시간적 예측 불가능성과 잡음이 많은 멀티모달 입력 상황에서도 신뢰할 수 있는 장기 의도 예측과 작업 진행 추적이 가능합니다.

상호작용 중 의도 추론 및 행동 예측 모델을 지속적으로 업데이트하는 온라인 적응 모듈이 제안된 시스템에 통합되어 있습니다. 이 시스템은 정적 또는 오프라인 학습된 멀티모달 모델의 단점을 극복하며, 고유한 사용자 행동, 선호도, 맥락 변화에 동적으로 적응할 수 있게 합니다.

시각적 및 청각 모달리티는 각 시간 단계에서 맥락적 중요성에 따라 독특한 주의력 기반 융합 기법을 사용하여 동적으로 가중치를 부여합니다. 이 데이터 기반 융합 접근법은 다양한 상호작용 환경에서 견고성을 향상시키고 규칙 기반 모달리티 스위칭을 대체합니다.

이 연구는 계층적 계획과 융합 결정을 이해 가능한 정당화로 변환하여 적응형 인간-AI 시스템의 해석 가능성 격차를 해소하는 경량 설명 모듈을 포함합니다. 이는 장기적인 협업의 질을 높이고 적절한 신뢰 조정을 촉진합니다.

제안된 접근법은 구현된 로봇을 넘어 가상 에이전트와 지능형 인터페이스로 일반화하여, 로봇 플랫폼을 활용한 실제 협업 조립 활동에서 입증되었음에도 불구하고 여러 인간-AI 협력 분야로 유용성을 확장하는 것을 목표로 합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

인간-AI 협력 증강을 위한 제안된 아키텍처는 시각과 음성 양상을 결합한 적응형 다중 모달 상호작용 파이프라인을 동적이고 계층적인 추론 프레임워크로 사용합니다. 이 연구는 이전에 발표된 실험에서 공개된 데이터를 사용했습니다. 새로운 인간 대상 대상자는 포함되지 않았으며, 추가적인 윤리적 승인도 필요하지 않았습니다.

제안된 적응형 다중 모달 상호작용 아키텍처

기본적으로 시스템은 시각적 스트림이 RGB-D 센서를 사용해 사용자 자세와 움직임을 포착하고, 오디오 스트림이 경량 ASR(자동 음성 인식) 엔진을 사용해 음성 입력을 분석하는 등 지각 모듈에서 시작합니다. 이러한 원시 입력은 Transformer 기반 행동 예측 모듈에 입력되며, 이 모듈은 자세와 명령 시퀀스의 시간 의존성을 인코딩하여 저수준 인간 행동을 추론합니다. 이후 고수준 협업 계획을 가능하게 하기 위해, 동적 시간 왜곡(DTW) 메커니즘이 감지된 행동을 미리 정의된 작업 그래프의 노드와 정렬하여 사용자 목표와 다음 행동을 예측합니다. 새로운 주의 기반 퓨전 모듈은 매 타임스텝마다 어떤 모달리티(오디오든 시각이든)가 가장 맥락적으로 중요한 정보를 제공하는지 결정하고, 입력 가중치를 동적으로 조정합니다. 상호작용을 개별화하기 위해 시스템은 온라인 모델 적응을 포함하며, 사용자 행동 변화에 실시간으로 행동 예측기를 조정합니다. 가벼운 설명 모듈은 예측된 의도와 AI 의사결정을 사용자 친화적으로 요약하여 투명성과 신뢰를 향상시킵니다. 전체 시스템은 시뮬레이션되었지만 실제 협동 조립 환경에서 테스트되어, 단일양식 및 적응형 다중 모달 환경 간 비교가 가능합니다. 이러한 접근법은 모든 영역에서 AI 에이전트와의 더 유연하고 직관적이며 신뢰할 수 있는 협업을 가능하게 합니다.

그림 1 은 인간-AI 협업 개선을 목표로 한 적응형 다중 모드 상호작용 프레임워크의 아키텍처를 보여줍니다. 이 단계는 입력 획득 단계로 시작되며, 이는 두 가지 주요 감지 장치를 기반으로 합니다: 깊이 강화된 시각 정보(예: 인간의 자세와 움직임)를 관찰하는 RGB-D 카메라와 음성 명령을 수집하는 방향성 마이크입니다. 원시 신호는 이후 전처리 모듈을 통과하여 오디오 비주얼 데이터를 처리하여 입력 스트림을 정제, 정규화, 포맷 처리하여 후속 분석을 수행합니다. 그 후 파이프라인은 특징 추출 단계로 넘어가며, 데이터는 두 개의 스트림으로 나뉩니다: 포즈 추정 알고리즘을 통해 자세와 움직임 특징을 분리하는 비주얼 스트림과 음성 해석 가능한 명령어 임베딩으로 전사하는 오디오 스트림입니다. 다중 모드 트랜스포머 인코더는 다중 헤드 자기 주의와 시간 위치 인코딩을 사용하여 상호작용 시퀀스 간 장거리 상호의존성을 표현하며, 융합된 표현을 처리합니다. 사용자의 현재 목표 상태는 장기 의도 및 작업 진행 예측기로 추정되며, 저수준 행동은 DTW 기반 정렬 모듈을 통해 신뢰할 수 있는 작업 추적을 위해 계층적 작업 그래프의 노드에 매핑됩니다. 융합 가중치와 예측 매개변수는 상호작용 피드백에 따라 온라인 모델 적응 루프를 통해 지속적으로 업데이트되며, 설명 가능성 모듈은 개방성과 신뢰를 촉진하는 명확한 설명을 제공합니다. 전체 파이프라인은 시스템이 동적인 작업과 환경에서 사용자와 적응적이고 효율적으로 협력할 수 있도록 합니다.

figure-protocol-1
그림 1: 트랜스포머를 기반으로 제안된 다중 모달 상호작용 프레임워크의 개요. 시각 및 청각 데이터를 인코딩하고 동적으로 통합하기 위해 주의 유도 기법이 사용됩니다. 계층적 작업 모델링과 온라인 적응을 통합한 트랜스포머 모듈은 장기 지평선 의도 예측과 작업 진행 추정을 위한 융합된 표현을 처리합니다. . 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

제안된 시스템은 다중 모드 융합 및 계층적 계획 구성 요소와 연동하여 투명성과 사용자 신뢰를 높이기 위해 작동하는 경량 설명 모듈을 포함하고 있습니다. 이 모듈은 DTW 기반 작업 그래프 정렬(예: 현재 작업 진행 상황 및 예상 다음 행동)과 주의 기반 융합 계층(예: 양식 중요도 가중치)으로부터 해석 가능한 단서를 도출합니다. 이 단서들은 말로 된 명령이나 시각적 제스처가 시스템 선택에 주로 영향을 미치는지, 예상되는 행동이 더 넓은 작업 계획에 어떻게 부합하는지와 같은 이해 가능한 설명으로 변환됩니다. 사용자는 간결한 서면 또는 시각적 피드백의 형태로 설명을 받아 시스템 동작을 이해하고 예측하며 필요시 수정하는 데 도움을 줍니다. 평가에서 제시된 향상된 사용자 만족도, 상호작용 부드러움, 신뢰 관련 지표는 사용자 인식 가능성의 간접적 지표입니다. 이 연구 결과는 장기적인 인간-AI 상호작용에서 AI 의사결정에 대한 투명한 추론이 사용자 신뢰를 높이고 협업을 촉진하며 적응형 시스템 행동에 대한 수용을 높인다는 것을 시사합니다.

입력 데이터

인간-AI 협업을 위한 구상된 프레임워크에서의 입력 획득은 시각과 청각 방식을 결합한 구조화된 다중 모달 센싱 메커니즘을 통해 수행되며, 이는 인간의 행동과 의도를 효과적으로 실현합니다. 시각적 입력은 RGB-D 카메라로 수집되며, 이는 인간의 실시간 자세 정보, 공간 위치, 주변 환경의 맥락을 포착합니다. 시각 데이터는 BlazePose와 같은 사전 학습 모델을 통해 상공지능 작업에서 관심 있는 상체 키포인트를 얻습니다. 동시에 지향성 마이크로폰에서 청각 정보를 얻어 사전 학습된 DeepSpeech 모델을 통해 해석하여 음성 명령을 식별하여 중의성을 해소하거나 불확실한 시각적 신호를 보완합니다. 협동 환경에서 이중 입력 시스템은 동적 적응과 맥락 인식 인식을 제공합니다. 훈련 및 평가 데이터셋은 조립 및 핸드오버 행동 등 다양한 상호작용활동에 대해 5,000개 이상의 다중 모달 인간 운동 경로로 구성되어 있으며, 이는 통제되고 반구조화된 환경에서 네 명의 사용자로부터 수집되었습니다. 일반화를 강화하기 위해, 시스템은 온라인 모델 적응을 도입하여 사용자 행동과 환경 역학 변화에 따라 실시간으로 예측을 갱신할 수 있게 합니다.

데이터셋 설명

제안된 프레임워크의 학습 및 평가 데이터셋은 KINOVA GEN3 로봇1을 이용한 장난감 자동차 조립 과제 하에서 실제 인간-로봇 협업 실험에서 얻어졌습니다. 실험 환경은 시각적 및 청각 양식을 모두 포함하는 다중 모달 상호작용을 포함하는 장기적인 협업 활동을 모방하는 것을 목표로 했습니다. 특히, 훈련 데이터셋은 두 사용자의 3,003개의 궤적 시퀀스로 구성되어 있으며, 테스트 데이터셋은 모델 일반화 평가를 위한 두 명의 신규 사용자 데이터를 포함해 2,088개의 시퀀스를 포함하고 있습니다. 각 궤적은 BlazePose로 검색한 상체 자세 키포인트의 5단계 시퀀스와 DeepSpeech33에서 받아온 해당 음성 명령어를 기록합니다. 수집된 데이터는 물체 전달, 도구 사용, 협력 행동 등 활동에서 인간의 제스처와 명령 표현에서 자연스러운 변이를 보여줍니다. 멀티모달 데이터셋은 DLinear 행동 및 궤적 예측 모델의 지도 학습의 기초이며, 시각 전용, 오디오 전용, 다중 모달 조건에서 수행된 사용자 연구의 중심 벤치마크입니다. 다양한 유형의 사용자와 현실적인 소음 조건을 반영함으로써 영구 HRC 시스템의 견고성과 적응성 테스트를 보장합니다. 표 2는 상세한 데이터셋 설명을 보여줍니다.

속성세부 사항
데이터셋 이름장난감 자동차 조립 데이터셋 (사내 수집)
수집 환경KINOVA GEN3 팔을 사용한 실제 HRC 실험
사용자 수 (교육)사용자 2명
사용자 수 (테스트)사용자 4명 (트레이닝 세트 2명, 미확인 2명)
총 궤적(훈련)3,003 궤도
총 궤적 (테스트)2,088 궤도
포획된 모달리션시각 (포즈용 RGB-D), 오디오(음성 명령)
데이터 형식포즈 키포인트(BlazePose에서), 음성 변환 명령어
시간 해상도각 궤적은 5시간 단계를 포함합니다
다루는 업무3가지 주요 작업: 픽 앤 플레이스, 객체 회전, 협업 조립
사용행동/궤적 예측 모델의 감독 학습; 사용자 연구

표 2: 데이터셋 설명. 프로그래밍 프레임워크, 하드웨어 설정, 평가 환경을 포함한 시뮬레이션 환경에 관한 정보입니다.

데이터셋 전처리

인간-AI 협업에서 적응형 다중 모달 상호작용을 가능하게 하기 위해, 시각적 데이터(RGB 및 깊이 이미지), 청각(음성 명령), 시간 행동 데이터(자세 키포인트)와 같은 원시 데이터셋에 구조화된 전처리가 이루어집니다. 시각적 데이터는 먼저 BlazePose나 OpenPose에서 파생된 포즈 추정 모델 f 추출됩니다. 프레임 t에 대해 인간 자세 벡터는 다음과 같이 정의됩니다:

figure-protocol-2(1)

여기서 k는 키포인트의 개수이며, 모든 키포인트는 2차원 좌표를 포함한다. 시퀀스는 몸통 길이에 따라 정규화되고 Savitzky-Golay 필터로 시간에 따라 부드럽게 다듬어집니다:

figure-protocol-3(2)

여기서 w는 필터링 창의 크기입니다. 둘째, 원시 오디오 스트림 At 를 음성 활동 감지기(VAD)를 사용해 세그먼트로 나눠집니다. 신뢰할 수 있는 구간들은 음성 인식 모델 fspeech(예: DeepSpeech)에 입력되어 명령 토큰을 추출합니다:

figure-protocol-4(3)

여기서 V는 인식된 명령어의 어휘입니다. 통합을 위해 모든 명령 토큰은 보간 기반 정렬 함수 τ를 사용하여 시각적 포즈 타임스탬프에 시간 정렬됩니다:

figure-protocol-5(4)

셋째, 시간 의도 훈련 시퀀 figure-protocol-6스를 형성하기 위해 궤적 시퀀스와 관련된 음성 명령 figure-protocol-7어를 정의합니다. 이들은 크기 l의 슬라이딩 윈도우를 이용해 고정 길이의 세그먼트로 창을 나누어 있습니다:

figure-protocol-8(5)

figure-protocol-9(6)

마지막으로, 입력값은 궤적 기반 예측 모델에서 수렴을 위해 키포인트 차원별 평균과 단위 분산 0으로 정규화됩니다:

figure-protocol-10(7)

여기서 μj, σj 는 키포인트 j가 훈련 집합을 완성한 평균과 표준편차입니다.

특징 추출

개괄된 적응형 다중 모달 상호작용 패러다임에서는 시각, 청각, 맥락적 작업 기능을 결합함으로써 강력하고 실시간 협력이 가능해집니다. 특징 추출 파이프라인은 시각 신호 figure-protocol-11 와 오디오 신호 figure-protocol-12두 가지 주요 방식에서 동시 데이터 획득으로 시작되며, 이는 시간 단계 t에 인덱스됩니다. 이 관찰들은 해당 지각 모듈을 거쳐 인간 행동, 의도, 음성 명령과 관련된 고수준 의미 특징을 얻습니다.

시각적 특징 추출

RGB-D 카메라의 원시 시각 데이터는 figure-protocol-13 인간의 자세 추정기(예: BlazePose)를 통해 전달되며, k는 검출된 키포인트 수를 figure-protocol-14나타내고 각 키포인트는 3D 좌표를 포함합니다:

figure-protocol-15(8)

이 핵심점들은 시간 내에 포즈 궤적 figure-protocol-16에 내재되며, 여기서 추세-계절 분해를 통해 운동 역학이 추출됩니다:

figure-protocol-17(9)

여기서 ∈_t는 잔류 잡음을 나타냅니다.

오디오 특징 추출

오디오 입력 figure-protocol-18 은 사전 학습된 음성 인식 모델(예: DeepSpeech)을 통해 처리되며, 토큰 길이 n인 토큰화된 명령 표현 figure-protocol-19을 생성합니다:

figure-protocol-20(10)

다중 모드 핵융합

통합 상호작용 맥락을 구성하기 위해, 신뢰도와 상호 정보를 기반으로 한 신뢰도 가중 주의를 통해 특징들을 결합합니다:

figure-protocol-21(11)

여기서φ V 와 φA는 시각 및 청각 특징을 공유된 잠재 공간으로 투영하는 함수이며,α t∈[0,1]는 엔트로피를 기반으로 계산된 동적 양상 가중치 항입니다:

figure-protocol-22(12)

여기서 와 figure-protocol-23figure-protocol-24 목표 상태 g와 관찰된 양상 간의 상호 정보이다.

맥락 임베딩을 이용한 계획

마지막 다중 모달 특징 벡터 Ft 는 작업 맥락과 진행 상황 Pt로 풍부해지며, 적응적 계획 모듈의 상태 입력이 됩니다:

figure-protocol-25(13)

추출된 특징 xt 는 하위 의도 예측 및 동작 계획 모델의 입력으로 사용되어, 동적이고 불확실한 환경에서 적응적이고 견고한 인간-AI 협업을 지원합니다.

작업 그래프 정렬 을 통한 행동 및 계획 예측

다중 모달 특징 추출 과정을 거쳐, 음성 의도(오디오), 자세 궤적(시각), 맥락(예: 작업 기록 또는 감정) 데이터가 통합되어 후속 처리를 진행하며, 계층적 작업 그래프 정렬을 이용한 적응형 인간 행동 예측과 계획 추론이 포함됩니다.

시간 단계 t에서 적분된 다중 모달 특징 벡터를 다음과 같이 표현하자:

figure-protocol-26(14)

시스템은 처음에 함수 fact를 통해 저수준 인간의 행동을 예측하는데, 이는 종종 반복 인코더-디코더 또는 트랜스포머로 표현됩니다:

figure-protocol-27(15)

여기서 F(t-k:t) 는 마지막 k 시간 단계의 특징 융합 시퀀스를 나타내며 figure-protocol-28, 는 작용 집합 A에서 예측된 작용이다. 모듈은 적응 손실에 의해 미세 조정되어 온라인 상태입니다:

figure-protocol-29(16)

여기서 CE는 작용 분류의 교차엔트로피 손실이며, 두 번째 항은 좋은 미래 궤적 예측을 촉진합니다.

고수준 계획 예측을 위해 작업을 계층적 작업 그래프 G = (N, E)를 따라 진행하는 것으로 구성하며, 각 노드n i ∈N은 하위 작업 또는 중간 목표를 나타냅니다. 목표는 관측된 작업 시퀀스를 참조 작업 경로 R*∈G와 일치시키기 위해 거리를 줄이는 것입니다:

figure-protocol-30(17)

여기서 Pt 는 현재 진행 트레이스를, d(⋅)는 동적 시간 왜곡(DTW) 거리 또는 소프트 정렬 지표를 나타냅니다.

궁극적인 계획 수준의 의도 figure-protocol-31 는 예측된 행동 a_t를 정렬된 경로 figure-protocol-32의 가장 가능성 높은 다음 단계에 투영하여 도출됩니다:

figure-protocol-33(18)

이 계층적 디코딩은 불분명하거나 잡음이 많은 감각 입력에도 불구하고 시스템이 현재 작업 시퀀스와 일치하는 가장 맥락적으로 적합한 고수준 의도를 선택하도록 보장합니다. 이러한 예측 계획은 협업 효율성을 높일 뿐만 아니라 다중 인터뷰 인간-AI 상호작용 내에서의 예측과 적응력을 높입니다.

다중 모드 융합(주의 기반) 메커니즘

적응형 인간-AI 협력에서는 여러 감각 양식(예: 시각: 인간 자세, 궤적, 청각: 음성 명령)의 다중 모드 통합이 사용자 의도를 올바르게 해석하는 데 필수적입니다. 규칙 기반이나 정적 융합 접근법은 실제 세계의 동적 인간 상호작용을 감당할 수 없습니다. 이를 위해, 각 모달리티를 각 시간 단계에서 맥락적 중요성에 따라 동적으로 가중치를 부여하는 주의 기반 융합 메커니즘이 제시됩니다.

시각 모달리티와 청각 모달리티에서 추출한 특징 벡터를 각각 와 figure-protocol-34figure-protocol-35 표기하자. 이 벡터들은 이전 처리 파이프라인을 통해 얻은 의미 정보를 인코딩합니다. 예를 들어, 시각 특징은 자세 추정과 행동 예측에서 나올 수 있고, 오디오 특징은 DeepSpeech나 wav2vec와 같은 모델을 사용한 음성 임베딩에서 도출될 수 있습니다.

주의 기반 융합의 목적은 각 모달리티의 상대적 중요성을 포착하는 모달리티별 주의 가중치를 계산하는 것입니다. 이는 부드러운 주의 메커니즘을 통해 이루어집니다.

주의 가중치 계산

첫 단계로, 두 벡터는 학습 가능한 변환을 통해 공유된 주의 공간으로 변환됩니다. 즉, 모든 양측 i∈{V,A}에 대해 중간 주의 점수는 다음과 같이 계산된다:

figure-protocol-36(19)

여기서 figure-protocol-37figure-protocol-38 는 주의 네트워크의 학습 가능한 매개변수이며, tanh는 비선형 활성화 함수이다. 이 변환을 통해 모델은 각 모달리티의 고수준 상관관계와 맥락적 중요성을 추출할 수 있습니다.

이 비정규화 주의 점수 eV와 αA 는 소프트맥스 함수로 정규화되어 합산이 1이 됩니다

figure-protocol-39(20)

여기서 αV 와 αA 는 각각 시각적 방식과 청각 양식에 대한 주의 가중치입니다. 가중치는 적응형이며, 기존 작업 상황, 신호 품질, 사용자 활동에 따라 시간이 지남에 따라 업데이트됩니다.

figure-protocol-40(21)

결과적으로 융합된 표현 figure-protocol-41 은 입력 모달리티 벡터들의 가중 조합으로 얻어집니다:

이 결합된 벡터는 시각 및 청각 정보의 공통 의미론을 인코딩하여 가장 유익한 흐름을 적극적으로 강조합니다. 그 후 작업 그래프 매칭, 의도 예측, 로봇 모션 플래닝 엔진과 같은 하위 모듈에 입력됩니다.

알고리즘 1 : 다중 모달 주의에 기반한 융합

입력: 시각적 특징 벡터는 hV∈Rd, 오디오 특징 벡터는 hA∈Rd

학습 가능한 매개변수: W∈Rk*d, w∈Rk 그리고 b∈Rk

출력: 융합 표현 h융합∈Rd.

1단계: 방정식 19를 사용하여 중간 표현을 결정하기

2단계: 소프트맥스를 사용해 20식 사용으로 주의력 점수를 정규화합니다

3단계: 방정식 21을 사용하여 융합 벡터를 계산합니다

4단계:융합된 h 반환

주의 기반 다중 모달 융합 알고리즘은 시각적 스트림과 오디오 스트림 같은 다양한 입력 모달리티의 특징을 맥락 인식 방식으로 스마트하게 융합할 수 있는 수단을 제공합니다. 융합은 각 모달리티가 상호 보완적이지만 다양한 정보를 제공하는 시스템에서 필수적입니다. 예를 들어, 시각이 몸짓이나 몸의 위치를 포착하고 오디오가 음성 명령이나 음성 신호를 포착하는 인간-AI 협업 환경입니다.

알고리즘 1은 각 모달리티에 대한 중간 표현을 결정하는 것으로 시작한다. 이 두 모델 모두를 계산하기 위해, eV 는 시각 흐름, eA 는 오디오 스트림을 나타내며, 공유 신경망 계층은 먼저 해당 특징 벡터에 대해 비선형 변환을 수행합니다. 그 후중간 점수들에 대해 SoftMax 함수를 수행하여 주의 가중치α V와 αA 를 계산합니다. 이렇게 하면 가중치가 양수로 되어 합이 1이 되어, 각 모달리티의 기여도를 정규화하는 셈입니다. 모델링된 모달리티가 더 유익할수록 그 주의 비중이 커집니다.

궁극적으로 알고리즘은 그래픽과 오디오 특징 벡터의 가중치 조합을 통해 합된 표현 h를 각각의 주의 가중치로 정규화하여 계산합니다. 이 융합 벡터는 두 모달리티를 데이터 기반의 맥락 민감 방식으로 결합하며, 의도 인식, 의사결정, 로봇 동작 계획과 같은 후속 작업에 사용됩니다. 전체적으로 이 알고리즘은 고정되거나 규칙 기반 융합 방식을 사용하지 않고, 특정 시점에 가장 관련 있는 모달리티 또는 모달리티 조합에 동적으로 집중할 수 있게 합니다. 이로 인해 프레임워크는 더 강력하고 유연하며 동적인 인간-AI 상호작용 상황에서 반응성이 향상됩니다.

그림 2는 시각 및 청각 입력의 맥락 민감 통합에서 작동하는 주의 기반 다중 모드 융합 메커니즘의 워크플로우를 보여줍니다. 워크플로우의 첫 단계인 시각적 특징 추출은 입력 이미지나 비디오(예: RGB-D 카메라)에서 공간 또는 자세 관련 특징을 추출하는 작업을 포함합니다. 이 질문들은 이후 시각적 주의 모듈에 입력되며, 이 모듈은 시각 정보에서 가장 유익한 내용을 강조하는 법을 배웁니다. 동시에, 오디오 주의 모듈은 음성 임베딩이나 음성 명령에서 나오는 오디오 토큰을 처리하여 다양한 청각 신호에 맥락적 의미를 부여합니다. 이렇게 얻은 주의 가중치 특징들은 주의 기반 융합 계층을 통해 통합되고, 잔류 연결과 계층 정규화가 있는 위치별 피드포워드 네트워크로 전달되어 표준 트랜스포머 인코더 블록을 형성합니다. 결과물은 다양한 상호작용 조건에서 견고한 장기 의도 예측과 적응적 의사결정을 지원하는 통합 다중 모달 임베딩입니다. 이 설계는 시스템이 언제든지 더 견고한 모달리티에 선택적으로 집중할 수 있게 하여, 실시간 인간-AI 상호작용에서 견고함과 해석 가능성을 향상시킵니다.

figure-protocol-42
그림 2: 주의 유도 다중 모드 핵융합 모듈의 상세 구조. 각 시간 단계에서 맥락 인식 융합 표현을 생성하기 위해, 모달리티 특화 인코더는 시각 및 청각 스트림에서 특징을 수집합니다. 이러한 특징들은 데이터 기반 주의 메커니즘을 통해 동적으로 가중치가 부여됩니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

온라인 모델 적응

다양한 사용자 행동과 맥락에서 고품질의 인간-AI 협업을 보장하기 위해, 우리 프레임워크는 상호작용 중 사용자 특정 모델을 점진적으로 최적화하는 온라인 모델 적응 메커니즘을 통합합니다. 이 모듈은 실시간 행동 신호(예: 자세, 제스처 궤적, 음성 톤)를 추적하고, 점진적 학습 알고리즘으로 기본 예측 모델을 업데이트합니다. 특히, 궤적 예측 및 의도 인식 모델은 최근 입력을 반영해 경배 기반 미세 조정 또는 저랭크 적응(LoRA)을 통해 미세 조정되어, 시스템이 완전한 재교육 없이도 사용자 행동 변화나 작업별 요구사항에 적응할 수 있습니다.

피드백 계층은 암묵적 피드백(예: 수정, 망설임, 지연)과 명시적 명령(예: 음성 또는 GUI)을 통해 적응과 조화롭게 작동합니다. 이 방법은 두 가지 목적을 가집니다: 다중 모드 단서의 중요성을 적응적으로 보정하고, 신뢰/확신 측정을 의사결정 및 제어 모듈에 전달하는 것입니다.

피드백 사이클은 작업 수행과 사용자 지향적 응답을 원활하게 합니다. 신뢰와 투명성을 키우기 위해, 이 프레임워크는 저수준 모델 결정을 인간이 이해할 수 있는 정당화로 번역하는 설명 가능성 모듈을 통합합니다. 이 도구는 멀티모달 퓨전 트랜스포머의 합리성 맵을 사용하며, 작업 그래프를 통한 논리 추적을 보완합니다. 선택적으로 GUI나 청각 보조 기능을 통해 이 논리를 제시하여 사용자가 시스템 동작을 이해하고 심지어 수정할 수 있도록 할 수 있습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

여기서 제안된 적응형 다중 모달 상호작용 모델은 이러한 문제를 해결하며, 시각과 음성 모드를 실시간 사용자 적응 과정과 원활하게 결합하여 인간-AI 협업을 크게 향상시킵니다. 기본 계층적 다중 모드 시스템과 달리, 우리의 접근법은 개인화된 피드백 루프와 인지 부하 인식 적응을 포함하여 보다 직관적이고 맥락 인식 있는 상호작용을 제공합니다. 객체 처리, 컴포넌트 프레젠테이션, 순서에 따른 목표 달성과 같은 시뮬레이션 협업 활동에서의 실험적 테스트 결과, 시스템은 항상 효율성, 유연성, 사용자 만족도를 향상시켰습니다. 구체적으로, 제안된 방법은 복잡한 상호작용 상황에서 과제 완료 시간을 25% 단축시키고 의도 예측 정확도를 15% 향상시켰습니다. 또한, 사용자는 더 원활한 상호작용과 향상된 시스템 투명성을 경험하여 장기적인 협업을 지원하는 데 적응형 피드백의 필요성을 정당화했습니다. 3은 제안된 방법의 시뮬레...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

연구 결과는 제안된 적응형 다중 모달 상호작용 기반이 인간-AI 협업을 향상시키는 효율성을 결정적으로 입증합니다.

작업 완료 시간(TCT), 인간 의도 예측 정확도(HIPA), 다중 모달 융합 효율(MFE), 오류 복구율(ERR), 사용자 만족도 점수(USS), 상호작용 부드러움 지수(ISI)와 같은 표준 평가 점수 외에도, 적응형 다중 모달 프레임워크의 심층 분석을 위한 추가 사용자 중심 지표를 추가할 수 있습니다. 특히, 인지 부하 지수(CLI)를 도입하여 참가자들이 함께 작업하는 동안 사용자 스트레스를 줄인다는 인지 노력을 정량화할 수 있습니다.

신뢰 교정 점수는 설명 모듈이 시스템에 대한 사용자 신뢰에 미치는 영향 정도를 경험적으로 확인하는 데 활용될 수 있으며, 이는 반복 사용 시 프레임워크가 적절한 신뢰 수준을 유지하는 성능을 측정하는 지표입니다. 마지막으로,...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 이해 상충이 없습니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 중국 우시에 위치한 강난대학교 디자인학부의 지원에 깊이 감사드립니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
RGB-D 카메라 (인텔 리얼센스 D435)인텔 코퍼레이션D435깊이 해상도 1280 & 배; 720 픽셀 @ 30 fps; RGB 해상도 1920 이상; 1080 픽셀 @ 30fps; 사용자 자세, 신체 움직임, 공간적 맥락 포착에 사용됩니다
지향성 마이크일반 / 다중 공급업체해당 없음광대역 노이즈 캔슬링 마이크 (16 kHz & ndash; 44.1 kHz); 음성 명령 수집에 사용됨
BlazePose (사전 학습된 모델)구글https://developers.google.com/mediapipe/solutions/vision/pose33개의 핵심 포인트를 가진 포즈 추정 모델; 실시간 인간 자세 추출
OpenPose (사전 학습된 모델)CMU 지각 컴퓨팅 연구실https://github.com/CMU-Perceptual-Computing-Lab/openpose운동 궤적을 추출하기 위해 사용되는 다중 사용자 자세 추정 프레임워크
딥스피치 ASR 엔진모질라v0.9.3음성 변환용 사전 학습된 자동 음성 인식 모델
wav2vec 2.0 ASR 엔진메타 AIhttps://github.com/facebookresearch/fairseq실시간 음성 처리를 위한 자기 감독 음성 표현 모델
트랜스포머 기반 액션 예측 모델 (DLinear / Seq2Seq)맞춤형 구현해당 없음단기 동작 예측에 중점을 둔 시간 인코더-디코더 아키텍처
동적 시간 왜곡(DTW) 모듈커스텀 / 사이피 기반https://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.distance.cdist.html사용자 행동과 미리 정의된 작업 그래프를 맞추는 소프트 정렬 알고리즘
주의 기반 다중 모드 핵융합 네트워크맞춤형 구현해당 없음시각과 음성 입력을 융합하는 신뢰 가중 주의 메커니즘
온라인 적응 모듈 (LoRA / 그라디언트 기반)맞춤형 구현https://github.com/microsoft/LoRA사용자 행동에 적응하기 위한 가볍고 매개변수 효율적인 미세 조정
설명 모듈 (규칙 기반 + 주의 지도)맞춤형 구현해당 없음규칙과 주의 시각화를 사용하여 해석 가능한 의사결정 근거를 제공합니다
KINOVA Gen3 로봇 팔키노바 로보틱스3세대7 심도 로봇 조작기가 통합 토크 센서를 탑재했으며; 협업 장난감 자동차 조립에 사용
협력 조립 시뮬레이션 환경커스텀 환경해당 없음다중 모달 협업 벤치마킹에 사용되는 실제 장난감 자동차 조립 설정
평가 지표 (TCT, HIPA, MFE, 지연, ERR, USS, ISI)사용자 정의해당 없음협업 효율성, 정확성, 신뢰를 평가하는 정량적이고 사용자 중심적인 지표

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Yu, P., Abuduweili, A., Liu, R., Liu, C. Robustifying long-term human-robot collaboration through a hierarchical and multimodal framework. arXiv. , (2024).
  2. Cheng, Y., Sun, L., Liu, C., Tomizuka, M. Towards efficient human-robot collaboration with robust plan recognition and trajectory prediction. IEEE Robot Autom Lett. 5, 2602-2609 (2020).
  3. Abuduweili, A., Li, S., Liu, C. Adaptable human intention and trajectory prediction for human-robot collaboration. arXiv. , (2019).
  4. Amirova, A., Rakhymbayeva, N., Yadollahi, E., Sandygulova, A., Johal, W. Ten years of human-NAO interaction research: A scoping review. Front Robot AI. 8, 744526(2021).
  5. Liu, R., Liu, C. Human motion prediction using adaptable recurrent neural networks and inverse kinematics. IEEE Control Syst Lett. 5, 1651-1656 (2021).
  6. Wang, T., Zhao, Y., Chen, L., Li, Q., Xu, Y., Zhang, H. Multimodal human-robot interaction for human-centric smart manufacturing: A survey. Adv Intell Syst. 6, 2300359(2024).
  7. Ergonomic adaptation of robotic movements in human-robot collaboration. van den Broek, M. K., Moeslund, T. B. Companion Proc. ACM/IEEE Int Conf Hum-Robot Interact, 2020, 499-501 (2020).
  8. Human-robot collaboration using multimodal perception. Yang, Y., et al. Proc IEEE Int Conf Robot Biomimetics (ROBIO), , 358-363 (2021).
  9. Sawadwuthikul, G., et al. Intelligent manufacturing with deep reinforcement learning. IEEE Trans Ind Inform. 18, 1883-1894 (2022).
  10. Multimodal robotic manipulation in collaborative tasks. Huang, W., Gu, J., Duan, P., Hou, S., Zheng, Y. Proc IEEE Int Conf Robot Autom (ICRA), , 14213-14219 (2021).
  11. Dellermann, D., et al. The future of human-AI collaboration: A taxonomy of design knowledge for hybrid intelligence systems. arXiv. , (2021).
  12. Ostheimer, J., Chowdhury, S., Iqbal, S. An alliance of humans and machines for machine learning: Hybrid intelligent systems and their design principles. Technol. Soc. 66, 101647(2021).
  13. Afsar, B., Al-Ghazali, B. M., Cheema, S., Javed, F. Cultural intelligence and innovative work behavior: The role of work engagement and interpersonal trust. Eur J Innov Manag. 24, 1082-1109 (2020).
  14. Spadaro, G., Gangl, K., Van Prooijen, J. W., Van Lange, P. A. M., Mosso, C. O. Enhancing feelings of security: How institutional trust promotes interpersonal trust. PLoS ONE. 15, e0237934(2020).
  15. Pavez, I., Gómez, H., Laulié, L., González, V. A. Project team resilience: The effect of group potency and interpersonal trust. Int J Proj Manag. 39, 697-708 (2021).
  16. Yuan, H., Long, Q., Huang, G., Huang, L., Luo, S. Different roles of interpersonal trust and institutional trust in COVID-19 pandemic control. Soc Sci Med. 293, 114677(2022).
  17. Yun, Y., Ma, D., Yang, M. Human-computer interaction-based decision support systems with applications in data mining. Future Gener Comput Syst. 114, 285-289 (2021).
  18. Nazar, M., Alam, M. M., Yafi, E., Su'ud, M. M. A systematic review of human-computer interaction and explainable artificial intelligence in healthcare. IEEE Access. 9, 153316-153348 (2021).
  19. Ho, Y. H., Tsai, Y. J. Open collaborative platforms for multi-drone search and rescue operations. Drones. 6, 132(2022).
  20. VAHAK: A blockchain-based outdoor delivery scheme using UAVs for healthcare 4.0 services. Gupta, R., et al. Proc IEEE INFOCOM Workshops, , 255-260 (2020).
  21. BloCoV6: A blockchain-based 6G-assisted UAV contact tracing scheme for COVID-19. Zuhair, M., Patel, F., Navapara, D., Bhattacharya, P., Saraswat, D. Proc 2nd Int Conf. Intell Eng Manag (ICIEM), , 271-276 (2021).
  22. Sahoo, S. K., et al. Intelligent trust-based utility and reusability model using UAV-assisted sensor networks. Appl Sci. 12, 1317(2022).
  23. Ko, Y., et al. Drone secure communication protocol for future sensitive military applications. Sensors. 21, 2057(2021).
  24. Gupta, R., Kumari, A., Tanwar, S., Kumar, N. Blockchain-envisioned softwarized multi-swarming UAVs to tackle COVID-19 situations. IEEE Netw. 35, 160-167 (2020).
  25. Tomsett, R., et al. Rapid trust calibration through interpretable and uncertainty-aware. Patterns. 1, 100049(2020).
  26. Huang, R., Zhou, H., Liu, T., Sheng, H. Multi-UAV collaboration to survey Tibetan antelopes in Hoh Xil. Drones. 6, 196(2022).
  27. Seeber, I., et al. Machines as teammates: A research agenda on AI in team collaboration. Inf Manag. 57, 103174(2020).
  28. Ajoudani, A., et al. Progress and prospects of the human-robot collaboration. Auton Robots. 42, 957-975 (2018).
  29. Oviatt, S., et al. The Handbook of Multimodal-Multisensor Interfaces, Volume 1: Foundations, User Modeling, and Common Modality Combinations. , Association for Computing Machinery. New York, NY, USA. (2017).
  30. Villani, V., Pini, F., Leali, F., Secchi, C. Survey on human-robot collaboration in industrial settings. Mechatronics. 55, 248-266 (2018).
  31. Nikolaidis, S., et al. Human-robot collaboration in manufacturing: Quantitative evaluation of predictable, convergent robot behavior. Auton Robots. 41, 123-140 (2017).
  32. Roggen, D., Junker, M., Transter, G., Roques, D. L. Collecting complex activity datasets in smart environments. J Ambient Intell Humaniz Comput. 1, 1-17 (2009).
  33. Bazarevsky, V., et al. BlazePose: On-device real-time body pose tracking. arXiv. , (2020).
  34. Garcia, S., Gomez-Donoso, F., Cazorla, M. Enhancing human-robot interaction: Development of a multimodal robotic assistant for user emotion recognition. Appl Sci. 14, 11914(2024).
  35. Li, S., et al. Toward proactive human-robot collaborative assembly: A multimodal transfer-learning-enabled action prediction approach. IEEE Trans Ind Electron. 69, 8579-8588 (2021).
  36. Abdelrahman, A. A., Almotiri, J., Yaseen, Q., Alanazi, A., Alotaibi, B. Multimodal engagement prediction in multiperson human-robot interaction. IEEE Access. 10, 61980-61991 (2022).
  37. Chiossi, F., et al. Designing intent: A multimodal framework for human-robot cooperation in industrial workspaces. arXiv. , (2025).
  38. McGrath, M. J., Chen, Y., Patel, A., Smith, J., Rao, V. Collaborative human-AI trust (CHAI-T): A process framework for active management of trust in human-AI collaboration. arXiv. , (2024).
  39. Fragiadakis, G., Nikas, C., Karageorgiou, E., Papadopoulos, A. Evaluating human-AI collaboration: A review and methodological framework. arXiv. , (2024).
  40. Younis, H. A., Khan, S., Raza, M., Ahmed, F., Mahmood, T. Multimodal age and gender estimation for adaptive human-robot interaction: A systematic literature review. Processes. 11, 1488(2023).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

AI

관련 논문