우리는 최신 언어와 확산 모델을 결합하여 사용자의 행동과 프로필에 맞게 적응하는 실시간 동기 부여 인터뷰를 수행할 수 있는 오픈 소스 가상 에이전트 플랫폼을 제시합니다. Greta 2.0 플랫폼을 활용하여 영양 및 스포츠 중심 개입 등 다양한 주제를 지원하며, 디지털 치료 상호작용을 향상시키기 위한 유연하고 검증된 도구를 제공합니다.
방법 논문
우리는 최신 언어와 확산 모델을 결합하여 사용자의 행동과 프로필에 맞게 적응하는 실시간 동기 부여 인터뷰를 수행할 수 있는 오픈 소스 가상 에이전트 플랫폼을 제시합니다. Greta 2.0 플랫폼을 활용하여 영양 및 스포츠 중심 개입 등 다양한 주제를 지원하며, 디지털 치료 상호작용을 향상시키기 위한 유연하고 검증된 도구를 제공합니다.
치료 지원에 대한 수요가 증가하면서 점점 더 전문가의 역량을 초과하고 있습니다. 동기부여 면담(MI)을 수행할 수 있는 가상 에이전트는 환자들이 인간 치료사와의 세션 사이에 행동 변화라는 목표를 달성할 수 있도록 돕는 유망한 해결책을 제공합니다. MI는 본질적으로 협력적이고 적응적인 의사소통 형태입니다. 따라서 대화 전략을 상황에 맞게 조정할 수 있는 에이전트를 개발하는 것은 치료의 효과를 크게 높일 수 있습니다. MI 세션 동안 인간 치료사는 인간 환자의 반응과 프로필에 따라 언어적 및 비언어적 행동을 조정합니다. 환자의 동기 수준에 따라 치료사는 그에 맞게 접근 방식을 조정합니다. 따라서 효과적인 MI 가상 에이전트 개발에는 개인화와 적응성이 필수적입니다. 이 논문에서는 실시간으로 사용자에게 언어적·비언어적으로 동적으로 적응하여 MI 세션을 수행할 수 있는 가상 에이전트를 제시합니다. 최첨단 모델을 활용하여 이 시스템은 MI 상호작용을 가능하게 합니다. 가상 에이전트는 Greta 2.0 플랫폼을 통해 구현됩니다. 비언어적 행동은 MODIFF라는 확산 모델을 통해 생성되며, 이는 사용자의 표정과 변화 준비 상태에 적응합니다. 이러한 표정들은 MI 코퍼스에서 학습되었고, 전용 사용자 연구를 통해 검증되었습니다. 대화는 최첨단 대형 언어 모델(LLM)을 사용해 생성되며, MI를 위해 특별히 설계된 대화 관리자와 강화 학습 접근법을 통해 강화되고 사용자 테스트를 통해 검증됩니다. 더 나아가, 대화 관리자는 다양한 사용자 프로필에 맞게 조정할 수 있습니다. 결과적으로 만들어진 플랫폼은 오픈소스이며 실시간 다중 모드 MI 대화 생성을 용이하게 하여 디지털 매개 치료 상호작용을 위한 새로운 도구를 제공합니다.
동기 면담(MI)은 행동 변화를 장려하는 협력적 치료 접근법입니다. MI 세션 동안 MI 실무자들은 환자들이 변화를 위한 동기를 명확히 표현하고 촉진하도록 돕습니다. 1. 이를 위해 그들은 반성이나 질문과 같은 대화 전략을 사용하며, 미소나 특정 머리와 몸 자세 같은 비언어적 행동으로 강화합니다.
최근 몇 년간 정신 건강 문제의 빈도가 증가함에 따라, 정신 건강 서비스에 대한 수요와이용 가능한 자원 사이에 격차가 생겼습니다. 이로 인해 환자들이 치료를 받기 전 대기 시간이 길어졌다 2,3. 이 문제를 완화하기 위한 한 가지 제안된 해결책은 예약을 기다리는 환자들을 위해 MI를 복제할 수 있는 가상 에이전트를 사용하는 것입니다. 즉각적인 지원과 개입을 제공함으로써, 이 가상 에이전트들은 특히 여러 세션이 필요한 치료 환경에서 대기 기간의 영향을 줄이는 데 도움을 줄 수 있습니다. 여러 연구에서 MI 전문가를 대체하는 것이 목적이 아닌 5,6,7,8,9 같은 에이전트 또는 챗봇의 효과가 입증되었습니다; 이들은 치료 과정에서 보완적인 도구로 기능하도록 설계되었습니다. 예를 들어, 세션 사이에 심근 개입을 제공할 수 있습니다.
이전 MI 요원들이 적응 행동이 제한적이긴 하지만, MI는 본질적으로 협력적이고 적응적인 의사소통 형태입니다. 따라서 대화를 맥락에 맞게 조정할 수 있는 치료제를 개발하는 것은 치료법10의 효과를 크게 높일 수 있습니다. MI 세션 동안 치료사는 환자의 반응, 동기 또는 참여 수준 11,12, 그리고 개별 프로필에 따라 언어(대화) 및 비언어적 행동을 조정합니다. 환자의 동기 수준에 따라 치료사는 그에 맞게 접근 방식을 조정합니다. 따라서 효과적인 MI 가상 에이전트 개발에는 개인화와 적응성이 필수적입니다.
Greta 2.0 플랫폼14 는 실시간 상호작용을 지원하는 모듈형 가상 에이전트 프레임워크입니다. 최근에는 상호작용 중 생성형 AI 모델의 동적 적응을 가능하게 하는 기능을 포함하도록 확장되었습니다.
이 플랫폼에는 MODIFF-815라는 모델이 포함되어 있는데, 이는 사용자의 얼굴 표정에 동적으로 적응하는 실시간 표정을 생성합니다. 이 확산 기반 모델은 MI 맥락에서 수집된 다중 모달 데이터, 즉 치료사와 내담자 쌍 간의 상담 세션 영상으로 구성된 AnnoMI 코퍼스를 기반으로 훈련되었으며, 이 코퍼스는 YouTube와 Viméo 같은 스트리밍 플랫폼에서 수집되었으며, 대화 행위(질문, 인사, 인사 등 행동을 나타내는 발화 분류)와 행동 단위(인간 얼굴 표정의 분류학)에 주석이 달렸습니다. 이 데이터는 사용자의 현재 표정뿐만 아니라 상호작용 중 식별된 MI 특유의 대화 행동과 채택된 대화 전략에 따라 생성에 조건을 부여합니다. 여기에는 MI 관련 사용자의 대화 행위(예: 변경 토크)와 에이전트 자신의 대화 행위(예: 반영 또는 정보 제공)가 포함됩니다. 이 멀티모달 신호들을 실시간으로 통합함으로써, 시스템은 가상 에이전트가 사회적·맥락적으로 적합한 표정을 표현할 수 있게 합니다. 비언어적 행동(NVB)을 상호작용의 맥락에 맞춰 정렬함으로써, 이 가상 에이전트는 인터뷰 과정 전반에 걸쳐 사회적 유대감을 증진하고 내재적 동기 부여의 시작을 지원하도록 설계되었습니다.
또한, 이 플랫폼은 MI를 위해 특별히 설계된 대화 시스템인 DREAM16을 통합하고 있습니다. DREAM은 현재 대화 상태와 사용자의 프로필을 바탕으로 에이전트의 다음 대화 행위를 선택하는 대화 관리자로 구성되어 있습니다. 실제로 AnnoMI 코퍼스 분석은 MI 환자의 세 가지 프로필을 밝혀냈습니다: 변화에 열려 있는 경우(변화를 원하고 지원을 구하는 경우), 수용적(아직 변화를 고려하지 않은 상태), 저항형(환자가 변화할 의도가 없는 경우)13. 가상 에이전트와 상호작용하기 전에, 사용자는 의사결정 균형 척도(DBS) 설문지17에 대한 답변에 따라 이 세 가지 프로필 중 하나를 부여받습니다. 이 대화 시스템은 대화 관리자가 선택한 대화 행위에 대응하는 에이전트의 언어 출력을 생성하는 대형 언어 모델(LLM)으로 보완됩니다. 이 구성 요소는 대화의 맥락적 적응을 가능하게 하여 더 경직되고 규칙 기반의 접근법에 비해 개선된 점입니다. 최근 연구들은 LLM을 활용해 MI-일관성 대화를 생성하는 방법을 탐구했으나, 사용자 프로필을 고려하지 못했습니다18,19. 반면, 이 모듈은 사용자의 프로필에 동적으로 적응하여 이러한 기본 시스템과 비교해 친밀감을 향상시킵니다.
이 모델들을 Greta 2.0 플랫폼에 통합함으로써 동적 MI 개입이 가능해집니다. 모듈식 구현을 통해 각 모델의 영향력을 독립적으로 평가할 수 있습니다. 본 논문에서는 MODIFF-8과 DREAM 모델이 MI 대화에 기여하는 점을 평가하는 실험 수행 방법을 제시합니다. 이 방법은 MI 실무자와의 세션 사이에 맞춤형 MI 개입을 제공하는 데에도 사용할 수 있습니다. 16GB GPU가 장착된 윈도우 컴퓨터와 오픈소스 소프트웨어 설치가 필요합니다. 이 방법을 사용하여 적응 모델이 MI 전달 에이전트의 인지된 품질을 향상시키고 친밀감 형성을 강화함을 입증했습니다. 또한 에이전트가 언어 및 비언어 수준, 대화 전략 수준에서 적응 행동을 사용할 때 환자의 행동 변화 동기가 향상되는 것을 관찰했습니다. 이 논문에서 제시된 결과는 각 환자에 맞게 치료제의 심근경색 개입을 맞춤화하는 것이 긍정적인 영향을 미친다는 것을 보여줍니다.
이 시스템 설계를 지원하기 위해, 동기 부여 면담, 행동 변화 모델, 사용자 유형론 등 영양 코칭의 이론적·실천적 기초를 심층 문헌 검토로 탐구하였습니다. 이 검토는 두 가지 주요 차원의 교차점을 중심으로 구조화된 질적 지식 기반의 개발로 이어졌습니다: 1) 5단계(사전 사상, 숙고, 준비, 행동, 유지 단계)를 따른 사용자의 변화 준비 상태19 , 2) 식이 및 심리적 관련 요인에 기반한 식습관프로필 20 . 세 가지 유형이 확인되었습니다: 직관적 식사자(즉, 배고픔과 포만감 신호를 듣고, 다양하고 주로 식물성 식단을 유지하며, 고품질의 종종 유기농 식품을 우선시함), 감정적 식습관(즉, 스트레스, 외로움, 기쁨을 스트레스, 외로움, 기쁨을 달래며 단 음식이나 기름진 음식을 자주 간식으로 섭취하고, 종종 죄책감을 느끼는 유형), 그리고 제한적인 식사자(즉, 음식 조절에 집착하는 유형), 칼로리를 계산하고, 요요 효과가 있는 잦은 다이어트를 하며, 섭식 장애가 있을 수도 있습니다.
각 단계와 프로필 조합에 대해, 맞춤형 SMART 목표, 동기 부여 구성, 구체적 행동 제안 등 상황에 맞는 대화 전략이 제안되었습니다. 목표는 가상 에이전트가 심리적 준비도와 개인적 성향을 모두 바탕으로 개입을 동적으로 조정할 수 있도록 하는 것이었습니다. 이러한 기초 작업은 사용자 참여와 장기적인 행동 변화를 지속하는 데 필수적인 상호작용 시 개인화와 공감을 높여줍니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 방법은 INSEAD 연구소(Institut européen d'administration des affaires)로부터 윤리적 IRB 승인을 받았으며, 승인 번호는 INSEAD 2024-78 및 INSEAD 2025-23입니다. 모든 참가자는 사전 동의를 제공했고, 실험 시간에 대해 보상을 받았습니다.
1. 참가자 모집
2. 사전 설치 요구 사항
3. 그레타 설치
4. Mistral API 키 구성
5. DeepGram API 키 구성
6. MODIFF 모델 가져오기
7. 그레타 2.0 출시
8. OpenFace 출시
9. MODIFF-8 발사
10. ASR 발사
11. DREAM 출범
12. 방 준비
13. 참가자 환영
14. 참가자 프로필 식별
15. 주제와 프로필 설정
16. 대화 시작
17. 대화 중
18. 개입 이후
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
제시된 프로토콜에서는 측정하고자 하는 행동에 맞게 설문지를 활용해 상호작용 녹취록과 사용자 피드백을 수집했습니다. 우리는 상호작용 결과를 모델과 상호작용 없이 비교했습니다.
프로토콜 활용 MODIFF-8 적응형 표현 생성의 영향 평가
MODIFF-8 모듈은 가상 에이전트가 맥락에 적합하고 행동적으로 동기화된 얼굴 표정을 생성할 수 있도록 하여 가상 에이전트의 사회적 반응성을 향상시키기 위해 설계되었습니다15. 이 설계의 핵심 가설은 적응적 비언어 행동, 특히 상호작용 내용과 일치하는 얼굴 표정이 MI19, 20, 21 기간 동안 친밀감을 형성하고 자기 공개를 촉진하는 데 역할을...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 논문에서는 맞춤형 동기 부여 면담 개입을 제공하고, 통제되고 재현 가능한 상호작용 프레임워크 내에서 개별 행동 생성 모듈을 테스트하는 프로토콜을 제시합니다. 이 방법은 Greta 2.0 플랫폼의 모듈식 아키텍처를 기반으로 하며, 에이전트 동작에 관련된 구성 요소를 제어할 수 있어 연구자들이 특정 모듈을 쉽게 켜고 끌 수 있게 합니다. 이러한 유연성 덕분에 Greta 2.0은 실험적 조작과 인간-에이전트 멀티모달 상호작용의 새로운 특징에 대한 표적 평가 모두에 적합합니다. 이 프로토콜은 두 가지 목적으로 사용할 수 있습니다: Greta 플랫폼의 새로운 모듈(예: 자동 제스처 생성 모듈)의 타당성 테스트, 또는 치료 기준을 초과하는 맞춤형 동기 부여 인터뷰 제공. 결과에서 알 수 있듯이, 이러한 적응 모델의 사용은 사용자 간 행위자에 대한 인식과 행동 변화 동기를 향상시킵니다.
이 플랫폼의 주요 응용 분야 중 하나는 특...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 공개할 것이 없습니다.
이 연구는 ANR-DFG-JST Panorama, ANR-JST-CREST TAPAS(19-JSTS-0001-01), Enhancer(ANR-22-EXEN-0004), PEPR-Ensemble PC3(ANR-22-EXEN-0004) 프로젝트의 일부 자금 지원을 받았습니다. 이 논문에 제시된 평가는 미래를 위한 투자 프로그램의 국가 지원의 일환으로 Idex Sorbonne Université의 지원을 받았습니다. 이 연구는 프랑스 국립연구청(Agence Nationale de la Recherche)이 관리하는 프랑스 정부 보조금(프랑스 2030 프로그램의 일환으로, ANR-22-EXEN-0004 (PEPR eNSEMBLE / MATCHING) 및 22-PESN-0009(PEPR AUTONOM-HEALTH)의 지원을 받았습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 컴퓨터 | 델 | 인텔 코어 i7-14700 프로세서와 엔비디아 RTX5000 프로세서를 탑재한 컴퓨터 | |
| 마이크 헤드셋 | 에포 | 마이크가 달린 헤드셋 | |
| 웹캠 | 로지텍 | 얼굴 표정 추출을 위해 | |
| 웹캠2 | 로지텍 | 비디오 녹화를 위해 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청