2025년 12월 23일
우리는 최신 언어와 확산 모델을 결합하여 사용자의 행동과 프로필에 맞게 적응하는 실시간 동기 부여 인터뷰를 수행할 수 있는 오픈 소스 가상 에이전트 플랫폼을 제시합니다. Greta 2.0 플랫폼을 활용하여 영양 및 스포츠 중심 개입 등 다양한 주제를 지원하며, 디지털 치료 상호작용을 향상시키기 위한 유연하고 검증된 도구를 제공합니다.
우리 연구는 상호작용 중 얼굴 표정과 같은 가상 에이전트의 언어적 및 비언어적 행동을 적응시키는 데 중점을 두고 다중 모달 상호작용을 조사합니다. 특히 대형 언어 모델의 최근 머신러닝 분석은 보다 자연스럽고 유연한 인간-컴퓨터 상호작용을 가능하게 합니다. 우선, 실험을 위해 윈도우 컴퓨터를 준비하세요.
공식 배포판 소스에서 Java SE Development Kit 8을 설치하세요. 그 다음 Visual Studio 2013용 Visual C+Redistributable을 설치하세요. 온라인 신청 포털을 통해 CereProc 라이선스를 신청하세요.
제공된 저장소에서 OpenFace를 설치하세요. 비디오 촬영을 위해 웹캠을 구입하세요. 다음으로, 지정된 저장소에서 Greta 소프트웨어 릴리스를 다운로드하세요.
제공된 지침에 따라 NetBeans를 사용해 소프트웨어를 컴파일하세요. 온라인 콘솔에서 Mistral 애플리케이션 프로그래밍 인터페이스 키를 받아라. 파일을 만든 후, 애플리케이션 프로그래밍 인터페이스 키를 붙여넣어 넣으세요.
이제 온라인 콘솔에서 Deepgram 애플리케이션 프로그래밍 인터페이스 키를 얻으세요. 파일 경로를 생성하고 애플리케이션 프로그래밍 인터페이스 키를 생성한 파일에 붙여넣으세요. MoDiff 모델 가져오기를 위해서는 먼저 제공된 소스에서 MoDiff 모델 가중치를 다운로드하세요.
다운로드한 파일을 MoDiff 데이터 폴더에 넣으세요. 다음 단계로 모듈러 JAR을 출시할 예정입니다. 파일을 클릭하고, 열고, Greta, Advanced를 선택하고, Greta Expe Lucie_full.xml 20250128 선택하세요.
표시된 구성이 예상 설정과 일치하는지 확인하세요. 이제 OpenFace 오프라인 ZeroMQ 프로그램을 시작하세요. 레코드 탭에서 ZeroMQ로 방송을 제외한 모든 옵션을 체크 해제하세요.
파일 탭에서 웹캠 열기를 클릭하세요. 사용 가능한 웹캠을 사용해 실시간 특징 추출을 승인하세요. 사용할 웹캠을 선택하세요.
웹캠이 로드되고 실시간 기능 추출이 자동으로 시작될 때까지 기다리세요. 다음으로 OpenFace2 출력 스트림 리더에서 연결(Connect)을 클릭하세요. 사용 가능한 기능 목록이 채워질 때까지 기다리세요.
모두 선택을 클릭한 후 선택한 기능을 검증하도록 설정하세요. MoDiff에서 Launch를 클릭하고 연결 확인 메시지를 기다리세요. 그 다음 Connect를 눌러 MoDiff와 데이터 수신기 간의 연결을 활성화하세요.
필터 아래에서 생성된 데이터 실행을 허용하려면 Perform을 클릭하세요. MoDiff 창에서 활성화를 클릭하세요. 모델이 안정될 때까지 90초간 기다립니다.
ASR을 실행하려면 Dee 그라임 창에서 활성화(Enable)를 누르세요. 그 다음 조건 RL을 선택해 dream을 사용하거나, 기본 언어 모델을 사용할 조건을 선택하세요. MI 상담사 RL 창에서 활성화를 클릭하세요.
모델이 시작될 때까지 30초를 기다립니다. 테이블 위에 큰 모니터를 놓고 앞에 의자를 놓으세요. 웹캠을 의자 쪽을 향한 모니터 위에 설치하세요.
의자 앞 탁자 위에 지향성 마이크를 놓으세요. 참가자는 5단계 리커트 척도를 사용하여 의사결정균형척도(DBS) 설문지를 작성하게 합니다. 그 다음 참가자에게 마이크에 대고 말하게 하세요.
우선, 참가자 프로필을 확인하고 DBS 점수를 평가하세요. 점수에 따라 참가자를 저항적, 망설임적, 변화에 열려 있는 것으로 분류하세요. MI 상담사 RL 창에서 참가자가 선택한 토론 주제를 선택하세요.
상담원이 참가자와 대화를 시작할 수 있도록 하려면 시작을 클릭하세요. MI 상담사 창의 답변 섹션에서 해로운 결과물이 있는지 모니터링하세요. 딥그램 창에서 에이전트가 턴을 마친 후 'Listen'을 클릭하세요.
발언이 인식되지 않으면, 참가자의 발언을 요청란에 입력하고 전송을 클릭하세요. 참가자의 답변을 기다리세요. 참가자에게 중재 후 설문지를 작성하도록 요청하세요.
그 후 준비된 연설을 사용해 참가자를 브리핑합니다. 적응형 얼굴 표정을 가진 사용자는 다른 행동 조건 사용자보다 더 긍정적인 감상성을 드러냈다. 태도, 사회적 친밀감, 동기 면담의 질을 평가하는 주관적 설문지 점수에서는 세 가지 표현 조건 간에 유의한 차이가 관찰되지 않았습니다.
대인 관계 우발성이 더 이상 존중되지 않는 불일치 얼굴 표정 조건은 일반적으로 비표현형(즉 에이전트가 표정을 전혀 보이지 않는 상태)과 적응형(주관적 측정 전반에 걸쳐 모델 조건에 의해 주체의 표정이 좌우되는 상태)보다 낮게 평가되었다. 인지된 태도는 인터뷰의 질에 강한 직접적 영향을 미쳤다. 인지된 태도와 동기 면담의 질 간의 관계는 사회적 친밀감에 의해 부분적으로 매개되었으며, 이 효과의 43%를 설명했다.
적응형 꿈 대화 관리자와 상호작용한 참가자들은 일반 대형 언어 모델 기초선과 상호작용한 참가자들보다 유의미하게 높은 친밀감을 보고했습니다. 꿈 대화 관리자는 의사결정 균형 척도로 측정된 동기 점수에서 기저선 모델보다 다양한 참가자 프로필에 더 잘 적응하는 모습을 보였습니다. 기저 및 꿈 상태 모두 치료 기준을 초과하는 동기 부여 면담 점수에 대한 내담자 평가를 제공하였습니다.
우리의 연구 결과는 언어적 및 비언어적 행동을 적응시킨 것이 에이전트의 효율성을 크게 향상시키고 사회적 상호작용 에이전트의 인식을 개선했음을 보여줍니다. 우리 플랫폼은 제스처 생성이나 다른 대화 주제 표현과 같은 다른 적응형 구성 요소의 평가를 가능하게 합니다. 향후 연구는 여러 대화 세션에 걸친 장기적 상호작용과 지속적인 적응에 초점을 맞출 것입니다.
전체 스크립트를 보고 수천 개의 과학 동영상에 액세스하세요
본 연구는 고급 언어 모델과 확산 모델을 활용하여 사용자 행동에 적응하는 실시간 동기 부여 면담용 오픈 소스 가상 에이전트 플랫폼을 제시합니다. 이 플랫폼인 Greta 2.0은 영양 및 스포츠를 포함한 다양한 중재 주제를 지원하여 디지털 치료 상호작용을 강화합니다.
적응형 가상 에이전트를 이용한 디지털 매개 동기 강화 상담(MI)은 행동 건강 중재의 확장성 문제를 해결하며, 환자 참여를 위한 재현 가능하고 표준화된 접근 방식을 제공합니다. 언어적 및 비언어적 단서의 실시간 적응은 사용자 응답에 대한 예측 신뢰도를 높이고, 디지털 치료제의 강력한 타겟 검증을 지원합니다. 이 플랫폼을 통해 기업 R&D 팀은 다양한 환자 프로필에 걸쳐 디지털 중재 전략을 평가하고 최적화함으로써, 리스크가 조정된 포트폴리오의 진전을 도모할 수 있습니다.
이 적응형 MI 에이전트 플랫폼은 초기 가설 검증부터 행동 중재의 전임상 검증에 이르기까지, 디지털 치료제 발견의 연속적인 과정에 부합합니다.