23 grudnia 2025
Prezentujemy otwartoźródłową platformę wirtualnych agentów do przeprowadzania wywiadów motywacyjnych w czasie rzeczywistym, łączącą najnowocześniejszy język i modele dyfuzji, aby dostosować się do zachowań i profilu użytkowników. Wykorzystując platformę Greta 2.0, wspiera różne tematy, w tym interwencje związane z żywieniem i sportem, oferując elastyczne, zweryfikowane narzędzie do ulepszania cyfrowych interakcji terapeutycznych.
Nasze badania dotyczą interakcji multimodalnych, koncentrując się na adaptacji zachowań werbalnych i niewerbalnych wirtualnego agenta, takich jak mimika twarzy podczas interakcji. Najnowsze analizy w uczeniu maszynowym, szczególnie dużych modelach językowych, umożliwiają bardziej naturalną i elastyczną interakcję człowiek-komputer. Na początek przygotuj komputer z systemem Windows do eksperymentu.
Zainstaluj Java SE Development Kit 8 z oficjalnego źródła dystrybucji. Następnie zainstaluj Visual C+Redistributable dla Visual Studio 2013. Wniosek o licencję CereProc można założyć za pośrednictwem portalu aplikacyjnego online.
Zainstaluj OpenFace z udostępnionego repozytorium. Kup kamerę internetową do nagrywania wideo. Następnie pobierz wersję oprogramowania Greta z określonego repozytorium.
Skompiluj oprogramowanie za pomocą NetBeans, stosując podane instrukcje. Pobierz klucz do interfejsu programistycznego Mistral z konsoli internetowej. Utwórz plik, a następnie wklej klucz interfejsu programowania aplikacji do utworzonego pliku.
Teraz pobierz klucz do interfejsu programistycznego Deepgram z konsoli internetowej. Stwórz ścieżkę do pliku i wklej klucz interfejsu programowania aplikacji do utworzonego pliku. Aby importować modele MoDiff, najpierw pobierz wagi modeli MoDiff z udostępnionego źródła.
Włóż pobrany plik do folderu danych MoDiff. Następnie wypuszczę modułowy JAR. Kliknij na File, Otwórz, Greta, Zaawansowane i wybierz 20250128 Greta Expe Lucie_full.xml.
Upewnij się, że wyświetlana konfiguracja odpowiada oczekiwanemu ustawieniu. Teraz uruchom offline program OpenFace ZeroMQ. W zakładce Nagrywaj odznacz wszystkie opcje poza emisją z ZeroMQ.
W zakładce Plik kliknij Otwórz kamerę internetową. Autoryzuj ekstrakcję funkcji na żywo za pomocą dostępnej kamery internetowej. Wybierz kamerę internetową, którą chcesz użyć.
Poczekaj, aż kamera internetowa się załaduje i automatycznie rozpocznie się ekstrakcja na żywo. Następnie w czytniku strumieni wyjściowych OpenFace2 kliknij Połącz. Poczekaj, aż pojawi się dostępna lista funkcji.
Kliknij Wybierz Wszystko, a następnie ustaw opcję weryfikacji wybranych funkcji. W MoDiff kliknij Launch i czekaj na komunikat potwierdzenia połączenia. Następnie naciśnij Łącz, aby aktywować połączenie między MoDiff a odbiornikiem danych.
W sekcji Filtr kliknij Wykonaj, aby umożliwić wykonanie wygenerowanych danych. W oknie MoDiff kliknij Włącz. Poczekaj 90 sekund, aż model się ustabilizuje.
Aby uruchomić ASR, w oknie Dee gram naciśnij Enable. Następnie wybierz warunek RL, aby użyć snu lub bazę do użycia zwykłego dużego modelu językowego. W oknie MI Counselor RL kliknij Enable.
Poczekaj 30 sekund, aż model się uruchomi. Postaw duży monitor na stole, a krzesło z przodu. Umieść kamerę internetową na monitorze skierowanym w stronę krzesła.
Połóż mikrofon kierunkowy na stole przed krzesłem. Uczestnik powinien wypełnić Skalę Równowagi Decyzji lub DBS z wykorzystaniem pięciostopniowej skali Likerta. Następnie poproś uczestnika, by mówił do mikrofonu.
Na początek zidentyfikuj profil uczestnika i oceń wynik DBS. Klasyfikuj uczestnika jako opornego, niechętnego lub otwartego na zmiany w zależności od wyniku. W oknie MI Counselor RL wybierz temat dyskusji wybrany przez uczestnika.
Kliknij Start, aby umożliwić agentowi rozpoczęcie dyskusji z uczestnikiem. Monitoruj sekcję odpowiedzi w oknie doradcy MI pod kątem szkodliwych skutków. W oknie Deepgram kliknij Słuchaj po zakończeniu tury agenta.
Jeśli mowa nie jest rozpoznawana, wpisz mowę uczestnika w polu żądania i kliknij Wyślij. Poczekaj na odpowiedź uczestnika. Poproś uczestnika o wypełnienie kwestionariuszy po interwencji.
Następnie przeprowadz podsumowanie uczestnika, korzystając z przygotowanego przemówienia. Użytkownicy wchodzący w interakcje z agentem za pomocą adaptacyjnych mimik wykazywali więcej pozytywnego sentymentalizmu w ujawnianiu niż użytkownicy w innych warunkach zachowań. Nie zaobserwowano istotnych różnic między trzema warunkami ekspresji w subiektywnych wynikach ankietowych oceniających nastawienie, relacje społeczne oraz jakość wywiadów motywacyjnych.
Niedopasowany warunek mimiki, czyli gdy interpersonalna kontingencja nie jest już respektowana, był zazwyczaj oceniany niżej niż nieekspresyjny, czyli gdy agent nie wykazuje ekspresji, jak i adaptacyjny, czyli ekspresja agenta jest napędzana przez nasze warunki modelowe w różnych subiektywnych miarach. Postrzegane nastawienie miało silny, bezpośredni wpływ na postrzeganą jakość rozmów kwalifikacyjnych. Związek między postrzeganą postawą a jakością motywacyjnego wywiadu był częściowo pośredniczony przez relacje społeczne, które odpowiadały za 43% efektu.
Uczestnicy rozmawiający z adaptacyjnym menedżerem dialogów snów zgłaszali znacząco wyższy kontakt niż ci, którzy korzystali z prostego, dużego modelu językowego bazowego. Menedżer dialogu snów wykazał lepszą adaptację do różnych profili uczestników niż model bazowy w wynikach motywacyjnych mierzonych Skalą Równowagi Decyzyjnej. Zarówno warunki wyjściowe, jak i sny pozwoliły ocenie wyników wywiadu motywacyjnego powyżej progu terapeutycznego.
Nasze wyniki pokazują, że adaptacja zachowań werbalnych i niewerbalnych znacząco poprawiła skuteczność agenta i poprawiła postrzeganie podmiotów interaktywnych społecznie. Nasza platforma umożliwia ocenę innych komponentów adaptacyjnych, takich jak generowanie gestów czy wyrażanie innych tematów dialogowych. Przyszłe badania będą koncentrować się na długoterminowej interakcji i ciągłej adaptacji w trakcie wielu sesji dialogowych.
Wyświetl pełny transkrypt i uzyskaj dostęp do tysięcy filmów naukowych
Niniejsze badanie przedstawia otwartoźródłową platformę wirtualnego agenta zaprojektowaną do prowadzenia motywujących rozmów w czasie rzeczywistym, wykorzystującą zaawansowane modele językowe i dyfuzyjne w celu adaptacji do zachowania użytkownika. Platforma Greta 2.0 obsługuje różne tematy interwencji, w tym żywienie i sport, usprawniając cyfrowe interakcje terapeutyczne.
Motywujący wywiad (MI) przeprowadzany cyfrowo z wykorzystaniem adaptacyjnych agentów wirtualnych rozwiązuje problem skalowalności w interwencjach w zakresie zdrowia behawioralnego, oferując powtarzalne i zestandaryzowane podejście do angażowania pacjentów. Adaptacja wskazówek werbalnych i niewerbalnych w czasie rzeczywistym zwiększa pewność predykcyjną odpowiedzi użytkownika i wspiera rzetelną walidację celów w ramach cyfrowych terapii. Platforma ta umożliwia zespołom B+R w przedsiębiorstwach ocenę i optymalizację strategii interwencji cyfrowych dla zróżnicowanych profili pacjentów, wspierając rozwój portfela projektów z uwzględnieniem analizy ryzyka.
Ta adaptacyjna platforma agenta MI wpisuje się w kontinuum odkrywania cyfrowych terapii, od wczesnego testowania hipotez po przedkliniczną walidację interwencji behawioralnych.