23 december 2025
We presenteren een open-source virtueel agentenplatform voor het afnemen van realtime motiverende interviews, waarbij geavanceerde taal- en diffusiemodellen worden gecombineerd om zich aan te passen aan het gedrag en profiel van gebruikers. Met het Greta 2.0-platform ondersteunt het diverse onderwerpen, waaronder voeding en sportgerichte interventies, en biedt het een flexibel, gevalideerd hulpmiddel om digitale therapeutische interacties te verbeteren.
Ons onderzoek onderzoekt multimodale interactie met de nadruk op het aanpassen van verbaal en non-verbaal gedrag van een virtuele agent, zoals gezichtsuitdrukkingen tijdens interactie. Recente analyses in machine learning, met name grote taalmodellen, maken een natuurlijkere en flexibelere mens-computer interactie mogelijk. Om te beginnen, bereid een Windows-computer voor voor het experiment.
Installeer Java SE Development Kit 8 vanaf de officiële distributiebron. Installeer daarna Visual C+Redistributable voor Visual Studio 2013. Vraag een CereProc-licentie aan via het online aanvraagportaal.
Installeer OpenFace vanuit de verstrekte repository. Koop een webcam voor video-opname. Download vervolgens de Greta-softwarerelease uit de opgegeven repository.
Compileer de software met NetBeans volgens de verstrekte instructies. Verkrijg een sleutel voor de Mistral-applicatieprogrammeerinterface van de online console. Maak het bestand aan en plak vervolgens de sleutel van de application programming interface in het aangemaakte bestand.
Haal nu een Deepgram-applicatieprogrammeerinterfacesleutel op van de online console. Maak het bestandspad aan en plak de sleutel van de application programming interface in het aangemaakte bestand. Voor het importeren van MoDiff-modellen download eerst de MoDiff-modelgewichten van de verstrekte bron.
Plaats het gedownloade bestand in de MoDiff-datamap. Vervolgens lanceert Modular JAR. Klik op Bestand, Open, Greta, Geavanceerd en kies 20250128 Greta Expe Lucie_full.xml.
Zorg ervoor dat de weergegeven configuratie overeenkomt met de verwachte opstelling. Start nu het OpenFace offline ZeroMQ-programma. Verwijder in het tabblad Record alle opties behalve uitzenden met ZeroMQ.
Klik in het tabblad Bestand op Webcam openen. Autoriseer live feature-extractie met de beschikbare webcam. Selecteer de webcam die je wilt gebruiken.
Wacht tot de webcam geladen is en de live feature-extractie automatisch start. Klik vervolgens in de OpenFace2 Output Stream Reader op Verbinden. Wacht tot de lijst met beschikbare functies wordt ingevuld.
Klik op Selecteer Alles en stel vervolgens in om de geselecteerde functies te valideren. Klik onder MoDiff op Launch en wacht op het bevestigingsbericht van de verbinding. Druk vervolgens op Connect om de verbinding tussen MoDiff en de dataontvanger te activeren.
Klik onder Filter op Uitvoeren om uitvoering van de gegenereerde data toe te staan. Klik in het MoDiff-venster op Enable. Wacht 90 seconden tot het model stabiel is.
Om ASR te starten, druk in het Dee-gramvenster op Enable. Selecteer vervolgens de voorwaarde RL om dream te gebruiken of baseline om een plain large language-model te gebruiken. Klik in het MI Counselor RL-venster op Enable.
Wacht 30 seconden tot het model start. Zet een grote monitor op tafel met een stoel ervoor. Plaats een webcam bovenop de monitor met de stoel in de richting.
Plaats een richtmicrofoon op de tafel voor de stoel. Laat de deelnemer de Decision Balance Scale of DBS-vragenlijst invullen met behulp van een vijfstappen-Likert-weegschaal. Vraag vervolgens de deelnemer om in de microfoon te spreken.
Om te beginnen identificeer je het deelnemersprofiel en evalueer je de DBS-score. Classificeer de deelnemer als resistent, aarzelend of openstaan voor verandering op basis van de score. In het MI Counselor RL-venster kies je het door de deelnemer gekozen discussiethema.
Klik op Start zodat de agent het gesprek met de deelnemer kan beginnen. Houd het antwoordgedeelte van het MI Counselor-venster in de gaten op schadelijke output. Klik in het Deepgram-venster op Luisteren nadat de agent zijn beurt heeft afgerond.
Als spraak niet wordt herkend, voer dan de spraak van de deelnemer in het verzoekveld in en klik op Verzenden. Wacht op het antwoord van de deelnemer. Vraag de deelnemer om de vragenlijsten na de interventie in te vullen.
Vervolgens debrieft u de deelnemer met behulp van de voorbereide toespraak. Gebruikers die met de agent interactie hadden met adaptieve gezichtsuitdrukkingen toonden meer positieve sentimentaliteit in hun openbaring dan gebruikers in de andere gedragscondities. Er werden geen significante verschillen waargenomen over de drie expressiecondities in subjectieve vragenlijstscores die houding, sociale relatie en kwaliteit van motiverende gesprekken beoordeelden.
De mismatched face expression condition, dat wil zeggen wanneer interpersoonlijke contingentie niet langer wordt gerespecteerd, werd over het algemeen lagere beoordeeld dan zowel de inexpressieve, dat wil zeggen wanneer de agent geen expressie vertoont, als adaptieve, dat wil zeggen dat de expressie van de agent wordt bepaald door onze modelcondities over subjectieve maten. De waargenomen houding had een sterk direct effect op de vermeende kwaliteit van het interviewen. De relatie tussen waargenomen houding en de kwaliteit van motiverende gesprekken werd deels gemedieerd door sociale verbinding, wat 43% van het effect uitmaakte.
Deelnemers die interactie hadden met de adaptieve droomdialoogmanager rapporteerden significant een hogere band dan degenen die met het basisniveau van het eenvoudige grote taalmodel werkten. De droomdialoogmanager liet een betere aanpassing aan verschillende deelnemersprofielen zien dan het basismodel in motivatiescores gemeten met de Decisional Balance Scale. Zowel de basislijn- als de droomcondities leverden een evaluatie van motiverende gespreksscores boven de therapeutische drempel op.
Onze bevinding toont aan dat het aanpassen van verbaal en non-verbaal gedrag de effectiviteit van de agent aanzienlijk verbeterde en de perceptie van sociaal interactieve agenten verbeterde. Ons platform maakt de evaluatie mogelijk van andere adaptieve componenten, zoals het genereren van gebaren en het uitdrukken van andere dialoogonderwerpen. Toekomstig onderzoek zal zich richten op langdurige interactie en voortdurende aanpassing over meerdere dialoogsessies heen.
Bekijk het volledige transcript en krijg toegang tot duizenden wetenschappelijke video's
Deze studie presenteert een open-source platform voor virtuele agenten, ontworpen voor real-time motivationele interviews, waarbij gebruik wordt gemaakt van geavanceerde taal- en diffusiemodellen om zich aan te passen aan het gedrag van de gebruiker. Het platform, Greta 2.0, ondersteunt diverse interventiethema's, waaronder voeding en sport, waardoor digitale therapeutische interacties worden verbeterd.
Digitaal gemedieerde motiverende gespreksvoering (MI) met behulp van adaptieve virtuele agenten pakt de schaalbaarheidsproblematiek bij gedragsgezondheidsinterventies aan en biedt een reproduceerbare en gestandaardiseerde aanpak voor patiëntenbetrekking. Real-time adaptatie van zowel verbale als nonverbale signalen verhoogt de voorspellende betrouwbaarheid van de gebruikersrespons en ondersteunt een robuuste doelvalidatie voor digitale therapieën. Dit platform stelt R&D-teams binnen ondernemingen in staat om digitale interventiestrategieën te evalueren en te optimaliseren over diverse patiëntprofielen heen, wat bijdraagt aan een risico-gecorrigeerde portfolio-ontwikkeling.
Dit adaptieve MI-agentplatform past binnen het continuüm van digitale therapeutische ontdekking, van vroege hypothesetoetsing tot preklinische validatie van gedragsinterventies.