23. Dezember 2025
Wir präsentieren eine Open-Source-Plattform für virtuelle Agenten zur Durchführung von Echtzeit-Motivationsinterviews, die modernste Sprach- und Diffusionsmodelle kombiniert, um sich an das Verhalten und Profil der Nutzer anzupassen. Mit der Greta 2.0-Plattform unterstützt es verschiedene Themen, darunter Ernährung und sportorientierte Interventionen, und bietet ein flexibles, validiertes Werkzeug zur Verbesserung digitaler therapeutischer Interaktionen.
Unsere Forschung untersucht multimodale Interaktion mit dem Schwerpunkt auf der Anpassung des verbalen und nonverbalen Verhaltens eines virtuellen Agenten, wie zum Beispiel Gesichtsausdrücken während der Interaktion. Jüngste Analysen im Bereich maschinelles Lernen, insbesondere große Sprachmodelle, ermöglichen eine natürlichere und flexiblere Mensch-Computer-Interaktion. Bereiten Sie zunächst einen Windows-Computer für das Experiment vor.
Installiere Java SE Development Kit 8 von der offiziellen Vertriebsquelle. Installieren Sie dann Visual C+Redistributable für Visual Studio 2013. Beantragen Sie eine CereProc-Lizenz über das Online-Antragsportal.
Installiere OpenFace aus dem bereitgestellten Repository. Installieren Sie eine Webcam für Videoaufnahmen. Als Nächstes laden Sie die Greta-Softwareversion aus dem angegebenen Repository herunter.
Kompilieren Sie die Software mit NetBeans und folgen Sie den bereitgestellten Anweisungen. Erhalten Sie einen Mistral-Anwendungsprogrammierschnittstellen-Schlüssel von der Online-Konsole. Erstellen Sie die Datei und fügen Sie dann den Programmierschnittstellenschlüssel in die erstellte Datei ein.
Holen Sie sich nun einen Deepgram-Anwendungsprogrammierschnittstellen-Schlüssel von der Online-Konsole. Erstelle den Dateipfad und füge den Schlüssel der Programmschnittstelle in die erstellte Datei ein. Für den MoDiff-Modellimport laden Sie zunächst die MoDiff-Modellgewichte aus der bereitgestellten Quelle herunter.
Leg die heruntergeladene Datei in den MoDiff-Datenordner. Als nächstes startet Modular JAR. Klicken Sie auf Datei, Öffnen, Greta, Erweitert und wählen Sie 20250128 Greta Expe Lucie_full.xml.
Stellen Sie sicher, dass die angezeigte Konfiguration mit der erwarteten Konfiguration übereinstimmt. Starte jetzt das OpenFace offline ZeroMQ-Programm. Im Reiter Aufzeichnen deaktivieren Sie alle Optionen außer Broadcast mit ZeroMQ.
Im Datei-Tab klicken Sie auf Webcam öffnen. Autorisieren Sie die Live-Feature-Extraktion über die verfügbare Webcam. Wählen Sie die Webcam aus, die Sie verwenden möchten.
Warte, bis die Webcam geladen ist und die Live-Feature-Extraktion automatisch startet. Als Nächstes klicken Sie im OpenFace2 Output Stream Reader auf Verbinden. Warte, bis die verfügbare Funktionsliste angezeigt wird.
Klicken Sie auf 'Alle auswählen' und dann die ausgewählten Funktionen validieren. Unter MoDiff klicken Sie auf Launch und warten Sie auf die Verbindungsbestätigung. Dann drücke Verbinden, um die Verbindung zwischen MoDiff und dem Datenempfänger zu aktivieren.
Klicken Sie unter Filter auf Ausführen, um die Ausführung der generierten Daten zu ermöglichen. Im MoDiff-Fenster klicken Sie auf Aktivieren. Warten Sie 90 Sekunden, bis sich das Modell stabilisiert.
Um ASR zu starten, drücken Sie im Dee-Gramm-Fenster auf Aktivieren. Wählen Sie dann die Bedingung RL aus, um Traum zu verwenden, oder Baseline, um ein einfaches großes Sprachmodell zu verwenden. Im MI Counselor RL-Fenster klicke auf Aktivieren.
Warte 30 Sekunden, bis das Modell startet. Stell einen großen Monitor auf den Tisch mit einem Stuhl davor. Positioniere eine Webcam auf dem Monitor, die zum Stuhl zeigt.
Stellen Sie ein Richtmikrofon auf den Tisch vor dem Stuhl. Lassen Sie den Teilnehmer die Decision Balance Scale oder den DBS-Fragebogen mit einer fünfstufigen Likert-Skala ausfüllen. Bitte dann den Teilnehmer, ins Mikrofon zu sprechen.
Zu Beginn identifizieren Sie das Teilnehmerprofil und bewerten Sie den DBS-Score. Klassifizieren Sie den Teilnehmer als widerstandsfähig, zögerlich oder offen für Veränderungen basierend auf der Punktzahl. Im MI Counselor RL-Fenster wählen Sie das vom Teilnehmer gewählte Diskussionsthema.
Klicken Sie auf Start, damit der Agent die Diskussion mit dem Teilnehmer beginnen kann. Überwachen Sie den Antwortabschnitt des MI Counselor-Fensters auf schädliche Ergebnisse. Im Deepgram-Fenster klicken Sie auf Zuhören, nachdem der Agent seinen Zug beendet hat.
Wenn die Sprache nicht erkannt wird, geben Sie die Rede des Teilnehmers in das Anforderungsfeld ein und klicken Sie auf Senden. Warte auf die Antwort des Teilnehmers. Bitten Sie den Teilnehmer, die Fragebögen nach der Intervention auszufüllen.
Anschließend debriefen Sie den Teilnehmer mit der vorbereiteten Rede. Nutzer, die mit dem Agenten mit adaptiven Gesichtsausdrücken interagierten, zeigten in ihrer Offenlegung mehr positive Sentimentalität als Nutzer bei den anderen Verhaltensbedingungen. Es wurden keine signifikanten Unterschiede zwischen den drei Ausdrucksbedingungen in subjektiven Fragebogenwerten beobachtet, die Einstellung, soziale Beziehung und Qualität des motivierenden Interviews bewerteten.
Die Bedingung des unpassenden Gesichtsausdrucks, also wenn zwischenmenschliche Kontingenz nicht mehr respektiert wird, wurde im Allgemeinen niedriger bewertet als sowohl die inexpressiven, also wenn der Agent keinen Ausdruck zeigt, als auch adaptiv, das heißt, der Ausdruck des Agenten wird durch unsere Modellbedingungen über subjektive Maße hinweg bestimmt. Die wahrgenommene Einstellung hatte einen starken direkten Einfluss auf die wahrgenommene Interviewqualität. Die Beziehung zwischen wahrgenommener Einstellung und Qualität des motivierenden Gesprächs wurde teilweise durch soziale Beziehungen vermittelt, die 43 % des Effekts ausmachten.
Teilnehmer, die mit dem adaptiven Traumdialogmanager interagierten, berichteten von signifikant höherer Beziehung als diejenigen, die mit dem Standardmodell der einfachen großen Sprachen interagierten. Der Dream Dialogue Manager zeigte eine bessere Anpassung an verschiedene Teilnehmerprofile als das Baseline-Modell bei den Motivationswerten, die von der Decisional Balance Scale gemessen wurden. Sowohl die Ausgangs- als auch die Traumbedingungen führten zu einer Klientenbewertung der Motivationsinterview-Ergebnisse über der therapeutischen Schwelle.
Unser Ergebnis zeigt, dass die Anpassung von verbalem und nonverbalem Verhalten die Effektivität des Agenten signifikant verbesserte und die Wahrnehmung sozial interaktiver Agenten verbesserte. Unsere Plattform ermöglicht die Bewertung weiterer adaptiver Komponenten, wie der Gestengenerierung und dem Ausdruck weiterer Dialogthemen. Zukünftige Forschung wird sich auf langfristige Interaktionen und kontinuierliche Anpassungen über mehrere Dialogsitzungen hinweg konzentrieren.
Sehen Sie sich das vollständige Transkript an und erhalten Sie Zugang zu Tausenden wissenschaftlicher Videos
Diese Studie stellt eine quelloffene Plattform für virtuelle Agenten vor, die für Echtzeit-Motivationsgespräche konzipiert ist und fortschrittliche Sprach- und Diffusionsmodelle nutzt, um sich dem Nutzerverhalten anzupassen. Die Plattform Greta 2.0 unterstützt verschiedene Interventionsthemen, darunter Ernährung und Sport, und verbessert so digitale therapeutische Interaktionen.
Die digital vermittelte motivierende Gesprächsführung (MI) unter Verwendung adaptiver virtueller Agenten löst das Skalierbarkeitsproblem bei Interventionen zur Verhaltensgesundheit und bietet einen reproduzierbaren und standardisierten Ansatz für die Einbindung von Patienten. Die Echtzeitanpassung sowohl verbaler als auch nonverbaler Signale erhöht die Vorhersagegenauigkeit bezüglich der Nutzeraussage und unterstützt eine robuste Zielvalidierung für digitale Therapeutika. Diese Plattform ermöglicht es Unternehmensforschungs- und Entwicklungsgruppen, digitale Interventionsstrategien über verschiedene Patientenprofile hinweg zu bewerten und zu optimieren und fördert so die risikoadjustierte Weiterentwicklung des Portfolio.
Diese adaptive Plattform für MI-Agenten fügt sich in den Kontinuum der digitalen therapeutischen Forschung ein, von der frühen Hypothesenprüfung bis hin zur präklinischen Validierung von Verhaltensinterventionen.