23 декабря 2025 г.
Мы представляем платформу виртуального агента с открытым исходным кодом для проведения мотивационных интервью в реальном времени, сочетая передовые языковые и диффузионные модели для адаптации к поведению и профилю пользователей. Используя платформу Greta 2.0, она поддерживает различные темы, включая вмешательства, ориентированные на питание и спорт, и предлагает гибкий, проверенный инструмент для улучшения цифровых терапевтических взаимодействий.
Наше исследование изучает мультимодальное взаимодействие с акцентом на адаптацию вербального и невербального поведения виртуального агента, например, мимики во время взаимодействия. Недавний анализ в области машинного обучения, особенно в крупной языковой модели, позволяет более естественно и гибко взаимодействовать с человеком и компьютером. Для начала подготовьте компьютер с Windows к эксперименту.
Установите Java SE Development Kit 8 с официального источника дистрибутива. Затем установите Visual C+Redistributable для Visual Studio 2013. Запросите лицензию CereProc через онлайн-портал подачи заявок.
Установите OpenFace из предоставленного репозитория. Приобретите веб-камеру для съёмки видео. Далее скачайте версию программного обеспечения Greta из указанного репозитория.
Компилируйте программное обеспечение с помощью NetBeans, следуя предоставленным инструкциям. Получите ключ интерфейса программирования приложений Mistral из онлайн-консоли. Создайте файл, затем вставьте ключ интерфейса программирования приложений в созданный файл.
Теперь получите ключ интерфейса программирования приложений Deepgram с онлайн-консоли. Создайте путь к файлу и вставьте ключ интерфейса программирования приложений в созданный файл. Для импорта модели MoDiff сначала скачайте веса модели MoDiff с предоставленного источника.
Поместите загруженный файл в папку данных MoDiff. Следующий запуск — модульный JAR. Нажмите на Файл, Открыть, Грета, Расширенное и выберите 20250128 Greta Expe Lucie_full.xml.
Убедитесь, что отображаемая конфигурация соответствует ожидаемой конфигурации. Теперь запускайте офлайн-программу OpenFace ZeroMQ. Во вкладке «Запись» снимите галочку со всеми опциями, кроме вещания с помощью ZeroMQ.
Во вкладке «Файл» нажмите «Открыть веб-камеру». Авторизуйте извлечение функций в реальном времени с помощью доступной веб-камеры. Выберите веб-камеру для использования.
Подождите, пока веб-камера загрузится, и начнётся автоматическое извлечение функций в реальном времени. Далее, в OpenFace2 Output Stream Reader нажмите Connect. Ждите, пока появится список доступных функций.
Нажмите «Выбрать все» и затем установить проверку выбранных функций. В разделе MoDiff нажмите Запуск и дождитесь сообщения подтверждения соединения. Затем нажмите Connect, чтобы активировать соединение между MoDiff и приёмником данных.
В разделе «Фильтр» нажмите «Выполнить», чтобы разрешить выполнение сгенерированных данных. В окне MoDiff нажмите Включить. Подождите 90 секунд, пока модель стабилизируется.
Чтобы запустить ASR, в окне Dee Gram нажмите Включить. Затем выберите условие RL для использования dream или baseline для простой большой языковой модели. В окне MI Counselor RL нажмите Включить.
Подождите 30 секунд, пока модель не запустится. Поставьте большой монитор на стол с креслом перед ним. Разместите веб-камеру на мониторе, обращённую к креслу.
Поставьте направленный микрофон на стол перед креслом. Пусть участник заполнит анкету Decision Balance Scale или DBS с использованием пятиступенчатой шкалы Лайкерта. Затем попросите участника говорить в микрофон.
Для начала определите профиль участника и оцените балл DBS. Классифицируйте участника как сопротивляющегося, нерешительного или открытого к изменениям в зависимости от результата. В окне MI Counselor RL выберите тему обсуждения, выбранную участником.
Нажмите Старт, чтобы агент мог начать обсуждение с участником. Следите за разделом ответов в окне MI Counselor на предмет вредных результатов. В окне Deepgram нажмите «Слушать» после того, как агент завершит свой ход.
Если речь не распознана, введите речь участника в поле запроса и нажмите «Отправить». Ждите ответа участника. Попросите участника заполнить анкеты после вмешательства.
Затем проведите брифинг с участником, используя подготовленную речь. Пользователи, взаимодействующие с агентом с адаптивными выражениями лица, проявляли более позитивную сентиментальность в своём раскрытии, чем пользователи в других условиях поведения. Существенных различий между тремя состояниями экспрессии в субъективных оценках, оценивающих отношение отношения, социальный контакт и качество мотивационного интервью, не наблюдалось.
Условие несоответствия мимики, то есть когда межличностная контингентность больше не учитывается, обычно оценивалось ниже, чем невыразительное, то есть когда агент не проявляет выражения, и адаптивное, то есть выражение агента определяется нашими модельными условиями через субъективные показатели. Воспринимаемое отношение сильно напрямую влияет на качество интервью. Связь между воспринимаемым отношением и качеством мотивационного интервью частично была опосредована социальным контактом, составляя 43% эффекта.
Участники, взаимодействующие с менеджером адаптивного диалога во снах, отмечали значительно более высокий уровень взаимопонимания, чем те, кто взаимодействовал с базовой моделью простого большого языка. Менеджер диалога во сне показал лучшую адаптацию к различным профилям участников, чем базовая модель по мотивационным показателям, измеряемая по шкале баланса принятия решений. Как исходные, так и сновидческие условия приводили к оценке результатов мотивационного интервью клиентом выше терапевтического порога.
Наше открытие показывает, что адаптация вербального и невербального поведения значительно повысила эффективность агента и улучшила восприятие социальных интерактивных агентов. Наша платформа позволяет оценивать другие адаптивные компоненты, такие как генерация жестов и выражение других тем диалога. Будущие исследования будут сосредоточены на долгосрочном взаимодействии и постоянной адаптации в ходе нескольких диалоговых сессий.
Просмотрите полный транскрипт и получите доступ к тысячам научных видео
В данном исследовании представлена виртуальная агентская платформа с открытым исходным кодом, разработанная для проведения мотивационного интервью в режиме реального времени с использованием передовых языковых и диффузионных моделей для адаптации к поведению пользователя. Платформа Greta 2.0 поддерживает различные темы вмешательств, включая питание и спорт, что расширяет возможности цифровых терапевтических взаимодействий.
Мотивационное интервьюирование (MI), проводимое в цифровом формате с помощью адаптивных виртуальных агентов, решает проблему масштабируемости поведенческих медицинских вмешательств, предлагая воспроизводимый и стандартизированный подход к взаимодействию с пациентами. Адаптация вербальных и невербальных сигналов в режиме реального времени повышает прогностическую уверенность в ответе пользователя и обеспечивает надежную валидацию целей для цифровой терапии. Данная платформа позволяет научно-исследовательским группам предприятий оценивать и оптимизировать стратегии цифрового вмешательства для различных профилей пациентов, поддерживая развитие портфеля с учетом рисков.
Эта адаптивная платформа агентов мотивационного интервьюирования (MI) вписывается в континуум поиска цифровых терапевтических средств: от ранней проверки гипотез до доклинической валидации поведенческих вмешательств.