23 de dezembro de 2025
Apresentamos uma plataforma de agente virtual de código aberto para conduzir entrevistas motivacionais em tempo real, combinando linguagem de última geração e modelos de difusão para se adaptar ao comportamento e perfil dos usuários. Utilizando a plataforma Greta 2.0, ele apoia diversos temas, incluindo nutrição e intervenções focadas em esportes, e oferece uma ferramenta flexível e validada para aprimorar as interações terapêuticas digitais.
Nossa pesquisa investiga a interação multimodal com foco na adaptação do comportamento verbal e não verbal de um agente virtual, como a expressão facial durante a interação. Análises recentes em aprendizado de máquina, especialmente em grandes modelos de linguagem, permitem interações humano-computador mais naturais e flexíveis. Para começar, prepare um computador Windows para o experimento.
Instale o Java SE Development Kit 8 a partir da fonte oficial de distribuição. Depois, instale o Visual C+Redistributable para Visual Studio 2013. Solicite uma licença CereProc pelo portal de inscrição online.
Instale o OpenFace a partir do repositório fornecido. Adquira uma webcam para capturar vídeo. Em seguida, baixe a versão do software Greta do repositório especificado.
Compile o software usando NetBeans seguindo as instruções fornecidas. Obtenha uma chave de interface de programação de aplicativos Mistral no console online. Crie o arquivo e depois cole a chave da interface de programação de aplicativos no arquivo criado.
Agora, obtenha uma chave de interface de programação de aplicativos Deepgram no console online. Crie o caminho do arquivo e cole a chave da interface de programação de aplicativos no arquivo criado. Para importar modelos MoDiff, primeiro baixe os pesos dos modelos MoDiff da fonte fornecida.
Coloque o arquivo baixado na pasta de dados do MoDiff. Próximo lançamento: Modular JAR. Clique em Arquivo, Abrir, Greta, Avançado e escolha 20250128 Greta Expe Lucie_full.xml.
Certifique-se de que a configuração exibida corresponde à configuração esperada. Agora inicie o programa offline ZeroMQ do OpenFace. Na aba Gravar, desmarque todas as opções, exceto broadcast, com ZeroMQ.
Na aba Arquivo, clique em Abrir Webcam. Autorize a extração de recursos ao vivo usando a webcam disponível. Selecione a webcam para usar.
Espere até a webcam ser carregada e a extração de recursos ao vivo começar automaticamente. Em seguida, no Leitor de Stream de Saída do OpenFace2, clique em Conectar. Espere a lista de recursos disponíveis aparecer.
Clique em Selecionar Todos e então configure para validar as funcionalidades selecionadas. Em MoDiff, clique em Iniciar e aguarde a mensagem de confirmação de conexão. Depois, pressione Connect para ativar a conexão entre o MoDiff e o receptor de dados.
Em Filtrar, clique em Executar para permitir a execução dos dados gerados. Na janela do MoDiff, clique em Ativar. Espere 90 segundos para o modelo se estabilizar.
Para lançar o ASR, na janela Dee gram, pressione Ativar. Depois, selecione a condição RL para usar sonho ou linha de base para usar um modelo de linguagem grande e simples. Na janela de Conselheiro MI RL, clique em Ativar.
Espere 30 segundos para o modelo começar. Coloque um monitor grande na mesa com uma cadeira posicionada à frente. Posicione uma webcam em cima do monitor, voltada para a cadeira.
Coloque um microfone direcional na mesa em frente à cadeira. Peça ao participante para preencher a Escala de Equilíbrio de Decisão ou questionário DBS usando uma escala Likert de cinco etapas. Depois, peça ao participante para falar no microfone.
Para começar, identifique o perfil dos participantes e avalie a pontuação DBS. Classifique o participante como resistente, hesitante ou aberto a mudanças com base na pontuação. Na janela de Conselheiro MI RL, escolha o tema de discussão escolhido pelo participante.
Clique em Iniciar para permitir que o agente inicie a discussão com o participante. Monitore a seção de respostas da janela do Conselheiro MI para resultados prejudiciais. Na janela do Deepgram, clique em Ouvir após o agente terminar seu turno.
Se a fala não for reconhecida, insira a fala do participante no campo de solicitação e clique em Enviar. Espere pela resposta do participante. Peça ao participante que preencha os questionários pós-intervenção.
Depois, faça o debriefing do participante usando o discurso preparado. Usuários que interagiam com o agente por meio de expressões faciais adaptativas expressaram mais sentimentalismo positivo em sua divulgação do que usuários em outras condições comportamentais. Nenhuma diferença significativa foi observada entre as três condições de expressão nas pontuações subjetivas de questionários que avaliaram atitude, empatia social e qualidade da entrevista motivacional.
A condição de expressão facial descompate, ou seja, quando a contingência interpessoal não é mais respeitada, geralmente era avaliada abaixo tanto do que a inexpressiva, ou seja, quando o agente não demonstra expressão, quanto a adaptativa, ou seja, a expressão do agente é impulsionada pelas nossas condições do modelo em medidas subjetivas. A atitude percebida teve um forte efeito direto na qualidade percebida das entrevistas. A relação entre a atitude percebida e a qualidade da entrevista motivacional foi parcialmente mediada pelo relacionamento social, respondendo por 43% do efeito.
Participantes que interagem com o gerenciador de diálogo adaptativo de sonhos relataram um relacionamento significativamente maior do que aqueles que interagem com a linha base do modelo de linguagem grande simples. O gerenciador de diálogo de sonhos mostrou melhor adaptação a diferentes perfis de participantes do que o modelo base nas pontuações de motivação medidas pela Escala de Equilíbrio Decisional. Tanto as condições de base quanto as de sonho produziram avaliação do cliente das pontuações em entrevistas motivacionais acima do limiar terapêutico.
Nossa descoberta mostra que adaptar comportamentos verbais e não verbais melhorou significativamente a eficácia do agente e melhorou a percepção dos agentes interativos sociais. Nossa plataforma possibilita a avaliação de outros componentes adaptativos, como geração de gestos e a expressão de outros temas de diálogo. Pesquisas futuras focarão na interação de longo prazo e na adaptação contínua ao longo de múltiplas sessões de diálogo.
Veja a transcrição completa e aceda a milhares de vídeos científicos
Este estudo apresenta uma plataforma de agente virtual de código aberto projetada para entrevistas motivacionais em tempo real, utilizando modelos avançados de linguagem e de difusão para se adaptar ao comportamento do usuário. A plataforma, Greta 2.0, suporta diversos temas de intervenção, incluindo nutrição e esportes, aprimorando as interações terapêuticas digitais.
A entrevista motivacional (EM) mediada digitalmente utilizando agentes virtuais adaptativos aborda o desafio de escalabilidade nas intervenções em saúde comportamental, oferecendo uma abordagem reproduzível e padronizada para o engajamento do paciente. A adaptação em tempo real de estímulos verbais e não verbais aumenta a confiança preditiva na resposta do usuário e apoia a validação robusta de alvos para terapêuticas digitais. Esta plataforma permite que equipes corporativas de P&D avaliem e otimizem estratégias de intervenção digital em diversos perfis de pacientes, apoiando o avanço de portfólios ajustado ao risco.
Esta plataforma adaptativa de agente de IA encaixa-se no continuum de descoberta de terapêuticas digitais, desde a fase inicial de testes de hipóteses até a validação pré-clínica de intervenções comportamentais.