私たちは、最先端の言語と拡散モデルを組み合わせ、ユーザーの行動やプロフィールに適応するオープンソースのバーチャルエージェントプラットフォームを提示し、リアルタイムのモチベーショナルインタビューを行います。Greta 2.0プラットフォームを活用し、栄養やスポーツに焦点を当てた介入など多様なトピックをサポートし、デジタル治療的相互作用を強化するための柔軟で検証済みのツールを提供します。
方法論記事
私たちは、最先端の言語と拡散モデルを組み合わせ、ユーザーの行動やプロフィールに適応するオープンソースのバーチャルエージェントプラットフォームを提示し、リアルタイムのモチベーショナルインタビューを行います。Greta 2.0プラットフォームを活用し、栄養やスポーツに焦点を当てた介入など多様なトピックをサポートし、デジタル治療的相互作用を強化するための柔軟で検証済みのツールを提供します。
治療支援の需要増加は、利用可能な専門家の能力をますます超えています。動機付け面接(MI)を実施できるバーチャルエージェントは、患者が人間のセラピストとのセッション間で行動変容の目標を達成するのを支援する有望なソリューションを提供します。MIは本質的に協力的かつ適応的なコミュニケーションの形態です。したがって、会話戦略を文脈に合わせて適応できるエージェントを開発することは、治療の効果を大幅に高める可能性があります。MIセッション中、人間のセラピストは人間の反応やプロフィールに基づいて言語的・非言語的行動を調整します。患者の動機のレベルに応じて、セラピストはアプローチを適切に調整します。したがって、効果的なMIバーチャルエージェントを開発するためには、パーソナライズ性と適応性が不可欠です。本論文では、リアルタイムでユーザーに対して言語的および非言語的に動的に適応することでMIセッションを実行できる仮想エージェントを提示します。最先端のモデルを活用し、このシステムはMIの相互作用を可能にします。バーチャルエージェントはGreta 2.0プラットフォームを用いて実装されています。その非言語的な行動は、MODIFFという拡散モデルによって生成され、ユーザーの表情や変化への準備度に適応します。これらの表情はMIコーパスで学習され、専用のユーザースタディによって検証されました。対話は最先端の大規模言語モデル(LLM)を用いて生成され、MI専用に設計された対話マネージャーによって強化され、強化学習アプローチを採用し、ユーザーテストで検証されています。さらに、ダイアログマネージャーは異なるユーザープロファイルに適応可能です。このプラットフォームはオープンソースで、リアルタイムかつマルチモーダルなMI対話の生成を促進し、デジタル媒介による治療的相互作用のための新しいツールを提供します。
動機付け面接(MI)は、行動変容を促す協働的な治療アプローチです。MIセッション中、MIの施術者は患者が変化への動機を明確に伝え、育むのを支援します。この目的のために、彼らは振り返りや質問などの対話戦略を用い、笑顔や特定の頭体姿勢などの非言語的行動によって強化されます。
近年、メンタルヘルスの問題が増加する中で、メンタルヘルスサービスの需要と利用可能なリソースとの間にギャップが生じています。これにより、患者がセラピーを受けるまでの待ち時間が長くなりました。この問題を緩和するための提案された解決策の一つに、予約待ちの患者のために心梗塞を再現できる仮想エージェントの利用があります。即時のサポートと介入を提供することで、これらのバーチャルエージェントは特に複数回のセッションを必要とする治療的文脈において、待機期間の影響を軽減するのに役立ちます。複数の研究で、MI専門家の代替を目的としないエージェントやチャットボット5、6、7、8、9の有効性が示されています。これらは治療過程における補完的なツールとして機能することを意図しています。例えば、セッションの合間に心音検査(MI)介入を行うこともあります。
従来のMIエージェントは適応行動が限定的であることが多いですが、MIは本質的に協力的かつ適応的なコミュニケーション形態です。したがって、対話を文脈に合わせて適応できるエージェントを開発すれば、セラピー10の効果を大幅に高める可能性があります。MIセッション中、セラピストは患者の反応、動機、関与レベル11,12、そして個々のプロフィールに基づいて、言語(会話戦略)と非言語的行動の両方を調整します。患者の動機のレベルに応じて、セラピストはアプローチを適切に調整します。したがって、効果的なMIバーチャルエージェントを開発するためには、パーソナライズ性と適応性が不可欠です。
Greta 2.0 platform14 は、リアルタイムのやり取りをサポートするモジュラー型仮想エージェントフレームワークです。最近では、生成AIモデルの相互作用中に動的に適応できる機能も組み込むように拡張されました。
このプラットフォームにはMODIFF-8 15というモデルが含まれており、ユーザーの表情に動的に適応するリアルタイムの表情を生成します。この拡散ベースのモデルは、MIの文脈で収集されたマルチモーダルデータ、すなわちAnnoMIコーパスに基づいて訓練されました。AnnoMIコーパスは、セラピストとクライアントのペア間のカウンセリングセッション動画で構成され、YouTubeやViméoなどのストリーミングプラットフォームで収集され、ダイアログアクト(例:質問、挨拶などの行動を示す発話の分類)やアクションユニット(人間の顔表情の分類法)で注釈が付けられています。このデータは、ユーザーの現在の表情だけでなく、対話中に特定されたMI特有の対話行為、採用された会話戦略にも影響します。これには、MI関連ユーザーの対話行為(変更トークなど)や、エージェント自身の対話行為(振り返りや情報提供など)が含まれます。これらのマルチモーダル信号をリアルタイムで統合することで、仮想エージェントは社会的かつ文脈的に適切な表情を表現できます。非言語的行動(NVB)をインタラクションの文脈に合わせることで、このバーチャルエージェントは社会的信頼関係を促進し、面接プロセス全体を通じて内発的動機付けの開始を支援するよう設計されています15。
さらに、プラットフォームにはMI専用に設計された対話システム「DREAM16」も統合されています。DREAMはダイアログマネージャーで構成されており、現在のダイアログ状態とユーザーのプロフィールに基づいてエージェントの次のダイアログアクトを選択します。実際、AnnoMIコーパスの分析では、心筋梗塞患者の3つのプロファイルが明らかになりました:変化への開かれた状態(患者が変化を動機づけ、支援を求める状態)、受容的(患者がまだ変化を考えていない状態)、および抵抗性(患者が変化を望まない状態)13。仮想エージェントとやり取りする前に、ユーザーは意思決定バランススケール(DBS)アンケート17の回答に基づき、これら3つのプロファイルのいずれかに割り当てられます。この対話システムは、エージェントの言語出力を生成する大規模言語モデル(LLM)によって補完されており、これはダイアログマネージャーが選択した対話行為に対応しています。この構成要素は対話の文脈的適応を可能にし、より硬直的でルールベースのアプローチよりも改善を示しています6.最近の研究では、MI整合性対話を生成するためのLLMの利用が検討されていますが、ユーザープロファイルは考慮されていません(18,19)。対照的に、このモジュールはユーザーのプロフィールに動的に適応し、これらのベースラインシステムと比べてラポールを高めます。
これらのモデルをGreta 2.0プラットフォームに統合することで、動的なMI介入が可能になります。モジュール式の実装により、各モデルの影響を独立して評価できます。本論文では、MODIFF-8およびDREAMモデルがMI対話に与える貢献を評価する実験手法を提示します。この方法は、MI実践者とのセッション間に合わせたMI介入を提供するためにも利用できます。16GBのGPUを搭載したWindowsコンピュータとオープンソースソフトウェアのインストールが必要です。この手法を用いて、適応モデルがMIデリバリーエージェントの質の認識を向上させ、ラポール構築を促進することを示しました。また、エージェントが言語レベルおよび非言語レベル、会話戦略レベルで適応行動を用いることで、患者の行動変容動機の改善も観察されています。本論文で示された結果は、各患者に合わせて薬剤の心筋梗塞介入を調整することの肯定的な影響を示しています。
このシステムの設計を支持するために、動機付け面接、行動変容モデル、ユーザータイプ論など、栄養コーチングの理論的および実践的基盤を探求する詳細な文献レビューが実施されました。このレビューにより、2つの重要な側面を中心に構成された質的知識ベースの開発が進められました。1) トランスセオレティカルモデル19 に基づく変化への準備度(5段階:事前熟考、熟考、準備、行動、維持)、2) 食事行動プロファイル(20)食事および心理的関連要因に基づく20 。3つのプロファイルが特定されました。直感的食者(すなわち、空腹感や満腹感のサインに耳を傾け、多様で主に植物性の食事を維持し、高品質でしばしばオーガニックな食品を優先)、感情的な食べ方(ストレス、孤独、喜びを頻繁に甘いものや脂っこいものを間食し、その後に罪悪感を感じるタイプ)、そして制限的な食べ方(つまり、食事のコントロールに執着するタイプ、 彼らはカロリーを計算し、頻繁にダイエットを繰り返し、ヨーヨー効果があり、摂食障害もあるかもしれません。
各段階とプロファイルの組み合わせに対して、カスタマイズされたSMART目標、動機付けの定式化、具体的な行動提案など、文脈に応じた対話戦略が提案されました。この目的は、バーチャルエージェントが心理的準備度と個人的傾向の両方に基づいて介入を動的に適応させることでした。この基盤は、ユーザーの関与と長期的な行動変容を維持する上で極めて重要な、より高いパーソナライズと共感のインタラクションを保証します。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この方法はINSEAD研究所(Institut européen d'administration des affaires)から倫理的IRB承認を受けており、受理番号はINSEAD 2024-78およびINSEAD 2025-23です。すべての参加者はインフォームド・コンセントを提供し、実験時間に対して報酬を受け取りました。
1. 参加者の募集
2. 事前設置要件
3. グレタの設置
4. Mistral APIキー設定
5. DeepGram APIキー設定
6. MODIFFモデルのインポート
7. グレタ2.0のローンチ
8. OpenFaceの立ち上げ
9. MODIFF-8の発射
10. ASR発射
11. DREAMの立ち上げ
12. 部屋の準備をする
13. 参加者を歓迎する
14. 参加者プロフィールを特定する
15. テーマとプロフィールを設定する
16. 対話を始める
17. 対話中
18. 介入後
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
提示されたプロトコルでは、測定したい行動に合わせてアンケートを用いて相互作用の書き起こしとユーザーフィードバックを収集しました。私たちは、モデルの有無にかかわらず相互作用の結果を比較しました。
プロトコルを用いたMODIFF-8適応型表現生成の影響評価
MODIFF-8モジュールは、仮想エージェントが文脈的に適切かつユーザーと行動的に同期した表情を生成することで、社会的応答性を高めるために設計されました。この設計の核心仮説は、特に交換内容に沿った表情などの適応的非言語行動が、MI19、20、21におけるラポール構築や自己開示の促進に役割を果たすというものです。
このリアルタイム適応能力の影...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
本論文では、個別の行動生成モジュールを制御され再現可能な相互作用フレームワーク内で個別の行動生成モジュールをテストするための、個別の動機付け面接介入を提供するためのプロトコルを提示します。この手法はGreta 2.0プラットフォームのモジュールアーキテクチャに基づいて構築されており、エージェントの動作に関わるコンポーネントを制御できるため、研究者は特定のモジュールを簡単にオン・オフ切り替えが可能です。この柔軟性により、Greta 2.0は実験的操作と人間とエージェントのマルチモーダル相互作用における新機能のターゲット評価の両方に適しています。このプロトコルは2つの目的で使用できます。Greta Platformの新しいモジュールの妥当性(例えば自動ジェスチャーを生成するモジュール)の有効性を検証するか、治療閾値を超える質のカスタマイズされた動機付け面接の提供です。結果が示すように、これらの適応モデルの使用はエージェントの認識とユーザーの行動変化の動機を高める。
このプラットフォームの重要な応用の一つは、人間の専門家...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者たちは何も明かすことはありません。
この研究は、ANR-DFG-JST Panorama、ANR-JST-CREST TAPAS(19-JSTS-0001-01)、Enhancer(ANR-22-EXEN-0004)、およびPEPR-Ensemble PC3(ANR-22-EXEN-0004)プロジェクトの一部資金提供を受けました。本論文で提示された評価は、イデックス・ソルボンヌ大学の資金提供を受け、将来の投資プログラムへの国家支援の一環として提供されました。この研究はまた、フランス国立研究庁(Agence Nationale de la Recherche)が管理するフランス政府の助成金(France 2030プログラムの一環としてANR-22-EXEN-0004(PEPR eNSEMBLE / MATCHING)および22-PESN-0009(PEPR AUTONOM-HEALTH)によっても支援されました。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| コンピュータ | デル | Intel Core i7-14700プロセッサとNvidia RTX5000を搭載したコンピュータ | |
| マイクヘッドセット | エピソード | マイク付きのヘッドセット | |
| ウェブカメラ | ロジクール | 表情抽出のために | |
| ウェブカメラ2 | ロジクール | ビデオ録画用 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト