2025年12月23日
私たちは、最先端の言語と拡散モデルを組み合わせ、ユーザーの行動やプロフィールに適応するオープンソースのバーチャルエージェントプラットフォームを提示し、リアルタイムのモチベーショナルインタビューを行います。Greta 2.0プラットフォームを活用し、栄養やスポーツに焦点を当てた介入など多様なトピックをサポートし、デジタル治療的相互作用を強化するための柔軟で検証済みのツールを提供します。
本研究は、バーチャルエージェントの言語的および非言語的行動、例えば相互作用中の表情の適応に焦点を当てたマルチモーダル相互作用を調査しています。特に大規模言語モデルを中心とした機械学習の最近の解析は、より自然で柔軟な人間とコンピュータの相互作用を可能にします。まずは、実験のためにWindowsコンピュータを準備します。
公式ディストリビューションソースからJava SE Development Kit 8をインストールしてください。次にVisual Studio 2013用のVisual C+Redistributableをインストールしてください。オンライン申請ポータルからCereProcのライセンスを申請してください。
提供されたリポジトリからOpenFaceをインストールしてください。ビデオ撮影用のウェブカメラを用意しましょう。次に、指定されたリポジトリからGretaソフトウェアのリリースをダウンロードします。
NetBeansを使って提供された手順に従ってソフトウェアをコンパイルしてください。オンラインコンソールからMistralアプリケーションプログラミングインターフェースキーを取得してください。ファイルを作成し、アプリケーションプログラミングインターフェースキーを作成したファイルに貼り付けます。
さて、オンラインコンソールからDeepgramのアプリケーションプログラミングインターフェースキーを取得しましょう。ファイルパスを作成し、アプリケーションプログラミングインターフェースキーを作成したファイルに貼り付けます。MoDiffモデルのインポートには、まず提供されたソースからMoDiffモデルの重みをダウンロードしてください。
ダウンロードしたファイルをMoDiffのデータフォルダに入れます。次はModular JARをリリースします。ファイルをクリックし、開く、Greta、Advanced、そしてGreta Expe Lucie_full.xml 20250128を選択します。
表示される設定が予想されるセットアップと一致していることを確認してください。では、OpenFaceのオフラインZeroMQプログラムを開始してください。レコードタブで、ZeroMQでのブロードキャスト以外のすべてのオプションをオフにしてください。
「ファイル」タブで「ウェブカメラを開く」をクリックしてください。利用可能なウェブカメラを使ってライブの特徴抽出を許可してください。使用するウェブカメラを選択します。
ウェブカメラが読み込まれてライブフィーチャー抽出が自動的に始まるまで待ちましょう。次に、OpenFace2の出力ストリームリーダーで「接続」をクリックします。利用可能な機能リストが表示されるのを待ちましょう。
「すべて選択」をクリックし、選択した機能を検証する設定をしてください。MoDiffで「起動」をクリックし、接続確認メッセージを待ちます。次に「接続」を押してMoDiffとデータ受信機の接続を有効にします。
フィルターの下で「実行」をクリックして生成データの実行を許可します。MoDiffウィンドウで「Enable」をクリックします。モデルが安定するまで90秒待ちます。
ASRを起動するには、Deeグラムウィンドウで「Enable」を押してください。次に、dreamを使う条件をRLまたは単純な大規模言語モデルに条件を選びます。MIカウンセラーRLウィンドウで「有効化」をクリックしてください。
モデルが始まるまで30秒待ちます。大きなモニターをテーブルの上に置き、前に椅子を置きます。モニターの上に椅子の方を向くウェブカメラを設置します。
椅子の前のテーブルに指向性マイクを置いてください。参加者に意思決定バランススケール(DBS)アンケートに5段階リッカートスケールを用いて回答させます。次に、参加者にマイクに向かって話すよう促します。
まず、参加者のプロフィールを特定し、DBSスコアを評価します。スコアに基づいて参加者を抵抗、ためらい、または変化に寛容なと分類します。MIカウンセラーRLのウィンドウで、参加者が選んだディスカッションテーマを選びます。
「スタート」をクリックして、エージェントが参加者とのディスカッションを開始できるようにします。MIカウンセラーの回答欄で有害な内容がないか監視してください。ディープグラムのウィンドウで、エージェントのターンが終わった後に「聞く」をクリックしてください。
発言が認識されない場合は、参加者の発言をリクエスト欄に入力し、「送信」をクリックします。参加者の答えを待ちましょう。参加者に介入後のアンケートに記入してもらいます。
その後、用意したスピーチを使って参加者にブリーフィングを行います。適応型表情でエージェントと交流したユーザーは、他の行動条件の利用者よりも、開示においてより肯定的な感傷性を示しました。態度、社会的信頼関係、動機付け面接の質を評価する主観的質問票スコアにおいて、3つの表現条件間で有意な差は認められませんでした。
対人関係性が尊重されなくなるミスマッチした表情条件は、一般的に表現が乏しいもの(エージェントが表情を示さない状態)と適応的(主観的指標を横断してモデル条件に左右される表現)よりも低く評価されました。態度の認識は面接の質に強い直接的な影響を与えました。態度の認識と動機付け面接の質の関係は、社会的信頼関係によって部分的に媒介され、効果の43%を占めました。
適応型夢対話マネージャーと交流した参加者は、単純な大規模言語モデルのベースラインと交流した参加者よりも有意に高い信頼関係を示しました。夢対話マネージャーは、意思決定バランススケールで測定された動機スコアにおいて、ベースラインモデルよりも参加者プロファイルの違いにより良い適応を示しました。ベースラインおよび夢の状態の両方で、動機付け面接スコアのクライアント評価が治療閾値を超えました。
私たちの発見は、言語的および非言語的行動を適応させることでエージェントの効果が大幅に向上し、社会的インタラクティブエージェントの知覚も改善されたことを示しています。私たちのプラットフォームは、ジェスチャー生成や他の対話トピックの表現など、他の適応要素の評価を可能にします。今後の研究は、複数の対話セッションにおける長期的な相互作用と継続的な適応に焦点を当てる予定です。
完全なトランスクリプトを表示し、数千本の科学動画にアクセス
本研究では、高度な言語モデルと拡散モデルを利用してユーザーの行動に適応し、リアルタイムで動機づけ面接を行うために設計されたオープンソースの仮想エージェントプラットフォームを提示します。このプラットフォーム「Greta 2.0」は、栄養やスポーツを含むさまざまな介入トピックをサポートし、デジタル治療における相互作用を向上させます。
適応型バーチャルエージェントを用いたデジタル媒介型の動機づけ面接(MI)は、行動健康介入におけるスケーラビリティの課題を解決し、患者エンゲージメントに対する再現性と標準性を備えたアプローチを提供します。言語的および非言語的なキューの両方をリアルタイムで適応させることで、ユーザーの反応に対する予測信頼性が向上し、デジタル治療薬における強固な標的バリデーションがサポートされます。本プラットフォームにより、企業の研究開発チームは多様な患者プロファイルにわたってデジタル介入戦略を評価および最適化することが可能となり、リスク調整後のポートフォリオの推進が促進されます。
この適応型MIエージェントプラットフォームは、初期の仮説検証から行動介入の前臨床検証に至るまで、デジタル治療法探索のコンティニュアムに適合します。