本研究は、オンライン適応と注意駆動型マルチモーダル融合を伴うダイナミックタイムワーピング(DTW)に基づく階層的アライメントメカニズムを提案し、信頼性の高い長期的な意図予測とタスクトラッキングを可能にします。軽量な説明可能性モジュールは解釈性を向上させ、人間とAIの協力に対する信頼を促進します。このアプローチはロボットシステムと仮想インタラクティブシステムの両方に一般化されます。
研究記事
本研究は、オンライン適応と注意駆動型マルチモーダル融合を伴うダイナミックタイムワーピング(DTW)に基づく階層的アライメントメカニズムを提案し、信頼性の高い長期的な意図予測とタスクトラッキングを可能にします。軽量な説明可能性モジュールは解釈性を向上させ、人間とAIの協力に対する信頼を促進します。このアプローチはロボットシステムと仮想インタラクティブシステムの両方に一般化されます。
効果的で自然な人間とAIの協力を実現することは、特に動的な現実世界環境において依然として大きな課題です。既存のフレームワークは、硬直した単一モーダル入力やルールベースのマルチモーダル融合によって制限され、堅牢性、パーソナライズ、適応性が制限されています。本研究は、視覚ベースのポーズ推定と音声ベースのコマンド理解を階層的な人間の意図予測モデルに統合した適応型マルチモーダル相互作用フレームワークを導入します。このフレームワークは、アクション予測のためにトランスフォーマーベースのシーケンスモデルを用い、長期計画のために人間の行動を構造化されたタスクグラフと整合させるダイナミックタイムワーピングを用いています。従来の静的なモダリティスイッチングに依存する手法とは異なり、私たちのアーキテクチャでは注意ベースの融合メカニズムを用いて、最も情報量の高い入力を動的に重み付けします。さらに、オンライン適応モジュールによりユーザーの行動をリアルタイムで調整でき、軽量な説明可能性レイヤーが付随してユーザーの信頼を育んでいます。協働組立タスクにおける実験評価では、タスクのパフォーマンス(最大24%)、意図予測精度(最大18%)、ユーザー満足度において有意な向上が示されました。これらの結果は、適応型マルチモーダル相互作用フレームワークの有効性と多様性を強調し、より信頼性が高く透明性が高く人間志向のAIシステムへと協働知能を推進する可能性を支持しています。
人間とロボットの協働(HRC)は、特にロボットが人間中心の環境でますます活用されるようになっている中で、重要な研究分野の一つとなっています。短期HRCのフレームワークや技術は大幅に改善されましたが、長期的なHRCはまだ成熟していません。3.産業用途において、長期的なHRCの活用は、複雑な製造プロセスにおける生産性と適応性の顕著な向上につながる可能性があります。家庭環境、ロボットの伴侶、または高齢者介護エージェントは、長期的なHRC5を通じて生活の質を向上させる可能性があります。医療職は、認知症、自閉症、その他の身体的または精神的疾患を持つ患者にケアを提供する、家庭や介護者の代替として地域医療機器を担っています。同時に、旅行や親しみの分野では産業用ロボットを活用してユーザー知識の向上を図っています。インテリジェントエンジニアリングの目的は、AIを人間中心の方法で活用し、能力を回復し、パーソナライズされた作物を作ることであり、これがIndustry 5.0として知られています。ヒューマン・AIおよびヒューマン・ロボット協働システムは、8,9,10の多様な応用分野で探求されています。しかし、近年の研究は、信頼性の高い意図予測と長期的な課題理解を必要とする協働ロボット環境にますます焦点が当てられています。
AIはすでに日常生活に深く根付いており、その自己管理型や半自律的な応用は、ビジネスの多くの分野でますます現れています。これは単に、機能するビジネス機能には現在、技術の変化に適応し、組織の課題に対応できるシステムが必要であることを示しています。このように、AIの導入と実装の過程でハイブリッド化による人間の行動を改善する必要性が、いくつかの障壁を克服する助けとなっています。その結果、ハイブリッドシステムは人工知能と人間知能を組み合わせて複雑なタスクを共に達成し、より良い結果をもたらし、同僚から学ぶことでスキルを向上させます。したがって、ハイブリッドインテリジェントシステム12、協働、増幅知能などの拡張概念は、多様なAIモダリティを統合することで協働を促進する研究と理解を非公式に形成しています。
「信頼」という用語は対人関係研究に由来し、人間関係における感情的な絆を定義しています。例えば、著者13は信頼のレベルが協力当事者の感情、訴求力、倫理の側面を技術的に決定すると指摘しました。社会学的には、対人信頼の変動は個々の幸福、共同体間の交流、社会経済的成長、そして実践的行動に深い影響を与えます。本質的には、HRIはソーシャルワーカーと巧妙なオートマトンの間の手続き的対話を従来の自動機械の言語的障壁を超えて橋渡ししようとする試みです。このような相互作用は、自律システムの計算能力と人間の直感を組み合わせ、多様なアプリケーション環境間で効果的な協力を可能にします。オートマトンの利用には実際の利点があります。財務費の大幅な削減、環境負荷の低減、そして人間のリスクが大幅に減少する10。しかし、成果の最中で、人間のロボットに対する信頼感は柱であり、特に相互作用の一般的な質を評価する際に顕著です。
ロボットに対する人間の信頼のレベルは、その重要性と多くの分野での中心的役割を反映しています。医療分野では、HRIによるとロボットの信頼が医療資源の分配や感染性疾患抑制の効率に影響を与える20,21,22。兵士の応用では、オートマトンに対する社会的信念のレベルが兵士の調査装置戦略の運用能力レベルや輸送機との戦闘精度を左右します。さらに、機械への信頼は、兵士の政策決定におけるAIの能動的信念標準化メカニズムの服従と使用に影響を与えます。環境調査、例えば高度な身体運動研究においても、結果の合理性はHRI26への信頼度に依存します。ただし重要な警告は、意思決定の困難が増すとこの信頼が損なわれ、相互作用を危うくする可能性があるということです。表1は複数の研究の比較概要を示しています。
| 論文(年、出典) | 主な目的 | 主な方法とモダリティ | 洞察 |
| 謝とパク(2021年、arXiv)[28] | 感情的なソーシャルロボットとのロボットのやり取りをカスタマイズしましょう | 言語的および非言語的な手がかり(身体の姿勢、発話、表情)に基づく強化学習の方針 | 強化学習で訓練されたロボットの行動は人間の感情に応じて変化し、シンプルさと没入感を高めます。 |
| Li ら(2022年、IEEE T-IE)[29] | 製造組立の積極的な支援を促進する | 意図予測、転移学習、マルチモーダル学習(視覚+骨格学習) | ベースラインと比較してロボットのプロアクティブ性が向上し、組み立て時の動作予測をより迅速かつ正確に |
| Abdelrahmanら(2022年、IEEE Access)[30] | グループHRIにおける関与のリアルタイム推定 | ルールベースの分類とディープラーニングおよび視覚ベースの視線・頭部姿勢の組み合わせ | ≥90%のFスコア;物理的な構成で複数のユーザーを同時に管理します |
| Chiossi ら(2025年、arXiv)[31] | 製造環境におけるマルチモーダルかつ動的な意図伝達の構造 | 理論的多面レイアウト:SAT透過層;触覚、聴覚、視覚モード | 概念的枠組みを確立し、デザイン環境の媒体、計画、意図を説明します。 |
| McGrathら(2024年、arXiv)[32] | 適応可能な人間とAIの関係に対する信頼の発達をモデル化します。 | チームフェーズと信頼の先行要素;特定のモダリティに依存しない動的な信頼モデル | あらゆる段階の相互作用と時間に対して信頼意識のある設計原則を提供します。 |
| Fragiadakisら(2024年、arXiv)[33] | 人間とAIの協力評価を標準化すること。 | HAICモードに従って意思決定木によって選択されたメトリクス;混合手法指標 | このフレームワークは、AIと人間中心の共生相互作用モダリティに適した指標の選定を支援します。 |
| Younisら(2023年、MDPI)[34] | 人口統計的推論を用いて文脈に適応するHRI | 年齢と性別は視覚と音声モデルを用いて推定され、ロボットの行動は適切に調整されます。 | この調査では、アプローチをまとめ、HRIにおけるカスタマイズ適応の重要性を強調しています。 |
表1:ヒューマン・AIコラボレーションにおける最近の研究の比較概要で、各研究の主要な目標、方法論、発見 を強調しています。研究で使用されたデータセット、その仕様、サイズ、モダリティ、参加者分布。
現在の階層的かつマルチモーダルな人間-ロボット協働(HRC)フレームワークは、視覚的および音声モダリティを長期的な協働に活用する上で顕著な進展を示していますが、依然として多くの研究のギャップが存在し、より一般的な人間とAIの協働環境への適用性を妨げています。まず、現在のフレームワークは主に物理的ロボティクス(例:KINOVA GEN3アーム)に適用可能であり、多様なデジタル環境に存在する非身体的または仮想AIエージェントには移行できません。第二に、マルチモーダリティは視覚と音声で扱われますが、システムはユーザーの状態やタスクの難易度に応じた動的で文脈依存的な融合ではなく、あらかじめ定義されたモーダリティ切り替え戦略を実装しています。第三に、このアプローチはタスク効率性とレジリエンスを強調していますが、長期的な協力やシステムの説明可能性に不可欠なユーザーの信頼、認知的負荷、感情状態を具体的にモデル化していません。さらに、説明可能性のプロセスが意思決定に欠如すると、人間の解釈可能性やシステムの適応的振る舞いへの信頼は制限されます。最後に、評価は単一のドメイン(玩具車の組み立て)に限定されており、マルチドメイン検証は行われず、現実世界での変動を示しています。このようなギャップは、異種入力チャネルを動的に組み合わせ、人間の意図、信頼、文脈をリアルタイムでモデル化して人間とAIの協働を強化する、一般化され適応的かつ人間中心のマルチモーダルインタラクションフレームワークの開発を必要としています。
本研究の最重要目標は、視覚と音声のモダリティをリアルタイムのユーザーモデリングと統合する適応型マルチモーダルインタラクションシステムの設計を通じて、人間とAIの協働を最大化することです。強固な長期的な人間とロボットの協働という堅固な基盤を基に、本研究はマルチモーダルアーキテクチャを、仮想エージェントやインテリジェントインターフェースなどロボティクス以外の一般的なAIシステムに一般化します。主な重点は階層的計画メカニズム を通じた 動的な意図予測であり、低レベルの行動理解と高レベルのタスク進捗追跡を統合しています。ルールベースシステムとは対照的に、本フレームワークではユーザー固有のモデル更新や文脈認識モダリティ融合を含む適応学習手法を用いて、ユーザーの好み、認知状態、環境の動態に応じて相互作用行動を動的に適応させます。さらに、このフレームワークは説明可能なインタラクション推論による透明性と信頼の向上を目指しており、ユーザーがAIの選択を理解しフィードバックを提供できるようにします。最後に、本研究は異なる協働の文脈におけるインタラクションの流暢さ、タスクの有効性、長期的なユーザー満足度の向上を目指しています。
本論文では、視覚と音声のモダリティを動的に融合させることで人間とAIの協働を促進することを目的とした新しい適応型マルチモーダル相互作用フレームワークを紹介します。「ユニモーダル」システムは、タスクの実行や意図予測に単一の入力モダリティ(例:視覚または音声)のみを使用し、複数のチャネルにまたがる情報を統合しないモデルを指します。「非適応型」システムは、ユーザーの行動や文脈に基づいて行動を調整しないルールベースまたは固定戦略システムを指し、例えばルールベーススイッチングベースラインのことです。これらのベースラインは、我々が提案するTransformerと注意誘導融合モデルで実装されたマルチモーダル知覚および適応的相互作用戦略の利点を評価するための基準点を提供します。これまでの階層的HRCパラダイム31に基づき、私たちの手法はいくつかの重要な革新をもたらしています。
本研究は、主に短期行動認識に重点を置いていた従来のマルチモーダル相互作用システムとは対照的に、低レベルの人間の行動を階層的なタスクグラフのノードにマッピングするダイナミックタイムワーピング(DTW)ベースのアライメント機構を提示しています。時間的な予測不可能性やノイズの多いマルチモーダル入力に直面しても、これにより信頼性の高い長期的な意図予測とタスクの進捗追跡が可能になります。
インタラクション中に意図推論および行動予測モデルを継続的に更新するオンライン適応モジュールが提案されたシステムに組み込まれています。これにより、静的またはオフラインで訓練されたマルチモーダルモデルの欠点を克服し、システムは独自のユーザーの行動、好み、文脈の変化に動的に適応できます。
視覚的および聴覚的モダリティは、各タイムステップでの文脈的重要性に基づいて動的に加重され、独自の注意ベースの融合技術を用います。このデータ駆動型融合アプローチは、さまざまなインタラクション設定での堅牢性を向上させ、ルールベースのモダリティスイッチングに代わるものです。
本研究は、階層的な計画や融合の意思決定を理解可能な正当化に変換し、適応型人間AIシステムにおける解釈可能性のギャップを埋めるための軽量説明可能性モジュールを組み込んでいます。これにより長期的な協力の質が向上し、適切な信頼の調整が促進されます。
提案されたアプローチは、具身ロボットを超えて仮想エージェントやインテリジェントインターフェースへと一般化し、多くの人間とAIの協力分野でその有用性を拡大することを意図しています。これはロボットプラットフォームを用いた実際の共同組み立て活動で実証されていますが。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
人間とAIの協力を強化するための提案されたアーキテクチャは、視覚と音声のモダリティを組み合わせた適応型マルチモーダル相互作用パイプラインを動的かつ階層的な推論フレームワークで用いています。この研究は、既に公開された実験データを使用していました。新たな被験者は関与せず、追加の倫理的承認も必要ありませんでした。
提案された適応型マルチモーダル相互作用アーキテクチャ
基本的には、このシステムは知覚モジュールから始まります。例えば、視覚ストリームはRGB-Dセンサーを使ってユーザーの姿勢や動きを捉え、音声ストリームは軽量なASR(自動音声認識)エンジンを使って音声入力を解析します。このような生の入力は、Transformerベースのアクション予測モジュールに入力され、ポーズやコマンドシーケンスにおける時間的依存性を符号化して、低レベルの人間の行動を推論します。その後、高レベルのコラボレーション計画を可能にするために、動的タイムワーピング(DTW)メカニズムが検出されたアクションをあらかじめ定義されたタスクグラフのノードに整合させ、ユーザーの目標や次の行動を予測します。新しい注意ベースの融合モジュールは、各タイムステップでどのモダリティ(音声か視覚か)が最も文脈的に重要な情報を与えているかを判断し、入力の重みを動的に調整します。インタラクションを個別化するために、システムはオンラインモデル適応を含み、リアルタイムで行動予測器をユーザー行動の変化に合わせて適応させます。軽量な説明モジュールも、予測された意図やAIの意思決定をユーザーフレンドリーにまとめ、透明性と信頼を高めます。システム全体は、シミュレーションされたが実際の協調組立環境でテストされており、ユニモーダルおよび適応型マルチモーダル環境間の比較が可能です。このようなアプローチは、あらゆる分野でAIエージェントとのより柔軟で直感的かつ信頼性の高い協働を促進します。
図1 は、人間とAIの協働を向上させることを目的とした、説明された適応型マルチモーダル相互作用フレームワークのアーキテクチャを示しています。これは入力取得フェーズから始まります。これは主に2つのセンシングデバイスに基づいています。ひとつは、深度強化された視覚情報(例:人間の姿勢や動き)を観察するためのRGB-Dカメラと、音声コマンドを収集するための指向性マイクです。生信号はその後、前処理モジュールに通され、入力ストリームのクリーンニング、正規化、フォーマットによって視聴覚データを処理し、その後の解析を行います。その後、パイプラインは特徴抽出フェーズに進み、データは2つのストリームに分割されます。Visual Streamはポーズ推定アルゴリズムを通じてポーズや動きの特徴を分離し、音声を解釈可能なコマンド埋め込みに書き起こします。マルチモーダルのトランスフォーマーエンコーダは、マルチヘッドの自己注意と時間的位置符号化を用いて、相互作用列間の長距離相互依存性を表現し、融合した表現を処理します。ユーザーの現在の目標状態は、長期的な意図およびタスク進行状況予測器によって推定され、低レベルのアクションはDTWベースのアラインメントモジュールによって信頼性の高いタスク追跡のために階層的なタスクグラフのノードにマッピングされます。融合の重みと予測パラメータは、相互作用フィードバックに応じてオンラインモデル適応ループを通じて継続的に更新され、説明可能性モジュールは開放性と自信を促進するための明確な説明を提供します。このパイプライン全体により、システムは動的なタスクや環境でユーザーと適応的かつ効率的に連携して作業できます。

図1:トランスフォーマーに基づく提案されたマルチモーダル相互作用フレームワークの概要。注意誘導型技術を用いて視覚的および聴覚的データを符号化し、動的に統合します。階層的タスクモデリングとオンライン適応を統合したTransformerモジュールは、フューズド表現を処理し、長期的な意図予測とタスク進行の推定を行います。。この図の拡大版はこちらをクリックしてご覧ください。
提案されたシステムは、マルチモーダル融合および階層的計画コンポーネントと連携して、透明性とユーザーの信頼を高めるために、軽量な説明可能性モジュールを組み込んでいます。このモジュールは、DTWベースのタスクグラフアライメント(例:現在のタスク進行状況や予想される次の行動)や注意ベースのフュージョン層(例:モダリティ重要度の重み)から解釈可能な手がかりを導き出します。これらの手がかりは、口頭の命令や視覚的なジェスチャーがシステムの選択に主に影響したか、そして予想される行動がより広い作業計画にどのように位置づけられるかなど、人間にとって理解しやすい説明に変換されます。ユーザーは簡潔な書面または視覚的なフィードバックの形で説明を受け取り、システムの動作を理解し予測し、必要に応じて修正する助けとなります。評価で示されたユーザーの満足度の向上、やり取りの滑らかさ、信頼関連の指標は、説明可能性の認識を間接的に示す指標です。これらの研究結果は、長期的な人間とAIの相互作用において、AIの意思決定に対する透明な推論がユーザーの信頼を高め、協力を促進し、適応型システム挙動の受け入れを促進することを示唆しています。
入力データ
人間とAIの協働のための枠組みにおける入力の獲得は、視覚と聴覚の両方のモダリティを組み合わせた構造化されたマルチモーダルセンシング機構を通じて行われ、人間の行動や意図を効果的に実現します。視覚入力はRGB-Dカメラで取得され、人間のリアルタイムの姿勢情報、空間的位置、周囲の文脈を捉えます。視覚データはBlazePoseのような事前学習済みモデルを通じて処理され、インタラクションタスクで関心のある上半身キーポイントを取得します。同時に、指向性マイクから聴覚情報を取得し、事前学習済みのDeepSpeechモデルを通じて解釈して、曖昧さを解消したり、不確実な視覚的手がかりを提供する音声コマンドを特定します。協同環境では、デュアル入力システムは動的な適応と文脈認識知覚を提供します。トレーニングおよび評価データセットは、組み立てやハンドオーバー行動など多様な相互作用活動に関する5,000以上のマルチモーダルの人間の動きの軌跡を含み、4人のユーザーから制御された半構造化された環境で収集されています。一般化を強化するために、システムはオンラインモデル適応を展開可能にし、ユーザー行動の変化や環境動態に応じてリアルタイムで予測を更新できるようにします。
データセットの説明
提案されたフレームワークのトレーニングおよび評価データセットは、KINOVA GEN3ロボット1を用いた玩具車組立タスクのもとで、実際の人間とロボットの協働実験から得られました。実験環境は、視覚と聴覚の両方を含むマルチモーダル相互作用を含む長期的な協働活動を模倣することを目的としていました。特に、トレーニングデータセットは2人のユーザーによる3,003の軌跡シーケンスで構成されており、テストデータセットは2,088のシーケンスを含み、モデルの一般化を評価するための新規ユーザー2人のデータも含まれています。各軌道には、BlazePoseで取得した上半身のポーズキーポイントの5ステップシーケンスと、DeepSpeech33によって書き起こしされた対応する音声コマンドが記録されます。収集されたデータは、物の届け、道具の使用、協力的な行動などにおけるジェスチャーや命令表現における人間の自然な変化を示しています。マルチモーダルデータセットは、DLinearアクションおよび軌道予測モデルの教師あり学習の基盤であり、視覚のみ、音声のみ、マルチモーダル条件下で実施されたユーザー研究の中心的なベンチマークです。異なるタイプのユーザーや現実的な騒音条件を取り入れることで、恒久的なHRCシステムの堅牢性と適応性試験を保証します。 表2は 詳細なデータセットの説明を示しています。
| 属性 | 詳細 |
| データセット名 | 玩具車組み立てデータセット(社内で収集) |
| コレクション環境 | KINOVA GEN3アームを用いた実世界のHRC実験 |
| ユーザー数(トレーニング) | 2人のユーザー |
| ユーザー数(テスト) | 4人のユーザー(トレーニングセットから2人、未確認2人) |
| トータル・トレイジェクトリーズ(トレーニング) | 3,003回の軌道 |
| トータル・トレイジェクトリー(テスト) | 2,088回の軌道 |
| 捕獲されたモダリティ | ビジュアル(ポーズ用のRGB-D)、音声(音声コマンド) |
| データフォーマット | ポーズキーポイント(BlazePoseより)、音声入力コマンド |
| 時間的解決 | 各軌道には5つの時間ステップが含まれています |
| 扱う業務 | 主な3つの作業:ピック&プレイス、オブジェクトの回転、協働組み立て |
| 使用例 | 動作/軌道予測モデルの教師あり訓練;ユーザースタディ |
表2:データセットの説明。シミュレーション環境に関する情報、プログラミングフレームワーク、ハードウェア設定、評価環境などが含まれます。
データセットの前処理
人間とAIの協働における適応型マルチモーダルインタラクションを可能にするために、視覚的(RGBおよび深度画像)、聴覚(音声コマンド)、時間的行動データ(ポーズキーポイント)などの生データセットに構造化された前処理が施されます。視覚データはまず、BlazePoseやOpenPoseから導出されるポーズ推定モデルfポーズによって抽出されます。フレーム t に対して、人間の姿勢ベクトルは次のように定義されます。
(1)
ここでkはキーポイントの数であり、すべてのキーポイントは2次元座標を含みます。シーケンスは胴体長で正規化され、サヴィツキー・ゴレイフィルターで時間とともに平滑化されます。
(2)
ここでwはろ過ウィンドウの大きさです。次に、生の音声ストリームAt を音声活動検出器(VAD)を用いてセグメントに分割します。信頼できるセグメントは音声認識モデルf(例:DeepSpeech)に入力され、コマンドトークンを引き出します。
(3)
ここでVは認識されたコマンドの語彙です。統合のために、すべてのコマンドトークンは補間ベースのアラインメント関数τを用いて視覚的なポーズタイムスタンプにタイムアライメントされます。
(4)
第三に、時間的意図訓練シーケンス
形成するために、軌道シーケンスと関連する音声コマンドを定義します
。これらはサイズlのスライドウィンドウを使って固定長のセグメントに窓が開かれています。
(5)
(6)
最後に、軌跡ベースの予測モデルでは収束のために、入力はキーポイント次元あたりの平均および単位分散がゼロに正規化されます。
(7)
ここでμj、σj はキーポイント j が完成した訓練セットの平均と標準偏差を表します。
特徴抽出
示された適応型マルチモーダル相互作用パラダイムでは、視覚的、音声的、文脈的なタスク機能を組み合わせることで強力かつリアルタイムの協力が可能になります。特徴抽出のパイプラインは、主に2つのモダリティから同時データ取得を行うことから始まります。視覚信号
と音声信号
で、これらはタイムステップtでインデックスされています。これらの観察は対応する知覚モジュールを通過し、人間の行動、意図、発話指令に関する高度な意味的特徴を得られます。
視覚的特徴の抽出
RGB-Dカメラから得られる生の視覚データ
、人間のポーズ推定器(例:BlazePose)を通じて供給され、空間キーポイントベクトル
を提供します。ここでkは検出されたキーポイントの数を表し、それぞれが3D座標を含みます。
(8)
これらのキーポイントはポーズ軌道
に時間的に埋め込まれ、そこからトレンド・季節分解によって運動ダイナミクスが抽出されます。
(9)
ここで∈_tは残留ノイズを表します。
オーディオ特徴の抽出
音声入力
は事前学習済みの音声認識モデル(例:DeepSpeech)で処理され、トークン長nを用いるトークン化されたコマンド表現
を生成します。
(10)
マルチモーダル核融合
統一された相互作用の文脈を構築するために、信頼度と相互情報に基づく信頼度加重アテンションによって特徴を組み合わせます。
(11)
ここでφV と φAは視覚および聴覚的特徴の共有潜在空間への投影関数であり、t∈[0,1]はエントロピーに基づいて計算される動的モダリティ重み付け項α:
(12)
ここで、
と
は目標状態gと観測されたモダリティとの間の相互情報です。
コンテキスト埋め込みを用いた計画
最後のマルチモーダル特徴ベクトルFt はタスクコンテキストと進行状況Ptで豊かになり、適応計画モジュールの状態入力となります。
(13)
この抽出された特徴xt は、下流の意図予測および動作計画モデルへの入力として用いられ、動的かつ不確実な環境下での適応的かつ堅牢な人間-AI協働を支援します。
タスクグラフアライメント による 行動および計画の予測
マルチモーダル特徴抽出プロセスの後、音声の意図(音声)、姿勢の軌跡(視覚的)、文脈的(例:タスクログや感情)データが統合され、階層的なタスクグラフアラインメントを用いた適応的人間の行動予測や計画推論が含まれます。
タイムステップtにおける積分マルチモーダル特徴ベクトルを次のように表します。
(14)
システムは最初に関数f アクトを通じて 低レベルの人間の動作を予測します。fはしばしばリカレントエンコーダ・デコーダやトランスフォーマーとして表されます。
(15)
ここで F(t-k:t) は直近の k 時間ステップにおける特徴融合列を表し、
は作用集合 A からの予測作用を表します。モジュールは適応損失によってオンラインに微調整されています:
(16)
ここで、CEは作用分類のクロスエントロピー損失を表し、2番目の項は良い将来の軌道予測を促します。
高レベルの計画予測では、タスクを階層的タスクグラフG = (N, E)に沿った進行として枠組み設定し、各ノードni∈Nはサブタスクまたは中間目標を示します。目的は、距離を短縮することで、観測されたアクションシーケンスを参照タスクパスR*∈Gと照合することです。
(17)
ここでP、t は現在の進行トレース、d(⋅)は動的タイムワープ(DTW)距離またはソフトアライメントメトリクスを表します。
最終的な計画レベルの意図
は、予測された行動aをアラインメントされた経路の最も可能性の高い次のステップに投影することで導出されます_t
:
(18)
この階層的復号により、不明瞭またはノイズの多い感覚入力があっても、システムは現在のタスクシーケンスと整合した文脈的に最も関連性の高い高レベルの意図を選択します。この予測計画は協力効率を高めるだけでなく、マルチターンの人間とAIの相互作用における予測力と適応力も高めます。
マルチモーダルフュージョン(注意ベース)メカニズム
適応型人間とAIの協働においては、ユーザーの意図を正しく解釈するために、複数の感覚モダリティ(例:人間のポーズ、軌跡、聴覚:音声コマンド)のマルチモーダル統合が必要です。ルールベースや静的融合アプローチでは、現実世界の動的な人間関係には対応できません。そのため、注意に基づく融合メカニズムを提示し、各モーダリティを各タイムステップで文脈的重要性に応じて動的に重み付けします。
視覚モダリティから抽出された特徴ベクトルをそれぞれ
と
と表します。これらのベクトルは、以前の処理パイプラインで得られた意味情報を符号化します。例えば、視覚的特徴はポーズ推定やアクション予測から得られることがあり、音声特徴はDeepSpeechやwav2vecのようなモデルを用いた音声埋め込みから導き出されることがあります。
注意ベースフュージョンの目的は、各モーダリティの相対的意義を捉えるモダリティ特有の注意重みを計算することです。これはソフトアテンション(ソフトアテンション)メカニズムで行われます。
注意重み計算
最初のステップでは、両方のベクトルを学習可能な変換を通じて共有注意空間へと変換します。つまり、すべてのモダリティ i∈{V,A} に対して、中間注意スコアは次のように計算されます。
(19)
ここで
と
は注意ネットワークの学習可能なパラメータであり、tanhは非線形活性化関数です。この変換により、モデルは各モダリティの高レベルの相関や文脈的顕著性を抽出できます。
これらの正規化されていない注意スコアeVとαA はsoftmax関数で正規化され、合計は1になります
(20)
ここでαV とαA は、それぞれ視覚的および聴覚的モダリティに対する注意の重みです。重みは適応的で、既存のタスクコンテキスト、信号品質、ユーザーの活動に応じて時間とともに更新されます。
(21)
得られる融合表現
は、入力モダリティベクトルの重み付け組み合わせとして得られます。
この結合ベクトルは、視覚情報と聴覚情報の共通の意味を符号化し、最も情報量の高いストリームを積極的に強調します。その後、タスクグラフマッチング、意図予測、ロボットモーションプランニングエンジンなどの下流モジュールに入力されます。
アルゴリズム1:マルチモーダル注意に基づく融合
入力:視覚特徴ベクトルは hV∈Rd、音声特徴のベクトルは hA∈Rd です
学習可能なパラメータ:W∈Rk*d、w∈Rk および b∈Rk
出力:フューズ表現 hフューズド∈Rd。
ステップ1:式19を用いて中間表現を求める
ステップ2:Softmaxを使って、式20を使って注意力スコアを正規化する
ステップ3:式21を用いて融合ベクトルを計算する
ステップ4:ヒューズされたhを戻す
注意ベースマルチモーダル融合アルゴリズムは、視覚ストリームや音声ストリームなどのさまざまな入力モダリティの特徴を文脈認識型でスマートに融合させる手段を提供します。融合は、各モダリティが補完的だが異なる情報を提示するシステムにおいて不可欠です。例えば、視覚がジェスチャーや体の位置を捉え、音声が音声コマンドや音声信号を捉える人間とAIの協働環境などです。
アルゴリズム1は各モダリティの中間表現を決定することから始まります。これら両方のモデル、すなわち視覚の流れを表すeVと音声ストリームのeAを計算するために、共有ニューラルネットワーク層がまず対応する特徴ベクトルに対して非線形変換を行います。次に、注意重みαVおよびA α中間スコアに対してソフトマックス関数を用いて計算します。これにより重みは正になり、和えば1となり、各モダリティからの寄与を正規化します。モダリティが示される情報量が多いほど、その注意の重みは大きくなります。
最終的に、アルゴリズムは融合した描写hを 、それぞれの注意重みで正規化された重み付けされたグラフィックと音声特徴ベクトルの組み合わせで計算します。この融合ベクトルは、データ駆動型かつ文脈に敏感な形で両方のモダリティを組み合わせ、意図認識、意思決定、ロボットの動作計画などの下流作業に役立ちます。総じて、このアルゴリズムにより、固定されたフュージョンやルールベースの融合手法を用いる代わりに、特定の瞬間に最も関連するモダリティやモダリティの組み合わせに動的に集中できるようになります。これにより、フレームワークはより強固で柔軟かつ、動的な人間とAIの相互作用状況で応答性が高まります。
図2は、視覚と聴覚入力の文脈に敏感な統合で動作する注意ベースのマルチモーダル融合メカニズムのワークフローを示しています。ワークフローの最初のステップであるビジュアル特徴抽出は、入力画像や動画(RGB-Dカメラなど)から空間的またはポーズに関連する特徴を抽出するものです。これらは視覚情報の最も有益な内容を強調する学習を行うVisual Attentionモジュールに入力されます。並行して、オーディオアテンションモジュールは音声の埋め込みや音声トークンを処理し、異なる聴覚信号に文脈的な意義を付与します。得られる注意重み付け特徴は注意ベースの融合層を通じて統合され、残留接続と層正規化を含む位置別フィードフォワードネットワークに渡され、標準的なトランスエンコーダブロックを形成します。出力は統一されたマルチモーダル埋め込みであり、異なる相互作用条件下での堅牢な長期意図予測と適応的意思決定をサポートします。この設計により、システムは常により堅牢なモダリティに選択的に集中でき、リアルタイムの人間とAIの相互作用における堅牢性と解釈性が向上します。

図2:注意誘導型マルチモーダル融合モジュールの詳細構造。 各タイムステップで文脈認識型融合表現を生成するために、モダリティ特化エンコーダは視覚および聴覚ストリームから特徴を収集します。これらの特徴はデータ駆動型の注意メカニズムを用いて動的に加重されます。 この図の拡大版はこちらをクリックしてご覧ください。
オンラインモデル適応
異なるユーザーの行動や文脈下での高品質な人間とAIの協働を確保するため、私たちのフレームワークはオンラインモデル適応メカニズムを組み込み、ユーザー固有のモデルを段階的に最適化しています。このモジュールはリアルタイムの行動信号(例:ポーズ、ジェスチャー軌跡、音声トーン)を追跡し、基礎となる予測モデルを段階的な学習アルゴリズムで更新します。特に、軌道予測および意図認識モデルは、勾配ベースのファインチューニングや低ランク適応(LoRA) を通じて 最近の入力を微調整し、完全な再訓練なしに変化するユーザー行動やタスク固有の要件に適応できるようにします。
フィードバック層は、暗黙的フィードバック(例:修正、ためらい、遅延)と明示的命令(例:音声やGUI)の両方を通じて適応しながら調和的に作用します。これには2つの目的があります。マルチモーダル手がかりの顕著さを適応的に較正することと、信頼・信頼測定を意思決定および制御モジュールに送信することです。
フィードバックサイクルにより、よりスムーズなタスクパフォーマンスとユーザー指向の応答が可能になります。信頼と透明性を育むために、このフレームワークは低レベルのモデルの意思決定を人間が理解できる正当化に翻訳する説明可能性モジュールを統合しています。マルチモーダル融合トランスフォーマーの合理マップを使用し、タスクグラフを通じた論理トレーシングを補完します。この理由をGUIや聴覚補助ツールを通じて提示し、ユーザーがシステムの動作を理解し、場合によっては修正できるようにします。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
ここで提案された適応型マルチモーダルインタラクションモデルは、これらの懸念に対応し、視覚と音声のモダリティをリアルタイムのユーザー適応プロセスとシームレスに組み合わせることで、人間とAIの協働を大幅に強化します。基準的な階層的マルチモーダルシステムとは対照的に、私たちのアプローチにはパーソナライズされたフィードバックループと認知負荷認識適応が含まれており、より直感的で文脈認識的な相互作用を提供します。オブジェクトの取り扱い、コンポーネント提示、順序に基づく目標達成などのシミュレーション共同作業での実験テストでは、システムは常に効率性、柔軟性、ユーザー満足度の向上を示しました。具体的には、提案された手法は、特に複雑な相互作用状況において、タスク完了までの時間を25%短縮し、意図予測精度を15%向上させました。さらに、ユーザーはよりスムーズなやり取りとシステムの透明性の向上を経験し、長期的な協力を支援するための適応的フィードバックの必要性を正当化しました。 表 3は提案された手法のシミュレーション環境を示し...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この発見は、提案された適応型マルチモーダル相互作用基盤が人間とAIの協働を促進する効率性を決定的に示しています。
タスク完了時間(TCT)、人間の意図予測精度(HIPA)、マルチモーダル融合効率(MFE)、エラー回復率(ERR)、ユーザー満足度スコア(USS)、インタラクション・スムースネス指数(ISI)などの標準評価スコアに加え、適応型マルチモーダルフレームワークの詳細な分析のためにユーザー中心の指標を追加できます。特に、認知負荷指数(CLI)を導入することで、参加者から引き出される認知的努力を定量化し、適応融合が協力中のユーザーストレスを軽減するかどうかを評価できます。
信頼キャリブレーションスコアは、説明可能性モジュールがシステムの信頼度にどの程度影響を与えるかを実証的に確認するために利用され、繰り返し使用時に適切な信頼レベルを維持するフレームワークのパフォーマンスの指標となります。最後に、学習曲線分析は一連の試行を通じてシステム学習とユーザー学習を示し...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者たちには利益相反はありません。
著者たちは中国無錫の江南大学デザイン学院からの支援に感謝の意を表します。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| RGB-Dカメラ(Intel RealSense D435) | インテル・コーポレーション | D435 | 深度分解能:1280倍以上;720ピクセル @ 30fps;RGB解像度1920時間以上;1080ピクセル @ 30fps;ユーザーのポーズ、身体の動き、空間的文脈の捉えに使用 |
| 指向性マイク | ジェネリック/複数ベンダー | 該当なし | 広帯域ノイズキャンセリングマイク(16kHz–44.1 kHz);口頭命令の収集に使われる |
| BlazePose(事前学習済みモデル) | グーグル | https://developers.google.com/mediapipe/solutions/vision/pose | 33のキーポイントを持つポーズ推定モデル;リアルタイムヒューマンポーズ抽出 |
| OpenPose(事前学習済みモデル) | CMU知覚計算ラボ | https://github.com/CMU-Perceptual-Computing-Lab/openpose | 運動軌道の抽出に用いられる多人間姿勢推定フレームワーク |
| DeepSpeech ASRエンジン | モジラ | v0.9.3 | 音声からテキストへの文字起こしのための事前学習済み自動音声認識モデル |
| wav2vec 2.0 ASRエンジン | メタAI | https://github.com/facebookresearch/fairseq | リアルタイム音声処理のための自己教師あり音声表現モデル |
| トランスフォーマーベースのアクション予測モデル(DLinear / Seq2Seq) | カスタム実装 | 該当なし | 短期行動予測に注目した時間エンコーダ-デコーダアーキテクチャ |
| 動的タイムワープ(DTW)モジュール | カスタム/SciPyベース | https://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.distance.cdist.html | ユーザーの行動をあらかじめ定義されたタスクグラフとマッチングするためのソフトアライメントアルゴリズム |
| 注意型マルチモーダル融合ネットワーク | カスタム実装 | 該当なし | 視覚と音声入力を融合するための信頼加重注意メカニズム |
| オンライン適応モジュール(LoRA/グラデーションベース) | カスタム実装 | https://github.com/microsoft/LoRA | ユーザー行動に適応するための軽量でパラメータ効率の高い微調整 |
| 説明可能性モジュール(ルールベース+注意マップ) | カスタム実装 | 該当なし | ルールと注意の可視化を用いて解釈可能な意思決定の根拠を提供します |
| KINOVA Gen3 ロボットアーム | キノバ・ロボティクス | 第3世代 | トルクセンサーを内蔵した7自由度のロボットマニピュレーター、共同玩具車組立に使用 |
| 協調組立シミュレーション環境 | カスタム環境 | 該当なし | マルチモーダルコラボレーションベンチマーキングに用いられる実世界での玩具車組立セットアップ |
| 評価指標(TCT、HIPA、MFE、レイテンシー、ERR、USS、ISI) | カスタム定義 | 該当なし | コラボレーションの効率性、正確性、信頼を評価するための定量的かつユーザー中心の指標 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト