本研究では、トランスフォーマーエンコーダー、もつれを解いた感情表現、および視覚的マッピングを伴うグラフベースのクロスモーダルアテンションを活用し、2つのデータセットにおける感情認識精度を向上させるエンドツーエンドのマルチモーダル感情分析フレームワークを提案します。
研究記事
本研究では、トランスフォーマーエンコーダー、もつれを解いた感情表現、および視覚的マッピングを伴うグラフベースのクロスモーダルアテンションを活用し、2つのデータセットにおける感情認識精度を向上させるエンドツーエンドのマルチモーダル感情分析フレームワークを提案します。
機械に人間の感情状態を理解させ、解釈させ、それに反応させることで、マルチモーダルな感情特性を視覚的にマッピングすることは、インテリジェントなインターフェース設計において極めて重要です。しかしながら、現在のマルチモーダル感情検出アルゴリズムは主に予測性能に焦点を当てており、解釈性、インタラクションの認識、あるいは特徴量レベルでのクロスモーダルな相互作用に関する知見はほとんど得られていません。本研究では、インタラクション指向の視覚化、解釈可能な表現学習、および感情予測を組み合わせた、マルチモーダル感情アスペクトの視覚的マッピングのためのフレームワークを導入しました。手動で作成した特徴量を使用せず、Transformerベースのエンコーダを用いて、テキスト、音声、および視覚的な各モダリティから高レベルの感情埋め込みを抽出しました。堅牢性を向上させるため、もつれ解消表現学習(disentangled representation learning)の手法を用いて、感情固有の情報とモダリティ固有の情報を分離しました。さらに、適応的なアテンション重み付けを用いてモダリティ間の微細な感情関係をシミュレートするため、グラフベースのクロスモーダルアテンションネットワークを構築しました。透明性を高めるために、時間的な感情の軌跡、クロスモーダルアテンションの分布、および潜在的な感情埋め込みを描写するマルチビュー視覚マッピングモジュールを作成しました。提案したフレームワークの評価には、Carnegie Mellon University Multimodal Opinion Sentiment and Emotion Intensity (CMU-MOSEI) データセットおよびChinese Multimodal Sentiment Analysis Dataset (CH-SIMS) を使用しました。実験結果によれば、提案したフレームワークは、精度、F1スコア、相関、および平均絶対誤差において代表的なベースライン手法を一貫して上回りつつ、特徴量レベルの解釈性とインタラクション認識の視覚化を向上させました。加えて、視覚マッピングモジュールによって、マルチモーダルな感情表現、クロスモーダルな相互作用、および時間的な感情ダイナミクスの定性的な解釈が可能となり、インタラクション認識に基づいた視覚化と分析がサポートされました。
人間の感情を正確に識別し、理解する能力は、人間と機械の間のインタラクションを向上させるために極めて重要になっています。感情分析は、ヒューマン・コンピュータ・インタラクションの向上に不可欠であるだけでなく、前診断的な医学的診断1、教室における行動分析2、患者の心理的トラッキング3、車両内での疲労識別4、およびスマートホーム環境におけるインテリジェント管理5など、多くの分野に革命をもたらす可能性があります。アフェクティブ・コンピューティングとディープラーニング6の最近の進展により、人間の感情の複雑さを捉えることができるリアルタイムシステムの構築への関心が高まっています。
現在の多くの手法は、主にテキスト、画像、音声などの単一モーダルデータに依存しています7,8,9。これらのアプローチでは、皮肉や文脈依存のニュアンスといった精緻なシグナルを検出できないことが繰り返し示されています。そのため、これらの制限を克服するために、複数のソースからの補完的なデータを取り入れたマルチモーダル感情評価へと研究が移行しています10,11,12。複数のモーダルを統合する利点は、early fusion-long short-term memory (EF-LSTM)13、light and FM deep neural networks (LF-DNN)14、tensor fusion networks (TFN)、および低ランクマルチモーダル融合アプローチなどのベースラインモデルによって実証されています。しかし、これらのアプローチのほとんどはオフラインでの特徴量生成に依存しており、動的な現実世界の状況には適していません。
感情状態に対応するため、マルチモーダル感情識別に関する研究と応用が過去10年間で発展してきました15。今日、最も困難かつ重要な研究領域の一つは、多様なデータソースを用いた感情状態の継続的なモニタリングです16。このような多様な知識システムの出現に伴い、マルチモーダリティという概念が自然に生まれ、感情コンピューティング、ヒューマンコンピュータインタラクション(HCI)、学習、ビデオゲーム、カスタマーサービス、医療ケア、ユーザーエクスペリエンス(UX)評価などの領域における感情応用の多くの進歩をもたらしました。しかし、UX評価に感情認識技術を適用することは、必ずしも容易ではありませんでした。
単一のモダリティ(unimodal)の手法ではなく、マルチモーダル認識に重点を置く主な理由の一つは、単一の情報源に依存することに内在する欠点があるためです。単一モダリティの感情検出システムは、データの欠落や不明瞭さにより精度が低下することがありますが、一方でMER(マルチモーダル感情認識)スキームは、複数のデータソースを統合することで、より信頼性が高く、表現状態に関するより包括的で思慮深い理解を提供します17。例えば、顔の表情だけで感情を正確に分類することは、特にジェスチャーが複雑であったり不明瞭であったりする場合に不十分である可能性があります。しかし、顔の表情を言語や身体的キューなどの他のコミュニケーション形式と組み合わせることで、感情認識の精度を高めることができると考えられます。
感情認識に関する広範な研究が、いくつかのモダリティを用いて行われてきました。初期の研究では、画像、音声、またはテキストベースの入力など、異なるモダリティから特徴的な要素を特定することに焦点が当てられていました。しかし、多様なモダリティを統合することで、バランスの取れた感情情報を得ることができ、より信頼性と精度の高い感情検出が可能になることがますます明らかになっています。本セクションでは、単一モダリティおよびマルチモーダル感情分析における主要な進展をレビューし、ベースラインの手法、その欠点、および我々の手法の根拠について考察します。
感情認識に関する初期の研究は、主に単一のモダリティに焦点を当てていました。視覚領域では、画期的な研究によりプロトタイプ的な顔の動きの分類が行われました20。その後の進展として、視覚的動き21や隠れマルコフモデル22など、時間的なダイナミクスを捉える手法が登場し、一方で顔の反応はFacial Action Coding System (FACS)23を用いてアクションユニットに分類されました。LSTMや畳み込みニューラルネットワーク (CNN) は、生の音声信号から有意義な特徴を直接抽出することに成功しており、音声ベースの感情識別手法は、従来の信号処理からディープラーニングへと進化しています24。テキストベースの感情分析における文脈的な感情信号の抽出は、アテンションメカニズムを組み込んだ回帰型ニューラルネットワーク (RNN) や、より最近ではTransformerベースのモデルによって大幅に強化されました。これらの成果はあるものの、単一モダリティの手法は、他のモードに含まれる補完的な情報が欠けているため、人間が経験する複雑さを正確に表現することは本質的に不可能です。
対話感情識別におけるより長期的なコンテキストデータを収集するため、2021年にDialogXLモデル25などのアテンションメカニズムに基づくモデルが提案された。Kimらは、26 2021年に、ERC(感情認識会話)の精度を向上させるためにEmoBERTaモデルが導入されました。このモデルは、話者データを利用することで、会話における話者の特徴および話者相互間の相互作用に関する特徴を改善します。2022年、Liらは27 CoG-BART法を提示した。この手法では、教師あり対照学習を用いることで、関連データの解釈におけるモデルの能力を向上させている。なお、教師あり学習には大量のラベル付きデータが必要であることに留意されたい。
このような研究の代表的な例として、特徴量間の相互作用トークンと対比的アライメントを用いてモダリティ間の汎化性能を向上させるMultimodal Interaction-Aware Representation (MIAR) フレームワーク28がある。MIARはモダリティのアライメントを改善し、複数のデータセットにおいて高い性能を達成しているが、主に予測精度に焦点を当てており、視覚的なマッピングには対応していない。同様に、Cross-Attentional Audio-Visual Fusion モデル29は、バレンス(快・不快)およびアロウザル(覚醒度)の予測において、きめ細かなオーディオ・ビジュアル間の相互作用を効果的に捉えているが、2つのモダリティに限定されており、可視化機能に欠けている。LSTMネットワークとオートエンコーダー融合に基づく時間的モデリング手法は、感情の時間的ダイナミクスを捉えることに成功しているが、モダリティ間の相互作用や学習された感情表現に関する知見は限定的である。より最近では、Transformer-based Multimodal Fusion Network (TMFN)30などのTransformerベースの手法が、マルチモーダル融合と対比学習の強化により、CMU-MOSIおよびCMU-MOSEIにおいて強力な性能を示している。それにもかかわらず、これらのアプローチは依然として主に性能重視であり、説明可能性、特徴量レベルの解釈、および相互作用を重視した可視化へのサポートは限られている。
テキスト、音声、および視覚データの統合を強化するために、いくつかのマルチモーダル感情認識手法が提案されてきました。EF-LSTMやLF-DNNなどの初期融合(early fusion)手法は、複雑なクロスモーダル相互作用を捉えることはできませんでしたが、感情分析においてマルチモーダル情報を活用することの有用性を示しました。TFNは、CMU-MOSIやCMU-MOSEIなどのベンチマークデータセットにおける性能を向上させ、モーダル間相互作用の明示的なモデリングを導入しましたが、解釈可能性の低さと計算複雑度の高さが実用性の妨げとなりました。モーダリティの整合性と動的な特徴融合を改善するため、MIAR、クロスアテンション融合モデル、TMFN、および適応的マルチモーダルTransformerなどのより現代的な手法では、Transformerトポロジーとアテンションメカニズムが採用されています。これらの手法は、正解率、F1スコア、平均絶対誤差などの一般的な評価指標において競争力のある結果を達成しているものの、主に予測性能に焦点を当てており、特徴レベルの感情表現やクロスモーダル依存性に関する知見はほとんど得られていません。さらに、潜在的な感情埋め込み、アテンション分布、および時間的な感情動態を明らかにできる可視化技術を確立した研究や、モーダル間相互作用のグラフベースのモデリングを統合した研究はほとんどありません。提案するアプローチでは、これらの欠点を克服し、マルチモーダル感情認識の性能を向上させるために、マルチビュー視覚マッピング、グラフベースのクロスモーダルアテンション融合、およびもつれ解消表現学習(disentangled representation learning)を組み込んでいます。
同様に、Adaptive Multimodal Transformer32は、ノイズを含む、あるいは欠落したモダリティ情報を適応的に軽減するための交換ベースの融合を提案し、これにより感情分類の性能を向上させています。このアプローチは、モダリティ情報の分布における不一致を効果的に解決できますが、その設計は感情分析という特定のタスクに特化しており、学習された感情表現に関する洞察は限定的です。もう一つの重要な貢献は、リアルタイムのマルチモーダル感情認識のためにCNN、乗算的LSTM、およびトランスフォーマーベースのアテンションを統合したMultimodal Fusion Model33です。このモデルは、ビデオ、オーディオ、テキストの各モダリティに対して完全な融合を行い、堅牢な認識性能を示しています。それにもかかわらず、他の既存モデルと同様に、主に予測精度に焦点を当てており、可視化やインタラクションを重視した解釈性のための明確な機能に欠けています。
結論として、現在の最先端のマルチモーダル感情認識アプローチは、クロスモーダル相互作用の捕捉と予測精度の向上において大きな成果を上げていますが、その多くは認識主導のタスクに重点を置いています。特徴レベルの解釈可能性、画像空間における感情表現の可視化、およびインテリジェントなインタラクション設計のための提案フレームワークの導入といった領域への関心はほとんど向けられていません。これらの課題を念頭に置き、本フレームワークを提案します。
マルチモーダル感情認識に顕著な進歩が見られるものの28,29、現在の手法の大部分は主に予測性能の向上に焦点を当てており、学習された感情表現やクロスモーダル相互作用の解釈可能性についてはほとんど提供されていません。テキスト、音響、視覚の各モダリティ間の複雑な相互作用は、特にモダリティ間の不一致や情報の不足が発生した場合、現在の融合戦略ではモデル化することが困難な場合が多くあります28,31。Transformerベースの設計やアテンションメカニズムは表現学習を強化しましたが、感情特有の情報とモダリティ特有の情報が明示的に分離されていないため、その透明性と解釈可能性はしばしば低下しています31,32,33。さらに、モーダル間相互作用のグラフベースのモデリングを調査したり、時間的な感情ダイナミクス、アテンション分布、および感情埋め込みを開示できる可視化フレームワークを構築したりした研究はわずかしかありません。これらの欠点は、相互作用を重視した視覚的マッピングと強力なクロスモーダル学習を組み合わせた、インテリジェントなヒューマンマシンインタラクションのための解釈可能なマルチモーダルフレームワークの必要性を示しています。
本研究では、インテリジェントインターフェース設計におけるマルチモーダルな感情アスペクトを視覚的にマッピングするための、解釈可能なフレームワークを提示します。本システムは、手動で作成された特徴量を必要とせず、エンドツーエンドのディープラーニングを用いて、テキスト、音声、視覚の各モダリティから高レベルの感情表現を抽出します。クロスモーダルな感情相互作用は、感情特有の情報とモダリティ特有の情報を分離するグラフベースのアテンション融合メカニズムを用いてモデル化されており、これによりもつれのない表現学習が可能となり、解釈性と堅牢性が向上します。さらに、感情の時間的ダイナミクス、クロスモーダルアテンションパターン、および感情エンベディングを表示するためのマルチビュー可視化モジュールを構築しました。提案したフレームワークの有効性と、インテリジェントなヒューマンマシンインタラクションシステムへの適合性は、ベンチマークとなるマルチモーダル感情認識データセットを用いた検証によって評価されています。
本研究では、マルチモーダルな感情側面の視覚的マッピングのための独自のフレームワークを提案します。これは、従来の予測重視のアプローチを超え、現在のマルチモーダル感情識別システムにおけるクロスモーダル相互作用のモデリングの不十分さと、限定的な解釈可能性を克服することを目的としています。提案された手法は、単一のアーキテクチャ内で、Transformerベースのマルチモーダル表現学習、もつれを解いた(disentangled)感情認識特徴モデリング、グラフベースのクロスモーダル・アテンション融合、および相互作用指向の視覚化を組み合わせています。分類性能に主眼を置く現在の手法とは対照的に、本フレームワークでは感情特異的な表現とモダリティ特異的な表現を明確に分離することで、解釈可能性、堅牢性、およびクロスモーダルの一貫性を向上させています。さらに、テキスト、音声、視覚の各モダリティ間における詳細な感情的相互依存性を捉えることで、モーダル間相互作用の適応的なモデリングを可能にするグラフベースのアテンション機構を導入しました。また、時間的な感情の軌跡、クロスモーダル・アテンションパターン、および潜在的な感情埋め込みを明らかにすることで、モデルの意思決定プロセスに対する直感的な洞察を提供し、透明性を高めるマルチビュー視覚化モジュールを構築しました。CH-SIMSおよびCMU-MOSEIのベンチマークデータセットを用いた実験的な評価により、マルチモーダルな感情ダイナミクスの視覚化と解釈可能性が向上しただけでなく、精度、F1スコア、平均絶対誤差、および相関において競争力のある性能が示されました。
本研究は、マルチモーダルな感情特徴量の視覚的マッピングのための解釈可能なフレームワークを提供することで、インテリジェントなインタラクションデザインを改善することを目的としています。本研究では、公開されているCH-SIMSおよびCMU-MOSEIデータベースを使用しました。両データセットは公式ソースから取得し、それぞれの作成者が定めた使用ガイドライン、研究基準、およびライセンス条項に従って利用しました。テキスト、音声、ビデオデータを含むデータセットのマルチモーダルコンテンツは、データ提供者によって、承認された参加者の同意およびデータ収集プロトコルに基づき、事前に収集およびアノテーションが行われています。本研究において、人間との直接的な相互作用、新規参加者の募集、および個人特定情報の収集は行っていません。すべての分析は、公開されている研究用データセットを用いて実施されました。したがって、本二次データ分析において、追加の倫理承認や機関審査委員会(IRB)による審査は必要ありませんでした。本研究は、公開データセットの使用を管理する適切な機関の規範、倫理的な研究手順、および適用されるデータ利用ポリシーに従って実施されました。
理解度を向上させるため、感情またはモダリティ固有の特性を用いて、モダリティを横断した感情特性を学習するグラフベースのクロスモーダル注意機構が採用されました。また、リアルタイムの感情認識インタラクティブ設計を強化するためにマルチビュー視覚マッピングコンポーネントが使用され、その感情認識における効率性が推定されています。分析の結果、提案手法により、現実世界における感情認識インテリジェントユーザーインターフェースの解釈可能性と効率性の両方が向上することが示されました。図 1に、提案手法のアーキテクチャワークフローを示します。図 1は、インテリジェントインタラクションシステムにおけるマルチモーダル感情特徴学習のための、提案された視覚マッピングフレームワークの完全なワークフローを示しています。このワークフローは、同期した3つの入力モダリティ、すなわちテキスト、オーディオ、ビデオから始まり、これらはそれぞれ言語的、韻律的、および顔表情モダリティから相補的な感情情報をキャプチャします。モダリティ固有のトランスフォーマーエンコーダーが各モダリティを処理し、生入力データのハイレベルな表現を取得します。その後、これらの表現はもつれ解除表現学習モジュールに供給され、異種データソース間での学習済み感情の一貫性を確保するために、感情固有の埋め込みがモダリティ固有の特徴から分離されます。各モダリティからの感情固有の埋め込みは、その後、グラフベースのクロスモーダル注意ネットワークによって集約され、これによりモダリティ間の感情依存関係がモデル化され、インタラクションのコンテキストに基づいて各モダリティに動的な重要度ウェイトが割り当てられます。最終的に、このフレームワークは感情分類の結果とインタラクションに関する知見の両方を提供し、これにより透明性のある感情認識意思決定と適応的なインテリジェントインタラクション設計が促進されます。
マルチモーダルデータの取得
CH-SIMSおよびCMU-MOSEIデータセットは、同期されたビデオ、オーディオ、テキストなどのマルチモーダル情報を収集した、既存の2つのパブリックドメイン・マルチモーダルデータセットです。CH-SIMSデータセットは、映画、テレビドラマ、バラエティ番組からの複数のビデオセグメントに由来する2,281個のビデオセグメントを含み、中国人を対象としたマルチモーダル検査で構成されています。これらのビデオセグメントに対応するオーディオとテキストが付加されることで、マルチモーダルデータを用いた感情のマルチモーダル分析に関する研究は、より魅力的で実行可能なものとなります。一方、意見、感情、情動の検査において最大規模のマルチモーダルデータセットの一つであるCMU-MOSEIデータセットは、多様なトピックにわたる1,000人以上の話者によるフレーズを含む23,000以上のビデオクリップから収集されました。このデータセットは、クラス分布を維持したまま、トレーニング(70%)、検証(15%)、およびテスト(15%)のサブセットにランダムに分割されました。
テキストの書き起こし、音声信号、およびビデオフレームを取得し、きめ細かな時間レベルで一致するようにタイムスタンプを合わせて同期させます。フレームレベルでの統合により、提案された表現学習およびグラフベースの融合メカニズムが、視覚的表現、声のトーン、および言語的内容から生じる感情的なコンテンツを共同でモデル化し、活用することが可能になります。このようなマルチモーダル取得技術によって、モーダル間の感情ダイナミクスの効果的な抽出が可能となり、これはインテリジェントなインタラクション設計および理解可能な視覚的マッピングにとって不可欠です。
表1に、提案手法で使用したマルチモーダル感情データセットの主要な構成を示します。話し言葉、声の抑揚、顔の表情など、より広範囲に関連する感情を得るため、CH-SIMSとCMU-MOSEIはこれらのデータセットからビデオ、オーディオ、テキストのモダリティを統合しています。さらに、CH-SIMSではデータサンプル数が限定的であるため、中国におけるモダリティ間の相互作用と感情の変化を詳細に検討することが可能です。一方、CMU-MOSEIデータセットは、多様な言語、被験者、およびアノテーションされた感情レベルにわたる大量のデータを含んでいるため、本研究で扱う表現学習および関連する可視化アルゴリズムの堅牢性を評価する上でより重要です。加えて、従来の研究と比較して、モデルのテスト時における情報選択の困難さが軽減されています。
マルチモーダル前処理および同期
CH-SIMSおよびCMU-MOSEIデータセットのタイムスタンプ注釈を用いて、テキスト、音声、および視覚的なモダリティを同期させ、一貫したマルチモーダル表現学習を確保しました。各発話が基本の分析単位として機能し、同一の時間間隔内にある対応するオーディオおよびビデオセグメントに紐付けられました。アライメントは発話レベルで実施されました。トランスクリプトは、各発話の開始および終了タイムスタンプに基づいてセグメントに分割されました。同一の時間間隔内に含まれる対応するビデオフレームとオーディオ信号を抽出することで、トランスクリプト、オーディオ、および視覚情報の対応関係を構築しました。オーディオセグメントはWav2Vec 2.0を用いて処理し音響表現を生成し、ビデオセグメントの視覚フレームはあらかじめ定められたレートでサンプリングし、Vision Transformer (ViT)を用いてエンコードしました。発話トランスクリプトからテキスト埋め込みを作成するために、RoBERTaエンコーダーを使用しました。3つのモダリティが異なる長さの特徴量シーケンスを生成するため、すべてのモダリティ特徴を単一の発話境界に合わせることで、時間的な同期を実現しました。長さの異なるシーケンスを正規化するために、固定長フォーマットを採用しました。長いシーケンスは最大許容シーケンス長まで短縮し、短いシーケンスはゼロパディングを行いました。学習時には、パディングされた要素を正当な特徴位置から分離するためにアテンションマスクを使用しました。モダリティ間のシーケンス長の相違を克服するため、融合前にモダリティ固有の埋め込みを共通の潜在空間に投影しました。これにより次元の一貫性が保証され、グラフベースのアテンションメカニズムによる効果的なクロスモーダル相互作用学習が可能となりました。データの品質と同期の完全性を維持するため、ファイルの破損、注釈の欠落、またはモダリティ情報の不備があるサンプルは研究から除外しました。
Transformerベースの特徴抽出
マルチモーダルデータの整合および必要な前処理を行った後、視覚、音声、テキストなどの複数のモダリティにわたる情報から、エンドツーエンド方式で高レベルの感情認識特徴表現を学習するために、ディープラーニング手法が用いられます。トランスフォーマーエンコーダーを使用して生のマルチモーダルデータから本質的に識別可能な特徴表現を学習することで、提案手法は特徴量エンジニアリングの必要性を排除しています。提案アプローチで使用されるデータセット間の整合性を容易にするため、各モダリティに対して固定サイズの埋め込みが学習されます。例えば、画像、音声、テキストを含む個々の各モダリティにわたって768次元の特徴埋め込みが学習され、アプローチ全体で使用される統一された特徴空間を形成します。これは特に、提案するCH-SIMSデータセットおよびCMU-MOSEIデータセットにおいて、さまざまなサイズのデータから高レベルの特徴を学習するための特徴抽出アプローチとして使用されます。
視覚モダリティ:感情を考慮したフレーム埋め込みのためのビジョントランスフォーマー
感情に関連する空間的表現を得るために、Vision Transformer (ViT-Base) モデルを用いてビデオフレームから視覚情報を抽出しました。特徴抽出の前段階として、各ビデオセグメントのフレームを (224 × 224) ピクセルにリサイズし、一定の時間間隔でサンプリングしました。パッチサイズ 16 × 16 ピクセルを用い、ViT-Base アーキテクチャによって一連の視覚トークンが生成され、それが 12 層のトランスフォーマーエンコーダー層で処理されます。抽出されたフレームレベルの表現は、視覚バックボーンとして学習済み ViT モデルを使用し、768 次元の埋め込み空間に投影されました。これらのフレームレベルの埋め込みは、平均プーリングを用いて集約され、各セグメントの最終的な視覚表現として作成されました。学習時には、汎化性能を高めるために、画像の正規化およびランダムクロッピングや水平反転などの一般的なデータ拡張手法を用いました。その後、提案されたマルチモーダル融合フレームワークを用いて、これらの視覚的埋め込みをテキスト表現および音声表現と統合しました。
感情の時間的なダイナミクスを維持するため、視覚モダリティにはCH-SIMSおよびCMU-MOSEIデータセットからのビデオサンプルを均一にサンプリングします。各ビデオのフレーム
は、N個の固定サイズのセクションに分割し、それらをフラット化して、次元
の潜在埋め込み空間に逆転送します。その後、位置エンコーディングと学習可能なグルーピングトークンを加えることで、一連のシーケンスを作成します。
(1)
ここで、
は位置エンコーディングを、
はパッチ埋め込み行列を表します。
埋め込みパッチシーケンスを処理するために、フィードフォワードネットワークとマルチヘッド自己注意(self-attention)で構成される、スタックされたTransformerエンコーダ層が使用されます。層 l における変換は次のように記述されます:
(2)
(3)
感情を認識した視覚的特徴ベクトルを得るため、クラス・トークンに相当する出力を特徴ベクトル
として抽出します。データセット間での言語や内容の違いにかかわらず、一貫した視覚的な感情表現を実現するため、各ビデオセグメントからのフレームレベルの埋め込みを組み合わせ、表情と感情の推移を捉えます。
韻律および意味的音響埋め込みのためのWav2Vec 2.0を用いた音声モダリティ 音響バックボーンとして、学習済みWav2Vec 2.0エンコーダーを用いてコンテキスト化された音声埋め込みを生成した。平均プーリングを用いて出力隠れ表現を集約することで、各フレーズに対する固定長の音響特徴ベクトルを取得した。Wav2Vec 2.0モデルを使用して、音声信号から音響表現を抽出し、コンテキストおよび感情に関連する音声特性を捕捉した。特徴抽出の前に、音声録音を正規化し、16 kHzにリサンプリングした。テキストおよび視覚モダリティとの同期を確実にするため、データセットのアノテーションによって提供されたタイムスタンプの境界を用いて、各発話レベルの音声セグメントを分離した。タスク特有の適応を高めるため、モデル訓練中に学習済み音響エンコーダーを調整し、導出された表現が音声信号の感情的側面をより正確に表現できるようにした。その後、最終的な音声埋め込みを用いて、グラフベースのクロスモーダルアテンション融合およびもつれのない表現学習を行った。
音声モダリティでは、CH-SIMSおよびCMU-MOSEIデータセットの初期音声情報から得られた音声信号をモデル化するためにWav2Vec-2.0を使用し、感情に関連する音声特徴量を直接抽出します。各入力音声信号に対して、次のような畳み込み特徴量エンコーディングが存在します
:
(4)
ここでZは、メロディ、トーン、エネルギーなどの低レベルの韻律的特徴を表します。トランスフォーマーベースのコンテキストネットワークは、前述の構造に有用であり、長時間の時間的依存関係を表現します。
(5)
感情を表現する上で不可欠な韻律および意味論的な音響データが、これらの文脈的な音響表現に含まれています。時間的なプーリング処理を行うことで、特定の長さのオーディオ埋め込みが作成されます:
(6)
この設計では、MFCCなどの音響的な特徴量を使用せず、波形から表現を抽出するだけで、CMU-MOSEIの英語音声データおよびCH-SIMSの中国語音声データを用いて堅牢性を実現しています。
コンテキスト感情埋め込みのためのRoBERTaを用いたテキストモダリティ
テキストモダリティについては、2つのデータセットの音声転写データに深層双方向トランスフォーマーであるRoBERTaを適用し、文脈的な意味論と感情的な意味を生成しました。文脈的な意味情報および感情情報を抽出するため、RoBERTaベースのトランスフォーマーエンコーダーを用いて転写データからテキスト表現を抽出しました。英語のCMU-MOSEIデータセットには学習済みRoBERTaモデルを使用し、中国語のCH-SIMSデータセットには、言語固有の言語的特徴をより適切に考慮するため、中国語版RoBERTaバリアントを使用しました。テキストの前処理には、各言語に適したRoBERTaトークナイザーによるトークン化およびテキスト正規化が含まれます。一貫したバッチ処理を確保するため、入力シーケンスをトークン埋め込みに変換し、あらかじめ設定した最大シーケンス長に合わせてパディングまたはトリミングを行いました。RoBERTaの入力形式に従い、特別な分類トークンおよびセパレータートークンを導入しました。トランスフォーマーエンコーダーによって生成された文脈化トークン表現を、最終的な[CLS]相当の文表現を用いて集約することで、固定長のテキスト埋め込みを取得しました。学習された表現を感情認識タスクに適応させるため、学習済みRoBERTaエンコーダーをマルチモーダル学習を通じて微調整しました。その後、提案されたマルチモーダル融合フレームワークを用いて、テキスト埋め込みをオーディオおよびビジュアル特性と統合しました。
各トークン化された入力について、トークン埋め込みと位置エンコーディングを組み合わせることで、
、深層双方向変換手法として知られる手法における入力表現を作成できます。
(7)
この形式は、自己アテンションを用いて単語間の文脈依存性を抽出するLトランスフォーマーの層を通じて表現されます:
(8)
コンテキスト感情埋め込みは、分類トークンの最終隠れ状態を用いて取得されます:
(9)
感情の極性、激しい感情、およびそれに関連する含意は、このエンべディングによって表現される感情関連の言語的特徴の例です。RoBERTaは言語に依存しないモデリングを容易にします。これにより、システムはCMU-MOSEIデータセットの英語テキストとCH-SIMSデータセットの中国語テキストの両方に、同じエンベディングサイズを使用することが可能になります。
提案された深層特徴表現学習ステップにより、視覚 fv、音声 fa、テキスト ft の各モダリティから、768次元のモダリティ固有の特徴ベクトルが3つ抽出されます。インテリジェントなインタラクション設計において、これらの学習済み表現は統一されたマルチモーダル特徴空間を構築し、これが特徴レベルの視覚的マッピング、グラフベースのクロスモーダル融合、およびもつれを解いた表現学習(disentangled representation learning)の基盤となります。
もつれを解消した表現学習
深い特徴表現を学習した後、視覚、聴覚、およびテキストの各モダリティから得られたマルチモーダル特徴ベクトルに追加処理を行うことで、分離された感情記述を導き出すことができます。前ステップで使用した聴覚、視覚、およびテキストモダリティのモダリティ固有の特徴埋め込みを、それぞれfv、fa 、ftとし、
および
とする場合、このステップの目的は、各異なるモダリティの以前の意味論を考慮した後の感情記述を含む、2つの異なる潜在的な描写にすべてのモダリティ特徴を因数分解することです。
これは、各モダリティの特徴量 fm を、感情エンコーダー
とモダリティエンコーダー
という2つの並列投影ネットワークに入力し、2つのエンコーディングを生成することによって達成されます。
(10)
ここで、感情に関連付けられた潜在的な特徴は
で表され、
は特定のモダリティに固有の潜在的な特徴を表します。これにより、感情固有の埋め込みは、オーディオ、ビジュアル、テキストを含む複数の入力にわたって繰り返し空間と通信することができ、同時に各モダリティに関連する固有の構造データを保持することが可能になります。
独立性制約を用いて再構成することで、効果的な分離が強制されます。元のモダリティ特徴量の再構成は、以下のように与えられます:
(11)
ここで、
はデコーダーネットワークである。再構成損失は以下のデータを保持する:
(12)
さらに、感情とモダリティ特異的な描写の間の直交性(または非相関性)によって、情報の重複が制限されることがよくあります:
(13)
これらの目的を達成することで、モデルは信頼性が高く、理解可能で、かつモダリティの変動に強い感情表現を学習できる可能性があります。その後のグラフベースのクロスモーダル融合や視覚的マッピング機能、特にインテリジェントなインタラクション設計においては、解釈可能で構造化された感情表現が不可欠となります。
モダリティ間における感情の一貫性
感情の一貫性を追加することで、モダリティ間の融合の有効性が明らかに向上します。これは、モダリティ固有の感情埋め込みが潜在空間を共有しているため、融合戦略において2つの表現間の大きな乖離を考慮する必要がないためです。2つの感情を組み合わせた図式は、次のように記述されます
。感情固有の表現が一貫している場合、さまざまなモダリティからの信号間の変動が結果に影響を与えなくなるため、加重融合はより安定します。
(14)
感情情報の意味的なアライメントを強制することで、この目標はモダリティ間の不一致を最小限に抑え、感情の知覚が表現に使用されるモダリティに関わらず一貫性を維持することを保証します。その結果、音声信号、表情、および言語コンテンツから得られた感情的な手がかりを投影することにより、凝集性のある感情的な表現空間が構築されます。
クロスモーダル融合への影響
モダリティ間に感情の一貫性が導入されると、クロスモーダル融合はより効果的になります。感情特有の埋め込みが共通の潜在空間で整合されるため、融合メカニズムにおいて、モダリティ間の大幅な表現ギャップを補う必要がなくなります。融合された感情表現は、以下のように定義されます:
(15)
ここで αm はモダリティmに割り当てられる注意の重みを表します。感情特有の表現が一貫している場合、融合結果に矛盾するモダリティ信号ではなく補完的な感情的証拠が示されるため、重み付け融合はより安定し、理解しやすくなります。
数学的に、
に関して、さまざまな感情特異的表現タイプ間の分散を減少させることは、以下と同等になります: 
(16)
ここで、
は平均感情表現を表します。分散を減少させることで、入力モダリティがモダリティノイズではなく、その正確な感情的有意性に基づいて重み付けされるようになり、ネットワークの収束が改善され、より正確なアテンション評価が可能になります。
もつれを解消した感情視覚化(disentangled emotion visualizations)の最終的な学習目標は、断片化、再構成、および感情の均一性を組み合わせることにあります。
(17)
2つのハイパーパラメータ、λ1およびλ2が、クロスモーダル感情の信頼性と解離の関係を制御します。提案されたモデルは、これを達成するために、モーダル不変で解釈可能かつ融合可能な感情表現を取得します。これにより、インテリジェントインターフェース設計における、その後のグラフベースの融合および特徴レベルの表現のための強固な基盤を提供することに重点を置いています。
グラフベースのクロスモーダルアテンション融合
モダリティ間のきめ細かな感情関係をシミュレートするために、グラフベースのクロスモーダルアテンションネットワークが使用されました。モダリティ間の情報フローを促進するため、各モダリティ固有の埋め込み(テキスト、音声、視覚)をグラフノードとして表現した完全結合マルチモーダルグラフを構築しました。モダリティ間の関係を用いてグラフ隣接行列を確立し、これを学習可能なアテンション手法によって改良しました。複数のアテンションヘッドからの出力を連結して投影することで、共有潜在空間を構築しました。その後、アテンション重み付きプーリングを用いてノード表現を統合し、統一されたマルチモーダル感情表現を生成しました。この融合表現は、インタラクションを考慮した分析および感情認識のための予測・可視化モジュールに送られました。グラフ融合モジュールは、256の隠れ表現次元と、それぞれ8つのアテンションヘッドを持つ2つのグラフアテンション層で構成されました。隣接するモダリティの相対的な重要度を確定するため、接続されたノード間のアテンション係数を算出し、softmax関数を用いて標準化しました。トレーニングの安定性を高め、過学習を抑制するため、各グラフアテンション層の後にはレイヤー正規化、残差接続、および0.2のドロップアウト率を適用しました。複数のアテンションヘッドの出力を連結して共通の潜在空間に投影した後、アテンション重み付きプーリングを用いてノード表現を単一のマルチモーダル感情埋め込みに統合しました。その後、この融合表現をマルチビュー視覚マッピングおよび感情予測に使用しました。
マルチヘッドグラフアテンションを用いて、多様なクロスモーダル相互作用を捉えました。各ノードについて、接続されたノード間のアテンション係数を正規化するためにソフトマックス関数を使用しました。学習の安定性を高め、過学習を回避するため、グラフ融合モジュールのスタックされたグラフアテンション層の後には、残差接続、レイヤー正規化、およびドロップアウト正則化を適用しました。
ここで、項
は、それぞれ視覚、音声、およびテキストのモダリティによって収集された特定の感情に対応する表現を表します。各コンポーネントは、共有潜在空間
内に存在します。モダリティノードのモデルでは、グラフ
の表記法を用い、集合
のノードを3つのモダリティノード自体に対応させることで、さまざまなモダリティ表現間で共有される感情的な依存関係を明示的に強化しています。
グラフの各ノードに感情特異的な特徴ベクトルを割り当てると、以下のようになります:
(18)
あらかじめ決定された固定の融合重みを用いる従来の融合手法とは異なり、提案手法では、チャネル間および感情状況間の両方において、重要性と相互依存性に基づいた適応的なエッジ重みを学習します。
クロスモーダル融合には、グラフアテンションネットワーク(GAT)が利用されます。各ノードiとその隣接ノード(すなわちノードj)に対して、アテンション係数が計算されます:
(19)
モード j からモダリティ i への切り替えによる感情的な影響は、正規化された重み αij によって測定されます。
次に、各モダリティノードの統合された外観を、隣接ノードの加重グループとして算出します。
(20)
ここで、活性化関数
は非線形です。最終的に、各ノードの更新された特徴を組み合わせることで、グローバルな融合感情表現を得ます。
(21)
この手法は、複雑なモダリティ間の関係性を維持しつつ、さまざまなモダリティから相補的な情報を取得できるため、解釈可能な感情モデリングおよびその後の視覚的マッピングにおいて有用な技術です。
アルゴリズム 1 (Supplementary File 1) に、グラフベースのクロスモーダル融合を行うための一般的なスキームが示されています。まず、視覚、音声、テキストの各モダリティに紐付いた感情特有の特徴量を用いてグラフを作成します。次に、感情的な依存関係の組み合わせを表す、各グラフのノードペアに対するアテンションスコアを算出します。その後、アテンションスコアを正規化して、特定の感情コンテキストに対する各モダリティの相対的な寄与度を算出し、アテンションウェイトの学習を可能にします。最終段階では、グラフのノードに関連付けられた特徴量を集約することで、一般的な感情埋め込みを生成します。このように、特定の感情に紐付いたマルチモーダル特徴量を一般的に融合させるこのアルゴリズムは、適応性、解釈可能性、およびコンテキスト上の知能において有望です。
図2に、マルチモーダル感情融合のために提案されたクロスモーダル・アテンション・ネットワークの構造と動作を示します。テキスト、音声、ビデオの各モダリティに対して独立して導出された感情特異的埋め込みは、まずモダリティレベルのアテンション機構に送られ、これにより、特定の感情コンテキストにおける言語情報、音声情報、および顔情報の相対的な重要性が学習されます。次に、アテンションによる重み付けがなされた各モダリティの表現が統合され、統一された感情埋め込みが形成されます。この際、アテンション行列によってモダリティ間の依存関係と相互作用の強度が捉えられます。ネットワークによって学習されたアテンション行列は、各モダリティの寄与度を動的に調節し、ノイズが多く情報の少ないモダリティを無視しながら、最も有力な指示的モダリティに集中することを可能にします。このように融合された感情表現により、正確な感情認識と、「中立」、「抱擁」、「不安」などの感情状態のきめ細かな分析が可能になります。
視覚的マッピングモジュール
この目的のために特別に作成されたビジュアルマッピングセクションの支援により、インテリジェントなインタラクションデザイナーは、グラフに基づき、クロスモーダル融合プロセスの後で理解しやすく、容易に消費可能な視覚形式へと、感情状態の統合表現を変換することができます。
潜在的な感情表現を把握しやすくするため、次元削減手法を用いて学習されたマルチモーダル感情エンベディングを可視化しました。主成分分析(PCA)を用いて、分散の大部分を維持しつつ特徴量の次元数を削減した後、t-distributed Stochastic Neighbor Embedding(t-SNE)を用いてエンベディングを2次元空間に投影し、表示しました。t-SNEでは、perplexityを30、学習率を200とし、1,000回の最適化イテレーションを行いました。得られた投影図を用いて、感情特有のクラスターとモダリティ間の関係を可視化しました。グラフベースのアテンションネットワークによって得られた正規化クロスモーダル・アテンション重みを使用して、アテンションヒートマップを作成しました。これらのヒートマップには、感情予測時におけるテキスト、オーディオ、および視覚的モダリティの相対的な寄与が描かれています。学習されたアテンション係数をエッジの重みとしてクロスモーダル相互作用グラフを作成し、融合フレームワーク内でのモダリティ間の関係と情報の流れを視覚的に検討しました。また、連続する発話における潜在的感情エンベディングの変化を追跡することで、感情軌跡プロットを作成し、時間的な感情ダイナミクスを調査しました。これらの軌跡は、感情状態とモダリティの寄与が時間とともにどのように変化するかを明らかにしています。すべての視覚化には、PythonパッケージのMatplotlibとScikit-learnを使用しました。解釈可能性、クラスター形成、モダリティの寄与、および時間的な感情ダイナミクスを評価するため、エンベディングの可視化、相互作用グラフ、およびアテンションヒートマップの定性的分析を実施しました。
変数
を、グラフアテンションネットワーク関数による情動状態の融合表現とします。情動状態プロットの出力レベルでの可視化とは対照的に、このモジュールの主な目的は、情動状態の表現およびアテンションメカニズムの対応する重みを、理解可能な視覚形式に変換することです。
学習されたαjiを用いて、各モダリティの寄与度を視覚的に検討するためのアテンションヒートマップを作成します。次に、入力アテンションウェイトを合計し、各モダリティの複合的な重要度スコアを決定します。
(22)
ここで si はモダリティIの相対的な感情寄与度を表します。アテンションヒートマップを作成するため、得られた値は正規化され、ユーザーがさまざまな時間ステップやインタラクティブな状態で、どのモダリティが支配的であるかを容易に識別できるカラーマップにマッピングされます。視覚、聴覚、またはテキストなどのさまざまな入力モダリティを通じて、このようなインターフェースは、システムのアテンションメカニズムがどのように動作しているかをユーザーが理解するのに役立ちます。
学習されたグラフは、人間の感情のクロスモーダルな依存関係を表現するために、具体的に「重み付き相互作用グラフ」としてモデル化されています。各ノードはモーダル自体を表し、人間の感情に関わる相互作用の強さは、それらを結ぶエッジ上の αji という形式の重みによって表現されます。上記の重み付きグラフは、人間の感情的相互作用の強度を示しています。iおよびjの定義は以下の通りです:
(23)
これらのウェイトにより、グラフ可視化における線の太さや透明度が適切に表示されます。これにより、モダリティがどのように相互作用しているかをより容易に理解することが可能です。設計者は、クロスモーダル相互作用グラフを用いることで、融合プロセスにおいて感情指標がどのように相互作用するかをより深く理解できます。
時間的な感情の推移を表示するため、さまざまなタイムステップにおける融合感情埋め込み
を、PCAまたはt-SNEなどの次元削減アルゴリズムを用いて低次元空間に削減します。
(24)
ここで、投影関数は
で表されます。相互作用における感情の遷移、強度、および安定性を示す2D/3D感情トラジェクトリの出現は、感情状態の時間的変化を直感的に描写したものと解釈できます。これらの側面は、インテリジェントな相互作用、意思決定、およびリアルタイムモニタリングに活用することが可能です。
特定のクラスやスコアへのマッピングを提供するだけの従来の感情システムとは異なり、本システムは、システム内部で人間の感情がどのように形成されるかを実証することに焦点を当てています。重み付け係数、モデル間の相互作用、およびそれらに対応するパスを含む中間機能の可視化を提供することで、意思決定プロセスを明らかにしています。これにより、ユーザーは、視覚的、音声的、または言語的な各要因が、人間の感情に対する応答を生成する際にどのように影響しているかを理解することができます。
視覚的表現を通じて感情を理解可能な形式にマッピングすることで、ディープラーニングを用いた感情分析と、インテリジェントなインターフェース設計への統合との間の隔たりを埋めることができます。これにより、両アプローチから収集したデータを、より精緻なユーザーインターフェースの構築に活用することが可能になります。したがって、提案されたアプローチは、より精緻なユーザーインターフェースを構築するための重要な情報をインタラクションデザイナーに提供できます。言い換えれば、感情の理解がインタラクションデザインの非常に能動的な一部となるということです。感情の理解をインタラクションデザインに能動的に組み込むことで初めて、精度の向上が実現します。
視覚的マッピングモジュールは、相互に関連しながらも異なるいくつかの方法で説明可能性を可能にします。まず、特徴量レベルの説明可能性により、DNNによって生成された感情の潜在的な表現が明らかになり、感情に関連する各特徴を記述するために使用されるセマンティクスを理解することが可能になります。次に、モダリティレベルの説明可能性では、相互作用グラフと視覚的アテンションヒートマップからのデータを用いて、視覚、音声、またはテキストの各モダリティが、感情表現の決定にどのように寄与しているかを記述します。そして最後に、感情埋め込みから得られる軌跡により、動的な相互作用の観点から、視覚的およびテキスト的モダリティが時間とともにどのように変化するかを理解することが可能になります。アルゴリズム2(Supplementary File 1)を参照してください。
統合されたマルチモーダル感情特徴は、提案する視覚的マッピングアルゴリズム2を用いて、インテリジェントなインタラクション設計のための視覚的に重要な表現へとマッピングされます。グラフベースのマルチモーダルアテンションウェイトは、各タイムステップにおける入力視覚、音声、およびテキスト要素間の差異を定量化するために使用されます。これらの差異は、ヒートマップの視覚的要素を用いて、感情に影響を与えている主要なソースを強調するように視覚的表現にマッピングされます。入力要素間の相互作用に関する洞察を得て、マルチモーダル入力要素によって生成される感情の推移を伝えるため、次にペアごとの相互作用強度を計算し、マルチモーダル相互作用ウェイトを作成します。同時に、経時的に収集された統合感情要素を低次元空間にマッピングすることで、連続的な感情要素の推移を生成し、感情変化のビューを作成します。
感情予測とインタラクションフィードバック
融合された感情表現の結果(
で表示)は、インタラクションフィードバックと感情予測の両方の関数として利用されます。さらに、感情予測は、連続的な感情強度の認識を行う回帰タスクと、離散的な感情認識を行う分類タスクから構成されるマルチタスクモデルとして記述されます。離散的な感情認識には、以下のソフトマックスベースの分類モデルが使用されます:
(25)
ここで、
は期待される感情クラスの確率を表し、Wc および bc は学習可能な制約である。分類目的を強化するために、クロスエントロピー損失が利用される:
(26)
ここで、yk は正解タグであり、Kは感情クラスの数です。感情強度を並行して推定するために回帰ブランチが使用され、バレンス(快・不快)やアロウザル(覚醒度)を含む、さまざまな連続的な感情属性の予測を生成します。これに以下の定義を与えます:
(27)
ここで、期待される感情強度のスコアは
で示されます。回帰タスクを強化するために、平均二乗誤差損失が用いられます:
(28)
一般的に、これら2つのタスクは予測目的において組み合わされます:
(29)
ここでは、回帰と分類の目的がλによってバランス調整されています。これは、このようなインタラクションを考慮したフィードバックを可能にするために、特定された感情状態に基づいて視覚化モジュールを動的に修正することを提案しています。ある時刻tにおけるインタラクションのコンテキストはctで表されます。視覚化モジュールの応答は次のように提供されます:
(30)
ここで、可視化適応関数は
で表されます。これにより、予想される変化や感情に基づいて、モダリティヒートマップ、インタラクショングラフ、および感情軌跡をリアルタイムで調整することが可能になります。これは、本システムが感情状態の予測において優れた性能を発揮するだけでなく、フィードバックに対しても十分なサポートを提供していることを示しています。
本研究では、2つのベンチマークデータセットであるCH-SIMSおよびCMU-MOSEIを用い、提案するマルチモーダル感情特徴の視覚的マッピングフレームワークについて、インタラクションを考慮した解釈可能性と予測性能の両面から検証します。実験結果によれば、提案手法は相関、正解率、F1スコア、平均絶対誤差(MAE)を含む多様な指標において、既存のマルチモーダル感情認識手法を一貫して上回る性能を示しました。もつれ解消された感情表現、グラフベースのクロスモーダル融合メカニズム、およびエンドツーエンドの深層表現学習戦略のすべてが、より安定し意味的に整合した感情モデリングを可能にすることで、この性能向上に寄与しています。提案手法は視覚的マッピングを通じて、定量的な向上だけでなく、各モダリティの寄与や感情のダイナミクスを理解しやすくする、より豊かな特徴レベルの洞察を提供します。言語、文化的表現、データセットのサイズが異なるにもかかわらず、上述の性能向上は両方のデータセットで一貫して観察されており、提案フレームワークの強力な汎化能力が実証されました。
本提案研究では、マルチモーダル感情分析のための公開データセットであるCH-SIMSおよびCMU-MOSEIを使用します。CH-SIMSデータセットは、映画、テレビドラマ、バラエティ番組から抽出された2,281個のビデオクリップで構成されています。CH-SIMSでは、同期されたテキスト、音声、および視覚データが利用可能です。ユニモーダルおよびマルチモーダルのセンチメントラベルは、いずれもポジティブ、ニュートラル、ネガティブのカテゴリーに分類されています。CMU-MOSEIとして知られる大規模な英語マルチモーダルデータセットには、1,000人以上の話者が幅広い主題について議論する、約23,453個のアノテーション付きビデオクリップが含まれています。このデータセットには、バレンス(価)やアロウザル(覚醒度)などの連続的な感情強度の注釈と、カテゴリー別の感情ラベルの両方が含まれています。多様な言語的、文化的、および感情的な状況をサポートすることで、提案したフレームワークを用いてこれら2つのデータセットで実験を行うことにより、堅牢性と信頼性が強化されます。表2にシミュレーション環境の詳細を示します。
提案されたフレームワークを評価するために使用した主要な実験および実装設定を、このシミュレーション環境にまとめている。テキスト、音声、および視覚の各モダリティ間で特徴量の次元を統一するため、Transformerベースのエンコーダーを一貫して適用している。また、クロスモーダル融合にグラフベースのアテンション機構を採用することで、感情状態に関するモーダル間の依存性の適応的な学習を可能にしている。
提案されたフレームワークでは、Transformerベースのモダリティエンコーダーを用いて、テキスト、音声、および視覚的表現を抽出します。ReLU活性化関数を備えた全結合層により、モダリティ固有の埋め込みが共有潜在空間に投影されます。次に、それぞれ2つの全結合層と非線形活性化および正規化を備えた、個別の感情固有およびモダリティ固有のエンコーダーを使用して、もつれを解消した(disentangled)表現を学習します。潜在表現は256次元の特徴空間に投影され、そこで各モダリティと感情の情報が個別に学習されます。モダリティ情報を保持し、効率的なもつれ解消を促進するために、再構成デコーダーが使用されます。マルチモーダル融合と予測の前に、グラフベースのクロスモーダルアテンションモジュールが、潜在表現を用いてモダリティ間の感情的な依存関係をモデル化します。ネットワークの学習にはAdamオプティマイザーを用い、初期学習率は1 × 10⁻4、バッチサイズは32としました。過学習を防ぐため、検証損失に基づいた早期停止(Early stopping)を採用しました。全目的関数は、分類損失、再構成損失、および表現一貫性損失で構成され、それぞれ調整可能なハイパーパラメータによって重み付けされました。モデルの学習は最大100エポックまで行い、検証セットで最高の性能を示したモデルをテスト用に保持しました。
提案されたフレームワークは、正解率(Accuracy)、適合率(Precision)、再現率(Recall)、F1スコアなどの分類指標と、平均絶対誤差(MAE)などの回帰指標を用いて評価されました。感情カテゴリー間のクラス不均衡を考慮するため、適合率、再現率、およびF1スコアはマクロ平均を用いて算出しました。分類実験では、CH-SIMSおよびCMU-MOSEIデータセットで提供されている定義済みの感情/センチメントラベルを正解クラスとして使用しました。回帰ベースのセンチメント予測では、データセットの連続的なセンチメント強度スコアをターゲット変数として使用しました。クラスごとの予測性能と誤分類パターンを分析するために、信頼区間95%で混同行列を作成しました。堅牢性を確保するため、各実験は異なる乱数初期化を用いて5回繰り返し、報告された結果は全試行の平均値 ±± 標準偏差として性能を示しています。統計的有意性は適切な仮説検定手順を用いて評価し、適用可能な場合には信頼区間を算出しました。学習時間は、指定されたハードウェアプラットフォーム上でモデルが収束するまでに要した合計経過時間として測定しました。
早期融合(early fusion)や後期融合(late fusion)を含む、いくつかの代表的なベースラインモデルを、提案手法と比較することができます。これには、TFN、LSTMベースの手法、低ランクマルチモーダル融合モデル、適応型マルチモーダルTransformer、および新しいクロスモーダルアテンションベースのアーキテクチャが含まれます。これらのベースラインは、主にさまざまな融合手法を通じて感情認識の精度向上に焦点を当てた最先端の技術を反映しています。出力レベルの予測に主眼を置くこれらの手法とは対照的に、提案フレームワークのもつれを解いた表現学習(disentangled representation learning)とグラフベースの融合は、解釈可能性と相互作用への意識を向上させます。ベースラインモデルとして、公式のリポジトリまたは公開されている参照実装を用いて実装したLSTM Fusion、TFN、低ランクマルチモーダル融合(LMF)、Adaptive-Graph、およびTransformerベースの手法を例に挙げています。利用可能な場合は、著者によるオリジナルのハイパーパラメータ設定を使用しました。公正な比較を行うため、再学習したすべてのベースラインは、同一のデータセット分割、前処理手法、最適化パラメータ、および評価基準を用いて評価されました。比較表では、以前の出版物から直接得られたデータについて、 ilgiliな参考文献を明確に示しています。
正確性
離散感情分類の精度をCH-SIMSとCMU-MOSEIの両方で測定しましたが、精度の傾向は2つのデータセットの特性によって異なります。CH-SIMSは、感情カテゴリーの数が均等で、ビデオクリップが慎重に前処理された中規模のデータセットであるため、精度が高く、モデルがノイズの少ない状態で微細なマルチモーダル感情情報を捉えられることが示唆されました。一方で、CMU-MOSEIは多様な背景を持つ話者が含まれる大規模データセットであるため、感情を正確に分類することは困難です。したがって、CMU-MOSEIデータセットにおける精度は、感情を識別する能力に加えて、多様なインタラクションシナリオに対する汎化能力と耐性を示すものとなります。これら2つのデータセット全体で精度が向上したことは、提案手法が言語、規模、感情の複雑さレベルが異なるデータセット間で良好に汎化することを示しています。
CH-SIMSおよびCMU-MOSEIデータセットにおける、提案手法およびその他の一般的なベースラインの分類精度を表 3に示す。表 3に示されるように、提案フレームワークはCH-SIMSおよびCMU-MOSEIの両データセットで最高の精度を達成し、最も強力なベースライン(Adaptive-Graph)をそれぞれ約3.3%および3.1パーセントポイント上回った。また、標準偏差の値が低いことは、繰り返しの実験実行における安定性がより高いことを示している。従来のLSTM融合アプローチは、複雑なクロスモーダル関係を捉える能力が限定的であるため、精度が低い。TFNおよびLMFは、クロスモーダル関係をモデル化することで分類精度を向上させている。
F1スコア
感情分類の問題において、再現率(recall)と適合率(precision)のバランスはF1スコアを用いて測定されます。そのため、クラス間の数に不均衡が生じやすいマルチモーダル感情分類データセットには、F1スコアがより適しています。感情分類タスクにおいて、再現率と適合率のバランスを測定する指標としてF1スコアが用いられます。マルチモーダル感情分類データセットは不均衡であると予想されるため、F1スコアがより適切です。モデルが感情クラスをより正確に検出できるほど、F1スコアは高くなります。
図3は、CH-SIMSデータセットにおける提案手法とベースラインのF1スコアの評価を示しています。LSTMベースのベースラインはF1スコアが最も低く、複雑なクロスモーダル感情関係をモデル化する能力に限界があることが明らかになりました。CH-SIMSデータセットを用いて評価した各手法のF1スコアの比較を図3に示します。結果から明らかなように、より高度なグラフベースおよびトランスフォーマーベースの構造は、概して従来のフュージョンベースの手法を上回ります。F1スコアはLSTMモデルが0.71と最も低く、次いでTFN(0.74)、LMF(0.76)となりました。Adaptive-Graphを用いることでF1スコアは0.79まで向上し、モーダル間の関係性をモデル化することの有効性が示されました。提案フレームワークはF1スコア0.82を達成し、Adaptive-Graphを3.8%、LMFを7.9%、TFNを10.8%、LSTMを15.5%上回りました。これらの結果は、提案するグラフベースのクロスモーダル注意機構ともつれ解消表現学習が、テキスト、音声、視覚の各モーダルにわたる相補的な感情情報をより効果的に捉え、分類性能の向上につながることを示しています。
図 4 に示すように、すべての手法で CH-SIMS と比較して F1-score がわずかに低下しているものの、相対的な傾向は一貫しています。これらの結果は、従来の融合手法からグラフベースのマルチモーダル学習戦略へと移行することで、パフォーマンスが着実に向上することを示しています。F1-score が最も低かったモデルは、LSTM (0.69)、TFN (0.72)、および LMF (0.74) でした。Adaptive-Graph モデルの性能は 0.77 まで向上し、クロスモーダルな接続をいかに効果的にモデル化できるかが示されました。提案したフレームワークは、最高値となる 0.80 の F1-score を達成し、他のすべてのアプローチを上回りました。最強のベースラインである Adaptive-Graph よりも性能が向上したことは、提案したもつれ解消感情表現学習とグラフベースのクロスモーダルアテンションメカニズムが、テキスト、音声、視覚の各モダリティにわたる相補的な感情の手がかりを捉えるのに寄与していることを証明しています。これらの結果は、提案したマルチモーダル感情認識フレームワークが信頼でき、効率的であることを示しています。提案手法は、グラフベースのアプローチと従来の融合手法の両方に対して大幅な改善を示しており、本手法の強力な汎化能力がさらに確認されました。CMU-MOSEI データセットにおける F1-score の向上は、提案手法がノイズが多く多様な環境においても、バランスの取れた感情分類性能を達成できることを示しています。
精度
スマートコミュニケーションシステムにおいて、誤った感情信号はユーザーエクスペリエンスを低下させるため、適合率(precision)が極めて重要になります。適合率とは、特定の感情であると予測された全事例数に対する、正しく予測された事例数の比率のことです。もつれを解消した(disentangled)感情表現は、モーダル内でのノイズが少なく誤分類が起きにくいため、提案モデルは図5のCH-SIMSデータセットにおいてベースラインモデルを上回る性能を示しています。
CH-SIMSおよびCMU-MOSEIデータセットにおける、いくつかのマルチモーダル感情認識手法で達成された精度をFigure 5に示します。モデルが従来の融合ベースの手法から、より高度なグラフベースのアーキテクチャへと移行するにつれて、精度は着実に向上しています。提案フレームワークは、CH-SIMSデータセットにおいて最大精度0.82を達成しました。精度はLSTMの0.71から、TFNで0.74、LMFで0.76、Adaptive-Graphで0.79へと上昇しています。CMU-MOSEIデータセットでは、精度はLSTMの0.69から、TFNで0.72、LMFで0.74、Adaptive-Graphで0.77へと向上しました。提案手法は最高精度0.80を達成しました。提案フレームワークは、最強のベースライン(Adaptive-Graph)と比較して、CH-SIMSで約3.8%、CMU-MOSEIで3.9%精度を向上させました。これらの結果は、テキスト、音響、視覚の各モダリティにわたる相補的な感情情報を捉えることで、提案されたもつれ解消表現学習とグラフベースのクロスモーダルアテンション機構が、偽陽性予測を効果的に減少させていることを示しています。また、グラフベースのクロスモーダルアテンションによって、無関係なモダリティの影響がさらに軽減されています。CMU-MOSEIコーパスでは、話者や言語表現の多様性が高いため、すべてのモデルにおいて精度がわずかに低下しています。
再現率
感情認識タスクにおいて、特定のクラスに属する感情的な事例を適切に分類できるモデルの能力を示す指標である再現率(recall)は極めて重要です。なぜなら、感情情報の欠如はインタラクションの質に悪影響を及ぼす可能性があるためです。再現率の値が高いことは、モデルが偽陰性を少なくし、実際の感情表現をより多く特定できていることを示唆します。マルチモーダル感情分析の文脈において、再現率はテキスト、音声、および視覚的なモダリティから感情情報が抽出される効率の尺度であると考えることができます。
CH-SIMSおよびCMU-MOSEIデータセットにおける、ベースライン手法に対する提案手法の優位性は、図6の再現率(recall)の比較に示されています。モデルが従来の融合ベースの手法から、より高度なグラフベースのマルチモーダル構造へと進化するにつれて、再現率は一貫して向上しています。CH-SIMSデータセットにおける再現率は、LSTMの0.70から、TFNで0.73、LMFで0.75、Adaptive-Graphで0.78へと上昇し、提案したフレームワークでは最大値である0.82を達成しました。CMU-MOSEIデータセットにおいても、提案手法は最高の再現率0.80を達成し、再現率はLSTMの0.68から、TFNで0.71、LMFで0.73、Adaptive-Graphで0.76へと向上しました。最強のベースライン(Adaptive-Graph)と比較して、提案フレームワークはCH-SIMSで約5.1%、CMU-MOSEIで約5.3%の相対的な改善を示しました。これらの結果は、テキスト、音響、視覚という各モダリティにわたる相補的な感情の手がかりを捉えることで、提案したもつれ解除表現学習とグラフベースのクロスモーダル注意機構が偽陰性の予測を効果的に減少させ、その結果、両データセットにおける感情クラスの識別精度を向上させたことを示しています。従来の手法は複雑なクロスモーダル関係をモデル化する能力が限られているため、再現率が低くなる傾向があります。TFNおよびLMFは、モダリティ間の関係をより明示的にモデル化することで、中程度の向上を達成しています。Adaptive-Graph法は、モダリティ間の構造的関係をシミュレートすることで、再現率をさらに向上させました。両データセットにおいて、提案手法が最高の再現率を達成したことは、異なるインタラクションシナリオにおける感情インスタンスの検出能力がより高いことを示しています。この改善は大規模なCMU-MOSEIデータセットにおいてより顕著であり、提案フレームワークの堅牢性と汎用性が実証されました。
平均絶対誤差 (MAE)
平均絶対誤差(MAE)は、バレンス(快・不快)やアロウザル(覚醒度)の予測など、連続的な感情強度の予測タスクの性能を評価するために用いられます。正解率とは異なり、MAEは予測された感情強度が実際の感情状態にどれだけ近いかをより適切に反映します。そのため、連続的な感情ラベルを持つCH-SIMSやCMU-MOSEIのようなデータセットには、MAEの方が適しています。MAEの値が低いほど、感情強度の予測精度が高いことを示します。
CH-SIMSおよびCMU-MOSEIデータセットにおける、提案フレームワークとベースライン手法とのMAE比較を表4に示す。従来のLSTMベースの融合手法は、複雑なマルチモーダル感情依存性をモデル化する能力が限定的であるため、MAE値が高くなる傾向がある。TFNおよびLMFは、マルチモーダルな相互作用をモデル化することでMAEを低減でき、Adaptive-Graphアプローチは、モダリティグラフの関係性を学習することでさらにMAEを低減させている。提案フレームワークは、両データセットにおいて最小のMAEを達成しており、感情強度のより正確な推定が可能であることを示している。特に、大規模なデータの変動性と話者の条件により予測タスクがより困難となるCMU-MOSEIデータセットにおいて、改善がより顕著であることは注目に値する。
CH-SIMSデータセットの混同行列
CH-SIMSデータセットの混同行列によると、初期融合LSTMおよびTFNのベースライン手法では、中立的な感情と肯定的な感情のクラス間で著しい混同が見られます。これは、これらの手法が微妙なマルチモーダル感情表現の識別において十分な性能を持っていないことを示唆しています。一方で、提案手法は明確に強い対角支配を示し、非対角要素が非常に少ないため、クラス分離能が向上しています。提案手法のもつれ解消感情学習メカニズムは、モーダル間で一貫した感情表現を保証し、そのグラフ融合アプローチによって、密接に関連する感情クラス間の識別能が向上します。図 7A–Eは、様々なベースライン手法を用いたCH-SIMSデータセットの混同行列を示しています。
CMU-MOSEIデータセットの混同行列
提案されたフレームワークは、モダリティ不変の感情埋め込みと適応的なアテンションウェイトを用いることで、特に感情的に曖昧な入力に対する誤分類率を大幅に低減します。これにより、提案されたフレームワークがさまざまな大規模なマルチモーダル相互作用シナリオにおいて有効に機能することが確認されました。データセットの規模、話者のばらつき、および感情ラベルの連続的な性質により、CMU-MOSEIの混同行列では全体的な誤分類率が高くなっています。ベースライン手法では、さまざまな感情カテゴリー間でかなりの混同が見られます。図 8A–Eに、さまざまなベースライン手法を用いたCMU-MOSEIデータセットの混同行列を示します。
1エポックあたりのトレーニング時間
エポックあたりの学習時間の比較により、高度なマルチモーダル融合手法における計算上のトレードオフが浮き彫りになりました。トランスフォーマーエンコーダーとグラフアテンションメカニズムを採用しているため、提案モデルは単純な融合手法よりも学習時間にわずかに時間を要しますが、この増加は許容範囲内です。提案したフレームワークは、ベンチマークとなるマルチモーダル感情分析データセットにおいて高い性能を示し、知的な人間・マシンインタラクションシステムへの統合の可能性を示しています。しかし、本研究ではリアルタイム展開への適性は評価されておらず、レイテンシ、スループット、メモリ、および展開に関する分析を通じてさらなる調査が必要です。特筆すべきは、収束安定性の向上、ならびに予測性能と解釈可能性の優位性により、追加の計算コストをかける価値があるということです。図 9に、提案手法におけるエポックあたりの学習時間の結果を示します。
アブレーション解析
提案したフレームワークにおける視覚マッピングモジュール、グラフベースのクロスモーダル融合、およびもつれ解消感情表現などの各重要要素の影響を判断するため、アブレーション研究を実施した。影響を把握するため、各要素を一つずつ除外した。実験結果によると、グラフ融合戦略はクロスモーダル依存性のモデリングを向上させ、もつれ解消感情表現の寄与が性能の安定性において最も重要であることがわかった。視覚マッピングモジュールを除外した際の性能への影響がわずかであったことから、その補助的な役割が検証された。同一のトレーニングおよび評価条件下でのアブレーション研究の結果をTable 5に示す。最も大きな性能低下は、グラフベースのクロスモーダルアテンションモジュールを除去した後に観察され、精度は81.72%から77.88%へ、F1-scoreは0.823から0.776へと低下した。これは、複雑なモーダル間相互作用をモデリングすることの重要性を強調している。もつれ解消表現学習モジュールを除去すると、精度が2.78パーセントポイント、F1-scoreが0.032低下したことから、堅牢な感情特有の表現を学習させる役割が実証された。視覚マッピングモジュールを除去した際の予測性能の低下が比較的小さかったことは、このモジュールの主な利点が分類精度ではなく解釈可能性にあることを裏付けている。Basic Fusion構成が最低の性能となり、最適なマルチモーダル感情認識性能を得るには、提案したすべてのモジュールの統合的な影響が必要であることが示された。
データの利用可能性:
本研究で使用したデータセットは、公開されているベンチマークデータセットです。CMU-MOSEIデータセットはカーネギーメロン大学のMultimodal SDKによって提供されており、Zadeh et al. (2018) (https://doi.org/10.18653/v1/P18-1208) に詳述され、https://multicomp.cs.cmu.edu/multimodal-language-analysis-in-the-wild-cmu-mosei-dataset-and-interpretable-dynamic-fusion-graph/ からアクセス可能です。CH-SIMSデータセットは Yu et al. (2020) (https://doi.org/10.18653/v1/2020.acl-main.343) に詳述されており、https://github.com/thuiar/MMSA を含む著者提供のリソースを通じて公開されています。すべての実験は、これらのデータセットの公式バージョンを使用して実施されました。本研究の結果を裏付ける抽出済み生データ、処理済みデータファイル、前処理出力、訓練/検証/テスト用パーティション、導出された特徴量表現、および実装の詳細は、Zenodoリポジトリ (https://doi.org/10.5281/zenodo.21124921) で公開されています。

図 1: 提案するマルチモーダル感情特徴視覚マッピングフレームワークの概略図。解釈可能なマルチモーダル感情分析のための、マルチモーダル特徴抽出、もつれのない表現学習、グラフベースのクロスモーダルアテンション融合、および視覚マッピングコンポーネントを示す全体アーキテクチャの概念図。ここをクリックして、この図の拡大版を表示してください。

図2: 提案する計算プロトコルの概略ワークフロー図。
データセットの取得、前処理、モダリティ固有の特徴抽出、マルチモーダル融合、可視化、および感情予測ステージを含む、エンドツーエンド処理パイプラインの概念的な表現 こちらのリンクをクリックして、この図の拡大版を表示してください。

図3CH-SIMSデータセットにおけるF1スコア性能の比較5回の独立した実験ランから得られた平均F1スコア値(n = 5) 異なる乱数シードでの初期化を用いて。エラーバーは ±± 標準偏差(SD)1倍F1スコアの値が高いほど、感情分類の性能がより優れていることを示します。 この図の拡大版を表示するには、ここをクリックしてください。

図 4: CMU-MOSEI データセットにおける F1-score パフォーマンスの比較. 異なる乱数シードによる初期化を用いて5回の独立した実験(n = 5)から得られた平均 F1-score 値。エラーバーは±± 1 標準偏差 (SD)を表し、対応する平均 ±± SD 値が各データポイントの上に表示されている。F1-score の値が高いほど、感情分類のパフォーマンスが優れていることを示す。この図の拡大版を表示するには、こちらをクリックしてください。

図5CH-SIMSおよびCMU-MOSEIデータセットにおける精度の比較。 LSTM、TFN、LMF、Adaptive-Graph、および提案フレームワークによって得られた平均適合率スコア(across...) 5回の独立した実験(n = 5)エラーバーは以下を表します。 ±± 1標準偏差 (SD) 異なる乱数シードによる初期化を行い、繰り返し実行して算出した。提案したフレームワークは両方のデータセットで最高の精度を達成しており、効果的なマルチモーダル特徴学習とグラフベースのクロスモーダル融合を通じて、感情クラスの識別能が向上したことが示された。 こちらの図の拡大版を表示するには、ここをクリックしてください。

図6: CH-SIMSおよびCMU-MOSEIデータセットにおける再現率の比較。 LSTM、TFN、LMF、Adaptive-Graph、および提案フレームワークによって得られた平均リコールスコア(以下に提示) 5回の独立した実験試行(n = 5). エラーバーは次を示します。 ±± 標準偏差(SD)1倍分 反復的な実験から得られたものである。提案されたフレームワークは、両方のデータセットにおいて一貫して最高の再現率を達成しており、マルチモーダルな感情情報を捉え、偽陰性の予測を減少させる能力に優れていることを示している。 この図の拡大版を表示するには、ここをクリックしてください。

図 7: 様々なベースライン手法を用いたデータセット CH-SIMS の混同行列。行は正解(グランドトゥルース)の感情クラスに対応し、列は予測クラスに対応します。セルの値は、各正解クラスに対して正規化されたサンプルの割合を表しています。この混同行列は、ホールドアウトされた CH-SIMS テストパーティションを用いて算出されました。対角成分の割合が高いほど、対応する感情カテゴリの認識精度が高いことを示します。CH-SIMS データセットにおける (A) Early fusion LSTM、(B) TFN、(C) LMF、(D) Adaptive Graph、および (E) 提案手法の混同行列。 こちらのリンクをクリックして、この図の拡大版を表示してください。

図 8: 様々なベースライン手法を用いたCMU-MOSEIデータセットの混同行列。行は実際の感情ラベルを、列は予測ラベルを表す。値はCMU-MOSEIテストセットにおけるクラス正規化パーセンテージとして報告されている。この行列は、正しく分類されたサンプル(対角成分)と、感情カテゴリ間の混同(非対角成分)の両方を示している。CMU-MOSEIにおける混同行列(A)Early fusion LSTM、(B) TFN、(C) LMF、(D) Adaptive Graph、および(E) CMU-MOSEIデータセットにおける提案手法。この図の拡大版を表示するには、ここをクリックしてください。

図9ベンチマークとなるマルチモーダル感情データセットにおける、1エポックあたりの学習時間の比較。
〜から得られた1エポックあたりの平均トレーニング時間 5回の独立した実験試行(n = 5) 同一のハードウェアおよびソフトウェア設定下におけるCH-SIMSおよびCMU-MOSEIデータセットの結果。エラーバーは ±± 標準偏差(SD)1倍 異なるランダムシードでの初期化を用いた繰り返し実験から算出されました。値が低いほど計算効率が高いことを示し、実行間でのトレーニング時間の安定性は、再現性とトレーニングの一貫性の向上を示しています。 この図の拡大版を表示するには、ここをクリックしてください。
| データセット | モダリティ | サンプル数 | 言語 | 感情/センチメントラベル |
| CH-SIMS34 | ビデオ、オーディオ、テキスト | 2,281本のビデオセグメント | 中国語 | マルチモーダルおよびユニモーダル感情ラベル(ネガティブ、ニュートラル、ポジティブ) |
| CMU-MOSEI35 | ビデオ、オーディオ、テキスト | 約23,453個のアノテーション済みクリップ | 日本語 | 感情および感情強度のラベル(連続的およびカテゴリ的) |
表 1: データセットの説明。 本研究で使用したデータセット、モダリティ、サンプル数、言語、およびCH-SIMSとCMU-MOSEIデータセットにおける感情/センチメントラベルの概要。
| 構成要素 | 仕様 |
| プログラミングフレームワーク | Python with PyTorch |
| 視覚的特徴抽出器 | Vision Transformer (ViT) |
| 音声特徴抽出器 | Wav2Vec 2.0 |
| テキスト特徴抽出器 | RoBERTa |
| 融合戦略 | グラフベース・クロスモーダル・アテンションネットワーク |
| 特徴量次元 | 各モダリティにつき768 |
| 学習最適化アルゴリズム | Adam |
| 学習率 | 1.00E-04 |
| バッチサイズ | 16 |
| ハードウェア | NVIDIA GPU (例: RTXシリーズ) |
| 評価データセット | CH-SIMS, CMU-MOSEI |
| 潜在次元 | 2.56E+02 |
| 埋め込み次元 | 768 |
| 活性化関数 | ReLU |
| 最適化アルゴリズム | Adam |
| 学習率 | 1.00E-04 |
| バッチサイズ | 32 |
| エポック数 | 100 |
| 早期終了 | 有効 |
| 損失関数 | 分類 + 再構成 + 一貫性 |
表 2:シミュレーション環境。モデルの詳細、特徴量、オプティマイザ、使用したハードウェアなどの、シミュレーション環境の実験セットアップおよび実装の詳細。
| 手法 | CH-SIMS 正確度 (%) | CMU-MOSEI 正確度 (%) |
| LSTM (Early/Late Fusion) | 72.84 ± 1.12 | 70.35 ± 1.26 |
| TFN | 74.91 ± 0.98 | 72.68 ± 1.10 |
| LMF | 76.23 ± 0.85 | 74.12 ± 0.94 |
| Adaptive-Graph | 78.46 ± 0.73 | 76.89 ± 0.81 |
| 提案手法 | 81.72 ± 0.61 | 79.94 ± 0.69 |
表3:CH-SIMSおよびCMU-MOSEIデータセットにおける、ベースライン手法を用いた提案手法の精度の評価。結果は、異なる乱数シードによる初期化を用いた5回の独立した実験試行(n = 5)から得られた平均値 ±± 標準偏差として報告する。公正な比較を確実にするため、すべての手法は、それぞれのデータセットの同一のトレーニング、検証、およびテストパーティションを用いて評価した。
| 手法 | CH-SIMS MAE ↓ | CMU-MOSEI MAE ↓ |
| LSTM (Early/Late Fusion) | 0.412 ± 0.014 | 0.465 ± 0.016 |
| TFN | 0.387 ± 0.012 | 0.439 ± 0.014 |
| LMF | 0.361 ± 0.010 | 0.412 ± 0.012 |
| Adaptive-Graph | 0.334 ± 0.009 | 0.379 ± 0.010 |
| 提案手法 | 0.298 ± 0.007 | 0.341 ± 0.008 |
表4:平均絶対誤差の結果。結果は、異なるランダムシード初期化を用いた5回の独立した実験走行(n = 5)から得られた平均 ±± 標準偏差として報告されている。公平な比較を確実にするため、すべての手法は、それぞれのデータセットの同一な訓練、検証、およびテストパーティションを用いて評価された。提案フレームワークとベースライン手法を用いた、両データセットにおける連続的な感情強度の予測に関するMAEの比較。
| モデルのバリアント | 正解率 (%) | F1スコア |
| フルモデル | 81.72 ± 0.61 | 0.823 ± 0.008 |
| もつれ解消なし | 78.94 ± 0.74 | 0.791 ± 0.010 |
| グラフ融合なし | 77.88 ± 0.81 | 0.776 ± 0.011 |
| 視覚的マッピングなし | 80.11 ± 0.66 | 0.807 ± 0.009 |
| 基本融合 | 74.91 ± 0.98 | 0.742 ± 0.013 |
表 5:ベースライン手法を用いたアブレーション研究の結果。結果は、異なるランダムシードで初期化した5回の独立した実験(n = 5)から得られた平均値 ±± 標準偏差として報告されている。公正な比較を確実にするため、すべての手法は、それぞれのデータセットの同一なトレーニング、検証、およびテストパーティションを用いて評価された。モデルのバリエーション間での性能比較により、もつれを解いた表現(disentangled representations)からの学習、グラフベースの融合、および視覚的マッピングモジュールの有効性が示されている。
補足ファイル 1:アルゴリズム 1 およびアルゴリズム 2。こちらをクリックしてファイルをダウンロードしてください。
実験結果から、CH-SIMSおよびCMU-MOSEIデータセットにおいて、提案されたマルチモーダル感情特性の視覚的マッピングフレームワークが、現在のマルチモーダル感情認識技術を上回ることが実証されました。EF-LSTMやTFNなどの早期融合(early fusion)および後期融合(late fusion)モデルと比較して、提案手法はより高い精度(accuracy)とF1スコアを達成しており、多様な感情情報を処理する上での堅牢性が示されました。本手法による改善は、モダリティ固有のノイズを抑制し、視覚、音声、テキストの各モダリティ間で感情の一貫性を確保する、もつれを解いた感情表現(disentangled emotion representation)によるものであると考えられます36。
近年、Adaptive Multimodal Transformers37やMIAR38などのトランスフォーマーベースのマルチモーダルモデルが、クロスモーダルな依存関係のモデリングにおいて優れた結果を示しています。しかしながら、これらのモデルは主に予測を目的としており、特徴量レベルの解釈可能性をサポートするメカニズムを欠いています。対照的に、本提案システムは、グラフベースのクロスモーダル・アテンションと視覚的マッピングモジュールを組み合わせることで、モダリティと感情の相互作用の透明な分析を可能にします。これは、感情推論がブラックボックス的なプロセスとして扱われている現在の文献において、極めて重要な欠落要素です。
提案したフレームワークは、CH-SIMSおよびCMU-MOSEIのベンチマークデータセットにおいて一貫した性能を示しました。本フレームワークは、インテリジェントなヒューマンマシンインタラクション、ヘルスケアモニタリング、適応学習環境、およびその他の感情認識システムへの応用の可能性がありますが、本研究では制御されたベンチマーク条件下でのみ手法を評価しました。実世界への導入、ユーザーインターフェースの評価、ユーザビリティ調査、または被験者を対象とした評価は実施していません。したがって、運用環境における本フレームワークの実用的な有効性については、今後の検討が必要です。今後の課題として、導入を想定した評価、ユーザー中心の研究、レイテンシ分析、メモリ消費量の評価、およびリアルタイムインタラクション性能に焦点を当てます。
さらに、文化的および言語的に多様なさまざまなデータセットにおいて性能向上が見られたことは、提案したフレームワークの妥当性を示すものである。単一のデータセットや特定のインタラクションシナリオで検証された従来の研究とは異なり、提案したフレームワークは、言語、話者、および感情表現を問わず堅牢な性能を発揮する。したがって、本フレームワークは、正確な感情認識と解釈可能な意思決定が求められる実用的な知的インタラクションシステムに非常に適している。
提案されたフレームワークの解釈性は、学習されたマルチモーダル表現の視覚化ベースの分析を通じて評価されました。具体的には、モデルの意思決定プロセスとモダリティの寄与に関する知見を得るために、潜在感情エンベディング、クロスモーダルアテンションマップ、モダリティ相互作用グラフ、および時間的感情軌跡を検討しました。視覚的マッピングモジュールの目的は、特徴レベルの相互作用と感情ダイナミクスの観察を可能にすることで、透明性を高めることです。ただし、正式な解釈性指標、アテンションの忠実度評価、およびユーザー調査は、本研究には含まれていません。したがって、報告された解釈性の利点は、定量的に検証された説明可能性の尺度ではなく、視覚化に基づく根拠として解釈されるべきです。
理論的な観点から、本研究はマルチモーダル感情コンピューティングに以下の貢献をします。まず、感情特有の表現とモダリティ特有の表現を明確に区別する、感情モデリングの体系的な手法を提案します。共通の潜在空間においてモダリティ間の感情的な一貫性を保証することで、提案されたフレームワークはマルチモーダルシステムにおける表現学習の理論を前進させます。さらに、グラフベースのアテンションメカニズムを組み込むことで、感情表現における異なるモダリティ間の依存関係を定式化しています。
実用的な観点から、提案されたフレームワークは、インテリジェントなインタラクションデザインおよび感情認識ユーザーインターフェースにとって非常に有益です。本フレームワークの視覚的マッピングモジュールにより、システム設計者はさまざまなモダリティが感情予測に与える影響を把握することができ、これはシステム設計者にとって極めて重要です。提案されたフレームワークは、感情的な対話エージェント、適応型学習システム、ヘルスケアモニタリングインターフェース、およびユーザーエクスペリエンス評価プラットフォームなどのアプリケーションに非常に有用です。
しかしながら、提案されたフレームワークにはいくつかの限界があります。グラフアテンションメカニズムとトランスフォーマーエンコーダーの使用は複雑さを増大させ、機能が限られたデバイスでは問題となる可能性があります。さらに、本研究では視覚、音声、テキストのモダリティに焦点を当てるため、EEGやアイトラッキングなどの他の生理学的信号は考慮していません。提案されたフレームワークは、競争力のある予測性能と向上した可視化能力を達成したものの、リアルタイム展開における計算効率については具体的に評価されていません。今後の研究では、実際の知能的インタラクション環境における展開性能、推論遅延、スループット、メモリ消費量、およびモデル圧縮技術について検討します。また、感情モデリングの精度とインタラクションの応答性をさらに向上させるため、軽量モデルの開発、リアルタイム最適化手法、および追加モダリティの導入に焦点を当てます。リアルタイム展開の性能は評価されておらず、トランスフォーマーエンコーダーとグラフベースのアテンション手法の導入により計算複雑性が高まっています。手法の検証にはCH-SIMSおよびCMU-MOSEIのベンチマークデータセットのみが使用されており、これによりデータセット特有のバイアスが生じ、他のドメイン、言語、ユーザー集団への汎用性が制限される可能性があります。加えて、本研究ではEEGやアイトラッキングデータのような生理学的信号を含めておらず、視覚、音声、テキストのモダリティに特化しています。詳細な実装およびシミュレーション環境の説明により再現性は向上していますが、ソースコードと学習済みモデルは現在公開されていません。
本研究では、知的インタラクション設計に向けたマルチモーダル感情特徴学習のための、新しい視覚的マッピングフレームワークを使用しています。提案手法は、エンドツーエンドのTransformerベースの表現学習、もつれを解いた感情モデリング、およびグラフベースのクロスモーダルアテンションを統合することで、高い予測精度と解釈性を実現しています。CH-SIMSおよびCMU-MOSEIデータセットを用いた実験により、提案フレームワークが精度およびF1スコアにおいて、最先端のマルチモーダル感情認識モデルを上回ることが示されました。さらに重要な点として、提案された視覚的マッピングソリューションは、感情認識とインタラクション戦略の間のギャップを埋めるものであり、解釈可能でインタラクションを考慮したマルチモーダル感情計算システムの設計に向けた新たな方向性を提示しています。
解釈可能なインテリジェント・インタラクション設計を促進するため、本研究ではマルチモーダル感情特徴量を学習するための新しい視覚的マッピングフレームワークを導入した。提案されたシステムは、Transformerベースのマルチモーダル特徴抽出、もつれを解いた感情表現学習、グラフベースのクロスモーダルアテンション融合、および視覚的マッピング手法を組み合わせることで、単一のアーキテクチャ内で感情検出と解釈可能性を統合することに成功した。モダリティの寄与度、クロスモーダル相互作用、および時間的な感情動態を明確な視覚的表現で提供することに加え、CH-SIMSおよびCMU-MOSEIのベンチマークデータセットを用いた実験的評価により、Accuracy、Precision、Recall、F1-score、およびMean Absolute Error (MAE)を含む複数の指標において、代表的なベースライン手法を上回る性能向上が示された。しかし、本研究は2つのベンチマークデータセットによる評価に限定されており、実世界への展開研究、ユーザー中心の評価、定量的な説明可能性の評価、および生理学的モダリティの統合は含まれていない。さらに、Transformerエンコーダとグラフベースのアテンション処理の計算コストのため、リソースが限られた環境では困難が生じる可能性がある。今後の課題として、多様なデータセットを用いたより広範な検証、追加モダリティの統合、ユーザビリティ調査、再現可能なリソースの公開、およびリアルタイム展開シナリオに向けた最適化に重点を置くが、提案したフレームワークは全体として、アフェクティブコンピューティングおよびインテリジェント・インタラクションアプリケーションにおける解釈可能なマルチモーダル感情分析の可能性を示している。
著者らに利益相反はありません。
著者らは、マレーシアのペナンにあるマレーシア科学大学(Universiti Sains Malaysia)の住宅・建築・計画学部、および中国の長沙にある長沙理工大学(Changsha University of Science & Technology)のデザイン・アート学部の支援に感謝いたします。また、本研究を通じて学術的および研究的支援をいただいた、中国の厦門にある福州大学(Fuzhou University)の厦門芸術・デザイン学院に深く感謝いたします。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| アダム | PyTorchオプティマイザライブラリ | https://pytorch-optimizers.readthedocs.io/en/latest/ (学習率 = 1) × 10-4) | モデルトレーニングにおけるパラメータの最適化 |
| CH-SIMS | オリジナルデータセットリポジトリ | 最新の一般公開版 | 中国語マルチモーダル感情・情動分析のためのベンチマークデータセット |
| CMU-MOSEI | CMUマルチモーダルSDKリポジトリ | https://github.com/CMU-MultiComp-Lab/CMU-MultimodalSDK (最新パブリックリリース) | マルチモーダル感情および情動認識のためのベンチマークデータセット |
| もつれ解消済み感情エンコーダー | カスタム実装 | (デュアルエンコーダー・アーキテクチャ) | 感情特異的およびモダリティ特異的な潜在表現の分離 |
| グラフアテンションネットワーク (GAT) | PyTorch Geometric | マルチヘッドGAT (https://pytorch-geometric.readthedocs.io/en/latest/) | クロスモーダル感情関係のモデリングと適応的特徴融合 |
| グラフベースのクロスモーダル・アテンション層 | カスタム実装 | マルチヘッドアテンション融合 | モダリティ間におけるきめ細かな感情依存関係の学習 |
| Matplotlib | Matplotlibプロジェクト | 3.7+ | プロットの作成と視覚的分析 |
| NetworkX | NetworkXプロジェクト | 3.0+ | クロスモーダル相互作用グラフの構築と可視化 |
| NVIDIA GPU | NVIDIA Corporation | CUDA対応GPU | トランスフォーマーおよびグラフニューラルネットワークの学習加速 |
| 主成分分析 (PCA) | Scikit-learn | sklearn.decomposition.PCA | 高次元感情埋め込みの初期次元削減 |
| Python | Python Software Foundation | 3.8+ | マルチモーダル感情分析フレームワークの実装に使用される主要プログラミング言語 |
| PyTorch | PyTorch Foundation | 2.0+ | 深層ニューラルネットワークの開発、学習、および最適化 |
| RoBERTa | Hugging Face Transformers | https://huggingface.co/docs/transformers/index (roberta-base、768次元埋め込み) | 文脈的な言語的および意味的な感情表現の抽出 |
| Seaborn | Seabornプロジェクト | 0.12+ | アテンションヒートマップの作成と統計的視覚化 |
| t-分布確率的近傍埋め込み法 (t-SNE) | Scikit-learn | scikit-learn.org (パープレキシティ = 30, 反復回数 = 1000) | 潜在的な感情クラスターとトラジェクトリの可視化 |
| Ubuntu Linux | Canonical Ubuntu | 20.04 LTS 以降 | 実験実施環境 |
| ビジョン・トランスフォーマー (ViT-Base) | Google Research Vision Transformer | ViT-Base/16、768次元埋め込み | ビデオフレームからの感情認識視覚表現の抽出 |
| Wav2Vec 2.0 | Meta AI Research | ベースモデル、768次元埋め込み | 文脈的な音響的特徴および音声感情特徴の抽出 |
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト