このコンテンツを表示するには、JoVEへの購読が必要です。 または、無料トライアルをお申し込みください。

方法論記事

絵画鑑賞中の脳波計および顔面多モーダル感情認識のための二重分岐クロスアテンションネットワーク

114 回視聴

⸱

DOI:

10.3791/70600

⸱

2026年5月12日

この記事について

サマリー

このプロトコルは、絵画鑑賞環境における脳波および顔のデータを同期取得し、前処理、特徴融合、4つの感情状態の分類を含むマルチモーダル感情認識のための二分岐クロスアテンションネットワークを記述しています。

要約

絵画鑑賞中の感情認識は依然として困難です。なぜなら、美的反応は動的で文脈依存的であり、外的な行動を通じてのみ部分的にしか観察できないからです。したがって、顔の表情のみや生理的信号のみに基づくユニモーダルアプローチは、しばしば鑑賞者の経験を不完全な表現で提供しがちです。本記事では、顔の映像と脳波(EEG)データを統合し、絵画展覧会の文脈で多モーダルな感情認識を実現するための二重分岐クロスアテンションネットワークを構築する再現可能な手法について説明しています。このプロトコルは、64チャンネルのEEGシステムと高解像度カメラを用いた同期取得環境の確立から始まり、絵画鑑賞中に同時に記録します。その後の手順では、信号前処理(EEGフィルタリング、セグメンテーション、差分エントロピー特徴抽出、顔検出、アラインメント、映像解析のためのフレーム準備)が詳細に行われます。ニューラルネットワークはモダリティ特異的な2つの枝を含みます。EEG部門は、時空間的・時間的神経特徴をモデル化するために、畳み込みニューラルネットワークと双方向の長短期記憶ネットワークを用い、顔面部門は協調的な注意強化型軽量畳み込みネットワークを用いて視覚的表現特徴を抽出します。その後、マルチヘッドクロスアテンションモジュールを用いて、インターモーダル関連性を学習することで両ストリームを融合させます。ここで報告した実験条件下では、マルチモーダルフレームワークは4カテゴリー感情認識においてユニモーダル比較モデルよりも高い分類精度を達成しました。この手法は、制御された取得環境でのオフライン解析に最も適しており、感情計算、経験的美学、展示志向のヒューマン・コンピュータインタラクション研究のための実践的な枠組みを提供します。

概要

感情は外部刺激、内部評価、継続的な認知調整によって形作られた多次元的な心理的・生理学的プロセスであり、したがって人間とコンピュータの相互作用や認知科学において中心的な位置を占めています。絵画展の場では、感情も視覚芸術と鑑賞者の解釈との関係を媒介します。このため、鑑賞者の感情状態の特定は、展覧会評価、空間デザイン、美的体験の実証的研究において実用的価値を持つ。同時に、半自然な展示環境における感情測定は技術的には依然として難しい。なぜなら反応は微妙で一時的であり、作品や鑑賞の文脈の両方に影響されるからである。

感情認識の研究は一般的に行動分析と生理学的分析の二つの主要な方向で発展してきました。行動的アプローチ、特にコンピュータビジョンに基づく顔の表情分析は、非侵襲的で比較的容易に展開できるため広く使われています。残差ネットワークや軽量畳み込みネットワークなどの深層学習モデルは、基本的な顔の感情分類タスクで高い性能を示しています。しかし、絵画鑑賞中の顔の行動は弱く、社会的に抑制され、意図的に抑制されている場合があり、それが視覚的な表情と主観的感情の対応を減少させることがあります。特に脳波図(EEG)に基づく生理学的アプローチは、感情処理に関連する神経活動により直接的にアクセスできる6。EEGは感情研究で広く用いられています。なぜなら、神経信号の時間的変動は感情状態の変化、価数や覚醒に関連する次元を含むためです。それでもEEG記録は、動作アーティファクト、筋電図の汚染、環境ノイズに敏感であり、EEGだけでは視聴者が視覚的に反応している内容について限られた文脈情報しか提供できないことが多いです。

これらの補完的な強みと弱みが、マルチモーダル感情認識への関心を高めています。マルチモーダル融合の中心的な前提は、異質な信号が相互に有益な証拠を提供し、単一のモダリティを孤立して解釈する際に生じる曖昧さを軽減できることである。例えば絵画鑑賞の課題では、抑制された顔の行動が注意や情動関わりに関連する神経変化と一致することもあります。しかし、既存のマルチモーダルシステムはこの関係を必ずしも効果的にモデル化しているわけではありません。直接的な特徴連結に基づく初期の融合戦略は、次元負荷を増加させ、モダリティ特異的な時間構造をぼやかす可能性があります。別々の決定に基づく後期融合戦略は実行しやすいが、感情処理中の視覚信号と生理信号の細かい相互作用を見落とす可能性がある。さらに、多くのマルチモーダルモデルは固定的または弱適応的なフュージョンスキームを使用しており、展示のような環境での視聴者反応の変動には適していません。

これらの制約に対処するため、本プロトコルでは絵画鑑賞中の多モーダル感情認識のための二重分岐クロスアテンションネットワークを記述しています。この枠組みでは、EEGの特徴は畳み込みニューラルネットワーク双方向長期短期記憶モデル(CNN-BiLSTM)によって処理され、空間・時間的な神経動態を表現します。顔のビデオ特徴は、協調型注意強化型MobileNetV2ブランチによって処理され、低強度の表情手がかりを計算効率を維持しつつ捉えます。その後、両枝は単に出力を連結するのではなく、モダリティ間の関連性を学習する多頭クロスアテンション機構を通じて統合されます(15,16)。この設計は、モダリティ固有の構造を保持しつつ、クロスモーダル相互作用モデリングを向上させることを目的としています。

この手法は主に、制御されたデータ取得条件下でのオフライン解析を目的としており、オープンな公共展示空間でのリアルタイム展開は目的ではありません。信頼性の高い実装には、同期したEEGとビデオキャプチャ、安定した照明、制御されたカメラ配置、許容可能な電極インピーダンス、そしてモデルトレーニングのための十分な計算資源が必要です。パフォーマンスはまた、サンプルの構成、刺激の種類、参加者が記録されていることを知って行動をどの程度変えるかによっても異なる場合があります。これらの運用上の制約は、プロトコルを他の展示環境や対象集団に適応させる際に考慮すべきです。

ここで提示されるプロトコルは、327名の参加者からの同期取得、EEGおよび顔面映像データの前処理、特徴抽出、クロスモーダル融合、分類を含む実験パイプライン全体をカバーしています。この研究の目的は、絵画展覧会研究における多様性感情認識のための再現可能なワークフローを提供することです。感情的コンピューティングを超えて、このプロトコルは経験的美学や関連する心理学研究における定量的調査も支援する場合があります。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

研究プロトコルは形意民祖師範大学人間研究保護倫理委員会(承認番号2600AL0621)によって審査・承認されました。研究への参加前およびデータ収集前に、すべての参加者から書面によるインフォームドコンセントが取得されました。

1. 参加者の採用と倫理的遵守

  1. 倫理的承認の取得
    1. 研究開始前に、完全な実験プロトコル、同意書、参加者情報シート、データ保護計画を機関審査委員会(IRB)または倫理委員会に提出してください。
    2. 書面による承認を取得し、承認番号を研究文書に記録してください。
  2. 参加者募集
    1. 絵画鑑賞中の多様性感情獲得のために健康な成人参加者を募集します。このデモンストレーションプロトコルでは、327名の参加者を募集します。
    2. 以下の選択基準を適用してください:年齢18歳から35歳、視力が正常または正常に矯正されていること、自己申告した神経障害の既往歴なし、現在向精神薬の使用なし、脳波(EEG)記録および顔面ビデオ記録を受ける意思があること。
    3. 以下の除外基準を適用してください:過度な頭皮損傷や皮膚疾患による電極の挿入妨害、全記録セッションを完了できない、獲得時の激しい運動、または同意書の不完全な記録。
    4. 年齢、性別、利き手、過去の技術鑑賞経験、学歴などの参加者の特徴を記録します。このデモンストレーションプロトコルでは、以下のサンプル SHORT LONG ABSTRACT を記録します:平均年齢24.8歳±3.7歳、女性165名、男性162名、参加者全員右利き。
    5. 採用前に、業務的に人口統計のバランスを定義してください。このデモンストレーションプロトコルでは、この用語を用いて、ほぼ均衡した性別分布と、EEGや顔の表情反応における年齢関連のばらつきを減らすために、若年成人期に集中した年齢範囲を示します。
  3. インフォームドコンセントの取得
    1. 各参加者に、EEG記録、顔のビデオ記録、同期手順、匿名化、データ保存、そしていつでも罰則なしで撤退できる権利を記載した書面によるインフォームドコンセントフォームを提供してください。
    2. 顔画像は特徴抽出に使用され、参加者の身元を保護するためにすべての原稿図で目の領域はマスクされることを説明してください。
    3. いかなる実験的手続きを始める前に、必ず書面によるインフォームドコンセントを取得してください。
  4. 識別子の割り当てとデータの匿名化
    1. 各参加者に固有の数値研究IDを割り当てます。EEGファイル、ビデオファイル、メタデータを研究IDのみで保存します。
    2. 識別可能な同意書は生理データや画像データとは別に保存します。地域の倫理方針で求められる場合、非識別化された顔フレームや顔のランドマーク由来の出力を内部分析保存に使用してください。

2. 実験環境と刺激の設定

  1. 観測環境の準備
    1. 静かな屋内部屋を用意し、管理された絵画展示環境を模しましょう。周囲の気温は22〜24°C、相対湿度は45〜60%に保ちます。可能な限り40dB未満の背景雑音を抑えてください。
    2. 参加者を背もたれ付きの立った椅子に座らせ、椅子の位置を2.0mにして、参加者とディスプレイの距離を2.0mにします。
    3. 刺激提示中は、参加者に録音エリアで一人で座ったままでいるよう指示します。データ取得中、他の参加者や観察者が視界に入ることを許さないでください。
  2. 照明の構成
    1. 顔の影を減らすために、参加者の前に拡散リングや円形照明を設置します。顔面レベルで照明を約500ルクスの安定したレベルに設定します。
    2. 急激な照明の変動や目、額、頬への直射的なまぶしさは避けてください。視覚チェックポイント:顔全体、額、眉、目、鼻、頬、口の部分がカメラプレビューで過剰露出や深い影なしに見えることを確認してください。
  3. 視覚刺激提示の構成
    1. 視覚刺激をモニターやプロジェクションスクリーンに表示します。このデモンストレーションプロトコルでは、解像度1,920 x 1,080ピクセル、リフレッシュレート60Hzの27インチ液晶ディスプレイモニターを使用します。
    2. 研究デザインに応じて、絵画鑑賞刺激をビデオまたはスライドショー形式で表示します。すべての参加者に対して同じ画面の明るさ、コントラスト、表示順ルールを適用してください。
    3. 各ペイントクリップを90〜120秒間提示します。このデモンストレーションプロトコルでは、6つのクリップを使用し、それぞれ100秒の持続時間を持ち、刺激間休息間隔は20秒です。
      注意:すべての電気機器を適切に接地し、EEGアンプと電源ケーブルを高干渉源から離して50/60Hzのラインノイズを減らしてください。

3. マルチモーダルデータ取得

  1. 顔認証ビデオの取得
    1. 高精細の産業用カメラを参加者の目の前、ほぼ目の高さに設置します。カメラと顔の距離を1.2mに設定します。
    2. 最小取得解像度が1,920×1,080ピクセル、フレームレート30fpsのカメラを使用してください。
    3. フレームごとの変動を避けるために露出は手動で設定してください。このデモンストレーションプロトコルでは、ISO 400、シャッタースピード1/60秒、固定ホワイトバランスを使用します。
    4. 一定のフレームレートでMP4またはAVI形式で保存します。このデモンストレーションプロトコルでは、動画をMP4、H.264エンコーディング、30フレーム/秒として保存します。
    5. 録画中、顔全体が視野内に残っていることを確認してください。視覚チェックポイント:眉毛と額が完全に見えることを確認してください。額や眉の部分、あごがトリミングされたら、すぐにカメラの位置を変えてください。
      注意:30フレーム/秒を使用してください。このフレームレートは、低強度の顔表情動態に十分な時間的解像度を提供しつつ、同期マルチモーダル録画において管理可能なストレージと処理負荷を維持します。
  2. EEG信号の取得
    1. 頭囲を測定し、参加者に合った適切な頭蓋サイズを選びます。64チャンネルEEGキャップは、国際的な10–20システムまたはメーカー指定の64チャンネル拡張レイアウトに従って装着します。
    2. 解剖学的なランドマークを使ってキャップを合わせます。Fpzをナシオンの正中線上に位置させ、左右の半球の対称性を確認します。
    3. 各電極部位で髪を分け、導電性ジェルを塗布して電極と頭皮の接触を改善します。
    4. 高インピーダンス部位で綿棒や鈍器の準備ツールを使って優しく頭皮を準備してください。皮膚を過度に擦り傷つけないでください。
    5. コンデンサをEEGアンプに接続し、インピーダンス測定を行います。すべてのチャネルで電極インピーダンスを10 kΩ未満に下げてください。このデモンストレーションプロトコルでは、可能であれば前極および中央電極に対して<5 kΩを目指してください。
    6. サンプリング周波数を500Hzに設定し、アンプの設定に応じてオンライン参照を設定します。このデモンストレーションプロトコルでは、取得時にリンクされた乳様突起参照を使用し、前処理時に共通平均再参照を行います。
    7. アンプの仕様に従って接地電極を配置してください。このデモンストレーションプロトコルでは、アースをAFzに置いてください。刺激提示前に少なくとも60秒の安静時ベースラインを記録してください。
    8. 視覚チェックポイント:実験開始前にライブの脳波検査(EEG)を確認してください。安定したベースライン活動、低ドリフト、持続的な飽和チャネルや主要な運動アーティファクトの不在を確認しましょう。
  3. EEGと映像ストリームの同期
    1. 刺激提示コンピュータをトランジスタ・トランジスタロジック(TTL)トリガーケーブルまたはトリガーボックスを使ってEEG増幅器のトリガー入力に接続します。
    2. プレゼンテーションソフトを使って、各ペインティングクリップの開始時にTTLトリガーパルスを、オフセットで2つ目のTTLトリガーパルスを送信します。
    3. 各イベントタイプに固有のトリガーコードを割り当てます。このデモンストレーションプロトコルでは、クリップオンセットに11–16、クリップオフセットに21–26を使用します。
    4. カメラの流れとEEGのストリームを、最初のトリガーの少なくとも5秒前から最終トリガーの少なくとも5秒後まで同時に記録してください。刺激ソフトウェアでトリガータイムスタンプ表を自動的に記録してください。
    5. EEG記録のトリガータイムスタンプとプレゼンテーションログのビデオフレームインデックスを照合することで、取得後の同期を検証します。視覚チェックポイント:EEGトリガータイムスタンプとビデオフレームタイムスタンプの平均アライメント誤差が30フレーム/秒で33ms±以内であることを確認しましょう。
      注意:ハードウェアによるフレーム精度同期インターフェースがない場合は、両システムからタイムスタンプログをエクスポートし、トリガーオンセットマッチングを用いてオフラインアライメント補正を行います。
  4. 実験データの記録
    1. 参加者に、大きな頭の動き、過度なまばたき、話すこと、顔への触れ合いを最小限に抑えつつ、自然に絵画を鑑賞するよう指示します。
    2. あらかじめ定義された絵画クリップを選択した順序で提示します。視聴中、同期したEEGおよび顔面映像を継続的に記録してください。
    3. 録音中に5チャンネル以上がインピーダンス閾値を超えた場合は、実験を一時停止し、電極を再チェックしてください。中断、参加者の不快感、技術的な問題はセッションログに記録してください。

4. EEG前処理および特徴抽出

  1. 生のEEGデータのインポート
    1. 生のEEG記録を解析環境にインポートします。このデモンストレーションプロトコルでは、EEGLAB 2024.0のMATLAB R2023b、またはMNE 1.6のPython 3.10のいずれかを使用します。
    2. イベントマーカーをインポートし、すべての刺激開始・オフセットトリガーが存在しているか確認します。
  2. EEG信号のダウンサンプリング
    1. 信号を500Hzから200Hzにダウンサンプリングし、 図1に示すワークフローに従って前処理を行います。
    2. リサンプリング時には、ソフトウェアのデフォルトまたは定義されたフィルター設定に従ってアンチエイリアシングを適用してください。
  3. EEG信号のフィルタリング
    1. 0.5〜45Hzのバンドパスフィルターを適用し、線路ノイズが残る場合はローカルパワー周波数でノッチフィルターを適用します。このデモンストレーションプロトコルでは、50Hzノッチフィルターを適用します。
  4. アーティファクトの除去
    1. 連続EEGを手動で検査し、粗い動きのアーティファクトがある区間をマークしてください。
    2. フィルタリングされたデータに対して独立成分解析を行います。まばたき、水平眼球運動、顎の緊張、筋肉活動に関連する要素を、頭皮マップ、タイムコース、パワースペクトルを用いて特定します。
    3. 識別されたアーティファクトの部品を取り除き、クリーンになった脳波信号を再構築します。独立した成分解析補正後も過度な振幅変動を含むセグメントは却下します。このデモンストレーションプロトコルでは、±100μVを超えるセグメントをリジェクトします。
  5. データの再参照
    1. クリーンになったEEG信号を共通の平均基準に再参照します。
  6. EEGデータの分割
    1. 刺激の開始トリガーに応じて連続EEGを測定してください。クリップ全体または固定解析ウィンドウをカバーする刺激に整列したセグメントを抽出します。このデモンストレーションプロトコルでは、EEGを2.0秒のウィンドウに分割し、50%が重なります。セグメント後に残留アーティファクトのあるウィンドウは除外します。
  7. 微分エントロピー特徴の計算
    1. 各EEGセグメントを以下の周波数帯域に分解します:デルタ(1–4 Hz)、シータ(4–8 Hz)、アルファ(8–13 Hz)、ベータ(13–30 Hz)、ガンマ(30–45 Hz)。
    2. 各チャンネルの周波数帯の差分エントロピーを計算します。ガウス変数に対して次の式を用います。
      DE = 1/2 ln(2πeσ2)、ここでσ2 は帯域制限されたEEG信号の分散です。
    3. チャネルごとの微分エントロピー値を2次元トポグラフィー行列またはチャネル特徴行列に配置し、モデル入力を用いてください。
    4. このデモンストレーションプロトコルでは、分析ウィンドウあたり入力サイズ128×128×5のEEG特徴マップを生成します。視覚的チェックポイント:各バンドの代表的な微分エントロピーマップをプロットし、欠損チャネル、定数値マップ、異常なバンド面崩壊が存在しないことを確認します。

5. 顔のビデオ前処理

  1. 画像フレームの抽出
    1. 録画された映像をスクリプト化されたパイプラインを使って画像フレームにデコードします。同期メタデータを保持しつつ、モデル入力のために25フレーム/秒でフレームを抽出します。
  2. 顔の検出とアライメント
    1. 検証済みの顔検出器を使って各フレームの顔を検出します。顔のランドマークを特定し、目の中心や標準的なランドマークアンカーに基づいて顔を整列させます。顔が確実に検出されないフレームは捨てられます。
  3. 顔領域のトリミングとサイズ変更
    1. 面を検出されたバウンディングボックスに合わせてトリミングし、輪郭情報を保持します。トリミングした顔の画像を224×224ピクセルにリサイズします。
    2. 図2に示すように、4つの対象感情カテゴリーから代表的な顔をトリミングした顔サンプルを検査し、クロップ後も額、眉毛、目、鼻、頬、口が見えることを確認します。
  4. トレーニング画像の補強
    1. 訓練セットにのみ確率0.5でランダムな水平反転を適用します。トレーニングセットにのみ±15°以内のランダム回転を適用してください。
    2. 検証やテスト画像には拡張を適用しないでください。
  5. 顔入力の正規化
    1. ピクセル値を範囲[-1, 1]に正規化するか、すべての分割で一貫してバックボーン固有の正規化ルールを適用してください。

6. マルチモーダルニューラルネットワークを構築する

  1. ソフトウェアおよびハードウェア環境の設定
    1. Python 3.10でPyTorch 2.1を使ってモデルを実装してください。Ubuntu 22.04または他の指定OSでトレーニングを実施してください。
    2. 少なくとも32GBのRAM、12GB以上のビデオメモリを備えたグラフィックス処理ユニット、そして同期したEEGビデオデータに十分なローカルストレージを備えたワークステーションを使用してください。このデモンストレーションプロトコルでは、NVIDIA RTX 3080グラフィックス処理ユニットを使用します。
    3. トレーニングスクリプト、モデル定義ファイル、前処理スクリプト、設定ファイルをバージョン管理されたプロジェクトディレクトリに保存します。
    4. 共有が許可されている場合は、原稿内のコードリポジトリまたはアーカイブ済みスクリプトパッケージを報告してください。
  2. 顔の枝の構築
    1. 図3に示すように、全体の双重枝マルチモーダル枠組みを構築します。顔の分岐用にMobileNetV2バックボーンを初期化します。
    2. 最初の畳み込み層を32チャンネルから24チャンネルに変更します。 図4 に従って顔の特徴抽出分岐を構築し、選択した逆残差ブロックの後に座標注意モジュールを挿入します( 図5参照)。
    3. 指定された標準畳み込みを、3×3および5×5カーネルサイズの並列深度別畳み込みに置き換え、マルチスケールの特徴抽出を向上させます。
    4. 固定次元の顔の特徴ベクトルをエクスポートして融合します。このデモンストレーションプロトコルでは、特徴次元を256にします。
  3. EEG部門の建設
    1. 入力すると、微分エントロピー特徴が畳み込みニューラルネットワークエンコーダに写像されます。畳み込み層を使ってEEGの特徴マップから空間パターンを抽出します。
    2. 畳み込み出力シーケンスを双方向の長期短期記憶モジュールに入力し、ウィンドウ間の時間依存性を捉えます。
    3. 固定次元のEEG特徴ベクターをエクスポートします。このデモンストレーションプロトコルでは、特徴次元を256にします。
  4. クロスモーダル融合モジュールの構築
    1. 図6に示されるマルチモーダル特徴相互作用モジュールを実装します。 8人のヘッドによる複数ヘッドクロスアテンションブロックを実装します。
    2. EEGの特徴列をクエリとして、顔の特徴列をキーと値として一つのクロスアテンションストリームで使用します。
    3. 顔の特徴の列をクエリとして、EEGの特徴の列を相互のクロスアタッションストリームのキーと値として用いてください。
    4. 2つのクロスアテンションストリームの出力を連結します。連結した特徴を融合投影層に通します。
  5. 自己残差拡張畳み込み加群を加えること
    1. 図7に示す自己残差拡張畳み込み接続層で融合表現を精緻化します。
    2. 拡張された畳み込み連結層を1、3、6、12の拡張率で構成します。4つの拡張分岐からの出力を連結します。
    3. 残留スキップ接続を追加して勾配フローを安定させ、下位情報を保持します。
  6. 分類器の追加
    1. 融合した表現を平坦化またはプール化します。完全に接続されたレイヤーを1つと、最後にsoftmax出力レイヤーを追加します。出力クラスを恐怖、幸福、落ち着き、悲しみに設定します。
  7. トレーニング設定の定義
    1. 表1にまとめられたネットワークとトレーニング設定を活用してください。4つの感情クラス(恐怖、幸福、落ち着き、悲しみ)は、刺激設計と参加者自己報告に基づく結合ラベリング手順を用いて操作的に定義されました。各絵画クリップはあらかじめ選ばれ、対象となる感情カテゴリーを引き出しており、参加者は視聴後に支配的な感情体験を報告しました。最終的なラベルは、意図した刺激カテゴリーと自己申告の反応を一致させることで割り当てられ、ラベル付けの信頼性を確保するために一貫性のないサンプルは除外されました。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

提案された二重枝クロスアテンシャルネットワークの性能は、ペインティング視聴中に327名の参加者から収集されたマルチモーダルデータセットを用いて評価されました。主な結果は、恐怖、幸福、落ち着き、悲しみの4つの感情分類パフォーマンスでした。追加の解析では、ユニモーダルモデルの挙動、多重モーダル収束、注意頭部数に対する感度、比較認識性能、顔面および脳波サブネットワークの挙動が検討されました。本研究には個別の対照群を含めませんでした。これは、同一データセット内のユニモーダルおよびマルチモーダル構成間の相対的な性能を評価することであり、非曝露またはベースライン集団との比較を目的としなかったためです。さらに、文化的表現性は独立した要因として分析されず、参加者サンプルは文化的背景が比較的均質であり、実験デザインは感情表現における異文化間の違いを調査することを目的としていませんでした。この設計選択により、研究は管理された条件下でのマルチモーダルフレームワークの方法論的検証に焦点を当てることができました。

ユニモーダ...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

このプロトコルは、感情コンピューティングにおける実用的な問題、すなわち、視覚的な表現と生理的反応が常に完全に一致しない絵画鑑賞の場面で感情状態をどのように認識するかという問題に取り組んでいます。ここで報告した実験条件下では、二重枝フレームワークはユニモーダル比較モデルよりも高い分類性能を達成し、展示のような環境で脳波図と顔面発現情報を組み合わせる価値を支持しています。この発見は、多様態統合が特に顔の変化が微妙または社会的に抑えられている場合に有用であることを示唆しています。なぜなら、生理学的信号は外見行動に完全に反映されない追加情報を提供する可能性があるからです。この点で、この手法はマルチモーダル感情認識だけでなく、経験的美学研究や展示志向のヒューマン・コンピュータ相互作用研究にも有用かもしれません。同時に、現在の結果は報告データセットの範囲内、記録設定、ラベル定義手順18の範囲内で解釈されるべきです。

プロトコルの重要な特徴の一つはクロスアテンション融合機構です。直...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

著者たちは利益相反を一切認めていない。

謝辞

興義民祖師範大学および西南大学のボランティアの皆様、実験に参加してくださったことに心より感謝申し上げます。また、EEGデータ取得の支援をいただいたジローナ大学の技術スタッフと、洞察に満ちたコメントをいただいた匿名のレビュアーの皆様にも感謝いたします。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
ディープラーニングフレームワークパイトーチv2.0 / https://pytorch.orgモデル構築、トレーニング、評価に使用
EEG取得システム(64チャンネル)ブレイン・プロダクツ GmbHアクティチャンププラス / v1.6実験中の高解像度EEG信号取得に使用
EEG電極キャップ(10–20システム)ブレイン・プロダクツ GmbHActiCap / 64チャンネル標準国際10–20電極配置
高精細カメラソニー・コーポレーションIMX327センサー表情ビデオ録画に使用されます(≥1080p、30fps)

参考文献

  1. Yang, Y., et al. A dual-stream regional feature learning and adaptive fusion method for electroencephalogram-based emotion recognition. Eng Appl Artificial Intell. 164, 113250(2026).
  2. Li, C., Pun, S. H., Li, J. W., Chen, F. Eeg-based emotion recognition using graph attention network with dual-branch attention module. 2024 46th Ann Int Conf IEEE Eng Me Biol Soc (EMBC), , 1-4 (2024).
  3. Ubillús, J. A. T., et al. Algorithms used for facial emotion recognition: A systematic review of the literature. EAI Endorsed Transact Pervasive Health Technol. 9, 1-17 (2023).
  4. Xu, Y., Cheng, L. Face emotion recognition based on gabor wavelet and particle swarm optimization algorithm. Multimed Syst. 31 (6), 435(2025).
  5. Dube, D. Y., Sannasi, M. V., Kyritsis, M., Gulliver, S. R. Facial emotion recognition from feature loss media: Human versus machine learning algorithms. Comp Human Behav. 174, 108806(2026).
  6. Manuel, M. T. J., Medina-DeVilliers, S., Clarkson, T., Lerner, M. D., Riccardi, G. Evaluation of interpretability for deep learning algorithms in EEG emotion recognition: A case study in autism. Artif Intell Med. 143, 102545(2023).
  7. Watanabe, A., Yamazaki, T. Representation of the brain network by electroencephalograms during facial expressions. J Neurosci Meth. 357, 109158(2021).
  8. Prakash, A., Poulose, A. Electroencephalogram-based emotion recognition: A comparative analysis of supervised machine learning algorithms. Data Sci Manag. 8 (3), 342-360 (2025).
  9. Sun, Y., Ayaz, H., Akansu, A. N. Multimodal affective state assessment using fnirs + eeg and spontaneous facial expression. Brain Sci. 10 (2), 85(2020).
  10. Huang, Y., Yang, J., Liu, S., Pan, J. Combining facial expressions and electroencephalography to enhance emotion recognition. Future Internet. 11 (5), 105(2019).
  11. Han, Q., et al. A multi-branch electroencephalogram emotion recognition framework based on cross-subject or cross-session multi-perspective representation fusion. Neurocomputing. 658, 131767(2025).
  12. Wang, L., Chang, Y., Wang, K. Dual-branch multimodal fusion network for driver facial emotion recognition. Appl Sci. 14 (20), 9430(2024).
  13. Mutawa, A. M., Hassouneh, A. Multimodal real-time patient emotion recognition system using facial expressions and brain EEG signals based on machine learning and log-sync methods. Biomed Signal Proc Contr. 91, 105942(2024).
  14. Qi, Y., Ibrayim, M., Hamdulla, A. Attention-based dual-branch network for micro-expression recognition with global-local feature fusion. 2024 IEEE Int Joint Conf Biometr (IJCB), , 1-9 (2024).
  15. Li, E. Intervention of art education on college students’ aesthetic mood based on emotion recognition algorithm. Front Art Res. 6 (9), 81-90 (2024).
  16. Liu, Z., Han, M., Wu, B., Rehman, A. Speech emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multi-task learning. Appl Acoustics. 202, 109178(2023).
  17. Xue, P., Wang, S., Bai, J., Qiang, Y. Research on bimodal emotion recognition algorithm based on multi-branch bidirectional multi-scale time perception. J Biome Eng. 42 (3), 528-536 (2025).
  18. Shioiri, S., Nagata, H., Sato, Y., Hatori, Y. Prediction of preference judgments of face images using facial expressions and eeg signals. J Vis. (9), 5063(2023).
  19. Lu, Y., Chen, J. Cross-subject EEG emotion recognition using the SSA-EMS algorithm for feature extraction. Entropy. 27 (9), 986(2025).
  20. Thapa, D., Rai, R. Freq-eer: A novel frequency-driven ensemble framework for emotion recognition and classification of eeg signals. Appl Sci. 15 (19), 10671(2025).
  21. Yang, Y., et al. Investigating of deaf emotion cognition pattern by eeg and facial expression combination. IEEE J Biomed Health Inform. 26 (2), 589-599 (2022).
  22. Tong, L., Yang, L., Wang, X., Liu, L. Self-aware face emotion accelerated recognition algorithm: A novel neural network acceleration algorithm of emotion recognition for international students. PeerJ Comput Sci. 9, e1611(2023).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

タグ

EEG感情認識顔表情分析微分エントロピー畳み込みニューラルネットワーク双方向LSTMアフェクティブコンピューティングヒューマンコンピュータインタラクション