이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.

방법 논문

회화 감상 중 뇌파 및 얼굴 다중 모달 감정 인식을 위한 이중 분기 교차 주의 네트워크

114 조회수

⸱

DOI:

10.3791/70600

⸱

2026년 5월 12일

이 논문에서

요약

이 프로토콜은 회화 관람 환경에서 뇌파 및 얼굴 데이터의 동기화 획득과 다중 모달 감정 인식을 위한 이중 분기 교차 주의 네트워크를 설명합니다. 여기에는 전처리, 특징 융합, 네 가지 감정 상태의 분류가 포함됩니다.

초록

회화 감상 중 감정 인식은 여전히 어렵다. 왜냐하면 미적 반응은 역동적이고 맥락에 따라 다르며, 외적 행동을 통해서만 부분적으로 관찰되기 때문이다. 따라서 얼굴 표정이나 생리학적 신호만을 기반으로 한 단모달 접근법은 종종 관람자의 경험을 불완전하게 표현할 수 있습니다. 이 글은 회화 전시 맥락에서 다중 모달 감정 인식을 위해 얼굴 비디오와 뇌파(EEG) 데이터를 통합한 이중 분기 교차 주의 네트워크를 구축하는 재현 가능한 방법을 설명합니다. 프로토콜은 64채널 EEG 시스템과 고해상도 카메라를 이용한 동기화된 획득 환경을 구축하여 도화 감상 중 동시에 기록하는 것으로 시작합니다. 이후 절차에서는 EEG 필터링, 분할, 차등 엔트로피 추출과 함께 얼굴 감지, 정렬, 영상 분석을 위한 프레임 준비를 포함한 신호 전처리가 상세히 진행됩니다. 신경망은 두 가지 모달리티에 특화된 가지를 포함합니다. EEG 분기는 합성곱 신경망과 양방향 장기 단기 기억 네트워크를 사용하여 시공간-시간적 신경 특징을 모델링하는 반면, 얼굴 분기는 시각 표현 특징을 추출하기 위해 조정된 주의력 강화 경량 합성곱 네트워크를 사용합니다. 다중 헤드 교차 주의 모듈을 사용하여 두 흐름을 융합하여 인터모달 관련성을 학습합니다. 여기서 보고된 실험 조건 하에서, 다중 모달 프레임워크는 4범주 감정 인식에서 단일 모달 비교 모델보다 더 높은 분류 정확도를 달성했습니다. 이 방법은 통제된 획득 환경에서 오프라인 분석에 가장 적합하며, 정서 컴퓨팅, 경험적 미학, 전시 지향적 인간-컴퓨터 상호작용 연구를 위한 실용적 틀을 제공합니다.

서론

감정은 외부 자극, 내부 평가, 지속적인 인지 조절에 의해 형성되는 다차원적 심리적·생리학적 과정으로, 따라서 인간-컴퓨터 상호작용과 인지과학에서 중심적인 위치를 차지합니다. 회화 전시 환경에서는 감정이 시각 예술과 관람자 해석 간의 관계를 매개하기도 합니다. 이러한 이유로, 관람자의 감정 상태를 식별하는 것은 전시 평가, 공간 디자인, 미적 경험의 실증적 연구에 실질적인 가치를 가집니다. 동시에, 반자연적 전시 환경에서의 감정 측정은 미묘하고 일시적이며 작품과 관람 맥락 모두에 영향을 받기 때문에 기술적으로 여전히 어렵다.

감정 인식 연구는 일반적으로 행동 분석과 생리학적 분석이라는 두 가지 주요 방향을 따라 발전해 왔습니다. 특히 컴퓨터 비전을 기반으로 한 얼굴 표정 분석과 같은 행동 접근법은 비침습적이고 비교적 쉽게 배포할 수 있기 때문에 널리사용됩니다. 잔류 네트워크와 경량 합성곱 네트워크와 같은 딥러닝 모델은 기본 얼굴 감정분류 작업에서 강한 성능을 보였습니다. 4. 그러나 회화 감상 중 얼굴 행동은 약하거나 사회적으로 절제되거나 의도적으로 억제될 수 있어 가시적 표정과 주관적 감정 간의 대응을 감소시킬 수 있습니다. 특히 뇌파검사(EEG)를 기반으로 한 생리학적 접근법은 정서 처리와 관련된 신경 활동에 보다 직접적으로 접근할 수 있게 합니다6. EEG는 신경 신호의 시간적 변동이 정서 상태 변화, 특히 가치 및 각성 관련 차원을 알려주기 때문에 감정 연구에 널리 사용되고 있습니다. 그럼에도 불구하고 EEG 기록은 운동 아티팩트, 근전도 오염, 환경 소음에 민감하며, EEG만으로는 시청자가 시각적으로 반응하는 내용에 대한 제한된 맥락 정보를 제공하는 경우가많습니다.

이러한 상호 보완적인 강점과 약점은 다중 모달 감정 인식에 대한 관심을 증가시켰습니다. 다중 모달 퓨전의 중심 전제는 이질적 신호가 상호 정보 제공을 제공하고 단일 모달리티를 고립적으로 해석할 때 발생하는 모호함을 줄일 수 있다는 것이다10. 예를 들어 회화 관찰 과제에서는 억제된 얼굴 행동이 주의력이나 정서적 참여와 관련된 측정 가능한 신경 변화와 일치할 수 있습니다. 하지만 기존의 멀티모달 시스템은 항상 이 관계를 효과적으로 모델링하지는 못합니다. 직접적인 특징 연결에 기반한 초기 융합 전략은 차원 부담을 증가시키고 양식에 따른 시간 구조를 흐릴 수 있습니다11. 별도의 결정에 기반한 후기 융합 전략은 실행하기 더 쉽지만,감정 처리 중 시각 신호와 생리적 신호 간의 세밀한 상호작용을 간과할 수 있습니다. 또한 많은 멀티모달 모델은 고정 또는 약하게 적응하는 융합 방식을 사용하는데, 이는 전시와 유사한 환경에서 관객 반응의 변동에 적합하지 않습니다13.

이러한 한계를 해결하기 위해 본 프로토콜은 회화 감상 중 다중 모달 감정 인식을 위한 이중 분기 교차 주의 네트워크를 설명합니다. 이 프레임워크에서 EEG 특징은 합성 신경망-양방향 장기 단기 기억 모델(CNN-BiLSTM)으로 처리되며, 이는 시공간 신경 역학을 표현하는 데 사용됩니다. 얼굴 영상 특징은 정렬 주의 강화 MobileNetV2 분기로 처리되며, 이는 저강도 표정 신호를 캡처하면서 계산 효율성을 유지합니다14. 두 가지는 단순히 출력을 연결하는 대신 양상 간 관련성을 학습하는 다중 헤드 교차 주의 메커니즘을 통해 통합된다15,16. 이 설계는 모달리티별 구조를 유지하면서 교차 모달 상호작용 모델링을 개선하기 위해 설계되었습니다.

이 방법은 주로 통제된 데이터 수집 조건 하에서 오프라인 분석을 위해 설계되었으며, 공개 전시 공간에서의 직접 실시간 배포보다는 목적이 아닙니다. 신뢰성 있는 구현을 위해서는 동기화된 EEG 및 비디오 캡처, 안정적인 조명, 제어된 카메라 위치, 허용 가능한 전극 임피던스, 그리고 모델 학습을 위한 충분한 컴퓨팅 자원이 필요합니다. 수행은 샘플 구성, 자극 유형, 그리고 참가자들이 자신이 기록되고 있음을 알고 행동을 얼마나 변화시키는지에 따라 달라질 수 있습니다. 이러한 운영 제약 사항은 프로토콜을 다른 전시 환경이나 집단에 맞게 조정할 때 고려해야 합니다.

여기서 제시된 프로토콜은 327명의 참가자로부터 동기화된 수집, EEG 및 얼굴 영상 데이터의 전처리, 특징 추출, 교차 모달 융합, 분류 등 전체 실험 파이프라인을 포함합니다. 목표는 회화 전시 연구에서 다중 모달 감정 인식을 위한 재현 가능한 워크플로우를 제공하는 것입니다. 정서 컴퓨팅 외에도, 이 프로토콜은 경험적 미학 및 관련 심리학 연구에서 정량적 연구를 지원할 수도 있습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

연구 프로토콜은 싱이민주사범대학교 인간연구보호윤리위원회(승인번호 2600AL0621)에서 검토 및 승인되었습니다. 연구 포함 전과 데이터 수집 전에 모든 참가자로부터 서면 동의를 받았습니다.

1. 참가자 모집 및 윤리적 준수

  1. 윤리적 승인 획득
    1. 연구 시작 전에 전체 실험 프로토콜, 동의서, 참가자 정보 시트, 데이터 보호 계획을 기관심사위원회(IRB) 또는 윤리 위원회에 제출하십시오.
    2. 서면 승인을 받고 승인 번호를 연구 문서에 기록하세요.
  2. 참가자 모집
    1. 회화 감상 중 다중 감정 획득을 위해 건강한 성인 참가자를 모집합니다. 이 시범 프로토콜에서는 327명의 참가자를 모집합니다.
    2. 다음 포함 기준을 적용하세요: 18세에서 35세 사이, 정상 또는 정상으로 교정된 시력, 신경학적 질환 자기보고적 병력 없음, 현재 향정신성 약물 사용 없음, 뇌파(EEG) 및 얼굴 영상 촬영 의향.
    3. 다음 제외 기준을 적용하세요: 과도한 두피 손상 또는 전극 삽입을 방해하는 피부과 질환, 전체 녹화 세션 불가, 획득 중 심한 움직임, 또는 불완전한 동의서 문서.
    4. 참여자의 나이, 성별, 손잡이, 이전 기술 관람 경험, 교육 수준 등 특성을 기록하세요. 이 시연 프로토콜에서는 다음 샘플 SHORT LONG ABSTRACT를 기록하세요: 평균 연령 24.8세± 3.7세, 여성 165명, 남성 162명, 모두 오른손잡이 참가자.
    5. 채용 전에 운영적으로 인구 통계학적 균형을 정의하세요. 이 시범 프로토콜에서는 이 용어를 사용하여 성별 분포가 대략 균형 잡힌 상태와 성인 초기에 집중된 연령대를 나타내어 EEG 및 얼굴 표정 반응의 연령 관련 변동을 줄이도록 합니다.
  3. 사전 동의 획득
    1. 각 참가자에게 EEG 기록, 얼굴 영상 촬영, 동기화 절차, 익명화, 데이터 저장, 그리고 언제든지 처벌 없이 철회할 권리를 명시한 서면 동의서를 제공하세요.
    2. 얼굴 이미지가 특징 추출에 사용되며, 모든 원고 도표에서 눈 영역을 가려 참가자 신원을 보호할 것임을 설명하세요.
    3. 어떤 실험적 절차를 시작하기 전에 서면 동의서를 받으세요.
  4. 식별자 할당 및 데이터 익명화
    1. 각 참가자에게 고유한 수치 연구 ID를 할당합니다. EEG 파일, 비디오 파일, 메타데이터를 연구 ID만으로 저장하세요.
    2. 식별 가능한 동의서는 생리학적 및 영상 데이터와 별도로 저장하세요. 지역 윤리 정책에 따라 요구되는 경우 내부 분석 저장을 위해 비식별화된 얼굴 프레임이나 얼굴 랜드마크 기반 출력물을 사용합니다.

2. 실험 환경 및 자극 설정

  1. 관람 환경 준비
    1. 통제된 회화 전시 환경을 시뮬레이션할 수 있도록 조용한 실내 방을 준비하세요. 주변 온도는 22–24°C, 상대 습도는 45%–60%로 유지하세요. 가능한 한 배경 소음을 40dB 이하로 조절하세요.
    2. 참가자를 등받이가 있는 직립 의자에 앉히고, 참가자와 디스플레이 사이의 시야 거리를 2.0m로 맞추세요.
    3. 자극 제시 중 참가자에게 녹음 구역에 혼자 앉아 있으라고 지시하세요. 데이터 수집 중 다른 참가자나 관찰자가 즉시 시야에 들어오지 않도록 하십시오.
  2. 조명 구성
    1. 얼굴 그림자를 줄이기 위해 참가자 앞에 확산 링이나 원형 조명을 설치하세요. 얼굴 높이에서 조명을 약 500럭스의 안정적인 수준으로 설정하세요.
    2. 눈, 이마, 뺨에 급격한 조명 변화와 직접적인 눈부심을 피하세요. 시각적 체크포인트: 이마, 눈썹, 눈, 코, 뺨, 입 부위를 포함한 전체 얼굴이 과다 노출이나 짙은 그림자 없이 카메라 미리보기에서 보인다.
  3. 시각 자극 제시의 구성
    1. 시각 자극을 모니터나 프로젝션 스크린에 제시하세요. 이 시연 프로토콜에서는 해상도 1,920 x 1,080 픽셀, 주사율 60Hz의 27인치 액정 디스플레이 모니터를 사용한다.
    2. 연구 설계에 따라 회화 감상 자극을 비디오 또는 슬라이드쇼 형식으로 표시하세요. 모든 참가자에게 동일한 화면 밝기, 명암, 프레젠테이션 순서 규칙을 사용하세요.
    3. 각 페인팅 클립을 90–120초 동안 제시하세요. 이 시연 프로토콜에서는 각각 100초 길이의 6개의 클립을 사용하고, 자극 간 휴식 간격은 20초입니다.
      주의: 모든 전기 장비를 적절히 접지하고, EEG 증폭기와 전원 케이블을 고간섭 원인에서 멀리 배치하여 50/60Hz 라인 잡음을 줄이세요.

3. 다중 모달 데이터 수집

  1. 얼굴 영상 획득
    1. 고화질 산업용 카메라를 참가자 바로 앞, 대략 눈높이에 위치시킵니다. 카메라와 얼굴 사이의 거리를 1.2m로 설정하세요.
    2. 최소 획득 해상도가 1,920 x 1,080 픽셀이고 프레임 속도가 30프레임/초인 카메라를 사용하세요.
    3. 프레임 간 변동을 피하려면 노출을 수동으로 설정하세요. 이 시연 프로토콜에서는 ISO 400, 셔터 속도 1/60초, 고정 화이트 밸런스를 사용하세요.
    4. 비디오를 일정한 프레임 레이트를 사용해 MP4 또는 AVI 형식으로 저장하세요. 이 시연 프로토콜에서는 비디오를 MP4, H.264 인코딩, 30프레임/초로 저장합니다.
    5. 녹화 세션 내내 얼굴 전체가 시야에 남아 있는지 확인하세요. 시각적 체크포인트: 눈썹과 이마가 완전히 보이는지 확인하세요. 이마, 눈썹 부위, 턱이 잘렸다면 즉시 카메라의 위치를 바꿔주세요.
      참고: 30프레임/초를 사용하세요. 이 프레임 속도는 저강도 얼굴 표정 역학에 적절한 시간 해상도를 제공하면서도 동기화된 다중 모달 녹화에서 관리 가능한 저장 및 처리 부하를 유지할 수 있습니다.
  2. EEG 신호 획득
    1. 머리 둘레를 측정하고 참가자에게 맞는 모자 크기를 선택하세요. 64채널 EEG 캡은 국제 10–20 시스템 또는 제조사가 지정한 64채널 확장 레이아웃에 따라 장착하세요.
    2. 해부학적 랜드마크를 사용해 캡을 정렬하세요. Fpz를 비전 위 중앙선에 위치시키고 좌우 반구 전반의 대칭성을 확인하세요.
    3. 각 전극 부위의 모발을 갈라놓고 전극-두피 접촉을 개선하기 위해 전도성 젤을 바릅니다.
    4. 면봉이나 둔기 준비 도구를 사용해 고임피던스 부위에서 두피를 부드럽게 준비하세요. 피부를 과도하게 긁지 마세요.
    5. 커패시터를 EEG 증폭기에 연결하고 임피던스 측정을 수행합니다. 모든 채널에서 전극 임피던스를 10 kΩ 이하로 낮춥니다. 이 시연 프로토콜에서는 가능하면 전면 및 중앙 전극에 대해 < 5 kΩ를 목표로 합니다.
    6. 샘플링 주파수를 500Hz로 설정하고, 증폭기 구성에 따라 온라인 기준을 설정하세요. 이 시연 프로토콜에서는 획득 시 연결된 유양돌기 참조를 사용하고, 전처리 중에는 공통 평균 재참조를 수행합니다.
    7. 증폭기 규격에 따라 접지 전극을 배치하세요. 이 시연 프로토콜에서는 접지를 AFz에 배치하세요. 자극 제시 전 최소 60초 이상 휴식 기초 기록하세요.
    8. 시각적 점검: 실험 시작 전에 실시간 EEG 기록을 점검하세요. 안정적인 기초 활동, 낮은 드리프트, 지속적인 포화 채널이나 주요 운동 인공의 부재를 확인하세요.
  3. EEG와 영상 스트림 동기화
    1. 자극 제시 컴퓨터를 트랜지스터-트랜지스터 논리(TTL) 트리거 케이블이나 트리거 박스를 사용하여 EEG 증폭기 트리거 입력에 연결합니다.
    2. 프레젠테이션 소프트웨어를 사용해 각 페인팅 클립의 시작 지점에 TTL 트리거 펄스를, 각 클립의 오프셋에 두 번째 TTL 트리거 펄스를 보내세요.
    3. 각 이벤트 유형에 고유한 트리거 코드를 할당하세요. 이 시연 프로토콜에서는 11–16을 clip onset, 21–26을 클립 오프셋에 사용합니다.
    4. 카메라 스트림과 EEG 스트림을 첫 번째 트리거 최소 5초 전부터 최종 트리거 후 최소 5초 동안 동시에 기록하세요. 자극 소프트웨어에 트리거 타임스탬프 테이블을 자동으로 기록하세요.
    5. EEG 기록의 트리거 타임스탬프와 프레젠테이션 로그의 비디오 프레임 인덱스를 대조하여 획득 후 동기화를 검증합니다. 시각적 체크포인트: EEG 트리거 타임스탬프와 비디오 프레임 타임스탬프 간의 평균 정렬 오차가 30프레임/초에서 ±33ms 이내인지 확인하세요.
      참고: 하드웨어 프레임 정확 동기화 인터페이스가 없을 경우, 두 시스템에서 타임스탬프 로그를 내보내고 트리거 온셋 매칭을 이용해 오프라인 정렬 보정을 수행하세요.
  4. 실험 데이터를 기록하세요
    1. 참가자가 머리를 크게 움직이거나 과도하게 깜빡이고, 말하기, 얼굴 접촉을 최소화하면서 자연스럽게 그림을 감상하도록 지시하세요.
    2. 미리 정의된 페인팅 클립을 선택한 순서대로 제시하세요. 시청 세션 내내 동기화된 EEG와 얼굴 영상을 지속적으로 기록하세요.
    3. 녹음 중 5채널 이상이 임피던스 임계값을 초과하면 실험을 일시정지하고 전극을 다시 점검하세요. 방해, 참가자 불편함, 기술적 문제는 세션 로그에 기록하세요.

4. EEG 전처리 및 특징 추출

  1. 원시 EEG 데이터 가져오기
    1. 원시 EEG 기록을 분석 환경에 가져오세요. 이 데모 프로토콜에서는 EEGLAB 2024.0과 함께 MATLAB R2023b 또는 MNE 1.6과 함께 Python 3.10을 사용하세요.
    2. 이벤트 마커를 가져오고 모든 자극 시작 및 오프셋 트리거가 모두 있는지 확인하세요.
  2. EEG 신호 다운샘플링
    1. 신호를 500Hz에서 200Hz로 다운샘플링한 후 그림 1에 표시된 워크플로우에 따라 전처리합니다.
    2. 소프트웨어 기본값이나 정의된 필터 설정에 따라 리샘플링 시 안티앨리어싱을 적용하세요.
  3. EEG 신호 필터링
    1. 0.5–45 Hz 대역을 대역통과 필터로 적용하고, 가시적인 라인 잡음이 남아 있다면 해당 전력 주파수에 노치 필터를 적용합니다. 이 시연 프로토콜에서는 50Hz 노치 필터를 적용합니다.
  4. 아티팩트 제거
    1. 연속 EEG를 수동으로 점검하고 심한 움직임 아티팩트가 있는 구간을 표시하세요.
    2. 필터링된 데이터에 대해 독립 성분 분석을 실행하세요. 두피 지도, 시간 경로, 파워 스펙트럼을 사용하여 눈 깜빡임, 수평 안구 운동, 턱 긴장, 근육 활동과 관련된 요소를 식별합니다.
    3. 확인된 인공물 부품을 제거하고 깨끗한 EEG 신호를 재구성하세요. 독립 성분 분석 보정 후에도 여전히 과도한 진폭 변동이 있는 구간은 제외합니다. 이 시연 프로토콜에서는 ±100 μV를 초과하는 구간을 제거합니다.
  5. 데이터 재참조
    1. 깨끗한 EEG 신호를 일반 평균 기준으로 다시 참조합니다.
  6. EEG 데이터 분할
    1. 자극 시작 요인에 따라 연속 EEG를 측정하세요. 전체 클립 또는 고정 분석 창을 포함하는 자극 정렬 구간을 추출합니다. 이 시연 프로토콜에서는 EEG를 2.0초 창으로 분할하고 50%가 겹치도록 합니다. 세그멘테이션 후 잔여 아티팩트가 있는 창은 제외하세요.
  7. 미분 엔트로피 특징 계산
    1. 각 EEG 구간을 다음 주파수 대역으로 분해합니다: 델타(1–4 Hz), 쎄타(4–8 Hz), 알파(8–13 Hz), 베타(13–30 Hz), 감마(30–45 Hz).
    2. 각 채널에 대해 각 주파수 대역의 미분 엔트로피를 계산합니다. 가우시안 변수에 대해 다음 식을 사용하라:
      DE = 1/2 ln(2πeσ2)이며, 여기서 σ2 는 대역 제한 EEG 신호의 분산입니다.
    3. 채널별 미분 엔트로피 값을 2차원 지형 행렬 또는 채널-특징 행렬로 배열하여 모델 입력을 수행합니다.
    4. 이 시연 프로토콜에서는 각 분석 창당 입력 크기가 128 × 128 x 5인 EEG 특징 지도를 생성합니다. 시각적 체크포인트: 각 밴드별로 대표적인 미분 엔트로피 맵을 그려 누락된 채널, 상수 값 맵, 또는 비정상적인 밴드 붕괴가 없음을 확인합니다.

5. 얼굴 비디오 전처리

  1. 이미지 프레임 추출
    1. 녹화된 비디오를 스크립트 파이프라인을 사용해 이미지 프레임으로 디코딩합니다. 모델 입력을 위해 25프레임/초로 프레임을 추출하면서 동기화 메타데이터를 보존합니다.
  2. 얼굴 감지 및 정렬
    1. 검증된 얼굴 감지기를 사용해 각 프레임의 얼굴을 감지합니다. 얼굴 랜드마크를 찾아 눈 중심이나 표준 랜드마크 앵커를 기준으로 얼굴을 정렬하세요. 면이 신뢰성 있게 인식되지 않는 버려지는 프레임.
  3. 얼굴 영역의 크롭 및 크기 조정
    1. 면을 검출된 경계 박스에 맞게 잘라내고 윤곽 정보를 유지하기 위해 약간의 여백을 두세요. 잘린 얼굴 이미지를 224 x 224 픽셀로 크기 조절하세요.
    2. 그림 2에 나타난 대로 네 가지 목표 감정 범주에서 대표적으로 잘린 얼굴 샘플을 검사하고, 자르기 후에도 이마, 눈썹, 눈, 코, 뺨, 입이 여전히 보이는지 확인한다.
  4. 훈련 이미지 보강
    1. 훈련 집합에만 0.5 확률로 무작위 수평 뒤집기를 적용하세요. 훈련 세트에만 ±15° 이내의 무작위 회전을 적용하세요.
    2. 검증이나 테스트 이미지에 증강을 적용하지 마십시오.
  5. 얼굴 입력을 정규화하기
    1. 픽셀 값을 [-1, 1] 범위로 정규화하거나, 모든 분할에서 일관되게 백본 특화 정규화 규칙을 사용하세요.

6. 다중 모달 신경망 구축

  1. 소프트웨어 및 하드웨어 환경 구성
    1. Python 3.10에서 PyTorch 2.1을 사용해 모델을 구현하세요. Ubuntu 22.04 또는 다른 지정된 운영체제에서 교육을 진행하세요.
    2. 최소 32GB RAM, 최소 12GB 비디오 메모리를 갖춘 그래픽 처리 장치 1개, 그리고 동기화된 EEG 비디오 데이터를 위한 충분한 로컬 저장 공간을 갖춘 워크스테이션을 사용하세요. 이 시연 프로토콜에서는 NVIDIA RTX 3080 그래픽 처리 장치를 사용하세요.
    3. 학습 스크립트, 모델 정의 파일, 전처리 스크립트, 구성 파일을 버전 관리 프로젝트 디렉터리에 저장합니다.
    4. 공유가 허용된다면 원고에 코드 저장소나 보관된 스크립트 패키지를 보고하세요.
  2. 얼굴 지기 건설
    1. 그림 3에 나타난 것처럼 전체 이중 분기 다중 모달 프레임워크를 구성합니다. 얼굴 분기용 MobileNetV2 백본을 초기화하세요.
    2. 첫 번째 컨볼루션 층을 32채널에서 24채널로 수정합니다. 그림 4 에 따라 얼굴 특징 추출 분기를 구축하고, 선택된 역잔차 블록 뒤에 좌표 주의 모듈을 삽입하세요. 그림 5에 나타난 것처럼요.
    3. 지정된 표준 컨볼루션을 3 x 3 및 5 x 5 커널 크기의 깊이별 병렬 컨볼루션으로 대체하여 다중 스케일 특징 추출을 개선합니다.
    4. 융합을 위한 고정 차원 얼굴 특징 벡터를 내보내세요. 이 시연 프로토콜에서는 특징 차원 256을 사용하세요.
  3. EEG 지부 구축
    1. 입력하면 차분 엔트로피 특징이 합성곱 신경망 인코더에 매핑됩니다. 합성곱 계층을 사용해 EEG 특징 지도에서 공간 패턴을 추출하세요.
    2. 합성곱 출력 시퀀스를 양방향 장기 단기 기억 모듈에 입력하여 창 간 시간 의존성을 포착합니다.
    3. 고정 차원 EEG 특징 벡터를 내보내세요. 이 시연 프로토콜에서는 특징 차원 256을 사용하세요.
  4. 교차 모달 융합 모듈 구축
    1. 그림 6에 보이는 다중 모달 특징 상호작용 모듈을 구현합니다. 8개의 머리가 있는 다중 머리 교차 주의 블록을 구현하세요.
    2. EEG 특징 시퀀스를 쿼리로, 얼굴 특징 시퀀스를 키와 값으로 한 번의 교차 주의 흐름으로 사용하세요.
    3. 얼굴 특징 시퀀스를 쿼리로, EEG 피처 시퀀스를 상호 교차 주의 흐름의 키이자 값으로 사용하세요.
    4. 두 개의 교차 주의 스트림에서 나오는 출력을 연결합니다. 연결된 특징을 융합 투영 층을 통과시킵니다.
  5. 자기 잔류 확장 합성곱 모듈 추가
    1. 그림 7에 나타난 자기 잔류 확장 합성곱 연결 계층으로 융합 표현을 정제합니다.
    2. 1, 3, 6, 12의 지연률을 사용하여 확장된 합성곱 연결 층을 구성합니다. 네 개의 확장 분기에서 출력을 연결하세요.
    3. 잔류 스킵 연결을 추가하여 경사 흐름을 안정화하고 하위 정보를 보존하세요.
  6. 분류기 추가
    1. 융합된 표현을 평평하게 하거나 풀어보세요. 완전 연결된 레이어 하나와 마지막으로 소프트맥스 출력 레이어를 추가하세요. 출력 클래스를 두려움, 행복, 차분함, 슬픔으로 설정하세요.
  7. 훈련 설정 정의
    1. 표 1에 요약된 네트워크 및 교육 설정을 활용하세요. 네 가지 감정 분류(두려움, 행복, 평온, 슬픔)는 자극 설계와 참가자 자기보고를 기반으로 한 통합 라벨링 절차를 사용하여 조작적으로 정의되었습니다. 각 회화 클립은 목표 감정 범주를 유도하도록 미리 선택되었고, 참가자들은 관람 후 자신의 지배적인 감정 경험을 보고했습니다. 최종 라벨은 의도한 자극 범주와 자기보고된 반응을 일치시켜 부여했으며, 라벨링 신뢰성을 보장하기 위해 일관성 없는 표본은 제외하였습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

제안된 이중 분기 교차 주의 네트워크의 성능은 그림 감상 중 327명의 참가자로부터 수집한 다중 모달 데이터셋을 사용하여 평가되었습니다. 주요 결과는 두려움, 행복, 평온, 슬픔에 대한 4단계 감정 분류 수행이었습니다. 추가 분석에서는 단모달 모델 행동, 다중 모달 수렴, 주의 머리 수에 대한 민감도, 비교 인식 성능, 안면 및 뇌파 하위 네트워크의 거동을 조사했습니다. 이 연구에는 별도의 대조군이 포함되지 않았는데, 이는 동일한 데이터셋 내에서 단일 모달 및 다중 모달 구성의 상대적 성능을 평가하는 것이었기 때문이며, 비노출 또는 기초 집단과의 비교가 아니었습니다. 또한, 참여자 표본이 비교적 동질적인 문화적 배경을 가지고 있었고, 실험 설계는 감정 표현의 문화 간 차이를 조사하는 데 목적이 없었기 때문에 문화 표현 자체를 독립적인 요인으로 분석하지 않았습니다. 이러한 설계 선택 덕분에 연구는 통제된 조건 하에서 다중 모달 프레임워크의 방법론적 검증에 집중할 수 있었...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

이 프로토콜은 감정 컴퓨팅의 실용적인 문제를 다루는데, 즉 그림 감상 환경에서 시각적 표현과 생리적 반응이 매 순간 완전히 일치하지 않는 감정 상태를 어떻게 인식할 수 있는지에 관한 것입니다. 여기서 보고된 실험 조건 하에서 이중 분기 프레임워크는 단모달 비교 모델보다 더 높은 분류 성능을 달성했으며, 이는 전시와 유사한 환경에서 뇌파와 얼굴 발현 정보를 결합하는 가치를 뒷받침합니다. 연구 결과는 다중 모달 통합이 특히 미묘하거나 사회적으로 조절된 얼굴 변화에서 유용함을 시사합니다. 생리적 신호가 외적 행동에 완전히 반영되지 않는 추가 정보를 제공할 수 있기 때문입니다. 이 점에서 이 방법은 다중 모달 감정 인식뿐만 아니라 경험적 미학 연구와 전시 지향적 인간-컴퓨터 상호작용 연구에도 유용할 수 있습니다. 동시에 본 결과는 보고된 데이터셋, 기록 설정, 라벨 정의 절차18의 범위 내에서 해석되어야 합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

저자들은 이해 상충이 없음을 선언합니다.

감사의 글

싱이 민주사범대학교와 서남대학교 자원봉사자분들께 진심으로 감사드립니다. 또한 EEG 데이터 수집에 도움을 준 지로나 대학교 기술진과 통찰력 있는 의견을 남겨준 익명 심사위원들께도 감사드립니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
딥러닝 프레임워크파이토치v2.0 / https://pytorch.org모델 구축, 교육 및 평가에 사용됩니다
EEG 획득 시스템 (64채널)브레인 프로덕츠 GmbH액티챔프 플러스 / v1.6실험 중 고해상도 뇌파 신호 획득에 사용됨
EEG 전극 캡 (10– 20 시스템)브레인 프로덕츠 GmbH액티캡 / 64채널표준 국제 10– 20 전극 배치
고화질 카메라소니 코퍼레이션IMX327 센서표정 영상 녹화에 사용됨 (≥ 1080p, 30fps)

참고문헌

  1. Yang, Y., et al. A dual-stream regional feature learning and adaptive fusion method for electroencephalogram-based emotion recognition. Eng Appl Artificial Intell. 164, 113250(2026).
  2. Li, C., Pun, S. H., Li, J. W., Chen, F. Eeg-based emotion recognition using graph attention network with dual-branch attention module. 2024 46th Ann Int Conf IEEE Eng Me Biol Soc (EMBC), , 1-4 (2024).
  3. Ubillús, J. A. T., et al. Algorithms used for facial emotion recognition: A systematic review of the literature. EAI Endorsed Transact Pervasive Health Technol. 9, 1-17 (2023).
  4. Xu, Y., Cheng, L. Face emotion recognition based on gabor wavelet and particle swarm optimization algorithm. Multimed Syst. 31 (6), 435(2025).
  5. Dube, D. Y., Sannasi, M. V., Kyritsis, M., Gulliver, S. R. Facial emotion recognition from feature loss media: Human versus machine learning algorithms. Comp Human Behav. 174, 108806(2026).
  6. Manuel, M. T. J., Medina-DeVilliers, S., Clarkson, T., Lerner, M. D., Riccardi, G. Evaluation of interpretability for deep learning algorithms in EEG emotion recognition: A case study in autism. Artif Intell Med. 143, 102545(2023).
  7. Watanabe, A., Yamazaki, T. Representation of the brain network by electroencephalograms during facial expressions. J Neurosci Meth. 357, 109158(2021).
  8. Prakash, A., Poulose, A. Electroencephalogram-based emotion recognition: A comparative analysis of supervised machine learning algorithms. Data Sci Manag. 8 (3), 342-360 (2025).
  9. Sun, Y., Ayaz, H., Akansu, A. N. Multimodal affective state assessment using fnirs + eeg and spontaneous facial expression. Brain Sci. 10 (2), 85(2020).
  10. Huang, Y., Yang, J., Liu, S., Pan, J. Combining facial expressions and electroencephalography to enhance emotion recognition. Future Internet. 11 (5), 105(2019).
  11. Han, Q., et al. A multi-branch electroencephalogram emotion recognition framework based on cross-subject or cross-session multi-perspective representation fusion. Neurocomputing. 658, 131767(2025).
  12. Wang, L., Chang, Y., Wang, K. Dual-branch multimodal fusion network for driver facial emotion recognition. Appl Sci. 14 (20), 9430(2024).
  13. Mutawa, A. M., Hassouneh, A. Multimodal real-time patient emotion recognition system using facial expressions and brain EEG signals based on machine learning and log-sync methods. Biomed Signal Proc Contr. 91, 105942(2024).
  14. Qi, Y., Ibrayim, M., Hamdulla, A. Attention-based dual-branch network for micro-expression recognition with global-local feature fusion. 2024 IEEE Int Joint Conf Biometr (IJCB), , 1-9 (2024).
  15. Li, E. Intervention of art education on college students’ aesthetic mood based on emotion recognition algorithm. Front Art Res. 6 (9), 81-90 (2024).
  16. Liu, Z., Han, M., Wu, B., Rehman, A. Speech emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multi-task learning. Appl Acoustics. 202, 109178(2023).
  17. Xue, P., Wang, S., Bai, J., Qiang, Y. Research on bimodal emotion recognition algorithm based on multi-branch bidirectional multi-scale time perception. J Biome Eng. 42 (3), 528-536 (2025).
  18. Shioiri, S., Nagata, H., Sato, Y., Hatori, Y. Prediction of preference judgments of face images using facial expressions and eeg signals. J Vis. (9), 5063(2023).
  19. Lu, Y., Chen, J. Cross-subject EEG emotion recognition using the SSA-EMS algorithm for feature extraction. Entropy. 27 (9), 986(2025).
  20. Thapa, D., Rai, R. Freq-eer: A novel frequency-driven ensemble framework for emotion recognition and classification of eeg signals. Appl Sci. 15 (19), 10671(2025).
  21. Yang, Y., et al. Investigating of deaf emotion cognition pattern by eeg and facial expression combination. IEEE J Biomed Health Inform. 26 (2), 589-599 (2022).
  22. Tong, L., Yang, L., Wang, X., Liu, L. Self-aware face emotion accelerated recognition algorithm: A novel neural network acceleration algorithm of emotion recognition for international students. PeerJ Comput Sci. 9, e1611(2023).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

태그

EEG 감정 인식얼굴 표정 분석차분 엔트로피합성곱 신경망양방향 LSTM감성 컴퓨팅인간-컴퓨터 상호작용