이 프로토콜은 회화 관람 환경에서 뇌파 및 얼굴 데이터의 동기화 획득과 다중 모달 감정 인식을 위한 이중 분기 교차 주의 네트워크를 설명합니다. 여기에는 전처리, 특징 융합, 네 가지 감정 상태의 분류가 포함됩니다.
이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.
이 프로토콜은 회화 관람 환경에서 뇌파 및 얼굴 데이터의 동기화 획득과 다중 모달 감정 인식을 위한 이중 분기 교차 주의 네트워크를 설명합니다. 여기에는 전처리, 특징 융합, 네 가지 감정 상태의 분류가 포함됩니다.
회화 감상 중 감정 인식은 여전히 어렵다. 왜냐하면 미적 반응은 역동적이고 맥락에 따라 다르며, 외적 행동을 통해서만 부분적으로 관찰되기 때문이다. 따라서 얼굴 표정이나 생리학적 신호만을 기반으로 한 단모달 접근법은 종종 관람자의 경험을 불완전하게 표현할 수 있습니다. 이 글은 회화 전시 맥락에서 다중 모달 감정 인식을 위해 얼굴 비디오와 뇌파(EEG) 데이터를 통합한 이중 분기 교차 주의 네트워크를 구축하는 재현 가능한 방법을 설명합니다. 프로토콜은 64채널 EEG 시스템과 고해상도 카메라를 이용한 동기화된 획득 환경을 구축하여 도화 감상 중 동시에 기록하는 것으로 시작합니다. 이후 절차에서는 EEG 필터링, 분할, 차등 엔트로피 추출과 함께 얼굴 감지, 정렬, 영상 분석을 위한 프레임 준비를 포함한 신호 전처리가 상세히 진행됩니다. 신경망은 두 가지 모달리티에 특화된 가지를 포함합니다. EEG 분기는 합성곱 신경망과 양방향 장기 단기 기억 네트워크를 사용하여 시공간-시간적 신경 특징을 모델링하는 반면, 얼굴 분기는 시각 표현 특징을 추출하기 위해 조정된 주의력 강화 경량 합성곱 네트워크를 사용합니다. 다중 헤드 교차 주의 모듈을 사용하여 두 흐름을 융합하여 인터모달 관련성을 학습합니다. 여기서 보고된 실험 조건 하에서, 다중 모달 프레임워크는 4범주 감정 인식에서 단일 모달 비교 모델보다 더 높은 분류 정확도를 달성했습니다. 이 방법은 통제된 획득 환경에서 오프라인 분석에 가장 적합하며, 정서 컴퓨팅, 경험적 미학, 전시 지향적 인간-컴퓨터 상호작용 연구를 위한 실용적 틀을 제공합니다.
감정은 외부 자극, 내부 평가, 지속적인 인지 조절에 의해 형성되는 다차원적 심리적·생리학적 과정으로, 따라서 인간-컴퓨터 상호작용과 인지과학에서 중심적인 위치를 차지합니다. 회화 전시 환경에서는 감정이 시각 예술과 관람자 해석 간의 관계를 매개하기도 합니다. 이러한 이유로, 관람자의 감정 상태를 식별하는 것은 전시 평가, 공간 디자인, 미적 경험의 실증적 연구에 실질적인 가치를 가집니다. 동시에, 반자연적 전시 환경에서의 감정 측정은 미묘하고 일시적이며 작품과 관람 맥락 모두에 영향을 받기 때문에 기술적으로 여전히 어렵다.
감정 인식 연구는 일반적으로 행동 분석과 생리학적 분석이라는 두 가지 주요 방향을 따라 발전해 왔습니다. 특히 컴퓨터 비전을 기반으로 한 얼굴 표정 분석과 같은 행동 접근법은 비침습적이고 비교적 쉽게 배포할 수 있기 때문에 널리사용됩니다. 잔류 네트워크와 경량 합성곱 네트워크와 같은 딥러닝 모델은 기본 얼굴 감정분류 작업에서 강한 성능을 보였습니다. 4. 그러나 회화 감상 중 얼굴 행동은 약하거나 사회적으로 절제되거나 의도적으로 억제될 수 있어 가시적 표정과 주관적 감정 간의 대응을 감소시킬 수 있습니다. 특히 뇌파검사(EEG)를 기반으로 한 생리학적 접근법은 정서 처리와 관련된 신경 활동에 보다 직접적으로 접근할 수 있게 합니다6. EEG는 신경 신호의 시간적 변동이 정서 상태 변화, 특히 가치 및 각성 관련 차원을 알려주기 때문에 감정 연구에 널리 사용되고 있습니다. 그럼에도 불구하고 EEG 기록은 운동 아티팩트, 근전도 오염, 환경 소음에 민감하며, EEG만으로는 시청자가 시각적으로 반응하는 내용에 대한 제한된 맥락 정보를 제공하는 경우가많습니다.
이러한 상호 보완적인 강점과 약점은 다중 모달 감정 인식에 대한 관심을 증가시켰습니다. 다중 모달 퓨전의 중심 전제는 이질적 신호가 상호 정보 제공을 제공하고 단일 모달리티를 고립적으로 해석할 때 발생하는 모호함을 줄일 수 있다는 것이다10. 예를 들어 회화 관찰 과제에서는 억제된 얼굴 행동이 주의력이나 정서적 참여와 관련된 측정 가능한 신경 변화와 일치할 수 있습니다. 하지만 기존의 멀티모달 시스템은 항상 이 관계를 효과적으로 모델링하지는 못합니다. 직접적인 특징 연결에 기반한 초기 융합 전략은 차원 부담을 증가시키고 양식에 따른 시간 구조를 흐릴 수 있습니다11. 별도의 결정에 기반한 후기 융합 전략은 실행하기 더 쉽지만,감정 처리 중 시각 신호와 생리적 신호 간의 세밀한 상호작용을 간과할 수 있습니다. 또한 많은 멀티모달 모델은 고정 또는 약하게 적응하는 융합 방식을 사용하는데, 이는 전시와 유사한 환경에서 관객 반응의 변동에 적합하지 않습니다13.
이러한 한계를 해결하기 위해 본 프로토콜은 회화 감상 중 다중 모달 감정 인식을 위한 이중 분기 교차 주의 네트워크를 설명합니다. 이 프레임워크에서 EEG 특징은 합성 신경망-양방향 장기 단기 기억 모델(CNN-BiLSTM)으로 처리되며, 이는 시공간 신경 역학을 표현하는 데 사용됩니다. 얼굴 영상 특징은 정렬 주의 강화 MobileNetV2 분기로 처리되며, 이는 저강도 표정 신호를 캡처하면서 계산 효율성을 유지합니다14. 두 가지는 단순히 출력을 연결하는 대신 양상 간 관련성을 학습하는 다중 헤드 교차 주의 메커니즘을 통해 통합된다15,16. 이 설계는 모달리티별 구조를 유지하면서 교차 모달 상호작용 모델링을 개선하기 위해 설계되었습니다.
이 방법은 주로 통제된 데이터 수집 조건 하에서 오프라인 분석을 위해 설계되었으며, 공개 전시 공간에서의 직접 실시간 배포보다는 목적이 아닙니다. 신뢰성 있는 구현을 위해서는 동기화된 EEG 및 비디오 캡처, 안정적인 조명, 제어된 카메라 위치, 허용 가능한 전극 임피던스, 그리고 모델 학습을 위한 충분한 컴퓨팅 자원이 필요합니다. 수행은 샘플 구성, 자극 유형, 그리고 참가자들이 자신이 기록되고 있음을 알고 행동을 얼마나 변화시키는지에 따라 달라질 수 있습니다. 이러한 운영 제약 사항은 프로토콜을 다른 전시 환경이나 집단에 맞게 조정할 때 고려해야 합니다.
여기서 제시된 프로토콜은 327명의 참가자로부터 동기화된 수집, EEG 및 얼굴 영상 데이터의 전처리, 특징 추출, 교차 모달 융합, 분류 등 전체 실험 파이프라인을 포함합니다. 목표는 회화 전시 연구에서 다중 모달 감정 인식을 위한 재현 가능한 워크플로우를 제공하는 것입니다. 정서 컴퓨팅 외에도, 이 프로토콜은 경험적 미학 및 관련 심리학 연구에서 정량적 연구를 지원할 수도 있습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
연구 프로토콜은 싱이민주사범대학교 인간연구보호윤리위원회(승인번호 2600AL0621)에서 검토 및 승인되었습니다. 연구 포함 전과 데이터 수집 전에 모든 참가자로부터 서면 동의를 받았습니다.
1. 참가자 모집 및 윤리적 준수
2. 실험 환경 및 자극 설정
3. 다중 모달 데이터 수집
4. EEG 전처리 및 특징 추출
5. 얼굴 비디오 전처리
6. 다중 모달 신경망 구축
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
제안된 이중 분기 교차 주의 네트워크의 성능은 그림 감상 중 327명의 참가자로부터 수집한 다중 모달 데이터셋을 사용하여 평가되었습니다. 주요 결과는 두려움, 행복, 평온, 슬픔에 대한 4단계 감정 분류 수행이었습니다. 추가 분석에서는 단모달 모델 행동, 다중 모달 수렴, 주의 머리 수에 대한 민감도, 비교 인식 성능, 안면 및 뇌파 하위 네트워크의 거동을 조사했습니다. 이 연구에는 별도의 대조군이 포함되지 않았는데, 이는 동일한 데이터셋 내에서 단일 모달 및 다중 모달 구성의 상대적 성능을 평가하는 것이었기 때문이며, 비노출 또는 기초 집단과의 비교가 아니었습니다. 또한, 참여자 표본이 비교적 동질적인 문화적 배경을 가지고 있었고, 실험 설계는 감정 표현의 문화 간 차이를 조사하는 데 목적이 없었기 때문에 문화 표현 자체를 독립적인 요인으로 분석하지 않았습니다. 이러한 설계 선택 덕분에 연구는 통제된 조건 하에서 다중 모달 프레임워크의 방법론적 검증에 집중할 수 있었...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 프로토콜은 감정 컴퓨팅의 실용적인 문제를 다루는데, 즉 그림 감상 환경에서 시각적 표현과 생리적 반응이 매 순간 완전히 일치하지 않는 감정 상태를 어떻게 인식할 수 있는지에 관한 것입니다. 여기서 보고된 실험 조건 하에서 이중 분기 프레임워크는 단모달 비교 모델보다 더 높은 분류 성능을 달성했으며, 이는 전시와 유사한 환경에서 뇌파와 얼굴 발현 정보를 결합하는 가치를 뒷받침합니다. 연구 결과는 다중 모달 통합이 특히 미묘하거나 사회적으로 조절된 얼굴 변화에서 유용함을 시사합니다. 생리적 신호가 외적 행동에 완전히 반영되지 않는 추가 정보를 제공할 수 있기 때문입니다. 이 점에서 이 방법은 다중 모달 감정 인식뿐만 아니라 경험적 미학 연구와 전시 지향적 인간-컴퓨터 상호작용 연구에도 유용할 수 있습니다. 동시에 본 결과는 보고된 데이터셋, 기록 설정, 라벨 정의 절차18의 범위 내에서 해석되어야 합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이해 상충이 없음을 선언합니다.
싱이 민주사범대학교와 서남대학교 자원봉사자분들께 진심으로 감사드립니다. 또한 EEG 데이터 수집에 도움을 준 지로나 대학교 기술진과 통찰력 있는 의견을 남겨준 익명 심사위원들께도 감사드립니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 딥러닝 프레임워크 | 파이토치 | v2.0 / https://pytorch.org | 모델 구축, 교육 및 평가에 사용됩니다 |
| EEG 획득 시스템 (64채널) | 브레인 프로덕츠 GmbH | 액티챔프 플러스 / v1.6 | 실험 중 고해상도 뇌파 신호 획득에 사용됨 |
| EEG 전극 캡 (10– 20 시스템) | 브레인 프로덕츠 GmbH | 액티캡 / 64채널 | 표준 국제 10– 20 전극 배치 |
| 고화질 카메라 | 소니 코퍼레이션 | IMX327 센서 | 표정 영상 녹화에 사용됨 (≥ 1080p, 30fps) |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.