Bu içeriği görüntülemek için JoVE aboneliğiniz gereklidir. Giriş yapın veya ücretsiz denemenizi bugün başlatın.

Yöntem makalesi

Elektroensefalografi ve Yüz Multimodal Duygu Tanıma için Çift Dal Çapraz Dikkat Ağı Resim Görüntüleme Sırasında

109 görüntülenme

⸱

DOI:

10.3791/70600

⸱

12 Mayıs 2026

Bu makalede

Özet

Bu protokol, resim izleme ortamlarında elektroensefalografi ve yüz verilerinin senkronize edinimini ve çoklu modal duygu tanıma için çift dal çapraz dikkat ağını tanımı tanıma işlem, özellik birleşimi ve dört duygusal durumun sınıflandırılmasını tanımlar.

Özet

Resim izlerken duygu tanıma zordur çünkü estetik tepkiler dinamik, bağlama bağlı ve dışa dönük davranışlarla yalnızca kısmen gözlemlenebilir. Yalnızca yüz ifadelerine veya sadece fizyolojik sinyallere dayanan tek modlu yaklaşımlar, genellikle izleyicinin deneyiminin eksik temsillerini sunar. Bu makale, bir resim sergisi bağlamında çoklu modal duygu tanıma için yüz videosunu elektroensefalografi (EEG) verileriyle entegre eden çift dallı çapraz dikkat ağı oluşturmak için tekrarlanabilir bir yöntemi tanımlar. Protokol, 64 kanallı EEG sistemi ve yüksek çözünürlüklü bir kamera kullanılarak senkronize bir alım ortamının oluşturulmasıyla başlar; bu da resim izleme sırasında eşzamanlı kayıt için kullanılır. Sonraki prosedür, sinyal ön işleme (EEG filtreleme, segmentasyon ve diferansiyel entropi özelliklerinin çıkarılması) ile yüz algılama, hizalama ve video analizi için çerçeve hazırlama gibi detayları içerir. Sinir ağı, iki modalite-spesifik dal içerir. EEG dalı, mekansal-zaman sinirsel özellikleri modellemek için konvolüsyon sinir ağı ve iki yönlü uzun kısa süreli bellek ağı kullanırken, yüz dalı görsel ifade özelliklerini çıkarmak için koordinatle güçlendirilmiş hafif konvolüsyon ağ kullanır. Daha sonra, iki akını birleştirmek için çok başlı çapraz dikkat modülü kullanılır; intermodal alaka öğrenilir. Burada bildirilen deneysel koşullarda, multimodal çerçeve, dört kategorili duygu tanımadaki tek modlu karşılaştırma modellerinden daha yüksek sınıflandırma doğruluğu sağlamıştır. Bu yöntem, kontrollü edinim ortamlarında çevrimdışı analiz için en uygundur ve duygusal hesaplama, ampirik estetik ve sergi odaklı insan-bilgisayar etkileşim araştırmaları için pratik bir çerçeve sağlar.

Giriş

Duygu, dış uyarıcılar, iç değerlendirme ve sürekli bilişsel düzenleme tarafından şekillendirilen çok boyutlu psikolojik ve fizyolojik bir süreçtir ve bu nedenle insan-bilgisayar etkileşimi ve bilişsel bilimde merkezi bir konuma sahiptir. Resim sergi ortamlarında duygu, görsel sanat eserleri ile izleyici yorumu arasındaki ilişkiyi de aracılık eder. Bu nedenle, izleyicinin duygusal durumlarının tanımlanması, sergi değerlendirmesi, mekânsal tasarım ve estetik deneyimin ampirik çalışmaları için pratikdeğere sahiptir 2. Aynı zamanda, yarı doğal sergi ortamlarında duygu ölçümü teknik olarak zor olmaya devam ediyor çünkü tepkiler ince, geçici ve hem sanat eserinden hem de izleme bağlamından etkileniyor.

Duygu tanıma araştırmaları genellikle iki ana çizgide gelişmiştir: davranışsal analiz ve fizyolojik analiz. Davranışsal yaklaşımlar, özellikle bilgisayar görüşüne dayalı yüz ifadesi analizi, yaygın olarak kullanılır çünkü invaziv değildir ve nispeten kolaykullanılır 3. Kalıcı ağlar ve hafif konvolüsyon ağlar gibi derin öğrenme modelleri, temel yüz duyguları sınıflandırma görevlerinde güçlü performansgöstermiştir 4. Ancak, resim izleme sırasında yüz davranışı zayıf, sosyal olarak denetlenmiş veya kasıtlı olarak ölçülü olabilir; bu da görünür ifade ile öznel his arasındaki uyumuazaltabilir. Fizyolojik yaklaşımlar, özellikle elektroensefalografiye (EEG) dayalı olanlar, affektif işlemle ilişkili sinirsel aktiviteye daha doğrudan erişim sağlar6. EEG, sinirsel sinyallerdeki zamansal dalgalanmalar, değerlik ve uyarılma ile ilgili boyutlar dahil olmak üzere duygusal durum değişiklikleri için bilgilendirici olduğu için duygusal çalışmalarda yaygın olarakkullanılmaktadır 7. Buna rağmen, EEG kayıtları hareket artefaktlarına, elektromiyografik kirlenmeye ve çevresel gürültüye karşı hassastır ve EEG tek başına genellikle izleyicinin görsel olarak neye tepki verdiği hakkında sınırlı bağlamsalbilgi sağlar 8.

Bu tamamlayıcı güçlü ve zayıf yönler, çoklu modal duygu tanımaya olan ilgiyiartırmıştır 9. Multimodal füzyonun temel varsayımı, heterojen sinyallerin karşılıklı bilgilendirici kanıtlar sağlayabileceği ve tek bir modalitenin izole şekilde yorumlandığında ortaya çıkan belirsizliği azaltabileceğidir10. Örneğin, resim izleme görevlerinde, ölçülü yüz davranışı dikkat veya duygusal etkileşimle ilişkili ölçülebilir sinirsel değişikliklerle çakışabilir. Ancak, mevcut çok modal sistemler bu ilişkiyi her zaman etkili şekilde modellememektedir. Doğrudan özellik birleştirmesine dayalı erken füzyon stratejileri, boyutsal yükü artırabilir ve modalite-spesifik zaman yapısınıbulanıklaştırabilir 11. Ayrı kararlara dayanan geç füzyon stratejileri uygulanması daha kolaydır, ancak duygusal işleme sırasında görsel ve fizyolojik sinyaller arasındaki ince taneli etkileşimleri göz ardıedebilirler 12. Ayrıca, birçok multimodal model, sergi benzeri ortamlarda izleyici tepkilerinin değişkenliğine uygun olmayan sabit veya zayıf adaptif füzyon şemalarıkullanır 13.

Bu sınırlamaları gidermek için, mevcut protokol, resim izleme sırasında çoklu modal duygu tanıma için çift dallı çapraz dikkatler ağı tanımlamaktadır. Bu çerçevede, EEG özellikleri, mekansal-zamansal sinir dinamiklerini temsil etmek için kullanılan konvolüsyon sinir ağı-iki yönlü uzun kısa vadeli bellek modeli (CNN-BiLSTM) tarafından işlenir. Yüz video özellikleri, düşük yoğunluklu ifade ipuçlarını yakalamak için kullanılan koordinatle güçlendirilmiş MobileNetV2 dalı tarafından işlenir; bu dalı düşük yoğunluklu ifade ipuçlarını yakalayarak hesaplamaverimliliğini 14 korur. İki dal, modaliteler arasında sadece çıktılarını birleştirmek yerine alanları öğrenen çoklu başlı çapraz dikkat mekanizmasıyla entegreedilir 15,16. Bu tasarım, modalite-spesifik yapıyı korumayı ve modlar arası etkileşim modellemesini geliştirmeyi amaçlamaktadır.

Bu yöntem, açık halka açık sergi alanlarında doğrudan gerçek zamanlı dağıtım için değil, öncelikle kontrollü veri toplama koşullarında çevrimdışı analiz için tasarlanmıştır. Güvenilir uygulama için senkronize EEG ve video yakalama, kararlı aydınlatma, kontrollü kamera yerleşimi, kabul edilebilir elektrot empedansı ve model eğitimi için yeterli hesaplama kaynakları gereklidir. Performans ayrıca örnek bileşimine, uyarıcı türüne ve katılımcıların kaydedildiklerini bildikleri için davranışlarını ne ölçüde değiştirdiklerine de bağlı olabilir. Bu operasyonel kısıtlamalar, protokolü diğer sergi ortamlarına veya popülasyonlara uyarlarken dikkate alınmalıdır.

Burada sunulan protokol, 327 katılımcıdan senkronize alım, EEG ve yüz video verilerinin ön işlemesi, özellik çıkarma, çapraz modal füzyon ve sınıflandırma dahil olmak üzere tüm deneysel boru hattını kapsar. Amaç, resim sergisi araştırmalarında çoklu modal duygu tanıma için tekrarlanabilir bir iş akışı sağlamaktır. Duygusal hesaplamanınötesinde, protokol ampirik estetik ve ilgili psikolojik çalışmalarda nicel araştırmayı da destekleyebilir18.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Çalışma protokolü, Xingyi Minzu Normal Üniversitesi İnsan Araştırmaları Koruma Etik Komitesi tarafından incelenip onaylandı (Onay No. 2600AL0621). Tüm katılımcılardan çalışmaya dahil edilmeden ve veri toplamadan önce yazılı bilgilendirilmiş onay alındı.

1. Katılımcı kazanımı ve etik uyum

  1. Etik onay almak
    1. Çalışmaya başlamadan önce tam deneysel protokol, onay formu, katılımcı bilgi formu ve veri koruma planını kurumsal inceleme kuruluna (IRB) veya etik komiteye sunun.
    2. Yazılı onay alın ve onay numarasını çalışma dokümantasyonuna kaydedin.
  2. Katılımcıların Kazanımı
    1. Resim izleme sırasında çoklu modal duygu kazanımı için sağlıklı yetişkin katılımcıları işe alın. Bu gösterim protokolünde, 327 katılımcı alın.
    2. Aşağıdaki dahil etme kriterlerini uygulayın: 18–35 yaş arası, normal veya düzeltilmiş görme, nörolojik bozuklukların kendi bildirimi olmaması, mevcut psikoaktif ilaç kullanımı olmaması ve elektroensefalografi (EEG) kaydı ile yüz video kaydına isteklilik.
    3. Aşağıdaki dışlama kriterlerini uygulayın: aşırı saç derisi yaralanması veya elektrot yerleştirilmesini engelleyen dermatolojik durumlar, tam kayıt seansının tamamlanamaması, alım sırasında ciddi hareket veya eksik onay belgeleri.
    4. Katılımcı özelliklerini, yaş, cinsiyet, el kullanımı deneyimi, önceki sanat izleme deneyimi ve eğitim seviyesi dahil olmak üzere kaydet. Bu gösterim protokolünde aşağıdaki örnek KISA UZUN ÖZET kaydedin: ortalama yaş 24,8 ± 3,7 yıl, 165 kadın ve 162 erkek, katılımcıların hepsi sağ elini kullanmıştır.
    5. İşe alımdan önce operasyonel olarak demografik dengeyi tanımlayın. Bu gösteri protokolünde, bu terimi yaklaşık olarak dengeli bir cinsiyet dağılımını ve erken yetişkinlikte yoğunlaşmış bir yaş aralığını belirtmek için kullanın; böylece EEG ve yüz ifadesi yanıtlarındaki yaşa bağlı varyantları azaltabilirsiniz.
  3. Bilgilendirilmiş rıza almak
    1. Her katılımcıya, EEG kaydı, yüz görüntü kaydı, senkronizasyon prosedürleri, anonimleştirme, veri depolama ve ceza olmaksızın istediği zaman çekilme hakkını içeren yazılı bilgilendirilmiş onay formu verin.
    2. Yüz görüntülerinin özellik çıkarımı için kullanılacağını ve katılımcı kimliğini korumak için tüm el yazması figürlerinde göz bölgelerinin maskelendirileceğini açıklayın.
    3. Herhangi bir deneysel prosedür başlamadan önce yazılı bilgilendirilmiş onay alın.
  4. Tanımlayıcıların atanması ve verilerin anonimleştirilmesi
    1. Her katılımcıya benzersiz bir sayısal çalışma kimliği atayın. EEG dosyalarını, video dosyalarını ve meta verileri yalnızca çalışma kimliği kullanarak depolayın.
    2. Tanımlanabilir onay formlarını fizyolojik ve görüntü verilerinden ayrı olarak saklayın. Yerel etik politikası gerektirdiğinde, iç analiz depolama için kimliği belirsiz yüz çerçeveleri veya yüz işaretinden türetilen çıktılar kullanın.

2. Deneysel ortam ve uyarıcı kurulum

  1. İzleme ortamının hazırlanması
    1. Kontrollü bir resim sergi ortamını simüle etmek için sessiz bir kapalı oda hazırlayın. Ortam sıcaklığını 22–24 °C ve göreli nemi %45–%60 arasında tutun. Mümkün olduğunda 40 dB'nin altında arka plan gürültüsünü kontrol edin.
    2. Katılımcıyı sırt desteğiyle dik bir sandalyeye oturtun ve sandalyeyi katılımcı ile ekran arasındaki görüş mesafesi 2,0 m olacak şekilde konumlandırın.
    3. Katılımcıya, uyarı sunumu sırasında kayıt alanında yalnız oturmasını söyle. Veri edinim sırasında diğer katılımcıların veya gözlemcilerin doğrudan görüş alanında olmasına izin vermeyin.
  2. Aydınlatma konfigürasyonu
    1. Yüz gölgelenmesini azaltmak için katılımcının önüne dağınık halka veya dairesel aydınlatma yerleştirin. Aydınlatmayı yüz seviyesinde yaklaşık 500 luks sabit bir seviyeye ayarlayın.
    2. Hızlı ışık dalgalanmalarından ve gözlere, alnlara veya yanaklara doğrudan parlamadan kaçının. Görsel kontrol noktası: Alın, kaşlar, gözler, burun, yanaklar ve ağız bölgesi dahil olmak üzere tüm yüzün aşırı pozlama veya derin gölge olmadan kamera önizlemesinde görüldüğünü doğrulayın.
  3. Görsel uyarıcı sunumunun konfigürasyonu
    1. Görsel uyarıcıları bir monitör veya projeksiyon ekranında sunun. Bu gösterim protokolünde, 1.920 x 1.080 piksel çözünürlüğe ve 60 Hz yenileme hızına sahip 27 inçlik sıvı kristal bir monitör kullanılacaktır.
    2. Çalışma tasarımına göre resim izleme uyarıcılarını video veya slayt gösterisi formatında gösterin. Tüm katılımcılar için aynı ekran parlaklığı, kontrast ve sunum sırası kurallarını kullanın.
    3. Her bir resim klipini 90–120 saniye boyunca sunun. Bu gösterim protokolünde, her biri 100 saniye süreli 6 klip ve 20 saniyelik bir uyarım arası dinlenme aralığı kullanılır.
      DIKKAT: Tüm elektrik ekipmanlarını düzgün toprakla tutun ve EEG amplifikatörlerini ve güç kablolarını yüksek parazitli kaynaklardan uzak konumlandırarak 50/60 Hz hat gürültüsünü azaltın.

3. Multimodal veri edinimi

  1. Yüz videosu edinme
    1. Yüksek çözünürlüklü endüstriyel kamerayı katılımcının hemen önüne, yaklaşık göz hizasında konumlandırın. Kamera-yüz mesafesini 1,2 m olarak ayarlayın.
    2. Minimum 1.920 x 1.080 piksel çözünürlüğüne ve 30 kare/saniye kare hızına sahip bir kamera kullanın.
    3. Kadreler arası dalgalanmaları önlemek için manuel olarak pozlama ayarlayın. Bu gösterim protokolünde ISO 400, enstantane hızı 1/60 s ve sabit beyaz dengesi kullanılır.
    4. Videoyu sabit kare hızıyla MP4 veya AVI formatında kaydedin. Bu gösterim protokolünde, videoyu MP4 olarak kaydedin, H.264 kodlama, 30 kare/s.
    5. Kayıt süresi boyunca tüm yüzün görüş alanında kaldığından emin olun. Görsel kontrol noktası: Kaşların ve alnın tamamen görünür olduğunu doğrulayın. Alın, kaş bölgesi veya çene kırpılırsa kamerayı hemen yeniden konumlandırın.
      NOT: 30 kare/s kullanın çünkü bu kare hızı, düşük yoğunluklu yüz ifadesi dinamikleri için yeterli zamansal çözünürlük sağlarken, senkronize çok modlu kayıtta yönetilebilir depolama ve işlem yükünü korur.
  2. EEG sinyallerinin alınması
    1. Kafa çevresini ölçün ve oyuncu için doğru cap boyutunu seçin. 64 kanallı EEG kapağını uluslararası 10–20 sistemine veya üretici tarafından belirlenen 64 kanallı uzatma düzenine göre yerleştirin.
    2. Kapağı anatomik işaretlerle hizalayın. Fpz'yi nazionun üzerindeki orta hatta konumlandırın ve sol ve sağ yarımküre boyunca simetriyi doğrulayın.
    3. Her elektrot bölgesinde saçları ayırın ve elektrod-saç derisi temasını iyileştirmek için iletken jel uygulayın.
    4. Saç derisini, yüksek empedanslı bölgelerde pamuk çubuk veya küt hazırlık aracı kullanarak nazikçe hazırlayın. Deriyi aşırı aşındırmayın.
    5. Kapağı EEG amplifikatoruna bağlayın ve empedans ölçümü yapın. Tüm kanallar için elektrot empedansını 10 kΩ'nin altına indirin. Bu gösterim protokolünde, mümkün olduğunda frontal ve merkezi elektrotlar için < 5 kΩ hedeflenin.
    6. Örnekleme frekansını 500 Hz'e ayarlayın. Çevrimiçi referansı amplifikatör konfigürasyonuna göre ayarlayın. Bu gösterim protokolünde, edinim sırasında bağlı bir mastoid referans kullanın ve ön işleme sırasında ortak ortalama yeniden referans yapın.
    7. Toprak elektrotunu amplifikatör spesifikasyonuna göre yerleştirin. Bu gösterim protokolünde, zemini AFz konumuna yerleştirin. Uyarı sunumundan önce en az 60 saniyelik dinlenme başlangıç çizgisini kaydedin.
    8. Görsel kontrol noktası: Deneye başlamadan önce canlı EEG izlerini inceleyin. Stabil temel aktivite, düşük kayma ve kalıcı doygun kanallar ya da büyük hareket artefaktlarının yokluğunu doğrulayın.
  3. EEG ve video akışlarının senkronize edilmesi
    1. Uyarı sunum bilgisayarını, transistör-transistör mantık (TTL) tetik kablosu veya tetik kutusu kullanarak EEG amplifikatör tetik girişine bağlayın.
    2. Sunum yazılımını kullanarak her resim klipinin başında TTL tetikleyici darbesi ve her klipin offsetinde ikinci bir TTL tetik darbesi gönderin.
    3. Her olay türüne benzersiz tetikleyici kodları atayın. Bu gösteri protokolünde, klip başlangıcı için 11–16, klip offset için ise 21–26 kullanılır.
    4. Kamera akışını ve EEG akışını, ilk tetikten en az 5 saniye öncesinden son tetikten en az 5 saniyeye kadar aynı anda kaydedin. Tetikleyici zaman damgası tablosunu uyarıcı yazılımında otomatik olarak kaydedin.
    5. Alındıktan sonra senkronizasyonu doğrulamak, EEG kaydındaki tetikleyici zaman damgalarını sunum günlüğünden video çerçeve indeksleriyle eşleştirerek doğrulayın. Görsel kontrol noktası: EEG tetikleme zaman damgaları ile video kare zaman damgaları arasındaki ortalama hizalama hatasının 30 kare/s hızda ±33 ms içinde olduğunu doğrulayın.
      NOT: Donanım çerçevesine uygun senkronizasyon arayüzü yoksa, her iki sistemden zaman damgası günlüklerini dışa aktarın ve tetikleyici başlangıç eşleştirmesi kullanarak çevrimdışı hizalama düzeltmesi yapın.
  4. Deneysel verileri kaydetme
    1. Katılımcıya tabloları doğal bir şekilde izlemesini öğretin, böylece büyük baş hareketleri, aşırı kırpma, konuşma ve yüz dokunmalarını en aza indirin.
    2. Önceden tanımlanmış resim kliplerini seçilen sırayla sunun. Görüntüleme oturumu boyunca senkronize EEG ve yüz videolarını sürekli kaydedin.
    3. Deneyi durdurun ve kayıt sırasında empedans eşiğini 5'ten fazla kanal aşarsa elektrotları tekrar kontrol edin. Kesintileri, katılımcı rahatsızlığını ve teknik sorunları oturum günlüğünde belgeleyin.

4. EEG ön işleme ve özellik çıkarımı

  1. Ham EEG verilerinin içe aktarılması
    1. Ham EEG kayıtlarını analiz ortamına aktarın. Bu gösterim protokolünde, EEGLAB 2024.0 ile MATLAB R2023b veya MNE 1.6 ile Python 3.10 kullanın.
    2. Olay belirteçlerini içe aktarın ve tüm uyarıcı başlangıç ve kayma tetikleyicilerinin var olduğundan emin olun.
  2. EEG sinyallerinin aşağı örneklenmesi
    1. Sinyalleri 500 Hz'den 200 Hz'e kadar aşağı alın ve Şekil 1'de gösterilen iş akışına göre ön işleyin.
    2. Yazılım varsayılan veya tanımlanmış filtre ayarlarına göre yeniden deneme sırasında anti-aliasing uygulayın.
  3. EEG sinyallerinin filtrelenmesi
    1. 0.5–45 Hz arasında bir bant geçirici filtre uygulayın. Görünür hat gürültüsü kalırsa yerel güç frekansında bir çentik filtresi uygulayın. Bu gösterim protokolünde, 50 Hz çentik filtresi uygulanır.
  4. Eserlerin kaldırılması
    1. Sürekli EEG'yi manuel olarak inceleyin ve segmentleri büyük hareket artefaktlarıyla işaretleyin.
    2. Filtrelenen veriler üzerinde bağımsız bileşen analizi yapın. Göz kırpma, yatay göz hareketleri, çene gerginliği veya kas aktivitesiyle ilgili bileşenleri saç derisi haritaları, zaman parlakları ve güç spektrumları kullanarak belirleyin.
    3. Tanımlanan artefakt bileşenlerini çıkarın ve temizlenmiş EEG sinyallerini yeniden inşa edin. Bağımsız bileşen analizi düzeltmesinden sonra hâlâ aşırı genlik dalgalanmasına sahip segmentleri reddedin. Bu gösterim protokolünde, ±100 μV'yi aşan segmentleri reddedin.
  5. Verilere yeniden referans vermek
    1. Temizlenmiş EEG sinyallerini ortak ortalama referansa yeniden referans verin.
  6. EEG verilerinin segmentlere ayrılması
    1. Sürekli EEG'yi uyarıcı tetikleyicilere göre epoş. Tam klip veya sabit analiz pencerelerini kapsayan uyarıcıya hizalanmış segmentleri çıkarın. Bu gösterim protokolünde, EEG %50 örtüşme ile 2.0 saniyelik pencerelere bölünür. Segmentasyondan sonra kalan artefaktlara sahip pencereleri hariç tutun.
  7. Diferansiyel entropi özelliklerinin hesaplanması
    1. Her EEG segmentini aşağıdaki frekans bantlarına ayırın: delta (1–4 Hz), theta (4–8 Hz), alfa (8–13 Hz), beta (13–30 Hz) ve gamma (30–45 Hz).
    2. Her kanal için her frekans bandının diferansiyel entropisini hesaplayın. Bir Gauss değişkeni için aşağıdaki denklemi kullanın:
      DE = 1/2 ln(2πeσ2), burada σ2 , bant sınırlı EEG sinyalinin varyansıdır.
    3. Kanal yoluyla diferansiyel entropi değerlerini model girişi için iki boyutlu bir topografik matris veya kanal özellik matrisine düzenleyin.
    4. Bu gösterim protokolünde, analiz penceresi başına 128 × 128 x 5 giriş boyutuyla EEG özellik haritaları oluşturulur. Görsel kontrol noktası: Her bant için temsilci diferansiyel entropi haritalarını çizin ve eksik kanalların, sabit değer haritalarının veya anormal bant bazında çöküşün bulunmadığını doğrulayın.

5. Yüz videosu ön işleme

  1. Görüntü çerçevelerinin çıkarılması
    1. Kaydedilen videoyu scriptli bir pipeline kullanarak görüntü çerçevelerine ayırın. Model girişi için 25 kare/s hızında kareleri çıkararak senkronizasyon meta verilerini koruyun.
  2. Yüzü tespit etmek ve hizalamak
    1. Her karedeki yüzü doğrulanmış bir yüz dedektörü kullanarak tespit edin. Yüz işaretlerini bulun ve yüzü göz merkezlerine veya standart işaret noktalarına göre hizala. Yüzün güvenilir şekilde tespit edilmediği çerçeveleri at.
  3. Yüz bölgesinin kırpılması ve boyutlandırılması
    1. Kontur bilgisini korumak için yüzeyi, tespit edilen sınır kutusuna küçük bir kenar bırakarak kırpın. Kırpılmış yüz görüntüsünü 224 x 224 piksele boyutuna değiştirin.
    2. Şekil 2'de gösterildiği gibi dört hedef duygu kategorisinden temsil eden kırpılmış yüz örneklerini inceleyin ve alın, kaşlar, gözler, burun, yanaklar ve ağzın kırpmadan sonra görünür kaldığını doğrulayın.
  4. Eğitim görüntülerinin artırılması
    1. Sadece eğitim setine 0.5 olasılıkla rastgele yatay çevirme uygulayın. Sadece eğitim setine rastgele ±15° duruşu uygulayın.
    2. Doğrulama veya test görsellerine artırma uygulamayın.
  5. Yüz girdisini normalleştirmek
    1. Piksel değerlerini [-1, 1] aralığına normalleştirin veya omurga özel normalizasyon kuralını tüm bölünmelerde tutarlı şekilde kullanın.

6. Çok modlu sinir ağını inşa edin

  1. Yazılım ve donanım ortamının yapılandırılması
    1. Modeli Python 3.10'da PyTorch 2.1 kullanarak uygulayın. Ubuntu 22.04 veya başka bir belirtilmiş işletim sisteminde eğitim çalıştırın.
    2. En az 32 GB RAM, en az 12 GB video hafızası olan bir grafik işlem birimi ve senkronize EEG-video verileri için yeterli yerel depolama içeren bir iş istasyonu kullanın. Bu gösterim protokolünde, NVIDIA RTX 3080 grafik işlemci birimi kullanın.
    3. Eğitim betiklerini, model tanım dosyasını, ön işleme betiklerini ve yapılandırma dosyasını sürüm kontrollü bir proje dizininde sakla.
    4. Paylaşıma izin verilirse kod deposunu veya arşivlenmiş script paketini makalede bildirin.
  2. Yüz dalının inşası
    1. Şekil 3'te gösterildiği gibi genel çift dallı multimodal çerçeveyi oluşturun. Yüz dalı için bir MobileNetV2 omurgasını başlatın.
    2. İlk konvolüsyon katmanını 32 kanaldan 24 kanala değiştirin. Şekil 4'e göre yüz özelliği çıkarma dalını oluşturun ve Şekil 5'te gösterildiği gibi seçilmiş ters çevrilmiş kalıntı blokların ardından koordinat dikkat modülleri ekleyin.
    3. Belirlenmiş standart konvolüsyonları 3 x 3 ve 5 x 5 çekirdek boyutlarında paralel derinlik bazında konvolüsyonlarla değiştirerek çok ölçekli özellik çıkarımı iyileştirin.
    4. Füzyon için sabit boyutlu bir yüz özelliği vektörü dışa aktarın. Bu gösterim protokolünde, 256 özellik boyutu kullanabilirsiniz.
  3. EEG şubesinin inşası
    1. Diferansiyel entropi özelliğini konvolüsyon sinir ağı kodlayıcısına girin. EEG özellik haritalarından uzamsal desenler çıkarmak için konvolüsyon katmanları kullanın.
    2. Pencereler arasında zamansal bağımlılığı yakalamak için konvolüsyon çıkış dizisini çift yönlü uzun kısa vadeli bellek modülüne aktarın.
    3. Sabit boyutlu bir EEG özellik vektörünü dışa aktarın. Bu gösterim protokolünde, 256 özellik boyutu kullanabilirsiniz.
  4. Çapraz modal füzyon modülünün inşası
    1. Şekil 6'da gösterilen çok modal özellik etkileşim modülünü uygulayın. 8 başlık çoklu başlı çapraz dikkat bloğu uygulayın.
    2. EEG özellik dizisini sorgu olarak, yüz özelliği dizisini ise anahtar ve değer olarak tek bir çapraz dikkat akışında kullanın.
    3. Yüz özelliği dizisini sorgu olarak, EEG özellik dizisini karşılıklı çapraz dikkat akışında anahtar ve değer olarak kullanın.
    4. İki çapraz dikkat akışından çıkan çıktıları birleştirin. Birleştirilmiş özelliği füzyon projeksiyon katmanından geçirin.
  5. Kendi kendine kalan genişleme konvolüsyon modülünün eklenmesi
    1. Figür temsili, Şekil 7'de gösterilen kendi kendine kalan genişlemiş konvolüsyon bağlantı katmanıyla iyileştirin.
    2. 1, 3, 6 ve 12 genişleme oranlarıyla genişletilmiş bir konvolüsyon birleştirme katmanı oluşturun. Dört genişleme dalının çıkışlarını birleştirin.
    3. Gradyent akışını stabilize etmek ve alt seviyedeki bilgileri korumak için kalıntı atlama bağlantıları ekleyin.
  6. Sınıflandırıcı eklenmesi
    1. Birleşmiş temsilleri düzleştirin veya biriktirin. Bir tam bağlı katman ve son bir softmax çıkış katmanı ekleyin. Çıktı sınıflarını korku, mutluluk, sakinlik ve üzüntüye ayarlayın.
  7. Eğitim ayarlarının tanımlanması
    1. Tablo 1'de özetlenen ağ ve eğitim ayarlarını kullanın. Dört duygu sınıfı (korku, mutluluk, sakinlik ve üzüntü), uyarıcı tasarımı ve katılımcı öz-bildirimine dayalı birleşik bir etiketleme prosedürü kullanılarak operasyonel olarak tanımlandı. Her resim klipi hedef duygu kategorisini ortaya çıkarmak için önceden seçildi ve katılımcılar izledikten sonra baskın duygusal deneyimlerini bildirdiler. Son etiketler, amaçlanan uyarıcı kategorisinin kendi bildirilen yanıtlarla hizalanmasıyla atanmış ve tutarsız örnekler etiketleme güvenilirliğini sağlamak için hariç tutulmuştur.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Önerilen çift dal çapraz dikkati ağının performansı, resim görüntüleme sırasında 327 katılımcıdan toplanan multimodal veri seti kullanılarak değerlendirildi. Birincil sonuç, korku, mutluluk, sakinlik ve üzüntü için dört sınıflı duygu sınıflandırmasıydı. Ek analizler, tek modlu model davranışını, multimodal yakınsamayı, dikkat başlarının sayısına duyarlılığı, karşılaştırmalı tanıma performansını ve yüz ile elektroensefalografi alt ağlarının davranışını inceledi. Bu çalışmaya ayrı bir kont...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Bu protokol, duygusal hesaplamada pratik bir sorunu ele alır; yani resim izleme ortamlarında görünür ifade ve fizyolojik tepkinin her an tam olarak örtüşmediği duygusal durumların nasıl tanınacağıdır. Burada bildirilen deneysel koşullarda, çift dal çerçevesi, tek modlu karşılaştırma modellerinden daha yüksek sınıflandırma performansı sağlamış ve bu da elektroensefalografi ile yüz ifade bilgisinin sergi benzeri ortamlarda birleştirilmesinin değerini desteklemektedir. Bulgular, yüz değişik...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Yazarlar çıkar çatışması belirtmemektedir.

Teşekkürler

Minzu Normal University of Xingyi ve Southwest Üniversitesi'nden gönüllülere deneylere katıldıkları için içten teşekkürlerimizi sunuyoruz. Ayrıca EEG veri toplama konusundaki yardımları için Girona Üniversitesi teknik personeline ve anonim incelemecilere içgörülü yorumları için teşekkür ederiz.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Derin Öğrenme ÇerçevesiPyTorchv2.0 / https://pytorch.orgModel yapımı, eğitim ve değerlendirme için kullanılır
EEG Toplama Sistemi (64 kanal)Beyin Ürünleri GmbHactiCHamp Plus / v1.6Deneyler sırasında yüksek çözünürlüklü EEG sinyali alımı için kullanılır
EEG Elektrot Kapağı (10&ntir; 20 sistemi)Beyin Ürünleri GmbHActiCap / 64-kanalStandart uluslararası 10&ntir; 20 elektrot yerleşimi
Yüksek Çözünürlüklü KameraSony CorporationIMX327 SensörüYüz ifadesi video kaydı için kullanılır (≥ 1080p, 30 fps)

Kaynaklar

  1. Yang, Y., et al. A dual-stream regional feature learning and adaptive fusion method for electroencephalogram-based emotion recognition. Eng Appl Artificial Intell. 164, 113250(2026).
  2. Li, C., Pun, S. H., Li, J. W., Chen, F. Eeg-based emotion recognition using graph attention network with dual-branch attention module. 2024 46th Ann Int Conf IEEE Eng Me Biol Soc (EMBC), , 1-4 (2024).
  3. Ubillús, J. A. T., et al. Algorithms used for facial emotion recognition: A systematic review of the literature. EAI Endorsed Transact Pervasive Health Technol. 9, 1-17 (2023).
  4. Xu, Y., Cheng, L. Face emotion recognition based on gabor wavelet and particle swarm optimization algorithm. Multimed Syst. 31 (6), 435(2025).
  5. Dube, D. Y., Sannasi, M. V., Kyritsis, M., Gulliver, S. R. Facial emotion recognition from feature loss media: Human versus machine learning algorithms. Comp Human Behav. 174, 108806(2026).
  6. Manuel, M. T. J., Medina-DeVilliers, S., Clarkson, T., Lerner, M. D., Riccardi, G. Evaluation of interpretability for deep learning algorithms in EEG emotion recognition: A case study in autism. Artif Intell Med. 143, 102545(2023).
  7. Watanabe, A., Yamazaki, T. Representation of the brain network by electroencephalograms during facial expressions. J Neurosci Meth. 357, 109158(2021).
  8. Prakash, A., Poulose, A. Electroencephalogram-based emotion recognition: A comparative analysis of supervised machine learning algorithms. Data Sci Manag. 8 (3), 342-360 (2025).
  9. Sun, Y., Ayaz, H., Akansu, A. N. Multimodal affective state assessment using fnirs + eeg and spontaneous facial expression. Brain Sci. 10 (2), 85(2020).
  10. Huang, Y., Yang, J., Liu, S., Pan, J. Combining facial expressions and electroencephalography to enhance emotion recognition. Future Internet. 11 (5), 105(2019).
  11. Han, Q., et al. A multi-branch electroencephalogram emotion recognition framework based on cross-subject or cross-session multi-perspective representation fusion. Neurocomputing. 658, 131767(2025).
  12. Wang, L., Chang, Y., Wang, K. Dual-branch multimodal fusion network for driver facial emotion recognition. Appl Sci. 14 (20), 9430(2024).
  13. Mutawa, A. M., Hassouneh, A. Multimodal real-time patient emotion recognition system using facial expressions and brain EEG signals based on machine learning and log-sync methods. Biomed Signal Proc Contr. 91, 105942(2024).
  14. Qi, Y., Ibrayim, M., Hamdulla, A. Attention-based dual-branch network for micro-expression recognition with global-local feature fusion. 2024 IEEE Int Joint Conf Biometr (IJCB), , 1-9 (2024).
  15. Li, E. Intervention of art education on college students’ aesthetic mood based on emotion recognition algorithm. Front Art Res. 6 (9), 81-90 (2024).
  16. Liu, Z., Han, M., Wu, B., Rehman, A. Speech emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multi-task learning. Appl Acoustics. 202, 109178(2023).
  17. Xue, P., Wang, S., Bai, J., Qiang, Y. Research on bimodal emotion recognition algorithm based on multi-branch bidirectional multi-scale time perception. J Biome Eng. 42 (3), 528-536 (2025).
  18. Shioiri, S., Nagata, H., Sato, Y., Hatori, Y. Prediction of preference judgments of face images using facial expressions and eeg signals. J Vis. (9), 5063(2023).
  19. Lu, Y., Chen, J. Cross-subject EEG emotion recognition using the SSA-EMS algorithm for feature extraction. Entropy. 27 (9), 986(2025).
  20. Thapa, D., Rai, R. Freq-eer: A novel frequency-driven ensemble framework for emotion recognition and classification of eeg signals. Appl Sci. 15 (19), 10671(2025).
  21. Yang, Y., et al. Investigating of deaf emotion cognition pattern by eeg and facial expression combination. IEEE J Biomed Health Inform. 26 (2), 589-599 (2022).
  22. Tong, L., Yang, L., Wang, X., Liu, L. Self-aware face emotion accelerated recognition algorithm: A novel neural network acceleration algorithm of emotion recognition for international students. PeerJ Comput Sci. 9, e1611(2023).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Etiketler

EEG Duygu TanımaYüz İfadesi AnaliziDiferansiyel EntropiEvrişimli Sinir AğıÇift Yönlü LSTMDuygusal Hesaplamaİnsan-Bilgisayar Etkileşimi