הרשמה ל-JoVE נדרשת לצפייה בתוכן זה. התחברו או התחילו בגרסת ניסיון בחינם.

מאמר שיטה

רשת קשב צולב דו-ענפית לאלקטרואנצפלוגרפיה וזיהוי רגשות רב-מודלי פנים במהלך צפייה בציור

109 צפיות

⸱

DOI:

10.3791/70600

⸱

12 במאי 2026

במאמר זה

סיכום

פרוטוקול זה מתאר רכישה מסונכרנת של אלקטרואנצפלוגרפיה ונתוני פנים בסביבות צפייה בציור, ורשת דו-ענפית של תשומת לב חוצה לזיהוי רגשות רב-מודלי, הכוללת עיבוד מוקדם, מיזוג תכונות וסיווג של ארבעה מצבים רגשיים.

תקציר

זיהוי רגשות במהלך צפייה בציור נותר קשה כי התגובות האסתטיות הן דינמיות, תלויות בהקשר, וניתן לצפות בהן רק חלקית דרך התנהגות חיצונית. לכן, גישות חד-מודליות המבוססות רק על הבעות פנים או רק על אותות פיזיולוגיים, לעיתים קרובות מספקות ייצוגים לא שלמים של חוויית הצופה. מאמר זה מתאר שיטה ניתנת לשחזור לבניית רשת קשב צולב דו-ענפית המשלבת וידאו פנים עם נתוני אלקטרואנצפלוגרפיה (EEG) לזיהוי רגשות רב-מודלי בהקשר של תערוכת ציור. הפרוטוקול מתחיל בהקמת סביבת רכישה מסונכרנת באמצעות מערכת EEG בעלת 64 ערוצים ומצלמה ברזולוציה גבוהה להקלטה מקבילה במהלך צפייה בצביעה. ההליך הבא מפרט עיבוד מוקדם של אותות, כולל סינון EEG, סגמנטציה וחילוץ תכונות אנטרופיה דיפרנציאלית, יחד עם זיהוי פנים, יישור והכנת פריימים לניתוח וידאו. הרשת העצבית כוללת שני ענפים ספציפיים למודליות. ענף ה-EEG עושה שימוש ברשת עצבית קונבולוציונית וברשת זיכרון דו-כיוונית ארוכת טווח קצרה למידול תכונות עצביות מרחב-זמניות, בעוד שהענף הפנים משתמש ברשת קונבולוציונית קלה ומשופרת על ידי קשב כדי להפיק תכונות הבעה חזותית. מודול קשב רב-ראשי משולב משמש למיזוג שני הזרמים על ידי לימוד רלוונטיות בין-מודלית. בתנאים הניסיוניים המדווחים כאן, המסגרת הרב-מודלית השיגה דיוק סיווג גבוה יותר מאשר מודלי השוואה חד-מודליים בזיהוי רגשות ארבע-קטגוריות. שיטה זו מתאימה במיוחד לניתוח לא מקוון בסביבות רכישה מבוקרת ומספקת מסגרת מעשית למחשוב אפקטיבי, אסתטיקה אמפירית ומחקר אינטראקציה בין אדם למחשב ממוקד תצוגה.

מבוא

הרגש הוא תהליך פסיכולוגי ופיזיולוגי רב-ממדי המעוצב על ידי גירויים חיצוניים, הערכה פנימית וויסות קוגניטיבי מתמשך, ולכן הוא תופס מקום מרכזי באינטראקציה בין אדם למחשב ובמדעי הקוגניציה1. בסביבות תערוכות בציור, הרגש גם מתווך את הקשר בין יצירות אמנות חזותית לפרשנות הצופה. מסיבה זו, לזיהוי מצבים רגשיים של הצופה יש ערך מעשי להערכת תערוכה, עיצוב מרחבי ומחקרים אמפיריים של החוויה האסתטית2. במקביל, מדידת רגשות בסביבות תערוכה חצי-טבעיות נותרת טכנית קשה משום שהתגובות עדינות, חולפות ומושפעות הן מהיצירה והן מההקשר הצפייה.

מחקר זיהוי רגשות התפתח בדרך כלל בשני קווים עיקריים: ניתוח התנהגותי וניתוח פיזיולוגי. גישות התנהגותיות, במיוחד ניתוח הבעות פנים המבוסס על ראיית מחשב, בשימוש נרחב משום שהן לא פולשניות ויחסית קלות ליישום3. מודלים של למידה עמוקה כגון רשתות שאריות ורשתות קונבולוציוניות קלות משקל הראו ביצועים חזקים במשימות סיווג רגשי פניםבסיסיות 4. עם זאת, התנהגות פנים במהלך צפייה בציור עשויה להיות חלשה, מתונה חברתית או מוגבלת במכוון, מה שעלול להפחית את ההתאמה בין הבעה נראית לעין לתחושה סובייקטיבית5. גישות פיזיולוגיות, במיוחד אלו המבוססות על אלקטרואנצפלוגרפיה (EEG), מציעות גישה ישירה יותר לפעילות עצבית הקשורה לעיבוד רגשי6. EEG שימש רבות במחקרי רגש, משום שתנודות זמניות באותות עצביים מספקות מידע לשינויים במצב הרגשי, כולל ממדים הקשורים לערכיות ולעוררות. עם זאת, הקלטות EEG רגישות לארטיפקטים של תנועה, זיהום אלקטרומיוגרפי ורעש סביבתי, ו-EEG לבדו מספק לעיתים קרובות מידע הקשרי מוגבל לגבי מה שהצופה מגיב אליו חזותית8.

חוזקות וחולשות משלימות אלו גרמו לעניין מוגבר בזיהוי רגשות רב-מודלי9. ההנחה המרכזית של מיזוג רב-מודלי היא שאותות הטרוגניים יכולים לספק ראיות אינפורמטיביות הדדית ולהפחית את העמימות שנוצרת כאשר מודליות אחת מפורשת בנפרד10. במשימות צפייה בציור, למשל, התנהגות פנים מאופקת עשויה עדיין להתרחש במקביל לשינויים עצביים מדידים הקשורים לקשב או למעורבות רגשית. עם זאת, מערכות מולטימודליות קיימות אינן תמיד מדמות את הקשר הזה ביעילות. אסטרטגיות מיזוג מוקדמות המבוססות על שרשור תכונות ישיר עלולות להגדיל את העומס הממדי ועלולות לטשטש את מבנה הזמן הספציפי למודאליות11. אסטרטגיות מיזוג מאוחרות המבוססות על החלטות נפרדות קלות יותר ליישום, אך הן עשויות להתעלם מאינטראקציות מדויקות בין אותות חזותיים ופיזיולוגיים במהלך עיבוד רגשי12. בנוסף, מודלים רב-מודליים רבים משתמשים בשיטות היתוך קבועות או אדפטיביות חלשות, שאינן מתאימות לתגובות משתנות של הצופים בסביבות תצוגה13.

כדי להתמודד עם מגבלות אלו, הפרוטוקול הנוכחי מתאר רשת קשב חוצה דו-ענפית לזיהוי רגשות רב-מודלי במהלך צפייה בציור. במסגרת זו, תכונות EEG מעובדות על ידי מודל זיכרון ארוך-טווח דו-כיווני של רשת עצבית קונבולוציונית (CNN-BiLSTM), המשמש לייצוג דינמיקה עצבית מרחבית-זמנית. תכונות וידאו פנים מעובדות על ידי ענף MobileNetV2 משודרג על ידי קואורדינטות קשב, המשמש ללכידת רמזים של הבעה בעוצמה נמוכה תוך שמירה על יעילות חישובית14. שני הענפים משולבים באמצעות מנגנון ריבוי ראשים של קשב צולב שלומד רלוונטיות בין מודאליות במקום פשוט לאחד את הפלטיםשלהם 15,16. עיצוב זה נועד לשמר מבנה ייחודי למודאליות תוך שיפור מידול אינטראקציות חוצות מודאליות.

השיטה מיועדת בעיקר לניתוח לא מקוון בתנאי איסוף נתונים מבוקרים, ולא לפריסה ישירה בזמן אמת בחללי תצוגה ציבוריים פתוחים. מימוש אמין דורש סנכרון של EEG ולכידת וידאו, תאורה יציבה, מיקום מצלמה מבוקר, התנגדות אלקטרודות מקובלת, ומשאבים מחשוביים מספקים לאימון מודלים. הביצועים עשויים גם להיות תלויים בהרכב המדגם, סוג הגירוי ובמידה שבה המשתתפים משנים התנהגות כי הם יודעים שהם מוקלטים. יש לקחת בחשבון את המגבלות התפעוליות הללו בעת התאמת הפרוטוקול לסביבות תערוכה או אוכלוסיות אחרות.

הפרוטוקול המוצג כאן מכסה את כל צינור הניסוי, כולל רכישה מסונכרנת מ-327 משתתפים, עיבוד מוקדם של EEG ונתוני וידאו פנים, חילוץ תכונות, מיזוג בין-מודלי וסיווג. המטרה היא לספק זרימת עבודה ניתנת לשחזור לזיהוי רגשות רב-מודלי במחקר תערוכות ציור. מעבר למחשוב רגשי17, הפרוטוקול עשוי גם לתמוך בחקירה כמותית באסתטיקה אמפירית ובמחקרים פסיכולוגיים קשורים18.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

פרוטוקול המחקר נבדק ואושר על ידי ועדת האתיקה להגנה על מחקר אנושי של אוניברסיטת שינגיי מינזו נורמל (אישור מס' 2600AL0621). הסכמה מדעת בכתב התקבלה מכל המשתתפים לפני הכללתם במחקר ולפני איסוף הנתונים.

1. גיוס משתתפים וציות אתי

  1. קבלת אישור אתי
    1. יש להגיש את פרוטוקול הניסוי המלא, טופס הסכמה, גיליון מידע למשתתפים ותוכנית הגנת הנתונים לוועדת הביקורת המוסדית (IRB) או לוועדת האתיקה לפני תחילת המחקר.
    2. קבל אישור בכתב ורשם את מספר האישור במסמך המחקר.
  2. גיוס משתתפים
    1. גייסו משתתפים בוגרים בריאים לרכישת רגשות רב-מודליים במהלך צפייה בציור. בפרוטוקול ההדגמה הזה, גייסו 327 משתתפים.
    2. יש ליישם את קריטריוני ההכללה הבאים: גיל 18–35, ראייה תקינה או מתוקנת לנורמלית, ללא דיווח עצמי על היסטוריה של הפרעות נוירולוגיות, ללא שימוש נוכחי בתרופות פסיכואקטיביות, ונכונות לעבור הקלטת אלקטרואנצפלוגרפיה (EEG) והקלטת וידאו פנים.
    3. יש ליישם את קריטריוני ההחרגה הבאים: פגיעות קשות מופרזות בקרקפת או מצבים דרמטולוגיים המונעים הצבת אלקטרודות, חוסר יכולת להשלים את כל סשן ההקלטה, תנועה קשה במהלך הרכישה, או תיעוד הסכמה לא מלא.
    4. רשמו את מאפייני המשתתפים, כולל גיל, מין, ידיים, ניסיון צפייה באמנות קודמת ורמת השכלה. בפרוטוקול ההדגמה הזה, יש לרשום את הדגימה הבאה SHORT LONG ABSTRACT: גיל ממוצע 24.8 ± 3.7 שנים, 165 נשים ו-162 גברים, כולם ימניים.
    5. הגדר איזון דמוגרפי תפעולי לפני הגיוס. בפרוטוקול ההדגמה הזה, יש להשתמש במונח זה כדי לציין התפלגות מגדרית מאוזנת בערך וטווח גילאים המרוכז בבגרות המוקדמת, כדי להפחית שונות בגיל בתגובות EEG והבעות פנים.
  3. קבלת הסכמה מדעת
    1. ספק לכל משתתף טופס הסכמה מדעת בכתב המתאר הקלטת EEG, הקלטת וידאו פנים, נהלי סנכרון, אנונימיזציה, אחסון נתונים וזכות למשוך בכל עת ללא קנס.
    2. הסבר שתמונות פנים ישמשו להפקת תכונות ושאזורי העיניים יוסתרו בכל איורי כתב היד כדי להגן על זהות המשתתף.
    3. קבל הסכמה מדעת בכתב לפני תחילת כל הליך ניסוי.
  4. הקצאת מזהים ואנונימיזציה של נתונים
    1. הקצה לכל משתתף מזהה מחקר מספרי ייחודי. אחסן קבצי EEG, קבצי וידאו ומטא-דאטה רק באמצעות מזהה המחקר.
    2. אחסן טפסי הסכמה מזוהים בנפרד מהנתונים הפיזיולוגיים והתמונה. השתמש במסגרות פנים לא מזוהות או בפלטים שמקורם בנקודות ציון פנים לאחסון ניתוח פנימי כאשר נדרש לפי מדיניות האתיקה המקומית.

2. סביבה ניסיונית והגדרת גירויים

  1. הכנת סביבת הצפייה
    1. הכן חדר פנימי שקט לדמות סביבה של תערוכת ציור מבוקרת. לשמור על טמפרטורה סביבתית של 22–24 מעלות צלזיוס ולחות יחסית של 45%–60%. שלוט ברעש רקע מתחת ל-40 dB ככל האפשר.
    2. הושבים את המשתתף בכיסא זקוף עם תמיכה לגב ומקמו את הכיסא כך שמרחק הצפייה בין המשתתף לתצוגה הוא 2.0 מטר.
    3. הנחו את המשתתף להישאר לבד באזור ההקלטה במהלך הצגת הגירויים. אין לאפשר למשתתפים או לצופים אחרים להיות בשדה הראייה המיידי במהלך איסוף הנתונים.
  2. תצורת התאורה
    1. התקן תאורה טבעתית או עגולה מפוזרת מול המשתתף כדי להפחית צללים בפנים. כוון את התאורה לרמה יציבה של כ-500 לוקס בגובה הפנים.
    2. הימנעו משינויים מהירים בתאורה וסנוור ישיר על העיניים, המצח או הלחיים. נקודת ביקורת ויזואלית: ודאו שכל הפנים, כולל המצח, הגבות, העיניים, האף, הלחיים ואזור הפה, נראים בתצוגה המקדימה של המצלמה ללא חשיפה יתר או צל עמוק.
  3. קונפיגורציה של הצגת גירוי חזותי
    1. הצג את הגירויים הוויזואליים על מסך או מסך הקרנה. בפרוטוקול ההדגמה הזה, יש להשתמש במסך גביש נוזלי בגודל 27 אינץ' ברזולוציה של 1,920 על 1,080 פיקסלים וקצב רענון של 60 הרץ.
    2. הצג גירויים לציור בפורמט וידאו או מצגת לפי עיצוב המחקר. השתמש באותם כללי בהירות, ניגודיות וסדר ההצגה לכל המשתתפים.
    3. הציגו כל קטע ציור למשך 90–120 שניות. בפרוטוקול ההדגמה הזה, יש להשתמש ב-6 קליפים, כל אחד באורך של 100 שניות, עם מרווח מנוחה של 20 שניות.
      אזהרה: הארקת כל הציוד החשמלי כראוי והנח את מגבר ה-EEG וכבלי החשמל הרחק ממקורות בעלי הפרעות גבוהות כדי להפחית רעש קו ב-50/60 הרץ.

3. רכישת נתונים רב-מודליים

  1. רכישת וידאו פנים
    1. מקם מצלמה תעשייתית ברזולוציה גבוהה ישירות מול המשתתף, בגובה עיניים בקירוב. הגדר את המרחק בין המצלמה לפנים ל-1.2 מטר.
    2. השתמש במצלמה עם רזולוציית רכישה מינימלית של 1,920 על 1,080 פיקסלים וקצב פריימים של 30 פריימים לשנייה.
    3. הגדר את החשיפה ידנית כדי למנוע תנודות בין פריים. בפרוטוקול ההדגמה הזה, השתמש ב-ISO 400, מהירות תריס 1/60 שניות, ואיזון לבן קבוע.
    4. שמור את הווידאו בפורמט MP4 או AVI באמצעות קצב פריימים קבוע. בפרוטוקול ההדגמה הזה, שמור וידאו כ-MP4, קידוד H.264, 30 פריימים לשנייה.
    5. וודא שהפנים המלאות נשארות בשדה הראייה לאורך כל ההקלטה. נקודת ביקורת ויזואלית: אשר שהגבות והמצח נראים במלואם. מקם מחדש את המצלמה מיד אם המצח, אזור הגבות או הסנטר חתוכים.
      הערה: השתמש ב-30 פריימים לשנייה כי קצב הפריימים הזה מספק רזולוציה זמנית מספקת לדינמיקת הבעה פנים בעוצמה נמוכה, תוך שמירה על עומס אחסון ועיבוד שניתן לנהל בהקלטה מולטימודלית מסונכרנת.
  2. רכישת אותות EEG
    1. מדוד את היקף הראש ובחר את גודל הכובע הנכון למשתתף. מקם את מכסה ה-EEG בעל 64 הערוצים בהתאם למערכת הבינלאומית 10–20 או לפי פריסת הארכה 64 ערוצים שנקבעה על ידי היצרן.
    2. יישר את הכובע באמצעות סימני ציון אנטומיים. מקם את ה-FPZ בקו האמצע מעל הנתיב ואמת סימטריה בין חצי הכדור השמאלי והימני.
    3. הפרדו את השיער בכל אתר אלקטרודה ומרחו ג'ל מוליך לשיפור מגע האלקטרודה עם הקרקפת.
    4. הכינו את הקרקפת בעדינות באתרים בעלי התנגדות גבוהה באמצעות מטוש כותנה או כלי הכנה קהה. אל תשחק את העור בצורה מופרזת.
    5. חבר את הקבל למגבר ה-EEG ובצע מדידת התנגדות. הפחיתו את התנגדות האלקטרודות לפחות מ-10 kΩ לכל הערוצים. בפרוטוקול ההדגמה הזה, יש לכוון ל-< 5 kΩ לאלקטרודות החזיתיות והמרכזיות כאשר הדבר אפשרי.
    6. הגדר את תדר הדגימה ל-500 הרץ. הגדר את ההפניה המקוונת לפי תצורת המגבר. בפרוטוקול ההדגמה זה, השתמשו בהתייחסות מאסטואידית מקושרת במהלך הרכישה ובצעו הפניה ממוצעת חוזרת רגילה במהלך העיבוד המוקדם.
    7. מקם את אלקטרודת ההארקה לפי מפרט המגבר. בפרוטוקול ההדגמה הזה, מקם את הקרקע ב-AFz. רשמו לפחות 60 שניות של בסיס מנוחה לפני הצגת הגירוי.
    8. נקודת ביקורת ויזואלית: בדוק את עקבות ה-EEG החיות לפני תחילת הניסוי. אשר פעילות בסיסית יציבה, סטייה נמוכה, והיעדר תעלות רוויות מתמשכות או ארטיפקטים עיקריים של תנועה.
  3. סנכרון זרמי EEG ווידאו
    1. חבר את מחשב הצגת הגירוי לקלט הטריגר של מגבר ה-EEG באמצעות כבל טריגר לוגיקת טרנזיסטור-טרנזיסטור (TTL) או תיבת טריגר.
    2. השתמש בתוכנת ההצגה כדי לשלוח פולס טריגר TTL בתחילת כל קליפ ציור ופולס טריגר TTL שני בהסטה של כל קליפ.
    3. הקצה קודי טריגר ייחודיים לכל סוג אירוע. בפרוטוקול ההדגמה זה, יש להשתמש ב-11–16 להתחלת קליפ ו-21–26 להזזת קליפ.
    4. הקלט את זרם המצלמה וזרם ה-EEG בו זמנית לפחות מ-5 שניות לפני הטריגר הראשון ועד לפחות 5 שניות אחרי הטריגר הסופי. רשמו אוטומטית את טבלת חותמת הזמן של הטריגר בתוכנת התמריצים.
    5. אימות סנכרון לאחר רכישה על ידי התאמת חותמות זמן של טריגרים בהקלטת ה-EEG עם אינדקסים של פריימים וידאו מתוך יומן ההצגה. נקודת ביקורת ויזואלית: אשר שגיאת היישור הממוצעת בין חותמות הזמן של הפעלת EEG לחותמות זמן של פריימים וידאו היא בטווח של ±33 מילישניות במהירות 30 פריימים לשנייה.
      הערה: אם אין ממשק סנכרון מדויק למסגרת חומרה זמין, יש לייצא יומני חותמת זמן משתי המערכות ולבצע תיקון יישור לא מקוון באמצעות התאמת הפעלה של טריגר.
  4. תיעוד נתונים ניסיוניים
    1. הנחה את המשתתף לצפות בציורים באופן טבעי תוך מזעור תנועות ראש גדולות, מצמוצים מופרזים, דיבור ונגיעות בפנים.
    2. הצג את קטעי הציור המוגדרים מראש בסדר שנבחר. הקלט וידאו EEG ופנים מסונכרן ברציפות לאורך כל סשן הצפייה.
    3. עצרו את הניסוי ובדקו מחדש את האלקטרודות אם יותר מ-5 ערוצים חורגים מסף ההתנגדות במהלך ההקלטה. תיעוד של הפרעות, אי נוחות של משתתפים, ובעיות טכניות ביומן הסשן.

4. קדם-עיבוד EEG וחילוץ תכונות

  1. ייבוא נתוני EEG גולמיים
    1. ייבא את הקלטות ה-EEG הגולמיות לסביבת הניתוח. בפרוטוקול ההדגמה הזה, יש להשתמש ב-MATLAB R2023b עם EEGLAB 2024.0 או ב-Python 3.10 עם MNE 1.6.
    2. ייבא את סימני האירועים וודא שכל הטריגרים של תחילת והזזת הגירויים קיימים.
  2. דגימה קטנה של אותות EEG
    1. הורד את האותות מ-500 הרץ ל-200 הרץ ועבד אותם מראש לפי תהליך העבודה המוצג באיור 1.
    2. יש להחיל אנטי-אליאסינג במהלך הדגימה מחדש בהתאם להגדרות ברירת המחדל של התוכנה או הגדרות המסנן המוגדרות.
  3. סינון אותות ה-EEG
    1. החלו מסנן מעבר פס בתדר 0.5–45 הרץ. החלו פילטר חריץ בתדר ההספק המקומי אם נשאר רעש קו נראה. בפרוטוקול ההדגמה הזה, יש להפעיל פילטר חריץ של 50 הרץ.
  4. הסרת ארטיפקטים
    1. בדוק ידנית את ה-EEG הרציף וסמן מקטעים עם ארטיפקטים של תנועה גסה.
    2. הרץ ניתוח רכיבים עצמאי על הנתונים המסוננים. זהה מרכיבים הקשורים למצמוצי עיניים, תנועות עיניים אופקיות, מתיחות בלסת או פעילות שרירים באמצעות מפות קרקפת, מסלולי זמן וספקטרום כוח.
    3. הסר את רכיבי החפץ שזוהו ושחזר את אותות ה-EEG הנקיים. דחו מקטעים שעדיין מכילים תנודות משרעת מופרזות לאחר תיקון ניתוח רכיבים עצמאי. בפרוטוקול ההדגמה זה, דחו מקטעים העולים על ±100 מיקרו-וולט.
  5. התייחסות מחדש לנתונים
    1. הפנה מחדש את אותות ה-EEG המנוקים לממוצע המשותף.
  6. חלוקת נתוני ה-EEG
    1. ה-EEG הרציף לפי הטריגרים של גירויים. חלץ מקטעים מיושרים לגירוי המכסים את כל חלונות הניתוח הקבועים או הקליפ. בפרוטוקול ההדגמה הזה, חלקו את ה-EEG לחלונות 2.0 שניות עם חפיפה של 50%. החריגו חלונות עם ארטיפקטים שאריות לאחר סגמנטציה.
  7. חישוב מאפייני אנטרופיה דיפרנציאלית
    1. פירוק כל קטע EEG לתדרים הבאים: דלתא (1–4 הרץ), תטא (4–8 הרץ), אלפא (8–13 הרץ), בטא (13–30 הרץ) וגמא (30–45 הרץ).
    2. חשב את האנטרופיה הדיפרנציאלית של כל תחום תדרים עבור כל ערוץ. השתמשו במשוואה הבאה עבור משתנה גאוסיאני:
      DE = 1/2 ln(2πeσ2), כאשר σ2 הוא השונות של אות EEG מוגבל בתחום הדרום.
    3. סדר את ערכי האנטרופיה הדיפרנציאלית לערוץ למטריצה טופוגרפית דו-ממדית או למטריצת תכונות-ערוץ לקלט המודל.
    4. בפרוטוקול ההדגמה זה, יש ליצור מפות תכונות EEG עם גודל קלט של 128 × 128 x 5 לכל חלון ניתוח. נקודת ביקורת ויזואלית: מציגים מיפוי אנטרופיה דיפרנציאלית מייצגים עבור כל רצועה ואישור שאין ערוצים חסרים, מפות בערכים קבועים או קריסה לא נורמלית.

5. עיבוד מוקדם של וידאו פנים

  1. חילוץ מסגרות תמונה
    1. פענח את הווידאו המוקלט למסגרות תמונה באמצעות צינור מתוסרט. חילוץ פריימים במהירות של 25 פריימים לשנייה להזנת מודל תוך שמירה על מטא-דאטה של סנכרון.
  2. זיהוי ויישור הפנים
    1. לזהות את הפנים בכל פריים באמצעות גלאי פנים מאומת. אתר נקודות ציון בפנים ויישר את הפנים לפי מרכזי העיניים או עוגנים סטנדרטיים. השליכו פריימים שבהם הפנים אינן מזוהות באופן אמין.
  3. חיתוך ושינוי גודל אזור הפנים
    1. חתוך את הפאה לתיבת הגבול שזוהה עם שוליים קטנים כדי לשמור על מידע על קווי המתאר. שנו את גודל תמונת הפנים החתוכה ל-224 על 224 פיקסלים.
    2. בדקו דגימות פנים נחתכות מייצגות מארבע קטגוריות הרגשות היעד, כפי שמוצג באיור 2, ואשרו שהמצח, הגבות, העיניים, האף, הלחיים והפה נשארים גלויים לאחר החיתוך.
  4. הרחבת תמונות האימון
    1. הפעילו היפוך אופקי אקראי בהסתברות של 0.5 רק על קבוצת האימונים. הפעילו סיבוב אקראי בטווח של ±15° רק על ערכת האימון.
    2. אל תיישם הרחבה על אימות או בדיקות תמונות.
  5. נרמול קלט הפנים
    1. נרמל ערכי פיקסלים לטווח [-1, 1] או השתמש בכלל הנורמליזציה הספציפי לעמוד השדרה באופן עקבי בכל הפיצולים.

6. בניית רשת עצבית רב-מודלית

  1. הגדרת סביבת התוכנה והחומרה
    1. מימוש המודל בפייתון 3.10 באמצעות PyTorch 2.1. הרץ הדרכה על Ubuntu 22.04 או מערכת הפעלה מוגדרת אחרת.
    2. השתמש בתחנת עבודה עם לפחות 32GB RAM, יחידת עיבוד גרפית אחת עם לפחות 12GB זיכרון וידאו, ואחסון מקומי מספיק לנתוני EEG-video מסונכרנים. בפרוטוקול ההדגמה הזה, השתמש ביחידת עיבוד גרפיקה NVIDIA RTX 3080.
    3. אחסן את סקריפט ההדרכה, קובץ הגדרת המודל, סקריפט הקדם-עיבוד וקובץ הקונפיגורציה בתיקיית פרויקט מבוקרית גרסאות.
    4. דווח על מאגר הקוד או חבילת התסריט הארכיונית בכתב היד אם מותר לשיתוף.
  2. בניית ענף הפנים
    1. בנה את המסגרת הרב-מודלית הכוללת בעלת הענפים הכפולה כפי שמוצג באיור 3. אתחל עמוד שדרה של MobileNetV2 עבור ענף הפנים.
    2. שנו את שכבת הקונבולוציה הראשונה מ-32 ערוצים ל-24 ערוצים. בנה את ענף חילוץ תכונות הפנים לפי איור 4 והכנס מודולי קשב קואורדינטות לאחר הבלוקים ההפוכים שנבחרו, כפי שמוצג באיור 5.
    3. החלפת קונבולוציות סטנדרטיות מיועדות בקונבולוציות עומק מקבילות בגודל גרעין 3 x 3 ו-5 x 5 כדי לשפר את חילוץ התכונות בקנה מידה רב.
    4. ייצוא וקטור תכונות פנים בממד קבוע עבור פיוז'ן. בפרוטוקול ההדגמה הזה, יש להשתמש בממד תכונה של 256.
  3. בניית סניף ה-EEG
    1. הזן את מאפיין האנטרופיה הדיפרנציאלית למקודד רשת עצבית קונבולוציונית. השתמש בשכבות הקונבולוציונליות כדי להפיק דפוסים מרחביים ממפות תכונות ה-EEG.
    2. הזן את רצף הפלט הקונבולוציוני למודול זיכרון דו-כיווני ארוך טווח קצר כדי ללכוד תלות זמנית בין חלונות.
    3. ייצוא וקטור תכונה EEG בממד קבוע. בפרוטוקול ההדגמה הזה, יש להשתמש בממד תכונה של 256.
  4. בניית מודול ההיתוך החוצה-מודלי
    1. מימוש מודול אינטראקציה של תכונות רב-מודליות המוצג באיור 6. יישם בלוק קרוס-קאוז מרובה ראשים עם 8 ראשים.
    2. השתמש ברצף תכונות ה-EEG כשאילתה וברצף תכונות הפנים כמפתח וערך בזרם תשומת לב אחד.
    3. השתמש ברצף תכונות הפנים כשאילתה וברצף תכונות ה-EEG כמפתח וערך בזרם הקשב ההדדי.
    4. לאחד את הפלטים משני זרמי הקשב החוצה. העבר את התכונה המחוברת דרך שכבת הקרנת היתוך.
  5. הוספת מודול הקונבולוציה המורחב העצמי
    1. לחדד את הייצוג המאוחד עם שכבת החיבור קונבולוציה המורחבת שארית עצמית המוצגת באיור 7.
    2. בנו שכבת קונובלוציה מורחבת באמצעות קצבי התרחבות של 1, 3, 6 ו-12. לאחד את הפלטים מארבעת ענפי ההתרחבות.
    3. הוסף חיבורי דילוג שנותרו כדי לייצב את זרימת הגרדיאנט ולשמר מידע ברמה נמוכה יותר.
  6. הוספת המסווג
    1. שטח או איחד את הייצוג הממוזג. הוסף שכבה אחת מחוברת במלואה ושכבת פלט סופית של softmax. הגדר את מחלקות הפלט לפחד, אושר, רוגע ועצב.
  7. הגדרת הגדרות האימון
    1. השתמש בהגדרות הרשת וההדרכה המסוכמות בטבלה 1. ארבעת מחלקות הרגש (פחד, אושר, רוגע ועצב) הוגדרו באופן תפעולי באמצעות הליך תיוג משולב המבוסס על עיצוב גירוי ודיווח עצמי של המשתתף. כל קטע ציור נבחר מראש כדי לעורר קטגוריית רגש ממוקדת, והמשתתפים דיווחו על החוויה הרגשית הדומיננטית שלהם לאחר הצפייה. התוויות הסופיות הוקצו על ידי יישור קטגוריית הגירוי המיועדת לתגובות שדווחו בעצמם, ומדגמים לא עקביים הוצאו כדי להבטיח אמינות תיוג.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

הביצועים של רשת הקשב הצולבת המוצעת בעלת שני ענפים הוערכו באמצעות מערך הנתונים הרב-מודלי שנאסף מ-327 משתתפים במהלך צפייה בציור. התוצאה העיקרית הייתה ביצועי סיווג רגשי בארבעה מחלקות לפחד, אושר, רוגע ועצב. ניתוחים נוספים בחנו התנהגות מודל חד-מודלי, התכנסות רב-מודלית, רגישות למספר ראשי הקשב, ביצועי זיהוי השוואתי, והתנהגות תת-רשתות הפנים והאלקטרואנצפלוגרפיה. לא נכללה קבוצת ביקורת נפרדת במחקר זה, משום שהמטרה הייתה להעריך ביצועים יחסיים בין תצורות חד-מודליות ורב-מודליות בתוך אותו מאגר נתונים ול...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

פרוטוקול זה מתמודד עם בעיה מעשית במחשוב רגשי, כלומר כיצד לזהות מצבים רגשיים בסביבות צפייה בציור, שבהם הביטוי הגלוי והתגובה הפיזיולוגית אינם תואמים לחלוטין בכל רגע. בתנאים הניסיוניים המדווחים כאן, מסגרת הענפים הכפולה השיגה ביצועי סיווג גבוהים יותר מאשר מודלים חד-מודליים, מה שתומך בערך של שילוב אלקטרואנצפלוגרפיה ומידע הבעה פנים בסביבות דמויות תצוגה. הממצאים מצביעים על כך שאינטגרציה רב-מודלית שימושית במיוחד כאשר שינויים בפנים הם עדינים או מתונים חברתית, מכיוון שאותות פיזיולוגיים יכולים לספק...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

המחברים מצהירים שאין ניגוד עניינים.

תודות

אנו מביעים את תודתנו הכנה למתנדבים מאוניברסיטת מינזו נורמל של שינגיי ומאוניברסיטת דרום-מערב על השתתפותם בניסויים. אנו מודים גם לצוות הטכני של אוניברסיטת ז'ירונה על עזרתם באיסוף נתוני EEG ולסוקרים האנונימיים על תגובותיהם המעמיקות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
מסגרת למידה עמוקהפייטורץ'v2.0 / https://pytorch.orgמשמש לבניית מודלים, הכשרה והערכה
מערכת רכישת EEG (64 ערוצים)בריין פרודקטס GmbHactiCHamp Plus / v1.6משמש לרכישת אות EEG ברזולוציה גבוהה במהלך ניסויים
מכסה אלקטרודה EEG (10– מערכת 20)בריין פרודקטס GmbHActiCap / 64 ערוציםStandard International 10– מיקום 20 אלקטרודות
מצלמת HD-HDסוני קורפוריישןחיישן IMX327משמש להקלטת וידאו של הבעות פנים (≥ 1080p, 30 fps)

מקורות

  1. Yang, Y., et al. A dual-stream regional feature learning and adaptive fusion method for electroencephalogram-based emotion recognition. Eng Appl Artificial Intell. 164, 113250(2026).
  2. Li, C., Pun, S. H., Li, J. W., Chen, F. Eeg-based emotion recognition using graph attention network with dual-branch attention module. 2024 46th Ann Int Conf IEEE Eng Me Biol Soc (EMBC), , 1-4 (2024).
  3. Ubillús, J. A. T., et al. Algorithms used for facial emotion recognition: A systematic review of the literature. EAI Endorsed Transact Pervasive Health Technol. 9, 1-17 (2023).
  4. Xu, Y., Cheng, L. Face emotion recognition based on gabor wavelet and particle swarm optimization algorithm. Multimed Syst. 31 (6), 435(2025).
  5. Dube, D. Y., Sannasi, M. V., Kyritsis, M., Gulliver, S. R. Facial emotion recognition from feature loss media: Human versus machine learning algorithms. Comp Human Behav. 174, 108806(2026).
  6. Manuel, M. T. J., Medina-DeVilliers, S., Clarkson, T., Lerner, M. D., Riccardi, G. Evaluation of interpretability for deep learning algorithms in EEG emotion recognition: A case study in autism. Artif Intell Med. 143, 102545(2023).
  7. Watanabe, A., Yamazaki, T. Representation of the brain network by electroencephalograms during facial expressions. J Neurosci Meth. 357, 109158(2021).
  8. Prakash, A., Poulose, A. Electroencephalogram-based emotion recognition: A comparative analysis of supervised machine learning algorithms. Data Sci Manag. 8 (3), 342-360 (2025).
  9. Sun, Y., Ayaz, H., Akansu, A. N. Multimodal affective state assessment using fnirs + eeg and spontaneous facial expression. Brain Sci. 10 (2), 85(2020).
  10. Huang, Y., Yang, J., Liu, S., Pan, J. Combining facial expressions and electroencephalography to enhance emotion recognition. Future Internet. 11 (5), 105(2019).
  11. Han, Q., et al. A multi-branch electroencephalogram emotion recognition framework based on cross-subject or cross-session multi-perspective representation fusion. Neurocomputing. 658, 131767(2025).
  12. Wang, L., Chang, Y., Wang, K. Dual-branch multimodal fusion network for driver facial emotion recognition. Appl Sci. 14 (20), 9430(2024).
  13. Mutawa, A. M., Hassouneh, A. Multimodal real-time patient emotion recognition system using facial expressions and brain EEG signals based on machine learning and log-sync methods. Biomed Signal Proc Contr. 91, 105942(2024).
  14. Qi, Y., Ibrayim, M., Hamdulla, A. Attention-based dual-branch network for micro-expression recognition with global-local feature fusion. 2024 IEEE Int Joint Conf Biometr (IJCB), , 1-9 (2024).
  15. Li, E. Intervention of art education on college students’ aesthetic mood based on emotion recognition algorithm. Front Art Res. 6 (9), 81-90 (2024).
  16. Liu, Z., Han, M., Wu, B., Rehman, A. Speech emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multi-task learning. Appl Acoustics. 202, 109178(2023).
  17. Xue, P., Wang, S., Bai, J., Qiang, Y. Research on bimodal emotion recognition algorithm based on multi-branch bidirectional multi-scale time perception. J Biome Eng. 42 (3), 528-536 (2025).
  18. Shioiri, S., Nagata, H., Sato, Y., Hatori, Y. Prediction of preference judgments of face images using facial expressions and eeg signals. J Vis. (9), 5063(2023).
  19. Lu, Y., Chen, J. Cross-subject EEG emotion recognition using the SSA-EMS algorithm for feature extraction. Entropy. 27 (9), 986(2025).
  20. Thapa, D., Rai, R. Freq-eer: A novel frequency-driven ensemble framework for emotion recognition and classification of eeg signals. Appl Sci. 15 (19), 10671(2025).
  21. Yang, Y., et al. Investigating of deaf emotion cognition pattern by eeg and facial expression combination. IEEE J Biomed Health Inform. 26 (2), 589-599 (2022).
  22. Tong, L., Yang, L., Wang, X., Liu, L. Self-aware face emotion accelerated recognition algorithm: A novel neural network acceleration algorithm of emotion recognition for international students. PeerJ Comput Sci. 9, e1611(2023).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

תגיות

זיהוי רגשות באמצעות EEGניתוח הבעות פניםאנטרופיה דיפרנציאליתרשת עצבית קונבולוציוניתLSTM דו-כיוונימחשוב רגשיאינטראקציית אדם-מחשב