סקירה סכמטית של זרימת העבודה של עיבוד מקדימה של EEG, חילוץ מאפיינים וסיווג מוצגת ב- איור 1. החומרים והתוכנות ששימשו במחקר מפורטים ב- טבלת חומרים.

איור 1: זרימת העבודה של צינור העיבוד המקדים של ה-EEG, חילוץ המאפיינים והסיווג. סקירה סכימטית של זרימת העבודה במחקר, הכוללת אימות נתוני EEG, סינון פס-מעבר (band-pass) וייחוס מחדש (re-referencing), חילוץ מאפייני שורש ממוצע הריבועים (RMS), צפיפות הספק ספקטרלית (PSD) ואנטרופיה, הוספת גיל, חלוקה למערכי אימון ובדיקה, פיתוח מודל Random Forest, ניתוח יציבות מאפיינים, ניתוח SHAP, ניתוח גודל אפקט באמצעות Cohen’s d, בחירת מאפיינים משולבת, אבלציה של מאפייני אנטרופיה, אימון מחדש של המודל והערכת ביצועים. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.
1. רכישת נתונים
מערך נתוני EEG במצב מנוחה הזמין לציבור נלקח ממאגר OpenNeuro (מערך נתונים ds004504, גרסה 1.0.9)33. תוויות המשתתפים והמידע הדמוגרפי אומתו. מערך הנתונים כלל 88 משתתפים, ביניהם 36 משתתפים עם מחלת אלצהיימר (AD), 23 עם דמנציה פרונטו-טמפורלית (FTD), ו-29 ביקורות בריאות (HC).
2. ייבוא הקלטת EEG
עבור כל משתתף, הקלטת ה-EEG נטענה באמצעות ספריית MNE-Python. כל קובץ EEG נבדק כדי לוודא שהוא נגיש, ניתן לייבוא בהצלחה ומכיל מזהה משתתף תקף. הקלטות עם קבצים חסרים או פגומים הוסירו מהניתוח. תדר הדגימה המקורי של ה-EEG, שהיה 500 Hz, נשמר בשלב זה. האותות עברו דגימה מחדש (downsampled) כדי להפחית את העומס החישובי תוך שימור כל מידע ה-EEG הרלוונטי מבחינה קלינית למחקר זה.
3. סינון מעביר-פס (Band-pass filtering)
הקלטות ה-EEG הרציפות סוננו באמצעות מסנן מעביר-פס מסדר רביעי, עם תדר קיטוע נמוך של 0.5 Hz ותדר קיטוע גבוה של 40 Hz.
4. ייחוס ממוצע נפוץ (CAR) וחלוקה לתקופות (epoching)
ייחוס ממוצע נפוץ (CAR) הוחל על הקלטות ה-EEG המסוננות. בכל דגימת זמן, חושב האות הממוצע על פני כל ערוצי ה-EEG הזמינים והופחת מכל ערוץ. אותות ה-EEG המיוחסים נשמרו לצורך ניתוח המשכי. כל הקלטת EEG מיוחסת חולקה לתקופות (epochs) באורך קבוע באמצעות הפונקציה ()make_fixed_length_epochs ב-MNE-Python. נעשה שימוש במשך תקופה של 10 s ללא חפיפה (0 s overlap).
5. תיקוף תקופות (Epoch validation)
עבור כל משתתף, נשמרו רק תקופות שלמות של 10s. כל מקטע EEG שנותר שאורכו פחות מ-10 s בסוף הקלטה נפסל. כל תקופה שנשמרה שימשה לאחר מכן כדגימה בודדת להפקת מאפיינים.
6. הכנת מאפיינים
למרות שנתוני מבחן המצב המנטלי המקוצר (MMSE) היו זמינים במערך הנתונים המקורי, הם הוצאו מהניתוח הנוכחי. המאפיינים שהופקו מה-EEG מוזגו עם מידע דמוגרפי על המשתתפים, כולל גיל ותוויות אבחנתיות, שהושגו מקובץ המטא-דאטה participants.csv. מזהה המשתתף שימש כמפתח המשותף, ורק משתתפים בעלי רשומות מאפייני EEG ומידע דמוגרפי תואם נשמרו.
מטריצת תכונות רב-המישומית כללה חמישה מאפייני שורש ממוצע ריבועים (RMS) (delta_rms, theta_rms, alpha_rms, beta_rms, ו-gamma_rms), חמישה מאפייני צפיפות ספקטרלית של הספק (PSD) (delta_psd, theta_psd, alpha_psd, beta_psd, ו-gamma_psd), וחמישה מאפייני אנטרופיה (delta_entropy, theta_entropy, alpha_entropy, beta_entropy, ו-gamma_entropy). גיל נכלל כמשתנה דמוגרפי משלים. מכיוון שהתפלגויות הגיל עשויות להשתנות בין קבוצות אבחנה, לא ניתן היה לשלול לחלוטין השפעה של משתנים דמוגרפיים מערפליים (confounding). קבוצת האבחנה, שהוגדרה כ-AD, HC או FTD, הוקצתה כתווית המטרה.
7. עיבוד מקדימה של נתונים וחלוקה למערכי אימון ובדיקה
במהלך העיבוד המקדימה, קצב הדגימה של ההקלטות הופחת מ-500 Hz ל-250 Hz כדי להפחית את הדרישות החישוביות, תוך שמירה על מידע תדרי EEG רלוונטי.
סט הנתונים חולק לתתי-קבוצות של אימון (80%) ובדיקה (20%) ברמת הנבדק באמצעות אסטרטגיית פיצול מקובצת. תחזיות ברמת הנבדק התקבלו לאחר מכן באמצעות הצבעת רוב על פני התקופות (epochs) שנחזו עבור כל משתתף. ההערכה הראשונית השתמשה בפיצול אימון-בדיקה מקובץ ברמת הנבדק כדי למנוע מצב שבו תקופות מאותו משתתף יופיעו בשתי תתי-הקבוצות. תחזיות ברמת הנבדק התקבלו באמצעות הצבעת רוב על פני התקופות שנחזו עבור כל משתתף. סט הנתונים נסרק לאיתור ערכים חסרים, ותצפיות חסרות הוסרו או הושלמו (imputed) בהתאם לצורך. תוויות אבחון קודדו. StandardScaler הותאם לנתוני האימון ולאחר מכן הוחל הן על סט נתוני האימון והן על סט נתוני הבדיקה.
8. פיתוח מודל יער אקראי (Random forest)
סווג Random Forest אותחל באמצעות 80 עצים, עומק עץ מקסימלי של 10, מקסימום של ארבעה מאפיינים, מינימום של חמישה דגימות לכל עלה, ומצב אקראי (random state) של 42. הסווג אומן באמצעות מערך נתוני האימון הסטנדרטיים.
9. הערכת המודל
תוויות הסיווג נחזו עבור מערכי הנתונים לאימון ולבדיקה כאחד. נבנתה מטריצת בלבול, וחושבו הדיוק (accuracy), הדיוק החזוי (precision), הרגישות (recall) ומדד F1, יחד עם דוח הסיווג. רשמו את רמות הדיוק באימון ובבדיקה.
עבור ההערכה ברמת המשתתף, ודאו שכל האיפוכים (epochs) של משתתף נתון הוקצו באופן בלעדי או לתת-קבוצת האימון או לתת-קבוצת הבדיקה. מסווג ה-Random Forest אומן באמצעות אותם היפר-פרמטרים ששימשו בניתוח הראשוני.
10. תיקוף צולב (Cross-validation)
כהליך נוסף להערכת המודל, בוצע תיקוף צולב מרובד בן חמישה שלבים (five-fold stratified cross-validation) תוך שימוש ב-shuffle = True וב-random_state = 30. חושבו הדיוק הממוצע וסטיית התקן על פני חמשת השלבים. ניתוח זה נבחן בנפרד מהערכת ה-holdout הראשונית ברמת הנבדק.
11. ניתוח יציבות מאפיינים
יציבות המאפיינים הוערכה על ידי חזרה על אימון Random Forest 10 פעמים תוך שימוש בזרעים אקראיים (random seeds) מ-0 עד 9. עבור כל הרצה, נרשמו דיוק הבדיקה וציוני חשיבות המאפיינים. הממוצע וסטיית התקן של ציון חשיבות המאפיין עבור כל חוזה (predictor) חושבו על פני 10 ההרצות, והחוזים דורגו לפי מידת יציבותם. ניתוח זה שימש להערכת העקביות של דירוג המאפיינים ולא כדי להחליף את ההערכה הראשונית ברמת הנבדק.
12. ניתוח בינה מלאכותית הניתנת להסבר
הוחל SHAP TreeExplainer על מודל ה-Random Forest המאומן. ערכי SHAP חושבו כדי להעריך את תרומתה של כל תכונה לתחזיות המודל. ערך ה-SHAP המוחלט הממוצע חושב עבור כל תכונה, והתכונות דורגו על פי תרומות ה-SHAP שלהן. תכונות בעלות ערכי SHAP נמוכים באופן עקבי זוהו והושוו לתוצאות של ניתוחי יציבות התכונות ושל Cohen’s d. תכונות שהראו תרומות נמוכות באופן עקבי נבחרו להסרה (ablation) ולאימון מחדש של המודל.
13. ניתוח סטטיסטי של גודל האפקט
הערך d של כהן (Cohen’s d) חושב עבור כל סמן ביולוגי של EEG עבור AD לעומת ביקורת בריאה, אלצהיימר מול FTD, ו-FTD לעומת השוואות לקבוצת הביקורת הבריאה (HC). גדלי גודל האפקט (effect-size magnitudes) פולסו באמצעות ספי השוואה של 0.20 לאפקט קטן, 0.50 לאפקט בינוני ו-0.80 לאפקט גדול.
14. בחירת תכונות משולבת
תוצאות ניתוח חשיבות התכונות של Random Forest, ניתוח SHAP וניתוח Cohen’s d הושוו. משתנים מנבאים שהראו באופן עקבי חשיבות תכונות נמוכה, תרומת SHAP נמוכה וגודל אפקט קטן, זוהו כמועמדים להסרה.
15. השבתת מאפיינים (Feature ablation)
מאפייני האנטרופיה נבחנו בניתוח השבתה (ablation analysis) גשש, ונבנתה מטריצת מאפיינים מצומצמת הכוללת RMS, PSD וגיל. מסווג ה-Random Forest אומן מחדש תוך שימוש באותם היפר-פרמטרים. אימון המודל, הבדיקה, תיקוף הצמוד (cross-validation) וניתוח עקומה של מאפייני תגובה (ROC) חזרו על עצמם באמצעות מערך המאפיינים המצומצם.
16. ניתוח ROC
הסתברויות המחלקה הופקו ממסווג Random Forest שעבר אופטימיזציה. עקומות ROC רב-מחלקתיות נוצרו באמצעות אסטרטגיית one-versus-rest. חושבו ערכי השטח תחת העקומה (AUC) עבור כל מחלקה וכן ה-AUC הממוצע.
17. השוואת ביצועים
ביצועי מודל המאפיינים המלא הושוו לביצועי מודל המאפיינים המצומצם שהתקבל לאחר השמטת מאפייני-אנטרופיה (entropy-feature ablation).