يظهر مخطط عام لسير عمل المعالجة المسبقة لتخطيط كهربائية الدماغ (EEG)، واستخراج الميزات، والتصنيف في الشكل 1. المواد والبرامج المستخدمة في الدراسة مدرجة في جدول المواد.

الشكل 1: سير عمل خط معالجة EEG مسبقاً، واستخراج الميزات، والتصنيف. نظرة عامة تخطيطية لسير عمل الدراسة، بما في ذلك التحقق من بيانات EEG، والترشيح تمرير النطاق (band-pass filtering) وإعادة المرجعية، واستخراج ميزات جذر متوسط المربعات (RMS)، وكثافة القدرة الطيفية (PSD)، وميزات الإنتروبيا، وإضافة العمر، وتقسيم بيانات التدريب والاختبار، وتطوير نموذج الغابة العشوائية (Random Forest)، وتحليل استقرار الميزات، وتحليل SHAP، وتحليل حجم تأثير Cohen’s d، والاختيار المتكامل للميزات، واستئصال ميزات الإنتروبيا، وإعادة تدريب النموذج، وتقييم الأداء. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
1. الحصول على البيانات
تم الحصول على مجموعة بيانات تخطيط كهربية الدماغ (EEG) في حالة الراحة المتاحة للعموم من مستودع OpenNeuro (مجموعة البيانات ds004504، الإصدار 1.0.9)33. وتم التحقق من تسميات المشاركين والمعلومات الديموغرافية. تكونت مجموعة البيانات من 88 مشاركاً، من بينهم 36 مشاركاً مصاباً بمرض الزهايمر (AD)، و23 مصاباً بالخرف الجبهي الصدغي (FTD)، و29 من المجموعات الضابطة السليمة (HC).
2. استيراد تسجيلات تخطيط كهربائية الدماغ (EEG)
بالنسبة لكل مشارك، تم تحميل تسجيل تخطيط كهربائية الدماغ باستخدام مكتبة MNE-Python. وتم فحص كل ملف EEG للتأكد من إمكانية الوصول إليه، وإمكانية استيراده بنجاح، واحتوائه على معرف صحيح للمشارك. كما استُبعدت التسجيلات التي كانت ملفاتها مفقودة أو تالفة. تم الإبقاء على تردد أخذ العينات الأصلي لتخطيط كهربائية الدماغ البالغ 500 Hz في هذه المرحلة، ثم خُفضت معدلات أخذ عينات الإشارات لتقليل العبء الحسابي مع الحفاظ على جميع معلومات EEG ذات الصلة سريرياً بهذه الدراسة.
3. ترشيح تمرير النطاق
تم ترشيح تسجيلات تخطيط كهربائية الدماغ (EEG) المستمرة باستخدام مرشح تمرير نطاق من الدرجة الرابعة، بتردد قطع منخفض قدره 0.5 Hz وتردد قطع مرتفع قدره 40 Hz.
4. المرجعية المتوسطة الشائعة والتقسيم إلى حقب زمنية
تم تطبيق المرجعية المتوسطة الشائعة (CAR) على تسجيلات EEG المفلترة. وعند كل عينة زمنية، تم حساب متوسط الإشارة عبر جميع قنوات EEG المتاحة وطرحه من كل قناة. تم الاحتفاظ بإشارات EEG المرجعية للتحليلات اللاحقة. وقُسم كل تسجيل EEG مرجعي إلى حقب زمنية ذات طول ثابت باستخدام دالة make_fixed_length_epochs() في مكتبة MNE-Python. وقد استُخدمت مدة حقبة زمنية قدرها 10 s مع تداخل قدره 0 s.
5. التحقق من صحة الحقبات الزمنية
بالنسبة لكل مشارك، تم الاحتفاظ فقط بالحقبات الزمنية المكتملة التي تبلغ مدتها 10s. كما تم استبعاد أي جزء متبقٍ من مخطط كهربية الدماغ (EEG) تقل مدته عن 10 s في نهاية التسجيل. واستُخدمت كل حقبة زمنية تم الاحتفاظ بها لاحقاً كعينة فردية لاستخراج الميزات.
6. تحضير الميزات
على الرغم من توفر بيانات فحص الحالة العقلية المصغر (MMSE) في مجموعة البيانات المصدر، فقد تم استبعادها من التحليل الحالي. تم دمج ميزات تخطيط كهربية الدماغ (EEG) المستخرجة مع المعلومات الديموغرافية للمشاركين، بما في ذلك العمر والتصنيفات التشخيصية، والتي تم الحصول عليها من ملف البيانات الوصفية participants.csv. استُخدم معرف المشارك كمفتاح مشترك، وتم الاحتفاظ فقط بالمشاركين الذين تتوفر لهم سجلات ميزات EEG والمعلومات الديموغرافية المقابلة.
تضمنت مصفوفة السمات متعددة المجالات خمس سمات لجذر متوسط المربعات (RMS) وهي (delta_rms و theta_rms و alpha_rms و beta_rms و gamma_rms)، وخمس سمات لكثافة القدرة الطيفية (PSD) وهي (delta_psd و theta_psd و alpha_psd و beta_psd و gamma_psd)، وخمس سمات للإنتروبيا وهي (delta_entropy و theta_entropy و alpha_entropy و beta_entropy و gamma_entropy). وقد أُدرج العمر كمتغير ديموغرافي تكميلي. ونظرًا لأن توزيعات الأعمار قد تختلف عبر المجموعات التشخيصية، لم يكن من الممكن استبعاد التداخل الديموغرافي بشكل كامل. كما تم تعيين المجموعة التشخيصية، المحددة كـ AD أو HC أو FTD، كملصق مستهدف.
7. المعالجة المسبقة للبيانات وتقسيم مجموعة التدريب والاختبار
خلال مرحلة المعالجة المسبقة، تم خفض معدل أخذ العينات للتسجيلات من 500 Hz إلى 250 Hz لتقليل المتطلبات الحسابية مع الحفاظ على معلومات تردد EEG ذات الأهمية.
تم تقسيم مجموعة البيانات إلى مجموعات فرعية للتدريب (80%) والاختبار (20%) على مستوى المفحوص باستخدام استراتيجية التقسيم المجمّع. بعد ذلك، تم الحصول على التنبؤات على مستوى المفحوص عن طريق التصويت بالأغلبية عبر الحقبات المتنبأ بها التابعة لكل مشارك. استخدم التقييم الأساسي تقسيماً مجمّعاً للتدريب والاختبار على مستوى المفحوص لمنع ظهور الحقبات التابعة لنفس المشارك في كلتا المجموعتين الفرعيتين. تم الحصول على التنبؤات على مستوى المفحوص عن طريق التصويت بالأغلبية عبر الحقبات المتنبأ بها التابعة لكل مشارك. كما تم فحص مجموعة البيانات بحثاً عن القيم المفقودة، وتمت إزالة الملاحظات المفقودة أو تعويضها حسب الاقتضاء. وتم ترميز التسميات التشخيصية. كما تم تطبيق StandardScaler على بيانات التدريب ثم تعميمه على كل من مجموعتي بيانات التدريب والاختبار.
8. تطوير نموذج الغابة العشوائية
تم تهيئة مصنف الغابة العشوائية (Random Forest) باستخدام 80 شجرة، وبحد أقصى لعمق الشجرة يبلغ 10، وبحد أقصى أربع ميزات، وبحد أدنى خمس عينات لكل ورقة، وحالة عشوائية 42. وقد تم تدريب المصنف باستخدام مجموعة بيانات التدريب المعيارية.
9. تقييم النموذج
تم التنبؤ بتصنيفات الفئات لكل من مجموعتي بيانات التدريب والاختبار. كما تم إنشاء مصفوفة الارتباك، وحساب الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1-score، وذلك جنباً إلى جنب مع تقرير التصنيف. وتم تسجيل دقة التدريب والاختبار.
بالنسبة للتقييم على مستوى المشارك، تأكد من تعيين جميع العصور (epochs) الخاصة بمشارك معين حصرياً إما إلى المجموعة الفرعية للتدريب أو المجموعة الفرعية للاختبار. تم تدريب مصنف الغابة العشوائية (Random Forest classifier) باستخدام نفس المعلمات الفائقة المستخدمة في التحليل الأساسي.
10. التحقق المتقاطع
كإجراء إضافي لتقييم النموذج، تم إجراء تحقق متقاطع طبقي خماسي الطيات (five-fold stratified cross-validation) باستخدام shuffle = True و random_state = 30. وتم حساب متوسط الدقة والانحراف المعياري عبر الطيات الخمس. وقد اعتبر هذا التحليل منفصلاً عن تقييم الاستبعاد الأساسي على مستوى المشاركين.
11. تحليل استقرار الميزات
تم تقييم استقرار الميزات عن طريق تكرار تدريب الغابة العشوائية (Random Forest) 10 مرات باستخدام بذور عشوائية من 0 إلى 9. وفي كل تشغيل، تم تسجيل دقة الاختبار ودرجات أهمية الميزات. كما تم حساب المتوسط والانحراف المعياري لدرجة أهمية الميزات لكل متنبئ عبر التشغيلات العشرة، ورُتبت المتنبئات وفقاً لاستقرارها. استُخدم هذا التحليل لتقييم اتساق ترتيب الميزات بدلاً من استبدال التقييم الأساسي على مستوى الأشخاص.
12. تحليل الذكاء الاصطناعي القابل للتفسير
تم تطبيق SHAP TreeExplainer على نموذج Random Forest المدرب. وحُسبت قيم SHAP لتقدير مساهمة كل ميزة في تنبؤات النموذج. كما حُسب متوسط القيمة المطلقة لـ SHAP لكل ميزة، ورُتبت الميزات وفقاً لمساهمات SHAP الخاصة بها. تم تحديد الميزات ذات قيم SHAP المنخفضة باستمرار ومقارنتها بنتائج تحليلات ثبات الميزات وCohen’s d. ثم اختيرت الميزات التي أظهرت مساهمات منخفضة باستمرار لإجراء عملية الاستئصال (ablation) وإعادة تدريب النموذج لاحقاً.
13. تحليل حجم التأثير الإحصائي
تم حساب قيمة Cohen’s d لكل مؤشر حيوي في تخطيط كهربية الدماغ (EEG) للمقارنات بين مرض الزهايمر (AD) مقابل المجموعة الضابطة الصحية (HC)، ومرض الزهايمر (AD) مقابل الخرف الجبهي الصدغي (FTD)، والخرف الجبهي الصدغي (FTD) مقابل المجموعة الضابطة الصحية (HC). وتم تفسير أحجام التأثير باستخدام عتبات 0.20 للتأثير الصغير، و0.50 للتأثير المتوسط، و0.80 للتأثير الكبير.
14. اختيار الميزات المتكامل
تمت مقارنة نتائج تحليل أهمية الميزات باستخدام الغابة العشوائية (Random Forest)، وتحليل SHAP، وتحليل Cohen’s d. وقد تم تحديد المتنبئات التي أظهرت باستمرار أهمية ميزات منخفضة، ومساهمة SHAP ضئيلة، وأحجام تأثير صغيرة كمرشحة للاستبعاد.
15. استئصال الميزات
تم تقييم ميزات الإنتروبيا في تحليل استئصال استكشافي، وتم بناء مصفوفة ميزات مختزلة تحتوي على RMS وPSD والعمر. أُعيد تدريب مصنف الغابة العشوائية (Random Forest) باستخدام نفس المعلمات الفائقة. كما كُررت عمليات تدريب النموذج، والاختبار، والتحقق المتقاطع، وتحليل خصائص تشغيل المستقبل (ROC) باستخدام مجموعة الميزات المختزلة.
١٦. تحليل منحنى خصائص التشغيل للمستقبل (ROC analysis)
تم الحصول على احتمالات الفئات من مصنف الغابة العشوائية (Random Forest) المُحسَّن. كما تم إنشاء منحنيات خصائص تشغيل المستقبل (ROC) متعددة الفئات باستخدام نهج واحد-مقابل- استراتيجية الراحة. تم حساب قيم المساحة تحت المنحنى (AUC) لكل فئة على حدة، بالإضافة إلى متوسط المساحة تحت المنحنى.
17. مقارنة الأداء
تمت مقارنة أداء نموذج الميزات الكامل مع أداء نموذج الميزات المختزل الذي تم الحصول عليه بعد عملية استئصال ميزات الإنتروبيا.