يصف هذا البروتوكول التنفيذ خطوة بخطوة لنموذج التعلم العميق الهجين (HDRL) لدمج الإشارات الطبية الحيوية متعددة الوسائط. يدمج الإطار تقنيات التعلم العميق والتعلم المعزز لتحسين دمج بيانات تخطيط القلب الكهربائي وتخطيط الدماغ والتصوير الطبي في الوقت الحقيقي. كما يوضح القسم إجراءات استخراج الميزات، والتدريب، وتحضير البيانات المستخدمة في النموذج المقترح.
المواد
أجريت جميع التجارب على محطة عمل مزودة بمعالج رئيسي متعدد النوى، وذاكرة RAM بسعة ≥32 جيجابايت، وبطاقة رسومات مخصصة (≥8 جيجابايت من ذاكرة VRAM). تكونت بيئة التنفيذ من بايثون (الإصدار 3.9 أو أحدث)، تينسورفلو (الإصدار 2.12)، وكيراس (الإصدار 2.12). تم تثبيت مكتبات التعلم المعزز باستخدام pip install stable-baselines3. توفر حزمة Stable-Baselines3رقم 18 تطبيقات فعالة لخوارزميات التعلم التعزيزي، مثل شبكة Q العميقة (DQN) وتحسين السياسات القريبة (PPO).
مجموعات البيانات
تم تقييم إطار التعلم الهجين العميق المعزز (HDRL) المقترح باستخدام ثلاث مجموعات بيانات طبية حيوية متاحة للجمهور تمثل أنواع الإشارات متعددة الوسائط. (1) تحدي PhysioNet 2016: مجموعة من تسجيلات تخطيط القلب ب 12 رصاصا من مرضى أمراض القلب، بما في ذلك الرجفان الأذيني، واضطراب نظم البطين، وأمراض القلب الإقفاري. تتضمن مجموعة البيانات تسميات مشروحة لحالات القلب19. (2) قاعدة بيانات تخطيط الدماغ لفروة الرأس CHB-MIT: تستخدم مجموعة بيانات لتسجيلات تخطيط الدماغ في فروة الرأس لاكتشاف نوبات الصرع، مع تعليقات تشير إلى أحداث النوبات وغير النوبات20. (3) قاعدة بيانات OASIS-3 للرنين المغناطيسي: تستخدم مجموعة من صور الدماغ بالرنين المغناطيسي والتقييمات السريرية لاكتشاف ومراقبة مرض الزهايمر21. تظهر العينات الممثلة من كل نمط التفاوت الفطري وخصائص الضوضاء الموجودة في البيانات الطبية الحيوية متعددة الوسائط (الشكل 2).

الشكل 2: عينات من الإشارات الطبية الحيوية من تخطيط القلب الكهربائي، تخطيط الدماغ الكهربائي، والتصوير الطبي. أمثلة تمثيلية لشكل موجة تخطيط القلب الكهربائي، وإشارة تخطيط الدماغ، وفحص تصوير طبي يوضح الأساليب المختلفة المستخدمة في الدراسة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
معالجة البيانات المسبقة
خضع كل وسيلة لإجراءات معالجة مسبقة خاصة بكل طريقة لضمان تمثيل مدخل موحد. تم ترشيح إشارات EEG وECG باستخدام مرشح تمرير النطاق من الدرجة الرابعة Butterworth. تم ضبط نطاق التردد بين 0.5–40 هرتز لتخطيط الدماغ و0.5–45 هرتز للتخطيط الكهربائي الكهربائي. تم تقسيم العينات إلى نوافذ مدتها 5 ثوان مع تداخل بنسبة 50٪. تم تطبيع كل إشارة عن طريق تقسيمها لتحقيق تباين متوسط ووحدة صفرية. تمت معالجة صور الرنين المغناطيسي باستخدام إزالة الجمجمة باستخدام أداة استخراج الدماغ FSL (BET). تم تغيير حجم الصور إلى 224 × 224 بكسل. تم تطبيع شدة البكسل إلى نطاق [0,1] لتوحيد توزيعات الإدخال.
استخراج الميزات
تم استخراج الميزات بشكل مستقل لكل وسيلة باستخدام DNNs، لضمان التقاط الخصائص الفريدة لكل طريقة بشكل فعال.
تتميز أجهزة استخراج تخطيط القلب وتخطيط الدماغ الكهربائية:
تم استخدام بنية شبكة عصبية الالتفافية أحادية البعد (1D-CNN) لمعالجة الإشارات على السلاسل الزمنية. تكونت البنية من (1) طبقة إدخال (window_length، 1)، (2) طبقات Conv1D مع 64 مرشحا وحجم نواة 3، (3) تفعيل ReLU، (4) MaxPooling1D بحجم تجمع=2، (5) طبقات مسطحة وكثيفة (128 وحدة، ReLU). تم استخراج تمثيلات الطبقة الكثيفة قبل الأخيرة كمتجهات ميزات خاصة بالنمط.
مستخرج ميزات الرنين المغناطيسي
تم ضبط نموذج CNN ثنائي الأبعاد مدرب مسبقا (مثل VGG16 أو ResNet50) لاستخراج الميزات المكانية من صور الرنين المغناطيسي. تم تدريب CNN على مجموعة بيانات OASIS-3، مع تعديل الطبقات الأخيرة من النموذج المدرب مسبقا للتكيف مع مهمة التصنيفالمحددة 21. تم استبدال طبقات التصنيف النهائية بطبقات خاصة بالمهمة، وتم استخراج ميزات مكانية عالية المستوى من الطبقة قبل الأخيرة 5,6.
بنية النماذج والتدريب
تم تطوير وتدريب إطار التعلم العميق الهجين المقترح (HDRL) على مرحلتين متسلسلتين: استخراج الميزات حسب الأسلوب الدراسي، تليها تحسين الدمج القائم على التعلم التعزيزي. في المرحلة الأولى، تم تدريب شبكات عصبية الالتفافية منفصلة (CNNs) على بيانات معنونة لأنماط تخطيط القلب الكهربائي وتخطيط الدماغ وتصوير بالرنين المغناطيسي. تم استخدام محسن تقدير العزم التكيفي (آدم) بمعدل تعلم 0.001 وفقدان إنتروبيا متقاطع تصنيفي خلال التدريب تحت الإشراف. بعد التقارب، تم استخراج تمثيلات عالية المستوى من الطبقة قبل الأخيرة لكل CNN، مما أدى إلى استخدام متجهات ميزات خاصة بالنمط F ECG =CNN ECG (X ECG)، FECG = CNN ECG (X ECG) و F MRI = CNNMRI(XMRI). تم دمج هذه المتجهات لتشكيل تمثيل موحد متعدد الوسائط Fconcat = [F ECG,F EEG, FMRI]، والذي يعمل كمدخل لمرحلة التعلم التعزيزي.
تمت صياغة عملية الاندماج كعملية قرار ماركوف (MDP)، حيث كانت الحالة s تتوافق مع متجه الميزات المتسلسلة Fالمتراكم، وتمثل الفعل اختيار استراتيجية الاندماج (إما الجمع الموزون أو الربط المباشر)، وتعرف المكافأة r كدقة تصنيف تم الحصول عليها من مصنف لاحق مدرب على الميزات المندمجة. تم تقريب دالة قيمة الفعل Q(s,a) باستخدام شبكة Q العميقة (DQN)، التي قدرت المكافأة
التراكمية المتوقعة. تم تحديث معلمات النموذج بشكل تكراري وفقا للقاعدة.

حيث α = 0.0001 هو معدل التعلم، γ = 0.99 هو عامل الخصم وs يرمز إلى الحالة التالية.
خلال تحسين التعلم التعزيزي، تم تدريب النموذج على 1000 حلقة مع حجم دفعة 32. تم اعتماد استراتيجية جشع إبسيلون لتحقيق التوازن بين الاستكشاف والاستغلال، حيث
تم تهيئة المعدل عند 1.0 وتحلل بنسبة 0.995 لكل حلقة. مع الاحتمالية
، تم اختيار استراتيجية اندماج عشوائي، بينما مع احتمال 1 -
، تم اختيار الاستراتيجية ذات القيمة التقديرية الأعلى Q. تمت مراقبة تقارب المكافأة طوال فترة التدريب، مع أداء مستقر (>0.85 مكافأة تراكمية) يلاحظ عادة في حوالي 500 حلقة.
يتضمن سير عمل HDRL معالجة مسبقة للإشارات متعددة الوسائط، واستخراج ميزات عميقة خاصة بالنمطية، وتشكيل تمثيل حالة موحد، واختيار استراتيجيات الاندماج، وتحسين السياسة باستخدام تغذية راجعة التصنيف من وكيل DQN. يشكل التفاعل بين مستخرجات الميزات المعتمدة على CNN وعامل التعلم المعزز نظام دمج تكيفي مغلق الحلقة (الشكل 3)، مما يمكن من تحديث السياسات بناء على تغذية راجعة المكافآت.

الشكل 3: مخطط التدفق لسير العمل المقترح للتعلم العميق الهجين (HDRL). مخطط سير العمل يوضح استخراج ميزات CNN الخاصة بالنمط، ودمج الميزات، والاختيار القائم على التعلم المعزز لاستراتيجية الاندماج (DQN/PPO)، والتصنيف اللاحق، وتحديث السياسات المعتمدة على المكافآت. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.