المرض الأكثر تهديداً في العالم هو ورم الدماغ. يمكن أن يكون التشخيص الدقيق مفيداً لبقاء المرضى. ومع ذلك، لا يزال هناك حاجة إلى نظام تشخيصي دقيق يمكنه اكتشاف أورام الدماغ في مراحلها المبكرة. ولحل هذه المشكلة، تم اقتراح تقنية أكثر موثوقية لاكتشاف أورام الدماغ بدقة في مراحلها المبكرة، وذلك باستخدام آلية هجينة مزدوجة للتعلم العميق مع معاملات فائقة مُحسَّنة وطبقات مُهيأة بدقة تعتمد على نموذجي DenseNet121 وEfficientNetB7. يستخدم النهج المقترح صور الرنين المغناطيسي ثنائية الأبعاد كمدخلات، وينتج تنبؤاً إما بوجود ورم أو عدم وجود ورم لمجموعة البيانات ثنائية التصنيف Br35H، وتصنيف الأورام لأربع مجموعات بيانات أخرى متعددة التصنيف. وبالتالي، توضح هذه الفقرة الخطوات الرئيسية للنهج المقترح، بدءاً من جمع البيانات وحتى الناتج النهائي، بما في ذلك اقتناء البيانات، ومعالجة البيانات مسبقاً، وتقسيم البيانات، واختيار النموذج، واستخراج السمات، والتنبؤ بالورم، وتقييم النموذج المقترح، كما هو موضح في الشكل 1.

الشكل 1: تدفق منهجية العمل المقترحة. يُظهر هذا المخطط البنية الشاملة للنموذج المقترح، بما في ذلك الحصول على البيانات والمعالجة المسبقة؛ نموذجين مُدرّبين مسبقًا لاستخراج السمات؛ دمج السمات المستخرجة منهما؛ وضبط المعاملات الفائقة لتصنيف الورم ونوعه. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
استخلاص البيانات
في أي بحث تجريبي، تكون الخطوة الأولى هي اقتناء البيانات.为此، تم اختيار خمسة مجموعات بيانات مختلفة متاحة علنًا، بما في ذلك Br35H24، وFigshare25، وSartaj26، وMasoud27، ومجموعة بيانات صور الرنين المغناطيسي لأورام الدماغ من المكتبة مفتوحة المصدر Kaggle28، والتي استخدمها بالفعل العديد من الباحثين لتشخيص اكتشاف أورام الدماغ. وتضم مجموعة بيانات Br35H ما مجموعه 3000 صورة مقسمة إلى صنفين: صور دماغ سليم وصور دماغ غير سليم (ورم)، بواقع 1500 صورة لكل صنف. أما مجموعة بيانات Figshare فتضم 3064 صورة، موزعة على ثلاث مجموعات حسب نوع الورم: 1426 صورة لورم الدبلاستوما (glioma)، و708 صور لورم السحايا (meningioma)، و930 صورة لأورام الغدة النخامية (pituitary). وتضم مجموعة بيانات Sartaj ما مجموعه 3264 صورة مصنفة إلى أربع فئات من الأورام: الدبلاستوما (926 صورة)، وورم السحايا (937 صورة)، وأورام الغدة النخامية (901 صورة)، وحالة سليمة أو خالية من الورم (500 صورة). كما تضم مجموعة بيانات Masoud أربع فئات مختلفة من الأورام، وقد تم جمع صورها من المجموعات الثلاثة المذكورة سابقًا، بإجمالي 7023 صورة، مصنفة إلى ورم الدبلاستوما (1621 صورة)، وورم السحايا (1645 صورة)، وورم الغدة النخامية (1757 صورة)، وحالة سليمة أو خالية من الورم (2000 صورة). أما المجموعة الخامسة والأخيرة فهي مجموعة بيانات مبنية على صور الرنين المغناطيسي، وتشمل أيضًا أربع فئات بإجمالي 5248 صورة، موزعة بالتساوي إلى أنواع الأورام: 1312 صورة لورم الدبلاستوما، و1312 صورة لورم السحايا، و1312 صورة لأورام الغدة النخامية، و1312 صورة لحالة سليمة أو خالية من الورم، وتُعد هذه المجموعة متوازنة نظرًا لتوزيعها المتساوي بين الفئات.
المعالجة الأولية للبيانات
بعد اقتناء البيانات، تأتي الخطوة التالية وهي المعالجة المسبقة، وهي خطوة ضرورية للحصول على نتائج أفضل وأكثر فائدة للأساليب الحسابية لاستخلاص أفضل السمات من البيانات والتعلم منها، وبالتالي إنتاج نتائج أكثر دقة. أول خطوة تم تطبيقها كانت تغيير حجم الصور. تم اختيار خمس قواعد بيانات متاحة للعامة، تحتوي على فئات مختلفة وأحجام صور مختلفة، حتى داخل نفس قاعدة البيانات، وذلك حسب فئات الأورام المختلفة، ثم تم توحيد حجم جميع الصور إلى 224 × 224 لتحسين تفسير النموذج وتعلمه. علاوة على ذلك، تم تطبيق تضخيم البيانات على جميع قواعد البيانات من خلال إنشاء عينات إضافية من زوايا مختلفة، مما يحسّن استخلاص السمات والتعلم بواسطة نماذج التعلم العميق (DL). ولتحقيق ذلك، تم تطبيق مدى دوران بنسبة 7% على جميع الصور، بحيث تدور حتى 7 درجات. بالإضافة إلى ذلك، تم تطبيق إزاحة عشوائية بنسبة 5% على جميع الصور أفقياً ورأسياً، مع إزاحة بنسبة 5% في الارتفاع والعرض بالنسبة للصور الأصلية. بعد ذلك، تم تكبير الصور بنسبة 10% بالنسبة للصور الأصلية، وأخيراً تم قلب جميع الصور أفقياً ورأسياً. السبب الرئيسي لإجراء تضخيم البيانات29 هو التغلب على الإفراط في التخصيص (overfitting) وتحسين قدرة التعميم للنماذج من خلال تدريبها على إصدارات مختلفة ومُحوّلة من العينات الأصلية. قبل تقسيم قواعد البيانات إلى مجموعات تدريب وتحقق، تم تطبيق ترميز التسمية (label encoding)، وهو ما يُعد أكثر فائدة في حساب الخسارة (loss) أثناء التدريب والتحقق، كما يجعل عينات البيانات أكثر أهمية للنماذج لمعالجة التسميات بشكل صحيح. بالإضافة إلى ذلك، تم تقسيم قاعدة البيانات إلى مجموعتي تدريب وتحقق بنسبة 80% إلى 20%30 على التوالي، ويوضح الجدول 2 التوزيع الكلي لعينات البيانات ونِسب التدريب والتحقق الخاصة بها.
| مجموعة البيانات | فئات الأورام | إجمالي الصور | صور التدريب | صور التحقق |
| Br35H | سليمة | 1500 | 1200 | 300 |
| ورم | 1500 | 1200 | 300 |
| إجمالي الصور | 3000 | 2400 | 600 |
| Figshare | الورم الدبقي | 1426 | 1141 | 285 |
| الورم السحائي | 708 | 566 | 142 |
| الورم النخامي | 930 | 744 | 186 |
| إجمالي الصور | 3064 | 2451 | 613 |
| Sartaj | الورم الدبقي | 926 | 741 | 185 |
| الورم السحائي | 937 | 749 | 188 |
| لا يوجد ورم | 500 | 400 | 100 |
| الورم النخامي | 901 | 721 | 180 |
| إجمالي الصور | 3264 | 2611 | 653 |
| Masoud | الورم الدبقي | 1621 | 1297 | 324 |
| الورم السحائي | 1645 | 1316 | 329 |
| لا يوجد ورم | 2000 | 1600 | 400 |
| الورم النخامي | 1757 | 1405 | 352 |
| إجمالي الصور | 7023 | 5618 | 1405 |
| Balanced brain tumor dataset (BBT-Dataset) | الورم الدبقي | 1312 | 1050 | 262 |
| الورم السحائي | 1312 | 1050 | 262 |
| لا يوجد ورم | 1312 | 1050 | 262 |
| الورم النخامي | 1312 | 1050 | 262 |
| إجمالي الصور | 5248 | 4200 | 1048 |
الجدول 2: توزيع مجموعة البيانات. يعرض الجدول إحصائيات حسب الفئة حول إجمالي عدد الصور، وعدد الصور المستخدمة في التدريب، وعدد الصور المستخدمة في التحقق في مجموعات بيانات أورام الدماغ.
تتكون مجموعة بيانات Br35H من 3000 صورة، تم اختيار 2400 منها للتدريب و600 للتحقق. وتضم مجموعة بيانات Figshare 3064 صورة. من بين جميع الصور، تم اختيار 2451 للتدريب، والـ 613 المتبقية للتحقق. وتضم مجموعة بيانات Sartaj ما مجموعه 3264 صورة، استُخدم منها 2611 للتدريب، والـ 653 المتبقية للتحقق. وتضم مجموعة بيانات Masoud ما مجموعه 7023 صورة؛ استُخدم منها 5618 للتدريب، والـ 1405 المتبقية للتحقق. وتضم مجموعة بيانات BBT ما مجموعه 5248 صورة. من إجمالي الصور، اُعتبرت 4200 صورة لأغراض التدريب، في حين اُعتبرت الـ 1048 الصورة المتبقية لأغراض التحقق. بالإضافة إلى ذلك، الشكل 2 يوضح الشكل أدناه صورًا مختلفة للأورام الدماغية.

الشكل 2: صور أورام الدماغ، بما في ذلك أنواع الأورام. يحتوي المجموعة على أربع صور لأنسجة دماغية سليمة وثلاث صور لأورام: ورم دبقي، سرطان سحائي، وورم في الغدة النخامية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
النموذج المقترح
بعد مرحلة المعالجة المسبقة، تتمثل الخطوة التالية في اقتراح نموذج تدريب فعّال يُستخدم فقط لتصنيف أورام الدماغ.为此، تم اقتراح نموذج فعّال للتدريب، مخصص خصيصًا لتصنيف أورام الدماغ. لهذا الغرض، يُقترح نموذج مُدرَّب مسبقًا قائم على دمج ميزات هجين جديد وفعال، يشمل DenseNet12131,32 وEfficientNetB733، والتي استُخدمت لاستخراج الميزات من الصور، وبعد ذلك تم دمج هذه الميزات المستخرجة وتمريرها إلى معلمات فائقة مختلفة تم ضبطها بدقة، بما في ذلك طبقات قابلة للتدريب وغير قابلة للتدريب، من أجل تشخيص أورام الدماغ بدقة، وتم تنفيذ هذا النموذج على خمسة مجموعات بيانات مختلفة متاحة للعامة، والتي نوقشت في الأقسام المرتبطة أعلاه. علاوةً على ذلك، تم تطوير نموذج DenseNet121 من قبل جاو هوانغ وزملائه في عام 2017 ويتكون من 121 طبقة. كان الهدف الرئيسي من هذا النموذج هو التركيز على تعظيم إعادة استخدام الميزات وتجنب مشكلة تلاشي التدرج34. يتم تنظيم الطبقات في هذا النموذج إلى كتل كثيفة، تحتوي كل منها على طبقات تلافيفية متعددة تقوم باستخراج الميزات وتعلُّمها. تستقبل كل طبقة خريطة الميزات من جميع الطبقات السابقة كمدخل، ويتم ربط مخرجها بمخرجات تلك الطبقات وتمريرها كمدخل للطبقات اللاحقة في نفس الكتلة بطريقة تغذية أمامية. علاوةً على ذلك، تُضاف طبقات انتقالية بين الكتل الكثيفة، تتكون كل منها من طبقة تلافيفية 1 × 1، وطبقة تسوية دُفعة (BatchNormalization)، وطبقات تجميع متوسطة 2 × 2، والتي تعمل على تقليل خريطة الميزات للتحكم في تعقيد النموذج. بالإضافة إلى ذلك، تُضاف طبقة نهائية بوظيفة تنشيط SoftMax (AF) قبل طبقة تجميع متوسطة عالمية للتصنيف. ويُظهر الشكل 334 أدناه التصميم الأساسي لنموذج DenseNet121.

الشكل 3: تفاصيل بنية DenseNet12134. يوضح هذا الشكل التفاصيل البنائية لنموذج DenseNet121، بما في ذلك جميع الكتل الكثيفة وكتل الانتقال. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
علاوة على ذلك، تم اختراع نموذج EfficientNetB7 من قبل تان ولي في عام 2019. وينتمي هذا النموذج إلى عائلة EfficientNet، التي تتضمن نُسَخًا تتراوح من B0 إلى B7، وهدفه الأساسي هو التفوق على النماذج الأخرى مع استخدام عدد أقل من المعلمات وقدر أقل من القوة الحاسوبية. ويمكن ضبط عرض النموذج (عدد القنوات لكل طبقة) وعمقه (عدد الطبقات) ودقة المدخلات بدقة من خلال التدرج المركب، وهو الميزة الأساسية للنموذج. ويتكون هذا النموذج أيضًا من كتل MBConv (الالتواء العكسي المتنقل التلافيفي)، والتي تتضمن طبقة توسيع تلافيفية 1 × 1 مسؤولة عن توسيع القنوات، وطبقة تلافيف منفصلة حسب العمق (depthwise separable convolution) تقوم بتطبيق التلافيف على كل قناة على حدة، وطبقة إسقاط تلافيفية 1 × 1 تُقلل عدد القنوات إلى عددها الأصلي. وتحتوي كل كتلة MBConv أيضًا على كتل الضغط والتحفيز (Squeeze and Excitation (SE))35، التي تقوم بإعادة معايرة الخصائص الخاصة بكل قناة، مما يساعد الشبكة على التركيز على أهمها. وبدلًا من دالة السيجمويد أو أي دالة تنشيط أخرى، تُستخدم دالة Swish، التي تتفوق على دالة ReLU من خلال السماح بالقيم السالبة، مما يُحسّن تدفق التدرجات. علاوةً على ذلك، تُضاف طبقة مخرجات نهائية تستخدم دالة تنشيط SoftMax قبل طبقة التجميع المتوسطة الشاملة (global average pooling layer) لأغراض التصنيف. ويُظهر الشكل 435 التصميم الأساسي لنموذج EfficientNetB7، في حين يُظهر الشكل 5 البنية الموصى بها للنموذج.

الشكل 4: تفاصيل بنية EfficientNetB735. يوضح هذا الشكل التفاصيل المعمارية لنموذج EfficientNetB7، بما في ذلك جميع كتل التلافيف المعكوسة المتنقلة ذات العُقدة الضيقة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 5: هيكل النموذج المدمج الهجين المقترح. يوضح الهيكل المقترح كيفية تمرير الصور المعالجة مسبقًا إلى مستخرج السمات، والذي يتكون من ثلاثة كتل مخصصة ذات معلمات فائقة مختلفة، تليها طبقة مخرجات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
بالإضافة إلى ذلك، تم استخراج الخصائص الأولى من نماذج DenseNet121 وEfficientNetB7 المُدرَّبة مسبقًا. تم تحميل الأوزان المُحدَّثة للنماذج المُدرَّبة مسبقًا على النماذج المُدرَّبة، وتجميد الطبقات الأساسية غير القابلة للتدريب لمنع إعادة تدريب النموذج مرة أخرى. وينبغي أن يساعد ذلك النموذج على الاحتفاظ بأفضل معرفة سابقة له، وتعديلها في ضوء عينات البيانات الجديدة لتحسين التقارب، والتركيز على الطبقات الإضافية من أجل التدريب واستخراج الخصائص المتقدمة. توضح المعادلتان 1 و2 أدناه طريقة عمل نموذجَي DenseNet120 وEfficientNetB7.
(1)
(2)
تُظهر المعادلتان 1 و 2 أعلاه طريقة عمل النموذج المدرب مسبقًا فيما يتعلق باستخراج الخصائص؛ حيث يدل F1 على خرائط الخصائص الناتجة عن النموذج المدرب مسبقًا DenseNet121، ويدل F2 على خرائط الخصائص الناتجة عن النموذج المدرب مسبقًا EfficientNetB7 من خلال تطبيق معالجة على الصور المدخلة، والتي يُرمز إليها بـ X. علاوة على ذلك، فإن W1 و W2 هي معلمات قابلة للتعلم أو أوزان مرتبطة بالكتل والطبقات الأولى لكل من نموذجي DenseNet121 و EfficientNetB7 على التوالي. كذلك، فإن ∈ RN ×H1×W1×C1 و ∈ RN ×H2×W2×C2 تمثل أبعاد خرائط الخصائص الناتجة من نموذجي DenseNet121 و EfficientNetB7 على التوالي، مع أبعاد H1 ×N×W1×C1 و H2 ×N×W2×C2، حيث يمثل N حجم الدفعة للصور، والذي اُعتبر 16. كما يمثل H1×W1 الارتفاع والعرض للصور على التوالي بالنسبة لنموذج DenseNet121، ويمثل H2×W2 الارتفاع والعرض للصور بالنسبة لنموذج EfficientNetB7، وقد تم اختيار مقاسات 224 × 224 للارتفاع والعرض. وتمثل C1 و C2 قناة اللون لكل من نموذجي DenseNet121 و EfficientNetB7 على التوالي. بعد الحصول على خرائط الخصائص الناتجة من النموذج، وهي 2560 قناة من EfficientNetB7 و 1024 من DenseNet121، تُطبَّق طبقة التجميع المتوسط العالمي ثنائي الأبعاد 2D36 على خرائط الخصائص الناتجة لتقليل البُعد المكاني من خلال أخذ المتوسط لجميع الأبعاد المكانية إلى متجه واحد، مما يجعل من الأسهل تمريرها إلى الطبقة التالية لتحسين استخراج الخصائص والتمييز بين الأنماط من حيث الخصائص القابلة للتفسير.
(3)
(4)
تُظهر المعادلتان 3 و4 أعلاه كيفية عمل طبقة التجميع المتوسطة العالمية ثنائية الأبعاد (Global Average Pooling 2D) المطبقة على نموذلي DenseNet121 وEfficientNetB7 على التوالي، حيث يُمثل
و
إجراء تسوية المجموع من خلال قسمة المجموع الكلي على عدد المواقع المكانية لكل من النموذجين، لضمان أن يكون الناتج بعد التجميع هو متوسط وليس مجموعًا بسيطًا. وتمثل
و
عملية الجمع على الأبعاد المكانية لخرائط الميزات، في حين أن i وj يستخدمان فقط للتكرار على الارتفاع والعرض على التوالي، من أجل جمع خرائط الميزات لكلا النموذجين. علاوةً على ذلك، فإن F1(i, j, :) وF2(i, j, :) يمثلان قيم خرائط الميزات عند مواضع مكانية محددة (i, j) عبر جميع القنوات لكل من نموذلي DenseNet121 وEfficientNetB7 على التوالي. وتُجمع عملية التجميع هذه المعلومات المكانية في تمثيل أكثر إحكامًا ودقة مع الحفاظ على أهم الميزات عبر كل صورة. بالإضافة إلى ذلك، يتم دمج مخرجات طبقات التجميع المتوسطة العالمية لإنتاج متجه ميزة واحد لكل عينة، ويُستخدم هذا المتجه عادةً لدمج ميزات من نماذج مختلفة لتحسين الأداء من خلال الاستفادة من نقاط قوة كلا النموذجين؛ وتوضح المعادلة 5 كيفية عمل ذلك.
(5)
توضح المعادلة 5 أعلاه إجراء الدمج لاتّحاد متجهين مميزين من نموذجين مختلفين [G1، G2]، حيث يمثل G1 متجه الخصائص الخاص بنموذج DenseNet121، ويمثل G2 متجه الخصائص الخاص بنموذج EfficientNetB7، في حين يُعبّر عن شكل متجه الخصائص المدمج بالرمز RN ×(C1+ C2)، حيث يشير N إلى حجم الدفعة (batch size)، وهو ما يمثل عدد العينات التي تُعالج بشكل متوازٍ، و(C1+ C2) تمثل العدد الكلي للخصائص المستخلصة من النموذجين 1 و2 على التوالي، والذي يبلغ حوالي 3584 خاصية، وتُعالج هذه الخصائص بشكل متوازٍ، ويُعبّر عن متجه الخصائص الناتج من الدمج بالرمز G. علاوةً على ذلك، تم إضافة ثلاثة كتل مختلفة لتعديل النموذج المدمج بهدف استخلاص خصائص أكثر تعقيدًا، وتحسين التعميم، ومنع الإفراط في التخصيص (overfitting)، وذلك للحصول على نتائج أكثر دقة وكفاءة. تتكون كل كتلة من طبقة كثيفة (dense layer) تحتوي على عدد مختلف من الخلايا العصبية، حيث تحتوي الكتلة الأولى على 1024 خلية عصبية في طبقاتها الكثيفة، وتُركّز على التقاط طائفة واسعة من الخصائص وأنماط عامة في البيانات، في حين تحتوي الكتلة الثانية على 512 خلية عصبية في طبقتها الكثيفة، والتي تقوم بتنقيح الخصائص بشكل محدد من خلال تقليل البُعد (reducing dimensionality) والتركيز على أنماط أكثر تحديدًا. أما الكتلة الثالثة فتحتوي على 256 خلية عصبية في طبقتها الكثيفة، والتي تقوم بتركيز الخصائص بشكل أدق لضمان تمرير الخصائص والأنماط الأكثر صلةً فقط إلى الطبقة النهائية لأداء مهمة أكثر ملاءمة. علاوةً على ذلك، تم إضافة تقنيات تنظيم L237 إلى كل طبقة كثيفة ضمن كل كتلة لمنع الإفراط في التخصيص من خلال معاقبة الأوزان الكبيرة، مما يزيد أيضًا من تعقيد النموذج. كما تم إدخال طبقة إسقاط (dropout layer)38 بعد كل كتلة بهدف تجاهل 30% و20% و10% من الخلايا العصبية عشوائيًا في الكتل 1 و2 و3 على التوالي، مما يُجبر الشبكة على تطوير خصائص أكثر قوة وعدم الاعتماد على خلية عصبية واحدة فقط. بالإضافة إلى ذلك، ولتثبيت عملية التدريب، تم تطبيق طبقة تسوية الدُفعة (BatchNormalization)39 بعد كل طبقة كثيفة، مما يضمن بقاء التفعيلات ضمن نطاق مستقر، ويساعد النموذج على تجنب مشاكل مثل تلاشي التدرجات (vanishing gradients) أو انفجارها (exploding gradients) أثناء مرحلة التدريب. كما ساهمت طبقة التسوية هذه أيضًا في تسريع عملية التدريب، حيث مكّنت النموذج من التقارب بشكل أسرع من خلال تسوية سطح دالة الخسارة، مما سهّل الوصول إلى القيم الدنيا العالمية للمُحسّنات (optimizers). علاوةً على ذلك، تم استخدام دالة تفعيل Leaky ReLU40 في كل كتلة لإنتاج سلوك غير خطي، مما يسمح للنموذج بتعلّم أنماط معقدة، وتتميّز دالة Leaky ReLU هذه بميزات تفوق بها دوال التفعيل الأخرى، حيث تضمن ألا تصبح الخلية العصبية غير نشطة من خلال السماح بتدرّج صغير وغير صفري للمدخلات السالبة. وأخيرًا، توضح المعادلة 6 أدناه آلية عمل الكتل المختلفة المدمجة مع النموذج المهجّن المُدمج.
(6)
بعد الحصول على المتجه المدمج، يمر G عبر الطبقة الكثيفة (المتصلة بالكامل) في الكتلة 1 التي تحتوي على 1024 خلية عصبية، حيث تقوم مصفوفة الأوزان W1 بتحويل المتجه المدخل G إلى متجه خرج ذو بُعد 1024، ويكون كل عنصر في متجه الخرج عبارة عن تركيبة خطية من خصائص المدخلات. بعد ذلك، يُضاف متجه الانحياز b1 إلى كل عنصر من عناصر الخرج الـ1024، مما يسمح للنموذج بتحريك نتائج خصائص المدخلات بشكل مستقل. علاوةً على ذلك، فإن حد تنظيم L2: λ||W1||22 يُعاقب على الأوزان الكبيرة، ما يثني النموذج عن الاعتماد المفرط على خلية عصبية واحدة، وبالتالي يساعد ذلك في تجنب الإفراط في التخصيص. حيث تمثل مصفوفة الأوزان الخاصة بطبقة معينة W1 في الشبكة العصبية، بينما يدل الرمز ||W1||22 على المعيار التربيعي L2 لمصفوفة الأوزان W1، وλ هو معامل التنظيم الذي يتحكم في درجة التنظيم المطبقة، وقد تم ضبطه على 0.1 في جميع الكتل. ويصبح Z1 التمثيل الجديد للخصائص بعد تطبيق الطبقة الكثيفة وكذلك تنظيم L2 على المدخلات الواردة من المتجه المدمج G، كما هو موضح في المعادلة 6.
بعد الحصول على المخرجات من الطبقة الكثيفة للوحدة 1 على شكل Z1، تم تطبيق طبقة التسوية الدُفعة (BatchNormalization)، والتي تُستخدم لتسريع عملية التدريب، ويوضح المعادلة 7 أدناه كيف تعمل.
(7)
σ2 تمثل تباين مخرجات الطبقة الأخيرة Z1 عبر الدفعة، في حين أن μ هو متوسط المخرجات Z1 الذي يُحسب بشكل منفصل لكل عصبون، والذي كان 1024 في الطبقة الكثيفة الأولى. في المقابل، ε هو ثابت صغير يُدمج لضمان الاستقرار العددي ومنع القسمة على الصفر. يمكن تعديل المخرجات المعيارية بواسطة النموذج من خلال تعديل معلمة المقياس القابلة للتعلم γ، في حين يمكن إزاحة المخرجات المعيارية بواسطة معلمة الإزاحة القابلة للتعلم β. أخيرًا، بعد تطبيق طبقة التطبيع الدفعي (BatchNormalization) على مخرجات الطبقة الكثيفة، تضمن المخرجات المعيارية Z1 أن تكون التفعيلات ذات توزيع متسق عبر الطبقات المختلفة، مما يساعد على تثبيت وتسريع عملية التدريب. بعد التطبيع الدفعي، تمر المخرجات المعيارية Z1 عبر دالة التنشيط Leaky ReLU، التي تُنتج سلوكًا غير خطي في الشبكة، مما يساعد على تعلُّم الأنماط المعقدة في البيانات. بدلًا من اختيار دالة ReLU أو دالة تنشيط أخرى، تم اختيار دالة Leaky ReLU، وهي نسخة معدلة من دالة ReLU تأخذ القيم السالبة الصغيرة بعين الاعتبار بدل جعلها صفرًا كما تفعل دالة ReLU، وبالتالي تتفادى مشكلة "موت ReLU" (dying ReLU problem). توضح المعادلة 8 أدناه كيفية عملها.
(8)
حيث ينتمي Z1 إلى مخرجات طبقة التسوية الدفعية (BatchNormalization)، والتي تُمرر إلى دالة ReLU التالفة كمدخل لأداء عدم الخطية، في حين أن ∝ هو ثابت صغير يُستخدم لتحديد ميل الجزء السالب من الدالة. علاوةً على ذلك، يُظهر A1 المخرجات التي تُحصل عليها بعد تطبيق عدم الخطية. وأخيرًا، تُطبَّق طبقة الإسقاط (dropout) على المخرجات A1 المستلمة كمدخل من دالة تنشيط Leaky ReLU، كما هو موضح في المعادلة 9.
(9)
حيث إن A1 هو مخرج دالة التنشيط الأصلي المستلم من دالة التنشيط ReLu الأخيرة، وحيث إن p هو معدل الإسقاط (dropout rate)، والذي يتراوح بين 0 و1، وقد تم اختياره بقيم 0.3 و0.2 و0.1 على التوالي لثلاث طبقات كتلة، وذلك فقط لتجاهل جزء من الخلايا العصبية. علاوةً على ذلك، فإن A1′ يمثل المخرج المعدّل بعد تطبيق طبقة الإسقاط، والتي تم فيها تعيين بعض الخلايا العصبية بقيمة 0. والميزة الرئيسية لاستخدام هذه الطريقة هي منع مشكلة التخصّص الزائد (overfitting) وكذلك تقليل التكيّف المشترك (co-adaptation). بالإضافة إلى ذلك، يتم تمرير المخرج من الكتلة1 A1′ إلى الكتلة التالية مجددًا لاستخراج ميزات أكثر تجريدًا، ويتم تطبيق نفس المعاملات الموجودة في الكتلة 1، مع بعض الاختلافات وهي استخدام 512 خلية عصبية في الطبقة الكثيفة بدلاً من 1024، ومعدل إسقاط قدره 0.2 بدلاً من 0.3، وتبقى التسلسلات التشغيلية الأخرى نفسها، كما هو موضح في المعادلات من 10 إلى 13 أدناه.
(10)
(11)
(12)
(13)
بعد الحصول على المخرجات من الكتلة 1 على شكل A1′، والتي تمر عبر الطبقة الكثيفة (المتصلة بالكامل) في الكتلة 2 التي تحتوي على 512 خلية عصبية، حيث تقوم مصفوفة الأوزان W2 بتحويل متجه الإدخال A1′ إلى متجه مخرجات ذو بُعد 512، وكل عنصر في متجه المخرجات يمثل تركيبة خطية من خصائص الإدخال. بعد ذلك، يتم إضافة متجه الانحياز b2 إلى كل عنصر من عناصر المخرجات الـ512، مما يسمح للنموذج بتحريك مخرجات خصائص الإدخال بشكل مستقل. علاوةً على ذلك، يتم تطبيق تنظيم L2 حيث: λ||W2||22 يُعاقب على الأوزان الكبيرة، وهو ما يُستخدم لتقليل الإفراط في التخصيص من خلال منع النموذج من الاعتماد المفرط على أي خلية عصبية معينة في هذه الكتلة المحددة. حيث إن W2 هي مصفوفة الأوزان لطبقة معينة في الشبكة العصبية، في حين أن λ هو معلمة التنظيم التي تتحكم في درجة التنظيم المطبقة، وقد تم تعيينها بقيمة 0.1. ويصبح Z2 التمثيل الجديد للخصائص بعد تطبيق الطبقة الكثيفة وكذلك تنظيم L2 على المدخلات الواردة من الكتلة 1، كما هو موضح في المعادلة 10.
علاوةً على ذلك، طُبق طبقة التطبيع الدُفعة (BatchNormalization) على الميزة الجديدة Z2، والتي استُخدمت لتسريع عملية التدريب، حيث يمثل σ22 التباين عبر الدُفعة، في حين أن μ2 هو متوسط المخرجات Z2. على الرغم من أن ε هو ثابت صغير يُدمج لضمان الاستقرار العددي، فإن γ هو معلمة قابلة للقياس يمكن للنموذج تعديلها لتغيير المخرجات المعيارية، وβ هي معلمة إزاحة قابلة للتعلم تسمح للنموذج بإزاحة المخرجات المعيارية. وأخيرًا، بعد تطبيق طبقة التطبيع الدُفعة، كما هو موضح في المعادلة 11، مرت المخرجات المعيارية Z2 عبر دالة التنشيط غير الخطية Leaky ReLU، التي أنتجت السلوك غير الخطي في الشبكة، كما هو موضح في المعادلة 12. حيث ينتمي Z2 إلى مخرجات طبقة التطبيع الدُفعة، والتي تُمرر إلى Leaky ReLU كمدخل لأداء السلوك غير الخطي. في المقابل، يُظهر A2 المخرجات التي تم الحصول عليها بعد تطبيق السلوك غير الخطي.
وأخيرًا، يتم تطبيق طبقة إسقاط على المخرجات A2 المستلمة كمدخلات من دالة التنشيط Leaky ReLU، كما هو موضح في المعادلة 13. حيث تمثل A2 المخرجات المستلمة من دالة التنشيط ReLU الأخيرة، وتمثل p2 معدل الإسقاط الذي تم اختياره بقيمة 0.2 لهذا الكتلة، وذلك فقط لإسقاط جزء من الخلايا العصبية. علاوةً على ذلك، فإن A2′ يمثل المخرجات المعدلة بعد تطبيق طبقة الإسقاط، والتي تم تعيين بعض الخلايا العصبية فيها إلى 0. بعد ذلك، تُمرر المخرجات من الكتلة الثانية A2′ إلى الكتلة الثالثة مجددًا لاستخلاص ميزات أكثر تجريدًا، وتُطبَّق نفس المعلمات الموجودة في الكتلة الثانية، مع بعض الاختلافات المتمثلة في استخدام 256 خلية عصبية في الطبقة الكثيفة بدلًا من 512 ومعدل إسقاط قدره 0.1 بدلًا من 0.2، وتبقى التسلسلات التشغيلية الأخرى كما هي، والتي تم وصفها في المعادلات التالية من 14 إلى 17.
(14)
(15)
(16)
(17)
بعد الحصول على المخرجات من الكتلة 2 على شكل A2′، والتي تمر عبر الطبقة الكثيفة (المتصلة بالكامل) في الكتلة 3 المكونة من 256 خلية عصبية، حيث تقوم مصفوفة الأوزان W3 بتحويل متجه المدخلات A2′ إلى متجه مخرجات بُعده 256، وكل عنصر في متجه المخرجات يمثل تركيبًا خطيًا للميزات المدخلة. بعد ذلك، يتم إضافة متجه الانحياز b3 إلى كل عنصر من عناصر المخرجات الـ 256، مما يسمح للنموذج بتحريك مخرجات الميزات المدخلة بشكل مستقل. علاوةً على ذلك، يتم تطبيق تنظيم L2 حيث يُعاقب التعبير λ||W3||22 على الأوزان الكبيرة، ما يثني النموذج عن الاعتماد المفرط على خلية عصبية واحدة، ويساعد ذلك في تجنب التخصيص الزائد. حيث تمثل W3 مصفوفة الأوزان الخاصة بطبقة معينة في الشبكة العصبية، في حين يتم التحكم في درجة التنظيم المستخدم من خلال معلمة التنظيم λ، والتي تم ضبطها على القيمة 0.01. تصبح Z3 التمثيل الجديد للميزات بعد تطبيق الطبقة الكثيفة وكذلك تنظيم L2 على المدخلات الواردة من الكتلة 3، كما هو موضح في المعادلة 14.
علاوةً على ذلك، تم تطبيق طبقة التسوية الدُفعة (BatchNormalization) على الميزة الجديدة Z3، والتي استُخدمت لتسريع عملية التدريب، حيث يمثل σ32 التباين عبر الدُفعة، في حين أن μ3 هو متوسط المخرجات Z3. في المقابل، يُعد ε ثابتًا صغيرًا يُضاف لضمان الاستقرار العددي. يمكن تعديل المخرجات المُعدَّلة بواسطة النموذج باستخدام معلمة المقياس القابلة للتعلم γ3، وتحريكها باستخدام معلمة الإزاحة القابلة للتعلم β3. وأخيرًا، بعد تطبيق طبقة التسوية الدُفعة، كما هو موضح في المعادلة 15، تمر المخرجات المُعدَّلة Z3 عبر دالة التنشيط تسرب ReLU (leaky ReLU)، التي تُنتج سلوكًا غير خطي في الشبكة، كما هو موضح في المعادلة 16. حيث ينتمي Z3 إلى مخرجات طبقة التسوية الدُفعة، والتي تُدخل إلى دالة تسرب ReLU كمدخل لأداء السلوك غير الخطي. في المقابل، يُظهر A3 المخرجات التي تُحصل عليها بعد تطبيق السلوك غير الخطي.
وأخيرًا، يتم تطبيق طبقة الإسقاط على المخرجات A3 المستلمة كمدخلات من دالة التنشيط Leaky ReLU، كما هو موضح في المعادلة 17. حيث تمثل A3 المخرجات المستلمة من آخر دالة تنشيط ReLU، وتمثل p3 معدل الإسقاط الذي تم اختياره بقيمة 0.1 لهذا الكتلة، وذلك فقط لإسقاط جزء من الخلايا العصبية. علاوةً على ذلك، تُظهر A3′ المخرجات المعدلة بعد تطبيق طبقة الإسقاط، والتي تم فيها تعيين بعض الخلايا العصبية إلى الصفر.
علاوةً على ذلك، يمر المخرج من الكتلة 3 A3′ عبر الطبقة الكثيفة الأخيرة لأغراض التصنيف مع عدد K من الخلايا العصبية التي تمثل العدد الفعلي للفئات في مجموعة البيانات، كما هو موضح في المعادلة 18 أدناه.
(18)
المصفوفة المرتبطة بالطبقة السميكة هي Wk، وهي المسؤولة عن تحويل المتجه ذي الأبعاد الـ 256 A3′ إلى متجه ذي أبعاد k، والذي يمثل السمات المُتعلمة من الكتلة السابقة ويظهر كمخرجات. علاوةً على ذلك، فإن bk يمثل متجه الانحياز الذي يُعدّل التنبؤ لضمان أن تكون دالة التنشيط ذات مخرجات غير صفرية عندما يكون المدخل صفرًا، وZk هو مخرج الطبقة النهائية قبل تطبيق دالة التنشيط، ويُنتج القيم اللوجستية مقابل كل فئة، وفي النهاية تم تطبيق مصنّف SoftMax41 الذي يحوّل القيمة اللوجستية Zk إلى احتمالات كل فئة، كما هو موضح في المعادلتين 19 و20.
(19)
(20)
حيث إن الاحتمال المتوقع للـ ith يُمثل الفصل بـ صi, ك هو عدد الفئات، بينما ضك, i هو اللوجيت للقيمة ith فئة، و هـضك, i هو الأس للدالة اللوجستية للقيمة ith فئة ي يُظهر التوزيع الاحتمالي لجميع الفئات الممكنة، ويضمن أن مجموع الاحتمالات يساوي 1. الجدول 3 يُقدِّم القسم أدناه تفاصيل المعلمات الفائقة المستخدمة لتدريب النموذج الهجين المقترح، بما في ذلك التفاصيل المعمارية المُعتمدة لتحسين إمكانية إعادة الإنتاج والأداء.
| المعاملات الفائقة | النموذج المقترح (FusionNetX) |
| حجم الصورة | 224 × 224 |
| معمارية العمود الفقري | تم استخدام EfficientNetB7 وDenseNet121 مُدرّبين مسبقًا كـ BBA1 وBBA2 |
| تكبير البيانات | مدى الدوران = 7، |
| مدى إزاحة العرض/الارتفاع حتى 0.05، |
| مدى التكبير حتى 0.01، |
| الانعكاس الأفقي/العمودي |
| نسبة تقسيم البيانات | 80% للتدريب و20% للتحقق باستخدام أخذ عينات مصنفة مع قيمة عشوائية ثابتة randome_state = 42 |
| استخراج السمات والدمج | يتم تطبيق الاستخلاص المتوسط الكلي على مخرجات كل عمود فقري: 2560 لـ BBA1 و1024 لـ BBA2، ثم يتم دمجها للحصول على 3584 متجهًا مشتركًا للسمات. |
| تكوين كتلة الاتصال الكامل | 3 كتل متصلة بالكامل مع طبقة مخرجات واحدة. تحتوي كل كتلة على تنظيم L2 (λ=0.01)، التسوية الدُفعة (BatchNormalization)، دالة تنشيط LeakyReLU (α=0.01)، إسقاط (Dropout) بقيم (0.3، 0.2، و0.1) وأبعاد كامنة (1024، 512، 256) على التوالي. لم يتم إدخال اتصال تخطّي إضافي في رأس الدمج |
| دالة التنشيط | Leaky ReLU وSoftMax |
| خوارزمية التحسين ومعدل التعلم | Adam مع معدل تعلم ثابت قدره 0.00001 دون استخدام جدولة لمعدل التعلم. |
| دالة الخسارة | sparse_categorical_crossentropy |
| حجم الدفعة | 16 |
| عدد العصور | 100 عصر ثابت لكل مجموعة بيانات |
| المنصة المستخدمة | ملاحظات كاجل (Kaggle Notebook) مزودة بمعالج رسوميات P100 و16 غيغابايت ذاكرة وصول عشوائي فيديو (VRAM) مع منصتي TensorFlow وKeras. |
الجدول 3: المعلمات الفائقة المستخدمة لتدريب النموذج المقترح والتفاصيل المعمارية المقترحة. يقدِّم هذا الجدول التفاصيل الهيكلية والمعمارية للنموذج المقترح، إلى جانب المعلمات المُهيأة بدقة والبيئة التنفيذية.