$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
استخدمت هذه الدراسة مجموعة بيانات متاحة للجمهور ومجهولة الهوية؛ لذلك، لم يكن مطلوبا الموافقة المستنيرة. يتكون النهج المقترح من ستة مكونات: المعالجة المسبقة، وحدة الالتفاف، وحدة الانتباه، دمج وحدات الالتفاف والانتباه، وطبقات متصلة بالكامل (FC). يوضح الشكل 1 سير العمل الكامل لطريقتنا.
جمع مجموعة البيانات
يتم الحصول على صور الرنين المغناطيسي للدماغ الموسومة من مجموعة بيانات كاجل متاحة للجمهور تتكون من أربع فئات أورام وأنسجة طبيعية.
معالجة البيانات المسبقة
يتم إعادة تكبير الصور إلى دقة موحدة ويتم تطبيع شدتها. يتم تطبيق التعزيز الاختياري (الدوران، القلب، التكبير) لتحسين التعميم. تنقسم مجموعة البيانات إلى مجموعات تدريب (70٪) ومجموعات اختبار (30٪).
بنية النماذج
تم استخدام ثلاث شبكات CNN عمودية تم تدريبها مسبقا على ImageNet—MobileNetV2، EfficientNetV1، وInception-ResNet-V2—لتصنيف أورام الدماغ إلى أربع فئات باستخدام صور الرنين المغناطيسي. تم تكوين MobileNetV2 وEfficientNetV1 بأبعاد إدخال 224 × 224 بكسل، بينما كان Inception-ResNet-V2 يتطلب حجم إدخال 299 × 299 بكسل. في عملية تعلم النقل، تم تجميد الطبقات الالتفافية الأولية في البداية للحفاظ على ميزات الصورة العامة، بينما تم ضبط الطبقات العليا بدقة لتكييف النموذج لتصنيف أورام الدماغ. تم إقران كل عمود فقري برأس تصنيف خفيف الوزن يشمل تجميع المتوسط العالمي، وطبقات كثيفة، ونقطة انقطاع للتنظيم، ودالة تفعيل Softmax للتنبؤ بأربع فئات. تم تنفيذ Dropout للحد من الإفراط في التركيب وتعزيز التعميم. دمجت البنية المصممة بفعالية بين استخراج الميزات الفعال ومتطلبات حسابية أقل، مما سهل التصنيف الدقيق مع البقاء مناسبا للنشر في سيناريوهات محدودة الموارد وإثبات المفهوم.
استخراج الميزات المعتمد على الانتباه
تتم معالجة الصور المدخلة عبر طبقة التفافية أولية تليها وحدة انتباه مخصصة. التجميع الأقصى المتوازي والتجميع المتوسط يلتقط السمات البارزة والسياقية، التي يتم دمجها وتحسينها عبر الالتفاف لتسليط الضوء على المناطق ذات الصلة بالورم.
العمود الفقري الالتفاوي والاندماج
يتم توجيه الميزات المرجحة بالانتباه إلى العمود الفقري المدربة مسبقا (MobileNetV2، EfficientNetV1، أو Inception-ResNet-V2). يتم دمج طبقات الالتفاف عالية المستوى منطقيا لتقليل الوصول إلى الذاكرة وتحسين الكفاءة الحسابية.
التصنيف
يتم تمرير الميزات المسطحة عبر طبقات متصلة بالكامل مع تفعيل ReLU6 وإلغاء التشغيل، مما ينتج تمثيلا مدمجا لتصنيف النهائي للأربع فئات softmax.
التقييم
يتم تقييم أداء النموذج على مجموعة الاختبار باستخدام مصفوفات الدقة، والدقة، والاسترجاع، ودرجة F1، والارتباك.
تطوير الإطار
الحل المقترح منفذ بلغة بايثون ويستخدم كيرا للتنفيذ. يوضح الجدول 1 المعاملات الفائقة. تنقسم مجموعة البيانات إلى مجموعة تدريب ومجموعة اختبار تتبع نسبة 70:30. تستخدم خمسة تقسيمات عشوائية مختلفة للقطارات/الاختبارات لعرض الأداء المتوازن النهائي لكل مجموعة بيانات.
المعالجة المسبقة
يجب تحديث الصور المدخلة لأن إطار عمل MobileNetV2 يعد الأساس للحل المقترح. لاستخراج ميزات عالية الدقة من الصور الفوتوغرافية، يستخدم نموذج MobileNetV2 المدرب مسبقا مع بعد الإدخال. يتم بعد ذلك تكبير كل صورة مدخلة إلى 224×224 بكسل ضمن النطاق [-1، 1].
نموذج الالتفاف
يعزز MobileNetV2 التعرف على الصور من خلال الاستفادة من بنية الشبكة العصبية الالتفافية (CNN) الفعالة المصممة لتقليل المتطلبات الحاسوبية. بينما تحقق شبكات CNN التقليدية دقة عالية، إلا أنها غالبا ما تتطلب ذاكرة كبيرة وقوة معالجة كبيرة. قدم MobileNetV1 مفهوم الالتفاف القابل للفصل حسب العمق، والذي يفصل الالتفاف القياسي إلى عمليتين مميزتين: الالتفاف العمق لتصفية المدخلات والالتفاف النقطي لدمج الميزات. يبني MobileNetV2 على هذه الفكرة من خلال دمج كتل عنق الزجاجة المتبقية التي تتكون من طبقات التمدد، والالتفاف العميق، وطبقات الإسقاط، والوصلات المتبقية. طبقة الإسقاط تضغط قنوات الميزات، بينما تسهل الاتصالات المتبقية تدفق المعلومات بشكل أفضل عبر الشبكة. لتحسين الاستقرار وتعزيز أداء التعلم، يتم تطبيق تفعيل ReLU6 وتطبيع الدفعات بعد العمليات الالتفافية.
في هذا البحث، تم استخدام MobileNetV2، المدرب مسبقا على ImageNet، كنموذج أساسي لاستخراج الميزات، مقدما تمثيلات دلالية فعالة عالية المستوى مع الحفاظ على انخفاض التكاليف الحسابية لتصنيف أورام الدماغ. بعد كل طبقة التفاف، هناك طبقة تفعيل ReLU6، وهي تعديل لدالة تفعيل ReLU حيث يتم تعظيم الحجم عند ستة، وطبقة تطبيع دفعات. يتم تطبيق طبقات الالتفاف 1x1 الشائعة، والتجميع المتوسط، والتصنيف على 17 من كتلة عنق الزجاجة المتبقية، مما يشكل البنية الكاملة ل MobileNetV2. استخدمنا MobileNetV2 كشبكة عمود فقري مدربة مسبقا على ImageNet. في مثل هذه الحالة، يتم الحصول على الخريطة الالفافية من آخر كتلة متبقية بعد المرور عبر طبقة الالتفاف MobileNetV2. الكتل المتبقية في المستويات الأدنى تنتج خرائط ميزات أصغر. هذه الحواجز لا تساهم في أبحاثنا لأنها لا تجمع بيانات عالية المستوى لتحديد الصورة بشكل عام. أثناء بناء النماذج والتدريب، تبقى الطبقات التي تسبق الطبقات الالتفافية التي تولد خريطة ميزات ثلاثية الأبعاد بحجم 7 × 7 ثابتة. من الناحية الرياضية، يعبر عن ذلك كما يلي في المعادلة (1):
F1(I) = Conv(I) (1)
هنا، يمثلF1(I) الميزة الالتفافية المستخرجة من الصورة الداخلة، I.
وحدة التركيز
آلية الانتباه في الدماغ البشري، التي تعني أن الناس يركزون بشكل طبيعي أكثر على المدخلات البصرية المهمة بدلا من كل تفصيل في الصورة، تشكل الأساس لتصميم شبكة التحول هذه. تم ابتكار العديد من النماذج القائمة على الانتباه في أبحاث التعلم العميق بسبب هذه الفكرة. يتم تسليط الضوء على الارتباطات المكانية التي تظهر في تمثيلات أورام الدماغ بواسطة آلية الانتباه المقترحة. بينما تلتقط وحدة انتباه القناة أهم المعلومات المتعلقة بالورم عبر قنوات المميزة، تحدد وحدة الانتباه الإقليمية المناطق الأكثر إفادة في صورة الرنين المغناطيسي. باستخدام طريقة الانتباه المنظم، تركز وحدة التركيز المقترحة على المناطق التي تحتوي على معلومات أورام تمييزية.
لتحسين تمثيل الميزات، تستخدم تقنيات مثل تجميع التفعيل الأعلى واستخراج الميزات المتوازن قبل مرحلة اكتشاف الميزات المكانية. تعزز هذه الاستراتيجية قدرة النموذج على التركيز على مناطق الأورام ذات الأهمية السريرية مع تقليل التفاصيل الخلفية غير ذات الصلة، مما يحسن دقة التصنيف وكفاءة تعلم الميزات. الثاني هو دمج الموترات المجمعة بأقصى حد ومتوسطة التجميع. أخيرا، يجب استخدام وظيفة تنشيط السيغما، مع مرشح التفافي 7x7، لتنشيط المنبهات البصرية داخل الرؤية. يتم الإشارة إلى المراحل المختلفة لوحدة التركيز في المعادلتين (2) و(3). حيث يمثل Pool(F) ∈ RHxWx1 متوسط عملية التجميع، بينما يصف MaxPool(F) ∈ RHxWx1 عملية التجميع القصوى.
F2(I) = [AvgPool(F); ماكسبول(أنثى)] (2)
يمكن دمج هاتين الخرائط العنصريتين ثلاثي الأبعاد لإنشاء خريطة عنصرية
F2(I) = ∈ RHxwx1. F3(I) = σ(f7x7(F2(I))) (3)
حيث σ هي دالة التفعيل التي تشير إلى سيغما. خصائص الانتباه، التي تمثل بواسطة موتر مشفر بارتفاع HxWxC (V)، والعرض (W)، والسمك (C)، ممثلة ب F3(I)، بينما يمثل f7x7 عملية الالتفاف بحجم المرشح (7x7).
دمج الانتباه ونموذج الالتفاف
على عكس الشبكة التي تعتمد على مشفر واحد، يمكن لوحدة دمج متعددة الوسائط استخراج معلومات أكثر كفاءة وشمولا لغالبية الوسائط الساحقة. تهدف كتلة الاندماج إلى توجيهها نحو أقصى الميزات متعددة الوسائط الأساسية؛ لذا، سيحدد مناطق الاهتمام لاستخراج منطقة الورم. هذه مجرد تسلسل بسيط للتمثيلات الكامنة الفردية، لكن بعض المعلومات ستضيع. وبذلك تم إنشاء خريطة كائنات مركبة عن طريق دمج خرائط الميزات لوحدات الالتفاف والملاحظة باستخدام طريقة ربط الميزات الأساسية لسيتاولا وآخرين. هاتان الخرائط الميزتان التقطتا الفروقات في خصائص الصور المختلفة، لذا قررنا استخدام طريقة الربط البسيطة بدلا من استراتيجيات تعتمد على الحد الأقصى أو الأدنى أو الجمع. وهذا يجعله أيضا أخف من الناحية الحسابية مقارنة بالطرق البديلة التي تستخدم الطرق ثنائية الخط كشكل من أشكال حساب ضرب الموترات. عندما يتم دمج هذين الميزتين، يسمى الناتج موتر الميزة. التعبير الرياضي لخرج الموتر المجمع للحرف T يعطى بواسطة المعادلة (4).
[F1(I), F3(I)] = T(I) (4)
حيث F1(I) ∈ RHxWx1 و F2(I) ∈ RHxWx1280. هذه موترات ثلاثية الأبعاد بنفس العرض (W) والارتفاع (H). علاوة على ذلك، يمكن دمجها في إنشاء 3D k لموترات ثلاثية الأبعاد، حيث T(I) ∈ LxWx1281.
الطبقات المتصلة بالكامل (FC)
استخدمنا سلسلة من طبقات FC بعد دمج الميزات لتحويل موتر حجمي معاد تشكيله إلى متجه سمة خطي. يتكون رأس التصنيف من طبقة تجميع متوسط عالمي، وطبقات كثيفة متصلة بالكامل، وتنظيم الانقطاع، وطبقة إخراج سوفت ماكس. تستخدم وظيفة تفعيل ReLU6، ب 128 وحدة واحتمال انقطاع 50٪.