مقالة منهجية

MixKNet: شبكة معدلة على شكل حرف U مع التواء قناة هجينة لتجزئة الصور الطبية

DOI:

10.3791/68450

يوليو 15, 2025

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقدم هذه الدراسة متغيرا خفيف الوزن U-Net مع دقة تجزئة محسنة باستخدام الالتفاف الهجين وانتباه القناة ، مما يحقق أحدث النتائج على MoNuseg و GlaS مع معلمات أقل.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تطورت تقنية معالجة الصور الحاسوبية القائمة على الشبكة العصبية الاصطناعية بسرعة في السنوات الأخيرة ووجدت تطبيقات واسعة النطاق في مجالات متعددة. في معالجة الصور الطبية ، أظهرت UNet ومتغيراتها نجاحا كبيرا في اكتشاف الآفات وتجزئة الخلايا ومهام تجزئة الأورام الحميدة. يقدم هذا البحث شبكة معدلة على شكل حرف U مع معلمات شبكة مخفضة يتم تحقيقها عن طريق تقليل عمق الشبكة وزيادة قنوات الشبكة لتعزيز قدرة النموذج على التعلم. لمواجهة الانخفاض في قدرة التعلم الناجم عن ضغط العمق ، يتم إدخال وحدة تلافيفية للقناة الهجينة لتحل محل الوحدة التلافيفية للشبكة الأصلية. يقدم النموذج آلية انتباه القناة بين الطبقة وطبقة الالتفاف النقطي لتحسين قدرة استخراج ميزة القناة العملية. وخلصت المقالة أيضا إلى أن استخدام الالتفاف مختلط العمق يمكن أن يحل بشكل فعال مدى حجم هدف التجزئة ، مما يجعل من الصعب على نموذج واحد أن يكون مناسبا لمجموعات بيانات متعددة. يحقق النموذج المقترح أحدث النتائج على مجموعتي بيانات عامتين شائعتين ، MoNuseg و GlaS ، بمتوسط زيادة في النرد بنسبة 1.0٪ و 1.37٪ على التوالي. تم تقليل المعلمات الإجمالية للنموذج المعدل إلى 1.71 مليون ، وهو ما يمثل انخفاضا بمقدار 38.6 ضعفا مقارنة ب UCtransNet ، مع 65.6 مليون معلمة.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعد تجزئة الصور الطبية أمرا بالغ الأهمية في مختلف التطبيقات السريرية ، بما في ذلك التشخيص وتخطيط العلاج ومراقبة المرض. لم تعد طرق معالجة الصور التقليدية القائمة على خوارزميات هندسة الميزات مناسبة للتعامل مع الكميات الكبيرة من البيانات التي تم إنشاؤها في بيئات الرعاية الصحية الحديثة. لحسن الحظ ، فإن تقدم تكنولوجيا الشبكة العصبية الاصطناعية والتحسينات في قدرات أجهزة الكمبيوتر جعل من الممكن تدريب ونشر نماذج الشبكات العصبية واسعة النطاق. نتيجة لذلك ، يتم تطوير خوارزميات معالجة رؤية الكمبيوتر القائمة على نماذج التعلم الآلي وتطبيقها باستمرار في مختلف المجالات.

وهيكل النموذج الأكثر تمثيلا في التجزئة الدلالية للصور الطبية هو UNet1 مع بنية فك التشفير. يستخدم النموذج أولا برنامج تشفير متعدد المستويات لاستخراج ميزات بمقاييس مختلفة من صورة الإدخال. بعد ذلك ، يقوم وحدة فك التشفير بأخذ عينات خطوة بخطوة مع دمج إخراج الميزات الدلالية بواسطة برنامج التشفير للمستوى المقابل كاتصال تخطي. ومع ذلك، يمكن زيادة تحسين أداء هيكل UNet بتطبيق عدة أساليب. على سبيل المثال ، ثبت أن آليات الانتباه فعالة في تحسين أداء الشبكات العصبية التلافيفية. يمكن لهذه الآليات أن تؤكد بشكل انتقائي على الميزات الأساسية في بيانات الإدخال ، مما يؤدي إلى تحسين تعلم التمثيل ودقة التجزئة.

في الوقت الحاضر ، يركز العديد من الباحثين على دمج الميزات المستخرجة بواسطة المشفر بشكل فعال في مرحلة فك التشفير. وتشمل بعض المتغيرات الأكثر شيوعا في UNet الانتباهUNet 2 و Recurrent UNet3 و V-Net4. تستخدم هذه الأساليب آليات الانتباه5 ، مثل الانتباه المكاني ، لتسليط الضوء على المناطق الإعلامية في خرائط الميزات وقمع المناطق غير الإعلامية. بالإضافة إلى ذلك ، تتضمن بعض المتغيرات شبكات عصبية متكررة لنمذجة الطبيعة المتسلسلة للصور الطبية وتحسين تمثيلات الميزات. تم استخدام نماذج ما قبل التدريب ، مثل VGG6 و ResNet7 و DenseNet8 ، على نطاق واسع لتحسين أداء الشبكات على شكل حرف U من خلال الاستفادة من معرفتها الغنية المستفادة من مجموعات البيانات واسعة النطاق. بالإضافة إلى ذلك ، تم إدخال آليات المحولات ، مثل الانتباه الذاتي والانتباه متعدد الرؤوس ، إلى تبعيات النماذج طويلة المدى والتقاط المعلومات السياقية العالمية ، مما يؤدي إلى أداء أفضل للتجزئة.

ومع ذلك ، في حين أن هذه المتغيرات قد تحسنت مقارنة ب UNet1 الأصلي ، إلا أنها لا تزال تواجه قيودا معينة في التعامل مع الصور الطبية المعقدة بمقاييس وأشكال مختلفة. علاوة على ذلك ، غالبا ما يؤدي التعقيد المتزايد لهذه المتغيرات إلى ارتفاع التكاليف الحسابية وأوقات التدريب الأطول ، مما يحد من قابليتها للتطبيق في السياقات العملية.

ولتعزيز بنية UNet1 ، يقترح نموذج معدل يسمى MixKNet (شبكة Mix Kernel Size U-shaped Net)، مما يقلل من عمق الشبكة مع زيادة عدد القنوات لتحسين القدرة على التعلم. ومع ذلك ، يمكن أن يؤدي انخفاض العمق إلى انخفاض الأداء العام. للتخفيف من هذه المشكلة ، يتم تقديم وحدة تلافيفية ذات قناة هجينة ، لتحل محل الوحدة العصبية التلافيفية الأصلية. تتضمن هذه الوحدة آلية انتباه القناة بين طبقات الالتواء العميقة والنقطية ، بهدف تعزيز قدرة النموذج على استخراج ميزات القناة الفعالة.

لتوجيه قابلية التطبيق العملي ، من المهم ملاحظة أن الطريقة المقترحة تم تقييمها على مجموعات بيانات الصور الطبية صغيرة نسبيا ، مع دقة صور فردية تتراوح من 500 × 500 إلى 1000 × 1000 بكسل. للتدريب على النموذج ، تم تغيير حجم جميع الصور إلى 224 × 224 بكسل. تم تنفيذ التنفيذ باستخدام PyTorch على وحدة معالجة رسومات NVIDIA RTX 3090 واحدة. تشير هذه المعلمات التشغيلية إلى أن الطريقة مجدية حسابيا للإعدادات التجريبية المعتدلة وقابلة للتكيف مع أحجام مجموعات البيانات المحدودة.

في الختام ، تقدم هذه المقالة تعديلا جديدا على هيكل الشبكة على شكل حرف U وتقدم وحدة الالتفاف الهجينة للقناة جنبا إلى جنب مع آلية انتباه القناة ، وكلاهما يحسن أداء التجزئة على مجموعات بيانات الصور الطبية. المساهمات الرئيسية لهذا العمل هي كما يلي: (1) اقتراح هيكل شبكة معدل على شكل حرف U مع وحدة الالتفاف الهجينة ذات النسيج العميق التي تحل محل الوحدة العصبية التلافيفية الأصلية. (2) إدخال آلية انتباه القناة بين طبقة الالتفاف ذات النسيج العميق والطبقة النقطية لتحسين قدرة النموذج على استخراج ميزة القناة الفعالة. (3) تحقيق أحدث النتائج في وقت واحد على مجموعتي بيانات عامتين شائعتين في مجموعة بيانات التجزئة النووية MoNuseg9 مع معلمات نموذج أقل بكثير (مقارنة ب UCtransNet10 مع معلمات 64M) وتحسين الأداء على مجموعة بيانات تجزئة الغدة GlaS11 .

يتم تنظيم بقية هذه المقالة على النحو التالي. تقدم الخطوة 2 استعراضا شاملا للدراسات السابقة حول UNet1 وأشكاله في تجزئة الصور الطبية. يتم فحص مواطن القوة والقيود في النهج القائمة، إلى جانب العمل ذي الصلة بآليات الانتباه، والشبكات التلافيفية المختلطة العمقة، وتطبيقاتها في نماذج التجزئة. تفصل الخطوة 3 معمارية نموذج MixKNet المقترح ، بما في ذلك التعديلات على هيكل UNet ، ودمج آلية انتباه القناة ، واستخدام الالتفاف المختلط العمق. تبلغ الخطوة 4 عن نتائج التجارب المكثفة ، مصحوبة بمناقشة ودراسة استئصال لتقييم مساهمات كل مكون. أخيرا ، تختتم الخطوة 5 الورقة البحثية وتحدد الاتجاهات المحتملة للبحث المستقبلي.

يبدأ هذا القسم باستعراض الدراسات السابقة حول UNet ومتغيرات Ut في تجزئة الصور الطبية ، مع تحديد نقاط القوة والقيود في الأساليب الحالية. بالإضافة إلى ذلك ، تمت مناقشة البحوث ذات الصلة حول آليات الانتباه وتطبيقاتها في نماذج التجزئة. كما يتم فحص التطورات الأخيرة التي تنطوي على تقنيات الالتفاف العميق لتعزيز أداء التجزئة. يتم تقديم تحليل مقارن ل MixKNet (c) المقترحة والنماذج الأخرى في الشكل 1 ، حيث تشير الخطوط المتقطعة إلى اتصالات التخطي.

UNet وأشكاله المختلفة
تم اقتراح بنية UNet لأول مرة بواسطة Ronneberger et al. في عام 20151 ومنذ ذلك الحين تم استخدامها على نطاق واسع في تجزئة الصور الطبية. يتكون النموذج من مسار تشفير ومسار فك تشفير. يستخرج برنامج التشفير ميزات عالية المستوى من صورة الإدخال بينما يقوم وحدة فك التشفير بأخذ عينات من الميزات وجمعها لإنشاء خريطة تجزئة. ومنذ ذلك الحين، أدخلت تعديلات مختلفة على بنية UNet لتحسين أدائها في تجزئة الصور الطبية. أحد التعديلات الأكثر شيوعا هو إدخال اتصالات التخطي ، والتي ثبت أنها تعمل على تحسين دقة التجزئة. اقترح Zhou et al.12 متغير UNet يستخدم وصلات تخطي كثيفة ، مما يسمح للنموذج بالحفاظ على المعلومات المكانية بشكل أفضل.

ومن التعديلات الشائعة الأخرى على بنية UNet إضافة آليات الاهتمام. يمكن أن تساعد هذه الآليات النموذج في التأكيد بشكل انتقائي على أهم الميزات ، مما يؤدي إلى تحسين تعلم التمثيل ودقة التجزئة. وتشمل بعض الأمثلة على المتغيرات ذات آليات الانتباه الانتباهUNet 2 و ResUNet مع بوابات الانتباه13 و Dense-UNet مع بوابات الانتباه14. بالإضافة إلى التعديلات المذكورة أعلاه ، تم اقتراح العديد من المتغيرات الأخرى لبنية UNet لتجزئة الصور الطبية. UCTransNet10 هو نوع مختلف من بنية U-Net التي تتضمن اتصالات تخطي ووحدة محول. تتم إعادة التفكير في اتصالات التخطي في UCTransNet10 من منظور القناة ، مما يسمح بإعادة استخدام الميزات بشكل أفضل ويقلل من عدد المعلمات. تمت إضافة وحدة المحولات لالتقاط التبعيات بعيدة المدى وتحسين جودة الترجمة. لقد ثبت أن UCTransNet10 يحقق أحدث النتائج في العديد من معايير الترجمة الآلية. اقترح Zihan et al. نموذج التعلم العميق المسمى LViT15 ، والذي قاموا بتطبيقه على مهام تحليل الصور الطبية. لتوسيع الإصدار شبه الخاضع للإشراف من LViT15 والتعويض عن نقص الجودة في بيانات الصورة ، اقترحوا آلية تكرار التسمية الزائفة الأسية (EPI). بالإضافة إلى ذلك ، للحفاظ على الميزات المحلية للصور ، اقترحوا وحدة الانتباه على مستوى البكسل (PLAM) ، والتي تركز بشكل انتقائي على ميزات الصورة المهمة.

آلية الانتباه
تمت دراسة آليات الانتباه على نطاق واسع في التعلم الآلي ، لا سيما في معالجة اللغة الطبيعية ورؤية الكمبيوتر. في السنوات الأخيرة ، تم تطبيق آليات الانتباه أيضا على مهام تحليل الصور الطبية ، بما في ذلك تجزئة الصور. قدم Bahdanau et al.16 آلية انتباه في الترجمة الآلية العصبية لتحسين جودة الترجمة. تسمح الآلية للنموذج بالتركيز بشكل انتقائي على الأجزاء ذات الصلة من تسلسل الإدخال ، مما يحسن جودة الترجمة. منذ ذلك الحين ، تم اقتراح آليات اهتمام مختلفة لمهام تحليل الصور. أحد الأنواع الشائعة لآلية الانتباه هو آلية الانتباه المكاني ، والتي تتضمن تطبيق وزن على كل بكسل في خريطة المعالم بناء على أهميتها. على سبيل المثال ، اقترح Guo et al.17 آلية انتباه مكاني لمهمة تجزئة الأوعية الشبكية. تستخدم الآلية آلية بوابات لضبط وزن الميزات المكانية ، مما يحسن قدرة النموذج على التمييز بين وحدات البكسل في السفينة وغير السفينة. نوع آخر من آلية الانتباه هو انتباه القناة ، والذي يركز على ضبط أوزان خرائط الميزات عبر القنوات. اقترح Hu et al.18 شبكة الضغط والإثارة (SENet) التي تطبق اهتماما بالقناة على خرائط الميزات ، مما يحسن أداء مهمة تصنيف الصور. في الآونة الأخيرة ، تم دمج آليات الانتباه مع الشبكات العصبية التلافيفية (CNNs) لمهام تجزئة الصور. على سبيل المثال ، اقترح Chen et al.19 شبكة موجهة نحو الانتباه لتجزئة أورام الدماغ تجمع بين آليات الانتباه المكانية والقناة.

أظهرت التطورات الحديثة في التعلم شبه الخاضع للإشراف والمتعدد الوسائط لتحليل الصور الطبية والاستشعار عن بعد تحسينات واعدة في الأداء. اقترح يانغ وآخرون 20 UMSCS ، وهو إطار جديد للتجزئة متعددة الوسائط غير متزاوجة يستفيد من التعلم التوليدي متعدد الوسائط والاستراتيجيات شبه الخاضعة للإشراف. قدم Zhang et al. العديد من التقنيات المتطورة: نموذج تناسق ثلاثي الفروع محسن بالأدلة للتجزئة شبه الخاضعة للإشراف21 ، وإطار التعلم النموذجي الواعي الذاتي وعبر العينة لتجزئة الصور الطبية22 ، ونهج تحسين الميزة الهرمية المدركة للتردد الزمني للتعرف على تشويش رادار الفتحة الاصطناعية (SAR) في مجال الفضاء23. تسلط هذه الأعمال الضوء بشكل جماعي على أهمية الإشراف الهجين ونمذجة الميزات المدركة للمجال في كل من مهام التصوير الطبي والهندسي.

الالتفاف العميق
تم تصميم الالتواء العميق لالتقاط الارتباطات على مستوى القناة في خرائط ميزات الإدخال وقد ثبت أنه يحسن كفاءة ودقة الشبكات العصبية التلافيفية.

يعد MobileNet24 أحد أقدم نماذج الالتواء وأكثرها تأثيرا في العمق ، الذي اقترحه Howard et al. في عام 2017. تستخدم MobileNet الالتفاف القابل للفصل من حيث العمق ، والذي يطبق التواء عميقا متبوعا بالتفاف نقطي ، لتقليل عدد المعلمات والحساب المطلوب للطبقات التلافيفية. يسمح ذلك ل MobileNet بتحقيق دقة حديثة في مهام تصنيف الصور مع استخدام معلمات أقل بكثير من الشبكات العصبية التلافيفية التقليدية. منذ إدخال MobileNet ، تم اقتراح عدد من بنى الالتواء الأخرى من حيث العمق ، بما في ذلك ShuffleNet25 و Xception26 و ResNeXt27. تختلف هذه النماذج في تنفيذها المحدد للالتفاف العميق ، ولكن جميعها تشترك في هدف تقليل التعقيد الحسابي للطبقات التلافيفية مع الحفاظ على الدقة أو تحسينها. كما تم تطبيق الالتفاف العميق على مهمة التجزئة الدلالية ، مع نماذج مثل PSPNet28 تستخدم الالتواء القابل للفصل بالعمق لتقليل متطلبات الحساب والذاكرة للطبقات التلافيفية واسعة النطاق. يوسع MixNet29 فكرة الالتفاف العميق من خلال تقديم الالتفاف المختلط من حيث العمق ، والذي يستخدم أحجام نواة متعددة لالتقاط الميزات بمقاييس مختلفة. لقد ثبت أنه يتفوق على النماذج الحديثة الأخرى مع الحفاظ على المعلمات و FLOPs القابلة للمقارنة. أظهرت هذه النماذج تحسينات كبيرة في الدقة والكفاءة مقارنة بالشبكات العصبية التلافيفية التقليدية في مهام التجزئة الدلالية المختلفة.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يصف هذا القسم بنية MixKNet المقترحة لتجزئة الصور الطبية. يوسع نموذج MixKNet بنية UNet ، حيث يتضمن آليات الانتباه وطبقات الالتفاف المختلطة العمقية. البرنامج المستخدم في هذه الدراسة مدرج في جدول المواد.

1. الهندسة المعمارية الشاملة

  1. تتبع بنية MixKNet ، الموضحة في الشكل 2 ، بنية UNet القياسية ، التي تتكون من مشفر ووحدة فك تشفير. اضبط شكل الإدخال على 224 × 224 × 3. في برنامج التشفير ، استخدم وحدتي DownBlock - تتضمن كل منهما 1×1 الالتفاف العمق ، وطبقة تجميع 2×2 كحد أقصى ، والالتفاف متعدد النواة (MDConv) بأحجام النواة مثل [1 ، 3 ، 5] أو [3-13].
  2. في وحدة فك التشفير ، استخدم وحدتي UpBlock - تقوم كل منهما بأخذ عينات ثنائية الخط ، وتخطي تسلسل الاتصال ، وتلاف 1×1 من حيث العمق ، والالتفاف متعدد النواة.
  3. استخدم عمليات تنشيط ReLU بعد كل كتلة تلافيفية. قم بتطبيق الالتفاف النهائي 1×1 لإنتاج الإخراج ، متبوعا بتنشيط Sigmoid للتجزئة الثنائية ، أو اتركه غير نشط ل Softmax الخارجي في مهام متعددة الفئات.

2. على شكل حرف U بالارض

ملاحظة: تقليل عمق بنية الشبكة العصبية لتقليل التعقيد الحسابي وحجم النموذج، مع إدراك أن هذا قد يقلل من القدرة على تعلم تمثيلات البيانات المعقدة.

  1. تقليص معمارية UNet من أربعة مستويات إلى نسخة من مستويين، كما هو مبين في الشكل 3، لتقليل عدد معلمات النموذج مع الاحتفاظ بمكونات التشفير وفك التشفير الأساسية.
    1. قم بإنشاء البنية المسطحة عن طريق إزالة المستويين 3 و 4 من كل من مسارات التشفير ووحدة فك التشفير ، والحفاظ على اتصالات الميزات في المستوى 2.
    2. اضبط عمليات أخذ العينات المنخفضة ورفع العينات وفقا لذلك لتتناسب مع العمق المنخفض ، وخطوة واحدة فقط لأخذ العينات قبل عنق الزجاجة وخطوة واحدة لأخذ العينات بعد ذلك.
      ملاحظة: قد يقلل هذا الانخفاض في العمق من قدرة النموذج على التعلم ، لأنه قد لا يلتقط العلاقات المعقدة بين المدخلات والمخرجات. يمكن أن تساعد زيادة عدد قنوات الالتواء الأساسية في كل طبقة من طبقات النموذج في التغلب على هذا القيد من خلال تعزيز قدرة النموذج على تعلم الميزات التمييزية. مع المزيد من قنوات الالتواء ، يمكن للنموذج التقاط أنماط وعلاقات أكثر تعقيدا في بيانات الإدخال ، مما يعوض عن العمق المنخفض ويحسن الأداء.
  2. ضع في اعتبارك أن زيادة عدد قنوات الالتواء يمكن أن تزيد أيضا من التعقيد الحسابي للنموذج واستخدام الذاكرة ، مما يوفر مقايضة مع سرعة التدريب والاستدلال. إيجاد توازن مناسب بين سعة النموذج والكفاءة الحسابية.

3. امزج حجم النواة لجهاز التشفير

  1. لتحسين أداء برنامج التشفير ، استخدم نهج حجم النواة المختلط في وحدة DC-CA (الالتفاف العميق وانتباه القناة) ، كما هو موضح في الشكل 4. بدلا من الاعتماد على حجم نواة واحد ، قم بتطبيق تلافيف عميقة متعددة بالتوازي مع أحجام النواة المختلفة (على سبيل المثال ، 1 ، 3 ، 5 ، 7 ، 9 ، 11 ، 13) لاستخراج الميزات في حقول استقبال متعددة.
  2. قم بتطبيق تطبيع الدفعات وتنشيط ReLU على كل فرع على حدة قبل التسلسل. تسلسل المخرجات من كل فرع نواة على طول بعد القناة.
  3. استخدم الالتفاف 1×1 بعد التسلسل لدمج الميزات وعرضها على عدد ثابت من قنوات الإخراج، مع الحفاظ على الاتساق مع حجم الإدخال المتوقع للطبقة التالية.
    ملاحظة: تتكون طبقة الالتفاف العميقة المختلطة من تلافيف عميقة متعددة بأحجام نواة مختلفة ، متبوعة بالتفاف نقطي. يتيح هذا التصميم التقاط الميزات بمقاييس مختلفة ، وهو أمر بالغ الأهمية في مهام تجزئة الصور الطبية. تستخدم الوحدة الأولى ثلاثة أحجام نواة - 1 و 3 و 5 - لزيادة مجال الاستقبال ، بينما تستخدم الوحدة الثانية أحجام نواة أكبر والمزيد من المجموعات ، وتحديدا 3 و 5 و 7 و 9 و 11 و 13.

4. قناة الانتباه

  1. دمج آلية انتباه القناة في وحدة DC-CA لتحسين تمثيل الميزات.
    1. استخدم التواء 1×1 مع حشوة "نفسها" لإنشاء خرائط انتباه حسب القناة. قم بتطبيق تجميع المتوسط العالمي عبر الأبعاد المكانية لإنتاج واصف مضغوط لكل قناة.
    2. استخدم شبكة تلافيفية خفيفة الوزن تتكون من اثنين من الالتفاف 1×1 مع تنشيط ReLU بينهما. تجنب مشاركة الوزن عبر القنوات - تعرف على أوزان الانتباه الفريدة لكل قناة.
    3. قم بتطبيق تنشيط السيني على الإخراج النهائي للحصول على درجات انتباه طبيعية. أعد وزن خرائط ميزة الإدخال عن طريق الضرب حسب القناة.
      ملاحظة: دع موتر الإدخال يكون x. يتم تنفيذ انتباه القناة من خلال التعبير التالي:
      (انتباه)_tensor = σ(conv(ReLU (conv(x)))) (1)
      حيث يمثل σ دالة التنشيط السيني ، والتحديات هي عملية الالتفاف ، و ReLU هي وظيفة تنشيط الوحدة الخطية المصححة.
  2. احصل على خريطة الانتباه عن طريق إجراء عملية تجميع متوسط تكيفية على موتر الانتباه ، متبوعا بتوسيعها لتتناسب مع حجم موتر الإخراج بعد الالتفاف بحجم نواة مختلف y:
    الانتباه = التوسع (avg_pool ([الانتباه] _tensor) ، الحجم (ذ)) (2)
  3. احسب موتر الإخراج z عن طريق إجراء الضرب حسب العنصر لموتر الإدخال y باستخدام خريطة الانتباه:
    z = z * الانتباه (3)
    حيث * يمثل الضرب حسب العنصر

5. مجموعات البيانات

ملاحظة: يتم استخدام مجموعتين من مجموعات بيانات الصور الطبية المتاحة للجمهور ، كما هو موضح في الجدول 1 والجدول 2 ، في هذه الدراسة: GlaS (Sirinukunwattana et al.11) و MoNuSeg (Kumar et al.9).

  1. استخدم مجموعة بيانات تجزئة الغدة (Sirinukunwattana et al.11) ، التي تم الحصول عليها باستخدام ماسح ضوئي رقمي لعلم الأمراض ومشروحة يدويا لتقسيم الهياكل الغدية الفردية داخل عينات الأنسجة.
    ملاحظة: تتكون مجموعة البيانات من 165 صورة ، دقة كل منها 500 × 500 بكسل ، جنبا إلى جنب مع أقنعة تجزئة الحقيقة الأرضية المقابلة. تتكون مجموعة بيانات MoNuSeg (Kumar et al.9) من 51 صورة للنوى المجهرية ، دقة كل منها 1000 × 1000 بكسل.

6. تفاصيل التنفيذ

  1. قم بتنفيذ النموذج باستخدام PyTorch على وحدة معالجة رسومات NVIDIA RTX 3090 واحدة. استخدم Ubuntu 22.04 كنظام تشغيل.
  2. قم بتغيير حجم جميع الصور المدخلة إلى حجم ثابت يبلغ 224 × 224 بكسل. تطبيق تقنيات زيادة البيانات لتعزيز تنوع التدريب.
    1. قم بتطبيق التعزيزات بشكل عشوائي بالترتيب التالي: الوجه الأفقي → الدوران → الدوران → تصحيح جاما → التحويل اللوغاريتمي → القياس العشوائي.
    2. قم بتطبيق تقلبات أفقية عشوائية باحتمال 0.5 ، والتقلبات الرأسية باحتمال 0.5 ، والدوران في حدود ±15 درجة باحتمال 0.5.
    3. تطبيق تصحيح جاما باحتمال 0.3 ، والتحول اللوغاريتمي باحتمال 0.3 ، والقياس العشوائي بعامل قياس يتراوح بين 0.9 و 1.1 ، مطبق باحتمال 0.3.
    4. تطبيع الصور باستخدام القيم المتوسطة [0.485 ، 0.456 ، 0.406] والانحرافات المعيارية [0.229 ، 0.224 ، 0.225].
  3. قم بتدريب النموذج باستخدام محسن Adam بمعدل تعلم 0.001 وحجم دفعة 4. استخدم تقنية جدولة معدل التعلم Warm Rerestart لإدخال التباين في جدول معدل التعلم ومنع التقارب مع المستوى الأمثل المحلي.
    ملاحظة: استخدم torch.optim.lr_scheduler المدمج في PyTorch. CosineAnnealingWarmRestarter Scheduler. تم تنفيذ المحسن والجدولة على النحو التالي:
    المحسن = torch.optim.Adam (model.parameters() ، lr = 0.001 ، weight_decay = 1e-5)
    المجدول = torch.optim.lr_scheduler. جيب التمامAnnealingWarmRestarts(
    المحسن ، T_0 = 10 ، T_mult = 2 ، eta_min = 1e-6)
    هنا ، يشير T_0 = 10 إلى عدد الحصور قبل إعادة التشغيل الأولى ، و T_mult = 2 يضاعف فترة إعادة التشغيل بعد كل دورة ، و eta_min = 1e-6 يحدد الحد الأدنى لمعدل التعلم. قم بتحديث معدل التعلم في نهاية كل حقبة عن طريق استدعاء scheduler.step().
  4. استخدم الانتروبيا الثنائية المتقاطعة كدالة الخسارة. ضع التوقف المبكر لمنع الإفراط في التركيب. تدريب النموذج لمدة أقصاها 5000 حقبة.
  5. تقييم أداء النموذج باستخدام متوسط التقاطع عبر الاتحاد (mIoU) ومعامل النرد.
    النرد = (2 |أ∩ب |)/(|أ |+ |ب |) (4)
    IoU=(|أ∩ب |)/(|أ∪ب |) (5)
    ملاحظة: mIoU هي نسبة التقاطع بين أقنعة تجزئة الحقيقة المتوقعة والأرضية إلى اتحادها. في الوقت نفسه ، معامل النرد هو نسبة ضعف التقاطع إلى مجموع أقنعة تجزئة الحقيقة المتوقعة والأرضية.
  6. إجراء تقييم صارم لمجموعات البيانات الصغيرة باستخدام ثلاث جولات من التحقق المتبادل 5 أضعاف ، مما أدى إلى ما مجموعه 15 تقييما. قم بخلط تقسيمات التحقق المتقاطع بشكل عشوائي في كل جولة لضمان التباين عبر الطيات. قم بتقسيم الطيات إلى طبقات بناء على توزيعات الفئات للحفاظ على توازن الملصق داخل كل طية.
  7. احسب متوسط الأداء عبر الطيات للتخفيف من مخاطر التقارب مع المستوى الأمثل المحلي. إجراء اختبار إحصائي لإثبات أن النهج المقترح يحقق تحسينات ذات دلالة إحصائية مقارنة بالطرق المماثلة.
  8. اعرض تنبؤات التحقق التمثيلية أثناء التدريب في الشكل 5 لتوضيح التحسن التدريجي في جودة التجزئة. بعد اكتمال التدريب، قم بتحميل نقطة تفتيش النموذج الأفضل أداء بناء على أداء التحقق من الصحة (على سبيل المثال، أعلى درجة mIoU و Dice).
    1. قم بتشغيل النموذج على مجموعة التحقق من الصحة لإنشاء أقنعة تجزئة متوقعة باستخدام المعلمات المحفوظة.
    2. تصور النتائج باستخدام Matplotlib من خلال عرض صورة الإدخال وقناع الحقيقة الأرضية والقناع المتوقع بتنسيق جنبا إلى جنب.
    3. تسليط الضوء على تفوق الطريقة المقترحة في أداء التجزئة من خلال تمييز المناطق التمثيلية بالمربعات الحمراء في التصور.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

مقارنة مع أحدث الأساليب
تم تقييم بنية MixKNet على مجموعتي بيانات تجزئة الصور الطبية ، GlaS و MoNuSeg ، ومقارنتها بأحدث الأساليب في هذا المجال. تم إجراء التقييم من خلال الإبلاغ عن درجات النرد وإنترنت الأشياء للطريقة المقترحة والعديد من النماذج المماثلة ، كما هو موضح في الجدول 3. تشير النتائج إلى أن بنية MixKNet تتفوق على النماذج الأخرى ، حيث تحقق أعلى درجات متوسط النرد وإنترنت الأشياء في كلتا مجموعتي البيانات. في مجموعة بيانات GlaS11 ، حققت MixKNet المق...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقدم هذه الدراسة MixKNet ، وهو تعديل جديد لبنية UNet1 لتجزئة الصور الطبية ، يدمج الالتواء المختلط العمق وآلية انتباه القناة لتعزيز أداء التجزئة مع تقليل التعقيد الحسابي بشكل كبير. يجمع الالتفاف القناة الهجينة بين نواة تلافيفية متعددة تعمل على مجموعات قنوات منفصلة. يسمح هذا التصميم للشبكة بالتقاط ميزات مكانية وسياقية متنوعة بمقاييس مجال استقبالية مختلفة داخل نفس الطبقة ، مما يحسن قدرة النموذج على تمثيل كل من الهياكل المحلية والعالمية. على عكس الالتواءات القياسية ، ...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ويعلن أصحاب البلاغ عدم وجود مصالح مالية متنافسة أو أي تضارب في المصالح.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

الدفعة الثانية من مشاريع أبحاث الرعاية الاجتماعية لعام 2023 في مدينة نينغبو: البحث وتطبيق التقنيات الرئيسية لتحديد الاحتيال في شبكات الاتصالات بناء على الأنطولوجيا والبرمجة اللغوية العصبية (2023S169).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
نظام التشغيل Linux (Ubuntu 22.04)  مختلف (مجتمع مفتوح المصدر)N / A (الإصدار 22.04 LTS) نظامتشغيل مفتوح المصدر للتطوير
https://releases.ubuntu.com/22.04/
NVIDIA RTX 3090 GPUNVIDIA3090وحدة معالجة الرسومات عالية الأداء للتعلم العميق
https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/
PythonPython Software FoundationN / A (الإصدار > 3.8)لغة برمجة لتطوير الذكاء الاصطناعي / ML
https://www.python.org/
PyTorchMeta الذكاء الاصطناعيN / A (الإصدار 1.13) إطارعمل التعلم الآلي مفتوح المصدر
https://pytorch.org/
Visual Studio Code (VS Code) MicrosoftN / Aمحرر كود خفيف الوزن وقوي
https://code.visualstudio.com/

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ronneberger, O., Fischer, P., Brox, T. U-Net: Convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  2. Oktay, O., et al. Attention U-Net: Learning where to look for the pancreas. arXiv. , (2018).
  3. Alom, M. Z., Yakopcic, C., Hasan, M., Taha, T. M., Asari, V. K. Recurrent residual U-Net for medical image segmentation. J Med Imaging. 6 (1), 014006-014006 (2019).
  4. Milletari, F., Navab, N., Ahmadi, S. -A. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. 3DV. , 565-571 (2016).
  5. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  6. Simonyan, K., Zisserman, A. Very deep convolutional networks for large-scale image recognition. arXiv. , (2014).
  7. Deep residual learning for image recognition. He, K., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 770-778 (2016).
  8. Densely connected convolutional networks. Huang, G., Liu, Z., Van der Maaten, L., Weinberger, K. Q. Proc IEEE Conf Comput Vis Pattern Recognit, , 4700-4708 (2017).
  9. Kumar, N., et al. A dataset and a technique for generalized nuclear segmentation for computational pathology. IEEE Trans Med Imaging. 36 (7), 1550-1560 (2017).
  10. Wang, H., Cao, P., Wang, J., Zaiane, O. R. UCTransNet: Rethinking the skip connections in U-Net from a channel-wise perspective with Transformer. Proc AAAI Conf Artif Intell. 36 (3), 2441-2449 (2022).
  11. Sirinukunwattana, K., et al. Gland segmentation in colon histology images: The GlaS challenge contest. Med Image Anal. 35, 489-502 (2017).
  12. Zhou, Z., Rahman Siddiquee, M. M., Tajbakhsh, N., Liang, J. UNet++: A nested U-Net architecture for medical image segmentation. Lect Notes Comput Sci. 11045, 3-11 (2018).
  13. Diakogiannis, F. I., Waldner, F., Caccetta, P., Wu, C. ResUNet-a: A deep learning framework for semantic segmentation of remotely sensed data. ISPRS J Photogramm Remote Sens. 162, 94-114 (2020).
  14. Cai, S., Tian, Y., Lui, H., Zeng, H., Wu, Y., Chen, G. Dense-UNet: A novel multiphoton in vivo cellular image segmentation model based on a convolutional neural network. Quant Imaging Med Surg. 10 (6), 1275-1285 (2020).
  15. Li, Z., et al. LViT: Language meets Vision Transformer in medical image segmentation. IEEE Trans Med Imaging. 43 (1), 96-107 (2023).
  16. Bahdanau, D., Cho, K., Bengio, Y. Neural machine translation by jointly learning to align and translate. arXiv. , (2014).
  17. Guo, C., Szemenyei, M., Yi, Y., Zhou, W., Bian, H. Residual spatial attention network for retinal vessel segmentation. Proc ICONIP. 27, 509-519 (2020).
  18. Squeeze-and-excitation networks. Hu, J., Shen, L., Sun, G. Proc IEEE Conf Comput Vis Pattern Recognit, , 7132-7141 (2018).
  19. Chen, H., Qi, X., Yu, L., Dou, Q., Qin, J., Heng, P. -A. DCAN: Deep contour-aware networks for object instance segmentation from histology images. Med Image Anal. 36, 135-146 (2017).
  20. Yang, F., Li, X., Wang, B., Teng, P., Liu, G. UMSCS: A novel unpaired multimodal image segmentation method via cross-modality generative and semi-supervised learning. Int J Comput Vis. , 1-23 (2025).
  21. Zhang, Z., et al. An evidential-enhanced tri-branch consistency learning method for semi-supervised medical image segmentation. IEEE Trans Instrum Meas. , 1-15 (2024).
  22. Zhang, Z., et al. Self-aware and cross-sample prototypical learning for semi-supervised medical image segmentation. Med Image Comput Comput Assist Interv. 14372, 192-201 (2023).
  23. Zhang, Z., et al. A time-frequency-aware hierarchical feature optimization method for SAR jamming recognition. IEEE Trans Aerosp Electron Syst. , 1-15 (2025).
  24. Howard, A. G., et al. MobileNets: Efficient convolutional neural networks for mobile vision applications. arXiv. , (2017).
  25. ShuffleNet: An extremely efficient convolutional neural network for mobile devices. Zhang, X., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 6848-6856 (2018).
  26. Xception: Deep learning with depthwise separable convolutions. Chollet, F. Proc IEEE Conf Comput Vis Pattern Recognit, , 1251-1258 (2017).
  27. Aggregated residual transformations for deep neural networks. Xie, S., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 1492-1500 (2017).
  28. Pyramid scene parsing network. Zhao, H., Shi, J., Qi, X., Wang, X., Jia, J. Proc IEEE Conf Comput Vis Pattern Recognit, , 2881-2890 (2017).
  29. Tan, M., Le, Q. V. MixConv: Mixed depthwise convolutional kernels. arXiv. , (2019).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

U Net
الفيديو قريباً

مقالات ذات صلة