يتطلب اشتراك JoVE لعرض هذا المحتوى. تسجيل الدخول أو ابدأ نسخة تجريبية مجانية

مقالة منهجية

شبكة تقسيم السلائل بناء على التواء الدواء والانتباه المزدوج لتشخيص آفات ما قبل سرطانية في القولون والمستقيم

51 مشاهدة

DOI:

10.3791/71178

يونيو 26, 2026

* These authors contributed equally

في هذه المقالة

ملخص

ينفذ هذا البروتوكول شبكة تعلم عميق على شكل حرف U تدمج الالتفاف الدوامي، والانتباه المزدوج، والاندماج متعدد المقاييس لتقسيم سلائل القولون والمستقيم.

الملخص

يعد تقسيم دقيق لسائلات القولون والمستقيم أمرا بالغ الأهمية للوقاية المبكرة والتشخيص لسرطان القولون والمستقيم. ومع ذلك، وبسبب التنوع الكبير في السلائل من حيث الشكل والحجم والملمس، بالإضافة إلى تعقيد بيئة الأمعاء (مثل الطيات، الانعكاسات المرآتية، وبقايا البراز)، لا تزال الطرق الحالية تواجه تحديات كبيرة في تحديد موقع الحدود واكتشاف السلائل الصغيرة. لمعالجة هذه القضايا، تقترح هذه الورقة شبكة تقسيم السلائل تعتمد على الالتفاف الدوجي والانتباه المزدوج (PWD-Net). تعتمد الشبكة المقترحة بنية مشفر-فك تشفير على شكل U، حيث يستخدم شبكة ResNet مدربة مسبقا كمشفر لاستخراج ميزات محلية متعددة المستويات. على وجه التحديد، يتم إدخال وحدة الالتفاف الدواسة (PCM) في طبقة عنق الزجاجة لالتقاط البنية الهندسية العالمية والمعلومات السياقية متعددة الاتجاهات للسلائل من خلال نوى الالتفاف متعددة الزوايا المدورة. آلية الانتباه المزدوج (DAM) التي تدمج انتباه القناة والانتباه المكاني مصممة لقمع الضوضاء الخلفية بشكل تكيفي وتعزيز ميزات منطقة البوليب. بالإضافة إلى ذلك، تستخدم استراتيجية دمج الميزات متعددة المقاييس (MSF) لدمج المعلومات الدلالية العميقة مع تفاصيل الحدود السطحية، مما يضمن اكتمال ودقة نتائج التقسيم. تظهر التجارب التي أجريت على مجموعتي بيانات Kvasir-SEG و CVC-ClinicDB أن PWD-Net يحقق متوسط معاملات نرد 0.865 و0.944، ودرجات IoU 0.765 و0.892 على التوالي، متفوقا بشكل ملحوظ على الطرق الحديثة الحالية. تؤكد دراسات الاستئصال فعالية كل وحدة، وتؤكد التقييمات عبر مجموعات البيانات القدرة القوية على التعميم للنموذج. توفر هذه الدراسة حلا عالي الدقة وقويا لتقسيم السلائل السريري، مما يوفر قيمة كبيرة للتشخيص المبكر للآفات ما قبل سرطانية القولون والمستقيم ويدعم التدخل بمساعدة الحاسوب.

المقدمة

يعد سرطان القولون والمستقيم من أكثر الأورام الخبيثة شيوعا في العالم، مع معدلات حدوث ووفيات مرتفعة باستمرار. أظهرت الدراسات أن معظم سرطانات القولون والمستقيم تتطور من السلائل الغدية، وهي عملية تستغرق عادة من 10 إلى 15 سنة، مما يوفر نافذة زمنية قيمة للكشف المبكر والتدخل. يمكن أن يؤدي زيادة بنسبة 1٪ في معدل الكشف عن الورم الغدي (ADR) إلى تقليل خطر الإصابة بسرطان القولون والمستقيم بحوالي 3٪، مما يقلل بشكل كبير من وفيات المرضى1. يعتبر تنظير القولون المعيار الذهبي لفحص سرطان القولون والمستقيم، مما يتيح إزالة السلائل مباشرة أثناء الفحص، مما يقلل بشكل فعال من حدوث السرطان والوفيات.

ومع ذلك، يعتمد تنظير القولون التقليدي بشكل كبير على خبرة ومستوى مهارة أخصائيي التنظيف. عوامل مثل الحكم الذاتي، والإرهاق البصري، والتشتت قد تؤدي إلى معدل فشل يتراوح بين 20٪–30٪، مما يؤثر بشكل مباشر على فعالية الفحص2. لذلك، فإن تطوير أنظمة الكشف بمساعدة الحاسوب (CAD) للتقسيم التلقائي لسليلات القولون والمستقيم يحمل أهمية كبيرة لتحسين ADR وتقليل التشخيصات الفائتة. سلطت الدراسات السريرية الأخيرة الضوء أكثر على الاهتمام بدمج الذكاء الاصطناعي في سير عمل تقييم الآفات بالمنظار، مما يعزز الحاجة إلى طرق تقسيم قوية وقابلة للتكرار3.

في السنوات الأخيرة، حقق التعلم العميق تقدما ملحوظا في تحليل الصور الطبية، لا سيما الشبكات العصبية الالفافية (CNNs)، التي تظهر قدرة قوية على استخراج وتمثيل الميزات لمهام تقسيم الصورة4. كنموذج تقليدي لتقسيم الصور الطبية، يستخدم U-Net بنية مشفر-فك تشفير متماثلة ويتجاوز الاتصالات لتحقيق تقسيم دقيق على مستوى البكسل، ليصبح معيارا فيهذا المجال. استنادا إلى U-Net، تم اقتراح العديد من البنى المحسنة لمعالجة مهام تقسيم الصور الطبية المعقدة. تقلل UNet++ الفجوة الدلالية بين خرائط ميزات المشفر ومفكك الترميز من خلال إدخال اتصالات تخطي متداخلةوكثيفة 6. يدمج ResUNet++ الكتل المتبقية، ووحدات الضغط والإثارة، والتداخلات المتوسعة، وآليات الانتباه، محققا أداء قويا في تقسيم السلائل7. تعتمد U2-Net هيكلا متداخلا على شكل U من مستويين لالتقاط معلومات الميزات متعددة المقاييس8. مؤخرا، تم اقتراح شبكة تقسيم سلائل عميقة تعتمد على الترميز ومفك الترميز المزدوج، تستفيد من مسارات الترميز وفك الترميز المتوازي لتعزيز دقة التقسيم9.

وفي الوقت نفسه، يوفر إدخال آليات الانتباه حلولا جديدة لتعزيز الميزات وقمع الضوضاء. يستخدم الانتباه يو-نت بوابات الانتباه للتركيز على المناطق المستهدفة مع قمع المعلومات الخلفية غير ذات الصلة10. شبكة الانتباه المزدوج (DANet) تثقل الميزات بشكل تكيفي من أبعاد القناة والأبعاد المكانية11، مما يحسن إدراك الميزات الحرجة. تعزز شبكات الانتباه الثلاثي (TANet) أداء التقسيم من خلال الاختيار التكيفي للميزات متعددة المقاييس12.

مع نجاح بنى المحولات في معالجة اللغة الطبيعية ورؤية الحاسوب13، بدأ الباحثون في استكشاف تطبيقها في تقسيم الصور الطبية. كانت ترانس يونيت أول من استخدم محول كمشفر لنمذجة التبعيات طويلة المدى بفعالية14. تعتمد Swin-UNet بنية ترانسفورمر نقية وتحقق تجميعا عالميا للمعلومات بكفاءة من خلال آلية النافذة المتغيرة15. يقترح UTNet بنية هجينة تجمع بين قدرة استخراج الميزات المحلية لشبكات CNN مع القدرة العالمية على النمذجة في Transformers16.

في مجال تقسيم السلائل، يستخدم Polyp-PVT محول رؤية هرم لالتقاط المعلومات الدلالية العالمية متعددة المقاييس17، بينما يعزز UNet المتداخلة متعددة المقاييس الفهم السياقي من خلال دمج ترانسفورمرز18. كما استكشفت الدراسات الحديثة استراتيجيات التعلم السلبي للارتباط السلبي لتقسيم السلائل عبر المجالات19، وتعزيز التقسيم المعزز بجومبرتز20، والهياكل القائمة على الانتباه التي تتضمن توجيه الحدود21. على الرغم من أن هذه الأساليب تحسن أداء التقسيم إلى حد ما، إلا أن تقسيم السلائل لا يزال يواجه عدة تحديات. أولا، تظهر السلائل تباينا عاليا في الشكل والحجم والملمس، تتراوح من سلائل دقيقة أصغر من 5 مم إلى سلائل كبيرة تتجاوز 30 مم، مع أشكال تتراوح من الدائرية والهليلجية إلى أشكال غير منتظمة للغاية. ثانيا، البيئة المعوية معقدة ومتغيرة، حيث تسبب طيات المخاط، الانعكاسات المرآتية، بقايا البراز، وبقايا الطعام تداخلا خلفيا شديدا. ثالثا، العديد من السلائل لها حدود غير واضحة، أو قد تكون محجوبة جزئيا بطيات، أو مغمورة في سوائل الأمعاء، مما يجعل تحديد تحديد الحدود بدقة أمرا صعبا للغاية22.

لا تزال الطرق الحالية تفرض قيودا واضحة في مواجهة هذه التحديات. شبكات CNN التقليدية فعالة في استخراج الملمس المحلي وميزات الحواف؛ ومع ذلك، فإن نوى الالتفاف المربع الثابت ليست مناسبة جيدا لالتقاط أشكال هندسية متنوعة23، خاصة للسلائل غير المنتظمة للغاية، ولا يمكنها نمذجة الميزات الهندسية متعددة الاتجاهات بفعالية. يمكن لطرق المحول نمذجة الاعتماديات العالمية لكنها أقل فعالية في التقاط التفاصيل المحلية الدقيقة ومعلومات الحدود. علاوة على ذلك، فإن تعقيدها الحسابي العالي يجعلها أقل ملاءمةللتطبيقات السريرية في الوقت الحقيقي. الأساليب الحديثة لتقسيم السلائل مثل PraNet، التي تستخدم وحدات الانتباه العكسي لتحسين المناطق الرئيسية25، وشبكات الانتباه المتسلسل الموجهة بالحدود التي تعزز استخراج ميزات الحدود26، وCAFE-Net، التي تدمج ميزات المشفر والمفكك عبر آليات الانتباهالمتقاطع 27، لا تزال تواجه تمثيلا غير كاف للميزات وتحديد موقع حدود غير دقيق عند التعامل مع السلائل الصغيرة28، حدود ضبابية، وخلفيات معقدة. علاوة على ذلك، تتجاهل معظم الطرق الشكل الهندسي وتفشل في استغلال المعلومات السياقية متعددة الاتجاهات بشكل كامل، مما يؤدي إلى تقسيم غير مثالي للسلائل غير المنتظمة.

باختصار، تفتقر الطرق الحالية القائمة على CNN إلى القدرة على التقاط ميزات هندسية متعددة الاتجاهات بسبب اعتمادها على نوى الالتفاف المربعة الثابتة. تقدم الأساليب القائمة على المحولات نمذجة عالمية لكنها تضحي بدقة الحدود المحلية وتفرض تكاليف حسابية عالية. وفي الوقت نفسه، لم يتم تحسين استراتيجيات الاندماج المعززة بالانتباه ومتعددة المقاييس بشكل مشترك ضمن إطار موحد مصمم خصيصا لتقسيم السلائل29. هذه الفجوات تحفز تطوير طريقة تعالج في الوقت نفسه نمذجة الميزات الهندسية، وقمع الضوضاء التكيفي، وتكامل الميزات عبر المقاييس.

لمعالجة هذه القضايا، يقدم هذا البروتوكول شبكة تقسيم السلائل تعتمد على الالتفاف الدوجي والانتباه المزدوج (PWD-Net). تدمج الشبكة المقترحة نمذجة الميزات الهندسية، وتعزيز الانتباه متعدد الأبعاد، ودمج الميزات متعددة المقاييس، مما يتيح تقسيم دقيق للسلائل المعقدة. تلخص المساهمات الرئيسية لهذا العمل كما يلي: وحدة الالتفاف الدوارة (PCM)، المستوحاة من بنية الدولاب الدبابيس، يقترح تصميم نواة الالتفاف المدورة الجديدة التي تلتقط الميزات الهندسية متعددة الاتجاهات للسلائل من خلال عمليات الالتفاف بزوايا متعددة (0°، 45°، 90°، 135°، 180°، 225°، 270°، و315°). تحل هذه الوحدة محل طبقة الالتفاف التقليدية في مرحلة عنق الزجاجة، مما يتيح إدراكا فعالا لاتجاهات الحواف المختلفة ويحسن بشكل كبير تمثيل السلائل ذات الأشكال غير المنتظمة. آلية الانتباه المزدوج (DAM) تعالج الضوضاء الخلفية مثل الطيات، الانعكاسات، وبقايا البراز في صور تنظير القولون. تم تصميم وحدة تركيز مزدوج تدمج انتباه القناة والانتباه المكاني. مدمجة داخل اتصالات التخطي، تقوم هذه الوحدة بقمع التداخل الخلفي بشكل تكيفي وتعزز استجابات الميزات في مناطق البوليب من خلال تحديد "ما" المهم (بعد القناة) و"أين" الهدف (البعد المكاني)، مما يضمن أن الميزات المحسنة فقط هي التي تدخل في الاندماج اللاحق. تحافظ استراتيجية دمج الميزات متعددة المقاييس (MSF) على كل من المعلومات الدلالية العميقة وتفاصيل الحدود الضحلة من خلال آلية هرمية تم إدخالها في جهاز فك الترميز. من خلال دمج ميزات الترميز المحسنة ب DAM مع ميزات فك التشفير المعززة بعينة أعلى، تعوض هذه الاستراتيجية بشكل فعال عن فقدان التفاصيل المكانية الناتج عن تقليل العينة، مما يمكن الكشف الدقيق عن السلائل الصغيرة وتحديد الحدود بدقة.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

تستخدم هذه الدراسة فقط مجموعات بيانات صور تنظير القولون المجهولة الهوية المتاحة للجمهور (Kvasir-SEG). لم يتم جمع بيانات جديدة من البشر. لم تكن هناك حاجة لموافقة أخلاقيات المؤسسات وموافقة المريض المستنيرة، كما أكدت سياسات المراجعة المؤسسية للتحليلات الرجعية لمجموعات البيانات العامة غير المحددة هوية.

1. تحضير البيانات

  1. حمل مجموعة بيانات Kvasir-SEG من المستودع الرسمي 33 (https://datasets.simula.no/kvasir-seg/). تحتوي مجموعة البيانات على 1000 صورة بوليب مع أقنعة حقيقة أرضية على مستوى البكسل المقابلة.
  2. قسم مجموعة البيانات عشوائيا إلى مجموعات تدريب (800 صورة)، والتحقق (100 صورة)، ومجموعات اختبار (100 صورة) بنسبة 8:1:1 باستخدام بذرة عشوائية ثابتة (seed = 42). تحقق من عدم وجود صور متداخلة عبر المجموعات الثلاث الفرعية لمنع تسرب البيانات.
  3. إعادة تكبير جميع الصور والأقنعة المقابلة إلى 352 × 352 بكسل باستخدام الاستيفاء الثنائي الخطي للصور واستيفاء أقرب جار للأقنعة.
  4. قم بتطبيع قيم البكسل إلى [0, 1] عن طريق القسمة على 255، ثم تطبيق طرح متوسط ImageNet على قناة (0.485، 0.456، 0.406) وتطبيع الانحراف المعياري (0.229، 0.224، 0.225).
  5. تطبيق التحولات التعزيزية التالية على مجموعة التدريب فقط (وليس على مجموعات التحقق أو الاختبار): الانقلاب الأفقي العشوائي (الاحتمالية = 0.5); الانقلاب العمودي العشوائي (الاحتمالية = 0.5)؛ الدوران العشوائي (النطاق: −30° إلى +30°، الاحتمالية = 0.5)؛ تغيير الحجم العشوائي متعدد المقاييس (عامل المقياس: 0.75 إلى 1.25، الاحتمالية = 0.5)
    ملاحظة: تطبيق تحويلات مكانية متطابقة على كل من الصورة وقناعها المقابل للحفاظ على المحاذاة. تحقق من صحة التعزيز من خلال فحص عدة أزواج من الصور والقناع المعززة بصريا قبل بدء التدريب.

2. العمارة العامة

ملاحظة: راجع الشكل 1 للعمود الفقري للترميز-فك الترميز على المستوى الكلي ل PWD-Net، وإلى الشكل 2 لتكامل وتفاعل الوحدات الأساسية ضمن تدفق الميزات. تتبع البنية العامة تصميم مشفر-فك التشفير على شكل حرف U للتعامل مع تغيرات مقياس السلائل والتداخل الخلفي في صور تنظير القولون.

  1. العمود الفقري ومسار الترميز (الشكل 1)
    1. استخدم جهاز ResNet-50 المدرب مسبقا على ImageNet (مستورد من حديقة النماذج الرسمية ل PyTorch) كمشفر العمود الفقري30. قم بضبط جميع طبقات الترميز أثناء التدريب.
    2. قم بتغذية صورة القولون المدخلة (التي تم تعديلها إلى 352 × 352 بكسل) عبر خمس مراحل من الكتل الالفافية المتبقية لاستخراج الميزات الهرمية. يتم تقليل الدقة المكانية لخرائط الميزات تدريجيا من إلى عبر المراحل الخمس، بينما تزداد أبعاد القنوات تتناسب مع ذلك (64 → 128 → 256 → 512 → 1024).
    3. عند عنق الزجاجة (أعمق طبقة مشفرة)، استبدل الطبقة الالفافية القياسية بوحدة الالتفاف الدواء (PCM، الموضحة في القسم 3) لالتقاط الشكل الهندسي العالمي والمعلومات السياقية متعددة الاتجاهات بدقة منخفضة.
      ملاحظة: المراحل الخمس للترميز تتوافق مع مجموعات الطبقات القياسية ل ResNet-50: conv1، الطبقة 1، الطبقة 2، الطبقة 3، والطبقة 4. توفر الأوزان المدربة مسبقا تهيئة ميزات قوية على المستوى المنخفض والمتوسط، مما يقلل من وقت التقارب في مجموعات البيانات الطبية الصغيرة.
  2. المكونات الرئيسية وتفاعل الميزات (الشكل 2 والشكل 3)
    1. تطبيق آلية الانتباه المزدوج (DAM، الموضحة في القسم 4) على مخرجات كل مرحلة من مراحل المشفر قبل نقلها إلى جهاز فك التشفير عبر اتصالات تخطي. تقوم هذه الخطوة بشكل تكيفي بكبت الضوضاء الخلفية الناتجة عن طيات الأمعاء وانعكاسات الانعكاسات المرآتية، مع تعزيز استجابة الخصائص في مناطق البوليب. يتم تمرير الميزات المصفاة فقط إلى طبقة فك التشفير المقابلة.
    2. في جهاز فك الترميز، تستعيد الدقة المكانية تدريجيا من خلال الأخذ في العينات الثنائية الخطية. في كل طبقة فك ترميز، قم بدمج الميزات التي تم رفع عينة من مرحلة فك الترميز السابقة مع ميزات الترميز المعززة ب DAM ذات نفس الدقة المكانية.
    3. تطبيق طبقتين التفافيتين متتاليتين (كل واحدة تليها تطبيع دفعي وتفعيل ReLU) لدمج المعلومات متعددة المقاييس. يشكل هذا استراتيجية دمج الميزات متعددة المقاييس (MSF) الموضحة في القسم 5.
      ملاحظة: يتقدم جهاز فك الترميز من الطبقات العميقة إلى الطبقات الضحلة (المرحلة 5 → المرحلة 1)، مما يضمن دمج معلومات تحديد الموقع الدلالي العميق وتفاصيل الحدود الضحلة بشكل فعال في كل مستوى.
  3. توليد المخرجات
    1. تطبيق طبقة الالتفافية تليها دالة تفعيل سيجمويد على خرج فك التشفير النهائي لتوليد قناع التنبؤ.
    2. قم بثنائية قناع التنبؤ باستخدام عتبة 0.5 للحصول على نتيجة التقسيم النهائية، حيث يتم تصنيف البكسلات ذات الاحتمالية المتوقعة ≥ 0.5 كسلائل سلائل وبقية البكسلات كخلفية.

3. وحدة الالتفاف العجلة (الشكل 3)

  1. تستبدل وحدة الالتفاف الدوجين (PCM) الالتفاف الزجاجي القياسي لالتقاط الميزات الهندسية متعددة الاتجاهات للسلائل. نفذ هذه الوحدة كما يلي:
    1. حدد نواة الالتفاف الأساسية W بحجم 3 × 3 مع Cفي قنوات الإدخال وC قنواتالإخراج .
    2. حدد مجموعة زوايا الدوران Θ = {0°، 45°، 90°، ...، 315°}. لكل زاوية θ ∈ Θ، تولد النواة المدورة Wθ بتطبيق دوران قائم على الاستيفاء الثنائي الخطي على W. جميع النوى الثمانية المدورة تشترك في نفس المعلمات الأساسية؛ فقط الترتيب المكاني للأوزان يختلف.
    3. لكل زاوية θ، احسب خريطة الميزات الخاصة بالاتجاه:
      figure-protocol-1
      حيث X هي خريطة ميزات الإدخال.
    4. اجمع خرائط الميزات الثمانية الاتجاهية عن طريق التسلسل على قناة على محور القناة، لإنتاج موتر ذو بعد (8 × Cإلى خارج) × H × W. ثم تطبيق التفاف 1 × 1 لتقليل بعد القناة إلىC out، يليه تطبيع دفعي وتفعيل ReLU31:
      figure-protocol-2
      ملاحظة: يتم تنفيذ الدوران والاستيفاء على أوزان النواة، وليس على خريطة ميزات الإدخال. يتيح هذا التصميم استخراج ميزات متعددة الاتجاهات بكفاءة المعلمات دون زيادة دقة الإدخال. في التطبيق الحالي، Cin = 1024 وCout = 1024 في مرحلة عنق الزجاجة، مما يطابق بعد قناة الإخراج لطبقة ResNet-504. راجع حزمة الكود الإضافية للتنفيذ الكامل.

4. آلية الانتباه المزدوج (الشكل 4)

ملاحظة: آلية الانتباه المزدوج (DAM) مدمجة داخل كل اتصال تخطي لقمع الضوضاء الخلفية وتعزيز ميزات منطقة البوليب من أبعاد القناة والمكان.

  1. انتباه القناة
    يحدد فرع انتباه القناة أي القنوات المميزة هي الأكثر إفادة. بالنظر إلى ميزة الإدخال F ∈ RC×H×W:
    1. ضغط الأبعاد المكانية عبر تجميع المتوسط العالمي للحصول على واصف قناة z ∈ RC×1×1.
    2. مرر z عبر طبقة من MLP (طبقات متصلة بالكامل) بنسبة اختزال r = 16. الطبقة الأولى تقلل البعد من C إلى C/16 مع تفعيل ReLU؛ الطبقة الثانية تستعيده من C/16 إلى C مع تنشيط سيجمويد لإنتاج متجه وزن القناة Ac:
      figure-protocol-3
      حيث δ تشير إلى ReLU وتشير σ إلى سيغمويد.
  2. الانتباه المكاني
    يحدد فرع الانتباه المكاني أماكن المناطق المستهدفة:
    1. طبق كل من التجميع الأقصى والتجميع المتوسط على طول بعد القناة لإنشاء خريطتين ميزات ثنائية الأبعاد بحجم 1 × H × W.
    2. ادمج الدالتين على محور القناة لتشكيل موتر 2 × H × W. تطبيق طبقة التفافية بحجم 7 × 7 تليها تفعيل السيغمويد لإنتاج خريطة الوزن المكاني As ∈ R1×H×W:
      figure-protocol-4
  3. فيتش فيوجن
    1. دمج مخرجات القناة والانتباه المكاني مع ميزة الإدخال من خلال الضرب على العنصر:
      figure-protocol-5
      حيث α و β هما معاملات توازن قابلة للتعلم، كلاهما مهيأ إلى 0.5 ويتم تحديثهما معا مع معلمات الشبكة عبر تحسين قائم على التدرج أثناء التدريب.
      ملاحظة: راجع حزمة الكود التكميلية (dam_module.py) للتنفيذ الكامل.

5. دمج الميزات متعدد المقاييس

  1. تطبيق استراتيجية دمج الميزات متعددة المقاييس (MSF) في جهاز فك التشفير لمعالجة فقدان التفاصيل المكانية في الميزات العميقة. في كل مرحلة من مراحل فك الترميز، قم بأداء ما يلي:
  2. قم بزيادة نموذج خريطة الميزة من مرحلة فك التشفير السابقة بمقدار 2 باستخدام الاستيفاء الثنائي الخطي.
  3. قم بدمج الميزات التي تم رفع عينات منها مع ميزات المشفر المحسنة بواسطة DAM ذات الدقة المكانية المقابلة على محور القناة.
  4. تطبيق طبقتين التفافيتين متتاليتين من 3 × 3 (كل واحدة تليها تطبيع دفعي وتفعيل ReLU32) لدمج الميزات المتراكمة.
    ملاحظة: يضمن هذا الدمج عبر المستويات الحفاظ على تفاصيل حدود السلائل (التي توفرها ميزات المشفر السطحية) وتحديد الموقع الدلالي (الذي توفره الميزات العميقة) في الوقت نفسه، مما يولد نتائج تقسيم دقيقة الحبيبات.

6. وظيفة الفقدان وتكوين التدريب

  1. دالة الخسارة
    1. يتم اعتماد دالة فقدان هجينة L_total لتحسين الشبكة بشكل مشترك، معالجة اختلال التوازن الشامل بين المقدمة–الخلفية في تقسيم السلائل.
      يقيس فقدان الإنتروبيا المتقاطعة الثنائية (LBCE) دقة التصنيف على مستوى البكسلات:
      figure-protocol-6
      حيث N هو العدد الكلي للبكسلات، وyi ∈ {0,1} هو تسمية الحقيقة الأرضية، وŷi ∈ [0,1] هو الاحتمال المتوقع.
    2. فقدان النرد (LDice) يقيس تشابه المجموعات بين المناطق المتوقعة ومنطقة الحقيقة الأرضية:
      figure-protocol-7
      figure-protocol-8
      حيث ε هو عامل تنعيم (مضبوط على 1 × 10⁻5) لتجنب القسمة على الصفر.
      اضبط λ = 0.5 لموازنة مساهمات الفصلين الخاسرين.
  2. تكوين التدريب
    1. قم بتهيئة المشفر بأوزان ResNet-50 المدربة مسبقا على ImageNet. تهيئة جميع طبقات فك الترميز، ومعلمات PCM، وDAM باستخدام تهيئة كايمينغ الموحدة.
    2. قم بتكوين المحسن وجدول التدريب كما يلي. استخدم محسن آدم مع β₁ = 0.9 و β₂ = 0.999. اضبط معدل التعلم الأولي إلى 1 × 10⁻⁴. طبق جدول معدل التعلم بالجيب التمام، حيثT max = 50 و ηmin = 1 × 10⁻⁶. استخدم حجم دفعة 16 ودرب النموذج لخمس فترة من الحقبة.
    3. درب النموذج لمدة 50 حقبة على مجموعة التدريب (800 صورة). في نهاية كل حقبة، يتم تقييم النموذج على مجموعة التحقق (100 صورة) باستخدام معامل Dice كمقياس مراقبة أساسي.
    4. احفظ نقطة التحقق في النموذج التي تحقق أعلى معامل نرد في مجموعة التحقق. استخدم هذه النقطة كنموذج نهائي لجميع التقييمات اللاحقة على مجموعة الاختبار.
      ملاحظة: التوقف المبكر غير مطبق بشكل صريح. استراتيجية اختيار نقاط التحقق من النرد لأفضل تحقق من حيث الاعتماد هي معيار اختيار النموذج. تجرى جميع التجارب باستخدام بيئة الأجهزة والبرمجيات المحددة في جدول المواد. التدريب على 50 فترة على 800 صورة يستغرق حوالي ساعتين ضمن التكوين المذكور. يتم الحصول على جميع النتائج المبلغ عنها من تجربة تدريب واحدة باستخدام البذرة العشوائية المحددة (البذرة = 42). راجع حزمة الكود الإضافية للحصول على نص التدريب الكامل.

7. الشيفرة الزائفة

  1. استخدم خوارزمية 1 كخريطة سير عمل كاملة لشبكة PWD. مطابقة كتل PCM وDAM والبنية الرئيسية وخط أنابيب التدريب في الخوارزمية مع الملفات المقابلة في حزمة الكود التكميلية.
  2. نفذ كتلة PCM الموضحة في الأسطر من 4 إلى 12. تعريف نواة الالتفاف الأساسية 3 × 3 وتوليد ثماني نوى مدورة عند 0°، 45°، 90°، 135°، 180°، 225°، 270°، و315° باستخدام الاستيفاء الثنائي.
  3. احتفظ بنفس المعايير الأساسية القابلة للتعلم لجميع نوى PCM المدوارة. لكل زاوية دوران، احسب خريطة ميزة خاصة بالاتجاه.
  4. قم بدمج خرائط ميزات PCM الثمانية على طول بعد القناة. قم بتطبيق التفاف 1 × 1، وتطبيع دفعي، وتفعيل ReLU لاستعادة بعد القناة الأصلي.
  5. نفذ كتلة DAM الموضحة في الأسطر 14 إلى 19. تطبيق تجميع المتوسط العالمي لتوليد واصف القناة، ثم مرره عبر MLP من طبقتين بنسبة تقليل 16 للحصول على أوزان القنوات.
  6. قم بإنشاء خريطة الانتباه المكاني عن طريق تطبيق تجميع متوسط على قناة وأقصى تجمع على ميزة الإدخال. ادمج الخريطتين ومعالجتهما بالتفاف 7 × 7 يليه تفعيل السيغمويد.
  7. دمج قناة DAM ومخرجات الانتباه المكاني مع ميزة الإدخال باستخدام ضرب العناصر على حدة. وزن خريطتي الانتباه بمعاملين قابلين للتعلم α و β، وكلاهما مهيأ إلى 0.5.
  8. ابن البنية الرئيسية لشبكة PWD الموضحة في الأسطر 21 إلى 32. مرر صورة الإدخال عبر خمس مراحل من مشفر ResNet 50 المدرب مسبقا للحصول على e1 إلى e5، مع انخفاض الدقة المكانية من H × W إلى H/32 × W/32.
  9. ضع PCM على E5 عند عنق الزجاجة. قم بتطبيق DAM على e1 إلى e4 قبل إرسال هذه الميزات إلى جهاز فك التشفير عبر اتصالات تخطي.
  10. فك شفرة خريطة الميزات من الطبقات العميقة إلى السطحية. عند كل مستوى فك ترميز، قم برفع عينة الميزة السابقة، وربطها بميزة الترميز المحسنة DAM المقابلة، وتطبيق DoubleConv لدمج الميزات.
  11. توليد مخرج التقسيم باستخدام الالتفاف 1 × 1 يليه تفعيل السيجمويد. استخدم خريطة الاحتمالات بالبكسل كقناع متوقع.
  12. نفذ حلقة التدريب الموضحة في الأسطر 34 إلى 39. في كل حقبة، قم بتنفيذ الانتشار عبر شبكة PWD وحساب القناع المتوقع.
  13. احسب خسارة التدريب كخسارة 0.5 مضمرة BCE زائد 0.5 x خسارة نرد. قم بتحديث جميع المعلمات القابلة للتعلم باستخدام محسن آدم من خلال الانتشار العكسي.

الخوارزمية 1: تقسيم السلائل الشبكية إلى PWD
1: الإدخال: صورة تنظير القولون I ∈ RH×W×3
2: الإنتاج: قناع التجزئة M ∈ {0,1}(H×W)
3:
4: الوظيفة وحدة الالتفاف العجلة PCM(X) ▷
5: حدد نواة القاعدة W (3 × 3)، الزوايا Θ = {0°، 45°، ...، 315°}
6: لكل θ ∈ Θ قم
7: Wθ ← تدوير ثنائي الخط(W, θ) ▷ نواة التدوير
8: Yθ ← Conv2d(X, Wθ) ▷ الميزات الخاصة بالاتجاه
9: نهاية ل
10: Y ReLU(BN(Conv1 × 1(Concat({Y θ})))) ▷ Aggregate
11:إرجاع Y
12: دالة النهاية
13:
14: الوظيفة DAM(F) ▷ آلية الانتباه المزدوج
15: Ac ← سيغمويد (MLP(AvgPool(F))) ▷ انتباه القناة (r=16)
16: As ← Sigmoid (Conv7 × 7([AvgPool(F)؛ MaxPool(F)])) ▷ الانتباه المكاني
17: F' ← F ⊗ (α · Ac + β · As) ▷ الاندماج مع α قابل للتعلم، β (init=0.5)
18: العودة F'
19: نهاية الدالة
20:
21: الوظيفة PWD-Net(I)
22: المشفر: e1،e 2،e 3،e 4، e5 ← ResNet50_Stages(I) ▷ مشفر مدرب مسبقا بخمس مراحل
23: عنق الزجاجة: b ← PCM(e5) ▷ تطبيق PCM عند عنق الزجاجة
24: تخطي الاتصالات: si ← DAM(ei) ل i = 1، 2، 3، 4 ▷ ميزات مشفر المرشح
25: فك الترميز:
26: d4 ← DoubleConv(Concat(Up(b)،s 4))
27: d3 ← DoubleConv(Concat(Up(d4),s 3))
28: النصر2 ← المؤتمر المزدوج (كونكات (دور3)، الثانوية2))
29: d1 ← DoubleConv(Concat(Up(d2),s 1))
30: M ← سيغمويد (Conv1 × 1(d1))
31: العودة M
32: دالة النهاية
33:
34: التدريب:
35: لكل عصر قم ب
36: M̂ ← PWD-Net(I)
37: L ← 0.5 · BCE(M̂,M gt) + 0.5 · DiceLoss(M̂, Mgt) ▷ λ = 0.5

38: تحديث المعلمات عبر الانتشار العكسي (Adam تحسينr)
39: نهاية ل

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

الإعداد التجريبي
مجموعة البيانات

تم استخدام مجموعة بيانات كفاسير SEG لتقييم سلوك تقسيم شبكة PWD على صور تنظير القولون ذات ظهور سلائل غير متجانسة. تحتوي مجموعة البيانات على صورة بوليب مشروحة بحجم 1000 بكسل، وتشمل تنوعا في حجم البوليب، وشكلها، وملمسها، وإضاءتها، وتعقيد الخلفية، مما يجعلها مناسبة لتقييم اكتشاف الأهداف الصغيرة، وتحديد موقع الحدود، ومتانة التداخل البصري. تم تقسيم مجموعة البيانات إلى مجموعات تدريب، والتحقق من الصحة، والاختبار، وت...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

تعد عدة خيارات تصميمية في بروتوكول PWD-Net ضرورية لتحقيق نتائج تقسيم موثوقة وتستحق الانتباه الدقيق أثناء التنفيذ. أولا، يؤثر اختيار وتهيئة العمود الفقري للمشفر بشكل مباشر على سلوك التقارب والأداء النهائي. يستخدم البروتوكول مشفر ResNet-50 مدرب مسبقا على ImageNet، مما يوفر تهيئة ميزات قوية على المستوى المنخفض والمتوسط. وهذا مهم بشكل خاص لمهام تقسيم الصور الطبية حيث تكون بيانات التدريب المتاحة محدودة (800 صورة في هذه الدراسة). يسمح ضبط جميع طبقات المشفر، بدلا من تجميدها، للشبكة بتكييف الميز...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

المؤلفون ليس لديهم ما يكشفون عنه.

شكر وتقدير

تم تمويل هذه الدراسة من قبل برنامج البحث والتطوير الوطني للمفاتيح في الصين (أرقام البرنامج 2022YFC3500200 و2022YFC3500204).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
Adam Optimizerموجود في PyTorch
Albumentationsفريق Albumentationsv1.0+مكتبة تكبير البيانات
CUDA ToolkitNVIDIAv11.3+تسريع GPU
مجموعة بيانات Kvasir-SEGSimulaMethttps://datasets.simula.no/kvasir-seg/
Matplotlibمجتمع Matplotlibv3.4+تصور منحنيات التدريب
NumPyمجتمع NumPyv1.21+الحساب العددي
NVIDIA Tesla P100NVIDIAP100-PCIE-16GBGPU للتدريب والاستدلال
OpenCVمجتمع OpenCVv4.5+معالجة الصور
Pythonمؤسسة Python للبرمجياتv3.8+لغة برمجة
PyTorchMeta Platformsv1.12+إطار عمل التعلم العميق
أوزان ResNet-50 المسبقة التدريبPyTorch Model Zooتم تدريبها على ImageNet-1K
UbuntuCanonical18.04+نظام تشغيل

إعادة الطباعة والأذونات

الوسوم

الطبالعدد 232العدد 232قيمة فارغةعددآلية الانتباه المزدوجدمج الميزات متعدد المقاييسالتعلم العميقمعالجة الصور الطبية