مقالة منهجية

إطار شبكة مامبا على شكل U متعدد الرؤية لتقسيم الصور الطبية

DOI:

10.3791/72616

أغسطس 7, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يصف هذا البروتوكول كيفية بناء وتدريب وتقييم إطار شبكة Vision Mamba U-Shape متعددة المنظورات لتقسيم الصور الطبية، مما يمكن من إعادة تقسيم آفات الجلد وأعضاء البطن من خلال إعداد مجموعات البيانات الموحدة، وتنفيذ النماذج، وتقييم الأداء.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يتطلب تقسيم الصور الطبية طرقا حسابية تلتقط بدقة السياق العالمي، والحدود المحلية، والهياكل التشريحية متعددة المقاييس مع الحفاظ على قابلية التكرار عبر تطبيقات مختلفة. تقدم هذه المقالة بروتوكولا لبناء وتدريب وتقييم إطار شبكة مامبا متعددة الرؤى على شكل U لتقسيم الصور الطبية ثنائية الأبعاد. يوفر البروتوكول سير عمل قابل للتكرار يشمل اكتساب مجموعات البيانات العامة، والمعالجة المسبقة للصور والأقنعة، وبناء الشبكة، وتدريب النماذج، واختيار نقاط التحقق، والتقييم الكمي والنوعي للأداء. يدمج الإطار مسح الميزات متعددة الوجهات لالتقاط معلومات مكملة عن المكان، والكنتور، والمقياس، والحدود، ويطبق دمج الميزات متعددة المراحل ضمن بنية مشفر-مفكك على شكل حرف U لتحسين تكامل الميزات أثناء التقسيم. يتم عرض البروتوكول باستخدام مجموعات بيانات الآفات الجلدية وتقسيم الأعضاء البطنية المتاحة للجمهور. وفقا لسير العمل المذكور في التنفيذ، يحقق الإطار أداء تنافسي في التقسيم باستخدام مقاييس التقييم القياسية. باتباع الإجراءات المقدمة في هذا البروتوكول، يمكن للباحثين إعادة إنتاج تنفيذ النموذج، وتدريب الشبكة باستخدام إعدادات تجريبية محددة، وتقييم أداء التقسيم، وتكييف سير العمل لمهام تقسيم الصور الطبية ذات الصلة التي تتطلب تحليلا قائما على التعلم العميق القابل للتكرار.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقسيم الصور الطبية هو مهمة أساسية في مجالات رؤية الحاسوب وتحليل الصور الطبية 1,2,3. يتضمن تقسيم الصورة إلى مناطق أو كائنات متعددة لمزيد من التحليل والمعالجة. تكتسب هذه التقنية أهمية خاصة في التصوير الطبي لأنها تساعد الأطباء في تحديد وتحديد المناطق المرضية، مما يحسن دقة التشخيص وتخطيط العلاج. مع تقدم تقنيات التصوير الطبي، مثل التصوير بالرنين المغناطيسي (MRI)، والتصوير المقطعي المحوسب (CT)، والتصوير المقطعي بانبعاث البوزيترون (PET)، استمر الطلب على تقنيات تقسيم الصور الطبية الدقيقة في الازدياد. يمكن تصنيف الطرق الحالية لتقسيم الصور الطبية بشكل عام إلى ثلاثة طرق رئيسية: الطرق المعتمدة على الشبكة العصبية الالفافية (CNN)4، الطرق المعتمدة على المحولات5، والطرق القائمة على نموذج فضاء الحالة (SSM)6،7. عادة ما تستخدم الطرق المعتمدة على CNN هياكل شبكات على شكل حرف U لتقسيم الصور الطبية. أكثر المعمارية استخداما في هذه الفئة هي U-Net8، التي أظهرت فعالية بنية مشفر-فك التشفير على شكل U لتقسيم الصور الطبية الحيوية. يجمع U-Net3+ بين اتصالات التخطي الكثيفة من UNet++9 مع اتصالات تخطي كاملة الحجم لتعزيز تجميع الميزات متعدد المقاييس. ومع ذلك، فإن الطرق المعتمدة على CNN لديها قدرة محدودة على التقاط التبعيات طويلة المدى، وبالتالي قد لا تنمذج معلومات سياقة بعيدة المدى بفعالية.

تلتقط الطرق المعتمدة على المحولات الاعتماديات طويلة المدى بشكل فعال من خلال آلية الانتباه الذاتي، التي تمكن من الحساب المتوازي وتمنح أوزان انتباه مختلفة لمناطق اهتمام مختلفة. يقدم UNETR++10 وحدة الانتباه المزدوج الفعال (EPA) لتقليل عدد المعلمات والتكلفة الحاسوبية. يجمع nnFormer11 بين العمليات الالفافية المتداخلة وعمليات الانتباه الذاتي ويقدم آلية تركيز ذاتي قائم على الحجم المحلي والعالمي لتعلم التمثيلات الحجمية في تقسيم الصور الطبية ثلاثية الأبعاد (ثلاثية الأبعاد). يقترح H2Former12 محول رؤية هجين هرمي فعال يجمع بين آليات الانتباه واستخراج الميزات المعتمد على CNN في المشفر. ومع ذلك، تظهر الطرق المعتمدة على المحولات تعقيد حسابي تربيعي مع زيادة طول التسلسل، مما يؤدي إلى تكلفة حسابية أعلى بكثير. يوضح الشكل 1 الدافع وراء MVM-UNet ويقارن بين استراتيجية المسح متعدد الرؤى المقترحة مع أطر التقسيم القائمة على SSM.

figure-introduction-1
الشكل 1. مقارنة بين MVM-UNet وبنيات تقسيم القائمة القائمة على نموذج الفضاء النقي (SSM). مقارنة بين إطار التقسيم التقليدي القائم على نموذج الحالة النقي (SSM) وبنية شبكة مامبا متعددة الرؤية المقترحة (MVM-UNet). توضح اللوحة العلوية MVM-UNet، حيث تستخرج وحدة الرؤية متعددة الأبعاد (MV4D) ميزات مكملة باستخدام أزواج المسح المتعرج، الهرمي، الحلزونية، والشعاعية التي يتم دمجها بواسطة مامبا الاندماج المكاني (SFusion Mamba)، بينما يقوم مامبا الاندماج متعدد المراحل (MFusion Mamba) بتجميع ميزات الترميز متعدد المقاييس قبل فك الترميز. تظهر اللوحة السفلية بنية تمثيلية نقية قائمة على SSM باستخدام وحدات المسح الانتقائي ثنائي الأبعاد (SS2D) مع المسح المتبادل. يبرز الشكل الفروقات المعمارية بين شبكات التقسيم التقليدية المعتمدة على SSM وشبكة MVM-UNet المقترحة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

تجمع الطرق المعتمدة على SSM بين قدرة النمذجة العالمية للترانسفورمرز والتعقيد الحسابي الخطي. تعالج معمارية مامبا معلومات الإدخال بشكل انتقائي باستخدام نموذج فضاء الحالة الانتقائي (Selective-SSM)، مما يمكن النموذج من تعديل معلماته ديناميكيا وفقا للمدخلات مع تصفية المعلومات غير ذات الصلة والتركيز على الميزات المعلوماتية. تتكيف Vim13 وVMamba14 مع بنية مامبا لمهام رؤية الحاسوب. يستخدم يو-مامبا15 بنية هجينة بين CNN–SSM لاستكشاف تطبيق SSMs في تقسيم الصور الطبية، بينما يعتمد مامبا-UNet16 بنية مشفر-فك تشفير تعتمد بالكامل على SSM لتقسيم الصور الطبية. تحقق هذه الطرق أداء تنافسيا مع استخدام معايير أقل بكثير. ومع ذلك، فإن الطرق الحالية القائمة على SSM/Mamba تستخرج بشكل أساسي ميزات الصورة باستخدام رقع صورة بسيطة واستراتيجيات مسح SS2D، مما يفرض عدة قيود على تقسيم الصور الطبية. أولا، تقنيات SS2D والتقنيات المعتمدة على الرقعة مصممة بشكل أساسي لمهام رؤية الحاسوب العامة. اقترحت تطبيقات Local Mamba17 وMotion Mamba18 أن استراتيجية المسح SS2D غير كافية لجميع المهام البصرية لأن استراتيجيات المسح المختلفة تلتقط أنواعا مختلفة من المعلومات البصرية. ثانيا، استراتيجية المسح بنظام SS2D بسيطة نسبيا، وتعتمد فقط على اتجاهات المسح الأفقي والعمودي. وبالتالي، قد لا يلتقط بشكل كاف العلاقات المكانية المعقدة والتفاصيل الهيكلية الدقيقة. يتطلب تقسيم الصور الطبية نمذجة متزامنة لكل من السياق المكاني العالمي والخصائص التشريحية المحلية الدقيقة. علاوة على ذلك، توفر الطرق الحالية القائمة على SSM/Mamba اندماجا محدودا للميزات بين المشفر ومفك الترميز. تعمل البنى مثل UNet++ وFATNet على تحسين دقة التقسيم من خلال دمج الميزات، مما يبرز أهمية التكامل الفعال للميزات في تقسيم الصور الطبية.

لمعالجة هذه القيود، تقترح هذه الورقة إطار عمل جديد لتقسيم الصور الطبية يعتمد على مامبا، يسمى MVM-UNet. كما هو موضح في الشكل 1، تعد وحدة العرض المتعددة متعددة الاتجاهات المقترحة (MV4D) المكون الأساسي لاستخراج الميزات في MVM-UNet، وهي مصممة خصيصا لتقسيم الصور الطبية من خلال دمج المعلومات من أربع استراتيجيات مسح مميزة. كل استراتيجية مسح تستخرج ميزات صورة مكملة وتمثل رؤية مختلفة للصورة المدخلة. يقوم المسح المتعرجرقم 19 بالتناوب بين اتجاه العبور في نهاية كل صف أو عمود، مما يوازن بين المعلومات المكانية المحلية والعالمية. على النقيض من ذلك، توفر مخططات المسح الحلزونيوالشعاعي 20 تغطية شاملة من خلال الامتداد إما للخارج من المركز أو إلى الداخل من المحيط. يلتقط المسح الهرمي18 ميزات محلية وعالمية على مقاييس متعددة. لتحسين متانة كل استراتيجية مسح، يتم دمج أزواج المسح قبل إدخالها في كتلة S6. تقوم وحدة Scan-view Fusion Mamba (SFusion Mamba) بدمج الميزات المستخرجة من أنماط المسح الأربعة. للاستفادة الفعالة من ميزات الترميز متعدد المقاييس، تقترح هذه الورقة أيضا وحدة دمج مامبا متعددة المقاييس (MFusion Mamba)، التي تجمع وتدمج مخرجات كل مرحلة من مراحل المشفر قبل تمرير الميزات المدمجة إلى جهاز فك الترميز. تم تقييم MVM-UNet في مجموعات بيانات ISIC 2017، ISIC 2018، ومجموعات بيانات Synapse. تظهر النتائج التجريبية أن MVM-UNet يحقق أداء تنافسي في تقسيم البيانات في مجموعات بيانات ISIC 2017 وISIC 2018 وSynapse.

وقد طورت هياكل التقسيم التمثيلي تقسيم الصور الطبية بشكل أكبر. كما تم تطبيق U-Net بنجاح في مهام تحليل الصور الطبية الحيوية مثل عد الخلايا، والكشف، والقياس الشكلي21. تعمل هياكل CNN المحسنة بالانتباه، مثل CA-Net22، على تحسين تمثيل الميزات من خلال آليات انتباه شاملة. تظهر أطر التقسيم المعتمدة على المحول التمثيلي، بما في ذلك TransUNet23، Pyramid Medical Transformer24، Swin U-Net25، TransAttUNet26، وTransCUNet27، فعالية نمذجة الميزات العالمية القائمة على الانتباه في تقسيم الصور الطبية.

تصميم MVM-UNet مدفوع بقيدين لطرق التقسيم القائمة على SSM/Mamba الحالية. أولا، تعتمد العديد من نماذج فيجن مامبا الحالية على استراتيجيات مسح ثنائية الأبعاد بسيطة، والتي قد لا تكون كافية للصور الطبية التي تحتوي على حدود غير منتظمة للآفات، ومناطق هدف صغيرة، وهياكل تشريحية متعددة المقاييس. ثانيا، تنقل بنى المشفر-فك التشفير التقليدية على شكل حرف U الميزات بشكل أساسي عبر اتصالات تخطي مقابلة، مما يحد من الاستخدام المباشر لمعلومات الترميز متعدد المراحل أثناء فك الترميز. لذلك، تقدم MVM-UNet MV4D لتعزيز النمذجة المكانية متعددة الرؤية، وMFusion Mamba لتجميع ميزات الترميز متعدد المراحل بشكل صريح. يهدف هذا التصميم إلى تكييف النمذجة طويلة المدى المعتمدة على مامبا لتلبية المتطلبات الخاصة لتقسيم الصور الطبية.

على الرغم من أن MVM-UNet مبني على نموذج المشفر-مفكك العام ونمذجة التسلسل المعتمدة على مامبا، إلا أن جداته تكمن في كيفية تكييف هذه المكونات ودمجها لتقسيم الصور الطبية. بدلا من دمج كتلة مامبا القياسية في شبكة على شكل حرف U، يعيد الإطار المقترح تصميم عملية النمذجة المكانية من خلال فروع متعددة موجهة نحو أزواج المسح الموجهة، ويقدم SFusion Mamba لدمج التمثيلات الخاصة بالمسح، ويعزز كتلة MVV بمسارات متبقية وإسقاط، ويدرج MFusion Mamba بين المشفر والمفكك لتجميع ميزات الترميز متعدد المراحل قبل فك الترميز. يهدف هذا التصميم على مستوى الهيكل إلى معالجة الحدود غير المنتظمة، والمناطق المستهدفة الصغيرة، والهياكل التشريحية متعددة المقاييس التي تلاحظ عادة في الصور الطبية.

هذا البروتوكول مناسب جدا لمهام التقسيم التي تتطلب نمذجة متزامنة للمعلومات السياقية بعيدة المدى، وحدود الأجسام غير المنتظمة، والهياكل التشريحية متعددة المقاييس في الصور الطبية ثنائية الأبعاد. مقارنة بطرق التقسيم المعتمدة على CNN، يوفر تصميم المشفر-فك التشفير القائم على مامبا آلية فعالة لنمذجة السياق مع الحفاظ على سير عمل على شكل حرف U مألوف لباحثي تقسيم الصور الطبية. مقارنة بطرق الترانسفورمر، يتجنب الإطار المقترح الاستخدام المباشر للانتباه الذاتي التربيعي ويهدف إلى الباحثين الباحثين الباحثين عن نمذجة سياقية عالمية باستخدام آلية نمذجة تسلسلية فعالة نسبيا. وبناء عليه، فإن هذا البروتوكول مناسب لتقسيم آفات الجلد، وتقسيم الأعضاء البطنية، ومهام تقسيم الصور الطبية ثنائية الأبعاد المشابهة التي تكون فيها المعلومات الهيكلية العالمية وتفاصيل الحدود المحلية مهمة.

هذا البروتوكول له قيود يجب أخذها في الاعتبار قبل الاستخدام. قد لا يكون ذلك ضروريا لمهام تقسيم بسيطة نسبيا حيث يوفر CNN خفيف الوزن أداء كافيا بالفعل. بالإضافة إلى ذلك، فهي ليست مصممة مباشرة للتقسيم الحجمي ثلاثي الأبعاد الكامل دون تكييف معماري. يجب على الباحثين الذين لديهم بيانات مشروحة محدودة جدا، أو موارد وحدات معالجة الرسومات (GPU) محدودة، أو متطلبات نماذج كلاسيكية قابلة للتفسير عاليا، أن يأخذوا هذه القيود في الاعتبار قبل تطبيق البروتوكول. بشكل عام، تهدف هذه الطريقة إلى الباحثين الذين يسعون لإعادة إنتاج وتقييم إطار تقسيم على شكل حرف U قائم على مامبا يوازن بين النمذجة السياقية طويلة المدى، وتمثيل الحدود المحلية، ودمج الميزات متعددة المراحل.

المساهمات الرئيسية هي كما يلي:

1. تقدم هذه الورقة إطار عمل جديد لتقسيم الصور الطبية القائمة على مامبا، يسمى MVM-UNet. على عكس الأساليب التي تدمج مباشرة كتل مامبا القائمة القائمة على SS2D أو القياسية، يقدم MVM-UNet ميزات MV4D لنماذج الصور الطبية من أربع عروض زوج مسح مكملة، بما في ذلك المسح المتعرج، والهرمي، واللولبي، والشعاعي.

2. تصميم هذه الورقة SFusion Mamba وكتلة MVV لدمج التمثيلات الخاصة بالمسح وتعزيز تحويل الميزات. تدمج SFusion Mamba الميزات المستخرجة من فروع أزواج المسح المختلفة، بينما توفر فروع الإسقاط المتبقية وUp-Down ضمن كتلة MVV مسارات ميزات مكملة تستقر وتثري تمثيلات الميزات.

3. تقدم هذه الورقة MFusion Mamba كوحدة اندماج متعددة المراحل وسيطة بين المشفر والمفكك. على عكس اتصالات التخطي التقليدية التي تنقل بشكل أساسي ميزات المراحل المقابلة للترميز، يقوم MFusion Mamba بتجميع ميزات الترميز متعدد المراحل بشكل صريح من خلال دمج خشن إلى دقيق ويوفر معلومات غنية لفك الترميز.

4. تظهر النتائج التجريبية الواسعة أن MVM-UNet المقترح يحقق أداء تنافسية في تقسيم البيانات في مجموعتي بيانات ISIC 2017 وISIC 2018 وأداء قويا في مجموعة بيانات تقسيم أعضاء Synapse المتعددة. علاوة على ذلك، تثبت الدراسات الشاملة للاستئصال مساهمة كل مكون ضمن MVM-UNet.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

استخدمت هذه الدراسة فقط مجموعات بيانات الصور الطبية المتاحة للجمهور وغير المحددة الهوية، بما في ذلك ISIC 2017، ISIC 2018، وSynapse. لم يتم جمع أي مشاركين بشريين جدد، أو مواضيع حيوانات، أو سجلات طبية خاصة يمكن التعرف عليها في هذه الدراسة. كانت مجموعة بيانات ISIC 2017 المستخدمة في هذه الدراسة هي مجموعة بيانات تقسيم آفات الجلد لتحدي ISIC 2017، والتي تم الحصول عليها من مستودع بيانات تحدي التعاون الدولي لتصوير الجلد (https://challenge.isic-archive.com/data/#2017). النسخة المستخدمة في هذه الدراسة تتوافق مع مهمة تقسيم الآفة في ISIC 2017، بما في ذلك الأقسام الرسمية للتدريب، والتحقق، والاختبار. تم تحميل مجموعة البيانات في 15 مارس 2024. مجموعة بيانات ISIC 2018 المستخدمة في هذه الدراسة كانت مجموعة بيانات تقسيم حدود الآفة لمهمة التحدي 1 لمهمة ISIC 2018، والتي تم الحصول عليها من مستودع بيانات تحدي التعاون الدولي لتصوير الجلد (https://challenge.isic-archive.com/data/#2018). نسخة مجموعة البيانات المستخدمة في هذه الدراسة تتوافق مع مهمة ISIC 2018 1: تقسيم حدود الآفات. تم تحميل مجموعة البيانات في 8 يوليو 2024.

كانت مجموعة بيانات المشابك العصبية المستخدمة في هذه الدراسة هي مجموعة بيانات التصوير المقطعي المقطعي البطني متعدد الأطلس بخلاف القبو الجمجمي، والتي تم الحصول عليها من مستودع السينابس تحت معرف الإدخال syn3193805 (https://www.synapse.org/Synapse:syn3193805). تتوافق مجموعة البيانات المستخدمة في هذه الدراسة مع مجموعة بيانات تقسيم الأعضاء متعددة الأعضاء المقطعية المقطعية البطنية ذات 30 حالة شائعة. الأرشيف الذي تم تنزيله كان Abdomen/RawData.zip، متوفر تحت نظام accession syn3193805. لم يتم توفير رقم إصدار منفصل أو تسمية إصدار أو علامة إصدار مؤرخة من قبل المستودع وقت التنزيل. وفقا للتقسيم القياسي المعتمد في الدراسات السابقة، تم استخدام 18 حالة للتدريب و12 حالة للاختبار. تبع تقسيم البيانات قائمة الحالات المستخدمة في TransUNet23. تحديدا، كانت حالات التدريب هي case0031، case0007، case0009، case0005، case0026، case0039، case0024، case0034، case0033، case0030، case0023، case0040، case0010، case0021، case0006، case0027، case0028، و case0037، بينما كانت حالات الاختبار هي case0008، case0022، case0038، case0036، case0032، case0002، case0029، case0003، case0001، case0004، case0025، و case0035. تم تحميل مجموعة البيانات في 9 يوليو 2024. نظرا لأن هذه الدراسة استخدمت مجموعات بيانات متاحة للجمهور فقط ولم تتضمن جمع بيانات جديدة من البشر أو معلومات خاصة قابلة للتعريف، لم تكن هناك حاجة لموافقة لجنة المراجعة المؤسسية للتجارب الحسابية الموصوفة في هذا البروتوكول. لم يتم الحصول على قرار رسمي مكتوب للإعفاء المؤسسي. إذا تطلب ذلك السياسة المؤسسية المحلية، يجب على الباحثين الحصول على تحديد إعفاء مؤسسي قبل إجراء تحليلات ثانوية لمجموعات البيانات المتاحة للجمهور. لم يكن هناك رقم مرجعي للاستثناء الأخلاقي المؤسسي أو وثائق رسمية للاستثناء لهذه الدراسة.

1. إعداد مجموعات البيانات

  1. حمل مجموعة بيانات تقسيم آفات الجلد ISIC لعام 2017 من المستودع الرسمي للتعاون الدولي لتصوير الجلد. استخدم أقسام التدريب والتحقق والاختبار الرسمية. تحقق من أن مجموعة البيانات تحتوي على 2000 صورة تدريبية، و150 صورة تحقق، و600 صورة اختبار.
  2. حمل مجموعة بيانات تقسيم آفات الجلد ISIC لعام 2018 من المستودع الرسمي للتعاون الدولي لتصوير الجلد. استخدم أقسام التدريب والتحقق والاختبار الرسمية. تحقق من أن مجموعة بيانات التقسيم تحتوي على 2,594 صورة تدريبية، و100 صورة تحقق، و1,000 صورة اختبار.
  3. حمل مجموعة بيانات تقسيم الأعضاء المتعددة لSynapse. استخدم التقسيم القياسي المكون من 18 حالة (2,212 شريحة محورية) للتدريب و12 حالة (1,567 شريحة محورية) للاختبار. لا تقدم مجموعة تحقق منفصلة.
    1. احتفظ بالحالات ال12 التي أجريت اختبارا حصريا للتقييم النهائي. لا تستخدم حالات الاختبار لتدريب النماذج، أو ضبط المعاملات الفائقة، أو اختيار النماذج. تشمل مهمة التقسيم ثمانية أعضاء بطنية: الشريان الأبهر، المرارة، الطحال، الكلية اليسرى، الكلية اليمنى، الكبد، البنكرياس، والمعدة.
    2. استخدم تقسيم مجموعة بيانات Synapse التالي. كانت الحالات التدريبية ال18 هي case0031، case0007، case0009، case0005، case0026، case0039، case0024، case0034، case0033، case0030، case0023، case0040، case0010، case0021، case0006، case0027، case0028، و case0037. الحالات الاثنتي عشرة التي تم اختبارها كانت case0008، case0022، case0038، case0036، case0032، case0002، case0029، case0003، case0001، case0004، case0025، و case0035.
  4. نظم كل مجموعة بيانات في مجلدات صورة وأقنعة منفصلة. تأكد من أن كل صورة لها قناع تقسيم مطابق مع نفس معرف الحالة.
    1. حول كل قناع لآفة الجلد إلى خريطة تقسيم ثنائية للخلفية الأمامية. احتفظ بتسميات الأعضاء متعددة الفئات الأصلية لمجموعة بيانات Synapse.
    2. بالنسبة لمجموعات بيانات ISIC 2017 وISIC 2018، قم بتعيين قيمة تسمية 0 لبكسل الخلفية و1 لبكسل الآفة (المقدمة السابقة) بعد تحويل القناع الثنائي. البكسلات التي تحتوي على قيم قناع أصلية أكبر من 0 تعامل كمقدمة وتحويلها إلى 1، بينما تعامل البكسلات التي قيم القناع الأصلية التي تساوي 0 كخلفية وتحتفظ بها كصفر. بالنسبة لمجموعة بيانات Synapse، احتفظ بقيم التسمية الصحيحة الأصلية، حيث يمثل 0 فئة الخلفية و1–8 تمثل فئات الأعضاء الثمانية في المقدمة.
  5. قم بتغيير حجم صور وأقنعة ISIC 2017 وISIC 2018 إلى 256 × 256 بكسل دون الحفاظ على نسبة العرض إلى الارتفاع الأصلية. لا تضع قصا أو حشوة.
    1. قم بإعادة تكبير كل شريحة CT في Synapse وتعيين التسمية المقابلة إلى 224 × 224 بكسل. استخدم الاستيفاء الثنائي الخطي لصور RGB، واستيفاء الخطوط من الدرجة الثالثة لشرائح CT، واستيفاء أقرب جار لأقنعة التقسيم.
    2. قم بتغيير حجم الصور في بايثون.
      1. لمجموعات بيانات ISIC 2017 وISIC 2018، استخدم تحويل myResize المخصص المنفذ في utils.py، والذي يستدعي torchvision.transforms.functional.resize لإعادة تكبير موترات الصورة والقناع إلى 256 × 256 بكسل. لا تحدد وضع استيفاء صريح أو حجة مضادة للتعرج في هذا التحويل.
      2. لمجموعة بيانات Synapse، استخدم scipy.ndimage.zoom في مجموعات البيانات/dataset.py. إعادة تكبير شرائح صورة CT إلى 224 × 224 بكسل باستخدام استيفاء الخطوط من الدرجة الثالثة (الترتيب = 3)، وإعادة تكبير خرائط التسميمات باستخدام استيفاء أقرب جار (ترتيب = 0). لا تطبق عملية منفصلة لإزالة التداخل أو إعداد anti_aliasing=True أثناء تغيير الحجم.
  6. تطبيع كل صورة RGB من ISIC قبل تحويل التنسور باستخدام المتوسط والانحراف المعياري الخاص بمجموعة البيانات باستخدام المعادلة 1 كما يلي:
    figure-protocol-1(1)
    ثم أعد تكبير الصورة الممطرة إلى النطاق من 0–255 باستخدام الحد الأدنى إلى الحد الأقصى.
    1. استخدم μ = 159.922 و σ = 28.871 لمجموعة تدريب ISIC 2017 و μ = 148.429 و σ = 25.748 لمجموعات التحقق والاختبار ل ISIC 2017. استخدم μ = 157.561 و σ = 26.706 لمجموعة تدريب ISIC 2018 و μ = 149.034 و σ = 32.022 لمجموعات التحقق والاختبار لنظام ISIC 2018.
    2. حول كل صورة مطبعة إلى موتر من الشكل 3 × 256 × 256. حول كل قناع ثنائي إلى موتر من الشكل 1 × 256 × 256.
    3. إجراء تطبيع الحد الأدنى والأقصى بشكل مستقل لكل صورة بعد تطبيع المتوسط والانحراف المعياري الخاص بمجموعة البيانات. تحديدا، اطرح المتوسط الخاص بمجموعة البيانات من كل صورة وقسمه على الانحراف المعياري المقابل.
    4. احسب قيم الشدة الدنيا والقصوى من الصورة المطبعة وأعد تكبير الصورة إلى النطاق من 0 إلى 255 باستخدام هذه القيم الدنيا والعظمى لكل صورة. لا تستخدم القيم الدنيا والعظمى على مستوى مجموعة البيانات في هذه الخطوة من إعادة التحجيم إلى الحد الأقصى.
  7. جهز كل شريحة من CT في Synapse كصورة رمادية ثنائية الأبعاد. حول كل شريحة CT إلى float32 وأضف بعد قناة أحادية للحصول على موتر إدخال بالشكل 1 × 224 × 224.
    1. احتفظ بكل خريطة تسمية Synapse كقناع صحيح أحادي القناة مع الشكل 224 × 224. لا تطبق تطبيع متوسط SD إضافي على مستوى مجموعة البيانات في محمل البيانات.
    2. استخدم ملفات Synapse المعالجة مسبقا المقدمة بصيغة .npz لشرائح التدريب وتنسيق .npy.h5 لاختبار حجم التخزين. قم بتحميل الصور والمصفوفات التسميمية مباشرة من كل ملف .npz أثناء التدريب ومن كل ملف .npy.h5 أثناء الاختبار. لا تطبق قص شدة إضافي، أو نوافذ CT، أو تطبيع على مستوى مجموعة البيانات، أو إعادة أخذ عينات الحجم الخام في محمل البيانات المحرر.
    3. خلال تدريب النماذج، قم بتحويل كل شريحة ثنائية الأبعاد محملة إلى float32، ثم أعد تحجيمها إلى الحجم المكاني المستهدف باستخدام scipy.ndimage.zoom مع ترتيب = 3 لشرائح الصورة والترتيب = 0 لخرائط التسميات، ثم حول المصفوفات المعاد حجمها إلى موترات ذات بعد قناة مفردة.
  8. طبق تعزيز البيانات فقط على مجموعة التدريب. في ISIC 2017 وISIC 2018، استخدم الانقلاب الأفقي العشوائي (p = 0.5)، والانقلاب العمودي العشوائي (p = 0.5)، والدوران العشوائي (p = 0.5) مع زاوية مأخوذة من 0° إلى 360°.
    1. تطبيق نفس التحويل الهندسي على كل زوج من الصورة-القناع. أثناء التحقق والاختبار، قم بتطبيق فقط تغيير الحجم، والتطبيع، وتحويل التنسور.
    2. بالنسبة لمجموعة بيانات Synapse، طبق الدوران العشوائي والانقلاب العشوائي أثناء التدريب. قم بتدوير كل زوج من الصور والتسمية عشوائيا بمقدار k × 90°، حيث k ∈ {0,1,2,3}، أو قلب زوج الصورة-التسمية عشوائيا على محور مكاني واحد، أو تدوير زوج الصورة-التسمية عشوائيا بزاوية مأخوذة من −20° إلى 20°.
    3. لا تطبق التعزيز العشوائي أثناء الاختبار.
    4. تطبيق تعزيز البيانات على مجموعة بيانات Synapse باستخدام الفروع المتعارضة المنفذة في تحويل المولد العشوائي.
      1. لكل عينة تدريب، قم أولا بتقييم الحالة random.random() > 0.5. إذا تحقق هذا الشرط، يطبق random_rot_flip، ويتكون من دوران عشوائي بزاوية 90° (k = 0، 1، 2، أو 3) يليه انقلاب عشوائي على محور مكاني واحد.
      2. إذا لم يتم اختيار الفرع الأول، قيم شرطا ثانيا، random.random() > 0.5. إذا تحقق هذا الشرط، يطبق random_rotate باستخدام زاوية دوران مختارة عشوائيا بين −20° و20°. إذا لم يتحقق أي من الشرطين، فلا تطبق التعزيز العشوائي على العينة.
      3. طبق نفس التحويل على كل من الصورة المدخلة وخريطة التسمية المقابلة.
  9. قم بتعيين البذرة العشوائية قبل تحميل مجموعة البيانات، والمعالجة المسبقة، والتدريب. استخدم بذور عشوائية 1، 52، و100 لتجارب المقارنة الرئيسية، واستخدم بذور 100 لدراسات الاستئصال ما لم يذكر خلاف ذلك.
    1. قم بتهيئة مولدات بايثون وNumPy وPyTorch وPyTorch وCUDA وcuDNN العشوائية قبل بناء محمل البيانات. حافظ على تقسيمات مجموعات البيانات، وإجراءات المعالجة المسبقة، وإعدادات التعزيز، ومعلمات التطبيع، واستراتيجية تغيير الحجم، والمعالجة المسبقة للتقييم دون تغيير عبر جميع عمليات البذرة.
    2. اضبط num_workers = 0 لكل من تجارب ISIC وSynapse لأداء تحميل البيانات في العملية الرئيسية. قبل إنشاء مجموعة البيانات وإنشاء DataLoader، قم بتهيئة البذرة العشوائية العالمية باستخدام دالة set_seed لزرع مولدات الأرقام العشوائية Python وNumPy وPyTorch وPyTorch CUDA وcuda وcuDNN. لا تحدد worker_init_fn منفصلا أو مولد عشوائي خاص ب DataLoader، لأن هذه المولدات غير مستخدمة في التنفيذ الصادر عنها.

2. بناء عمارة MVM-UNet

  1. بناء نموذج Vision متعدد الرؤى المقترح Mamba UNet (MVM-UNet) باستخدام بنية مشفر-فك تشفير على شكل U.
  2. اضبط بعد الصورة المدخلة إلى H × W × 3. مرر صورة الإدخال عبر طبقة تضمين الباتش.
    1. تنفيذ طبقة تضمين الpatch باستخدام التفاف ثنائي الأبعاد بحجم نواة 4 × 4، وخطوة 4، وثلاث قنوات إدخال، و96 قناة إخراج.
    2. تحويل خريطة ميزة الإدخال إلى دقة مكانية H/4 × W/4 مع C = 96 قناة إخراج.
  3. قم ببناء أربع مراحل مشفر وأربع مراحل فك ترميز. قلل الدقة المكانية بمقدار النصف وضاعف بعد كل مرحلة من مراحل المشفر.
  4. استخدم تكوين مشفر-مفكك متماثل. اضبط عدد كتل MVV في كل من المشفر ومفك التشفير إلى {2، 2، 2، 2}.
    1. ضع كتلتين MVV في كل مرحلة مشفر وكتلتين MVV في كل مرحلة فك ترميز.
  5. أدخل كتلة MVV في كل مرحلة من مراحل المشفر وفك الترميز. استخدم وحدة MV4D كوحدة استخلاص الميزات الأساسية داخل كل كتلة MVV.
  6. أدخل وحدة MFusion Mamba بين المشفر وفك الترميز. استخدم هذه الوحدة لدمج ميزات المشفر متعدد المراحل قبل فك الترميز.
  7. قم بتكوين سير العمل العام ل MVM-UNet. استخدم MV4D لاستخراج الميزات في جميع أنحاء المشفر.
    1. احتفظ بمخرجات المشفر كاتصالات تخطي. مرر مخرجات المشفر إلى مراحل فك التشفير المقابلة.
    2. مرر ميزات التشفير إلى MFusion Mamba قبل فك الترميز. قم بزيادة التمثيل المدمج تدريجيا عبر جهاز فك التشفير وتوليد خريطة التقسيم النهائية باستخدام رأس التقسيم.
  8. مرر الصورة الإدخال I ∈ RB×H×W×3 عبر طبقة تضمين الpatch للحصول على figure-protocol-2 Here, C = 96.
    1. توليد خرائط ميزات المشفر: E1 ∈ RB×H/4×W/4×C، E2 ∈ RB×H/8×W/8×2C، E3 ∈ RB×H/16×W/16×4C، و E4 ∈ RB×H/32×W/32×8C. استخدم كتل MVV التي تحتوي على MV4D في كل مرحلة من مراحل المشفر.
    2. حافظ على كل ميزة مشفر لاتصال التخطي المقابل. مرر جميع ميزات الترميز إلى MFusion Mamba لدمج الميزات متعددة المراحل.
    3. محاذاة ميزات المشفر مع فضاء ميزات مشترك قبل الاندماج الخشن والدقيق داخل MFusion Mamba. مرر التمثيل المدمج إلى جهاز فك الترميز.
    4. قم بزيادة العينات تدريجيا في تمثيل فك التشفير. قم بدمج ميزات فك التشفير مع E3 عند H/16 × W/16، E2 عند H/8 × W/8، وE1 عند H/4 × W/4.
    5. قم برفع عينة ميزة فك التشفير النهائية إلى دقة الصورة الأصلية. أنشئ خريطة figure-protocol-3 التنبؤ ∈ RB×H×W×K. هنا، K = 1 لتقسيم الآفات الثنائية وK = 8 لتقسيم الأعضاء المتعددة للمشابك العصبية.
    6. راجع الشكل 2 لبنية الشبكة العامة والجدول التكميلي 1 لمواصفات معمارية طبقة بطبقة كاملة، بما في ذلك العمليات، والمعلمات الرئيسية، وأبعاد ميزات الإخراج لكل مرحلة
    7. طبقات الانتقال بين المشفر ومفك الترميز
      1. ميزات ترميز العينات الأصغر باستخدام طبقات الانتقال التي تدمج الرقعة. لكل انتقال، قم بأخذ عينات من أربع مجموعات ميزات متداخلة مكانيا من جوار 2 × 2، وربطها على طول بعد القناة، وتطبيق تطبيع الطبقة (LayerNorm)، وإسقاط الميزة الناتجة ذات الأبعاد رباعية C إلى قنوات 2C باستخدام طبقة خطية خالية من التحيز. تقلل هذه العملية الدقة المكانية بمقدار 2 أضعاف مع مضاعفة بعد القناة.
      2. ميزات فك التشفير بزيادة العينات باستخدام طبقات الانتقال التي توسع الرقعة. تطبيق إسقاط خطي خال من الانحياز، وأعد ترتيب الميزات الموسعة مكانيا لزيادة الدقة بمقدار 2، وطبق LayerNorm بعد التوسع المكاني. كرر هذه العملية لإعادة بناء خرائط الميزات تدريجيا من H/32 × W/32 إلى H/16 × W/16، H/8 × W/8، وH/4 × W/4.
      3. قم بمحاذاة ميزات المشفر داخل وحدة MFusion Mamba عن طريق تغيير حجمها إلى الدقة المكانية المستهدفة باستخدام الاستيفاء الثنائي الخطي (align_corners = خطأ) ثم تطبيق إسقاط قناة خطية قابل للتعلم قبل دمج الميزات.
    8. رأس التقسيم
      1. قم بزيادة خريطة ميزات فك التشفير النهائية من H/4 × W/4 إلى دقة الصورة الأصلية (H × W) باستخدام طبقة توسيع الرقعة النهائية. تطبيق الإسقاط الخطي، وإجراء إعادة ترتيب مكاني بعامل توسع 4، وتطبيق LayerNorm.
      2. قم بإسقاط الميزة المعاد بناؤها إلى قنوات إخراج K باستخدام التفاف 1 × 1 بعد تحويل الموتر إلى تنسيق القناة أولا.
      3. توليد التنبؤ النهائي أثناء التقييم بتطبيق دالة تنشيط السينيد لتقسيم الآفة الثنائية أو تنشيط سوفتماكس يليه أرجماكس لتقسيم الأعضاء المتعددة للمشابك العصبية. لا تطبق دالة تفعيل داخل رأس التقسيم نفسه.

figure-protocol-4
الشكل 2. البنية العامة لشبكة مامبا متعددة الرؤية (MVM-UNet). نظرة عامة على بنية شبكة مامبا U-Net متعددة الرؤية المقترحة (MVM-UNet). يتم تحويل صورة الإدخال إلى تجمعات الpatch ومعالجتها عبر أربع مراحل ترميز مكونة من كتل Multi-View Vision (MVV) مفصولة بواسطة عمليات دمج الرقعة. يتم تجميع ميزات المشفر بواسطة مامبا الاندماج متعدد المراحل (MFusion Mamba) وتنتقل إلى جهاز فك التشفير عبر اتصالات تخطي. يقوم جهاز فك الترميز باستعادة الدقة المكانية تدريجيا باستخدام عمليات توسيع الرقعة ويولد خريطة التقسيم النهائية عبر طبقة الإسقاط. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

3. بناء وحدة MV4D

  1. استخدم وحدة MV4D كوحدة استخلاص الميزات الأساسية في كتلة MVV. تغذية تصحيحات ميزات الإدخال إلى أربعة فروع أزواج مسح. راجع الخوارزمية 1، الملف التكميلي 1 للحصول على الشيفرة الزائفة الكاملة للتسوية المكانية، وبناء مؤشر أزواج المسح، وجمع التسلسلات، ومعالجة S6/Mamba، وإعادة الترتيب المكاني العكسي، ودمج الزوج المسح، ودمج SFusion Mamba، والإسقاط، وإعادة تشكيل المخرجات.
  2. استخدم إجراءات توليد مؤشر المسح المتعرجة والهرمية الحلزونية والشعاعية التي تم تنفيذها في النماذج/mvmunet/core.py. لكل استراتيجية مسح، استخدم ترتيب المسح الأمامي وترتيبه العكسي كزوج مسح ثنائي الاتجاه واحد.
  3. قم ببناء زوج المسح المتعرج. اعبر تفاصيل الصورة في اتجاهات متناوبة في نهاية كل صف أو عمود. استخدم نمط المسح هذا لتحقيق توازن بين المعلومات المكانية المحلية والعالمية.
  4. قم ببناء زوج المسح الهرمي. التقاط الميزات على مقاييس مكانية متعددة. استخدم نمط المسح هذا لتعزيز استخراج التمثيلات المحلية والعالمية على حد سواء.
  5. قم ببناء زوج المسح الحلزوني. مسح ميزات الصورة من المركز نحو الحدود أو من الحدود نحو المركز. استخدم نمط المسح هذا لتعزيز استخراج معلومات الكونتور العالمية.
  6. قم ببناء زوج المسح الشعاعي. امسح ميزات الصورة على عدة اتجاهات شعاعية. استخدم نمط المسح هذا لتعزيز استخراج تفاصيل الحدود والحواف المحلية.
  7. ادمج كل زوج مسح قبل إدخال التسلسل المدمج في كتلة S6. استخدم التصميم المزدوج لتحسين متانة كل استراتيجية مسح مع الحفاظ على الكفاءة الحاسوبية.
  8. قم بتغذية تسلسل الإخراج لكل فرع من زوج المسح في كتلة S6. احصل على أربعة تمثيلات سمية تتوافق مع الرؤية المتعرجة، الهرمية، الحلزونية، والشعاعية.
  9. دمج تمثيلات الميزات الأربعة المستخرجة باستخدام وحدة SFusion Mamba. استخدم مسارين اندماجين متوازيين. في المسار الأول، قم بدمج الميزات الأربع عن طريق الجمع العنصري.
  10. في مسار مامبا الثاني من SFusion، ادمج الميزات الأربعة. معالجة التمثيل المترابط باستخدام Conv1d وMamba. تقليل بعد القناة باستخدام طبقة إسقاط لتتناسب مع بعد إخراج كتلة S6.
  11. قم بتكوين كتلة S6/Mamba باستخدام بعد الميزة C كبعد للنموذج. استخدم طبقة إسقاط لتعيين كل ميزة مزودة بزوج المسح إلى بعد القناة C قبل الدمج.
  12. في SFusion Mamba، قم بجمع العناصر في المسار الأول. قم بدمج الميزات الأربعة لعرض المسح في المسار الثاني قبل Conv1d وMamba والإسقاط الخطي. استخدم عمليات التطبيع، والإسقاط الخطي، والالتفاف المنفصل حسب العمق، والتفعيل المحيط ب MV4D كما هو موضح في الخطوة 4.
  13. أضف مخرجات المسارين للاندماج للحصول على الخرج النهائي لوحدة MV4D.
  14. قم بإنشاء أربعة فروع مزدوجة مكملة للمسح بدلا من استخدام اتجاهات المسح الأفقية والعمودية فقط. استخدم المسح المتعرج لتأكيد العبور المكاني المستمر، والمسح الهرمي لتعزيز التمثيل متعدد المقاييس، والمسح الحلزوني لالتقاط معلومات الخطوط من المركز إلى الحدود، والمسح الشعاعي لتعزيز استخراج التفاصيل المحلية الموجهة للحدود.
  15. عالج كل فرع من زوج المسح بشكل مستقل. دمج الميزات الناتجة باستخدام SFusion Mamba. قم بتحويل كل تسلسل معالج إلى ترتيبه المكاني الأصلي قبل الاندماج.
  16. عند إعطاء خريطة ميزة إدخال X ∈ RB×H×W×C، يتم تسويتها إلى مرتبة X ∈ RB×L×C، حيث L = H × W.
  17. أعد ترتيب التسلسل المسطح وفقا لمؤشرات المسح لكل فرع من زوج المسح. عالج كل تسلسل معاد ترتيبه باستخدام كتلة S6. أعد التسلسل المعالج إلى الترتيب المكاني الأصلي.
  18. دمج ميزات العرض الأربعة عبر المسار الجمع ومسار SFusion Mamba للحصول على المخرج النهائي ل MV4D. راجع الشكل 3 لبنية MV4D والخوارزمية 1، الملف الإضافي 1 لسير عمل تنفيذ مستوى الموتر الكامل.
  19. استخدم التطبيق البرمجي الكامل في model/mvmunet/core.py. يحتوي هذا الملف على مولدات مؤشر المسح، PairwiseScanMamba، SequenceS6، SFusion Mamba، ووحدة تغليف MV4D.
  20. توليد مؤشرات مسح متعددة الرؤى
    1. قم بتوليد مؤشرات المسح باتباع التنفيذ الصادر في model/mvmunet/core.py. لخريطة ميزات إدخال بحجم مكاني H × W، قم بتسطيح كل موقع بكسل إلى مؤشر أحادي البعد باستخدام: index = r × W + c، حيث أن r و c ترمز إلى إحداثيات الصف والعمود على التوالي.
    2. توليد المسح المتعرج عن طريق عبور الأقطار في الصورة ذات الثابت r + c. اجمع مؤشرات البكسل الصالحة لكل قطر وبدل اتجاه العبور عن طريق عكس ترتيب كل قطر زوجي العدد.
    3. توليد المسح الهرمي عن طريق تقسيم الصورة بشكل متكرر إلى أربعة أرباع. قم بزيارة الأرباع العلوية-اليسرى، العلوية-اليمنى، السفلية-اليسرى، وأسفل اليمين بالتتابع حتى لا يتجاوز ارتفاع أو عرض المنطقة الفرعية بكسلتين، ثم انقل البكسلات المتبقية بترتيب الصف الرئيسي.
    4. قم بتوليد المسح الحلزوني عن طريق عبور حدود الصورة الخارجية من اليسار إلى اليمين على طول الصف العلوي، ثم نزولا على طول العمود الأيمن، ومن اليمين إلى اليسار على طول الصف السفلي، وصعودا على طول العمود الأيسر مع تقليص الحد تدريجيا نحو مركز الصورة.
    5. توليد المسح الشعاعي عن طريق فرز كل بكسل حسب المسافة المربعة من مركز الصورة ثم حسب الزاوية القطبية المحسوبة باستخدام دالة atan2.
    6. توليد المسح العكسي لكل استراتيجية مسح عن طريق عكس ترتيب المسح الأمامي المقابل. اجمع تسلسلي المسح الأمامي والعكسي لتشكيل زوج مسح واحد لكل استراتيجية مسح قبل تمرير أزواج المسح إلى وحدة MV4D.

figure-protocol-5
الشكل 3. بنية وحدة العرض متعدد الاتجاهات (MV4D). هيكل وحدة استخراج الميزات متعددة الرؤية رباعية الاتجاه (MV4D). تتم معالجة رقع الإدخال من خلال أربعة فروع مكملة من أزواج المسح، بما في ذلك المسح المتعرج، الهرمي، الحلزوني، والشعاعي. يتم دمج الميزات المستخرجة من الفروع الأربعة، ومعالجتها باستخدام كتل فضاء الحالة، ودمجها بواسطة Spatial Fusion Mamba (SFusion Mamba) لتوليد تمثيل ميزات الإخراج. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

4. بناء مبنى MVV

  1. ابن كتلة MVV باستخدام فرع رئيسي واحد وفرعين مساعدين. استخدم الهيكل العام الموضح في الشكل 4.
  2. تطبيق تطبيع الطبقة على ميزة الإدخال في الفرع الرئيسي. قم بتغذية الميزة التطبيعة إلى طبقة خطية. مرر الميزة المحولة إلى الالتفاف القابل للفصل من حيث العمق.
  3. معالجة الميزة المحولة باستخدام الالتفاف القابل للفصل حسب العمق. طبق وظيفة تفعيل GELU. قم بإدخال الميزة المفعلة إلى وحدة MV4D.
  4. بناء الفرع المساعد الأول كاتصال متبقي للهوية. قم بتوصيل ميزة الإدخال مباشرة بالمخرج النهائي. استخدم هذا الفرع للحفاظ على التمثيل الأصلي وتثبيت التدريب.
  5. ابن الفرع المساعد الثاني كفرع إسقاط من الأسفل-الأعلى. ضغط ميزة الإدخال باستخدام طبقة إسقاط للأسفل. استعاد بعد الميزة باستخدام طبقة عرض للأعلى.
  6. ادمج مخرجات الفرع الرئيسي وكلا الفرعين المساعدين. احصل على مخرج كتلة MVV النهائي. راجع الشكل 4 للبنية الكاملة.
  7. اجعل البعد الخفي للفرع الرئيسي مساويا لبعد قناة الإدخال Cs. طبق LayerNorm(Cs) قبل الإسقاط الخطي الرئيسي واستخدم طبقة خطية بأبعاد Cs→Cs. استخدم الالتفاف قابل للفصل حسب العمق يتكون من الالتفاف 3×3 بعمق مع حشو 1، المجموعات = Cs، وبدون انحياز، يليه التواء 1×1 نقطة بدون انحياز.
  8. طبق دالة تفعيل GELU بعد الالتفاف القابل للفصل حسب العمق. قم بتغذية الميزة المنشطة في MV4D وتطبيق إسقاط خطي بأبعاد Cs→Cs. قم بتكوين فرع الإسقاط للأسقط-الأعلى باستخدام LayerNorm(Cs)، ونسبة إسقاط 4، وعرض منخفض CsC s/4، وتفعيل GELU، وعرض تصاعدي Cs/4→Cs.
  9. اجمع فرع الهوية، وفرع الإسقاط النزولي إلى الأعلى، والفرع الرئيسي المعالج بمسار الإسقاط باستخدام الجمع العنصري للحصول على مخرج كتلة MVV النهائي.

figure-protocol-6
الشكل 4. هيكلية كتلة الرؤية متعددة الرؤى (MVV). هيكل كتلة الرؤية متعددة الرؤى (MVV). تتكون الكتلة من فرع رئيسي لاستخراج الميزات يحتوي على وحدة متعددة الرؤية رباعية الاتجاهات (MV4D) إلى جانب طبقات الالتفاف العميق، والتطبيع، والإسقاط الخطي. يوفر فرع إسقاط مساعد للأعلى إلى الأسفل تعديل الميزات المبوابة من خلال الضرب عنصريا قبل الجمع المتبقي لتوليد تمثيل الميزة المخرجة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

5. بناء MFusion Mamba

  1. اجمع خرائط الميزات من جميع مراحل المشفر. قم بمحاذاة ميزات المشفر مع مساحة تمثيل موحدة عن طريق تغيير حجمها أو إسقاطها عند الحاجة. راجع الخوارزمية 2، الملف الإضافي 1 لسير عمل تنفيذ المستوى الموتر الكامل.
  2. إعادة تكبير ميزات المشفر إلى الدقة المكانية المستهدفة عند الضرورة. ميزات المشروع بأبعاد قنوات مختلفة في نفس بعد القناة. قم بمحاذاة جميع ميزات التشفير قبل دمج الدمج متعدد المراحل.
  3. قم بإدخال ميزات المشفر المحاذفة إلى مكون Coarse Fusion. قم بعمل اندماج خشن باستخدام منتج هادامارد. توليد التمثيل الخشن الملتصق.
  4. أدخل التمثيل الخشن الملتحم إلى مكون الاندماج الدقيق. بناء مسارين دقيقين متوازيين. عالج كلا المسارين بشكل مستقل.
  5. معالجة أول مسار اندماج دقيق باستخدام طبقة خطية. معالجة مسار الاندماج الدقيق الثاني باستخدام الإسقاط الصاعد، Conv1d، Mamba، والإسقاط النزولي. استعاد بعد العرض السفلي.
  6. ادمج مخرجات مسارين الاندماج الدقيق باستخدام حاصل ضرب هادامارد. طبق الطبقة الخطية النهائية. احصل على إخراج MFusion Mamba.
  7. أدخل إخراج MFusion Mamba إلى جهاز فك الترميز. فك تشفير التمثيل متعدد المراحل المدمج مع ميزات تخطي المشفر-فك الترميز. أنشئ خريطة التقسيم النهائية.
  8. محاذاة ميزات المشفر من مراحل مختلفة إلى فضاء ميزات موحد قبل الاندماج الخشن. معالجة تمثيلات الميزات المحاذية باستخدام مراحل الاندماج الخشن والدقيق. راجع الشكل 5 لبنية MFusion Mamba والخوارزمية التكميلية 2 لسير عمل تنفيذ المستوى الموتري الكامل.
  9. استخدم معلمات تنفيذ MFusion Mamba كما يلي. لكل ميزة مشفر Ei، قم بإسقاط بعد القناة من Ci إلى Ct. إعادة تكبير الميزات المسقطة إلى الحجم المكاني المستهدف باستخدام الاستيفاء الثنائي الخطي مع align_corners=خاطئ عند الضرورة.
  10. تطبيق حاصل ضرب هادامارد لإجراء دمج خشن عبر ميزات المشفر المحاذية. قم بتكوين أول مسار اندماج دقيق باستخدام طبقة خطية بأبعاد Ct Ct. قم بتكوين مسار الاندماج الدقيق الثاني باستخدام إسقاط تصاعدي Ct → 2Ct، Conv1d، كتلة مامبا/S6 ببعد نموذج 2Ct، اتجاه مسح واحد، بعد الحالة 16، وإسقاط هابط2Ct Ct.
  11. قم بدمج مخرجات مسارات الاندماج الدقيق باستخدام منتج هادامارد. نطبق إسقاطا خطيا نهائيا بأبعاد من Ct إلى Ct. قم بإدخال التمثيل متعدد المراحل المدمج إلى جهاز فك الترميز.
  12. استخدم ميزات الترميز متعدد المراحل باستخدام MFusion Mamba
    1. اجمع ميزات المشفر من جميع مراحل الترميز الأربع (E1،E 2،E 3، وE4) واستخدمها كمدخل لوحدة MFusion Mamba. لا تختار فقط ميزة المشفر في المرحلة المقابلة لدمج جهاز فك التشفير.
    2. محاذاة جميع ميزات التشفير مع الدقة المكانية المطلوبة لمرحلة فك التشفير الحالية. قم بتغيير حجم ميزات المشفر إلى الدقة المستهدفة وعرضها إلى بعد القناة المطلوبة قبل دمج الميزات.
    3. كرر إجراء محاذاة الميزات لكل مرحلة من مراحل فك الترميز. عندما يعمل جهاز فك التشفير عند H/16 × W/16، H/8 × W/8، وH/4 × W/4، قم بإعادة تكبير E1 وE 2 وE3 وE4 إلى مساحة الميزات المستهدفة المقابلة.
    4. قم بدمج ميزات الترميز متعدد المراحل المحاذفة باستخدام عمليات الاندماج الخشن والاندماج الدقيق في وحدة MFusion Mamba، وادمج التمثيل المدمج مع ميزات فك التشفير على المقياس المقابل.
    5. قم بتنفيذ عمليات إسقاط الميزات، وتغيير الحجم، والدمج وفقا للتنفيذ الصادر في model/mvmunet/core.py.

figure-protocol-7
الشكل 5. بنية وحدة مامبا الاندماج متعددة المراحل (MFusion Mamba). هيكل وحدة مامبا الاندماج متعددة المراحل (MFusion Mamba). يتم دمج ميزات المشفر متعددة المقاييس أولا عن طريق الاندماج الخشن ثم يتم تحسينها من خلال وحدة الاندماج الدقيق التي تتكون من إسقاط خطي، والالتفاف أحادي البعد (Conv1d)، وكتلة مامبا، وطبقات إسقاط الميزات قبل توليد تمثيل الميزات المندمجة المستخدم في جهاز فك الترميز. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

6. تدريب النماذج

  1. درب MVM-UNet على أوبونتو 22.04.1 باستخدام نواة لينكس الإصدار 6.8.0. استخدم محطة عمل مزودة بمعالج Intel Core i9-13900K من الجيل الثالث عشر وبطاقة رسومات NVIDIA A800. استخدم نفس تكوين الأجهزة طوال فترة التدريب والتقييم.
  2. تنفيذ وتدريب النموذج باستخدام PyTorch 2.0.1 مع CUDA 11.8. قم بتثبيت جميع الاعتماديات البرمجية المطلوبة قبل التدريب.
  3. استخدم محسن AdamW بمعدل تعلم ابتدائي 3 × 10−5، β1 = 0.9، β2 = 0.999، ε = 1 × 10−8، وانخفاض الوزن 0.01. اضبط حجم الدفعة إلى 32 ما لم يذكر خلاف ذلك.
  4. درب كل نموذج لمدة 300 عصر. استخدم جدول معدل التعلم بالجيب التمام، حيث يكون ηدقيقة = 1 × 10−5. اضبط حجم الصورة المدخلة إلى 256 × 256 ل ISIC 2017 وISIC 2018 وإلى 224 × 224 ل Synapse.
  5. استخدم ثلاث بذور عشوائية مستقلة (1، 52، و100) لتجارب المقارنة الرئيسية. كرر عملية التدريب والتقييم الكاملة لكل بذرة. أبلغ عن النتائج الكمية النهائية كمتوسط ± SD عبر الثلاث جولات.
  6. استخدم بذرة عشوائية ثابتة بقيمة 100 لجميع دراسات الاستئصال ما لم يذكر خلاف ذلك. حافظ على أقسام مجموعة البيانات، واستراتيجية المعالجة المسبقة، وبنية الشبكة، والمحسن، ومعدل التعلم، وحجم الدفعة، وعدد فترات التدريب دون تغيير عبر جميع تجارب الابتلاص.
  7. استخدم فقدان BCE-Dice لتقسيم الآفات الثنائية في ISIC 2017 وISIC 2018. اضبط أوزان فقدان BCE وDice إلى 1.0. استخدم فقدان النرد CE لنظام Synapse واضبط أوزان الإنتروبيا المتقاطع ووزن فقدان النرد إلى 1.0.
  8. إعادة تكبير وتطبيع وتعزيز صور التدريب ISIC 2017 وISIC 2018 باستخدام إجراء المعالجة المسبقة الموضح في الخطوة 1. طبق تغيير الحجم، والدوران العشوائي، والتقليب العشوائي على صور تدريب المشابك كما هو موضح في الخطوة 1. استخدم إعدادات المعالجة المسبقة المتطابقة خلال جميع جولات التدريب.
  9. اختر نقاط التحقق من النموذج وفقا لبروتوكول التحقق الخاص بمجموعة البيانات. احفظ نقطة التحقق التي تحقق أفضل أداء تحقق ل ISIC 2017 وISIC 2018، وقم بإجراء التحقق كل 30 عصرا. درب Synapse لمدة 300 فترة بدون مجموعة تحقق واستخدم نقطة التحقق النهائية للاختبار.
  10. استخدم مجموعة التحقق الرسمية فقط لاختيار النموذج في ISIC 2017 وISIC 2018. لا تستخدم مجموعة اختبار Synapse للتدريب، أو ضبط المعاملات الفائقة، أو اختيار نقاط الحفظ. احتفظ بجميع بيانات الاختبار حصريا للتقييم النهائي.
  11. استخدم معايير التدريب التالية لقابلية التكرار. اضبط حجم الدفعة إلى 32 لكل مجموعات البيانات. استخدم AdamW بمعدل تعلم ابتدائي 3 × 10−5، β1 = 0.9، β2 = 0.999، ε = 1 × 10−8، وانخفاض الوزن 1 × 10−2.
  12. قم بتكوين جدولة معدل التعلم بالتلدين الجيب مع Tmax = 50 و ηmin = 1×10−5 لمعايير ISIC 2017 وISIC 2018. قم بتكوين المجدول بحيث يكون Tmax = 100 و ηmin = 1×10−5 ل Synapse. حافظ على إعدادات المجدول دون تغيير لجميع التجارب المتكررة.
  13. درب جميع النماذج باستخدام حسابات FP32 بدقة كاملة. تعطيل التدريب التلقائي متعدد الدقة. لا تطبق قص التدرج أثناء التحسين.
  14. حافظ على إعدادات الدقة، واستراتيجية تحديث التدرج، وتكوين المحسن، وجدول معدل التعلم، وبروتوكول البذور العشوائية دون تغيير عبر جميع تجارب المقارنة، ودراسات الاستئصال، وعمليات إعادة التكرار.
  15. اختر أفضل نموذج نقطة تفتيش
    1. قيم النموذج على مجموعة التحقق بعد كل فترة تدريب لمجموعات بيانات ISIC 2017 وISIC 2018.
    2. احسب خسارة النرد الثنائي عبر الإنتروبيا (BCE) لكل دفعة تحقق وحساب متوسط خسارة التحقق عبر مجموعة التحقق بأكملها.
    3. حفظ النموذج الحالي كأفضل نقطة تحقق عندما يكون متوسط فقدان التحقق أقل من الحد الأدنى المسجل سابقا لخسارة التحقق.
    4. سجل متوسط التقاطع عبر الاتحاد (mIoU)، معامل تشابه النرد (DSC)، الدقة (Acc)، النوعية (Spe)، والحساسية (Sen) أثناء التحقق فقط لمراقبة الأداء. لا تستخدم هذه المقاييس كمعيار لاختيار نقاط التفتيش.

7. تقييم النموذج

  1. قيم النموذج المدرب باستخدام مجموعة الاختبار الرسمية لكل مجموعة بيانات. استخدم مجموعة الاختبارات فقط للتقييم النهائي للأداء.
  2. بالنسبة ل ISIC 2017 و ISIC 2018، احسب mIoU، DSC، Acc، Sen، و Spe. استخدم الإيجابيات الحقيقية على مستوى البكسل (TP)، والإيجابيات الكاذبة (FP)، والسلبيات الحقيقية (TN)، والسلبيات الكاذبة (FN) لجميع الحسابات.
  3. تطبيق دالة تفعيل السيجمويد على مخرجات النموذج ل ISIC 2017 و ISIC 2018. حول خريطة الاحتمالات إلى قناع تقسيم ثنائي باستخدام عتبة 0.5. احسب مقاييس التقييم باستخدام المعادلات 2–6:
    figure-protocol-8 (2)
    figure-protocol-9 (3)
    figure-protocol-10 (4)
    figure-protocol-11 (5)
    figure-protocol-12 (6)
  4. بالنسبة ل Synapse، طبق دالة تفعيل softmax على مخرجات النموذج. قم بتعيين كل بكسل أو فوكسل للفئة ذات الاحتمال الأعلى باستخدام عملية argmax. احسب DSC ومسافة هوسدورف بنسبة 95 (HD95) لكل عضو في المقدمة وأبلغ عن القيم المتوسطة عبر جميع حالات الاختبار.
  5. قارن MVM-UNet مع طرق التجزئة المعتمدة على CNN التمثيلية، والقائمة على المحول، ونماذج فضاء الحالة (SSM). استخدم تقسيمات مجموعات البيانات المتطابقة، وإجراءات المعالجة المسبقة، ودقة الإدخال، ومقاييس التقييم لجميع الطرق.
  6. استخدم أقسام التدريب والتحقق والاختبار الرسمية ل ISIC 2017 وISIC 2018. استخدم التقسيم القياسي المكون من 18 حالة تدريب و12 حالة اختبار ل Synapse. اضبط دقة الإدخال إلى لمجموعات بيانات ISIC ولل Synapse.
  7. إعادة إنتاج الطرق الأساسية باستخدام تنفيذاتها الرسمية كلما توفرت الفرصة. أعاد التقرير النتائج كمتوسط ± SD عبر المحاولات المتكررة. احتفظ بالقيم المبلغ عنها من الأدبيات كما نشرت في الأصل وتمييزها في ملاحظات الجدول المقابلة.
  8. أجر دراسات الاستئصال باستخدام البذرة العشوائية الثابتة 100 ما لم يذكر خلاف ذلك. حافظ على تقسيمات مجموعة البيانات، إجراءات المعالجة المسبقة، دقة الإدخالات، المحسن، جدول معدل التعلم، حجم الدفعة، عدد العصور، دالة الفقدان، ومقاييس التقييم دون تغيير عبر جميع تجارب الاستئصال.
  9. قيم مساهمات MV4D، SFusion Mamba، فرع الإسقاط الأعلى-الأسفل في كتلة MVV، MFusion Mamba، حجم صورة الإدخال، قيمة الانقطاع، وتكوين طبقة المشفر-فك الترميز. تعديل فقط المكون أو المعامل المستهدف في كل تجربة استئصال.
  10. قم بإجراء اختبار الترتيب الموقعة في ويلكوكسون باستخدام نتائج مزدوجة لكل صورة لاختباري ISIC 2017 وISIC 2018 ونتائج مزدوجة لكل حالة ل Synapse. اعتبر قيمة p أصغر من 0.05 للدلالة على الدلالة الإحصائية.
  11. تقييم الكفاءة الحسابية باستخدام نفس بيئة الأجهزة ودقة الإدخال لجميع الطرق. قس وقت التدريب لكل حقبة، ووقت الاستدلال لكل صورة، وذروة استخدام ذاكرة GPU أثناء التدريب، وعدد معلمات النموذج، وعمليات النقطة العائمة (FLOPs). احسب FLOPs باستخدام تمريرة أمامية واحدة.
  12. اختر أمثلة نوعية ممثلة فقط من مجموعة الاختبار بعد إكمال تقييم النموذج. قارن الصورة الأصلية، وقناع الحقيقة الأرضية، والقناع المتوقع باستخدام حالات اختبار متطابقة عبر جميع الطرق. اختر أمثلة تمثيلية تشمل أهدافا صغيرة، وحدود غير منتظمة، وحدود غامضة، وهياكل متعددة الأعضاء تمثيلية.
  13. حساب مقاييس التقييم وإجراء التحليل الإحصائي
    1. احسب مقاييس التقسيم لمجموعتي بيانات ISIC 2017 وISIC 2018 بلغة بايثون باستخدام NumPy و sklearn.metrics.confusion_matrix. قم بتحديد خريطة الاحتمالات المتوقعة عند 0.5، واحصل على TP وFP وTN وFN على مستوى البكسل، وحساب mIoU، DSC، Acc، Sen، وSpe من هذه القيم.
    2. احسب DSC وHD95 لمجموعة بيانات Synapse باستخدام medpy.metric.binary.dc و medpy.metric.binary.hd95 على التوالي. طبق softmax متبوعا ب argmax على مخرجات النموذج قبل حساب مقاييس التقييم.
    3. احسب عدد ال FLOPs والمعلمات القابلة للتدريب باستخدام thop.profile بتمريرة أمامية واحدة.
    4. قم بإجراء اختبار الترتيب الموقعة ل Wilcoxon بلغة بايثون باستخدام scipy.stats.wilcoxon. استخدم قيم مقياس الصورة المزدوجة لمجموعتي بيانات ISIC 2017 وISIC 2018 وقيم مقياس الوحدة المزدوجة لكل حالة لمجموعة بيانات Synapse.

8. تعريف دالة الخسارة

  1. استخدم فقدان الإنتروبيا المتقاطعة (CE) القياسي للتقسيم متعدد الفئات وخسارة BCE القياسية للتقسيم الثنائي. استخدم الصياغة القياسية لفقدان النرد للتقسيم. المعادلات 7–11 تحدد دوال الخسارة المستخدمة في هذا البروتوكول.
    figure-protocol-13(7)
    figure-protocol-14(8)
    figure-protocol-15(9)
    figure-protocol-16(10)
    figure-protocol-17(11)
  2. اضبط أوزان فقدان BCE وDice إلى 1.0 في ISIC 2017 وISIC 2018، بحيث figure-protocol-18يكون 1 = 1.0 و figure-protocol-192 = 1.0. اضبط أوزان فقدان CE وDice إلى 1.0 لSynapse، بحيث φ1 = 1.0 that و φ2 = 1.0.
  3. نفذ دوال الخسارة في utils.py. استخدم nn. BCELoss لفصل BCE وnn. CrossEntropyLoss لمصطلح CE. احسب خسارة النرد الثنائية عن طريق تسطيح كل قناع متوقع وقناع الحقيقة الأرضية، وحساب خسارة النرد لكل عينة، وحساب متوسط الخسارة عبر الدفعة. احسب خسارة النرد المتعدد الفئات عن طريق تحويل خريطة التسمية المستهدفة إلى صيغة One-hot، وتطبيق softmax على مخرجات النموذج، وحساب خسارة النرد لكل فئة، وحساب متوسط الخسارة عبر جميع الفئات.
  4. اضبط ثابت التنعيم إلى 1 لخسارة النرد الثنائية وإلى 1×10−5 لخسارة النرد متعددة الفئات. تنفيذ خسارة BCE-Dice باستخدام فئة BceDiceLoss بحيث يكون wb = 1 و wd = 1. نفذ خسارة النرد في CE باستخدام فئة CeDiceLoss مع loss_weight = [1, 1]. حافظ على ثوابت التنعم، واستراتيجية التقليل، وتنفيذ البرمجيات دون تغيير لجميع مجموعات البيانات، والبذور العشوائية، والتجارب.
  5. تكوين تقليل الخسارة
    1. التجسيد النني. BCELoss() و nn. CrossEntropyLoss() دون تحديد حجة الاختزال بشكل صريح.
    2. استخدم إعداد تقليل فقدان PyTorch الافتراضي (reduction = "متوسط") لكلتا دالتي الفقدان. لا تستخدم الاختزال = "المجموع" أو مخرج الخسارة غير المختزل.

9. إعدادات قابلية التكرار والتنفيذ

  1. حمل التطبيق الصادر من https://github.com/LIXUEGUANG002/MVM-UNet. استخدم المستودع مع حزم البرمجيات، ومجموعات البيانات، ومواصفات العتاد، والموارد الحاسوبية المدرجة في جدول المواد.
  2. قم باستنساخ المستودع وادخل مجلد المشروع عن طريق تشغيل git clone https://github.com/LIXUEGUANG002/MVM-UNet.git، ثم قرص CD MVM-Unet.
  3. قم بتكوين تجربة ISIC 2017 أو ISIC 2018 عن طريق تعيين اسم مجموعة البيانات، مسار مجموعة البيانات، حجم الإدخال، حجم الدفعة، عدد الفترات الزمنية (epochs)، دالة الفقدان، المحسن، جدولة معدل التعلم، والبذور العشوائية في الإعدادات/config_setting.py. شغل سكريبت التدريب من جذر المستودع باستخدام بايثون train.py.
  4. قم بتكوين تجربة Synapse عن طريق تعيين اسم مجموعة البيانات، مسار بيانات التدريب، مسار حجم الاختبار، دليل القوائم، حجم الإدخال، عدد الفئات، حجم الدفعة، عدد العصرات، دالة الفقدان، المحسن، جدولة معدل التعلم، والبذور العشوائية في الإعدادات/config_setting_synapse.py. شغل سكريبت التدريب من جذر المستودع باستخدام بايثون train_synapse.py.
  5. قم بإجراء تقييم الاستنتاج فقط عن طريق تعيين only_test_and_save_figs = صحيح، best_ckpt_path إلى نقطة التحقق المدربة، و img_save_path إلى مجلد الإخراج في ملف التكوين المقابل. شغل بايثون train.py ل ISIC 2017 أو ISIC 2018، أو شغل بايثون train_synapse.py ل Synapse لتوليد نتائج التنبؤ والأرقام النوعية.
  6. استخدم النسخة المصدرية الصادرة
    1. قم باستنساخ مستودع GitHub الصادر وتحقق من commit ee891b42c2f083c4990eed72f1d4463adc5e103e على الفرع الرئيسي قبل تكوين مجموعات البيانات، وسكريبتات التدريب، وإعدادات التقييم.
    2. استخدم هذا الالتزام لإعادة إنتاج التجارب التي تم الإبلاغ عنها في هذه الدراسة. لم تكن هناك نسخة إصدار موسوم متاحة للمستودع وقت مراجعة المخطوطة.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

النتائج المتوقعة والتفسير
عندما يتم تنفيذ هذا البروتوكول بشكل صحيح، من المتوقع أن ينتج نموذج MVM-UNet المدرب أداء تقسيم مستقر عبر عمليات متكررة، مع اختلافات بسيطة فقط بين البذور العشوائية المختلفة لمعظم مقاييس التقييم. بالنسبة لمعايير ISIC 2017 وISIC 2018، تنعكس النتائج الناجحة في قيم DSC وmIoU وAcc وSen وSpe مرتفعة، إلى جانب أقنعة آفات متوقعة تتبع عن كثب حدود الآفات الأرضية والحقيقة (الأشكال 6 و7). بالنسبة للسينابس، تنعكس النتائج الناجحة في متوسط قيم DSC عالية وقيم HD95 منخفضة عبر الأعضاء الأمامية (الشكل 8). أثناء تنفيذ البروتوكول، يجب تفسير المقاييس الكمية مع نتائج التقسيم النوعي المقابلة. يجب اعتبار النموذج الذي يحقق DSC عالي لكنه يظهر تسرب حدودي، أو إهمال هياكل صغيرة، أو توقعات مجزأة ناجحا جزئيا فقط، ويجب التحقق من إجراءات المعالجة المسبقة، واختيار نقاط التحقق، وإعدادات الاستدلال.

figure-results-1
الشكل 6. نتائج التقسيم النوعي الممثلة على مجموعة بيانات ISIC 2017. نتائج التقسيم النوعي الممثلة التي تم الحصول عليها في مجموعة بيانات تقسيم آفات الجلد للتعاون الدولي لتصوير الجلد (ISIC) لعام 2017. كل مثال يظهر الصورة الجلدية الأصلية (Image)، وقناع تقسيم الحقيقة الأرضية (GT)، والتنبؤ الذي تولده MVM-UNet (Pred). تظهر حالات الاختبار التمثيلية أداء التقسيم للآفات ذات الحجم والشكل والتعقيد الحدودي المختلفة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-2
الشكل 7. نتائج التقسيم النوعي الممثل على مجموعة بيانات ISIC 2018. نتائج التقسيم النوعي الممثلة التي تم الحصول عليها في مجموعة بيانات تقسيم آفات الجلد للتعاون الدولي لتصوير الجلد (ISIC) لعام 2018. كل مثال يظهر الصورة الجلدية الأصلية (Image)، وقناع تقسيم الحقيقة الأرضية (GT)، والتنبؤ الذي تولده MVM-UNet (Pred). تظهر حالات الاختبار التمثيلية أداء التقسيم عبر مظاهر الآفات المختلفة وخصائص الحدود. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-3
الشكل 8. نتائج التقسيم النوعي التمثيلي على مجموعة بيانات التصوير المقطعي المحوسب متعدد الأعضاء في Synapse. نتائج تمثيلية نوعية لتقسيم الأعضاء المتعددة تم الحصول عليها على مجموعة بيانات الأطلس المتعدد للمشابك العصبية خارج مجموعة بيانات القبو الجمجمي. كل مثال يظهر صورة التصوير المقطعي المحوسبة الأصلية (Image)، وتعليقات الأعضاء الأرضية المقابلة (GT)، والتنبؤ الذي يولده MVM-UNet (Pred). توضح أمثلة تمثيلية الاتفاق بين التقسيم المتوقع والتقسيم المرجعي عبر عدة أعضاء بطنية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الأداء في ISIC 2017
لتقييم قابلية تكرار MVM-UNet، تم تكرار جميع تجارب المقارنة الرئيسية باستخدام ثلاث بذور عشوائية مستقلة (1، 52، و100)، وتم الإبلاغ عن النتائج كمتوسط ± SD. تم تقييم الدلالة الإحصائية باستخدام اختبار ويلكوكسون للرتبة الموقعة بناء على نتائج مزدوجة لكل صورة لاختباري ISIC 2017 وISIC 2018 ونتائج الاقتران لكل حالة ل Synapse. تم إجراء التحليل الإحصائي باستخدام قيم مقياس مزدوجة بدلا من المتوسطات على مستوى البذرة. للمقارنة العادلة، تم إعادة إنتاج النتائج المبلغ عنها كمتوسط ± SD باستخدام التطبيقات الرسمية تحت نفس تقسيمات مجموعة البيانات، ودقة المدخلات، ومقاييس التقييم كلما أمكن، بينما تم الاحتفاظ بنتائج القيمة المفردة من المنشورات الأصلية المقابلة.

تم تقييم MVM-UNet على مجموعة بيانات تقسيم آفات الجلد ISIC لعام 2017 ومقارنتها مع طرق التقسيم التمثيلية، بما في ذلك UNet 8,21، TransUNet23، H-vmunet28، MISSFormer30، MaLUNet31، VM-UNet32، UNeXt-S33، HResFormer34، MedScale-Former35، MCAFT36، و H2Former12 (الجدول 1). حقق MVM-UNet نسبة mIoU بلغت 80.94 ± 1.01٪، وDSC بنسبة 91.32٪ ± 0.68٪، ودقة 96.58٪ ± 0.27٪، ونوعية 98.31٪ ± 0.23٪، وحساسية 91.65٪ ± 0.77٪ عبر ثلاث جولات مستقلة. مقارنة بالطرق التي تم تقييمها، حقق MVM-UNet أعلى مستويات mIoU، وDSC، وأعلى حساسية. تظهر نتائج التقسيم النوعي الممثلة في الشكل 6، حيث تتبع الأقنعة المتوقعة عن كثب حدود آفة الحقيقة الأرضية عبر صور الاختبار التمثيلية.

النموذجالمرجع.mIoU (٪)DSC (٪)الحسابات (٪)Spe (٪)سين (٪)
UNet876.9886.9995.6597.4386.82
ترانس يونيت2375.3281.2391.4595.7782.63
مالونيت3178.7888.1396.1898.4784.78
VM-UNet3280.2389.0396.2997.5889.90
UNeXt-S3378.2687.8095.9597.7487.04
HResFormer3479.89 ± 1.0588.82 ± 0.6596.25 ± 0.2497.73 ± 0.2287.72 ± 0.79
H-vmunet2880.34 ± 1.0290.68 ± 0.5596.42 ± 0.1898.23 ± 0.3288.97 ± 0.88
ميسفورمر3080.16 ± 0.7889.27 ± 0.6194.36 ± 0.2897.52 ± 0.3887.71 ± 0.69
H2Former1280.35 ± 0.9588.56 ± 0.7296.61 ± 0.1998.15 ± 0.1488.21 ± 0.81
ميدسكيل-فورمر3580.31 ± 0.8289.11 ± 0.5995.68 ± 0.3398.24 ± 0.2189.96 ± 0.92
MCAFT3680.59 ± 0.9389.27 ± 0.6396.42 ± 0.2097.95 ± 0.1790.05 ± 0.84
MVM-UNet (لنا)80.94 ± 1.0191.32 ± 0.6896.58 ± 0.2798.31 ± 0.2391.65 ± 0.77

الجدول 1: مقارنة الأداء على مجموعة بيانات تقسيم آفات الجلد لنظام ISIC لعام 2017. مقارنة MVM-UNet مع طرق التقسيم المعتمدة على الشبكة العصبية الالفافية التمثيلية (CNN)، والمحول، ونموذج الحالة والفضاء (SSM) باستخدام متوسط التقاطع عبر الاتحاد (mIoU)، معامل تشابه النرد (DSC)، الدقة (Acc.)، الخصوصية (النوعية)، والحساسية (الديمقراطية). تم الإبلاغ عن نتائج MVM-UNet كمتوسط ± انحراف معياري من ثلاث تجارب عشوائية مستقلة. تم إعادة إنتاج النتائج المبلغ عنها كقيم فردية من المنشورات الأصلية المقابلة.

تظهر الأمثلة النوعية أيضا أن MVM-UNet قسم بدقة كلا من الآفات الصغيرة والأكبر ذات حدود غير منتظمة. في هذه الأمثلة الممثلة، كانت الأقنعة المتوقعة متطابقة بشكل وثيق مع تعليقات الحقيقة الأرضية المقابلة وحافظت على حدود الآفات مع أقل قدر من التسرب أو التجزئة.

ولتقييم ما إذا كانت التحسينات الملحوظة ذات دلالة إحصائية بشكل أعمق، أجريت اختبارات ويلكوكسون ذات الإشارة باستخدام نتائج تقسيم مزدوجة لكل صورة. بالنسبة لمقياس mIoU، أظهر MVM-UNet تحسنا ذا دلالة إحصائية مقارنة ب MCAFT، بقيمة p بلغت 0.0114. بالنسبة لمقياس DSC، تفوق MVM-UNet بشكل ملحوظ على H-vmunet، بقيمة p 0.0031. تدعم هذه النتائج أن التحسينات الملحوظة في ISIC 2017 من غير المرجح أن تعزى إلى التغيرات العشوائية.

بشكل عام، حقق MVM-UNet أعلى أداء بين الطرق المقارنة لل mIoU وDSC والحساسية في مجموعة بيانات ISIC 2017 (الجدول 1). أمثلة التقسيم النوعي المعروضة في الشكل 6 تتوافق مع هذه النتائج الكمية.

الأداء في ISIC 2018
تم تقييم MVM-UNet بشكل إضافي على مجموعة بيانات تقسيم آفات الجلد ISIC لعام 2018 ومقارنتها مع طرق تقسيم تمثيلية، بما في ذلك UNet 8,21، UNet++9، UTNetV237، SANet38، MaLUNet31، VM-UNet32، H-vmunet28، MISSFormer30، H2Former12، HResFormer34، MedScale-Former35، وMCAFT36 (الجدول 2). حقق MVM-UNet نسبة mIoU بنسبة 82.47٪ ± 1.28٪، وDSC بنسبة 90.65٪ ± 0.94٪، ودقة 96.02٪ ± 0.36٪، وخصوصية 97.06٪ ± 0.31٪، وحساسية 91.80٪ ± 0.82٪ عبر ثلاث جولات مستقلة. تظهر هذه النتائج أن أداء MVM-UNet ظل ثابتا عبر بذور عشوائية مختلفة. تظهر نتائج التقسيم النوعي التمثيلي في الشكل 7.

النموذجالمرجع.mIoU (٪)DSC (٪)الحسابات (٪)Spe (٪)سين (٪)
UNet877.8687.5594.0596.6985.86
UNet++978.3187.8394.0295.7588.65
UTNetV23778.9788.2594.3296.4887.60
سانيت3879.5288.5994.3995.9789.46
مالونيت3180.2589.0494.6296.1989.74
VM-UNet3281.3589.7194.9196.1391.12
H-vmunet2881.93 ± 1.4590.46 ± 0.6295.19 ± 0.3096.82 ± 0.2188.37 ± 1.13
ميسفورمر3080.27 ± 1.2189.91 ± 0.4694.76 ± 0.2797.22 ± 0.1590.84 ± 1.07
H2Former1280.40 ± 0.8390.26 ± 0.7394.89 ± 0.3896.98 ± 0.2591.57 ± 0.54
HResFormer3481.12 ± 1.1888.86 ± 0.8494.96 ± 0.3396.43 ± 0.2291.86 ± 1.01
ميدسكيل-فورمر3580.97 ± 0.7490.47 ± 0.6895.02 ± 0.4195.89 ± 0.2690.65 ± 0.92
MCAFT3681.46 ± 1.0389.06 ± 0.7695.23 ± 0.2996.72 ± 0.1791.82 ± 0.57
MVM-UNet (لنا)82.47 ± 1.2890.65 ± 0.9496.02 ± 0.3697.06 ± 0.3191.80 ± 0.82

الجدول 2: مقارنة الأداء على مجموعة بيانات تقسيم آفات الجلد لمعهد ISIC لعام 2018. مقارنة بين MVM-UNet مع طرق التقسيم التمثيلية القائمة على CNN، وTransformer، وSSM باستخدام متوسط التقاطع عبر الاتحاد (mIoU)، معامل تشابه النرد (DSC)، الدقة (Acc.)، الخصوصية (Spe.)، والحساسية (Sen.). تم الإبلاغ عن نتائج MVM-UNet كمتوسط ± انحراف معياري من ثلاث تجارب عشوائية مستقلة. تم إعادة إنتاج النتائج المبلغ عنها كقيم فردية من المنشورات الأصلية المقابلة.

مقارنة ب H-vmunet، حسن MVM-UNet الوحدة المتوسطة بنسبة 0.54٪. مقارنة ب MedScale-Former، حسن MVM-UNet DSC بنسبة 0.18٪. حقق MVM-UNet أيضا أعلى دقة بين الطرق المقارنة. تظهر الأمثلة النوعية الممثلة المعروضة في الشكل 7 تقسيما دقيقا للآفات الجلدية الممثلة، بما في ذلك مناطق الآفات الصغيرة والآفات ذات الحدود غير المنتظمة.

بالنسبة لاختبار ISIC 2018، تم تقييم الدلالة الإحصائية باستخدام اختبار ويلكوكسون الموقع-الترتيب بناء على نتائج تقسيم الصور الزوجية. بالنسبة لمقياس mIoU، حقق MVM-UNet تحسنا ذا دلالة إحصائية مقارنة ب MCAFT، بقيمة p < 0.001. تدعم هذه النتائج أن التحسن الملحوظ في الأداء في ISIC 2018 كان من غير المرجح أن يكون بسبب التغير العشوائي.

بشكل عام، حقق MVM-UNet أعلى عدد من الوحدات الموسيقية (mIoU)، وDSC، والدقة بين الطرق المقارنة في مجموعة بيانات ISIC 2018 (الجدول 2). الأمثلة النوعية المعروضة في الشكل 7 تتوافق مع هذه التحسينات الكمية.

الأداء على سينابسي
تم تقييم الطريقة المقترحة أيضا على مجموعة بيانات تقسيم الأعضاء المتعددة للمشابك ومقارنتها مع الطرق التمثيلية، بما في ذلك UNet 8,21، Attention U-Net39، TransUNet23، TransNorm40، Swin U-Net25، TransDeepLab41، MEW-UNet42، MISSFormer30، H2Former12، HResFormer34، MedScale-Former35، وMCAFT36 (الجدول 3). شملت مجموعة بيانات المشابك ثمانية أعضاء بطنية: الشريان الأبهري، المرارة، الطحال، الكلية اليسرى، الكلية اليمنى، الكبد، البنكرياس، والمعدة. وفقا للبروتوكول التجريبي القياسي، تم استخدام 18 حالة (2,212 شريحة محورية) للتدريب و12 حالة (1,567 شريحة محورية) للاختبار. لم يتم إدخال مجموعة تحقق منفصلة. تم استخدام حالات الاختبار حصريا للتقييم النهائي ولم تستخدم لتدريب النماذج أو ضبط المعاملات الفائقة أو اختيار النماذج. تظهر نتائج التقسيم النوعي التمثيلي للأعضاء المتعددة في الشكل 8، ويتم تلخيص المقارنة الكمية في الجدول 3.

النموذجالمرجع.DSCHD95Aor.جال.يا صغير. (L)يا صغير. (R)ليف.بان.العتلة.ستو.
UNet876.8539.7889.0769.7277.7768.6993.4354.0186.6675.59
أت-UNet3977.7736.0289.5468.8877.9871.1193.5758.0487.3175.74
ترانس يونيت2377.4831.6987.2363.1381.8777.0294.0855.8485.0675.62
ترانس نورم4078.430.2586.2365.1882.1878.6394.2255.3289.5376.02
سوين يو-نت2579.1321.5585.4766.5383.2879.6194.2956.5890.6276.59
ترانس ديب لاب4180.1621.2586.0469.1684.0879.8893.5361.1589.0178.36
ميو-أونت4278.9221.6886.6865.3282.8780.0293.6358.3890.1674.27
ميسفورمر3080.92 ± 4.2320.09 ± 1.8986.43 ± 0.9869.81 ± 4.5684.29 ± 2.1181.03 ± 3.3493.85 ± 0.8961.11 ± 4.6790.05 ± 3.7880.62 ± 1.02
H2Former1281.05 ± 2.5620.13 ± 7.2386.61 ± 3.2169.32 ± 1.2385.12 ± 4.7882.01 ± 2.8994.09 ± 2.4561.16 ± 0.7689.97 ± 4.1280.94 ± 3.56
HResFormer3480.65 ± 4.0217:48 ± 6.8989.16 ± 2.7866.94 ± 0.7884.61 ± 4.3482.15 ± 2.5693.11 ± 1.3459.92 ± 4.1291.08 ± 3.4580.75 ± 2.01
ميدسكيل-فورمر3580.78 ± 1.3420.02 ± 3.7888.79 ± 4.0269.82 ± 2.5685.13 ± 0.8781.63 ± 4.7894.10 ± 2.7860.72 ± 1.8990.14 ± 1.5680.93 ± 4.56
MCAFT3681.03 ± 3.4519.98 ± 5.1289.76 ± 0.7668.96 ± 3.8984.54 ± 2.5681.98 ± 3.1294.32 ± 4.0160.85 ± 3.6789.06 ± 4.8980.91 ± 1.78
MVM-UNet (لنا)81.26 ± 1.8918.72 ± 2.1688.53 ± 3.2269.84 ± 4.2385.37 ± 2.6982.67 ± 1.6794.41 ± 3.5661.02 ± 2.7890.19 ± 0.6781.48 ± 3.12

الجدول 3: مقارنة الأداء على مجموعة بيانات تقسيم الأعضاء المتعددة لنظام Synapse. مقارنة MVM-UNet مع طرق التقسيم التمثيلية القائمة على CNN، وTransformer، وSSM باستخدام معامل تشابه النرد (DSC)، ومسافة هوسدورف بنسبة 95٪ (HD95)، ودرجات النرد الخاصة بالأعضاء للأورط الأبهر (Aor.)، المرارة (Gal.)، والكلية اليسرى (Kid. (L))، الكلية اليمنى (طفل. (R))، الكبد (Liv.)، البنكرياس (البانوامي)، الطحال (النوعية الخاصة)، والمعدة (Sto.). تم الإبلاغ عن نتائج MVM-UNet كمتوسط ± انحراف معياري من ثلاث تجارب عشوائية مستقلة. تم إعادة إنتاج النتائج المبلغ عنها كقيم فردية من المنشورات الأصلية المقابلة.

حقق MVM-UNet متوسط DSC بنسبة 81.26٪ ± 1.89٪ ومتوسط HD95 يبلغ 18.72 ± 2.16 عبر ثلاث جولات مستقلة. تظهر النتائج أداء تقسيمات مستقرة على مجموعة بيانات Synapse. من بين الطرق المقيمة، حقق MVM-UNet أعلى متوسط DSC وثاني أدنى متوسط HD95.

بالنسبة لنظام Synapse، تم تقييم الدلالة الإحصائية باستخدام اختبار Wilcoxon الموقع-رتبة بناء على قيم DSC المزدوجة لكل حالة. أظهر MVM-UNet تحسنا ذا دلالة إحصائية مقارنة ب H2Former، بقيمة p بلغت 0.026، مما يشير إلى أن التحسن الملحوظ في أداء التقسيم كان ذا دلالة إحصائية.

النتائج الناجحة وغير المثالية الممثلة
تظهر النتائج النوعية الناجحة الممثلة في الأشكال 6–8. تتميز النتائج الناجحة بأقنعة تقسيم متوقعة تتوافق بشكل وثيق مع تعليقات الحقيقة الأرضية وتحدد بدقة حدود الآفة الأساسية أو الأعضاء. قد تحدث نتائج تمثيلية غير مثالية للأهداف الصغيرة جدا، أو الحدود منخفضة التباين، أو أشكال الآفات، أو الأعضاء ذات التباين الضعيف في الشدة، أو الحدود التشريحية الغامضة، وغالبا ما تظهر كأجزاء أقل من التقسيم، أو زيادة في التقسيم، أو تسرب حدودي، أو شظايا قناع متقطعة. عند ملاحظة مثل هذه النتائج، يجب على المستخدمين التحقق من أن تغيير حجم الصورة، والتطبيع، واستيفاء القناع، واختيار نقاط التحقق من النموذج، وتحديد عتبة الاستدلال (لمجموعات بيانات ISIC) أو التنبؤ ب argmax (لنظام Synapse)، وإجراءات حساب المقاييس متوافقة مع تلك الموصوفة في البروتوكول.

دراسة الاستئصال لوحدة MV4D
تم تقييم مساهمة وحدة MV4D بإضافة أزواج المسح المتعرج، الهرمي، الحلزوني، والشعاعي تدريجيا، تليها وحدة SFusion Mamba (الجدول 4؛ الشكل 9). عندما كان يستخدم فقط زوج المسح المتعرج، كان أداء التقسيم محدودا. إضافة زوج المسح الهرمي حسن الأداء بشكل كبير، مما يشير إلى فائدة دمج المعلومات متعددة المقاييس. الإضافة اللاحقة لأزواج المسح الحلزوني والشعاعي حسنت أداء التقسيم من خلال تعزيز تمثيل الحدود والملامح. أدى دمج وحدة SFusion Mamba إلى أعلى أداء بين التكوينات التي تم تقييمها.

النموذجزوج المسح المتعرجزوج المسح الهرميزوج المسح الحلزونيزوج المسح الشعاعيSFusion Mambaوحدة الاستخبارات الدولية للعلوم والاتصالات 2017 mIoU (٪)ISIC 2017 DSC (٪)وحدة بيانات ISIC 2018 mIoU (٪)ISIC 2018 DSC (٪)
MVM-UNet56.7572.4658.0373.45
MVM-UNet72.3884.0173.4584.7
MVM-UNet75.6986.2076.9486.94
MVM-UNet76.4186.6178.2887.82
MVM-UNet80.9491.3282.4790.65

الجدول 4: دراسة الاستئصال لوحدة متعددة الرؤى رباعية الاتجاهات (MV4D). يتم الحصول على الأداء من خلال دمج أزواج المسح الهرمية، الحلزونية، والشعاعية تدريجيا، ووحدة الدمج المكاني (SFusion Mamba) في بنية أزواج المسح المتعرج الأساسية. يتم الإبلاغ عن الأداء باستخدام متوسط التقاطع مع الاتحاد (mIoU) ومعامل تشابه النرد (DSC) في مجموعات بيانات ISIC 2017 وISIC 2018.

figure-results-4
الشكل 9. دراسة الاستئصال لوحدة متعددة الرؤى رباعية الاتجاهات (MV4D). (أ) تغير متوسط التقاطع عبر الاتحاد (mIoU) بعد دمج زوج المسح الهرمي، زوج المسح الحلزوني، زوج المسح الشعاعي، ومامبا الاندماج المكاني (SFusion Mamba) في البنية الأساسية. (ب) التغير في معامل تشابه النرد (DSC) بعد دمج زوج المسح الهرمي، زوج المسح الحلزوني، زوج المسح الشعاعي، ومامبا الاندماج المكاني (SFusion Mamba) في البنية الأساسية. (ج) التغير في mIoU بعد دمج زوج المسح الهرمي، زوج المسح الحلزوني، زوج المسح الشعاعي، ومامبا الاندماج المكاني (SFusion Mamba) في البنية الأساسية ضمن الإعداد التجريبي الثاني. (د) التغير في DSC بعد دمج زوج المسح الهرمي، زوج المسح الحلزوني، زوج المسح الشعاعي، ومامبا الاندماج المكاني (SFusion Mamba) في البنية الأساسية ضمن الإعداد التجريبي الثاني. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

في مجموعة بيانات ISIC 2017، حققت وحدة MV4D الكاملة mIoU بنسبة 80.94٪ وDSC بنسبة 91.32٪. تظهر اتجاهات الأداء المقابلة ل mIoU و DSC في الشكل 9A و الشكل 9B على التوالي. في مجموعة بيانات ISIC 2018، حققت وحدة MV4D الكاملة mIoU بنسبة 82.47٪ وDSC بنسبة 90.65٪. تظهر اتجاهات الأداء المقابلة في الشكل 9C والشكل 9D على التوالي.

ما لم يذكر خلاف ذلك، أجريت جميع تجارب الاستئصال باستخدام بذرة عشوائية ثابتة تبلغ 100، بينما تم الإبلاغ عن نتائج المقارنة الرئيسية كمتوسط ± SD على ثلاث بذور عشوائية مستقلة (1، 52، و100). وبالتالي، تهدف نتائج الاستئصال إلى مقارنة المساهمات النسبية للمكونات الفردية تحت إعداد متحكم فيه بذرة واحدة بدلا من إعادة إنتاج الأداء النهائي متعدد البذور الذي تم الإبلاغ عنه في تجارب المقارنة الرئيسية.

بشكل عام، أدى دمج أزواج المسح الإضافية ووحدة SFusion Mamba تدريجيا إلى تحسين أداء التقسيم باستمرار، حيث حقق تكوين MV4D الكامل أعلى أداء على كلا مجموعتي البيانات.

دراسة الاستئصال لكتلة الرؤية متعددة الرؤية (MVV)
تم تقييم كتلة MVV من خلال مقارنة بنية الأساس مع نسخة تتضمن فرع الإسقاط للأعلى والأسفل (الجدول 5). في مجموعة بيانات ISIC لعام 2017، أدى إدراج فرع الإسقاط للأعلى-الأسفل إلى زيادة mIoU من 78.83٪ إلى 80.96٪، وDSC من 88.15٪ إلى 91.02٪. في مجموعة بيانات ISIC لعام 2018، ارتفع mIoU من 80.32٪ إلى 82.46٪، بينما ارتفع DSC من 89.15٪ إلى 90.57٪.

النموذجكتلة MVV الأساسيةالإسقاط الصاعد والأسفلوحدة الاستخبارات الدولية للعلوم والاتصالات 2017 mIoU (٪)ISIC 2017 DSC (٪)وحدة بيانات ISIC 2018 mIoU (٪)ISIC 2018 DSC (٪)
MVM-UNet78.8388.1580.3289.15
MVM-UNet80.9691.0282.4690.57

الجدول 5: دراسة الاستئصال لكتلة الرؤية متعددة الرؤيات (MVV). مقارنة الأداء لكتلة الرؤية متعددة الرؤيات (MVV) الأساسية مع وبدون فرع الإسقاط الأعلى-الأسفلي. يتم الإبلاغ عن الأداء باستخدام متوسط التقاطع مع الاتحاد (mIoU) ومعامل تشابه النرد (DSC) في مجموعات بيانات ISIC 2017 وISIC 2018.

أجريت تجارب استئصال كتلة MVV باستخدام البذرة العشوائية الثابتة 100. وبالتالي، فإن أداء التكوين الذي يحتوي على فرع الإسقاط الأعلى-الأسفل يعكس إعداد التآكل المتحكم فيه بذرة واحدة وقد يختلف قليلا عن متوسط الأداء الثلاثي المبلغ عنه لنموذج MVM-UNet الكامل في تجارب المقارنة الرئيسية.

بشكل عام، أدى دمج فرع الإسقاط للأعلى-الأسفل إلى تحسين أداء التقسيم باستمرار على كلا مجموعتي البيانات، مع زيادة لوحظت لكل من mIoU وDSC.

دراسة الاستئصال لوحدة مامبا الاندماج متعددة المراحل (MFusion Mamba)
تم تقييم وحدة MFusion Mamba من خلال مقارنة استراتيجيات الاندماج الخشن المختلفة مع مكون الاندماج الدقيق (الجدول 6؛ الشكل 10). بدون MFusion Mamba، حقق MVM-UNet معدل mIoU بنسبة 75.47٪ وDSC بنسبة 86.01٪ في مجموعة بيانات ISIC 2017، وmIoU بنسبة 77.49٪ وDSC بنسبة 87.29٪ في مجموعة بيانات ISIC 2018. من بين استراتيجيات الاندماج الخشن التي تم تقييمها، حقق منتج هادامارد أكبر تحسين. أدى دمج مكون الاندماج الدقيق إلى زيادة أداء التقسيم. حقق تكوين MFusion Mamba الكامل mIoU بنسبة 80.95٪ وDSC بنسبة 91.18٪ في ISIC 2017، وmIoU بنسبة 82.51٪ وDSC بنسبة 90.58٪ في ISIC 2018.

النموذجالاندماج الخشن من حيث العناصر القصوىالاندماج الخشن الجمع حسب العناصرحاصل الاندماج الخشن هاداماردوحدة الاندماج الدقيقوحدة الاستخبارات الدولية للعلوم والاتصالات 2017 mIoU (٪)ISIC 2017 DSC (٪)وحدة بيانات ISIC 2018 mIoU (٪)ISIC 2018 DSC (٪)
MVM-UNet75.4786.0177.4987.29
MVM-UNet76.2186.4778.3587.82
MVM-UNet76.8386.8679.1188.30
MVM-UNet78.2687.8380.0688.96
MVM-UNet80.9591.1882.5190.58

الجدول 6: دراسة الاستئصال لوحدة مامبا الاندماج متعددة المراحل (MFusion Mamba). مقارنة الأداء لاستراتيجيات الاندماج الخشن المختلفة، بما في ذلك أقصى اندماج (Max)، والجمع على العناصر (⊕)، وحاصل ضرب Hadamard (⊙)، مع وحدة الاندماج الدقيق الكاملة. يتم الإبلاغ عن الأداء باستخدام متوسط التقاطع مع الاتحاد (mIoU) ومعامل تشابه النرد (DSC) في مجموعات بيانات ISIC 2017 وISIC 2018.

figure-results-5
الشكل 10. دراسة الاستئصال لوحدة مامبا الاندماج متعددة المراحل (MFusion Mamba). (أ) التغير في متوسط التقاطع عبر الاتحاد (mIoU) تم الحصول عليه باستخدام استراتيجيات اندماج خشنة مختلفة (الجمع الأقصى والعنصري على حدة، وحاصل ضرب هادامارد) ووحدة الاندماج الدقيق الكاملة. (ب) التغير في معامل تشابه النرد (DSC) الذي يتم الحصول عليه باستخدام استراتيجيات اندماج خشنة مختلفة (الجمع الأقصى والعنصري حسب العنصر، وحاصل ضرب هادامارد) ووحدة الاندماج الدقيق الكاملة. (ج) التغير في mIoU تم الحصول عليه باستخدام استراتيجيات اندماج خشنة مختلفة (الجمع الأقصى والعنصري على حدة، وحاصل ضرب هادامارد) ووحدة الاندماج الدقيق الكاملة تحت الإعداد التجريبي الثاني. (د) التغير في ال DSC الذي تم الحصول عليه باستخدام استراتيجيات اندماج خشنة مختلفة (الجمع الأقصى والعنصري على أساس العنصر، وحاصل ضرب هادامارد) ووحدة الاندماج الدقيق الكاملة تحت الإعداد التجريبي الثاني. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

في مجموعة بيانات ISIC 2017، حقق تكوين MFusion Mamba الكامل mIoU بنسبة 80.95٪ وDSC بنسبة 91.18٪. تظهر اتجاهات الأداء المقابلة ل mIoU و DSC في الشكل 10A والشكل 10B على التوالي. في مجموعة بيانات ISIC 2018، حقق تكوين MFusion Mamba الكامل mIoU بنسبة 82.51٪ وDSC بنسبة 90.58٪. تظهر اتجاهات الأداء المقابلة في الشكل 10C والشكل 10D على التوالي. أجريت تجارب استئصال مامبا في MFusion باستخدام البذرة العشوائية الثابتة 100. وبالتالي، يمثل تكوين MFusion الكامل لمامبا نتيجة الاستئصال المسيطر عليه بذرة واحدة وقد يختلف قليلا عن متوسط الأداء الثلاثي المبلغ عنه لنموذج MVM-UNet الكامل في تجارب المقارنة الرئيسية.

بشكل عام، أدى دمج استراتيجية الاندماج الخشن لمنتج هادامارد ومكون الاندماج الدقيق بشكل تدريجي إلى تحسين أداء التقسيم بشكل مستمر، حيث حقق تكوين MFusion Mamba الكامل أعلى أداء على كلا مجموعتي البيانات.

ملخص دراسات الاستئصال
عبر تجارب الاستئصال، أدى دمج فروع الفحص الهرمية واللولبية والشعاعية تدريجيا، إلى جانب وحدة SFusion Mamba، إلى تحسين أداء التقسيم بشكل مستمر (الجدول 4؛ الشكل 9). وبالمثل، أدى إدراج فرع الإسقاط للأعلى والأسفل في كتلة MVV إلى تحسين كل من mIoU وDSC في مجموعتي بيانات ISIC 2017 وISIC 2018 (الجدول 5). كما حقق تكوين MFusion Mamba الكامل أعلى أداء بين استراتيجيات دمج الميزات متعددة المراحل التي تم تقييمها (الجدول 6؛ الشكل 10).

دراسة الاستئصال للمعاملات الفائقة
تم تقييم تأثيرات حجم المدخلات وقيمة الانقطاع على مجموعتي بيانات ISIC 2017 وISIC 2018 (الجدول 7). تمت مقارنة ثلاث قرارات إدخال (256 × 256، 384 × 384، و512 × 512). تحت الإعدادات المقيمة، حققت دقة الإدخال 256 × 256 أعلى أداء تقسيم على كلا مجموعتي البيانات.

النموذجحجم الإدخال 256 × 256حجم المدخل 384 × 384حجم المدخل 512 × 512دروب آوت 0.0السقوط 0.1دروب آوت 0.2دروب آوت 0.3وحدة الاستخبارات الدولية للعلوم والاتصالات 2017 mIoU (٪)ISIC 2017 DSC (٪)وحدة بيانات ISIC 2018 mIoU (٪)ISIC 2018 DSC (٪)
MVM-UNet80.0288.9181.7689.92
MVM-UNet79.9688.8780.9789.47
MVM-UNet77.4887.2878.7688.11
MVM-UNet79.3688.5381.1389.62
MVM-UNet80.9490.1582.4990.50
MVM-UNet79.7188.7180.4689.18

الجدول 7: دراسة الاستئصال لحجم الصورة المدخلة وقيمة الانقطاع. مقارنة الأداء بين MVM-UNet باستخدام أحجام صور إدخال مختلفة وقيم انقطاع. يتم الإبلاغ عن أداء التقسيم باستخدام متوسط تقاطع عبر الاتحاد (mIoU) ومعامل تشابه النرد (DSC) في مجموعتي بيانات ISIC 2017 وISIC 2018.

كما تم تقييم قيم مختلفة للانسحاب. من بين التكوينات المختبرة، حققت قيمة الانقطاع 0.2 أعلى أداء تقسيم على كلتا مجموعتي البيانات، وبالتالي تم استخدامها في التجارب الرئيسية.

دراسة الاستئصال لتكوين طبقة المشفر-مفكك الترميز
تم تقييم تكوينات طبقات المشفر-مفكك التشفير المختلفة لفحص تأثير عمق الشبكة على أداء التقسيم والتكلفة الحسابية (الجدول 8). من بين التكوينات المقيمة، حققت معمارية {2، 2، 2، 2}-{2، 2، 2، 2} المتماثلة أعلى أداء تقسيم عام مع الحفاظ على تعقيد النموذج المنخفض نسبيا. زيادة عمق الشبكة إلى {2، 2، 9، 2}-{2، 9، 2، 2} أنتجت أداء تقسيم مماثل لكنها زادت من عدد المعلمات والتكلفة الحاسوبية.

النموذجتكوين طبقة الترميز-فك الترميزالمعلمات (M)فلوبس (G)وحدة الاستخبارات الدولية للعلوم والاتصالات 2017 mIoU (٪)ISIC 2017 DSC (٪)وحدة بيانات ISIC 2018 mIoU (٪)ISIC 2018 DSC (٪)
MVM-UNet{2,2,2,1}-{2,2,2,2}28.224.1280.0288.9181.1689.64
MVM-UNet{2,2,2,2}-{2,2,2,2}28.364.3980.9590.1782.590.41
MVM-UNet{2,2,2,3}-{2,3,2,2}30.144.8879.8388.881.5689.85
MVM-UNet{2,4,2,2}-{2,2,4,2}33.465.3279.6588.781.4589.79
MVM-UNet{2,2,9,2}-{2,9,2,2}45.637.7880.9690.0982.4890.43

الجدول 8: دراسة الاستئصال لتكوينات طبقة المشفر-مفكك. مقارنة الأداء بين تكوينات طبقات الترميز وفك الترميز. يذكر الجدول عدد معلمات النموذج (المعلمات)، وعمليات الفابض العائمة (FLOPs)، ومتوسط التقاطع فوق الاتحاد (mIoU)، ومعامل تشابه النرد (DSC) في مجموعات بيانات ISIC 2017 وISIC 2018.

مقارنة التكاليف الحاسوبية
تمت مقارنة الكفاءة الحاسوبية لنموذج MVM-UNet النهائي مع طرق الأساس التمثيلية، بما في ذلك HResFormer، H-vmunet، MISSFormer، H2Former، MedScale-Former، وMCAFT، تحت نفس بيئة الأجهزة ودقة الإدخال (الجدول 9). شملت المقاييس المقيمة وقت التدريب لكل عصر، ووقت الاستدلال لكل صورة، وذروة استخدام ذاكرة GPU أثناء التدريب، وعدد المعلمات القابلة للتدريب (Params)، وFLOPs. تم قياس وقت التدريب بأنه الوقت المطلوب لإكمال فترة تدريب واحدة، ووقت الاستدلال كمتوسط زمن المعالجة لكل صورة اختبار، وتم حساب FLOPs لمرور واحد للأمام.

الطريقةالمرجع.وقت التدريب (الحقبة)زمن الاستدلال (ms/image)ذاكرة ذروة وحدة معالجة الرسوميات (GB)المعلمات (M)فلوبس (G)
HResFormer34520213.0819.2117.00131.70
H-vmunet288827.005.010.748.97
ميسفورمر3035592.8612.642.33109.45
H2Former1213029.028.833.7133.56
ميدسكيل-فورمر358023.505.94.963.79
MCAFT3614534.008.730.0012.00
MVM-UNet (لنا)10426.807.928.364.39

الجدول 9: مقارنة التكاليف الحسابية بين MVM-UNet وطرق الأساس التمثيلية. مقارنة الكفاءة الحسابية تحت نفس بيئة الأجهزة ودقة الإدخال. تشمل المقاييس المبلغ عنها وقت التدريب لكل عصر، ووقت الاستدلال لكل صورة، واستخدام ذروة ذاكرة وحدة معالجة الرسوميات (GPU) أثناء التدريب، وعدد معلمات النموذج (Parameters)، وعمليات النقطة العائمة (FLOPs). تم تقييم الطرق التي تحتوي على تطبيقات متاحة باستخدام نفس بيئة التجربة كلما أمكن.

كما هو موضح في الجدول 9، تطلب MVM-UNet 104 ثانية لكل فترة تدريب، و26.8 مللي ثانية لكل صورة للاستدلال، و7.9 جيجابايت من ذاكرة ذروة وحدة معالجة الرسوميات، و28.36 مليون معلم قابل للتدريب، و4.39 GFLOPs. مقارنة ب HResFormer وMISSFormer وH2Former وMCAFT، تطلب MVM-UNet وقت تدريب أقل، ووقت استدلالات أقل، واستخدام ذاكرة ذروة أقل لوحدة معالجة الرسومات، وعدد أقل من FLOPs. مقارنة بنماذج H-vmunet وخفيفة الوزن وMedScale-Form، تطلب MVM-UNet وقت تدريب واستخدام ذاكرة أكبر لكنه حافظ على سرعة استدلال مماثلة مع الحفاظ على تعقيد حسابي منخفض نسبيا.

توفر البيانات والشيفرة
مجموعات بيانات ISIC 2017 وISIC 2018 متاحة للجمهور من أرشيف التعاون الدولي لتصوير الجلد (ISIC)، ومجموعة بيانات Synapse متاحة للجمهور من مستودع Synapse. تم توفير تفاصيل جمع مجموعات البيانات في بيان الأخلاقيات. باختصار، تم الحصول على مجموعة بيانات ISIC 2017 من مستودع بيانات ISIC 2017 Challenge الرسمي (https://challenge.isic-archive.com/data/#2017)، وتم الحصول على مجموعة بيانات ISIC 2018 من مستودع بيانات ISIC 2018 Challenge Task 1 الرسمي (https://challenge.isic-archive.com/data/#2018)، وتم الحصول على مجموعة بيانات Synapse من مستودع Synapse تحت معرف الإدخال syn3193805 (https://www.synapse.org/Synapse:syn3193805). يتم الإبلاغ عن تواريخ التنزيل المقابلة في بيان الأخلاقيات. النسخة العامة الأولية من شفرة مصدر MVM-UNet متوفرة على https://github.com/LIXUEGUANG002/MVM-UNet. يشمل المستودع تنفيذ النموذج، ووحدات الشبكة الرئيسية، وملفات التكوين، وتعليمات تنظيم مجموعات البيانات، وسكريبتات التدريب، وسكريبتات التقييم. سيتم توفير حزمة إعادة الإنتاج الكاملة، بما في ذلك ملفات التكوين النهائية، وسكريبتات التجارب الكاملة، ووثائق إضافية، ونقاط تفتيش النماذج المدربة، للجمهور عند النشر.

الجدول التكميلي 1. بنية طبقة بطبقة لرؤية مامبا UNet متعددة الرؤية (MVM-UNet). يلخص الجدول بنية الشبكة التسلسلية ل MVM-UNet، بما في ذلك طبقة الإدخال، تضمين الباتش، مراحل المشفر، كتل الرؤية متعددة الرؤية (MVV)، عمليات دمج الرقعة، مامبا الاندماج متعدد المراحل (MFusion Mamba)، مراحل فك الترميز، الترقية النهائية للعينة النهائية، ورأس التقسيم. لكل مرحلة، يتم سرد العملية المقابلة، والمعلمات الرئيسية، وحجم ميزة الإخراج. تشير E1–E4 إلى خرائط ميزات مرحلة المشفر المستخدمة في دمج الميزات متعددة المراحل. B وH وW ترمز إلى حجم الدفعة، وارتفاع الصورة، وعرض الصورة على التوالي، وK تشير إلى عدد فئات الإخراج (K = 1 لتقسيم آفات الجلد الثنائية وK = 9 لتقسيم متعدد الفئات في المشابك، التي تتكون من فئة خلفية واحدة وثماني فئات من الأعضاء الأمامية). يولد MFusion Mamba ميزات مشفرة متعددة المراحل مدمجة مع ميزات فك التشفير المقابلة أثناء إعادة بناء جهاز فك الترميز. يرجى الضغط هنا لتحميل هذا الملف.

الملف التكميلي 1. كود زائف لوحدة متعددة الرؤى رباعية الاتجاهات (MV4D) ووحدة الاندماج متعددة المراحل (MFusion Mamba). يعرض الملف التكميلي سير العمل الخوارزمي للوحدتين الرئيسيتين المستخدمتين في MVM-UNet. تصف الخوارزمية 1 خط معالجة كامل لوحدة متعددة الرؤى رباعية الاتجاهات (MV4D)، بما في ذلك تسطيح الميزات، وبناء أربعة تسلسلات أزواج مسح (متعرجة، هرمية، حلزونية، وشعاعية)، ومعالجة فضاء الحالة الانتقائي (S6)، ودمج مامبا بعرض المسح (SFusion Mamba)، وإعادة بناء خريطة ميزات الإخراج. تصف الخوارزمية 2 وحدة مامبا الاندماج متعددة المراحل (MFusion Mamba)، بما في ذلك محاذاة ميزات المشفر متعدد المراحل، والاندماج الخشن، والاندماج الدقيق، وتكامل المفكك، وتوليد ميزة إدخال مفكك التشفير. يتم تعريف المتغيرات وأبعاد الموترات ضمن الخوارزميات. يرجى الضغط هنا لتحميل هذا الملف.

ملف الترميز الإضافي 1. حزمة الشيفرة المصدرية ل MVM-UNet (MVM-UNet-master). يحتوي أرشيف ZIP التكميلي على تنفيذ كود المصدر الكامل ل MVM-UNet المستخدم في هذه الدراسة. تتضمن الحزمة بنية الشبكة، ووحدات متعددة الرؤية رباعية الاتجاهات (MV4D) ووحدات الاندماج متعددة المراحل (MFusion Mamba)، وملفات التكوين، وسكريبتات التدريب والتقييم لمجموعات بيانات ISIC 2017، ISIC 2018، ومجموعات بيانات Synapse، ودوال الأدوات، وتوثيق المشروع اللازمة لإعادة إنتاج التجارب الموصوفة في هذا البروتوكول. تتضمن الحزمة أيضا ملف README مع تعليمات التثبيت، وتبعيات البرمجيات، وتنظيم مجموعات البيانات، وسير عمل التدريب والاستدلال. يرجى الضغط هنا لتحميل هذا الملف.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يصف هذا البروتوكول إطار عمل MVM-UNet، وهو إطار عمل لتقسيم الصور الطبية يعتمد على مامبا. تم تصميم الطريقة لمعالجة محدودين في نماذج التقسيم الحالية. أولا، الطرق التقليدية المعتمدة على CNN لديها قدرة محدودة على نمذجة التبعيات طويلة المدى والمعلومات السياقية الهرمية في الصور الطبية المعقدة43. ثانيا، يمكن للطرق المعتمدة على المحولات نمذجة السياق العالمي لكنها عادة ما تتطلب تكلفة حسابية أعلى23,25. يستخدم MVM-UNet بنية مامبا 13,14,15,16,17,18,19,20 لتحقيق نمذجة فعالة على المدى البعيد، ويقدم المسح متعدد الرؤى ودمج الميزات متعددة المراحل لتحسين دقة التقسيم. من منظور تنفيذ البروتوكول وقابلية التكرار، هناك عدة خطوات حاسمة للحصول على نتائج مماثلة لتلك المبلغ عنها في هذه الدراسة. أولا، يجب أن تبقى تقسيم مجموعة البيانات، وتغيير حجم الصورة، واستيفاء القناع، واستراتيجية التطبيع، وتحويل القناة متسقة مع البروتوكول لأن الاختلافات في المعالجة المسبقة يمكن أن تغير مباشرة توزيع الإدخال وحدود القناع. على وجه الخصوص، يجب إعادة تكبير أقنعة التقسيم باستخدام استيفاء أقرب جار لتجنب إدخال قيم تسمية غير صحيحة44. ثانيا، يجب فحص تكوين التدريب، بما في ذلك دقة الإدخال، حجم الدفعة، إعدادات المحسن، جدول معدل التعلم، البذرة العشوائية، معاملات وزن الخسارة، قاعدة اختيار نقاط التحقق، وعتبة الاستدلال أو عملية argmax، قبل مقارنة النتائج. إذا كانت النتائج المستنسخة أقل بوضوح من القيم المبلغ عنها، يجب على المستخدمين أولا التحقق من مسار مجموعة البيانات، وتنسيق التعليقات، واتفاقية التسمية المقدمة والخلفية، وتحميل نقاط الحفظ، وتقسيم التحقق أو الاختبار، وإجراء حساب المقاييس. عادة ما تشير تسرب الحدود، الأقنعة المجزأة، أو الهياكل الصغيرة المفقودة إلى وجود تناقضات محتملة في المعالجة المسبقة، أو استيفاء القناع، أو اختيار نقاط التفتيش، أو معالجة الاستدلال.

المساهمة الرئيسية ل MVM-UNet هي وحدة MV4D. على عكس استراتيجيات المسح ثنائية الأبعاد البسيطة التي تم اعتمادها في البنى السابقة القائمة على نموذج فضاء الحالة 14,15,16,17,18,19,20، يستخدم MV4D أزواج المسح المتعرج، الهرمي، الحلزوني، والشعاعي لالتقاط المعلومات البصرية المكملة. تساعد أزواج المسح المتعرج في موازنة المعلومات المكانية المحلية والعالمية، بينما تعزز أزواج المسح الهرمي استخراج الميزات متعدد المقاييس، وتقوي أزواج المسح الحلزونية تمثيل الخطوط العمومية، وتحسن أزواج المسح الشعاعي استخراج ميزات الحواف والحدود المحلية. ثم تدمج SFusion Mamba هذه الأساليب التكميلية للمسح. النتائج الممثلة وتجارب الكاهة (الجدولان 4 و5؛ الشكل 9) يثبت أن تنوع أنماط المسح وآلية الاندماج يسهمان في تحسين أداء التقسيم. مكون مهم آخر هو MFusion Mamba، الذي يعمل كوحدة دمج ميزات بين المشفر والمفكك. البنى التقليدية على شكل U، بما في ذلك U-Net 8,21، V-Net44، والعديد من النسخ اللاحقة 9,23,25، تنقل المعلومات بشكل أساسي عبر اتصالات تخطي على مراحل. قد لا تستفيد هذه الاستراتيجية بالكامل من تمثيلات المشفرة متعددة المراحل التكميلية. يعالج MFusion Mamba هذا القيد من خلال دمج ميزات المشفر عبر Coarse Fusion وFine Fusion قبل فك الترميز. النتائج الممثلة (الجدول 6؛ الشكل 10) يظهر أن MFusion Mamba يحسن باستمرار أداء التقسيم، مما يشير إلى أن دمج الميزات متعدد المراحل الصريح مفيد لتقسيم الصور الطبية.

يجب فهم المساهمة المنهجية ل MVM-UNet على أنها إعادة تصميم على مستوى الهيكل وليس اختراع كل عملية فردية من الصفر. تم دراسة بنى مشفر-مفكك التشفير على شكل حرف U، والاتصالات المتبقية، وطبقات الإسقاط، وكتل نموذج مامبا/فضاء الحالة (SSM) بشكل موسع في دراسات سابقة 8,13,14,15,16,17,18,19,20,21,23,24,25 ,29,44. ومع ذلك، فإن الجمع المباشر بين هذه المكونات لا يعالج بالضرورة التحديات المحددة لتقسيم الصور الطبية. تكمن حداثة MVM-UNet في التصميم المنسق لثلاثة جوانب. أولا، تستبدل وحدة MV4D نمط مسح واحد أو محدود بأربعة فروع مكملة من أزواج المسح، مما يمكن النموذج من التقاط الاستمرارية المكانية، والبنية متعددة المقاييس، ومعلومات الخطوط العالمية، وتفاصيل الحدود المحلية. ثانيا، يقوم SFusion Mamba وMVV Block بدمج وتعزيز ميزات خاصة بالمسح قبل تمريرها إلى المرحلة التالية من الشبكة. ثالثا، يقوم MFusion Mamba بتجميع ميزات الترميز متعدد المراحل صراحة قبل فك الترميز، مكملا اتصالات التخطي التقليدية 8,21,44 ويحسن استخدام المعلومات الهرمية. نتائج الاستئصال (جداول 4–6؛ الأشكال 9 و10) يدعم هذا المنطق التصميمي بشكل أكبر، حيث يظهر أن المسح متعدد الرؤية، والدمج الخاص بالمسح الخاص، وفرع الإسقاط الصاعد والأسفل، ودمج الميزات متعددة المراحل يساهم كل منها في تحسين أداء التقسيم. لذلك، تكمن مساهمة MVM-UNet في دمج محدد المهمة والتحقق تجريبيا بين النمذجة المكانية المعتمدة على مامبا ودمج ميزات الترميز ومفك التشفير لتقسيم الصور الطبية.

على الرغم من أدائها القوي، تعاني MVM-UNet من عدة قيود. أولا، لم يتحسن أداء التقسيم باستمرار مع أحجام الصور المدخلة الأكبر، مما يشير إلى أن البنية الحالية قد لا تستغل معلومات الصور عالية الدقة بالكامل. ثانيا، لم يتم تقييم النموذج بشكل موسع في ظروف التصوير ذات الضوضاء العالية أو التباين المنخفض، والتي تواجهها كثيرا في الممارسة السريرية وقد تؤثر على متانة التقسيم. ثالثا، رغم أن النموذج حقق أداء قويا في ثلاث مجموعات بيانات متاحة للجمهور، إلا أن التحقق الإضافي من الفحص على مجموعات بيانات التصوير الطبي الأكبر والأكثر تنوعا أمر ضروري. يمكن تكييف البروتوكول لمهام تقسيم الصور الطبية الأخرى، لكن يجب تنفيذ عدة تعديلات بعناية. لمهمة تقسيم ثنائية جديدة، يجب على المستخدمين تعديل محمل مجموعة البيانات، ومعلمات التطبيع، ودقة الإدخال، وعتبة المقدمة مع الحفاظ على إجراء فقدان وتقييم BCE-Dice الثنائي. لمهمة تقسيم متعددة الفئات جديدة، يجب على المستخدمين تحديث عدد فئات المخرجات، وتعيين مؤشر الفئة، وتحويل تسمية واحدة ساخنة، وتكوين خسارة النرد CE-Dice، ومقاييس التقييم حسب الفئة44. بالنسبة لمجموعات البيانات الرمادية، يجب مطابقة تكوين قناة الإدخال مع بنية النموذج إما باستخدام إسقاط إدخال أحادي القناة أو تكرار صورة التدرج الرمادي لإنشاء إدخال ثلاثي القنوات، حسب التنفيذ. قد تؤدي الطريقة أداء غير مثالي عندما تكون هياكل الهدف صغيرة جدا، أو تكون الحدود ضعيفة أو غامضة، أو يختلف تباين الصور بشكل كبير عن بيانات التدريب، أو عندما تظهر مجموعة البيانات المستهدفة تحولا كبيرا في المجال. في هذه الظروف، قد يحتاج المستخدمون إلى تعديل دقة المدخلات، واستراتيجية التعزيز، وتوازن الفئات، ووزن الفقدان، أو ضبط جدول التقييم مع الحفاظ على نفس بروتوكول التقييم لضمان مقارنات عادلة.

في مجموعة بيانات Synapse، حقق MVM-UNet أداء قويا في تقسيم الأعضاء المتعددة ضمن تقسيم التدريب الشائع من 18 حالة واختبار 12 حالة. على الرغم من أن الطريقة المقترحة حققت أعلى متوسط DSC بين الطرق الأساسية الممثلة التي تم تقييمها في هذه الدراسة (الجدول 3)، إلا أن بعض الطرق الحديثة أبلغت عن أداء أعلى للمشابك تحت بيئات تدريب وبروتوكولات تقييم مختلفة29. لذلك، نتجنب وصف MVM-UNet بأنه يحقق أداء متقدما بشكل عام على Synapse، وبدلا من ذلك وصفه بأنه تحقيق أداء قوي تحت إطار التجارب المقيمة. تشير هذه النتائج إلى أن أداء MVM-UNet ينشأ من التكيف المخصص للمهمة في النمذجة المعتمدة على مامبا لتقسيم الصور الطبية 13,14,15,16,17,18,19,20. بدلا من الاعتماد على استراتيجية مسح واحدة، يقوم MVM-UNet بتفكيك نمذجة الميزات البصرية إلى عدة رؤى مسح مكملة ودمجها عبر SFusion Mamba. بالإضافة إلى ذلك، يحسن MFusion Mamba تدفق المعلومات بين المشفر والمفكك من خلال تجميع ميزات الترميز متعدد المراحل بشكل صريح خارج اتصالات التخطي التقليدية 8,21,44. يتيح هذا التصميم للنموذج المقترح تحقيق أداء قوي في كل من تقسيم آفات الجلد الثنائية ومهام تقسيم الأعضاء المتعددة.

يجب أن يركز العمل المستقبلي على تحسين MVM-UNet لتقسيم الصور الطبية عالية الدقة. قد تمكن البنى متعددة المقاييس الأعمق أو التكيفية النموذج من استغلال معلومات الصور عالية الدقة بشكل أكثر فعالية. يجب أن تقيم الدراسات المستقبلية أيضا متانة MVM-UNet تحت ظروف التصوير الضوضاء ومنخفضة التباين وتغيير المجال. بالإضافة إلى ذلك، يمكن توسيع استراتيجية المسح متعدد الرؤى المقترحة لتشمل مهام تحليل الصور الطبية الأخرى، بما في ذلك اكتشاف الآفة4، وتحديد موقع الأعضاء، وتصنيف الأورام، والتقسيم ثلاثي الأبعاد10,11. باختصار، يوفر MVM-UNet إطارا فعالا وقابلا للتكرار لتقسيم الصور الطبية. يتيح دمج وحدة MV4D وMFusion Mamba للنموذج التقاط المعلومات المكانية التكميلية، والسياق متعدد المقاييس، ومعلومات الخطوط العالمية، وتفاصيل الحدود المحلية، والميزات الدلالية متعددة المراحل. تظهر النتائج الممثلة التي تم الحصول عليها على مجموعات بيانات ISIC 2017 وISIC 2018 وSynapse فعالية البنية المقترحة. يوفر هذا البروتوكول مرجعا عمليا للباحثين الذين يطورون هياكل فعالة قائمة على SSM/Mamba لتقسيم الصور الطبية 13,14,15,16,17,18,19,20.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلفون أنه لا توجد لديهم مصالح مالية متنافسة.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لم يحصل هذا البحث على تمويل خارجي.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
Hardware - GPU workstation or GPU serverInstitutional computing platform / local workstationCustom-built local GPU workstation; Ubuntu 22.04.1 with Linux kernel 6.8.0; Intel Core i9-13900K CPU; NVIDIA A800 GPU; 128 GB RAM; 512 GB local storage.Computational platform for training, validation, testing, ablation, and inference-only experiments.
Hardware - Graphics processing unit (GPU)NVIDIA CorporationNVIDIA A800 GPU (80 GB memory).GPU-accelerated model training and inference.
Hardware - Central processing unit (CPU)Intel Corporation / AMD13th Gen Intel Core i9-13900K CPU.Host processor for data loading, preprocessing, and experiment execution.
Hardware - System memory (RAM)Institutional computing platform / local workstation128 GB system RAMMemory for dataset loading, preprocessing, and training.
Hardware - StorageInstitutional computing platform / local workstation2 TB NVMe solid-state drive.Storage for datasets, checkpoints, logs, and generated prediction figures.
Software environment - Operating systemCanonical Ltd.Recommended: Ubuntu 22.04.1 LTSOperating system for the computational environment.
Software environment - Conda environmentAnaconda, Inc. / MinicondaEnvironment name: mvmunetPython environment used to install and isolate dependencies.
Software environment - PythonPython Software FoundationPython 3.8Programming language used for implementation and experiment execution.
Software environment - CUDA toolkitNVIDIA CorporationCUDA Toolkit 11.8GPU computing backend required by PyTorch and Mamba-related packages.
Software environment - cuDNNNVIDIA CorporationcuDNN 8.7.0.GPU-accelerated deep-learning primitives used through PyTorch.
Python package - PyTorchPyTorchtorch == 2.0.1Deep-learning framework for model training, loss calculation, optimization, and inference.
Python package - TorchvisionPyTorchtorchvision == 0.14.0Image transform utilities used in preprocessing and augmentation.
Python package - TorchaudioPyTorchtorchaudio == 0.13.0Installed with the recommended PyTorch environment.
Python package - timmtimm developerstimm == 0.4.12Model-component or utility dependency listed in the repository environment instructions.
Python package - tritonOpenAI / Triton developerstriton == 2.0.0Dependency used by GPU-accelerated sequence modeling components.
Python package - causal-conv1dcausal-conv1d developerscausal_conv1d == 1.0.0Efficient causal convolution dependency required by the Mamba implementation.
Python package - mamba-ssmMamba SSM developersmamba_ssm == 1.0.1State-space sequence modeling package used for Mamba/S6-related components.
Python package - NumPyNumPy developersNumPy version 1.24.3.Numerical computation and array operations.
Python package - SciPySciPy developersSciPy version 1.10.1.Scientific computation; scipy.ndimage.zoom is imported in utils.py.
Python package - SimpleITKInsight Software ConsortiumSimpleITK version 2.2.1.Medical image input/output and preprocessing utility imported in utils.py.
Python package - MedPyMedPy developersMedPy version 0.4.0.Medical image metric calculation package imported in utils.py.
Python package - scikit-imagescikit-image developersscikit-image version 0.21.0.Image-processing dependency listed in README.
Python package - scikit-learnscikit-learn developersscikit-learn version 1.3.2.Machine-learning utility package listed in README.
Python package - matplotlibMatplotlib developersMatplotlib version 3.7.2.Used for saving qualitative visualization figures.
Python package - h5pyh5py developersh5py version 3.9.0.HDF5 file support for Synapse test volumes.
Python package - thopTHOP developersTHOP version 0.1.1.post2209072238.Used when calculating FLOPs and parameter-related computational cost.
Python package - packagingPython Packaging Authoritypackaging version 23.1.Dependency listed in README.
Python package - pytestpytest developerspytest version 7.4.0.Dependency listed in README.
Python package - chardetchardet developerschardet version 5.2.0.Dependency listed in README.
Python package - yacsYACS developersyacs version 0.1.8.Configuration utility dependency listed in README.
Python package - termcolortermcolor developerstermcolor version 2.3.0.Logging/terminal utility dependency listed in README.
Python package - submititsubmitit developerssubmitit version 1.4.5.Experiment/job utility dependency listed in README.
Python package - tensorboardXtensorboardX developerstensorboardX version 2.6.2.2.Training log visualization utility listed in README.
Python package - ml-collectionsml_collections developersml-collections version 0.1.1.Imported by configs/config_setting_synapse.py.
Dataset - ISIC 2017 Challenge datasetInternational Skin Imaging CollaborationISIC 2017 skin lesion segmentation datasetPublic de-identified dermoscopic skin lesion images and masks used for binary segmentation.
Dataset - ISIC 2018 Challenge Task 1 datasetInternational Skin Imaging CollaborationISIC 2018 Task 1: Lesion Boundary SegmentationPublic de-identified dermoscopic skin lesion images and masks used for binary segmentation.
Dataset - Synapse Multi-Atlas Labeling Beyond the Cranial Vault datasetSynapse / Sage BionetworksAccession identifier: syn3193805Public abdominal CT multi-organ segmentation dataset.
Data organization - ISIC 2017 data folderAuthors / repository layoutdata/isic2017/Expected local folder containing train and validation images/masks.
Data organization - ISIC 2018 data folderAuthors / repository layoutdata/isic2018/Expected local folder containing train and validation images/masks.
Data organization - Synapse data folderAuthors / repository layoutdata/Synapse/Expected local folder for Synapse lists, train_npz, and test_vol_h5.
Source code - MVM-UNet source-code repositoryAuthors / GitHubBranch: master;Git commit hash: ee891b42c2f083c4990eed72f1d4463adc5e103e.Complete source-code implementation of the protocol.
Source code - ISIC configuration fileAuthorsconfigs/config_setting.pyConfiguration file for ISIC-style binary segmentation.
Source code - Synapse configuration fileAuthorsconfigs/config_setting_synapse.pyConfiguration file for Synapse multi-organ segmentation.
Source code - ISIC training scriptAuthorstrain.pyTraining and validation entry point for ISIC-style binary segmentation.
Source code - Synapse training scriptAuthorstrain_synapse.pyTraining and validation entry point for Synapse multi-class segmentation.
Source code -

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang F, et al. Cross co-teaching for semi-supervised medical image segmentation. Pattern Recognit. 2024;152:110485.
  2. Gu Y, et al. Dual-scale enhanced and cross-generative consistency learning for semi-supervised medical image segmentation. Pattern Recognit. 2025;158:111140.
  3. Zhu X, Wang W, Zhang C, Wang H. Polyp-Mamba: A hybrid multi-frequency perception gated selection network for polyp segmentation. Inf Fusion. 2025;115:103161.
  4. Iqbal S, et al. TBConvL-Net: A hybrid deep learning architecture for robust medical image segmentation. Pattern Recognit. 2025;158:111147.
  5. Zhao Z, et al. Balanced feature fusion collaborative training for semi-supervised medical image segmentation. Pattern Recognit. 2025;157:110986.
  6. Zhou T, et al. MambaYOLACT: You only look at Mamba prediction head for head-neck lymph nodes. Artif Intell Rev. 2025;58(6).
  7. Zhao Y, et al. MGF-GCN: Multimodal interaction Mamba-aided graph convolutional fusion network for semantic segmentation of remote sensing images. Inf Fusion. 2025;122:103268.
  8. Ronneberger O, Fischer P, Brox T. U-Net: Convolutional networks for biomedical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2015.
  9. Zhou Z, Siddiquee MMR, Tajbakhsh N, Liang J. UNet++: Redesigning skip connections to exploit multiscale features in image segmentation. IEEE Trans Med Imaging. 2019;39(6):1856-1867.
  10. Shaker A, et al. UNETR++: Delving into efficient and accurate 3D medical image segmentation. IEEE Trans Med Imaging. 2024;43(9):3377-3390.
  11. Zhou HY, et al. nnFormer: Volumetric medical image segmentation via a 3D Transformer. IEEE Trans Image Process. 2023;32:4036-4045.
  12. He A, et al. H2Former: An efficient hierarchical hybrid Transformer for medical image segmentation. IEEE Trans Med Imaging. 2023;42(9):2763-2775.
  13. Zhu L, et al. Vision Mamba: Efficient visual representation learning with bidirectional state space model. In: Proceedings of the 41st International Conference on Machine Learning (ICML). 2024.
  14. Liu Y, et al. VMamba: Visual state space model. Adv Neural Inf Process Syst. 2024;37:103031-103063.
  15. Ma J, Li F, Wang B. U-Mamba: Enhancing long-range dependency for biomedical image segmentation. arXiv. 2024;arXiv:2401.04722.
  16. Wang Z, et al. Mamba-UNet: UNet-like pure visual Mamba for medical image segmentation. arXiv. 2024;arXiv:2402.05079.
  17. Huang T, et al. LocalMamba: Visual state space model with windowed selective scan. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  18. Zhang Z, et al. Motion Mamba: Efficient and long sequence motion generation. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  19. Hu VT, et al. Zigma: A DiT-style zigzag Mamba diffusion model. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  20. Rahman MM, et al. Mamba in vision: A comprehensive survey of techniques and applications. arXiv. 2024;arXiv:2410.03105.
  21. Falk T, et al. U-Net: Deep learning for cell counting, detection, and morphometry. Nat Methods. 2019;16(1):67-70.
  22. Gu R, et al. CA-Net: Comprehensive attention convolutional neural networks for explainable medical image segmentation. IEEE Trans Med Imaging. 2020;40(2):699-711.
  23. Chen J, et al. TransUNet: Rethinking the U-Net architecture design for medical image segmentation through the lens of Transformers. Med Image Anal. 2024;97:103280.
  24. Zhang Z, Zhang W. Pyramid medical Transformer for medical image segmentation. arXiv. 2021;arXiv:2104.14702.
  25. Cao H, et al. Swin-Unet: UNet-like pure Transformer for medical image segmentation. In: European Conference on Computer Vision (ECCV). Springer; 2022.
  26. Chen B, et al. TransAttUNet: Multi-level attention-guided U-Net with Transformer for medical image segmentation. IEEE Trans Emerg Top Comput Intell. 2023.
  27. Jiang S, Li J. TransCUNet: UNet cross-fused Transformer for medical image segmentation. Comput Biol Med. 2022;150:106207.
  28. Wu R, Liu Y, Liang P, Chang Q. H-vmunet: High-order Vision Mamba UNet for medical image segmentation. Neurocomputing. 2025;624:129447.
  29. Liu J, et al. Swin-UMamba: Adapting Mamba-based vision foundation models for medical image segmentation. IEEE Trans Med Imaging. 2024.
  30. Huang X, et al. MISSFormer: An effective Transformer for 2D medical image segmentation. IEEE Trans Med Imaging. 2023;42(5):1484-1494.
  31. Ruan J, et al. MALUNet: A multi-attention and lightweight U-Net for skin lesion segmentation. In: 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM). IEEE; 2022.
  32. Ruan J, Xiang S. VM-UNet: Vision Mamba UNet for medical image segmentation. arXiv. 2024;arXiv:2402.02491.
  33. Valanarasu JMJ, Patel VM. UNeXt: MLP-based rapid medical image segmentation network. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2022.
  34. Ren S, Li X. HResFormer: Hybrid residual Transformer for volumetric medical image segmentation. IEEE Trans Neural Netw Learn Syst. 2025;36(6):10558-10566.
  35. Karimijafarbigloo S, Azad R, Kazerouni A, Merhof D. MedScale-Former: Self-guided multiscale Transformer for medical image segmentation. Med Image Anal. 2025;103.
  36. Yan S, et al. Multi-scale convolutional attention frequency-enhanced Transformer network for medical image segmentation. Inf Fusion. 2025;119.
  37. Gao Y, Zhou M, Metaxas DN. UTNet: A hybrid Transformer architecture for medical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2021.
  38. Mei J, et al. SANet: A slice-aware network for pulmonary nodule detection. IEEE Trans Pattern Anal Mach Intell. 2021;44(8):4374-4387.
  39. Hu XZ, Jeon WS, Rhee SY. ATT-UNet: Pixel-wise staircase attention for weed and crop detection. In: 2023 International Conference on Fuzzy Theory and Its Applications (iFUZZY). IEEE; 2023.
  40. Wang X, et al. Transferable normalization: Towards improving transferability of deep neural networks. Adv Neural Inf Process Syst. 2019;32.
  41. Azad R, et al. TransDeepLab: Convolution-free Transformer-based DeepLabV3+ for medical image segmentation. In: International Workshop on Predictive Intelligence in Medicine (PRIME). Springer; 2022.
  42. Ruan J, Gao J, Xie M, Xiang S. Learning multi-axis representation in frequency domain for medical image segmentation. Mach Learn. 2025;114(1):10.
  43. Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press; Cambridge, MA; 2016.
  44. Milletari F, Navab N, Ahmadi SA. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. In: 2016 Fourth International Conference on 3D Vision (3DV). IEEE; 2016.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

234 234 SSM UNet

مقالات ذات صلة