يصف هذا البروتوكول كيفية بناء وتدريب وتقييم إطار شبكة Vision Mamba U-Shape متعددة المنظورات لتقسيم الصور الطبية، مما يمكن من إعادة تقسيم آفات الجلد وأعضاء البطن من خلال إعداد مجموعات البيانات الموحدة، وتنفيذ النماذج، وتقييم الأداء.
مقالة منهجية
يصف هذا البروتوكول كيفية بناء وتدريب وتقييم إطار شبكة Vision Mamba U-Shape متعددة المنظورات لتقسيم الصور الطبية، مما يمكن من إعادة تقسيم آفات الجلد وأعضاء البطن من خلال إعداد مجموعات البيانات الموحدة، وتنفيذ النماذج، وتقييم الأداء.
يتطلب تقسيم الصور الطبية طرقا حسابية تلتقط بدقة السياق العالمي، والحدود المحلية، والهياكل التشريحية متعددة المقاييس مع الحفاظ على قابلية التكرار عبر تطبيقات مختلفة. تقدم هذه المقالة بروتوكولا لبناء وتدريب وتقييم إطار شبكة مامبا متعددة الرؤى على شكل U لتقسيم الصور الطبية ثنائية الأبعاد. يوفر البروتوكول سير عمل قابل للتكرار يشمل اكتساب مجموعات البيانات العامة، والمعالجة المسبقة للصور والأقنعة، وبناء الشبكة، وتدريب النماذج، واختيار نقاط التحقق، والتقييم الكمي والنوعي للأداء. يدمج الإطار مسح الميزات متعددة الوجهات لالتقاط معلومات مكملة عن المكان، والكنتور، والمقياس، والحدود، ويطبق دمج الميزات متعددة المراحل ضمن بنية مشفر-مفكك على شكل حرف U لتحسين تكامل الميزات أثناء التقسيم. يتم عرض البروتوكول باستخدام مجموعات بيانات الآفات الجلدية وتقسيم الأعضاء البطنية المتاحة للجمهور. وفقا لسير العمل المذكور في التنفيذ، يحقق الإطار أداء تنافسي في التقسيم باستخدام مقاييس التقييم القياسية. باتباع الإجراءات المقدمة في هذا البروتوكول، يمكن للباحثين إعادة إنتاج تنفيذ النموذج، وتدريب الشبكة باستخدام إعدادات تجريبية محددة، وتقييم أداء التقسيم، وتكييف سير العمل لمهام تقسيم الصور الطبية ذات الصلة التي تتطلب تحليلا قائما على التعلم العميق القابل للتكرار.
تقسيم الصور الطبية هو مهمة أساسية في مجالات رؤية الحاسوب وتحليل الصور الطبية 1,2,3. يتضمن تقسيم الصورة إلى مناطق أو كائنات متعددة لمزيد من التحليل والمعالجة. تكتسب هذه التقنية أهمية خاصة في التصوير الطبي لأنها تساعد الأطباء في تحديد وتحديد المناطق المرضية، مما يحسن دقة التشخيص وتخطيط العلاج. مع تقدم تقنيات التصوير الطبي، مثل التصوير بالرنين المغناطيسي (MRI)، والتصوير المقطعي المحوسب (CT)، والتصوير المقطعي بانبعاث البوزيترون (PET)، استمر الطلب على تقنيات تقسيم الصور الطبية الدقيقة في الازدياد. يمكن تصنيف الطرق الحالية لتقسيم الصور الطبية بشكل عام إلى ثلاثة طرق رئيسية: الطرق المعتمدة على الشبكة العصبية الالفافية (CNN)4، الطرق المعتمدة على المحولات5، والطرق القائمة على نموذج فضاء الحالة (SSM)6،7. عادة ما تستخدم الطرق المعتمدة على CNN هياكل شبكات على شكل حرف U لتقسيم الصور الطبية. أكثر المعمارية استخداما في هذه الفئة هي U-Net8، التي أظهرت فعالية بنية مشفر-فك التشفير على شكل U لتقسيم الصور الطبية الحيوية. يجمع U-Net3+ بين اتصالات التخطي الكثيفة من UNet++9 مع اتصالات تخطي كاملة الحجم لتعزيز تجميع الميزات متعدد المقاييس. ومع ذلك، فإن الطرق المعتمدة على CNN لديها قدرة محدودة على التقاط التبعيات طويلة المدى، وبالتالي قد لا تنمذج معلومات سياقة بعيدة المدى بفعالية.
تلتقط الطرق المعتمدة على المحولات الاعتماديات طويلة المدى بشكل فعال من خلال آلية الانتباه الذاتي، التي تمكن من الحساب المتوازي وتمنح أوزان انتباه مختلفة لمناطق اهتمام مختلفة. يقدم UNETR++10 وحدة الانتباه المزدوج الفعال (EPA) لتقليل عدد المعلمات والتكلفة الحاسوبية. يجمع nnFormer11 بين العمليات الالفافية المتداخلة وعمليات الانتباه الذاتي ويقدم آلية تركيز ذاتي قائم على الحجم المحلي والعالمي لتعلم التمثيلات الحجمية في تقسيم الصور الطبية ثلاثية الأبعاد (ثلاثية الأبعاد). يقترح H2Former12 محول رؤية هجين هرمي فعال يجمع بين آليات الانتباه واستخراج الميزات المعتمد على CNN في المشفر. ومع ذلك، تظهر الطرق المعتمدة على المحولات تعقيد حسابي تربيعي مع زيادة طول التسلسل، مما يؤدي إلى تكلفة حسابية أعلى بكثير. يوضح الشكل 1 الدافع وراء MVM-UNet ويقارن بين استراتيجية المسح متعدد الرؤى المقترحة مع أطر التقسيم القائمة على SSM.

الشكل 1. مقارنة بين MVM-UNet وبنيات تقسيم القائمة القائمة على نموذج الفضاء النقي (SSM). مقارنة بين إطار التقسيم التقليدي القائم على نموذج الحالة النقي (SSM) وبنية شبكة مامبا متعددة الرؤية المقترحة (MVM-UNet). توضح اللوحة العلوية MVM-UNet، حيث تستخرج وحدة الرؤية متعددة الأبعاد (MV4D) ميزات مكملة باستخدام أزواج المسح المتعرج، الهرمي، الحلزونية، والشعاعية التي يتم دمجها بواسطة مامبا الاندماج المكاني (SFusion Mamba)، بينما يقوم مامبا الاندماج متعدد المراحل (MFusion Mamba) بتجميع ميزات الترميز متعدد المقاييس قبل فك الترميز. تظهر اللوحة السفلية بنية تمثيلية نقية قائمة على SSM باستخدام وحدات المسح الانتقائي ثنائي الأبعاد (SS2D) مع المسح المتبادل. يبرز الشكل الفروقات المعمارية بين شبكات التقسيم التقليدية المعتمدة على SSM وشبكة MVM-UNet المقترحة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
تجمع الطرق المعتمدة على SSM بين قدرة النمذجة العالمية للترانسفورمرز والتعقيد الحسابي الخطي. تعالج معمارية مامبا معلومات الإدخال بشكل انتقائي باستخدام نموذج فضاء الحالة الانتقائي (Selective-SSM)، مما يمكن النموذج من تعديل معلماته ديناميكيا وفقا للمدخلات مع تصفية المعلومات غير ذات الصلة والتركيز على الميزات المعلوماتية. تتكيف Vim13 وVMamba14 مع بنية مامبا لمهام رؤية الحاسوب. يستخدم يو-مامبا15 بنية هجينة بين CNN–SSM لاستكشاف تطبيق SSMs في تقسيم الصور الطبية، بينما يعتمد مامبا-UNet16 بنية مشفر-فك تشفير تعتمد بالكامل على SSM لتقسيم الصور الطبية. تحقق هذه الطرق أداء تنافسيا مع استخدام معايير أقل بكثير. ومع ذلك، فإن الطرق الحالية القائمة على SSM/Mamba تستخرج بشكل أساسي ميزات الصورة باستخدام رقع صورة بسيطة واستراتيجيات مسح SS2D، مما يفرض عدة قيود على تقسيم الصور الطبية. أولا، تقنيات SS2D والتقنيات المعتمدة على الرقعة مصممة بشكل أساسي لمهام رؤية الحاسوب العامة. اقترحت تطبيقات Local Mamba17 وMotion Mamba18 أن استراتيجية المسح SS2D غير كافية لجميع المهام البصرية لأن استراتيجيات المسح المختلفة تلتقط أنواعا مختلفة من المعلومات البصرية. ثانيا، استراتيجية المسح بنظام SS2D بسيطة نسبيا، وتعتمد فقط على اتجاهات المسح الأفقي والعمودي. وبالتالي، قد لا يلتقط بشكل كاف العلاقات المكانية المعقدة والتفاصيل الهيكلية الدقيقة. يتطلب تقسيم الصور الطبية نمذجة متزامنة لكل من السياق المكاني العالمي والخصائص التشريحية المحلية الدقيقة. علاوة على ذلك، توفر الطرق الحالية القائمة على SSM/Mamba اندماجا محدودا للميزات بين المشفر ومفك الترميز. تعمل البنى مثل UNet++ وFATNet على تحسين دقة التقسيم من خلال دمج الميزات، مما يبرز أهمية التكامل الفعال للميزات في تقسيم الصور الطبية.
لمعالجة هذه القيود، تقترح هذه الورقة إطار عمل جديد لتقسيم الصور الطبية يعتمد على مامبا، يسمى MVM-UNet. كما هو موضح في الشكل 1، تعد وحدة العرض المتعددة متعددة الاتجاهات المقترحة (MV4D) المكون الأساسي لاستخراج الميزات في MVM-UNet، وهي مصممة خصيصا لتقسيم الصور الطبية من خلال دمج المعلومات من أربع استراتيجيات مسح مميزة. كل استراتيجية مسح تستخرج ميزات صورة مكملة وتمثل رؤية مختلفة للصورة المدخلة. يقوم المسح المتعرجرقم 19 بالتناوب بين اتجاه العبور في نهاية كل صف أو عمود، مما يوازن بين المعلومات المكانية المحلية والعالمية. على النقيض من ذلك، توفر مخططات المسح الحلزونيوالشعاعي 20 تغطية شاملة من خلال الامتداد إما للخارج من المركز أو إلى الداخل من المحيط. يلتقط المسح الهرمي18 ميزات محلية وعالمية على مقاييس متعددة. لتحسين متانة كل استراتيجية مسح، يتم دمج أزواج المسح قبل إدخالها في كتلة S6. تقوم وحدة Scan-view Fusion Mamba (SFusion Mamba) بدمج الميزات المستخرجة من أنماط المسح الأربعة. للاستفادة الفعالة من ميزات الترميز متعدد المقاييس، تقترح هذه الورقة أيضا وحدة دمج مامبا متعددة المقاييس (MFusion Mamba)، التي تجمع وتدمج مخرجات كل مرحلة من مراحل المشفر قبل تمرير الميزات المدمجة إلى جهاز فك الترميز. تم تقييم MVM-UNet في مجموعات بيانات ISIC 2017، ISIC 2018، ومجموعات بيانات Synapse. تظهر النتائج التجريبية أن MVM-UNet يحقق أداء تنافسي في تقسيم البيانات في مجموعات بيانات ISIC 2017 وISIC 2018 وSynapse.
وقد طورت هياكل التقسيم التمثيلي تقسيم الصور الطبية بشكل أكبر. كما تم تطبيق U-Net بنجاح في مهام تحليل الصور الطبية الحيوية مثل عد الخلايا، والكشف، والقياس الشكلي21. تعمل هياكل CNN المحسنة بالانتباه، مثل CA-Net22، على تحسين تمثيل الميزات من خلال آليات انتباه شاملة. تظهر أطر التقسيم المعتمدة على المحول التمثيلي، بما في ذلك TransUNet23، Pyramid Medical Transformer24، Swin U-Net25، TransAttUNet26، وTransCUNet27، فعالية نمذجة الميزات العالمية القائمة على الانتباه في تقسيم الصور الطبية.
تصميم MVM-UNet مدفوع بقيدين لطرق التقسيم القائمة على SSM/Mamba الحالية. أولا، تعتمد العديد من نماذج فيجن مامبا الحالية على استراتيجيات مسح ثنائية الأبعاد بسيطة، والتي قد لا تكون كافية للصور الطبية التي تحتوي على حدود غير منتظمة للآفات، ومناطق هدف صغيرة، وهياكل تشريحية متعددة المقاييس. ثانيا، تنقل بنى المشفر-فك التشفير التقليدية على شكل حرف U الميزات بشكل أساسي عبر اتصالات تخطي مقابلة، مما يحد من الاستخدام المباشر لمعلومات الترميز متعدد المراحل أثناء فك الترميز. لذلك، تقدم MVM-UNet MV4D لتعزيز النمذجة المكانية متعددة الرؤية، وMFusion Mamba لتجميع ميزات الترميز متعدد المراحل بشكل صريح. يهدف هذا التصميم إلى تكييف النمذجة طويلة المدى المعتمدة على مامبا لتلبية المتطلبات الخاصة لتقسيم الصور الطبية.
على الرغم من أن MVM-UNet مبني على نموذج المشفر-مفكك العام ونمذجة التسلسل المعتمدة على مامبا، إلا أن جداته تكمن في كيفية تكييف هذه المكونات ودمجها لتقسيم الصور الطبية. بدلا من دمج كتلة مامبا القياسية في شبكة على شكل حرف U، يعيد الإطار المقترح تصميم عملية النمذجة المكانية من خلال فروع متعددة موجهة نحو أزواج المسح الموجهة، ويقدم SFusion Mamba لدمج التمثيلات الخاصة بالمسح، ويعزز كتلة MVV بمسارات متبقية وإسقاط، ويدرج MFusion Mamba بين المشفر والمفكك لتجميع ميزات الترميز متعدد المراحل قبل فك الترميز. يهدف هذا التصميم على مستوى الهيكل إلى معالجة الحدود غير المنتظمة، والمناطق المستهدفة الصغيرة، والهياكل التشريحية متعددة المقاييس التي تلاحظ عادة في الصور الطبية.
هذا البروتوكول مناسب جدا لمهام التقسيم التي تتطلب نمذجة متزامنة للمعلومات السياقية بعيدة المدى، وحدود الأجسام غير المنتظمة، والهياكل التشريحية متعددة المقاييس في الصور الطبية ثنائية الأبعاد. مقارنة بطرق التقسيم المعتمدة على CNN، يوفر تصميم المشفر-فك التشفير القائم على مامبا آلية فعالة لنمذجة السياق مع الحفاظ على سير عمل على شكل حرف U مألوف لباحثي تقسيم الصور الطبية. مقارنة بطرق الترانسفورمر، يتجنب الإطار المقترح الاستخدام المباشر للانتباه الذاتي التربيعي ويهدف إلى الباحثين الباحثين الباحثين عن نمذجة سياقية عالمية باستخدام آلية نمذجة تسلسلية فعالة نسبيا. وبناء عليه، فإن هذا البروتوكول مناسب لتقسيم آفات الجلد، وتقسيم الأعضاء البطنية، ومهام تقسيم الصور الطبية ثنائية الأبعاد المشابهة التي تكون فيها المعلومات الهيكلية العالمية وتفاصيل الحدود المحلية مهمة.
هذا البروتوكول له قيود يجب أخذها في الاعتبار قبل الاستخدام. قد لا يكون ذلك ضروريا لمهام تقسيم بسيطة نسبيا حيث يوفر CNN خفيف الوزن أداء كافيا بالفعل. بالإضافة إلى ذلك، فهي ليست مصممة مباشرة للتقسيم الحجمي ثلاثي الأبعاد الكامل دون تكييف معماري. يجب على الباحثين الذين لديهم بيانات مشروحة محدودة جدا، أو موارد وحدات معالجة الرسومات (GPU) محدودة، أو متطلبات نماذج كلاسيكية قابلة للتفسير عاليا، أن يأخذوا هذه القيود في الاعتبار قبل تطبيق البروتوكول. بشكل عام، تهدف هذه الطريقة إلى الباحثين الذين يسعون لإعادة إنتاج وتقييم إطار تقسيم على شكل حرف U قائم على مامبا يوازن بين النمذجة السياقية طويلة المدى، وتمثيل الحدود المحلية، ودمج الميزات متعددة المراحل.
المساهمات الرئيسية هي كما يلي:
1. تقدم هذه الورقة إطار عمل جديد لتقسيم الصور الطبية القائمة على مامبا، يسمى MVM-UNet. على عكس الأساليب التي تدمج مباشرة كتل مامبا القائمة القائمة على SS2D أو القياسية، يقدم MVM-UNet ميزات MV4D لنماذج الصور الطبية من أربع عروض زوج مسح مكملة، بما في ذلك المسح المتعرج، والهرمي، واللولبي، والشعاعي.
2. تصميم هذه الورقة SFusion Mamba وكتلة MVV لدمج التمثيلات الخاصة بالمسح وتعزيز تحويل الميزات. تدمج SFusion Mamba الميزات المستخرجة من فروع أزواج المسح المختلفة، بينما توفر فروع الإسقاط المتبقية وUp-Down ضمن كتلة MVV مسارات ميزات مكملة تستقر وتثري تمثيلات الميزات.
3. تقدم هذه الورقة MFusion Mamba كوحدة اندماج متعددة المراحل وسيطة بين المشفر والمفكك. على عكس اتصالات التخطي التقليدية التي تنقل بشكل أساسي ميزات المراحل المقابلة للترميز، يقوم MFusion Mamba بتجميع ميزات الترميز متعدد المراحل بشكل صريح من خلال دمج خشن إلى دقيق ويوفر معلومات غنية لفك الترميز.
4. تظهر النتائج التجريبية الواسعة أن MVM-UNet المقترح يحقق أداء تنافسية في تقسيم البيانات في مجموعتي بيانات ISIC 2017 وISIC 2018 وأداء قويا في مجموعة بيانات تقسيم أعضاء Synapse المتعددة. علاوة على ذلك، تثبت الدراسات الشاملة للاستئصال مساهمة كل مكون ضمن MVM-UNet.
استخدمت هذه الدراسة فقط مجموعات بيانات الصور الطبية المتاحة للجمهور وغير المحددة الهوية، بما في ذلك ISIC 2017، ISIC 2018، وSynapse. لم يتم جمع أي مشاركين بشريين جدد، أو مواضيع حيوانات، أو سجلات طبية خاصة يمكن التعرف عليها في هذه الدراسة. كانت مجموعة بيانات ISIC 2017 المستخدمة في هذه الدراسة هي مجموعة بيانات تقسيم آفات الجلد لتحدي ISIC 2017، والتي تم الحصول عليها من مستودع بيانات تحدي التعاون الدولي لتصوير الجلد (https://challenge.isic-archive.com/data/#2017). النسخة المستخدمة في هذه الدراسة تتوافق مع مهمة تقسيم الآفة في ISIC 2017، بما في ذلك الأقسام الرسمية للتدريب، والتحقق، والاختبار. تم تحميل مجموعة البيانات في 15 مارس 2024. مجموعة بيانات ISIC 2018 المستخدمة في هذه الدراسة كانت مجموعة بيانات تقسيم حدود الآفة لمهمة التحدي 1 لمهمة ISIC 2018، والتي تم الحصول عليها من مستودع بيانات تحدي التعاون الدولي لتصوير الجلد (https://challenge.isic-archive.com/data/#2018). نسخة مجموعة البيانات المستخدمة في هذه الدراسة تتوافق مع مهمة ISIC 2018 1: تقسيم حدود الآفات. تم تحميل مجموعة البيانات في 8 يوليو 2024.
كانت مجموعة بيانات المشابك العصبية المستخدمة في هذه الدراسة هي مجموعة بيانات التصوير المقطعي المقطعي البطني متعدد الأطلس بخلاف القبو الجمجمي، والتي تم الحصول عليها من مستودع السينابس تحت معرف الإدخال syn3193805 (https://www.synapse.org/Synapse:syn3193805). تتوافق مجموعة البيانات المستخدمة في هذه الدراسة مع مجموعة بيانات تقسيم الأعضاء متعددة الأعضاء المقطعية المقطعية البطنية ذات 30 حالة شائعة. الأرشيف الذي تم تنزيله كان Abdomen/RawData.zip، متوفر تحت نظام accession syn3193805. لم يتم توفير رقم إصدار منفصل أو تسمية إصدار أو علامة إصدار مؤرخة من قبل المستودع وقت التنزيل. وفقا للتقسيم القياسي المعتمد في الدراسات السابقة، تم استخدام 18 حالة للتدريب و12 حالة للاختبار. تبع تقسيم البيانات قائمة الحالات المستخدمة في TransUNet23. تحديدا، كانت حالات التدريب هي case0031، case0007، case0009، case0005، case0026، case0039، case0024، case0034، case0033، case0030، case0023، case0040، case0010، case0021، case0006، case0027، case0028، و case0037، بينما كانت حالات الاختبار هي case0008، case0022، case0038، case0036، case0032، case0002، case0029، case0003، case0001، case0004، case0025، و case0035. تم تحميل مجموعة البيانات في 9 يوليو 2024. نظرا لأن هذه الدراسة استخدمت مجموعات بيانات متاحة للجمهور فقط ولم تتضمن جمع بيانات جديدة من البشر أو معلومات خاصة قابلة للتعريف، لم تكن هناك حاجة لموافقة لجنة المراجعة المؤسسية للتجارب الحسابية الموصوفة في هذا البروتوكول. لم يتم الحصول على قرار رسمي مكتوب للإعفاء المؤسسي. إذا تطلب ذلك السياسة المؤسسية المحلية، يجب على الباحثين الحصول على تحديد إعفاء مؤسسي قبل إجراء تحليلات ثانوية لمجموعات البيانات المتاحة للجمهور. لم يكن هناك رقم مرجعي للاستثناء الأخلاقي المؤسسي أو وثائق رسمية للاستثناء لهذه الدراسة.
1. إعداد مجموعات البيانات
(1)2. بناء عمارة MVM-UNet
Here, C = 96.
التنبؤ ∈ RB×H×W×K. هنا، K = 1 لتقسيم الآفات الثنائية وK = 8 لتقسيم الأعضاء المتعددة للمشابك العصبية.
الشكل 2. البنية العامة لشبكة مامبا متعددة الرؤية (MVM-UNet). نظرة عامة على بنية شبكة مامبا U-Net متعددة الرؤية المقترحة (MVM-UNet). يتم تحويل صورة الإدخال إلى تجمعات الpatch ومعالجتها عبر أربع مراحل ترميز مكونة من كتل Multi-View Vision (MVV) مفصولة بواسطة عمليات دمج الرقعة. يتم تجميع ميزات المشفر بواسطة مامبا الاندماج متعدد المراحل (MFusion Mamba) وتنتقل إلى جهاز فك التشفير عبر اتصالات تخطي. يقوم جهاز فك الترميز باستعادة الدقة المكانية تدريجيا باستخدام عمليات توسيع الرقعة ويولد خريطة التقسيم النهائية عبر طبقة الإسقاط. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
3. بناء وحدة MV4D

الشكل 3. بنية وحدة العرض متعدد الاتجاهات (MV4D). هيكل وحدة استخراج الميزات متعددة الرؤية رباعية الاتجاه (MV4D). تتم معالجة رقع الإدخال من خلال أربعة فروع مكملة من أزواج المسح، بما في ذلك المسح المتعرج، الهرمي، الحلزوني، والشعاعي. يتم دمج الميزات المستخرجة من الفروع الأربعة، ومعالجتها باستخدام كتل فضاء الحالة، ودمجها بواسطة Spatial Fusion Mamba (SFusion Mamba) لتوليد تمثيل ميزات الإخراج. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
4. بناء مبنى MVV

الشكل 4. هيكلية كتلة الرؤية متعددة الرؤى (MVV). هيكل كتلة الرؤية متعددة الرؤى (MVV). تتكون الكتلة من فرع رئيسي لاستخراج الميزات يحتوي على وحدة متعددة الرؤية رباعية الاتجاهات (MV4D) إلى جانب طبقات الالتفاف العميق، والتطبيع، والإسقاط الخطي. يوفر فرع إسقاط مساعد للأعلى إلى الأسفل تعديل الميزات المبوابة من خلال الضرب عنصريا قبل الجمع المتبقي لتوليد تمثيل الميزة المخرجة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
5. بناء MFusion Mamba

الشكل 5. بنية وحدة مامبا الاندماج متعددة المراحل (MFusion Mamba). هيكل وحدة مامبا الاندماج متعددة المراحل (MFusion Mamba). يتم دمج ميزات المشفر متعددة المقاييس أولا عن طريق الاندماج الخشن ثم يتم تحسينها من خلال وحدة الاندماج الدقيق التي تتكون من إسقاط خطي، والالتفاف أحادي البعد (Conv1d)، وكتلة مامبا، وطبقات إسقاط الميزات قبل توليد تمثيل الميزات المندمجة المستخدم في جهاز فك الترميز. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
6. تدريب النماذج
7. تقييم النموذج
(2)
(3)
(4)
(5)
(6)8. تعريف دالة الخسارة
(7)
(8)
(9)
(10)
(11)
يكون 1 = 1.0 و
2 = 1.0. اضبط أوزان فقدان CE وDice إلى 1.0 لSynapse، بحيث φ1 = 1.0 that و φ2 = 1.0.9. إعدادات قابلية التكرار والتنفيذ
النتائج المتوقعة والتفسير
عندما يتم تنفيذ هذا البروتوكول بشكل صحيح، من المتوقع أن ينتج نموذج MVM-UNet المدرب أداء تقسيم مستقر عبر عمليات متكررة، مع اختلافات بسيطة فقط بين البذور العشوائية المختلفة لمعظم مقاييس التقييم. بالنسبة لمعايير ISIC 2017 وISIC 2018، تنعكس النتائج الناجحة في قيم DSC وmIoU وAcc وSen وSpe مرتفعة، إلى جانب أقنعة آفات متوقعة تتبع عن كثب حدود الآفات الأرضية والحقيقة (الأشكال 6 و7). بالنسبة للسينابس، تنعكس النتائج الناجحة في متوسط قيم DSC عالية وقيم HD95 منخفضة عبر الأعضاء الأمامية (الشكل 8). أثناء تنفيذ البروتوكول، يجب تفسير المقاييس الكمية مع نتائج التقسيم النوعي المقابلة. يجب اعتبار النموذج الذي يحقق DSC عالي لكنه يظهر تسرب حدودي، أو إهمال هياكل صغيرة، أو توقعات مجزأة ناجحا جزئيا فقط، ويجب التحقق من إجراءات المعالجة المسبقة، واختيار نقاط التحقق، وإعدادات الاستدلال.

الشكل 6. نتائج التقسيم النوعي الممثلة على مجموعة بيانات ISIC 2017. نتائج التقسيم النوعي الممثلة التي تم الحصول عليها في مجموعة بيانات تقسيم آفات الجلد للتعاون الدولي لتصوير الجلد (ISIC) لعام 2017. كل مثال يظهر الصورة الجلدية الأصلية (Image)، وقناع تقسيم الحقيقة الأرضية (GT)، والتنبؤ الذي تولده MVM-UNet (Pred). تظهر حالات الاختبار التمثيلية أداء التقسيم للآفات ذات الحجم والشكل والتعقيد الحدودي المختلفة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 7. نتائج التقسيم النوعي الممثل على مجموعة بيانات ISIC 2018. نتائج التقسيم النوعي الممثلة التي تم الحصول عليها في مجموعة بيانات تقسيم آفات الجلد للتعاون الدولي لتصوير الجلد (ISIC) لعام 2018. كل مثال يظهر الصورة الجلدية الأصلية (Image)، وقناع تقسيم الحقيقة الأرضية (GT)، والتنبؤ الذي تولده MVM-UNet (Pred). تظهر حالات الاختبار التمثيلية أداء التقسيم عبر مظاهر الآفات المختلفة وخصائص الحدود. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 8. نتائج التقسيم النوعي التمثيلي على مجموعة بيانات التصوير المقطعي المحوسب متعدد الأعضاء في Synapse. نتائج تمثيلية نوعية لتقسيم الأعضاء المتعددة تم الحصول عليها على مجموعة بيانات الأطلس المتعدد للمشابك العصبية خارج مجموعة بيانات القبو الجمجمي. كل مثال يظهر صورة التصوير المقطعي المحوسبة الأصلية (Image)، وتعليقات الأعضاء الأرضية المقابلة (GT)، والتنبؤ الذي يولده MVM-UNet (Pred). توضح أمثلة تمثيلية الاتفاق بين التقسيم المتوقع والتقسيم المرجعي عبر عدة أعضاء بطنية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
الأداء في ISIC 2017
لتقييم قابلية تكرار MVM-UNet، تم تكرار جميع تجارب المقارنة الرئيسية باستخدام ثلاث بذور عشوائية مستقلة (1، 52، و100)، وتم الإبلاغ عن النتائج كمتوسط ± SD. تم تقييم الدلالة الإحصائية باستخدام اختبار ويلكوكسون للرتبة الموقعة بناء على نتائج مزدوجة لكل صورة لاختباري ISIC 2017 وISIC 2018 ونتائج الاقتران لكل حالة ل Synapse. تم إجراء التحليل الإحصائي باستخدام قيم مقياس مزدوجة بدلا من المتوسطات على مستوى البذرة. للمقارنة العادلة، تم إعادة إنتاج النتائج المبلغ عنها كمتوسط ± SD باستخدام التطبيقات الرسمية تحت نفس تقسيمات مجموعة البيانات، ودقة المدخلات، ومقاييس التقييم كلما أمكن، بينما تم الاحتفاظ بنتائج القيمة المفردة من المنشورات الأصلية المقابلة.
تم تقييم MVM-UNet على مجموعة بيانات تقسيم آفات الجلد ISIC لعام 2017 ومقارنتها مع طرق التقسيم التمثيلية، بما في ذلك UNet 8,21، TransUNet23، H-vmunet28، MISSFormer30، MaLUNet31، VM-UNet32، UNeXt-S33، HResFormer34، MedScale-Former35، MCAFT36، و H2Former12 (الجدول 1). حقق MVM-UNet نسبة mIoU بلغت 80.94 ± 1.01٪، وDSC بنسبة 91.32٪ ± 0.68٪، ودقة 96.58٪ ± 0.27٪، ونوعية 98.31٪ ± 0.23٪، وحساسية 91.65٪ ± 0.77٪ عبر ثلاث جولات مستقلة. مقارنة بالطرق التي تم تقييمها، حقق MVM-UNet أعلى مستويات mIoU، وDSC، وأعلى حساسية. تظهر نتائج التقسيم النوعي الممثلة في الشكل 6، حيث تتبع الأقنعة المتوقعة عن كثب حدود آفة الحقيقة الأرضية عبر صور الاختبار التمثيلية.
| النموذج | المرجع. | mIoU (٪) | DSC (٪) | الحسابات (٪) | Spe (٪) | سين (٪) |
| UNet | 8 | 76.98 | 86.99 | 95.65 | 97.43 | 86.82 |
| ترانس يونيت | 23 | 75.32 | 81.23 | 91.45 | 95.77 | 82.63 |
| مالونيت | 31 | 78.78 | 88.13 | 96.18 | 98.47 | 84.78 |
| VM-UNet | 32 | 80.23 | 89.03 | 96.29 | 97.58 | 89.90 |
| UNeXt-S | 33 | 78.26 | 87.80 | 95.95 | 97.74 | 87.04 |
| HResFormer | 34 | 79.89 ± 1.05 | 88.82 ± 0.65 | 96.25 ± 0.24 | 97.73 ± 0.22 | 87.72 ± 0.79 |
| H-vmunet | 28 | 80.34 ± 1.02 | 90.68 ± 0.55 | 96.42 ± 0.18 | 98.23 ± 0.32 | 88.97 ± 0.88 |
| ميسفورمر | 30 | 80.16 ± 0.78 | 89.27 ± 0.61 | 94.36 ± 0.28 | 97.52 ± 0.38 | 87.71 ± 0.69 |
| H2Former | 12 | 80.35 ± 0.95 | 88.56 ± 0.72 | 96.61 ± 0.19 | 98.15 ± 0.14 | 88.21 ± 0.81 |
| ميدسكيل-فورمر | 35 | 80.31 ± 0.82 | 89.11 ± 0.59 | 95.68 ± 0.33 | 98.24 ± 0.21 | 89.96 ± 0.92 |
| MCAFT | 36 | 80.59 ± 0.93 | 89.27 ± 0.63 | 96.42 ± 0.20 | 97.95 ± 0.17 | 90.05 ± 0.84 |
| MVM-UNet (لنا) | — | 80.94 ± 1.01 | 91.32 ± 0.68 | 96.58 ± 0.27 | 98.31 ± 0.23 | 91.65 ± 0.77 |
الجدول 1: مقارنة الأداء على مجموعة بيانات تقسيم آفات الجلد لنظام ISIC لعام 2017. مقارنة MVM-UNet مع طرق التقسيم المعتمدة على الشبكة العصبية الالفافية التمثيلية (CNN)، والمحول، ونموذج الحالة والفضاء (SSM) باستخدام متوسط التقاطع عبر الاتحاد (mIoU)، معامل تشابه النرد (DSC)، الدقة (Acc.)، الخصوصية (النوعية)، والحساسية (الديمقراطية). تم الإبلاغ عن نتائج MVM-UNet كمتوسط ± انحراف معياري من ثلاث تجارب عشوائية مستقلة. تم إعادة إنتاج النتائج المبلغ عنها كقيم فردية من المنشورات الأصلية المقابلة.
تظهر الأمثلة النوعية أيضا أن MVM-UNet قسم بدقة كلا من الآفات الصغيرة والأكبر ذات حدود غير منتظمة. في هذه الأمثلة الممثلة، كانت الأقنعة المتوقعة متطابقة بشكل وثيق مع تعليقات الحقيقة الأرضية المقابلة وحافظت على حدود الآفات مع أقل قدر من التسرب أو التجزئة.
ولتقييم ما إذا كانت التحسينات الملحوظة ذات دلالة إحصائية بشكل أعمق، أجريت اختبارات ويلكوكسون ذات الإشارة باستخدام نتائج تقسيم مزدوجة لكل صورة. بالنسبة لمقياس mIoU، أظهر MVM-UNet تحسنا ذا دلالة إحصائية مقارنة ب MCAFT، بقيمة p بلغت 0.0114. بالنسبة لمقياس DSC، تفوق MVM-UNet بشكل ملحوظ على H-vmunet، بقيمة p 0.0031. تدعم هذه النتائج أن التحسينات الملحوظة في ISIC 2017 من غير المرجح أن تعزى إلى التغيرات العشوائية.
بشكل عام، حقق MVM-UNet أعلى أداء بين الطرق المقارنة لل mIoU وDSC والحساسية في مجموعة بيانات ISIC 2017 (الجدول 1). أمثلة التقسيم النوعي المعروضة في الشكل 6 تتوافق مع هذه النتائج الكمية.
الأداء في ISIC 2018
تم تقييم MVM-UNet بشكل إضافي على مجموعة بيانات تقسيم آفات الجلد ISIC لعام 2018 ومقارنتها مع طرق تقسيم تمثيلية، بما في ذلك UNet 8,21، UNet++9، UTNetV237، SANet38، MaLUNet31، VM-UNet32، H-vmunet28، MISSFormer30، H2Former12، HResFormer34، MedScale-Former35، وMCAFT36 (الجدول 2). حقق MVM-UNet نسبة mIoU بنسبة 82.47٪ ± 1.28٪، وDSC بنسبة 90.65٪ ± 0.94٪، ودقة 96.02٪ ± 0.36٪، وخصوصية 97.06٪ ± 0.31٪، وحساسية 91.80٪ ± 0.82٪ عبر ثلاث جولات مستقلة. تظهر هذه النتائج أن أداء MVM-UNet ظل ثابتا عبر بذور عشوائية مختلفة. تظهر نتائج التقسيم النوعي التمثيلي في الشكل 7.
| النموذج | المرجع. | mIoU (٪) | DSC (٪) | الحسابات (٪) | Spe (٪) | سين (٪) |
| UNet | 8 | 77.86 | 87.55 | 94.05 | 96.69 | 85.86 |
| UNet++ | 9 | 78.31 | 87.83 | 94.02 | 95.75 | 88.65 |
| UTNetV2 | 37 | 78.97 | 88.25 | 94.32 | 96.48 | 87.60 |
| سانيت | 38 | 79.52 | 88.59 | 94.39 | 95.97 | 89.46 |
| مالونيت | 31 | 80.25 | 89.04 | 94.62 | 96.19 | 89.74 |
| VM-UNet | 32 | 81.35 | 89.71 | 94.91 | 96.13 | 91.12 |
| H-vmunet | 28 | 81.93 ± 1.45 | 90.46 ± 0.62 | 95.19 ± 0.30 | 96.82 ± 0.21 | 88.37 ± 1.13 |
| ميسفورمر | 30 | 80.27 ± 1.21 | 89.91 ± 0.46 | 94.76 ± 0.27 | 97.22 ± 0.15 | 90.84 ± 1.07 |
| H2Former | 12 | 80.40 ± 0.83 | 90.26 ± 0.73 | 94.89 ± 0.38 | 96.98 ± 0.25 | 91.57 ± 0.54 |
| HResFormer | 34 | 81.12 ± 1.18 | 88.86 ± 0.84 | 94.96 ± 0.33 | 96.43 ± 0.22 | 91.86 ± 1.01 |
| ميدسكيل-فورمر | 35 | 80.97 ± 0.74 | 90.47 ± 0.68 | 95.02 ± 0.41 | 95.89 ± 0.26 | 90.65 ± 0.92 |
| MCAFT | 36 | 81.46 ± 1.03 | 89.06 ± 0.76 | 95.23 ± 0.29 | 96.72 ± 0.17 | 91.82 ± 0.57 |
| MVM-UNet (لنا) | — | 82.47 ± 1.28 | 90.65 ± 0.94 | 96.02 ± 0.36 | 97.06 ± 0.31 | 91.80 ± 0.82 |
الجدول 2: مقارنة الأداء على مجموعة بيانات تقسيم آفات الجلد لمعهد ISIC لعام 2018. مقارنة بين MVM-UNet مع طرق التقسيم التمثيلية القائمة على CNN، وTransformer، وSSM باستخدام متوسط التقاطع عبر الاتحاد (mIoU)، معامل تشابه النرد (DSC)، الدقة (Acc.)، الخصوصية (Spe.)، والحساسية (Sen.). تم الإبلاغ عن نتائج MVM-UNet كمتوسط ± انحراف معياري من ثلاث تجارب عشوائية مستقلة. تم إعادة إنتاج النتائج المبلغ عنها كقيم فردية من المنشورات الأصلية المقابلة.
مقارنة ب H-vmunet، حسن MVM-UNet الوحدة المتوسطة بنسبة 0.54٪. مقارنة ب MedScale-Former، حسن MVM-UNet DSC بنسبة 0.18٪. حقق MVM-UNet أيضا أعلى دقة بين الطرق المقارنة. تظهر الأمثلة النوعية الممثلة المعروضة في الشكل 7 تقسيما دقيقا للآفات الجلدية الممثلة، بما في ذلك مناطق الآفات الصغيرة والآفات ذات الحدود غير المنتظمة.
بالنسبة لاختبار ISIC 2018، تم تقييم الدلالة الإحصائية باستخدام اختبار ويلكوكسون الموقع-الترتيب بناء على نتائج تقسيم الصور الزوجية. بالنسبة لمقياس mIoU، حقق MVM-UNet تحسنا ذا دلالة إحصائية مقارنة ب MCAFT، بقيمة p < 0.001. تدعم هذه النتائج أن التحسن الملحوظ في الأداء في ISIC 2018 كان من غير المرجح أن يكون بسبب التغير العشوائي.
بشكل عام، حقق MVM-UNet أعلى عدد من الوحدات الموسيقية (mIoU)، وDSC، والدقة بين الطرق المقارنة في مجموعة بيانات ISIC 2018 (الجدول 2). الأمثلة النوعية المعروضة في الشكل 7 تتوافق مع هذه التحسينات الكمية.
الأداء على سينابسي
تم تقييم الطريقة المقترحة أيضا على مجموعة بيانات تقسيم الأعضاء المتعددة للمشابك ومقارنتها مع الطرق التمثيلية، بما في ذلك UNet 8,21، Attention U-Net39، TransUNet23، TransNorm40، Swin U-Net25، TransDeepLab41، MEW-UNet42، MISSFormer30، H2Former12، HResFormer34، MedScale-Former35، وMCAFT36 (الجدول 3). شملت مجموعة بيانات المشابك ثمانية أعضاء بطنية: الشريان الأبهري، المرارة، الطحال، الكلية اليسرى، الكلية اليمنى، الكبد، البنكرياس، والمعدة. وفقا للبروتوكول التجريبي القياسي، تم استخدام 18 حالة (2,212 شريحة محورية) للتدريب و12 حالة (1,567 شريحة محورية) للاختبار. لم يتم إدخال مجموعة تحقق منفصلة. تم استخدام حالات الاختبار حصريا للتقييم النهائي ولم تستخدم لتدريب النماذج أو ضبط المعاملات الفائقة أو اختيار النماذج. تظهر نتائج التقسيم النوعي التمثيلي للأعضاء المتعددة في الشكل 8، ويتم تلخيص المقارنة الكمية في الجدول 3.
| النموذج | المرجع. | DSC | HD95 | Aor. | جال. | يا صغير. (L) | يا صغير. (R) | ليف. | بان. | العتلة. | ستو. |
| UNet | 8 | 76.85 | 39.78 | 89.07 | 69.72 | 77.77 | 68.69 | 93.43 | 54.01 | 86.66 | 75.59 |
| أت-UNet | 39 | 77.77 | 36.02 | 89.54 | 68.88 | 77.98 | 71.11 | 93.57 | 58.04 | 87.31 | 75.74 |
| ترانس يونيت | 23 | 77.48 | 31.69 | 87.23 | 63.13 | 81.87 | 77.02 | 94.08 | 55.84 | 85.06 | 75.62 |
| ترانس نورم | 40 | 78.4 | 30.25 | 86.23 | 65.18 | 82.18 | 78.63 | 94.22 | 55.32 | 89.53 | 76.02 |
| سوين يو-نت | 25 | 79.13 | 21.55 | 85.47 | 66.53 | 83.28 | 79.61 | 94.29 | 56.58 | 90.62 | 76.59 |
| ترانس ديب لاب | 41 | 80.16 | 21.25 | 86.04 | 69.16 | 84.08 | 79.88 | 93.53 | 61.15 | 89.01 | 78.36 |
| ميو-أونت | 42 | 78.92 | 21.68 | 86.68 | 65.32 | 82.87 | 80.02 | 93.63 | 58.38 | 90.16 | 74.27 |
| ميسفورمر | 30 | 80.92 ± 4.23 | 20.09 ± 1.89 | 86.43 ± 0.98 | 69.81 ± 4.56 | 84.29 ± 2.11 | 81.03 ± 3.34 | 93.85 ± 0.89 | 61.11 ± 4.67 | 90.05 ± 3.78 | 80.62 ± 1.02 |
| H2Former | 12 | 81.05 ± 2.56 | 20.13 ± 7.23 | 86.61 ± 3.21 | 69.32 ± 1.23 | 85.12 ± 4.78 | 82.01 ± 2.89 | 94.09 ± 2.45 | 61.16 ± 0.76 | 89.97 ± 4.12 | 80.94 ± 3.56 |
| HResFormer | 34 | 80.65 ± 4.02 | 17:48 ± 6.89 | 89.16 ± 2.78 | 66.94 ± 0.78 | 84.61 ± 4.34 | 82.15 ± 2.56 | 93.11 ± 1.34 | 59.92 ± 4.12 | 91.08 ± 3.45 | 80.75 ± 2.01 |
| ميدسكيل-فورمر | 35 | 80.78 ± 1.34 | 20.02 ± 3.78 | 88.79 ± 4.02 | 69.82 ± 2.56 | 85.13 ± 0.87 | 81.63 ± 4.78 | 94.10 ± 2.78 | 60.72 ± 1.89 | 90.14 ± 1.56 | 80.93 ± 4.56 |
| MCAFT | 36 | 81.03 ± 3.45 | 19.98 ± 5.12 | 89.76 ± 0.76 | 68.96 ± 3.89 | 84.54 ± 2.56 | 81.98 ± 3.12 | 94.32 ± 4.01 | 60.85 ± 3.67 | 89.06 ± 4.89 | 80.91 ± 1.78 |
| MVM-UNet (لنا) | — | 81.26 ± 1.89 | 18.72 ± 2.16 | 88.53 ± 3.22 | 69.84 ± 4.23 | 85.37 ± 2.69 | 82.67 ± 1.67 | 94.41 ± 3.56 | 61.02 ± 2.78 | 90.19 ± 0.67 | 81.48 ± 3.12 |
الجدول 3: مقارنة الأداء على مجموعة بيانات تقسيم الأعضاء المتعددة لنظام Synapse. مقارنة MVM-UNet مع طرق التقسيم التمثيلية القائمة على CNN، وTransformer، وSSM باستخدام معامل تشابه النرد (DSC)، ومسافة هوسدورف بنسبة 95٪ (HD95)، ودرجات النرد الخاصة بالأعضاء للأورط الأبهر (Aor.)، المرارة (Gal.)، والكلية اليسرى (Kid. (L))، الكلية اليمنى (طفل. (R))، الكبد (Liv.)، البنكرياس (البانوامي)، الطحال (النوعية الخاصة)، والمعدة (Sto.). تم الإبلاغ عن نتائج MVM-UNet كمتوسط ± انحراف معياري من ثلاث تجارب عشوائية مستقلة. تم إعادة إنتاج النتائج المبلغ عنها كقيم فردية من المنشورات الأصلية المقابلة.
حقق MVM-UNet متوسط DSC بنسبة 81.26٪ ± 1.89٪ ومتوسط HD95 يبلغ 18.72 ± 2.16 عبر ثلاث جولات مستقلة. تظهر النتائج أداء تقسيمات مستقرة على مجموعة بيانات Synapse. من بين الطرق المقيمة، حقق MVM-UNet أعلى متوسط DSC وثاني أدنى متوسط HD95.
بالنسبة لنظام Synapse، تم تقييم الدلالة الإحصائية باستخدام اختبار Wilcoxon الموقع-رتبة بناء على قيم DSC المزدوجة لكل حالة. أظهر MVM-UNet تحسنا ذا دلالة إحصائية مقارنة ب H2Former، بقيمة p بلغت 0.026، مما يشير إلى أن التحسن الملحوظ في أداء التقسيم كان ذا دلالة إحصائية.
النتائج الناجحة وغير المثالية الممثلة
تظهر النتائج النوعية الناجحة الممثلة في الأشكال 6–8. تتميز النتائج الناجحة بأقنعة تقسيم متوقعة تتوافق بشكل وثيق مع تعليقات الحقيقة الأرضية وتحدد بدقة حدود الآفة الأساسية أو الأعضاء. قد تحدث نتائج تمثيلية غير مثالية للأهداف الصغيرة جدا، أو الحدود منخفضة التباين، أو أشكال الآفات، أو الأعضاء ذات التباين الضعيف في الشدة، أو الحدود التشريحية الغامضة، وغالبا ما تظهر كأجزاء أقل من التقسيم، أو زيادة في التقسيم، أو تسرب حدودي، أو شظايا قناع متقطعة. عند ملاحظة مثل هذه النتائج، يجب على المستخدمين التحقق من أن تغيير حجم الصورة، والتطبيع، واستيفاء القناع، واختيار نقاط التحقق من النموذج، وتحديد عتبة الاستدلال (لمجموعات بيانات ISIC) أو التنبؤ ب argmax (لنظام Synapse)، وإجراءات حساب المقاييس متوافقة مع تلك الموصوفة في البروتوكول.
دراسة الاستئصال لوحدة MV4D
تم تقييم مساهمة وحدة MV4D بإضافة أزواج المسح المتعرج، الهرمي، الحلزوني، والشعاعي تدريجيا، تليها وحدة SFusion Mamba (الجدول 4؛ الشكل 9). عندما كان يستخدم فقط زوج المسح المتعرج، كان أداء التقسيم محدودا. إضافة زوج المسح الهرمي حسن الأداء بشكل كبير، مما يشير إلى فائدة دمج المعلومات متعددة المقاييس. الإضافة اللاحقة لأزواج المسح الحلزوني والشعاعي حسنت أداء التقسيم من خلال تعزيز تمثيل الحدود والملامح. أدى دمج وحدة SFusion Mamba إلى أعلى أداء بين التكوينات التي تم تقييمها.
| النموذج | زوج المسح المتعرج | زوج المسح الهرمي | زوج المسح الحلزوني | زوج المسح الشعاعي | SFusion Mamba | وحدة الاستخبارات الدولية للعلوم والاتصالات 2017 mIoU (٪) | ISIC 2017 DSC (٪) | وحدة بيانات ISIC 2018 mIoU (٪) | ISIC 2018 DSC (٪) |
| MVM-UNet | ✓ | 56.75 | 72.46 | 58.03 | 73.45 | ||||
| MVM-UNet | ✓ | ✓ | 72.38 | 84.01 | 73.45 | 84.7 | |||
| MVM-UNet | ✓ | ✓ | ✓ | 75.69 | 86.20 | 76.94 | 86.94 | ||
| MVM-UNet | ✓ | ✓ | ✓ | ✓ | 76.41 | 86.61 | 78.28 | 87.82 | |
| MVM-UNet | ✓ | ✓ | ✓ | ✓ | ✓ | 80.94 | 91.32 | 82.47 | 90.65 |
الجدول 4: دراسة الاستئصال لوحدة متعددة الرؤى رباعية الاتجاهات (MV4D). يتم الحصول على الأداء من خلال دمج أزواج المسح الهرمية، الحلزونية، والشعاعية تدريجيا، ووحدة الدمج المكاني (SFusion Mamba) في بنية أزواج المسح المتعرج الأساسية. يتم الإبلاغ عن الأداء باستخدام متوسط التقاطع مع الاتحاد (mIoU) ومعامل تشابه النرد (DSC) في مجموعات بيانات ISIC 2017 وISIC 2018.

الشكل 9. دراسة الاستئصال لوحدة متعددة الرؤى رباعية الاتجاهات (MV4D). (أ) تغير متوسط التقاطع عبر الاتحاد (mIoU) بعد دمج زوج المسح الهرمي، زوج المسح الحلزوني، زوج المسح الشعاعي، ومامبا الاندماج المكاني (SFusion Mamba) في البنية الأساسية. (ب) التغير في معامل تشابه النرد (DSC) بعد دمج زوج المسح الهرمي، زوج المسح الحلزوني، زوج المسح الشعاعي، ومامبا الاندماج المكاني (SFusion Mamba) في البنية الأساسية. (ج) التغير في mIoU بعد دمج زوج المسح الهرمي، زوج المسح الحلزوني، زوج المسح الشعاعي، ومامبا الاندماج المكاني (SFusion Mamba) في البنية الأساسية ضمن الإعداد التجريبي الثاني. (د) التغير في DSC بعد دمج زوج المسح الهرمي، زوج المسح الحلزوني، زوج المسح الشعاعي، ومامبا الاندماج المكاني (SFusion Mamba) في البنية الأساسية ضمن الإعداد التجريبي الثاني. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
في مجموعة بيانات ISIC 2017، حققت وحدة MV4D الكاملة mIoU بنسبة 80.94٪ وDSC بنسبة 91.32٪. تظهر اتجاهات الأداء المقابلة ل mIoU و DSC في الشكل 9A و الشكل 9B على التوالي. في مجموعة بيانات ISIC 2018، حققت وحدة MV4D الكاملة mIoU بنسبة 82.47٪ وDSC بنسبة 90.65٪. تظهر اتجاهات الأداء المقابلة في الشكل 9C والشكل 9D على التوالي.
ما لم يذكر خلاف ذلك، أجريت جميع تجارب الاستئصال باستخدام بذرة عشوائية ثابتة تبلغ 100، بينما تم الإبلاغ عن نتائج المقارنة الرئيسية كمتوسط ± SD على ثلاث بذور عشوائية مستقلة (1، 52، و100). وبالتالي، تهدف نتائج الاستئصال إلى مقارنة المساهمات النسبية للمكونات الفردية تحت إعداد متحكم فيه بذرة واحدة بدلا من إعادة إنتاج الأداء النهائي متعدد البذور الذي تم الإبلاغ عنه في تجارب المقارنة الرئيسية.
بشكل عام، أدى دمج أزواج المسح الإضافية ووحدة SFusion Mamba تدريجيا إلى تحسين أداء التقسيم باستمرار، حيث حقق تكوين MV4D الكامل أعلى أداء على كلا مجموعتي البيانات.
دراسة الاستئصال لكتلة الرؤية متعددة الرؤية (MVV)
تم تقييم كتلة MVV من خلال مقارنة بنية الأساس مع نسخة تتضمن فرع الإسقاط للأعلى والأسفل (الجدول 5). في مجموعة بيانات ISIC لعام 2017، أدى إدراج فرع الإسقاط للأعلى-الأسفل إلى زيادة mIoU من 78.83٪ إلى 80.96٪، وDSC من 88.15٪ إلى 91.02٪. في مجموعة بيانات ISIC لعام 2018، ارتفع mIoU من 80.32٪ إلى 82.46٪، بينما ارتفع DSC من 89.15٪ إلى 90.57٪.
| النموذج | كتلة MVV الأساسية | الإسقاط الصاعد والأسفل | وحدة الاستخبارات الدولية للعلوم والاتصالات 2017 mIoU (٪) | ISIC 2017 DSC (٪) | وحدة بيانات ISIC 2018 mIoU (٪) | ISIC 2018 DSC (٪) |
| MVM-UNet | ✓ | 78.83 | 88.15 | 80.32 | 89.15 | |
| MVM-UNet | ✓ | ✓ | 80.96 | 91.02 | 82.46 | 90.57 |
الجدول 5: دراسة الاستئصال لكتلة الرؤية متعددة الرؤيات (MVV). مقارنة الأداء لكتلة الرؤية متعددة الرؤيات (MVV) الأساسية مع وبدون فرع الإسقاط الأعلى-الأسفلي. يتم الإبلاغ عن الأداء باستخدام متوسط التقاطع مع الاتحاد (mIoU) ومعامل تشابه النرد (DSC) في مجموعات بيانات ISIC 2017 وISIC 2018.
أجريت تجارب استئصال كتلة MVV باستخدام البذرة العشوائية الثابتة 100. وبالتالي، فإن أداء التكوين الذي يحتوي على فرع الإسقاط الأعلى-الأسفل يعكس إعداد التآكل المتحكم فيه بذرة واحدة وقد يختلف قليلا عن متوسط الأداء الثلاثي المبلغ عنه لنموذج MVM-UNet الكامل في تجارب المقارنة الرئيسية.
بشكل عام، أدى دمج فرع الإسقاط للأعلى-الأسفل إلى تحسين أداء التقسيم باستمرار على كلا مجموعتي البيانات، مع زيادة لوحظت لكل من mIoU وDSC.
دراسة الاستئصال لوحدة مامبا الاندماج متعددة المراحل (MFusion Mamba)
تم تقييم وحدة MFusion Mamba من خلال مقارنة استراتيجيات الاندماج الخشن المختلفة مع مكون الاندماج الدقيق (الجدول 6؛ الشكل 10). بدون MFusion Mamba، حقق MVM-UNet معدل mIoU بنسبة 75.47٪ وDSC بنسبة 86.01٪ في مجموعة بيانات ISIC 2017، وmIoU بنسبة 77.49٪ وDSC بنسبة 87.29٪ في مجموعة بيانات ISIC 2018. من بين استراتيجيات الاندماج الخشن التي تم تقييمها، حقق منتج هادامارد أكبر تحسين. أدى دمج مكون الاندماج الدقيق إلى زيادة أداء التقسيم. حقق تكوين MFusion Mamba الكامل mIoU بنسبة 80.95٪ وDSC بنسبة 91.18٪ في ISIC 2017، وmIoU بنسبة 82.51٪ وDSC بنسبة 90.58٪ في ISIC 2018.
| النموذج | الاندماج الخشن من حيث العناصر القصوى | الاندماج الخشن الجمع حسب العناصر | حاصل الاندماج الخشن هادامارد | وحدة الاندماج الدقيق | وحدة الاستخبارات الدولية للعلوم والاتصالات 2017 mIoU (٪) | ISIC 2017 DSC (٪) | وحدة بيانات ISIC 2018 mIoU (٪) | ISIC 2018 DSC (٪) |
| MVM-UNet | 75.47 | 86.01 | 77.49 | 87.29 | ||||
| MVM-UNet | ✓ | 76.21 | 86.47 | 78.35 | 87.82 | |||
| MVM-UNet | ✓ | 76.83 | 86.86 | 79.11 | 88.30 | |||
| MVM-UNet | ✓ | 78.26 | 87.83 | 80.06 | 88.96 | |||
| MVM-UNet | ✓ | ✓ | 80.95 | 91.18 | 82.51 | 90.58 |
الجدول 6: دراسة الاستئصال لوحدة مامبا الاندماج متعددة المراحل (MFusion Mamba). مقارنة الأداء لاستراتيجيات الاندماج الخشن المختلفة، بما في ذلك أقصى اندماج (Max)، والجمع على العناصر (⊕)، وحاصل ضرب Hadamard (⊙)، مع وحدة الاندماج الدقيق الكاملة. يتم الإبلاغ عن الأداء باستخدام متوسط التقاطع مع الاتحاد (mIoU) ومعامل تشابه النرد (DSC) في مجموعات بيانات ISIC 2017 وISIC 2018.

الشكل 10. دراسة الاستئصال لوحدة مامبا الاندماج متعددة المراحل (MFusion Mamba). (أ) التغير في متوسط التقاطع عبر الاتحاد (mIoU) تم الحصول عليه باستخدام استراتيجيات اندماج خشنة مختلفة (الجمع الأقصى والعنصري على حدة، وحاصل ضرب هادامارد) ووحدة الاندماج الدقيق الكاملة. (ب) التغير في معامل تشابه النرد (DSC) الذي يتم الحصول عليه باستخدام استراتيجيات اندماج خشنة مختلفة (الجمع الأقصى والعنصري حسب العنصر، وحاصل ضرب هادامارد) ووحدة الاندماج الدقيق الكاملة. (ج) التغير في mIoU تم الحصول عليه باستخدام استراتيجيات اندماج خشنة مختلفة (الجمع الأقصى والعنصري على حدة، وحاصل ضرب هادامارد) ووحدة الاندماج الدقيق الكاملة تحت الإعداد التجريبي الثاني. (د) التغير في ال DSC الذي تم الحصول عليه باستخدام استراتيجيات اندماج خشنة مختلفة (الجمع الأقصى والعنصري على أساس العنصر، وحاصل ضرب هادامارد) ووحدة الاندماج الدقيق الكاملة تحت الإعداد التجريبي الثاني. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
في مجموعة بيانات ISIC 2017، حقق تكوين MFusion Mamba الكامل mIoU بنسبة 80.95٪ وDSC بنسبة 91.18٪. تظهر اتجاهات الأداء المقابلة ل mIoU و DSC في الشكل 10A والشكل 10B على التوالي. في مجموعة بيانات ISIC 2018، حقق تكوين MFusion Mamba الكامل mIoU بنسبة 82.51٪ وDSC بنسبة 90.58٪. تظهر اتجاهات الأداء المقابلة في الشكل 10C والشكل 10D على التوالي. أجريت تجارب استئصال مامبا في MFusion باستخدام البذرة العشوائية الثابتة 100. وبالتالي، يمثل تكوين MFusion الكامل لمامبا نتيجة الاستئصال المسيطر عليه بذرة واحدة وقد يختلف قليلا عن متوسط الأداء الثلاثي المبلغ عنه لنموذج MVM-UNet الكامل في تجارب المقارنة الرئيسية.
بشكل عام، أدى دمج استراتيجية الاندماج الخشن لمنتج هادامارد ومكون الاندماج الدقيق بشكل تدريجي إلى تحسين أداء التقسيم بشكل مستمر، حيث حقق تكوين MFusion Mamba الكامل أعلى أداء على كلا مجموعتي البيانات.
ملخص دراسات الاستئصال
عبر تجارب الاستئصال، أدى دمج فروع الفحص الهرمية واللولبية والشعاعية تدريجيا، إلى جانب وحدة SFusion Mamba، إلى تحسين أداء التقسيم بشكل مستمر (الجدول 4؛ الشكل 9). وبالمثل، أدى إدراج فرع الإسقاط للأعلى والأسفل في كتلة MVV إلى تحسين كل من mIoU وDSC في مجموعتي بيانات ISIC 2017 وISIC 2018 (الجدول 5). كما حقق تكوين MFusion Mamba الكامل أعلى أداء بين استراتيجيات دمج الميزات متعددة المراحل التي تم تقييمها (الجدول 6؛ الشكل 10).
دراسة الاستئصال للمعاملات الفائقة
تم تقييم تأثيرات حجم المدخلات وقيمة الانقطاع على مجموعتي بيانات ISIC 2017 وISIC 2018 (الجدول 7). تمت مقارنة ثلاث قرارات إدخال (256 × 256، 384 × 384، و512 × 512). تحت الإعدادات المقيمة، حققت دقة الإدخال 256 × 256 أعلى أداء تقسيم على كلا مجموعتي البيانات.
| النموذج | حجم الإدخال 256 × 256 | حجم المدخل 384 × 384 | حجم المدخل 512 × 512 | دروب آوت 0.0 | السقوط 0.1 | دروب آوت 0.2 | دروب آوت 0.3 | وحدة الاستخبارات الدولية للعلوم والاتصالات 2017 mIoU (٪) | ISIC 2017 DSC (٪) | وحدة بيانات ISIC 2018 mIoU (٪) | ISIC 2018 DSC (٪) |
| MVM-UNet | ✓ | ✓ | 80.02 | 88.91 | 81.76 | 89.92 | |||||
| MVM-UNet | ✓ | ✓ | 79.96 | 88.87 | 80.97 | 89.47 | |||||
| MVM-UNet | ✓ | ✓ | 77.48 | 87.28 | 78.76 | 88.11 | |||||
| MVM-UNet | ✓ | ✓ | 79.36 | 88.53 | 81.13 | 89.62 | |||||
| MVM-UNet | ✓ | ✓ | 80.94 | 90.15 | 82.49 | 90.50 | |||||
| MVM-UNet | ✓ | ✓ | 79.71 | 88.71 | 80.46 | 89.18 |
الجدول 7: دراسة الاستئصال لحجم الصورة المدخلة وقيمة الانقطاع. مقارنة الأداء بين MVM-UNet باستخدام أحجام صور إدخال مختلفة وقيم انقطاع. يتم الإبلاغ عن أداء التقسيم باستخدام متوسط تقاطع عبر الاتحاد (mIoU) ومعامل تشابه النرد (DSC) في مجموعتي بيانات ISIC 2017 وISIC 2018.
كما تم تقييم قيم مختلفة للانسحاب. من بين التكوينات المختبرة، حققت قيمة الانقطاع 0.2 أعلى أداء تقسيم على كلتا مجموعتي البيانات، وبالتالي تم استخدامها في التجارب الرئيسية.
دراسة الاستئصال لتكوين طبقة المشفر-مفكك الترميز
تم تقييم تكوينات طبقات المشفر-مفكك التشفير المختلفة لفحص تأثير عمق الشبكة على أداء التقسيم والتكلفة الحسابية (الجدول 8). من بين التكوينات المقيمة، حققت معمارية {2، 2، 2، 2}-{2، 2، 2، 2} المتماثلة أعلى أداء تقسيم عام مع الحفاظ على تعقيد النموذج المنخفض نسبيا. زيادة عمق الشبكة إلى {2، 2، 9، 2}-{2، 9، 2، 2} أنتجت أداء تقسيم مماثل لكنها زادت من عدد المعلمات والتكلفة الحاسوبية.
| النموذج | تكوين طبقة الترميز-فك الترميز | المعلمات (M) | فلوبس (G) | وحدة الاستخبارات الدولية للعلوم والاتصالات 2017 mIoU (٪) | ISIC 2017 DSC (٪) | وحدة بيانات ISIC 2018 mIoU (٪) | ISIC 2018 DSC (٪) |
| MVM-UNet | {2,2,2,1}-{2,2,2,2} | 28.22 | 4.12 | 80.02 | 88.91 | 81.16 | 89.64 |
| MVM-UNet | {2,2,2,2}-{2,2,2,2} | 28.36 | 4.39 | 80.95 | 90.17 | 82.5 | 90.41 |
| MVM-UNet | {2,2,2,3}-{2,3,2,2} | 30.14 | 4.88 | 79.83 | 88.8 | 81.56 | 89.85 |
| MVM-UNet | {2,4,2,2}-{2,2,4,2} | 33.46 | 5.32 | 79.65 | 88.7 | 81.45 | 89.79 |
| MVM-UNet | {2,2,9,2}-{2,9,2,2} | 45.63 | 7.78 | 80.96 | 90.09 | 82.48 | 90.43 |
الجدول 8: دراسة الاستئصال لتكوينات طبقة المشفر-مفكك. مقارنة الأداء بين تكوينات طبقات الترميز وفك الترميز. يذكر الجدول عدد معلمات النموذج (المعلمات)، وعمليات الفابض العائمة (FLOPs)، ومتوسط التقاطع فوق الاتحاد (mIoU)، ومعامل تشابه النرد (DSC) في مجموعات بيانات ISIC 2017 وISIC 2018.
مقارنة التكاليف الحاسوبية
تمت مقارنة الكفاءة الحاسوبية لنموذج MVM-UNet النهائي مع طرق الأساس التمثيلية، بما في ذلك HResFormer، H-vmunet، MISSFormer، H2Former، MedScale-Former، وMCAFT، تحت نفس بيئة الأجهزة ودقة الإدخال (الجدول 9). شملت المقاييس المقيمة وقت التدريب لكل عصر، ووقت الاستدلال لكل صورة، وذروة استخدام ذاكرة GPU أثناء التدريب، وعدد المعلمات القابلة للتدريب (Params)، وFLOPs. تم قياس وقت التدريب بأنه الوقت المطلوب لإكمال فترة تدريب واحدة، ووقت الاستدلال كمتوسط زمن المعالجة لكل صورة اختبار، وتم حساب FLOPs لمرور واحد للأمام.
| الطريقة | المرجع. | وقت التدريب (الحقبة) | زمن الاستدلال (ms/image) | ذاكرة ذروة وحدة معالجة الرسوميات (GB) | المعلمات (M) | فلوبس (G) |
| HResFormer | 34 | 520 | 213.08 | 19.2 | 117.00 | 131.70 |
| H-vmunet | 28 | 88 | 27.00 | 5.0 | 10.74 | 8.97 |
| ميسفورمر | 30 | 355 | 92.86 | 12.6 | 42.33 | 109.45 |
| H2Former | 12 | 130 | 29.02 | 8.8 | 33.71 | 33.56 |
| ميدسكيل-فورمر | 35 | 80 | 23.50 | 5.9 | 4.96 | 3.79 |
| MCAFT | 36 | 145 | 34.00 | 8.7 | 30.00 | 12.00 |
| MVM-UNet (لنا) | — | 104 | 26.80 | 7.9 | 28.36 | 4.39 |
الجدول 9: مقارنة التكاليف الحسابية بين MVM-UNet وطرق الأساس التمثيلية. مقارنة الكفاءة الحسابية تحت نفس بيئة الأجهزة ودقة الإدخال. تشمل المقاييس المبلغ عنها وقت التدريب لكل عصر، ووقت الاستدلال لكل صورة، واستخدام ذروة ذاكرة وحدة معالجة الرسوميات (GPU) أثناء التدريب، وعدد معلمات النموذج (Parameters)، وعمليات النقطة العائمة (FLOPs). تم تقييم الطرق التي تحتوي على تطبيقات متاحة باستخدام نفس بيئة التجربة كلما أمكن.
كما هو موضح في الجدول 9، تطلب MVM-UNet 104 ثانية لكل فترة تدريب، و26.8 مللي ثانية لكل صورة للاستدلال، و7.9 جيجابايت من ذاكرة ذروة وحدة معالجة الرسوميات، و28.36 مليون معلم قابل للتدريب، و4.39 GFLOPs. مقارنة ب HResFormer وMISSFormer وH2Former وMCAFT، تطلب MVM-UNet وقت تدريب أقل، ووقت استدلالات أقل، واستخدام ذاكرة ذروة أقل لوحدة معالجة الرسومات، وعدد أقل من FLOPs. مقارنة بنماذج H-vmunet وخفيفة الوزن وMedScale-Form، تطلب MVM-UNet وقت تدريب واستخدام ذاكرة أكبر لكنه حافظ على سرعة استدلال مماثلة مع الحفاظ على تعقيد حسابي منخفض نسبيا.
توفر البيانات والشيفرة
مجموعات بيانات ISIC 2017 وISIC 2018 متاحة للجمهور من أرشيف التعاون الدولي لتصوير الجلد (ISIC)، ومجموعة بيانات Synapse متاحة للجمهور من مستودع Synapse. تم توفير تفاصيل جمع مجموعات البيانات في بيان الأخلاقيات. باختصار، تم الحصول على مجموعة بيانات ISIC 2017 من مستودع بيانات ISIC 2017 Challenge الرسمي (https://challenge.isic-archive.com/data/#2017)، وتم الحصول على مجموعة بيانات ISIC 2018 من مستودع بيانات ISIC 2018 Challenge Task 1 الرسمي (https://challenge.isic-archive.com/data/#2018)، وتم الحصول على مجموعة بيانات Synapse من مستودع Synapse تحت معرف الإدخال syn3193805 (https://www.synapse.org/Synapse:syn3193805). يتم الإبلاغ عن تواريخ التنزيل المقابلة في بيان الأخلاقيات. النسخة العامة الأولية من شفرة مصدر MVM-UNet متوفرة على https://github.com/LIXUEGUANG002/MVM-UNet. يشمل المستودع تنفيذ النموذج، ووحدات الشبكة الرئيسية، وملفات التكوين، وتعليمات تنظيم مجموعات البيانات، وسكريبتات التدريب، وسكريبتات التقييم. سيتم توفير حزمة إعادة الإنتاج الكاملة، بما في ذلك ملفات التكوين النهائية، وسكريبتات التجارب الكاملة، ووثائق إضافية، ونقاط تفتيش النماذج المدربة، للجمهور عند النشر.
الجدول التكميلي 1. بنية طبقة بطبقة لرؤية مامبا UNet متعددة الرؤية (MVM-UNet). يلخص الجدول بنية الشبكة التسلسلية ل MVM-UNet، بما في ذلك طبقة الإدخال، تضمين الباتش، مراحل المشفر، كتل الرؤية متعددة الرؤية (MVV)، عمليات دمج الرقعة، مامبا الاندماج متعدد المراحل (MFusion Mamba)، مراحل فك الترميز، الترقية النهائية للعينة النهائية، ورأس التقسيم. لكل مرحلة، يتم سرد العملية المقابلة، والمعلمات الرئيسية، وحجم ميزة الإخراج. تشير E1–E4 إلى خرائط ميزات مرحلة المشفر المستخدمة في دمج الميزات متعددة المراحل. B وH وW ترمز إلى حجم الدفعة، وارتفاع الصورة، وعرض الصورة على التوالي، وK تشير إلى عدد فئات الإخراج (K = 1 لتقسيم آفات الجلد الثنائية وK = 9 لتقسيم متعدد الفئات في المشابك، التي تتكون من فئة خلفية واحدة وثماني فئات من الأعضاء الأمامية). يولد MFusion Mamba ميزات مشفرة متعددة المراحل مدمجة مع ميزات فك التشفير المقابلة أثناء إعادة بناء جهاز فك الترميز. يرجى الضغط هنا لتحميل هذا الملف.
الملف التكميلي 1. كود زائف لوحدة متعددة الرؤى رباعية الاتجاهات (MV4D) ووحدة الاندماج متعددة المراحل (MFusion Mamba). يعرض الملف التكميلي سير العمل الخوارزمي للوحدتين الرئيسيتين المستخدمتين في MVM-UNet. تصف الخوارزمية 1 خط معالجة كامل لوحدة متعددة الرؤى رباعية الاتجاهات (MV4D)، بما في ذلك تسطيح الميزات، وبناء أربعة تسلسلات أزواج مسح (متعرجة، هرمية، حلزونية، وشعاعية)، ومعالجة فضاء الحالة الانتقائي (S6)، ودمج مامبا بعرض المسح (SFusion Mamba)، وإعادة بناء خريطة ميزات الإخراج. تصف الخوارزمية 2 وحدة مامبا الاندماج متعددة المراحل (MFusion Mamba)، بما في ذلك محاذاة ميزات المشفر متعدد المراحل، والاندماج الخشن، والاندماج الدقيق، وتكامل المفكك، وتوليد ميزة إدخال مفكك التشفير. يتم تعريف المتغيرات وأبعاد الموترات ضمن الخوارزميات. يرجى الضغط هنا لتحميل هذا الملف.
ملف الترميز الإضافي 1. حزمة الشيفرة المصدرية ل MVM-UNet (MVM-UNet-master). يحتوي أرشيف ZIP التكميلي على تنفيذ كود المصدر الكامل ل MVM-UNet المستخدم في هذه الدراسة. تتضمن الحزمة بنية الشبكة، ووحدات متعددة الرؤية رباعية الاتجاهات (MV4D) ووحدات الاندماج متعددة المراحل (MFusion Mamba)، وملفات التكوين، وسكريبتات التدريب والتقييم لمجموعات بيانات ISIC 2017، ISIC 2018، ومجموعات بيانات Synapse، ودوال الأدوات، وتوثيق المشروع اللازمة لإعادة إنتاج التجارب الموصوفة في هذا البروتوكول. تتضمن الحزمة أيضا ملف README مع تعليمات التثبيت، وتبعيات البرمجيات، وتنظيم مجموعات البيانات، وسير عمل التدريب والاستدلال. يرجى الضغط هنا لتحميل هذا الملف.
يصف هذا البروتوكول إطار عمل MVM-UNet، وهو إطار عمل لتقسيم الصور الطبية يعتمد على مامبا. تم تصميم الطريقة لمعالجة محدودين في نماذج التقسيم الحالية. أولا، الطرق التقليدية المعتمدة على CNN لديها قدرة محدودة على نمذجة التبعيات طويلة المدى والمعلومات السياقية الهرمية في الصور الطبية المعقدة43. ثانيا، يمكن للطرق المعتمدة على المحولات نمذجة السياق العالمي لكنها عادة ما تتطلب تكلفة حسابية أعلى23,25. يستخدم MVM-UNet بنية مامبا 13,14,15,16,17,18,19,20 لتحقيق نمذجة فعالة على المدى البعيد، ويقدم المسح متعدد الرؤى ودمج الميزات متعددة المراحل لتحسين دقة التقسيم. من منظور تنفيذ البروتوكول وقابلية التكرار، هناك عدة خطوات حاسمة للحصول على نتائج مماثلة لتلك المبلغ عنها في هذه الدراسة. أولا، يجب أن تبقى تقسيم مجموعة البيانات، وتغيير حجم الصورة، واستيفاء القناع، واستراتيجية التطبيع، وتحويل القناة متسقة مع البروتوكول لأن الاختلافات في المعالجة المسبقة يمكن أن تغير مباشرة توزيع الإدخال وحدود القناع. على وجه الخصوص، يجب إعادة تكبير أقنعة التقسيم باستخدام استيفاء أقرب جار لتجنب إدخال قيم تسمية غير صحيحة44. ثانيا، يجب فحص تكوين التدريب، بما في ذلك دقة الإدخال، حجم الدفعة، إعدادات المحسن، جدول معدل التعلم، البذرة العشوائية، معاملات وزن الخسارة، قاعدة اختيار نقاط التحقق، وعتبة الاستدلال أو عملية argmax، قبل مقارنة النتائج. إذا كانت النتائج المستنسخة أقل بوضوح من القيم المبلغ عنها، يجب على المستخدمين أولا التحقق من مسار مجموعة البيانات، وتنسيق التعليقات، واتفاقية التسمية المقدمة والخلفية، وتحميل نقاط الحفظ، وتقسيم التحقق أو الاختبار، وإجراء حساب المقاييس. عادة ما تشير تسرب الحدود، الأقنعة المجزأة، أو الهياكل الصغيرة المفقودة إلى وجود تناقضات محتملة في المعالجة المسبقة، أو استيفاء القناع، أو اختيار نقاط التفتيش، أو معالجة الاستدلال.
المساهمة الرئيسية ل MVM-UNet هي وحدة MV4D. على عكس استراتيجيات المسح ثنائية الأبعاد البسيطة التي تم اعتمادها في البنى السابقة القائمة على نموذج فضاء الحالة 14,15,16,17,18,19,20، يستخدم MV4D أزواج المسح المتعرج، الهرمي، الحلزوني، والشعاعي لالتقاط المعلومات البصرية المكملة. تساعد أزواج المسح المتعرج في موازنة المعلومات المكانية المحلية والعالمية، بينما تعزز أزواج المسح الهرمي استخراج الميزات متعدد المقاييس، وتقوي أزواج المسح الحلزونية تمثيل الخطوط العمومية، وتحسن أزواج المسح الشعاعي استخراج ميزات الحواف والحدود المحلية. ثم تدمج SFusion Mamba هذه الأساليب التكميلية للمسح. النتائج الممثلة وتجارب الكاهة (الجدولان 4 و5؛ الشكل 9) يثبت أن تنوع أنماط المسح وآلية الاندماج يسهمان في تحسين أداء التقسيم. مكون مهم آخر هو MFusion Mamba، الذي يعمل كوحدة دمج ميزات بين المشفر والمفكك. البنى التقليدية على شكل U، بما في ذلك U-Net 8,21، V-Net44، والعديد من النسخ اللاحقة 9,23,25، تنقل المعلومات بشكل أساسي عبر اتصالات تخطي على مراحل. قد لا تستفيد هذه الاستراتيجية بالكامل من تمثيلات المشفرة متعددة المراحل التكميلية. يعالج MFusion Mamba هذا القيد من خلال دمج ميزات المشفر عبر Coarse Fusion وFine Fusion قبل فك الترميز. النتائج الممثلة (الجدول 6؛ الشكل 10) يظهر أن MFusion Mamba يحسن باستمرار أداء التقسيم، مما يشير إلى أن دمج الميزات متعدد المراحل الصريح مفيد لتقسيم الصور الطبية.
يجب فهم المساهمة المنهجية ل MVM-UNet على أنها إعادة تصميم على مستوى الهيكل وليس اختراع كل عملية فردية من الصفر. تم دراسة بنى مشفر-مفكك التشفير على شكل حرف U، والاتصالات المتبقية، وطبقات الإسقاط، وكتل نموذج مامبا/فضاء الحالة (SSM) بشكل موسع في دراسات سابقة 8,13,14,15,16,17,18,19,20,21,23,24,25 ,29,44. ومع ذلك، فإن الجمع المباشر بين هذه المكونات لا يعالج بالضرورة التحديات المحددة لتقسيم الصور الطبية. تكمن حداثة MVM-UNet في التصميم المنسق لثلاثة جوانب. أولا، تستبدل وحدة MV4D نمط مسح واحد أو محدود بأربعة فروع مكملة من أزواج المسح، مما يمكن النموذج من التقاط الاستمرارية المكانية، والبنية متعددة المقاييس، ومعلومات الخطوط العالمية، وتفاصيل الحدود المحلية. ثانيا، يقوم SFusion Mamba وMVV Block بدمج وتعزيز ميزات خاصة بالمسح قبل تمريرها إلى المرحلة التالية من الشبكة. ثالثا، يقوم MFusion Mamba بتجميع ميزات الترميز متعدد المراحل صراحة قبل فك الترميز، مكملا اتصالات التخطي التقليدية 8,21,44 ويحسن استخدام المعلومات الهرمية. نتائج الاستئصال (جداول 4–6؛ الأشكال 9 و10) يدعم هذا المنطق التصميمي بشكل أكبر، حيث يظهر أن المسح متعدد الرؤية، والدمج الخاص بالمسح الخاص، وفرع الإسقاط الصاعد والأسفل، ودمج الميزات متعددة المراحل يساهم كل منها في تحسين أداء التقسيم. لذلك، تكمن مساهمة MVM-UNet في دمج محدد المهمة والتحقق تجريبيا بين النمذجة المكانية المعتمدة على مامبا ودمج ميزات الترميز ومفك التشفير لتقسيم الصور الطبية.
على الرغم من أدائها القوي، تعاني MVM-UNet من عدة قيود. أولا، لم يتحسن أداء التقسيم باستمرار مع أحجام الصور المدخلة الأكبر، مما يشير إلى أن البنية الحالية قد لا تستغل معلومات الصور عالية الدقة بالكامل. ثانيا، لم يتم تقييم النموذج بشكل موسع في ظروف التصوير ذات الضوضاء العالية أو التباين المنخفض، والتي تواجهها كثيرا في الممارسة السريرية وقد تؤثر على متانة التقسيم. ثالثا، رغم أن النموذج حقق أداء قويا في ثلاث مجموعات بيانات متاحة للجمهور، إلا أن التحقق الإضافي من الفحص على مجموعات بيانات التصوير الطبي الأكبر والأكثر تنوعا أمر ضروري. يمكن تكييف البروتوكول لمهام تقسيم الصور الطبية الأخرى، لكن يجب تنفيذ عدة تعديلات بعناية. لمهمة تقسيم ثنائية جديدة، يجب على المستخدمين تعديل محمل مجموعة البيانات، ومعلمات التطبيع، ودقة الإدخال، وعتبة المقدمة مع الحفاظ على إجراء فقدان وتقييم BCE-Dice الثنائي. لمهمة تقسيم متعددة الفئات جديدة، يجب على المستخدمين تحديث عدد فئات المخرجات، وتعيين مؤشر الفئة، وتحويل تسمية واحدة ساخنة، وتكوين خسارة النرد CE-Dice، ومقاييس التقييم حسب الفئة44. بالنسبة لمجموعات البيانات الرمادية، يجب مطابقة تكوين قناة الإدخال مع بنية النموذج إما باستخدام إسقاط إدخال أحادي القناة أو تكرار صورة التدرج الرمادي لإنشاء إدخال ثلاثي القنوات، حسب التنفيذ. قد تؤدي الطريقة أداء غير مثالي عندما تكون هياكل الهدف صغيرة جدا، أو تكون الحدود ضعيفة أو غامضة، أو يختلف تباين الصور بشكل كبير عن بيانات التدريب، أو عندما تظهر مجموعة البيانات المستهدفة تحولا كبيرا في المجال. في هذه الظروف، قد يحتاج المستخدمون إلى تعديل دقة المدخلات، واستراتيجية التعزيز، وتوازن الفئات، ووزن الفقدان، أو ضبط جدول التقييم مع الحفاظ على نفس بروتوكول التقييم لضمان مقارنات عادلة.
في مجموعة بيانات Synapse، حقق MVM-UNet أداء قويا في تقسيم الأعضاء المتعددة ضمن تقسيم التدريب الشائع من 18 حالة واختبار 12 حالة. على الرغم من أن الطريقة المقترحة حققت أعلى متوسط DSC بين الطرق الأساسية الممثلة التي تم تقييمها في هذه الدراسة (الجدول 3)، إلا أن بعض الطرق الحديثة أبلغت عن أداء أعلى للمشابك تحت بيئات تدريب وبروتوكولات تقييم مختلفة29. لذلك، نتجنب وصف MVM-UNet بأنه يحقق أداء متقدما بشكل عام على Synapse، وبدلا من ذلك وصفه بأنه تحقيق أداء قوي تحت إطار التجارب المقيمة. تشير هذه النتائج إلى أن أداء MVM-UNet ينشأ من التكيف المخصص للمهمة في النمذجة المعتمدة على مامبا لتقسيم الصور الطبية 13,14,15,16,17,18,19,20. بدلا من الاعتماد على استراتيجية مسح واحدة، يقوم MVM-UNet بتفكيك نمذجة الميزات البصرية إلى عدة رؤى مسح مكملة ودمجها عبر SFusion Mamba. بالإضافة إلى ذلك، يحسن MFusion Mamba تدفق المعلومات بين المشفر والمفكك من خلال تجميع ميزات الترميز متعدد المراحل بشكل صريح خارج اتصالات التخطي التقليدية 8,21,44. يتيح هذا التصميم للنموذج المقترح تحقيق أداء قوي في كل من تقسيم آفات الجلد الثنائية ومهام تقسيم الأعضاء المتعددة.
يجب أن يركز العمل المستقبلي على تحسين MVM-UNet لتقسيم الصور الطبية عالية الدقة. قد تمكن البنى متعددة المقاييس الأعمق أو التكيفية النموذج من استغلال معلومات الصور عالية الدقة بشكل أكثر فعالية. يجب أن تقيم الدراسات المستقبلية أيضا متانة MVM-UNet تحت ظروف التصوير الضوضاء ومنخفضة التباين وتغيير المجال. بالإضافة إلى ذلك، يمكن توسيع استراتيجية المسح متعدد الرؤى المقترحة لتشمل مهام تحليل الصور الطبية الأخرى، بما في ذلك اكتشاف الآفة4، وتحديد موقع الأعضاء، وتصنيف الأورام، والتقسيم ثلاثي الأبعاد10,11. باختصار، يوفر MVM-UNet إطارا فعالا وقابلا للتكرار لتقسيم الصور الطبية. يتيح دمج وحدة MV4D وMFusion Mamba للنموذج التقاط المعلومات المكانية التكميلية، والسياق متعدد المقاييس، ومعلومات الخطوط العالمية، وتفاصيل الحدود المحلية، والميزات الدلالية متعددة المراحل. تظهر النتائج الممثلة التي تم الحصول عليها على مجموعات بيانات ISIC 2017 وISIC 2018 وSynapse فعالية البنية المقترحة. يوفر هذا البروتوكول مرجعا عمليا للباحثين الذين يطورون هياكل فعالة قائمة على SSM/Mamba لتقسيم الصور الطبية 13,14,15,16,17,18,19,20.
يعلن المؤلفون أنه لا توجد لديهم مصالح مالية متنافسة.
لم يحصل هذا البحث على تمويل خارجي.
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| Hardware - GPU workstation or GPU server | Institutional computing platform / local workstation | Custom-built local GPU workstation; Ubuntu 22.04.1 with Linux kernel 6.8.0; Intel Core i9-13900K CPU; NVIDIA A800 GPU; 128 GB RAM; 512 GB local storage. | Computational platform for training, validation, testing, ablation, and inference-only experiments. |
| Hardware - Graphics processing unit (GPU) | NVIDIA Corporation | NVIDIA A800 GPU (80 GB memory). | GPU-accelerated model training and inference. |
| Hardware - Central processing unit (CPU) | Intel Corporation / AMD | 13th Gen Intel Core i9-13900K CPU. | Host processor for data loading, preprocessing, and experiment execution. |
| Hardware - System memory (RAM) | Institutional computing platform / local workstation | 128 GB system RAM | Memory for dataset loading, preprocessing, and training. |
| Hardware - Storage | Institutional computing platform / local workstation | 2 TB NVMe solid-state drive. | Storage for datasets, checkpoints, logs, and generated prediction figures. |
| Software environment - Operating system | Canonical Ltd. | Recommended: Ubuntu 22.04.1 LTS | Operating system for the computational environment. |
| Software environment - Conda environment | Anaconda, Inc. / Miniconda | Environment name: mvmunet | Python environment used to install and isolate dependencies. |
| Software environment - Python | Python Software Foundation | Python 3.8 | Programming language used for implementation and experiment execution. |
| Software environment - CUDA toolkit | NVIDIA Corporation | CUDA Toolkit 11.8 | GPU computing backend required by PyTorch and Mamba-related packages. |
| Software environment - cuDNN | NVIDIA Corporation | cuDNN 8.7.0. | GPU-accelerated deep-learning primitives used through PyTorch. |
| Python package - PyTorch | PyTorch | torch == 2.0.1 | Deep-learning framework for model training, loss calculation, optimization, and inference. |
| Python package - Torchvision | PyTorch | torchvision == 0.14.0 | Image transform utilities used in preprocessing and augmentation. |
| Python package - Torchaudio | PyTorch | torchaudio == 0.13.0 | Installed with the recommended PyTorch environment. |
| Python package - timm | timm developers | timm == 0.4.12 | Model-component or utility dependency listed in the repository environment instructions. |
| Python package - triton | OpenAI / Triton developers | triton == 2.0.0 | Dependency used by GPU-accelerated sequence modeling components. |
| Python package - causal-conv1d | causal-conv1d developers | causal_conv1d == 1.0.0 | Efficient causal convolution dependency required by the Mamba implementation. |
| Python package - mamba-ssm | Mamba SSM developers | mamba_ssm == 1.0.1 | State-space sequence modeling package used for Mamba/S6-related components. |
| Python package - NumPy | NumPy developers | NumPy version 1.24.3. | Numerical computation and array operations. |
| Python package - SciPy | SciPy developers | SciPy version 1.10.1. | Scientific computation; scipy.ndimage.zoom is imported in utils.py. |
| Python package - SimpleITK | Insight Software Consortium | SimpleITK version 2.2.1. | Medical image input/output and preprocessing utility imported in utils.py. |
| Python package - MedPy | MedPy developers | MedPy version 0.4.0. | Medical image metric calculation package imported in utils.py. |
| Python package - scikit-image | scikit-image developers | scikit-image version 0.21.0. | Image-processing dependency listed in README. |
| Python package - scikit-learn | scikit-learn developers | scikit-learn version 1.3.2. | Machine-learning utility package listed in README. |
| Python package - matplotlib | Matplotlib developers | Matplotlib version 3.7.2. | Used for saving qualitative visualization figures. |
| Python package - h5py | h5py developers | h5py version 3.9.0. | HDF5 file support for Synapse test volumes. |
| Python package - thop | THOP developers | THOP version 0.1.1.post2209072238. | Used when calculating FLOPs and parameter-related computational cost. |
| Python package - packaging | Python Packaging Authority | packaging version 23.1. | Dependency listed in README. |
| Python package - pytest | pytest developers | pytest version 7.4.0. | Dependency listed in README. |
| Python package - chardet | chardet developers | chardet version 5.2.0. | Dependency listed in README. |
| Python package - yacs | YACS developers | yacs version 0.1.8. | Configuration utility dependency listed in README. |
| Python package - termcolor | termcolor developers | termcolor version 2.3.0. | Logging/terminal utility dependency listed in README. |
| Python package - submitit | submitit developers | submitit version 1.4.5. | Experiment/job utility dependency listed in README. |
| Python package - tensorboardX | tensorboardX developers | tensorboardX version 2.6.2.2. | Training log visualization utility listed in README. |
| Python package - ml-collections | ml_collections developers | ml-collections version 0.1.1. | Imported by configs/config_setting_synapse.py. |
| Dataset - ISIC 2017 Challenge dataset | International Skin Imaging Collaboration | ISIC 2017 skin lesion segmentation dataset | Public de-identified dermoscopic skin lesion images and masks used for binary segmentation. |
| Dataset - ISIC 2018 Challenge Task 1 dataset | International Skin Imaging Collaboration | ISIC 2018 Task 1: Lesion Boundary Segmentation | Public de-identified dermoscopic skin lesion images and masks used for binary segmentation. |
| Dataset - Synapse Multi-Atlas Labeling Beyond the Cranial Vault dataset | Synapse / Sage Bionetworks | Accession identifier: syn3193805 | Public abdominal CT multi-organ segmentation dataset. |
| Data organization - ISIC 2017 data folder | Authors / repository layout | data/isic2017/ | Expected local folder containing train and validation images/masks. |
| Data organization - ISIC 2018 data folder | Authors / repository layout | data/isic2018/ | Expected local folder containing train and validation images/masks. |
| Data organization - Synapse data folder | Authors / repository layout | data/Synapse/ | Expected local folder for Synapse lists, train_npz, and test_vol_h5. |
| Source code - MVM-UNet source-code repository | Authors / GitHub | Branch: master;Git commit hash: ee891b42c2f083c4990eed72f1d4463adc5e103e. | Complete source-code implementation of the protocol. |
| Source code - ISIC configuration file | Authors | configs/config_setting.py | Configuration file for ISIC-style binary segmentation. |
| Source code - Synapse configuration file | Authors | configs/config_setting_synapse.py | Configuration file for Synapse multi-organ segmentation. |
| Source code - ISIC training script | Authors | train.py | Training and validation entry point for ISIC-style binary segmentation. |
| Source code - Synapse training script | Authors | train_synapse.py | Training and validation entry point for Synapse multi-class segmentation. |
| Source code - |
طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه
طلب إذن