يصف هذا البروتوكول كيفية بناء وتدريب وتقييم إطار شبكة Vision Mamba U-Shape متعددة المنظورات لتقسيم الصور الطبية، مما يمكن من إعادة تقسيم آفات الجلد وأعضاء البطن من خلال إعداد مجموعات البيانات الموحدة، وتنفيذ النماذج، وتقييم الأداء.
يتطلب اشتراك JoVE لعرض هذا المحتوى. تسجيل الدخول أو ابدأ نسخة تجريبية مجانية
مقالة منهجية
يصف هذا البروتوكول كيفية بناء وتدريب وتقييم إطار شبكة Vision Mamba U-Shape متعددة المنظورات لتقسيم الصور الطبية، مما يمكن من إعادة تقسيم آفات الجلد وأعضاء البطن من خلال إعداد مجموعات البيانات الموحدة، وتنفيذ النماذج، وتقييم الأداء.
يتطلب تقسيم الصور الطبية طرقا حسابية تلتقط بدقة السياق العالمي، والحدود المحلية، والهياكل التشريحية متعددة المقاييس مع الحفاظ على قابلية التكرار عبر تطبيقات مختلفة. تقدم هذه المقالة بروتوكولا لبناء وتدريب وتقييم إطار شبكة مامبا متعددة الرؤى على شكل U لتقسيم الصور الطبية ثنائية الأبعاد. يوفر البروتوكول سير عمل قابل للتكرار يشمل اكتساب مجموعات البيانات العامة، والمعالجة المسبقة للصور والأقنعة، وبناء الشبكة، وتدريب النماذج، واختيار نقاط التحقق، والتقييم الكمي والنوعي للأداء. يدمج الإطار مسح الميزات متعددة الوجهات لالتقاط معلومات مكملة عن المكان، والكنتور، والمقياس، والحدود، ويطبق دمج الميزات متعددة المراحل ضمن بنية مشفر-مفكك على شكل حرف U لتحسين تكامل الميزات أثناء التقسيم. يتم عرض البروتوكول باستخدام مجموعات بيانات الآفات الجلدية وتقسيم الأعضاء البطنية المتاحة للجمهور. وفقا لسير العمل المذكور في التنفيذ، يحقق الإطار أداء تنافسي في التقسيم باستخدام مقاييس التقييم القياسية. باتباع الإجراءات المقدمة في هذا البروتوكول، يمكن للباحثين إعادة إنتاج تنفيذ النموذج، وتدريب الشبكة باستخدام إعدادات تجريبية محددة، وتقييم أداء التقسيم، وتكييف سير العمل لمهام تقسيم الصور الطبية ذات الصلة التي تتطلب تحليلا قائما على التعلم العميق القابل للتكرار.
تقسيم الصور الطبية هو مهمة أساسية في مجالات رؤية الحاسوب وتحليل الصور الطبية 1,2,3. يتضمن تقسيم الصورة إلى مناطق أو كائنات متعددة لمزيد من التحليل والمعالجة. تكتسب هذه التقنية أهمية خاصة في التصوير الطبي لأنها تساعد الأطباء في تحديد وتحديد المناطق المرضية، مما يحسن دقة التشخيص وتخطيط العلاج. مع تقدم تقنيات التصوير الطبي، مثل التصوير بالرنين المغناطيسي (MRI)، والتصوير المقطعي المحوسب (CT)، والتصوير المقطعي بانبعاث البوزيترون (PET)، استمر الطلب على تقنيات تقسيم الصور الطبية الدقيقة في الازدياد. يمكن تصنيف الطرق الحالية لتقسيم الصور الطبية بشكل عام إلى ثلاثة طرق رئيسية: الطرق المعتمدة على الشبكة العصبية الالفافية (CNN)4، الطرق المعتمدة على المحولات5، والطرق القائمة على نموذج فضاء الحالة (SSM)6،7. عادة ما تستخدم الطرق المعتمدة على CNN هياكل شبكات على شكل حرف U لتقسيم الصور الطبية. أكثر المعمارية استخداما في هذه الفئة هي U-Net8، التي أظهرت فعالية بنية مشفر-فك التشفير على شكل U لتقسيم الصور الطبية الحيوية. يجمع U-Net3+ بين اتصالات التخطي الكثيفة من UNet++9 مع اتصالات تخطي كاملة الحجم لتعزيز تجميع الميزات متعدد المقاييس. ومع ذلك، فإن الطرق المعتمدة على CNN لديها قدرة محدودة على التقاط التبعيات طويلة المدى، وبالتالي قد لا تنمذج معلومات سياقة بعيدة المدى بفعالية.
تلتقط الطرق المعتمدة على المحولات الاعتماديات طويلة المدى بشكل فعال من خلال آلية الانتباه الذاتي، التي تمكن من الحساب المتوازي وتمنح أوزان انتباه مختلفة لمناطق اهتمام مختلفة. يقدم UNETR++10 وحدة الانتباه المزدوج الفعال (EPA) لتقليل عدد المعلمات والتكلفة الحاسوبية. يجمع nnFormer11 بين العمليات الالفافية المتداخلة وعمليات الانتباه الذاتي ويقدم آلية تركيز ذاتي قائم على الحجم المحلي والعالمي لتعلم التمثيلات الحجمية في تقسيم الصور الطبية ثلاثية الأبعاد (ثلاثية الأبعاد). يقترح H2Former12 محول رؤية هجين هرمي فعال يجمع بين آليات الانتباه واستخراج الميزات المعتمد على CNN في المشفر. ومع ذلك، تظهر الطرق المعتمدة على المحولات تعقيد حسابي تربيعي مع زيادة طول التسلسل، مما يؤدي إلى تكلفة حسابية أعلى بكثير. يوضح الشكل 1 الدافع وراء MVM-UNet ويقارن بين استراتيجية المسح متعدد الرؤى المقترحة مع أطر التقسيم القائمة على SSM.

الشكل 1. مقارنة بين MVM-UNet وبنيات تقسيم القائمة القائمة على نموذج الفضاء النقي (SSM). مقارنة بين إطار التقسيم التقليدي القائم على نموذج الحالة النقي (SSM) وبنية شبكة مامبا متعددة الرؤية المقترحة (MVM-UNet). توضح اللوحة العلوية MVM-UNet، حيث تستخرج وحدة الرؤية متعددة الأبعاد (MV4D) ميزات مكملة باستخدام أزواج المسح المتعرج، الهرمي، الحلزونية، والشعاعية التي يتم دمجها بواسطة مامبا الاندماج المكاني (SFusion Mamba)، بينما يقوم مامبا الاندماج متعدد المراحل (MFusion Mamba) بتجميع ميزات الترميز متعدد المقاييس قبل فك الترميز. تظهر اللوحة السفلية بنية تمثيلية نقية قائمة على SSM باستخدام وحدات المسح الانتقائي ثنائي الأبعاد (SS2D) مع المسح المتبادل. يبرز الشكل الفروقات المعمارية بين شبكات التقسيم التقليدية المعتمدة على SSM وشبكة MVM-UNet المقترحة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
تجمع الطرق المعتمدة على SSM بين قدرة النمذجة العالمية للترانسفورمرز والتعقيد الحسابي الخطي. تعالج معمارية مامبا معلومات الإدخال بشكل انتقائي باستخدام نموذج فضاء الحالة الانتقائي (Selective-SSM)، مما يمكن النموذج من تعديل معلماته ديناميكيا وفقا للمدخلات مع تصفية المعلومات غير ذات الصلة والتركيز على الميزات المعلوماتية. تتكيف Vim13 وVMamba14 مع بنية مامبا لمهام رؤية الحاسوب. يستخدم يو-مامبا15 بنية هجينة بين CNN–SSM لاستكشاف تطبيق SSMs في تقسيم الصور الطبية، بينما يعتمد مامبا-UNet16 بنية مشفر-فك تشفير تعتمد بالكامل على SSM لتقسيم الصور الطبية. تحقق هذه الطرق أداء تنافسيا مع استخدام معايير أقل بكثير. ومع ذلك، فإن الطرق الحالية القائمة على SSM/Mamba تستخرج بشكل أساسي ميزات الصورة باستخدام رقع صورة بسيطة واستراتيجيات مسح SS2D، مما يفرض عدة قيود على تقسيم الصور الطبية. أولا، تقنيات SS2D والتقنيات المعتمدة على الرقعة مصممة بشكل أساسي لمهام رؤية الحاسوب العامة. اقترحت تطبيقات Local Mamba17 وMotion Mamba18 أن استراتيجية المسح SS2D غير كافية لجميع المهام البصرية لأن استراتيجيات المسح المختلفة تلتقط أنواعا مختلفة من المعلومات البصرية. ثانيا، استراتيجية المسح بنظام SS2D بسيطة نسبيا، وتعتمد فقط على اتجاهات المسح الأفقي والعمودي. وبالتالي، قد لا يلتقط بشكل كاف العلاقات المكانية المعقدة والتفاصيل الهيكلية الدقيقة. يتطلب تقسيم الصور الطبية نمذجة متزامنة لكل من السياق المكاني العالمي والخصائص التشريحية المحلية الدقيقة. علاوة على ذلك، توفر الطرق الحالية القائمة على SSM/Mamba اندماجا محدودا للميزات بين المشفر ومفك الترميز. تعمل البنى مثل UNet++ وFATNet على تحسين دقة التقسيم من خلال دمج الميزات، مما يبرز أهمية التكامل الفعال للميزات في تقسيم الصور الطبية.
لمعالجة هذه القيود، تقترح هذه الورقة إطار عمل جديد لتقسيم الصور الطبية يعتمد على مامبا، يسمى MVM-UNet. كما هو موضح في الشكل 1، تعد وحدة العرض المتعددة متعددة الاتجاهات المقترحة (MV4D) المكون الأساسي لاستخراج الميزات في MVM-UNet، وهي مصممة خصيصا لتقسيم الصور الطبية من خلال دمج المعلومات من أربع استراتيجيات مسح مميزة. كل استراتيجية مسح تستخرج ميزات صورة مكملة وتمثل رؤية مختلفة للصورة المدخلة. يقوم المسح المتعرجرقم 19 بالتناوب بين اتجاه العبور في نهاية كل صف أو عمود، مما يوازن بين المعلومات المكانية المحلية والعالمية. على النقيض من ذلك، توفر مخططات المسح الحلزونيوالشعاعي 20 تغطية شاملة من خلال الامتداد إما للخارج من المركز أو إلى الداخل من المحيط. يلتقط المسح الهرمي18 ميزات محلية وعالمية على مقاييس متعددة. لتحسين متانة كل استراتيجية مسح، يتم دمج أزواج المسح قبل إدخالها في كتلة S6. تقوم وحدة Scan-view Fusion Mamba (SFusion Mamba) بدمج الميزات المستخرجة من أنماط المسح الأربعة. للاستفادة الفعالة من ميزات الترميز متعدد المقاييس، تقترح هذه الورقة أيضا وحدة دمج مامبا متعددة المقاييس (MFusion Mamba)، التي تجمع وتدمج مخرجات كل مرحلة من مراحل المشفر قبل تمرير الميزات المدمجة إلى جهاز فك الترميز. تم تقييم MVM-UNet في مجموعات بيانات ISIC 2017، ISIC 2018، ومجموعات بيانات Synapse. تظهر النتائج التجريبية أن MVM-UNet يحقق أداء تنافسي في تقسيم البيانات في مجموعات بيانات ISIC 2017 وISIC 2018 وSynapse.
وقد طورت هياكل التقسيم التمثيلي تقسيم الصور الطبية بشكل أكبر. كما تم تطبيق U-Net بنجاح في مهام تحليل الصور الطبية الحيوية مثل عد الخلايا، والكشف، والقياس الشكلي21. تعمل هياكل CNN المحسنة بالانتباه، مثل CA-Net22، على تحسين تمثيل الميزات من خلال آليات انتباه شاملة. تظهر أطر التقسيم المعتمدة على المحول التمثيلي، بما في ذلك TransUNet23، Pyramid Medical Transformer24، Swin U-Net25، TransAttUNet26، وTransCUNet27، فعالية نمذجة الميزات العالمية القائمة على الانتباه في تقسيم الصور الطبية.
تصميم MVM-UNet مدفوع بقيدين لطرق التقسيم القائمة على SSM/Mamba الحالية. أولا، تعتمد العديد من نماذج فيجن مامبا الحالية على استراتيجيات مسح ثنائية الأبعاد بسيطة، والتي قد لا تكون كافية للصور الطبية التي تحتوي على حدود غير منتظمة للآفات، ومناطق هدف صغيرة، وهياكل تشريحية متعددة المقاييس. ثانيا، تنقل بنى المشفر-فك التشفير التقليدية على شكل حرف U الميزات بشكل أساسي عبر اتصالات تخطي مقابلة، مما يحد من الاستخدام المباشر لمعلومات الترميز متعدد المراحل أثناء فك الترميز. لذلك، تقدم MVM-UNet MV4D لتعزيز النمذجة المكانية متعددة الرؤية، وMFusion Mamba لتجميع ميزات الترميز متعدد المراحل بشكل صريح. يهدف هذا التصميم إلى تكييف النمذجة طويلة المدى المعتمدة على مامبا لتلبية المتطلبات الخاصة لتقسيم الصور الطبية.
على الرغم من أن MVM-UNet مبني على نموذج المشفر-مفكك العام ونمذجة التسلسل المعتمدة على مامبا، إلا أن جداته تكمن في كيفية تكييف هذه المكونات ودمجها لتقسيم الصور الطبية. بدلا من دمج كتلة مامبا القياسية في شبكة على شكل حرف U، يعيد الإطار المقترح تصميم عملية النمذجة المكانية من خلال فروع متعددة موجهة نحو أزواج المسح الموجهة، ويقدم SFusion Mamba لدمج التمثيلات الخاصة بالمسح، ويعزز كتلة MVV بمسارات متبقية وإسقاط، ويدرج MFusion Mamba بين المشفر والمفكك لتجميع ميزات الترميز متعدد المراحل قبل فك الترميز. يهدف هذا التصميم على مستوى الهيكل إلى معالجة الحدود غير المنتظمة، والمناطق المستهدفة الصغيرة، والهياكل التشريحية متعددة المقاييس التي تلاحظ عادة في الصور الطبية.
هذا البروتوكول مناسب جدا لمهام التقسيم التي تتطلب نمذجة متزامنة للمعلومات السياقية بعيدة المدى، وحدود الأجسام غير المنتظمة، والهياكل التشريحية متعددة المقاييس في الصور الطبية ثنائية الأبعاد. مقارنة بطرق التقسيم المعتمدة على CNN، يوفر تصميم المشفر-فك التشفير القائم على مامبا آلية فعالة لنمذجة السياق مع الحفاظ على سير عمل على شكل حرف U مألوف لباحثي تقسيم الصور الطبية. مقارنة بطرق الترانسفورمر، يتجنب الإطار المقترح الاستخدام المباشر للانتباه الذاتي التربيعي ويهدف إلى الباحثين الباحثين الباحثين عن نمذجة سياقية عالمية باستخدام آلية نمذجة تسلسلية فعالة نسبيا. وبناء عليه، فإن هذا البروتوكول مناسب لتقسيم آفات الجلد، وتقسيم الأعضاء البطنية، ومهام تقسيم الصور الطبية ثنائية الأبعاد المشابهة التي تكون فيها المعلومات الهيكلية العالمية وتفاصيل الحدود المحلية مهمة.
هذا البروتوكول له قيود يجب أخذها في الاعتبار قبل الاستخدام. قد لا يكون ذلك ضروريا لمهام تقسيم بسيطة نسبيا حيث يوفر CNN خفيف الوزن أداء كافيا بالفعل. بالإضافة إلى ذلك، فهي ليست مصممة مباشرة للتقسيم الحجمي ثلاثي الأبعاد الكامل دون تكييف معماري. يجب على الباحثين الذين لديهم بيانات مشروحة محدودة جدا، أو موارد وحدات معالجة الرسومات (GPU) محدودة، أو متطلبات نماذج كلاسيكية قابلة للتفسير عاليا، أن يأخذوا هذه القيود في الاعتبار قبل تطبيق البروتوكول. بشكل عام، تهدف هذه الطريقة إلى الباحثين الذين يسعون لإعادة إنتاج وتقييم إطار تقسيم على شكل حرف U قائم على مامبا يوازن بين النمذجة السياقية طويلة المدى، وتمثيل الحدود المحلية، ودمج الميزات متعددة المراحل.
المساهمات الرئيسية هي كما يلي:
1. تقدم هذه الورقة إطار عمل جديد لتقسيم الصور الطبية القائمة على مامبا، يسمى MVM-UNet. على عكس الأساليب التي تدمج مباشرة كتل مامبا القائمة القائمة على SS2D أو القياسية، يقدم MVM-UNet ميزات MV4D لنماذج الصور الطبية من أربع عروض زوج مسح مكملة، بما في ذلك المسح المتعرج، والهرمي، واللولبي، والشعاعي.
2. تصميم هذه الورقة SFusion Mamba وكتلة MVV لدمج التمثيلات الخاصة بالمسح وتعزيز تحويل الميزات. تدمج SFusion Mamba الميزات المستخرجة من فروع أزواج المسح المختلفة، بينما توفر فروع الإسقاط المتبقية وUp-Down ضمن كتلة MVV مسارات ميزات مكملة تستقر وتثري تمثيلات الميزات.
3. تقدم هذه الورقة MFusion Mamba كوحدة اندماج متعددة المراحل وسيطة بين المشفر والمفكك. على عكس اتصالات التخطي التقليدية التي تنقل بشكل أساسي ميزات المراحل المقابلة للترميز، يقوم MFusion Mamba بتجميع ميزات الترميز متعدد المراحل بشكل صريح من خلال دمج خشن إلى دقيق ويوفر معلومات غنية لفك الترميز.
4. تظهر النتائج التجريبية الواسعة أن MVM-UNet المقترح يحقق أداء تنافسية في تقسيم البيانات في مجموعتي بيانات ISIC 2017 وISIC 2018 وأداء قويا في مجموعة بيانات تقسيم أعضاء Synapse المتعددة. علاوة على ذلك، تثبت الدراسات الشاملة للاستئصال مساهمة كل مكون ضمن MVM-UNet.
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
استخدمت هذه الدراسة فقط مجموعات بيانات الصور الطبية المتاحة للجمهور وغير المحددة الهوية، بما في ذلك ISIC 2017، ISIC 2018، وSynapse. لم يتم جمع أي مشاركين بشريين جدد، أو مواضيع حيوانات، أو سجلات طبية خاصة يمكن التعرف عليها في هذه الدراسة. كانت مجموعة بيانات ISIC 2017 المستخدمة في هذه الدراسة هي مجموعة بيانات تقسيم آفات الجلد لتحدي ISIC 2017، والتي تم الحصول عليها من مستودع بيانات تحدي التعاون الدولي لتصوير الجلد (https://challenge.isic-archive.com/data/#2017). النسخة المستخدمة في هذه الدراسة تتوافق مع مهمة تقسيم الآفة في ISIC 2017، بما في ذلك الأقسام الرسمية للتدريب، والتحقق، والاختبار. تم تحميل مجموعة البيانات في 15 مارس 2024. مجموعة بيانات ISIC 2018 المستخدمة في هذه الدراسة كانت مجموعة بيانات تقسيم حدود الآفة لمهمة التحدي 1 لمهمة ISIC 2018، والتي تم الحصول عليها من مستودع بيانات تحدي التعاون الدولي لتصوير الجلد (https://challenge.isic-archive.com/data/#2018). نسخة مجموعة البيانات المستخدمة في هذه الدراسة تتوافق مع مهمة ISIC 2018 1: تقسيم حدود الآفات. تم تحميل مجموعة البيانات في 8 يوليو 2024.
كانت مجموعة بيانات المشابك العصبية المستخدمة في هذه الدراسة هي مجموعة بيانات التصوير المقطعي المقطعي البطني متعدد الأطلس بخلاف القبو الجمجمي، والتي تم الحصول عليها من مستودع السينابس تحت معرف الإدخال syn3193805 (https://www.synapse.org/Synapse:syn3193805). تتوافق مجموعة البيانات المستخدمة في هذه الدراسة مع مجموعة بيانات تقسيم الأعضاء متعددة الأعضاء المقطعية المقطعية البطنية ذات 30 حالة شائعة. الأرشيف الذي تم تنزيله كان Abdomen/RawData.zip، متوفر تحت نظام accession syn3193805. لم يتم توفير رقم إصدار منفصل أو تسمية إصدار أو علامة إصدار مؤرخة من قبل المستودع وقت التنزيل. وفقا للتقسيم القياسي المعتمد في الدراسات السابقة، تم استخدام 18 حالة للتدريب و12 حالة للاختبار. تبع تقسيم البيانات قائمة الحالات المستخدمة في TransUNet23. تحديدا، كانت حالات التدريب هي case0031، case0007، case0009، case0005، case0026، case0039، case0024، case0034، case0033، case0030، case0023، case0040، case0010، case0021، case0006، case0027، case0028، و case0037، بينما كانت حالات الاختبار هي case0008، case0022، case0038، case0036، case0032، case0002، case0029، case0003، case0001، case0004، case0025، و case0035. تم تحميل مجموعة البيانات في 9 يوليو 2024. نظرا لأن هذه الدراسة استخدمت مجموعات بيانات متاحة للجمهور فقط ولم تتضمن جمع بيانات جديدة من البشر أو معلومات خاصة قابلة للتعريف، لم تكن هناك حاجة لموافقة لجنة المراجعة المؤسسية للتجارب الحسابية الموصوفة في هذا البروتوكول. لم يتم الحصول على قرار رسمي مكتوب للإعفاء المؤسسي. إذا تطلب ذلك السياسة المؤسسية المحلية، يجب على الباحثين الحصول على تحديد إعفاء مؤسسي قبل إجراء تحليلات ثانوية لمجموعات البيانات المتاحة للجمهور. لم يكن هناك رقم مرجعي للاستثناء الأخلاقي المؤسسي أو وثائق رسمية للاستثناء لهذه الدراسة.
1. إعداد مجموعات البيانات
(1)2. بناء عمارة MVM-UNet
Here, C = 96.
التنبؤ ∈ RB×H×W×K. هنا، K = 1 لتقسيم الآفات الثنائية وK = 8 لتقسيم الأعضاء المتعددة للمشابك العصبية.
الشكل 2. البنية العامة لشبكة مامبا متعددة الرؤية (MVM-UNet). نظرة عامة على بنية شبكة مامبا U-Net متعددة الرؤية المقترحة (MVM-UNet). يتم تحويل صورة الإدخال إلى تجمعات الpatch ومعالجتها عبر أربع مراحل ترميز مكونة من كتل Multi-View Vision (MVV) مفصولة بواسطة عمليات دمج الرقعة. يتم تجميع ميزات المشفر بواسطة مامبا الاندماج متعدد المراحل (MFusion Mamba) وتنتقل إلى جهاز فك التشفير عبر اتصالات تخطي. يقوم جهاز فك الترميز باستعادة الدقة المكانية تدريجيا باستخدام عمليات توسيع الرقعة ويولد خريطة التقسيم النهائية عبر طبقة الإسقاط. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
3. بناء وحدة MV4D

الشكل 3. بنية وحدة العرض متعدد الاتجاهات (MV4D). هيكل وحدة استخراج الميزات متعددة الرؤية رباعية الاتجاه (MV4D). تتم معالجة رقع الإدخال من خلال أربعة فروع مكملة من أزواج المسح، بما في ذلك المسح المتعرج، الهرمي، الحلزوني، والشعاعي. يتم دمج الميزات المستخرجة من الفروع الأربعة، ومعالجتها باستخدام كتل فضاء الحالة، ودمجها بواسطة Spatial Fusion Mamba (SFusion Mamba) لتوليد تمثيل ميزات الإخراج. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
4. بناء مبنى MVV

الشكل 4. هيكلية كتلة الرؤية متعددة الرؤى (MVV). هيكل كتلة الرؤية متعددة الرؤى (MVV). تتكون الكتلة من فرع رئيسي لاستخراج الميزات يحتوي على وحدة متعددة الرؤية رباعية الاتجاهات (MV4D) إلى جانب طبقات الالتفاف العميق، والتطبيع، والإسقاط الخطي. يوفر فرع إسقاط مساعد للأعلى إلى الأسفل تعديل الميزات المبوابة من خلال الضرب عنصريا قبل الجمع المتبقي لتوليد تمثيل الميزة المخرجة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
5. بناء MFusion Mamba

الشكل 5. بنية وحدة مامبا الاندماج متعددة المراحل (MFusion Mamba). هيكل وحدة مامبا الاندماج متعددة المراحل (MFusion Mamba). يتم دمج ميزات المشفر متعددة المقاييس أولا عن طريق الاندماج الخشن ثم يتم تحسينها من خلال وحدة الاندماج الدقيق التي تتكون من إسقاط خطي، والالتفاف أحادي البعد (Conv1d)، وكتلة مامبا، وطبقات إسقاط الميزات قبل توليد تمثيل الميزات المندمجة المستخدم في جهاز فك الترميز. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
6. تدريب النماذج
7. تقييم النموذج
(2)
(3)
(4)
(5)
(6)8. تعريف دالة الخسارة
(7)
(8)
(9)
(10)
(11)
يكون 1 = 1.0 و
2 = 1.0. اضبط أوزان فقدان CE وDice إلى 1.0 لSynapse، بحيث φ1 = 1.0 that و φ2 = 1.0.9. إعدادات قابلية التكرار والتنفيذ
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
النتائج المتوقعة والتفسير
عندما يتم تنفيذ هذا البروتوكول بشكل صحيح، من المتوقع أن ينتج نموذج MVM-UNet المدرب أداء تقسيم مستقر عبر عمليات متكررة، مع اختلافات بسيطة فقط بين البذور العشوائية المختلفة لمعظم مقاييس التقييم. بالنسبة لمعايير ISIC 2017 وISIC 2018، تنعكس النتائج الناجحة في قيم DSC وmIoU وAcc وSen وSpe مرتفعة، إلى جانب أقنعة آفات متوقعة تتبع عن كثب حدود الآفات الأرضية والحقيقة (الأشكال 6 و7). بالنسبة للسينابس، تنعكس النتائج الناجحة في متوسط قيم...
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
يصف هذا البروتوكول إطار عمل MVM-UNet، وهو إطار عمل لتقسيم الصور الطبية يعتمد على مامبا. تم تصميم الطريقة لمعالجة محدودين في نماذج التقسيم الحالية. أولا، الطرق التقليدية المعتمدة على CNN لديها قدرة محدودة على نمذجة التبعيات طويلة المدى والمعلومات السياقية الهرمية في الصور الطبية المعقدة43. ثانيا، يمكن للطرق المعتمدة على المحولات نمذجة السياق العالمي لكنها عادة ما تتطلب تكلفة حسابية أعلى23,25. يستخدم MVM-UNe...
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
يعلن المؤلفون أنه لا توجد لديهم مصالح مالية متنافسة.
لم يحصل هذا البحث على تمويل خارجي.
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| Hardware - GPU workstation or GPU server | Institutional computing platform / local workstation | Custom-built local GPU workstation; Ubuntu 22.04.1 with Linux kernel 6.8.0; Intel Core i9-13900K CPU; NVIDIA A800 GPU; 128 GB RAM; 512 GB local storage. | Computational platform for training, validation, testing, ablation, and inference-only experiments. |
| Hardware - Graphics processing unit (GPU) | NVIDIA Corporation | NVIDIA A800 GPU (80 GB memory). | GPU-accelerated model training and inference. |
| Hardware - Central processing unit (CPU) | Intel Corporation / AMD | 13th Gen Intel Core i9-13900K CPU. | Host processor for data loading, preprocessing, and experiment execution. |
| Hardware - System memory (RAM) | Institutional computing platform / local workstation | 128 GB system RAM | Memory for dataset loading, preprocessing, and training. |
| Hardware - Storage | Institutional computing platform / local workstation | 2 TB NVMe solid-state drive. | Storage for datasets, checkpoints, logs, and generated prediction figures. |
| Software environment - Operating system | Canonical Ltd. | Recommended: Ubuntu 22.04.1 LTS | Operating system for the computational environment. |
| Software environment - Conda environment | Anaconda, Inc. / Miniconda | Environment name: mvmunet | Python environment used to install and isolate dependencies. |
| Software environment - Python | Python Software Foundation | Python 3.8 | Programming language used for implementation and experiment execution. |
| Software environment - CUDA toolkit | NVIDIA Corporation | CUDA Toolkit 11.8 | GPU computing backend required by PyTorch and Mamba-related packages. |
| Software environment - cuDNN | NVIDIA Corporation | cuDNN 8.7.0. | GPU-accelerated deep-learning primitives used through PyTorch. |
| Python package - PyTorch | PyTorch | torch == 2.0.1 | Deep-learning framework for model training, loss calculation, optimization, and inference. |
| Python package - Torchvision | PyTorch | torchvision == 0.14.0 | Image transform utilities used in preprocessing and augmentation. |
| Python package - Torchaudio | PyTorch | torchaudio == 0.13.0 | Installed with the recommended PyTorch environment. |
| Python package - timm | timm developers | timm == 0.4.12 | Model-component or utility dependency listed in the repository environment instructions. |
| Python package - triton | OpenAI / Triton developers | triton == 2.0.0 | Dependency used by GPU-accelerated sequence modeling components. |
| Python package - causal-conv1d | causal-conv1d developers | causal_conv1d == 1.0.0 | Efficient causal convolution dependency required by the Mamba implementation. |
| Python package - mamba-ssm | Mamba SSM developers | mamba_ssm == 1.0.1 | State-space sequence modeling package used for Mamba/S6-related components. |
| Python package - NumPy | NumPy developers | NumPy version 1.24.3. | Numerical computation and array operations. |
| Python package - SciPy | SciPy developers | SciPy version 1.10.1. | Scientific computation; scipy.ndimage.zoom is imported in utils.py. |
| Python package - SimpleITK | Insight Software Consortium | SimpleITK version 2.2.1. | Medical image input/output and preprocessing utility imported in utils.py. |
| Python package - MedPy | MedPy developers | MedPy version 0.4.0. | Medical image metric calculation package imported in utils.py. |
| Python package - scikit-image | scikit-image developers | scikit-image version 0.21.0. | Image-processing dependency listed in README. |
| Python package - scikit-learn | scikit-learn developers | scikit-learn version 1.3.2. | Machine-learning utility package listed in README. |
| Python package - matplotlib | Matplotlib developers | Matplotlib version 3.7.2. | Used for saving qualitative visualization figures. |
| Python package - h5py | h5py developers | h5py version 3.9.0. | HDF5 file support for Synapse test volumes. |
| Python package - thop | THOP developers | THOP version 0.1.1.post2209072238. | Used when calculating FLOPs and parameter-related computational cost. |
| Python package - packaging | Python Packaging Authority | packaging version 23.1. | Dependency listed in README. |
| Python package - pytest | pytest developers | pytest version 7.4.0. | Dependency listed in README. |
| Python package - chardet | chardet developers | chardet version 5.2.0. | Dependency listed in README. |
| Python package - yacs | YACS developers | yacs version 0.1.8. | Configuration utility dependency listed in README. |
| Python package - termcolor | termcolor developers | termcolor version 2.3.0. | Logging/terminal utility dependency listed in README. |
| Python package - submitit | submitit developers | submitit version 1.4.5. | Experiment/job utility dependency listed in README. |
| Python package - tensorboardX | tensorboardX developers | tensorboardX version 2.6.2.2. | Training log visualization utility listed in README. |
| Python package - ml-collections | ml_collections developers | ml-collections version 0.1.1. | Imported by configs/config_setting_synapse.py. |
| Dataset - ISIC 2017 Challenge dataset | International Skin Imaging Collaboration | ISIC 2017 skin lesion segmentation dataset | Public de-identified dermoscopic skin lesion images and masks used for binary segmentation. |
| Dataset - ISIC 2018 Challenge Task 1 dataset | International Skin Imaging Collaboration | ISIC 2018 Task 1: Lesion Boundary Segmentation | Public de-identified dermoscopic skin lesion images and masks used for binary segmentation. |
| Dataset - Synapse Multi-Atlas Labeling Beyond the Cranial Vault dataset | Synapse / Sage Bionetworks | Accession identifier: syn3193805 | Public abdominal CT multi-organ segmentation dataset. |
| Data organization - ISIC 2017 data folder | Authors / repository layout | data/isic2017/ | Expected local folder containing train and validation images/masks. |
| Data organization - ISIC 2018 data folder | Authors / repository layout | data/isic2018/ | Expected local folder containing train and validation images/masks. |
| Data organization - Synapse data folder | Authors / repository layout | data/Synapse/ | Expected local folder for Synapse lists, train_npz, and test_vol_h5. |
| Source code - MVM-UNet source-code repository | Authors / GitHub | Branch: master;Git commit hash: ee891b42c2f083c4990eed72f1d4463adc5e103e. | Complete source-code implementation of the protocol. |
| Source code - ISIC configuration file | Authors | configs/config_setting.py | Configuration file for ISIC-style binary segmentation. |
| Source code - Synapse configuration file | Authors | configs/config_setting_synapse.py | Configuration file for Synapse multi-organ segmentation. |
| Source code - ISIC training script | Authors | train.py | Training and validation entry point for ISIC-style binary segmentation. |
| Source code - Synapse training script | Authors | train_synapse.py | Training and validation entry point for Synapse multi-class segmentation. |
| Source code - |
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.