פרוטוקול זה מתאר כיצד לבנות, לאמן ולהעריך מסגרת רשת U-Shape של Vision Mamba רב-תצפית לחלוקת תמונות רפואיות, המאפשרת סגמנטציה שחזורית של נגעי עור ואיברי בטן באמצעות הכנת מערכי נתונים סטנדרטיים, יישום מודלים והערכת ביצועים.
הרשמה ל-JoVE נדרשת לצפייה בתוכן זה. התחברו או התחילו בגרסת ניסיון בחינם.
מאמר שיטה
פרוטוקול זה מתאר כיצד לבנות, לאמן ולהעריך מסגרת רשת U-Shape של Vision Mamba רב-תצפית לחלוקת תמונות רפואיות, המאפשרת סגמנטציה שחזורית של נגעי עור ואיברי בטן באמצעות הכנת מערכי נתונים סטנדרטיים, יישום מודלים והערכת ביצועים.
סגמנטציה של תמונות רפואיות דורשת שיטות חישוביות שתופסות במדויק הקשר גלובלי, גבולות מקומיים ומבנים אנטומיים רב-סקאליים, תוך שמירה על שחזור ביישומים שונים. מאמר זה מציג פרוטוקול לבניה, הדרכה והערכה של מסגרת רשת U-Shape של Vision Mamba רב-תצוגה לחלוקת תמונות רפואיות דו-ממדיות. הפרוטוקול מספק תהליך עבודה שניתן לשחזר הכולל רכישת מערכי נתונים ציבוריים, עיבוד מוקדם של תמונות ומסכה, בניית רשת, הדרכת מודלים, בחירת נקודות ביקורת, והערכת ביצועים כמותית ואיכותית. המסגרת משלבת סריקת תכונות מרובת תצוגה ללכידת מידע משלים על מרחב, קווי מתאר, קנה מידה וגבולות, ומיישמת מיזוג תכונות רב-שלבי בתוך ארכיטקטורת מקודד-מפענח בצורת U לשיפור האינטגרציה של תכונות במהלך סגמנטציה. הפרוטוקול מודגם באמצעות מאגרי נתונים זמינים לציבור על נגעי עור וחלוקת איברי בטן. במסגרת זרימת היישום המתוארת, המסגרת משיגה ביצועי סגמנטציה תחרותיים באמצעות מדדי הערכה סטנדרטיים. על ידי מעקב אחר הנהלים המוצגים בפרוטוקול זה, חוקרים יכולים לשחזר את מימוש המודל, לאמן את הרשת באמצעות הגדרות ניסוי מוגדרות, להעריך את ביצועי הסגמנטציה ולהתאים את זרימת העבודה למשימות סגמנטציה רפואיות קשורות הדורשות ניתנת לשחזור ניתנת לניתוח מבוסס למידה עמוקה.
סגמנטציה של תמונות רפואיות היא משימה יסודית בתחומי ראיית המחשב וניתוח תמונות רפואיות 1,2,3. זה כולל חלוקת תמונה לאזורים או אובייקטים מרובים לניתוח ועיבוד נוספים. טכנולוגיה זו חשובה במיוחד בהדמיה רפואית משום שהיא מסייעת לרופאים לזהות ולאתר אזורים פתולוגיים, ובכך משפרת את הדיוק האבחוני ותכנון הטיפול. עם התקדמות טכנולוגיות הדמיה רפואית, כגון הדמיית תהודה מגנטית (MRI), טומוגרפיה ממוחשבת (CT) וטומוגרפיית פליטת פוזיטרונים (PET), הביקוש לטכניקות סגמנטציה מדויקות של תמונות רפואיות המשיך לעלות. השיטות הנוכחיות לסגמנטציה של תמונות רפואיות ניתנות לסיווג כללי לשלוש גישות עיקריות: שיטות מבוססות רשת עצבית קונבולוציונית (CNN)4, שיטות מבוססות טרנספורמר5, ושיטות מבוססות מודל-מרחב מצבים (SSM) 6,7. שיטות מבוססות CNN משתמשות בדרך כלל בארכיטקטורות רשת בצורת U לחלוקת תמונות רפואיות. הארכיטקטורה הנפוצה ביותר בקטגוריה זו היא U-Net8, שהדגימה את היעילות של ארכיטקטורת מקודד-מפענח בצורת U לסגמנטציה של תמונות ביו-רפואיות. U-Net3+ משלבת חיבורי דילוגים צפופים מ-UNet++9 עם חיבורי דילוג בקנה מידה מלא כדי לשפר את אגרגציית התכונות הרב-קניות. עם זאת, לשיטות מבוססות CNN יש יכולת מוגבלת ללכוד תלויות לטווח ארוך, ולכן ייתכן שאינן מודלים ביעילות מידע הקשרי לטווח ארוך.
שיטות מבוססות טרנספורמרים לוכדות ביעילות תלות לטווח ארוך באמצעות מנגנון תשומת הלב העצמית, שמאפשר חישוב מקבילי ומקצה משקלי תשומת לב שונים לאזורים שונים של עניין. UNETR++10 מציג את מודול תשומת לב זוגית יעילה (EPA) כדי להפחית את מספר הפרמטרים והעלות החישובית. nnFormer11 משלבת פעולות קונבולוציונליות משולבות וריכוז עצמי ומציגה מנגנון תשומת לב עצמי מבוסס נפח מקומי-גלובלי ללמידת ייצוגים וולומטריים בסגמנטציה תלת-ממדית (תלת-ממדית) של תמונות רפואיות. H2Former12 מציע משמר ראייה היברידי היררכי יעיל המשלב מנגנוני קשב עם חילוץ תכונות מבוסס CNN במקודד. עם זאת, שיטות מבוססות טרנספורמר מציגות מורכבות חישובית ריבועית עם עלייה באורך הרצף, מה שמוביל לעלות חישובית גבוהה משמעותית. איור 1 ממחיש את המוטיבציה ל-MVM-UNet ומשווה את אסטרטגיית הסריקה הרב-תצוגה המוצעת למסגרות סגמנטציה קיימות מבוססות SSM.

איור 1. השוואה בין MVM-UNet לבין ארכיטקטורות סגמנטציה מבוססות מודל מצב-מרחב טהור (SSM) קיימות. השוואה בין מסגרת סגמנטציה קונבנציונלית המבוססת על מודל מצב טהור (SSM) לבין ארכיטקטורת Multi-View Mamba U-Net (MVM-UNet) המוצעת. הפאנל העליון ממחיש את MVM-UNet, שבו מודול Multi-View 4-Directional (MV4D) מפיק תכונות משלימות באמצעות זוגות סריקה זיגזג, היררכיים, ספירליים ורדיאליים, המשולבים על ידי Spatial Fusion Mamba (SFusion Mamba), בעוד ש-Multi-stage Fusion Mamba (MFusion Mamba) מאגד תכונות מקודד רב-סקאלה לפני הפענוח. הפאנל התחתון מציג ארכיטקטורה מייצגת מבוססת SSM טהורה המשתמשת במודולי סריקה סלקטיבית דו-ממדית (SS2D) עם סריקה צולבת. התרשים מדגיש את ההבדלים האדריכליים בין רשתות סגמנטציה מבוססות SSM קונבנציונליות לבין ה-MVM-UNet המוצע. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
שיטות מבוססות SSM משלבות את יכולת המידול הגלובלית של טרנספורמרים עם מורכבות חישובית ליניארית. ארכיטקטורת הממבה מעבדת באופן סלקטיבי מידע קלט באמצעות מודל מרחב מצבים סלקטיבי (Selective-SSM), המאפשר למודל להתאים את הפרמטרים שלו באופן דינמי בהתאם לקלט, תוך סינון מידע לא רלוונטי והדגשת תכונות אינפורמטיביות. Vim13 ו-VMamba14 מתאימים את ארכיטקטורת הממבה למשימות ראייה ממוחשבת. U-Mamba15 עושה שימוש בארכיטקטורת CNN–SSM היברידית כדי לחקור את יישום SSMs בחלוקת תמונות רפואיות, בעוד שמאמבה-UNet16 מאמץ ארכיטקטורת מקודד-מפענח מבוססת SSM לחלוטין לפיצול תמונות רפואיות. שיטות אלו משיגות ביצועים תחרותיים תוך שימוש בפרמטרים קטנים בהרבה. עם זאת, שיטות מבוססות SSM/Mamba כיום בעיקר מפיקות תכונות תמונה באמצעות פאצ'ים פשוטים של תמונה ואסטרטגיות סריקה SS2D, אשר מציבות מספר מגבלות לסגמנטציה רפואית של תמונות. ראשית, SS2D וטכניקות מבוססות פאץ' מיועדות בעיקר למשימות ראייה ממוחשבת כלליות. Local Mamba17 ו-MotionMamba 18 הציעו כי אסטרטגיית הסריקה SS2D אינה מספקת לכל המשימות הוויזואליות, משום שאסטרטגיות סריקה שונות לוכדות סוגים שונים של מידע חזותי. שנית, אסטרטגיית הסריקה של SS2D פשוטה יחסית, ומתבססת רק על כיווני סריקה אופקיים ואנכיים. כתוצאה מכך, ייתכן שהוא לא מצליח ללכוד כראוי יחסים מרחביים מורכבים ופרטים מבניים עדינים. סגמנטציה רפואית של תמונות דורשת מידול סימולטני של הקשר מרחבי גלובלי ושל תכונות אנטומיות מקומיות מדויקות. יתרה מזאת, שיטות קיימות מבוססות SSM/Mamba מאפשרות מיזוג תכונות מוגבל בין המקודד למפענח. ארכיטקטורות כמו UNet++ ו-FATNet משפרות את דיוק הסגמנטציה באמצעות מיזוג תכונות משופר, ומדגישות את חשיבות האינטגרציה היעילה של תכונות לסגמנטציה של תמונות רפואיות.
כדי להתמודד עם מגבלות אלו, מאמר זה מציע מסגרת חדשה לחלוקת תמונות רפואיות מבוססת ממבה, הנקראת MVM-UNet. כפי שמוצג באיור 1, מודול MV4D המוצע ל-Multi-View Four-Directional משמש כרכיב הליבה לחילוץ תכונות ב-MVM-UNet ותוכנן במיוחד לחלוקת תמונות רפואיות על ידי שילוב מידע מארבע אסטרטגיות סריקה שונות. כל אסטרטגיית סריקה מפיקה תכונות תמונה משלימות ומייצגת תצוגה שונה של התמונה הנכנסת. סריקת זיגזג19 מחליפה את כיוון המעבר בסוף כל שורה או עמודה, ובכך מאזנת בין מידע מרחבי מקומי וגלובלי. לעומת זאת, סכמות הסריקה הספירליתוהרדיאלית 20 מספקות כיסוי מקיף על ידי התפשטות החוצה מהמרכז או פנימה מהפריפריה. סריקההיררכית 18 לוכדת תכונות מקומיות וגלובליות בקני מידה שונים. כדי לשפר את עמידות כל אסטרטגיית סריקה, זוגות סריקה ממזגים לפני ההזנה לבלוק S6. מודול Scan-view Fusion Mamba (SFusion Mamba) משלב לאחר מכן את התכונות שהופקו מארבעת מודאליות הסריקה. כדי לנצל בצורה יעילה תכונות מקודד רב-קניות, מאמר זה מציע בנוסף מודול מיזוג ממבה רב-קנה מידה (MFusion Mamba), שאוסף וממזג את הפלטים מכל שלב מקודד לפני שהוא מעביר את התכונות הממוזגות למפענח. MVM-UNet הוערך על פי מערכי הנתונים ISIC 2017, ISIC 2018 ו-Synapse. תוצאות ניסוי מראות ש-MVM-UNet משיג ביצועי סגמנטציה תחרותיים במאגרי הנתונים ISIC 2017, ISIC 2018 ו-Synapse.
ארכיטקטורות סגמנטציה מייצגות כוללות סגמנטציה רפואית מתקדמת עוד יותר. U-Net יושמה בהצלחה גם במשימות ניתוח תמונות ביו-רפואיות כגון ספירת תאים, זיהוי ומורפומטריה21. ארכיטקטורות CNN משודרגות על ידי תשומת לב, כמו CA-Net22, משפרות ייצוג תכונות באמצעות מנגנוני קשב מקיפים. מסגרות סגמנטציה מייצגות מבוססות טרנספורמר, כולל TransUNet23, Pyramid Medical Transformer24, Swin U-Net25, TransAttUNet26 ו-TransCUNet27, מדגימות עוד יותר את היעילות של מידול תכונות גלובלי מבוסס תשומת לב לסגמנטציה של תמונות רפואיות.
עיצוב MVM-UNet מונע משתי מגבלות של שיטות סגמנטציה קיימות מבוססות SSM/Mamba. ראשית, רבים מהמודלים הנוכחיים של Vision Mamba מסתמכים על אסטרטגיות סריקה דו-ממדיות פשוטות, שעשויות להיות בלתי מספקות לתמונות רפואיות המכילות גבולות נגעים לא סדירים, אזורי מטרה קטנים ומבנים אנטומיים רב-קנפיים. שנית, ארכיטקטורות מקודד-מפענח בצורת U קונבנציונליות מעבירות בעיקר תכונות דרך חיבורי דילוג מתאימים, מה שמגביל את השימוש הישיר במידע מקודד רב-שלבי במהלך הפענוח. לכן, MVM-UNet מציגה את MV4D לשיפור מידול מרחבי רב-תצוגה ואת MFusion Mamba לאגרגציה מפורשת של תכונות מקודד רב-שלבי. עיצוב זה נועד להתאים את המידול ארוך הטווח המבוסס ממבה לדרישות הספציפיות של סגמנטציה של תמונות רפואיות.
למרות ש-MVM-UNet בנוי על פרדיגמת המקודד-מקודד הכללית ומידול רצפים מבוסס ממבה, החידוש שלו טמון באופן שבו רכיבים אלו מותאמים ומשולבים לסגמנטציה רפואית של תמונות. במקום פשוט לשלב בלוק ממבה סטנדרטי בתוך עמוד שדרה בצורת U, המסגרת המוצעת מעצבת מחדש את תהליך המידול המרחבי באמצעות מספר ענפי זוג סריקה ממוקדי משימות, מציגה את SFusion Mamba לשילוב ייצוגים ספציפיים לסריקה, משפרת את בלוק MVV עם מסלולי שאריות והקרנה, ומכניסה את MFusion Mamba בין המקודד למפענח כדי לאגד תכונות מקודד רב-שלבי לפני הפענוח. עיצוב ברמת ארכיטקטורה זה שואף להתמודד עם גבולות לא סדירים, אזורי מטרה קטנים ומבנים אנטומיים רב-קנה מידה הנצפים בדרך כלל בתמונות רפואיות.
פרוטוקול זה מתאים במיוחד למשימות סגמנטציה הדורשות מידול סימולטני של מידע הקשרי לטווח ארוך, גבולות אובייקטים לא סדירים ומבנים אנטומיים רב-קנה מידה בתמונות רפואיות דו-ממדיות. בהשוואה לשיטות סגמנטציה מבוססות CNN, עיצוב המקודד-מפענח מבוסס ממבה מספק מנגנון יעיל למידול הקשר תוך שמירה על זרימת עבודה בצורת U המוכרת לחוקרי סגמנטציה רפואית. בהשוואה לשיטות מבוססות טרנספורמר, המסגרת המוצעת נמנעת משימוש ישיר בתשומת לב עצמית ריבועית ומיועדת לחוקרים המחפשים מידול הקשר גלובלי באמצעות מנגנון מידול רצף יעיל יחסית. בהתאם לכך, פרוטוקול זה מתאים לסגמנטציה של נגעי עור, חלוקת איברים בטניים ומשימות דו-ממדיות דומות של חלוקת תמונות רפואיות, שבהן חשוב גם מידע מבני גלובלי וגם פרטי גבול מקומיים.
לפרוטוקול זה יש גם מגבלות שיש לקחת בחשבון לפני השימוש. ייתכן שהוא לא נחוץ למשימות סגמנטציה פשוטות יחסית שבהן CNN קל משקל כבר מספק ביצועים מספקים. בנוסף, הוא אינו מתוכנן ישירות לסגמנטציה נפחית תלת-ממדית מלאה ללא התאמה אדריכלית. חוקרים עם נתונים מוגבלים מאוד עם הערות, משאבי יחידת עיבוד גרפיקה (GPU) מוגבלים, או דרישה למודלים קלאסיים ניתנים לפרשנות גבוהה, צריכים גם הם לשקול את המגבלות הללו לפני יישום הפרוטוקול. בסך הכול, שיטה זו מיועדת לחוקרים המעוניינים לשחזר ולהעריך מסגרת סגמנטציה בצורת U מבוססת ממבה, המאזנת בין מידול הקשר ארוך טווח, ייצוג גבולות מקומיים ומיזוג תכונות רב-שלביות.
התרומות המרכזיות הן כדלקמן:
1. מאמר זה מציג מסגרת חלוקה רפואית חדשנית מבוססת ממבה, הנקראת MVM-UNet. בניגוד לגישות שמשלבות ישירות בלוקי ממבה מבוססי SS2D או סטנדרטיים, MVM-UNet מציגה את MV4D למודלים של תכונות תמונה רפואיות מארבע תצוגות זוג סריקה משלימות, כולל זיגזג, היררכי, ספירלי ורדיאלי.
2. מאמר זה מעצב את SFusion Mamba ואת בלוק ה-MVV כדי לשלב ייצוגים ספציפיים לסריקה ולשפר את טרנספורמציית התכונות. SFusion Mamba מאחד את התכונות שהופקו מענפי זוגות סריקה שונים, בעוד שהענפים השאריים וההקרנה למעלה-למטה בתוך בלוק MVV מספקים מסלולי תכונות משלימים שמייצבים ומעשירים ייצוגים של תכונות.
3. מאמר זה מציג את MFusion Mamba כמודול מיזוג רב-שלבי ביניים בין המקודד למפענח. בניגוד לחיבורי דילוג קונבנציונליים שמעבירים בעיקר תכונות של שלבים תואמים, MFusion Mamba מאגד במפורש תכונות מקודד רב-שלבי באמצעות מיזוג גס לדק ומספק מידע מועשר לפענוח.
4. תוצאות ניסוי נרחבות מראות כי ה-MVM-UNet המוצע משיג ביצועי סגמנטציה תחרותית במאגרי ISIC 2017 ו-ISIC 2018 וביצועים חזקים במאגר הסגמנטציה הרב-איברי של Synapse. יתרה מזאת, מחקרי אבלציה מקיפים מאמתים את תרומתו של כל רכיב בתוך MVM-UNet.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
מחקר זה השתמש רק במאגרי תמונות רפואיות זמינים לציבור ולא מזוהים, כולל ISIC 2017, ISIC 2018 ו-Synapse. לא נאספו משתתפים אנושיים חדשים, נבדקים בעלי חיים או רשומות רפואיות פרטיות מזוהות במחקר זה. מאגר הנתונים של ISIC 2017 ששימש במחקר זה היה מאגר הסגמנטציה של פצעי העור ISIC 2017 Challenge, שהושג ממאגר הנתונים הרשמי של International Skin Imaging Collaboration Challenge (https://challenge.isic-archive.com/data/#2017). גרסת מערך הנתונים ששימשה במחקר זה תואמת למשימת חלוקת הנגעים של ISIC 2017, הכוללת את המחיצות הרשמיות של ההדרכה, האימות והבדיקה. מערך הנתונים הורד ב-15 במרץ 2024. מאגר הנתונים של ISIC 2018 ששימש במחקר זה היה מאגר הסגמנטציה של משימת 1 של ISIC Challenge Task 1, שהתקבל ממאגר הנתונים הרשמי של International Skin Imaging Collaboration (https://challenge.isic-archive.com/data/#2018). גרסת מערך הנתונים ששימשה במחקר זה תואמת למשימה 1 של ISIC 2018: סגמנטציה של גבול הנגעים. מערך הנתונים הורד ב-8 ביולי 2024.
מאגר הנתונים של סינפס ששימש במחקר זה היה Multi-Atlas Labeling Beyond the Cranial Vault הבטני CT, שהושג ממאגר הסינפס תחת מזהה accession syn3193805 (https://www.synapse.org/Synapse:syn3193805). מאגר הנתונים ששימש במחקר זה תואם למאגר הנתונים הנפוץ ל-30 מקרי CT בבטן עם סגמנטציה רב-איברית. הארכיון שהורד היה Abdomen/RawData.zip, שהיה זמין תחת סינת accession syn3193805. לא סופקו מספר גרסה נפרד, תווית שחרור או תג שחרור מתוארך על ידי המאגר בזמן ההורדה. בהתאם לחלוקה התקנית שאומצה במחקרים קודמים, 18 מקרים שימשו להכשרה ו-12 מקרים לבדיקה. חלוקת הנתונים התבצעה לפי רשימת המקרים שבה השתמשה TransUNet23. בפרט, תיקי ההכשרה היו case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028, ו-case0037, בעוד שהמקרים היו case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025, ו-case0035. מערך הנתונים הורד ב-9 ביולי 2024. מכיוון שמחקר זה השתמש רק במאגרי נתונים ציבוריים שלא מזוהים ולא כלל איסוף נתונים חדשים של נבדקים אנושיים או מידע פרטי מזוהה, לא נדרשה אישור ועדת ביקורת מוסדית לניסויים החישוביים המתוארים בפרוטוקול זה. לא התקבלה קביעת פטור מוסדית רשמית בכתב. אם נדרש על פי מדיניות מוסדית מקומית, על החוקרים לקבל קביעת פטור מוסדי לפני ביצוע ניתוחים משניים של מאגרי נתונים זמינים לציבור. לא היה זמין מספר הפניה לפטור אתי מוסדי או מסמכי פטור רשמיים למחקר זה.
1. הכנת מערכי נתונים
(1)2. בניית ארכיטקטורת MVM-UNet
את Here, C = 96.
החיזוי ∈ RB×H×W×K. כאן, K = 1 עבור סגמנטציה בינארית של נגעים ו-K = 8 עבור סגמנטציה מרובת איברים בסינפסה.
איור 2. הארכיטקטורה הכוללת של Mamba U-Net רב-תצוגה (MVM-UNet). סקירה של ארכיטקטורת ה-Mamba U-Net (MVM-UNet) המוצעת ב-Multi-View. תמונת הקלט מומרת להטמעות פאץ' ומעובדת דרך ארבעה שלבי מקודד המורכבים מבלוקי Multi-View Vision (MVV) המופרדים על ידי פעולות מיזוג פאצ'ים. תכונות המקודד מאוגדות על ידי ממבה מיזוג רב-שלבית (MFusion Mamba) ומועברות למפענח דרך חיבורי דילוג. המפענח משחזר בהדרגה את הרזולוציה המרחבית באמצעות פעולות הרחבת פאץ' ומייצר את מפת הסגמנטציה הסופית דרך שכבת ההקרנה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
3. בניית מודול MV4D

איור 3. ארכיטקטורת המודול הרב-תצוגה 4-כיוונית (MV4D). מבנה מודול חילוץ תכונות רב-תצוגה 4-כיוונית (MV4D). טלאי קלט מעובדים דרך ארבעה ענפי זוג סריקה משלימים הכוללים זיגזג, היררכי, ספירלי וסריקה רדיאלית. תכונות שמופקות מארבעת הענפים מאוחדות, מעובדות באמצעות בלוקי מרחב מצבים, ומשולבות על ידי Spatial Fusion Mamba (SFusion Mamba) ליצירת ייצוג תכונות הפלט. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
4. בניית בלוק MVV

איור 4. ארכיטקטורה של בלוק Multi-View Vision (MVV). מבנה בלוק החזון הרב-תצוגה (MVV). הבלוק מורכב מענף חילוץ תכונות עיקרי הכולל את מודול Multi-View 4-Directional (MV4D) יחד עם שכבות קונבולוציה עומקית, נרמול והקרנה ליניארית. ענף הקרנה עזרי למעלה למטה מספק מודולציה של תכונות עם שער באמצעות כפל לפי אלמנט לפני חיבור שאריתי ליצירת ייצוג תכונת הפלט. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
5. בניית MFusion Mamba

איור 5. ארכיטקטורת מודול ה-Multi-stage Fusion Mamba (MFusion Mamba). מבנה מודול ה-Multi-שלבי Fusion Mamba (MFusion Mamba). תכונות מקודד רב-קנה מידה משולבות תחילה באמצעות מיזוג גס ובהמשך מעודנות באמצעות מודול Fine Fusion הכולל הקרנה ליניארית, קונבולוציה חד-ממדית (Conv1d), בלוק ממבה ושכבות הקרנת תכונות לפני יצירת ייצוג התכונות הממוזגות של המפענח. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
6. אימון מודלים
7. הערכת מודלים
(2)
(3)
(4)
(5)
(6)8. הגדרת פונקציית אובדן
(7)
(8)
(9)
(10)
(11)
ש-1 = 1.0 ו-2
= 1.0. הגדר את משקלי הירידה של CE ו-Dice ל-1.0 עבור Synapse, כך φ1 = 1.0 ש ו-φ2 = 1.0.9. הגדרות שחזוריות וביצוע
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
תוצאות צפויות ופרשנות
כאשר פרוטוקול זה מיושם נכון, מודל MVM-UNet המאומן צפוי לייצר ביצועי סגמנטציה יציבים לאורך ריצות חזרות, עם שינויים קטנים בלבד בין זרעים אקראיים שונים ברוב מדדי ההערכה. עבור ISIC 2017 ו-ISIC 2018, תוצאות מוצלחות משתקפות בערכי DSC, mIoU, Acc, Sen ו-Spe גבוהים, יחד עם מסכות נגע חזויות העוקבות מקרוב אחרי גבולות הנגעים בין אמת קרקע (איורים 6 ו-7). עבור סינפסה, תוצאות מוצלחות משתקפות בערכי DSC ממוצעים גבוהים וערכי HD95 נמוכים ברחבי האיב...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
פרוטוקול זה מתאר את MVM-UNet, מסגרת סגמנטציה רפואית מבוססת ממבה. השיטה תוכננה כדי להתמודד עם שתי מגבלות של מודלים קיימים של סגמנטציה. ראשית, שיטות מבוססות CNN קונבנציונליות מוגבלות ביכולת למודל תלות לטווח ארוך ומידע היררכי הקשרי בתמונות רפואיות מורכבות43. שנית, שיטות מבוססות טרנספורמר יכולות למודל הקשר גלובלי אך בדרך כלל דורשות עלות חישובית גבוההיותר 23,25. MVM-UNet משתמשת בארכיטקטורת Mamba 13,14,15,16,17,...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
המחברים מצהירים שאין להם אינטרסים פיננסיים מתחרים.
מחקר זה לא קיבל מימון חיצוני.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| Hardware - GPU workstation or GPU server | Institutional computing platform / local workstation | Custom-built local GPU workstation; Ubuntu 22.04.1 with Linux kernel 6.8.0; Intel Core i9-13900K CPU; NVIDIA A800 GPU; 128 GB RAM; 512 GB local storage. | Computational platform for training, validation, testing, ablation, and inference-only experiments. |
| Hardware - Graphics processing unit (GPU) | NVIDIA Corporation | NVIDIA A800 GPU (80 GB memory). | GPU-accelerated model training and inference. |
| Hardware - Central processing unit (CPU) | Intel Corporation / AMD | 13th Gen Intel Core i9-13900K CPU. | Host processor for data loading, preprocessing, and experiment execution. |
| Hardware - System memory (RAM) | Institutional computing platform / local workstation | 128 GB system RAM | Memory for dataset loading, preprocessing, and training. |
| Hardware - Storage | Institutional computing platform / local workstation | 2 TB NVMe solid-state drive. | Storage for datasets, checkpoints, logs, and generated prediction figures. |
| Software environment - Operating system | Canonical Ltd. | Recommended: Ubuntu 22.04.1 LTS | Operating system for the computational environment. |
| Software environment - Conda environment | Anaconda, Inc. / Miniconda | Environment name: mvmunet | Python environment used to install and isolate dependencies. |
| Software environment - Python | Python Software Foundation | Python 3.8 | Programming language used for implementation and experiment execution. |
| Software environment - CUDA toolkit | NVIDIA Corporation | CUDA Toolkit 11.8 | GPU computing backend required by PyTorch and Mamba-related packages. |
| Software environment - cuDNN | NVIDIA Corporation | cuDNN 8.7.0. | GPU-accelerated deep-learning primitives used through PyTorch. |
| Python package - PyTorch | PyTorch | torch == 2.0.1 | Deep-learning framework for model training, loss calculation, optimization, and inference. |
| Python package - Torchvision | PyTorch | torchvision == 0.14.0 | Image transform utilities used in preprocessing and augmentation. |
| Python package - Torchaudio | PyTorch | torchaudio == 0.13.0 | Installed with the recommended PyTorch environment. |
| Python package - timm | timm developers | timm == 0.4.12 | Model-component or utility dependency listed in the repository environment instructions. |
| Python package - triton | OpenAI / Triton developers | triton == 2.0.0 | Dependency used by GPU-accelerated sequence modeling components. |
| Python package - causal-conv1d | causal-conv1d developers | causal_conv1d == 1.0.0 | Efficient causal convolution dependency required by the Mamba implementation. |
| Python package - mamba-ssm | Mamba SSM developers | mamba_ssm == 1.0.1 | State-space sequence modeling package used for Mamba/S6-related components. |
| Python package - NumPy | NumPy developers | NumPy version 1.24.3. | Numerical computation and array operations. |
| Python package - SciPy | SciPy developers | SciPy version 1.10.1. | Scientific computation; scipy.ndimage.zoom is imported in utils.py. |
| Python package - SimpleITK | Insight Software Consortium | SimpleITK version 2.2.1. | Medical image input/output and preprocessing utility imported in utils.py. |
| Python package - MedPy | MedPy developers | MedPy version 0.4.0. | Medical image metric calculation package imported in utils.py. |
| Python package - scikit-image | scikit-image developers | scikit-image version 0.21.0. | Image-processing dependency listed in README. |
| Python package - scikit-learn | scikit-learn developers | scikit-learn version 1.3.2. | Machine-learning utility package listed in README. |
| Python package - matplotlib | Matplotlib developers | Matplotlib version 3.7.2. | Used for saving qualitative visualization figures. |
| Python package - h5py | h5py developers | h5py version 3.9.0. | HDF5 file support for Synapse test volumes. |
| Python package - thop | THOP developers | THOP version 0.1.1.post2209072238. | Used when calculating FLOPs and parameter-related computational cost. |
| Python package - packaging | Python Packaging Authority | packaging version 23.1. | Dependency listed in README. |
| Python package - pytest | pytest developers | pytest version 7.4.0. | Dependency listed in README. |
| Python package - chardet | chardet developers | chardet version 5.2.0. | Dependency listed in README. |
| Python package - yacs | YACS developers | yacs version 0.1.8. | Configuration utility dependency listed in README. |
| Python package - termcolor | termcolor developers | termcolor version 2.3.0. | Logging/terminal utility dependency listed in README. |
| Python package - submitit | submitit developers | submitit version 1.4.5. | Experiment/job utility dependency listed in README. |
| Python package - tensorboardX | tensorboardX developers | tensorboardX version 2.6.2.2. | Training log visualization utility listed in README. |
| Python package - ml-collections | ml_collections developers | ml-collections version 0.1.1. | Imported by configs/config_setting_synapse.py. |
| Dataset - ISIC 2017 Challenge dataset | International Skin Imaging Collaboration | ISIC 2017 skin lesion segmentation dataset | Public de-identified dermoscopic skin lesion images and masks used for binary segmentation. |
| Dataset - ISIC 2018 Challenge Task 1 dataset | International Skin Imaging Collaboration | ISIC 2018 Task 1: Lesion Boundary Segmentation | Public de-identified dermoscopic skin lesion images and masks used for binary segmentation. |
| Dataset - Synapse Multi-Atlas Labeling Beyond the Cranial Vault dataset | Synapse / Sage Bionetworks | Accession identifier: syn3193805 | Public abdominal CT multi-organ segmentation dataset. |
| Data organization - ISIC 2017 data folder | Authors / repository layout | data/isic2017/ | Expected local folder containing train and validation images/masks. |
| Data organization - ISIC 2018 data folder | Authors / repository layout | data/isic2018/ | Expected local folder containing train and validation images/masks. |
| Data organization - Synapse data folder | Authors / repository layout | data/Synapse/ | Expected local folder for Synapse lists, train_npz, and test_vol_h |
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.