פרוטוקול זה מתאר כיצד לבנות, לאמן ולהעריך מסגרת רשת U-Shape של Vision Mamba רב-תצפית לחלוקת תמונות רפואיות, המאפשרת סגמנטציה שחזורית של נגעי עור ואיברי בטן באמצעות הכנת מערכי נתונים סטנדרטיים, יישום מודלים והערכת ביצועים.
מאמר שיטה
פרוטוקול זה מתאר כיצד לבנות, לאמן ולהעריך מסגרת רשת U-Shape של Vision Mamba רב-תצפית לחלוקת תמונות רפואיות, המאפשרת סגמנטציה שחזורית של נגעי עור ואיברי בטן באמצעות הכנת מערכי נתונים סטנדרטיים, יישום מודלים והערכת ביצועים.
סגמנטציה של תמונות רפואיות דורשת שיטות חישוביות שתופסות במדויק הקשר גלובלי, גבולות מקומיים ומבנים אנטומיים רב-סקאליים, תוך שמירה על שחזור ביישומים שונים. מאמר זה מציג פרוטוקול לבניה, הדרכה והערכה של מסגרת רשת U-Shape של Vision Mamba רב-תצוגה לחלוקת תמונות רפואיות דו-ממדיות. הפרוטוקול מספק תהליך עבודה שניתן לשחזר הכולל רכישת מערכי נתונים ציבוריים, עיבוד מוקדם של תמונות ומסכה, בניית רשת, הדרכת מודלים, בחירת נקודות ביקורת, והערכת ביצועים כמותית ואיכותית. המסגרת משלבת סריקת תכונות מרובת תצוגה ללכידת מידע משלים על מרחב, קווי מתאר, קנה מידה וגבולות, ומיישמת מיזוג תכונות רב-שלבי בתוך ארכיטקטורת מקודד-מפענח בצורת U לשיפור האינטגרציה של תכונות במהלך סגמנטציה. הפרוטוקול מודגם באמצעות מאגרי נתונים זמינים לציבור על נגעי עור וחלוקת איברי בטן. במסגרת זרימת היישום המתוארת, המסגרת משיגה ביצועי סגמנטציה תחרותיים באמצעות מדדי הערכה סטנדרטיים. על ידי מעקב אחר הנהלים המוצגים בפרוטוקול זה, חוקרים יכולים לשחזר את מימוש המודל, לאמן את הרשת באמצעות הגדרות ניסוי מוגדרות, להעריך את ביצועי הסגמנטציה ולהתאים את זרימת העבודה למשימות סגמנטציה רפואיות קשורות הדורשות ניתנת לשחזור ניתנת לניתוח מבוסס למידה עמוקה.
סגמנטציה של תמונות רפואיות היא משימה יסודית בתחומי ראיית המחשב וניתוח תמונות רפואיות 1,2,3. זה כולל חלוקת תמונה לאזורים או אובייקטים מרובים לניתוח ועיבוד נוספים. טכנולוגיה זו חשובה במיוחד בהדמיה רפואית משום שהיא מסייעת לרופאים לזהות ולאתר אזורים פתולוגיים, ובכך משפרת את הדיוק האבחוני ותכנון הטיפול. עם התקדמות טכנולוגיות הדמיה רפואית, כגון הדמיית תהודה מגנטית (MRI), טומוגרפיה ממוחשבת (CT) וטומוגרפיית פליטת פוזיטרונים (PET), הביקוש לטכניקות סגמנטציה מדויקות של תמונות רפואיות המשיך לעלות. השיטות הנוכחיות לסגמנטציה של תמונות רפואיות ניתנות לסיווג כללי לשלוש גישות עיקריות: שיטות מבוססות רשת עצבית קונבולוציונית (CNN)4, שיטות מבוססות טרנספורמר5, ושיטות מבוססות מודל-מרחב מצבים (SSM) 6,7. שיטות מבוססות CNN משתמשות בדרך כלל בארכיטקטורות רשת בצורת U לחלוקת תמונות רפואיות. הארכיטקטורה הנפוצה ביותר בקטגוריה זו היא U-Net8, שהדגימה את היעילות של ארכיטקטורת מקודד-מפענח בצורת U לסגמנטציה של תמונות ביו-רפואיות. U-Net3+ משלבת חיבורי דילוגים צפופים מ-UNet++9 עם חיבורי דילוג בקנה מידה מלא כדי לשפר את אגרגציית התכונות הרב-קניות. עם זאת, לשיטות מבוססות CNN יש יכולת מוגבלת ללכוד תלויות לטווח ארוך, ולכן ייתכן שאינן מודלים ביעילות מידע הקשרי לטווח ארוך.
שיטות מבוססות טרנספורמרים לוכדות ביעילות תלות לטווח ארוך באמצעות מנגנון תשומת הלב העצמית, שמאפשר חישוב מקבילי ומקצה משקלי תשומת לב שונים לאזורים שונים של עניין. UNETR++10 מציג את מודול תשומת לב זוגית יעילה (EPA) כדי להפחית את מספר הפרמטרים והעלות החישובית. nnFormer11 משלבת פעולות קונבולוציונליות משולבות וריכוז עצמי ומציגה מנגנון תשומת לב עצמי מבוסס נפח מקומי-גלובלי ללמידת ייצוגים וולומטריים בסגמנטציה תלת-ממדית (תלת-ממדית) של תמונות רפואיות. H2Former12 מציע משמר ראייה היברידי היררכי יעיל המשלב מנגנוני קשב עם חילוץ תכונות מבוסס CNN במקודד. עם זאת, שיטות מבוססות טרנספורמר מציגות מורכבות חישובית ריבועית עם עלייה באורך הרצף, מה שמוביל לעלות חישובית גבוהה משמעותית. איור 1 ממחיש את המוטיבציה ל-MVM-UNet ומשווה את אסטרטגיית הסריקה הרב-תצוגה המוצעת למסגרות סגמנטציה קיימות מבוססות SSM.

איור 1. השוואה בין MVM-UNet לבין ארכיטקטורות סגמנטציה מבוססות מודל מצב-מרחב טהור (SSM) קיימות. השוואה בין מסגרת סגמנטציה קונבנציונלית המבוססת על מודל מצב טהור (SSM) לבין ארכיטקטורת Multi-View Mamba U-Net (MVM-UNet) המוצעת. הפאנל העליון ממחיש את MVM-UNet, שבו מודול Multi-View 4-Directional (MV4D) מפיק תכונות משלימות באמצעות זוגות סריקה זיגזג, היררכיים, ספירליים ורדיאליים, המשולבים על ידי Spatial Fusion Mamba (SFusion Mamba), בעוד ש-Multi-stage Fusion Mamba (MFusion Mamba) מאגד תכונות מקודד רב-סקאלה לפני הפענוח. הפאנל התחתון מציג ארכיטקטורה מייצגת מבוססת SSM טהורה המשתמשת במודולי סריקה סלקטיבית דו-ממדית (SS2D) עם סריקה צולבת. התרשים מדגיש את ההבדלים האדריכליים בין רשתות סגמנטציה מבוססות SSM קונבנציונליות לבין ה-MVM-UNet המוצע. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
שיטות מבוססות SSM משלבות את יכולת המידול הגלובלית של טרנספורמרים עם מורכבות חישובית ליניארית. ארכיטקטורת הממבה מעבדת באופן סלקטיבי מידע קלט באמצעות מודל מרחב מצבים סלקטיבי (Selective-SSM), המאפשר למודל להתאים את הפרמטרים שלו באופן דינמי בהתאם לקלט, תוך סינון מידע לא רלוונטי והדגשת תכונות אינפורמטיביות. Vim13 ו-VMamba14 מתאימים את ארכיטקטורת הממבה למשימות ראייה ממוחשבת. U-Mamba15 עושה שימוש בארכיטקטורת CNN–SSM היברידית כדי לחקור את יישום SSMs בחלוקת תמונות רפואיות, בעוד שמאמבה-UNet16 מאמץ ארכיטקטורת מקודד-מפענח מבוססת SSM לחלוטין לפיצול תמונות רפואיות. שיטות אלו משיגות ביצועים תחרותיים תוך שימוש בפרמטרים קטנים בהרבה. עם זאת, שיטות מבוססות SSM/Mamba כיום בעיקר מפיקות תכונות תמונה באמצעות פאצ'ים פשוטים של תמונה ואסטרטגיות סריקה SS2D, אשר מציבות מספר מגבלות לסגמנטציה רפואית של תמונות. ראשית, SS2D וטכניקות מבוססות פאץ' מיועדות בעיקר למשימות ראייה ממוחשבת כלליות. Local Mamba17 ו-MotionMamba 18 הציעו כי אסטרטגיית הסריקה SS2D אינה מספקת לכל המשימות הוויזואליות, משום שאסטרטגיות סריקה שונות לוכדות סוגים שונים של מידע חזותי. שנית, אסטרטגיית הסריקה של SS2D פשוטה יחסית, ומתבססת רק על כיווני סריקה אופקיים ואנכיים. כתוצאה מכך, ייתכן שהוא לא מצליח ללכוד כראוי יחסים מרחביים מורכבים ופרטים מבניים עדינים. סגמנטציה רפואית של תמונות דורשת מידול סימולטני של הקשר מרחבי גלובלי ושל תכונות אנטומיות מקומיות מדויקות. יתרה מזאת, שיטות קיימות מבוססות SSM/Mamba מאפשרות מיזוג תכונות מוגבל בין המקודד למפענח. ארכיטקטורות כמו UNet++ ו-FATNet משפרות את דיוק הסגמנטציה באמצעות מיזוג תכונות משופר, ומדגישות את חשיבות האינטגרציה היעילה של תכונות לסגמנטציה של תמונות רפואיות.
כדי להתמודד עם מגבלות אלו, מאמר זה מציע מסגרת חדשה לחלוקת תמונות רפואיות מבוססת ממבה, הנקראת MVM-UNet. כפי שמוצג באיור 1, מודול MV4D המוצע ל-Multi-View Four-Directional משמש כרכיב הליבה לחילוץ תכונות ב-MVM-UNet ותוכנן במיוחד לחלוקת תמונות רפואיות על ידי שילוב מידע מארבע אסטרטגיות סריקה שונות. כל אסטרטגיית סריקה מפיקה תכונות תמונה משלימות ומייצגת תצוגה שונה של התמונה הנכנסת. סריקת זיגזג19 מחליפה את כיוון המעבר בסוף כל שורה או עמודה, ובכך מאזנת בין מידע מרחבי מקומי וגלובלי. לעומת זאת, סכמות הסריקה הספירליתוהרדיאלית 20 מספקות כיסוי מקיף על ידי התפשטות החוצה מהמרכז או פנימה מהפריפריה. סריקההיררכית 18 לוכדת תכונות מקומיות וגלובליות בקני מידה שונים. כדי לשפר את עמידות כל אסטרטגיית סריקה, זוגות סריקה ממזגים לפני ההזנה לבלוק S6. מודול Scan-view Fusion Mamba (SFusion Mamba) משלב לאחר מכן את התכונות שהופקו מארבעת מודאליות הסריקה. כדי לנצל בצורה יעילה תכונות מקודד רב-קניות, מאמר זה מציע בנוסף מודול מיזוג ממבה רב-קנה מידה (MFusion Mamba), שאוסף וממזג את הפלטים מכל שלב מקודד לפני שהוא מעביר את התכונות הממוזגות למפענח. MVM-UNet הוערך על פי מערכי הנתונים ISIC 2017, ISIC 2018 ו-Synapse. תוצאות ניסוי מראות ש-MVM-UNet משיג ביצועי סגמנטציה תחרותיים במאגרי הנתונים ISIC 2017, ISIC 2018 ו-Synapse.
ארכיטקטורות סגמנטציה מייצגות כוללות סגמנטציה רפואית מתקדמת עוד יותר. U-Net יושמה בהצלחה גם במשימות ניתוח תמונות ביו-רפואיות כגון ספירת תאים, זיהוי ומורפומטריה21. ארכיטקטורות CNN משודרגות על ידי תשומת לב, כמו CA-Net22, משפרות ייצוג תכונות באמצעות מנגנוני קשב מקיפים. מסגרות סגמנטציה מייצגות מבוססות טרנספורמר, כולל TransUNet23, Pyramid Medical Transformer24, Swin U-Net25, TransAttUNet26 ו-TransCUNet27, מדגימות עוד יותר את היעילות של מידול תכונות גלובלי מבוסס תשומת לב לסגמנטציה של תמונות רפואיות.
עיצוב MVM-UNet מונע משתי מגבלות של שיטות סגמנטציה קיימות מבוססות SSM/Mamba. ראשית, רבים מהמודלים הנוכחיים של Vision Mamba מסתמכים על אסטרטגיות סריקה דו-ממדיות פשוטות, שעשויות להיות בלתי מספקות לתמונות רפואיות המכילות גבולות נגעים לא סדירים, אזורי מטרה קטנים ומבנים אנטומיים רב-קנפיים. שנית, ארכיטקטורות מקודד-מפענח בצורת U קונבנציונליות מעבירות בעיקר תכונות דרך חיבורי דילוג מתאימים, מה שמגביל את השימוש הישיר במידע מקודד רב-שלבי במהלך הפענוח. לכן, MVM-UNet מציגה את MV4D לשיפור מידול מרחבי רב-תצוגה ואת MFusion Mamba לאגרגציה מפורשת של תכונות מקודד רב-שלבי. עיצוב זה נועד להתאים את המידול ארוך הטווח המבוסס ממבה לדרישות הספציפיות של סגמנטציה של תמונות רפואיות.
למרות ש-MVM-UNet בנוי על פרדיגמת המקודד-מקודד הכללית ומידול רצפים מבוסס ממבה, החידוש שלו טמון באופן שבו רכיבים אלו מותאמים ומשולבים לסגמנטציה רפואית של תמונות. במקום פשוט לשלב בלוק ממבה סטנדרטי בתוך עמוד שדרה בצורת U, המסגרת המוצעת מעצבת מחדש את תהליך המידול המרחבי באמצעות מספר ענפי זוג סריקה ממוקדי משימות, מציגה את SFusion Mamba לשילוב ייצוגים ספציפיים לסריקה, משפרת את בלוק MVV עם מסלולי שאריות והקרנה, ומכניסה את MFusion Mamba בין המקודד למפענח כדי לאגד תכונות מקודד רב-שלבי לפני הפענוח. עיצוב ברמת ארכיטקטורה זה שואף להתמודד עם גבולות לא סדירים, אזורי מטרה קטנים ומבנים אנטומיים רב-קנה מידה הנצפים בדרך כלל בתמונות רפואיות.
פרוטוקול זה מתאים במיוחד למשימות סגמנטציה הדורשות מידול סימולטני של מידע הקשרי לטווח ארוך, גבולות אובייקטים לא סדירים ומבנים אנטומיים רב-קנה מידה בתמונות רפואיות דו-ממדיות. בהשוואה לשיטות סגמנטציה מבוססות CNN, עיצוב המקודד-מפענח מבוסס ממבה מספק מנגנון יעיל למידול הקשר תוך שמירה על זרימת עבודה בצורת U המוכרת לחוקרי סגמנטציה רפואית. בהשוואה לשיטות מבוססות טרנספורמר, המסגרת המוצעת נמנעת משימוש ישיר בתשומת לב עצמית ריבועית ומיועדת לחוקרים המחפשים מידול הקשר גלובלי באמצעות מנגנון מידול רצף יעיל יחסית. בהתאם לכך, פרוטוקול זה מתאים לסגמנטציה של נגעי עור, חלוקת איברים בטניים ומשימות דו-ממדיות דומות של חלוקת תמונות רפואיות, שבהן חשוב גם מידע מבני גלובלי וגם פרטי גבול מקומיים.
לפרוטוקול זה יש גם מגבלות שיש לקחת בחשבון לפני השימוש. ייתכן שהוא לא נחוץ למשימות סגמנטציה פשוטות יחסית שבהן CNN קל משקל כבר מספק ביצועים מספקים. בנוסף, הוא אינו מתוכנן ישירות לסגמנטציה נפחית תלת-ממדית מלאה ללא התאמה אדריכלית. חוקרים עם נתונים מוגבלים מאוד עם הערות, משאבי יחידת עיבוד גרפיקה (GPU) מוגבלים, או דרישה למודלים קלאסיים ניתנים לפרשנות גבוהה, צריכים גם הם לשקול את המגבלות הללו לפני יישום הפרוטוקול. בסך הכול, שיטה זו מיועדת לחוקרים המעוניינים לשחזר ולהעריך מסגרת סגמנטציה בצורת U מבוססת ממבה, המאזנת בין מידול הקשר ארוך טווח, ייצוג גבולות מקומיים ומיזוג תכונות רב-שלביות.
התרומות המרכזיות הן כדלקמן:
1. מאמר זה מציג מסגרת חלוקה רפואית חדשנית מבוססת ממבה, הנקראת MVM-UNet. בניגוד לגישות שמשלבות ישירות בלוקי ממבה מבוססי SS2D או סטנדרטיים, MVM-UNet מציגה את MV4D למודלים של תכונות תמונה רפואיות מארבע תצוגות זוג סריקה משלימות, כולל זיגזג, היררכי, ספירלי ורדיאלי.
2. מאמר זה מעצב את SFusion Mamba ואת בלוק ה-MVV כדי לשלב ייצוגים ספציפיים לסריקה ולשפר את טרנספורמציית התכונות. SFusion Mamba מאחד את התכונות שהופקו מענפי זוגות סריקה שונים, בעוד שהענפים השאריים וההקרנה למעלה-למטה בתוך בלוק MVV מספקים מסלולי תכונות משלימים שמייצבים ומעשירים ייצוגים של תכונות.
3. מאמר זה מציג את MFusion Mamba כמודול מיזוג רב-שלבי ביניים בין המקודד למפענח. בניגוד לחיבורי דילוג קונבנציונליים שמעבירים בעיקר תכונות של שלבים תואמים, MFusion Mamba מאגד במפורש תכונות מקודד רב-שלבי באמצעות מיזוג גס לדק ומספק מידע מועשר לפענוח.
4. תוצאות ניסוי נרחבות מראות כי ה-MVM-UNet המוצע משיג ביצועי סגמנטציה תחרותית במאגרי ISIC 2017 ו-ISIC 2018 וביצועים חזקים במאגר הסגמנטציה הרב-איברי של Synapse. יתרה מזאת, מחקרי אבלציה מקיפים מאמתים את תרומתו של כל רכיב בתוך MVM-UNet.
מחקר זה השתמש רק במאגרי תמונות רפואיות זמינים לציבור ולא מזוהים, כולל ISIC 2017, ISIC 2018 ו-Synapse. לא נאספו משתתפים אנושיים חדשים, נבדקים בעלי חיים או רשומות רפואיות פרטיות מזוהות במחקר זה. מאגר הנתונים של ISIC 2017 ששימש במחקר זה היה מאגר הסגמנטציה של פצעי העור ISIC 2017 Challenge, שהושג ממאגר הנתונים הרשמי של International Skin Imaging Collaboration Challenge (https://challenge.isic-archive.com/data/#2017). גרסת מערך הנתונים ששימשה במחקר זה תואמת למשימת חלוקת הנגעים של ISIC 2017, הכוללת את המחיצות הרשמיות של ההדרכה, האימות והבדיקה. מערך הנתונים הורד ב-15 במרץ 2024. מאגר הנתונים של ISIC 2018 ששימש במחקר זה היה מאגר הסגמנטציה של משימת 1 של ISIC Challenge Task 1, שהתקבל ממאגר הנתונים הרשמי של International Skin Imaging Collaboration (https://challenge.isic-archive.com/data/#2018). גרסת מערך הנתונים ששימשה במחקר זה תואמת למשימה 1 של ISIC 2018: סגמנטציה של גבול הנגעים. מערך הנתונים הורד ב-8 ביולי 2024.
מאגר הנתונים של סינפס ששימש במחקר זה היה Multi-Atlas Labeling Beyond the Cranial Vault הבטני CT, שהושג ממאגר הסינפס תחת מזהה accession syn3193805 (https://www.synapse.org/Synapse:syn3193805). מאגר הנתונים ששימש במחקר זה תואם למאגר הנתונים הנפוץ ל-30 מקרי CT בבטן עם סגמנטציה רב-איברית. הארכיון שהורד היה Abdomen/RawData.zip, שהיה זמין תחת סינת accession syn3193805. לא סופקו מספר גרסה נפרד, תווית שחרור או תג שחרור מתוארך על ידי המאגר בזמן ההורדה. בהתאם לחלוקה התקנית שאומצה במחקרים קודמים, 18 מקרים שימשו להכשרה ו-12 מקרים לבדיקה. חלוקת הנתונים התבצעה לפי רשימת המקרים שבה השתמשה TransUNet23. בפרט, תיקי ההכשרה היו case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028, ו-case0037, בעוד שהמקרים היו case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025, ו-case0035. מערך הנתונים הורד ב-9 ביולי 2024. מכיוון שמחקר זה השתמש רק במאגרי נתונים ציבוריים שלא מזוהים ולא כלל איסוף נתונים חדשים של נבדקים אנושיים או מידע פרטי מזוהה, לא נדרשה אישור ועדת ביקורת מוסדית לניסויים החישוביים המתוארים בפרוטוקול זה. לא התקבלה קביעת פטור מוסדית רשמית בכתב. אם נדרש על פי מדיניות מוסדית מקומית, על החוקרים לקבל קביעת פטור מוסדי לפני ביצוע ניתוחים משניים של מאגרי נתונים זמינים לציבור. לא היה זמין מספר הפניה לפטור אתי מוסדי או מסמכי פטור רשמיים למחקר זה.
1. הכנת מערכי נתונים
(1)2. בניית ארכיטקטורת MVM-UNet
את Here, C = 96.
החיזוי ∈ RB×H×W×K. כאן, K = 1 עבור סגמנטציה בינארית של נגעים ו-K = 8 עבור סגמנטציה מרובת איברים בסינפסה.
איור 2. הארכיטקטורה הכוללת של Mamba U-Net רב-תצוגה (MVM-UNet). סקירה של ארכיטקטורת ה-Mamba U-Net (MVM-UNet) המוצעת ב-Multi-View. תמונת הקלט מומרת להטמעות פאץ' ומעובדת דרך ארבעה שלבי מקודד המורכבים מבלוקי Multi-View Vision (MVV) המופרדים על ידי פעולות מיזוג פאצ'ים. תכונות המקודד מאוגדות על ידי ממבה מיזוג רב-שלבית (MFusion Mamba) ומועברות למפענח דרך חיבורי דילוג. המפענח משחזר בהדרגה את הרזולוציה המרחבית באמצעות פעולות הרחבת פאץ' ומייצר את מפת הסגמנטציה הסופית דרך שכבת ההקרנה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
3. בניית מודול MV4D

איור 3. ארכיטקטורת המודול הרב-תצוגה 4-כיוונית (MV4D). מבנה מודול חילוץ תכונות רב-תצוגה 4-כיוונית (MV4D). טלאי קלט מעובדים דרך ארבעה ענפי זוג סריקה משלימים הכוללים זיגזג, היררכי, ספירלי וסריקה רדיאלית. תכונות שמופקות מארבעת הענפים מאוחדות, מעובדות באמצעות בלוקי מרחב מצבים, ומשולבות על ידי Spatial Fusion Mamba (SFusion Mamba) ליצירת ייצוג תכונות הפלט. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
4. בניית בלוק MVV

איור 4. ארכיטקטורה של בלוק Multi-View Vision (MVV). מבנה בלוק החזון הרב-תצוגה (MVV). הבלוק מורכב מענף חילוץ תכונות עיקרי הכולל את מודול Multi-View 4-Directional (MV4D) יחד עם שכבות קונבולוציה עומקית, נרמול והקרנה ליניארית. ענף הקרנה עזרי למעלה למטה מספק מודולציה של תכונות עם שער באמצעות כפל לפי אלמנט לפני חיבור שאריתי ליצירת ייצוג תכונת הפלט. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
5. בניית MFusion Mamba

איור 5. ארכיטקטורת מודול ה-Multi-stage Fusion Mamba (MFusion Mamba). מבנה מודול ה-Multi-שלבי Fusion Mamba (MFusion Mamba). תכונות מקודד רב-קנה מידה משולבות תחילה באמצעות מיזוג גס ובהמשך מעודנות באמצעות מודול Fine Fusion הכולל הקרנה ליניארית, קונבולוציה חד-ממדית (Conv1d), בלוק ממבה ושכבות הקרנת תכונות לפני יצירת ייצוג התכונות הממוזגות של המפענח. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
6. אימון מודלים
7. הערכת מודלים
(2)
(3)
(4)
(5)
(6)8. הגדרת פונקציית אובדן
(7)
(8)
(9)
(10)
(11)
ש-1 = 1.0 ו-2
= 1.0. הגדר את משקלי הירידה של CE ו-Dice ל-1.0 עבור Synapse, כך φ1 = 1.0 ש ו-φ2 = 1.0.9. הגדרות שחזוריות וביצוע
תוצאות צפויות ופרשנות
כאשר פרוטוקול זה מיושם נכון, מודל MVM-UNet המאומן צפוי לייצר ביצועי סגמנטציה יציבים לאורך ריצות חזרות, עם שינויים קטנים בלבד בין זרעים אקראיים שונים ברוב מדדי ההערכה. עבור ISIC 2017 ו-ISIC 2018, תוצאות מוצלחות משתקפות בערכי DSC, mIoU, Acc, Sen ו-Spe גבוהים, יחד עם מסכות נגע חזויות העוקבות מקרוב אחרי גבולות הנגעים בין אמת קרקע (איורים 6 ו-7). עבור סינפסה, תוצאות מוצלחות משתקפות בערכי DSC ממוצעים גבוהים וערכי HD95 נמוכים ברחבי האיברים הקדמיים (איור 8). במהלך ביצוע הפרוטוקול, יש לפרש מדדים כמותיים יחד עם תוצאות הסגמנטציה האיכותית המתאימה. מודל שמשיג DSC גבוה אך מציג דליפת גבול, השמטת מבנים קטנים או תחזיות מפורקות צריך להיחשב כמוצלח חלקית בלבד, ויש לאמת את תהליך העיבוד המקדים, בחירת נקודות ביקורת והגדרות הסקנה.

איור 6. תוצאות סגמנטציה איכותנית מייצגת במאגר הנתונים של ISIC 2017. תוצאות סגמנטציה איכותנית מייצגות שהושגו במאגר נתוני סגמנטציה של נגעי עור של International Skin Imaging Collaboration (ISIC) לשנת 2017. כל דוגמה מציגה את התמונה הדרמוסקופית המקורית (Image), מסכת סגמנטציה של אמת קרקעית (GT) המתאימה, ואת התחזית שנוצרה על ידי MVM-UNet (Pred). מקרי בדיקה מייצגים ממחישים ביצועי סגמנטציה עבור נגעים בגודל, מורפולוגיה ומורכבות גבול משתנים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

איור 7. תוצאות סגמנטציה איכותנית מייצגת על מאגר הנתונים של ISIC 2018. תוצאות סגמנטציה איכותנית מייצגות שהושגו במאגר נתוני סגמנטציה של נגעי עור של International Skin Imaging Collaboration (ISIC) לשנת 2018. כל דוגמה מציגה את התמונה הדרמוסקופית המקורית (Image), מסכת סגמנטציה של אמת קרקעית (GT) המתאימה, ואת התחזית שנוצרה על ידי MVM-UNet (Pred). מקרים מייצגים מראים ביצועי סגמנטציה בין מראות נגעים שונים ומאפייני גבול. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

איור 8. תוצאות סגמנטציה איכותית מייצגות במאגר הנתונים של טומוגרפיה ממוחשבת של Synapse. תוצאות מייצגות של סגמנטציה איכותנית רב-איברית שהתקבלו על מאגר הסינפס Multi-Atlas Labeling מעבר ל-Cranial Vault. כל דוגמה מציגה את תמונת הטומוגרפיה הממוחשבת המקורית (תמונה), את הערות האיבר האמת הקרקעית (GT) המתאימים, ואת התחזית שנוצרה על ידי MVM-UNet (Pred). דוגמאות מייצגות ממחישות הסכמה בין סגמנטציה חזויה וייחוס בין איברי בטן מרובים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
ביצועים ב-ISIC 2017
כדי להעריך את השחזוריות של MVM-UNet, כל ניסויי ההשוואה המרכזיים חזרו על עצמם באמצעות שלושה זרעים אקראיים בלתי תלויים (1, 52 ו-100), והתוצאות מדווחות כממוצע ± SD. המובהקות הסטטיסטית הוערכה באמצעות מבחן הדירוג החתום של וילקוקסון, בהתבסס על תוצאות זוגיות לתמונה עבור ISIC 2017 ו-ISIC 2018 ותוצאות זוגיות לכל מקרה עבור Synapse. הניתוח הסטטיסטי בוצע באמצעות ערכי מדדים מזווגים במקום ממוצעים ברמת הזרע. לצורך השוואה הוגנת, תוצאות שדווחו כממוצע ± SD שוחזרו באמצעות המימושים הרשמיים תחת אותם חלוקות מאגר נתונים, רזולוציות קלט ומדדי הערכה ככל שניתן, בעוד שתוצאות הערך היחיד נשמרו מהפרסומים המקוריים המתאימים.
MVM-UNet הוערך על בסיס מאגר נתוני סגמנטציה של נגעי עור ISIC לשנת 2017 והושווה לשיטות סגמנטציה מייצגות, כולל UNet 8,21, TransUNet23, H-vmunet28, MISSFormer30, MaLUNet31, VM-UNet32, UNeXt-S33, HResFormer34, MedScale-Former35, MCAFT36, ו-H2Former12 (טבלה 1). MVM-UNet השיגה mIoU של 80.94 ± 1.01%, DSC של 91.32% ± 0.68%, דיוק של 96.58% ± 0.27%, ספציפיות של 98.31% ± 0.23%, ורגישות של 91.65% ± 0.77% בשלוש ריצות עצמאיות. בהשוואה לשיטות שנבדקו, MVM-UNet השיג את ה-mIoU, DSC והרגישות הגבוהים ביותר. תוצאות סגמנטציה איכותית מייצגות מוצגות באיור 6, כאשר המסכות החזויות עוקבות מקרוב אחרי גבולות הנגע האמת הקרקעית על פני תמונות בדיקה מייצגות.
| מודל | מקור. | mIoU (%) | DSC (%) | Acc (%) | Spe (%) | סן (%) |
| UNet | 8 | 76.98 | 86.99 | 95.65 | 97.43 | 86.82 |
| TransUNet | 23 | 75.32 | 81.23 | 91.45 | 95.77 | 82.63 |
| MaLUNet | 31 | 78.78 | 88.13 | 96.18 | 98.47 | 84.78 |
| VM-UNet | 32 | 80.23 | 89.03 | 96.29 | 97.58 | 89.90 |
| UNeXt-S | 33 | 78.26 | 87.80 | 95.95 | 97.74 | 87.04 |
| HResFormer | 34 | 79.89 ± 1.05 | 88.82 ± 0.65 | 96.25 ± 0.24 | 97.73 ± 0.22 | 87.72 ± 0.79 |
| H-vmunet | 28 | 80.34 ± 1.02 | 90.68 ± 0.55 | 96.42 ± 0.18 | 98.23 ± 0.32 | 88.97 ± 0.88 |
| MISSFormer | 30 | 80.16 ± 0.78 | 89.27 ± 0.61 | 94.36 ± 0.28 | 97.52 ± 0.38 | 87.71 ± 0.69 |
| H2Former | 12 | 80.35 ± 0.95 | 88.56 ± 0.72 | 96.61 ± 0.19 | 98.15 ± 0.14 | 88.21 ± 0.81 |
| מדסקייל-פורמר | 35 | 80.31 ± 0.82 | 89.11 ± 0.59 | 95.68 ± 0.33 | 98.24 ± 0.21 | 89.96 ± 0.92 |
| MCAFT | 36 | 80.59 ± 0.93 | 89.27 ± 0.63 | 96.42 ± 0.20 | 97.95 ± 0.17 | 90.05 ± 0.84 |
| MVM-UNet (שלנו) | — | 80.94 ± 1.01 | 91.32 ± 0.68 | 96.58 ± 0.27 | 98.31 ± 0.23 | 91.65 ± 0.77 |
טבלה 1: השוואת ביצועים במאגר הנתונים של חלוקת נגעי העור של ISIC 2017. השוואה בין MVM-UNet לבין שיטות סגמנטציה מבוססות רשת עצבית קונבולוציונית מייצגת (CNN)-, טרנספורמר-, ומודל מרחב מצבים (SSM) באמצעות חיתוך ממוצע על איחוד (mIoU), מקדם דמיון קוביות (DSC), דיוק (Acc.), ספציפיות (ספציפית) ורגישות (Sen.). התוצאות של MVM-UNet מדווחות כסטיית תקן ממוצעת ± משלושה ניסויי זרעים אקראיים עצמאיים. התוצאות שדווחו כערכים בודדים שוחזרו מהפרסומים המקוריים המתאימים.
הדוגמאות האיכותניות מראות עוד יותר ש-MVM-UNet חילקה במדויק הן נגעים קטנים והן נגעים גדולים עם גבולות לא סדירים. בדוגמאות המייצגות הללו, המסכות החזויות תאמו במידה רבה להערות האמת הקרקעית המקבילות ושמרו על גבולות הנגעים עם דליפה או פיצול מינימלית.
כדי להעריך עוד האם השיפורים שנצפו היו מובהקים סטטיסטית, בוצעו מבחני דירוג חתום של וילקוקסון באמצעות תוצאות סגמנטציה זוגיות לכל תמונה. במדד mIoU, MVM-UNet הראה שיפור מובהק סטטיסטית לעומת MCAFT, עם ערך p של 0.0114. במדד DSC, MVM-UNet גם הציג ביצועים גבוהים משמעותית מ-H-vmunet, עם ערך p של 0.0031. תוצאות אלו תומכות בכך שהשיפורים שנצפו ב-ISIC 2017 לא היו ככל הנראה מיוחסים לשונות אקראית.
בסך הכול, MVM-UNet השיגה את הביצועים הגבוהים ביותר בין השיטות שהושוו ל-mIoU, DSC ורגישות במערך הנתונים ISIC 2017 (טבלה 1). דוגמאות הסגמנטציה האיכותנית המוצגות באיור 6 תואמות את הממצאים הכמותיים הללו.
ביצועים ב-ISIC 2018
MVM-UNet הוערך בהרחבה על מאגר הנתונים של סגמנטציה של נגעי עור של ISIC 2018 והושווה לשיטות סגמנטציה מייצגות, כולל UNet 8,21, UNet++9, UTNetV237, SANet38, MaLUNet31, VM-UNet32, H-vmunet28, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35, ו-MCAFT36 (טבלה 2). MVM-UNet השיגה mIoU של 82.47% ± 1.28%, DSC של 90.65% ± 0.94%, דיוק של 96.02% ± 0.36%, ספציפיות של 97.06% ± 0.31%, ורגישות של 91.80% ± 0.82% בשלוש ריצות עצמאיות. תוצאות אלו מראות כי ביצועי MVM-UNet נשארו עקביים בין זרעים אקראיים שונים. תוצאות סגמנטציה איכותיות מייצגות מוצגות באיור 7.
| מודל | מקור. | mIoU (%) | DSC (%) | Acc (%) | Spe (%) | סן (%) |
| UNet | 8 | 77.86 | 87.55 | 94.05 | 96.69 | 85.86 |
| UNet++ | 9 | 78.31 | 87.83 | 94.02 | 95.75 | 88.65 |
| UTNetV2 | 37 | 78.97 | 88.25 | 94.32 | 96.48 | 87.60 |
| SANet | 38 | 79.52 | 88.59 | 94.39 | 95.97 | 89.46 |
| MaLUNet | 31 | 80.25 | 89.04 | 94.62 | 96.19 | 89.74 |
| VM-UNet | 32 | 81.35 | 89.71 | 94.91 | 96.13 | 91.12 |
| H-vmunet | 28 | 81.93 ± 1.45 | 90.46 ± 0.62 | 95.19 ± 0.30 | 96.82 ± 0.21 | 88.37 ± 1.13 |
| MISSFormer | 30 | 80.27 ± 1.21 | 89.91 ± 0.46 | 94.76 ± 0.27 | 97.22 ± 0.15 | 90.84 ± 1.07 |
| H2Former | 12 | 80.40 ± 0.83 | 90.26 ± 0.73 | 94.89 ± 0.38 | 96.98 ± 0.25 | 91.57 ± 0.54 |
| HResFormer | 34 | 81.12 ± 1.18 | 88.86 ± 0.84 | 94.96 ± 0.33 | 96.43 ± 0.22 | 91.86 ± 1.01 |
| מדסקייל-פורמר | 35 | 80.97 ± 0.74 | 90.47 ± 0.68 | 95.02 ± 0.41 | 95.89 ± 0.26 | 90.65 ± 0.92 |
| MCAFT | 36 | 81.46 ± 1.03 | 89.06 ± 0.76 | 95.23 ± 0.29 | 96.72 ± 0.17 | 91.82 ± 0.57 |
| MVM-UNet (שלנו) | — | 82.47 ± 1.28 | 90.65 ± 0.94 | 96.02 ± 0.36 | 97.06 ± 0.31 | 91.80 ± 0.82 |
טבלה 2: השוואת ביצועים במאגר נתוני סגמנטציה של נגעי עור ISIC לשנת 2018. השוואה בין MVM-UNet לשיטות סגמנטציה מייצגות מבוססות CNN-, Transformer- ו-SSM, תוך שימוש בחיתוך ממוצע על איחוד (mIoU), מקדם דמיון קוביות (DSC), דיוק (Acc.), ספציפיות (מיוחדת) ורגישות (סנטימנט). התוצאות של MVM-UNet מדווחות כסטיית תקן ממוצעת ± משלושה ניסויי זרעים אקראיים עצמאיים. התוצאות שדווחו כערכים בודדים שוחזרו מהפרסומים המקוריים המתאימים.
בהשוואה ל-H-vmunet, MVM-UNet שיפר את ה-mIoU ב-0.54%. בהשוואה ל-MedScale-Former, MVM-UNet שיפרה את ה-DSC ב-0.18%. MVM-UNet גם השיגה את הדיוק הגבוה ביותר בין השיטות שהושוו. הדוגמאות האיכותניות המייצגות המוצגות באיור 7 מראות חלוקה מדויקת של נגעי עור מייצגים, כולל אזורים קטנים ונגעים עם גבולות לא סדירים.
ל-ISIC 2018, מובהקות סטטיסטית הוערכה באמצעות מבחן וילקוקסון-דרגה חתום, בהתבסס על תוצאות סגמנטציה זוגיות לכל תמונה. במדד mIoU, MVM-UNet השיג שיפור מובהק סטטיסטית לעומת MCAFT, עם ערך p של < 0.001. תוצאות אלו תומכות בכך שהשיפור בביצועים שנצפה ב-ISIC 2018 לא סביר שיוחס לשונות אקראית.
בסך הכל, MVM-UNet השיג את ה-mIoU, DSC והדיוק הגבוהים ביותר בין השיטות שהושוו במאגר הנתונים של ISIC 2018 (טבלה 2). הדוגמאות האיכותניות המוצגות באיור 7 תואמות את השיפורים הכמותיים הללו.
ביצועים על סינפס
השיטה המוצעת הוערכה גם במאגר הנתונים של סגמנטציה רב-איברית של Synapse והושוותה לשיטות מייצגות, כולל UNet 8,21, Attention U-Net39, TransUNet23, TransNorm40, Swin U-Net25, TransDeepLab41, MEW-UNet42, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35, ו-MCAFT36 (טבלה 3). מאגר הנתונים של סינאפסה כלל שמונה איברי בטן: האאורטה, כיס המרה, הטחול, הכליה השמאלית, הכליה הימנית, הכבד, הלבלב והקיבה. בהתאם לפרוטוקול הניסוי הסטנדרטי, שימשו 18 מקרים (2,212 פרוסות ציריות) לאימון ו-12 מקרים (1,567 פרוסות אקסיאליות) לבדיקה. לא הוכנס סט אימות נפרד. מקרי הבדיקה שימשו אך ורק להערכה סופית ולא שימשו לאימון מודלים, כוונון היפרפרמטרים או בחירת מודל. תוצאות מייצגות של סגמנטציה איכותית של רב-איברים מוצגות באיור 8, וההשוואה הכמותית מסוכמת בטבלה 3.
| מודל | מקור. | DSC | HD95 | אאור. | גל. | ילד. (L) | ילד. (R) | ליב. | פאן. | סמל. | סטו. |
| UNet | 8 | 76.85 | 39.78 | 89.07 | 69.72 | 77.77 | 68.69 | 93.43 | 54.01 | 86.66 | 75.59 |
| Att-UNet | 39 | 77.77 | 36.02 | 89.54 | 68.88 | 77.98 | 71.11 | 93.57 | 58.04 | 87.31 | 75.74 |
| TransUNet | 23 | 77.48 | 31.69 | 87.23 | 63.13 | 81.87 | 77.02 | 94.08 | 55.84 | 85.06 | 75.62 |
| טרנסנורם | 40 | 78.4 | 30.25 | 86.23 | 65.18 | 82.18 | 78.63 | 94.22 | 55.32 | 89.53 | 76.02 |
| סווין יו-נט | 25 | 79.13 | 21.55 | 85.47 | 66.53 | 83.28 | 79.61 | 94.29 | 56.58 | 90.62 | 76.59 |
| TransDeepLab | 41 | 80.16 | 21.25 | 86.04 | 69.16 | 84.08 | 79.88 | 93.53 | 61.15 | 89.01 | 78.36 |
| MEW-UNet | 42 | 78.92 | 21.68 | 86.68 | 65.32 | 82.87 | 80.02 | 93.63 | 58.38 | 90.16 | 74.27 |
| MISSFormer | 30 | 80.92 ± 4.23 | 20.09 ± 1.89 | 86.43 ± 0.98 | 69.81 ± 4.56 | 84.29 ± 2.11 | 81.03 ± 3.34 | 93.85 ± 0.89 | 61.11 ± 4.67 | 90.05 ± 3.78 | 80.62 ± 1.02 |
| H2Former | 12 | 81.05 ± 2.56 | 20.13 ± 7.23 | 86.61 ± 3.21 | 69.32 ± 1.23 | 85.12 ± 4.78 | 82.01 ± 2.89 | 94.09 ± 2.45 | 61.16 ± 0.76 | 89.97 ± 4.12 | 80.94 ± 3.56 |
| HResFormer | 34 | 80.65 ± 4.02 | 17:48 ± 6.89 | 89.16 ± 2.78 | 66.94 ± 0.78 | 84.61 ± 4.34 | 82.15 ± 2.56 | 93.11 ± 1.34 | 59.92 ± 4.12 | 91.08 ± 3.45 | 80.75 ± 2.01 |
| מדסקייל-פורמר | 35 | 80.78 ± 1.34 | 20.02 ± 3.78 | 88.79 ± 4.02 | 69.82 ± 2.56 | 85.13 ± 0.87 | 81.63 ± 4.78 | 94.10 ± 2.78 | 60.72 ± 1.89 | 90.14 ± 1.56 | 80.93 ± 4.56 |
| MCAFT | 36 | 81.03 ± 3.45 | 19.98 ± 5.12 | 89.76 ± 0.76 | 68.96 ± 3.89 | 84.54 ± 2.56 | 81.98 ± 3.12 | 94.32 ± 4.01 | 60.85 ± 3.67 | 89.06 ± 4.89 | 80.91 ± 1.78 |
| MVM-UNet (שלנו) | — | 81.26 ± 1.89 | 18.72 ± 2.16 | 88.53 ± 3.22 | 69.84 ± 4.23 | 85.37 ± 2.69 | 82.67 ± 1.67 | 94.41 ± 3.56 | 61.02 ± 2.78 | 90.19 ± 0.67 | 81.48 ± 3.12 |
טבלה 3: השוואת ביצועים במאגר הנתונים של סגמנטציה רב-איברית של Synapse. השוואה בין MVM-UNet לשיטות סגמנטציה מבוססות CNN-, Transformer-ו-SSM באמצעות מקדם דמיון קוביות (DSC), מרחק האוסדורף באחוזון ה-95 (HD95), וציוני קוביות ספציפיות לאיברים עבור האאורטה (Aor.), כיס המרה (Gal.), הכליה השמאלית (Kid. (L)), הכליה הימנית (Kid. (R)), כבד (Liv.), לבלב (Pan.), טחול (Spl.), וקיבה (Sto.). התוצאות של MVM-UNet מדווחות כסטיית תקן ממוצעת ± משלושה ניסויי זרעים אקראיים עצמאיים. התוצאות שדווחו כערכים בודדים שוחזרו מהפרסומים המקוריים המתאימים.
MVM-UNet השיגה ממוצע DSC של 81.26% ± 1.89% וממוצע HD95 של 18.72 ± 2.16 בשלוש ריצות עצמאיות. התוצאות מראות ביצועי סגמנטציה יציבים במאגר הנתונים Synapse. מבין השיטות שנבדקו, MVM-UNet השיגה את ממוצע ה-DSC הגבוה ביותר ואת הממוצע השני הנמוך ביותר HD95.
עבור סינפס, מובהקות סטטיסטית הוערכה באמצעות מבחן דירוג חתום של וילקוקסון, המבוסס על ערכי DSC זוגיים לכל מקרה. MVM-UNet הראה שיפור מובהק סטטיסטית לעומת H2Former, עם ערך p של 0.026, מה שמעיד שהשיפור שנצפה בביצועי הסגמנטציה היה מובהק סטטיסטית.
תוצאות מוצלחות ובלתי אופטימליות מייצגות
תוצאות איכותיות מוצלחות מייצגות מוצגות באיורים 6–8. תוצאות מוצלחות מאופיינות במסכות חלוקה צפויות התואמות במדויק את הערות האמת הקרקעית ומגדירות במדויק את הנגע הראשי או גבולות האיברים. תוצאות מייצגות תת-אופטימליות עשויות להתרחש עבור מטרות קטנות מאוד, גבולות בעלי ניגודיות נמוכה, צורות נגע לא סדירות, איברים עם ניגודיות עוצמה חלשה, או גבולות אנטומיים עמומים, ולרוב להופיע כתת-סגמנטציה, סגמנטציה יתר, דליפת גבול או קטעי מסכה לא רציפים. כאשר נצפים תוצאות כאלה, על המשתמשים לוודא ששינוי גודל תמונה, נרמליזציה, אינטרפולציה של מסכה, בחירת נקודות ביקורת למודל, סף הסקה (עבור מערכי ISIC) או חיזוי ארגמקס (עבור Synapse), ושיטות חישוב מטריות תואמים לאלו המתוארים בפרוטוקול.
מחקר אבלציה של מודול MV4D
תרומת מודול MV4D הוערכה על ידי הוספת זוגות הסריקה הזיגזג, היררכית, הספירלית והרדיאלית, ואחריה מודול SFusion Mamba (טבלה 4; איור 9). כאשר השתמשו רק בזוג סריקת זיגזג, ביצועי הסגמנטציה היו מוגבלים. הוספת זוג הסריקה ההיררכי שיפרה משמעותית את הביצועים, מה שמעיד על היתרון בשילוב מידע רב-קנה מידה. הוספת זוגות הסריקה הספירלית והרדיאלית שיפרה עוד יותר את ביצועי הסגמנטציה על ידי שיפור הייצוג הקונטור והגבול. שילוב מודול SFusion Mamba הביא לביצועים הגבוהים ביותר מבין התצורות שנבדקו.
| מודל | זוג סריקת זיגזג | זוג סריקה היררכי | זוג סריקה ספירלית | זוג סריקה רדיאלית | SFusion Mamba | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | ✓ | 56.75 | 72.46 | 58.03 | 73.45 | ||||
| MVM-UNet | ✓ | ✓ | 72.38 | 84.01 | 73.45 | 84.7 | |||
| MVM-UNet | ✓ | ✓ | ✓ | 75.69 | 86.20 | 76.94 | 86.94 | ||
| MVM-UNet | ✓ | ✓ | ✓ | ✓ | 76.41 | 86.61 | 78.28 | 87.82 | |
| MVM-UNet | ✓ | ✓ | ✓ | ✓ | ✓ | 80.94 | 91.32 | 82.47 | 90.65 |
טבלה 4: מחקר אבלציה של מודול רב-תצוגה 4-כיוונית (MV4D). הביצועים שהושגו על ידי שילוב הדרגתי של זוגות הסריקה ההיררכיים, הספירליים והרדיאליים ומודול Spatial Fusion Mamba (SFusion Mamba) בארכיטקטורת זוג הסריקה-זוג הבסיסית של זיגזג. הביצועים מדווחים באמצעות חיתוך ממוצע על פני איחוד (mIoU) ומקדם דמיון קוביות (DSC) על מערכי הנתונים ISIC 2017 ו-ISIC 2018.

איור 9. מחקר אבלציה של מודול רב-תצוגה 4-כיווני (MV4D). (א) שינוי בחיתוך הממוצע על פני איחוד (mIoU) לאחר שילוב סדרתי של זוג הסריקה ההיררכי, זוג הסריקה הספירלי, זוג הסריקה הרדיאלית וממבה המיזוג המרחבי (SFusion Mamba) בארכיטקטורה הבסיסית. (ב) שינוי במקדם הדמיון לקוביות (DSC) לאחר שילוב רציף של זוג הסריקה ההיררכי, זוג הסריקה הספירלי, זוג הסריקה הרדיאלית וממבה מיזוג מרחבי (SFusion Mamba) בארכיטקטורת הבסיס. (ג) שינוי ב-mIoU לאחר שילוב רציף של זוג הסריקה ההיררכי, זוג הסריקה הספירלי, זוג הסריקה הרדיאלית וממבה מיזוג מרחבי (SFusion Mamba) בארכיטקטורת הבסיס תחת ההקשר הניסויי השני. (ד) שינוי ב-DSC לאחר שילוב רציף של זוג הסריקה ההיררכי, זוג הסריקה הספירלי, זוג הסריקה הרדיאלית וממבה מיזוג מרחבי (SFusion Mamba) בארכיטקטורה הבסיסית תחת ההגדרה הניסויית השנייה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
במאגר הנתונים של ISIC 2017, מודול MV4D המלא השיג mIoU של 80.94% ו-DSC של 91.32%. מגמות הביצועים המקבילים עבור mIoU ו-DSC מוצגות באיור 9A ובאיור 9B, בהתאמה. במאגר הנתונים של ISIC 2018, מודול MV4D המלא השיג mIoU של 82.47% ו-DSC של 90.65%. מגמות הביצועים המתאימות מוצגות באיור 9C ובאיור 9D, בהתאמה.
אלא אם צוין אחרת, כל ניסויי האבלציה נערכו באמצעות זרע אקראי קבוע של 100, בעוד שתוצאות ההשוואה העיקריות דווחו כממוצע ± SD על שלושה זרעים אקראיים בלתי תלויים (1, 52 ו-100). כתוצאה מכך, תוצאות האבלציה נועדו להשוות את התרומה היחסית של רכיבים בודדים תחת מסגרת מבוקרת של זרע יחיד, ולא לשחזר את הביצועים הסופיים של רב-זרעים שדווחו בניסויי ההשוואה המרכזיים.
בסך הכל, שילוב הדרגתי של זוגות הסריקה הנוספים ומודול SFusion Mamba שיפר באופן עקבי את ביצועי הסגמנטציה, כאשר תצורת MV4D המלאה השיגה את הביצועים הגבוהים ביותר בשני מערכי הנתונים.
מחקר אבלציה של בלוק הראייה הרב-זווית (MVV)
בלוק ה-MVV הוערך על ידי השוואת ארכיטקטורת הבסיס לגרסה הכוללת את ענף ההקרנה למעלה-למטה (טבלה 5). במאגר הנתונים של ISIC 2017, הכללת ענף ההקרנה למעלה ולמטה העלתה את mIoU מ-78.83% ל-80.96% ואת ה-DSC מ-88.15% ל-91.02%. במאגר הנתונים של ISIC 2018, ה-mIoU עלה מ-80.32% ל-82.46%, בעוד שה-DSC עלה מ-89.15% ל-90.57%.
| מודל | בלוק MVV בסיסי | הקרנה למעלה-למטה | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | ✓ | 78.83 | 88.15 | 80.32 | 89.15 | |
| MVM-UNet | ✓ | ✓ | 80.96 | 91.02 | 82.46 | 90.57 |
טבלה 5: מחקר אבלציה של בלוק הראייה הרב-תצוגה (MVV). השוואת ביצועים של בלוק ה-Multi-View Vision (MVV) הבסיסי עם ובלי ענף ההקרנה למעלה ולמטה. הביצועים מדווחים באמצעות חיתוך ממוצע על פני איחוד (mIoU) ומקדם דמיון קוביות (DSC) על מערכי הנתונים ISIC 2017 ו-ISIC 2018.
ניסויי האבלציה של MVV בלוק נערכו באמצעות זרע אקראי קבוע של 100. כתוצאה מכך, ביצועי התצורה המכילה את ענף ההקרנה למעלה-למטה משקפים את הגדרת האבלציה המבוקרת של זרע יחיד ועשויים להיות שונים במעט מהביצועים הממוצעים של שלושה זרעים שדווחו עבור מודל MVM-UNet המלא בניסויים המרכזיים בהשוואה המרכזית.
בסך הכל, שילוב ענף ההקרנה למעלה-למטה שיפר באופן עקבי את ביצועי הסגמנטציה בשני מערכי הנתונים, עם עליות שנצפו הן עבור mIoU והן עבור DSC.
מחקר אבלציה של מודול ה-Fusion Mamba הרב-שלבי (MFusion Mamba)
מודול MFusion Mamba הוערך על ידי השוואת אסטרטגיות היתוך גס שונות יחד עם רכיב ההיתוך העדין (טבלה 6; איור 10). ללא MFusion Mamba, MVM-UNet השיגה mIoU של 75.47% ו-DSC של 86.01% במאגר הנתונים של ISIC 2017, mIoU של 77.49% ו-DSC של 87.29% במאגר הנתונים ISIC 2018. מבין אסטרטגיות ההיתוך הגס שנבדקו, מוצר האדמארד השיג את השיפור הגדול ביותר. שילוב רכיב ההיתוך העדין שיפר עוד יותר את ביצועי הסגמנטציה. תצורת MFusion Mamba המלאה השיגה mIoU של 80.95% ו-DSC של 91.18% ב-ISIC 2017, ו-mIoU של 82.51% ו-DSC של 90.58% ב-ISIC 2018.
| מודל | מיזוג גס מבחינת אלמנט מקסימום | פיוז'ן גס חיבור לפי אלמנט | מכפלת פיוז'ן גס של Hadamard | מודול היתוך עדין | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | 75.47 | 86.01 | 77.49 | 87.29 | ||||
| MVM-UNet | ✓ | 76.21 | 86.47 | 78.35 | 87.82 | |||
| MVM-UNet | ✓ | 76.83 | 86.86 | 79.11 | 88.30 | |||
| MVM-UNet | ✓ | 78.26 | 87.83 | 80.06 | 88.96 | |||
| MVM-UNet | ✓ | ✓ | 80.95 | 91.18 | 82.51 | 90.58 |
טבלה 6: מחקר אבלציה של מודול ה-Multi-שלבי Fusion Mamba (MFusion Mamba). השוואת ביצועים של אסטרטגיות היתוך גס שונות, כולל היתוך מקסימלי (Max), חיבור לפי אלמנט (⊕), ומכפלת האדמארד (⊙), יחד עם מודול ההיתוך העדין המלא. הביצועים מדווחים באמצעות חיתוך ממוצע על פני איחוד (mIoU) ומקדם דמיון קוביות (DSC) על מערכי הנתונים ISIC 2017 ו-ISIC 2018.

איור 10. מחקר אבלציה של מודול ה-Multi-Stage Fusion Mamba (MFusion Mamba). (A) שינוי בחיתוך הממוצע על פני איחוד (mIoU) שהתקבל באמצעות אסטרטגיות היתוך גסות שונות (חיבור מקסימלי, לפי איברים, ומכפלת האדמר) ומודול ההיתוך העדין המלא. (ב) שינוי במקדם הדמיון לקוביות (DSC) שהושג באמצעות אסטרטגיות היתוך גסות שונות (חיבור מקסימלי, רכיב לפי איברים, ומכפלת האדמארד) ובמודול ההיתוך העדין המלא. (ג) שינוי ב-mIoU שהתקבל באמצעות אסטרטגיות היתוך גסות שונות (החיבור מקסימלי, לפי אלמנט, ומכפלת האדמארד) ומודול ההיתוך העדין המלא תחת ההגדרה הניסויית השנייה. (D) שינוי ב-DSC שהושג באמצעות אסטרטגיות היתוך גסות שונות (החיבור המקסימלי, לפי אלמנט, ומכפלת האדמר) ומודול ההיתוך העדין המלא תחת ההגדרה הניסויית השנייה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
במאגר הנתונים של ISIC 2017, תצורת MFusion Mamba המלאה השיגה mIoU של 80.95% ו-DSC של 91.18%. מגמות הביצועים המתאימות עבור mIoU ו-DSC מוצגות באיור 10A ובאיור 10B, בהתאמה. במאגר הנתונים של ISIC 2018, תצורת MFusion Mamba המלאה השיגה mIoU של 82.51% ו-DSC של 90.58%. מגמות הביצועים המתאימות מוצגות באיור 10C ואיור 10D, בהתאמה. ניסויי האבלציה של MFusion Mamba נערכו באמצעות זרע אקראי קבוע של 100. כתוצאה מכך, תצורת MFusion Mamba המלאה מייצגת את תוצאת האבלציה המבוקרת של זרע יחיד ועשויה להיות שונה במעט מהביצועים הממוצעים של שלושה זרעים שדווחו עבור מודל MVM-UNet המלא בניסויי ההשוואה המרכזיים.
בסך הכל, שילוב הדרגתי של אסטרטגיית ההיתוך הגס של מוצר האדמארד ורכיב ההיתוך העדין שיפר באופן עקבי את ביצועי הסגמנטציה, כאשר תצורת MFusion Mamba המלאה השיגה את הביצועים הגבוהים ביותר בשני מערכי הנתונים.
סיכום מחקרי אבלציה
במהלך ניסויי האבלציה, שילוב הדרגתי של ענפי זוג הסריקה ההיררכיים, הספירליים והרדיאליים, יחד עם מודול SFusion Mamba, שיפרו באופן עקבי את ביצועי הסגמנטציה (טבלה 4; איור 9). באופן דומה, הכללת ענף ההקרנה למעלה-למטה בבלוק MVV שיפרה את mIoU ו-DSC במאגרי ISIC 2017 ו-ISIC 2018 (טבלה 5). תצורת MFusion Mamba המלאה השיגה גם את הביצועים הגבוהים ביותר בין אסטרטגיות מיזוג תכונות רב-שלביות שנבדקו (טבלה 6; איור 10).
מחקר אבלציה של היפרפרמטרים
השפעות גודל הקלט וערך ההפסקה הוערכו על מערכי הנתונים של ISIC 2017 ו-ISIC 2018 (טבלה 7). שלוש רזולוציות קלט (256 × 256, 384 × 384, ו-512 × 512) הושוו. בהגדרות המוערכות, רזולוציית הקלט 256 × 256 השיגה את ביצועי הסגמנטציה הגבוהים ביותר בשני מערכי הנתונים.
| מודל | גודל קלט 256 × 256 | גודל קלט 384 × 384 | גודל קלט 512 × 512 | Dropout 0.0 | Dropout 0.1 | Dropout 0.2 | Dropout 0.3 | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | ✓ | ✓ | 80.02 | 88.91 | 81.76 | 89.92 | |||||
| MVM-UNet | ✓ | ✓ | 79.96 | 88.87 | 80.97 | 89.47 | |||||
| MVM-UNet | ✓ | ✓ | 77.48 | 87.28 | 78.76 | 88.11 | |||||
| MVM-UNet | ✓ | ✓ | 79.36 | 88.53 | 81.13 | 89.62 | |||||
| MVM-UNet | ✓ | ✓ | 80.94 | 90.15 | 82.49 | 90.50 | |||||
| MVM-UNet | ✓ | ✓ | 79.71 | 88.71 | 80.46 | 89.18 |
טבלה 7: מחקר אבלציה של גודל התמונה הנכנסת וערך הניתוק. השוואת ביצועים של MVM-UNet באמצעות גדלים שונים של תמונות קלט וערכי dropout. ביצועי הסגמנטציה מדווחים באמצעות חיתוך ממוצע מעל איחוד (mIoU) ומקדם דמיון קוביות (DSC) על מערכי הנתונים ISIC 2017 ו-ISIC 2018.
ערכי נשירה שונים הוערכו גם הם. מבין הקונפיגורציות שנבדקו, ערך הפסקה של 0.2 השיג את ביצועי הסגמנטציה הגבוהים ביותר בשני מערכי הנתונים ולכן שימש בניסויים המרכזיים.
מחקר אבלציה של תצורת שכבת המקודד-מפענח
הוערכו תצורות שונות של שכבות מקודד-מפענח כדי לבחון את השפעת עומק הרשת על ביצועי הסגמנטציה והעלות החישובית (טבלה 8). מבין התצורות שהוערכו, הארכיטקטורה הסימטרית {2, 2, 2, 2}-{2, 2, 2, 2} השיגה את ביצועי הסגמנטציה הכוללים הגבוהים ביותר תוך שמירה על מורכבות מודל נמוכה יחסית. הגדלת עומק הרשת ל-{2, 2, 9, 2}-{2, 9, 2, 2} יצרה ביצועי סגמנטציה דומים אך הגדילה הן את מספר הפרמטרים והן את העלות החישובית.
| מודל | תצורת שכבת מקודד-מפענח | פרמטרים (M) | פלופס (G) | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | {2,2,2,1}-{2,2,2,2} | 28.22 | 4.12 | 80.02 | 88.91 | 81.16 | 89.64 |
| MVM-UNet | {2,2,2,2}-{2,2,2,2} | 28.36 | 4.39 | 80.95 | 90.17 | 82.5 | 90.41 |
| MVM-UNet | {2,2,2,3}-{2,3,2,2} | 30.14 | 4.88 | 79.83 | 88.8 | 81.56 | 89.85 |
| MVM-UNet | {2,4,2,2}-{2,2,4,2} | 33.46 | 5.32 | 79.65 | 88.7 | 81.45 | 89.79 |
| MVM-UNet | {2,2,9,2}-{2,9,2,2} | 45.63 | 7.78 | 80.96 | 90.09 | 82.48 | 90.43 |
טבלה 8: מחקר אבלציה של תצורות שכבת המקודד-מפענח. השוואת ביצועים של תצורות שכבות שונות של מקודד-מפענח. הטבלה מדווחת על מספר פרמטרי המודל (פרמטרים), פעולות בנקודה צפה (FLOPs), חיתוך ממוצע מעל איחוד (mIoU), ומקדם דמיון קוביות (DSC) במאגרי הנתונים ISIC 2017 ו-ISIC 2018.
השוואת עלויות חישובית
היעילות החישובית של מודל MVM-UNet הסופי הושוותה לשיטות בסיס מייצגות, כולל HResFormer, H-vmunet, MISSFormer, H2Former, MedScale-Former ו-MCAFT, תחת אותה סביבת חומרה ורזולוציית קלט (טבלה 9). המדדים שנבדקו כללו זמן אימון לכל תקופה, זמן הסקה לכל תמונה, שימוש שיא בזיכרון GPU במהלך האימון, מספר פרמטרים ניתנים לאימון (Params) ו-FLOPs. זמן האימון נמדד כזמן הנדרש להשלמת תקופת אימון אחת, זמן ההסקה נמדד כזמן העיבוד הממוצע לכל תמונת בדיקה, ו-FLOPs חושבו עבור מעבר קדימה יחיד.
| שיטה | מקור. | זמן אימון (תקופה) | זמן הסקה (ms/image) | זיכרון GPU שיא (GB) | פרמטרים (M) | פלופס (G) |
| HResFormer | 34 | 520 | 213.08 | 19.2 | 117.00 | 131.70 |
| H-vmunet | 28 | 88 | 27.00 | 5.0 | 10.74 | 8.97 |
| MISSFormer | 30 | 355 | 92.86 | 12.6 | 42.33 | 109.45 |
| H2Former | 12 | 130 | 29.02 | 8.8 | 33.71 | 33.56 |
| מדסקייל-פורמר | 35 | 80 | 23.50 | 5.9 | 4.96 | 3.79 |
| MCAFT | 36 | 145 | 34.00 | 8.7 | 30.00 | 12.00 |
| MVM-UNet (שלנו) | — | 104 | 26.80 | 7.9 | 28.36 | 4.39 |
טבלה 9: השוואת עלויות חישובית של MVM-UNet ושיטות בסיס מייצגות. השוואת יעילות חישובית באותה סביבת חומרה ורזולוציית קלט. מדדים מדווחים כוללים זמן אימון לכל תקופה, זמן הסקה לכל תמונה, שימוש שיא בזיכרון יחידת עיבוד גרפיקה (GPU) במהלך האימון, מספר פרמטרי המודל (פרמטרים) ופעולות נקודה צפה (FLOPs). שיטות עם מימושים זמינים הוערכו באמצעות אותה סביבה ניסויית ככל שניתן.
כפי שמסוכם בטבלה 9, MVM-UNet דרש 104 שניות לתקופת אימון, 26.8 מילישניות לתמונה להסקת מסקנות, 7.9 GB של זיכרון GPU שיא ב-GPU, 28.36 מיליון פרמטרים ניתנים לכיוון ו-4.39 GFLOPs. בהשוואה ל-HResFormer, MISSFormer, H2Former ו-MCAFT, MVM-UNet דרש זמן אימון נמוך יותר, זמן הסקה נמוך יותר, שימוש שיא נמוך יותר בזיכרון GPU ופחות FLOPs. בהשוואה למודלים הקלים H-vmunet ו-MedScale-Form, MVM-UNet דרש זמן אימון ושימוש בזיכרון גדולים יותר אך שמר על מהירות הסקה דומה תוך שמירה על מורכבות חישובית נמוכה יחסית.
זמינות נתונים וקוד
מערכי הנתונים של ISIC 2017 ו-ISIC 2018 זמינים לציבור מארכיון International Skin Imaging Collaboration (ISIC), ומערך הנתונים של Synapse זמין לציבור ממאגר Synapse. פרטי רכישת מערכי הנתונים מסופקים בהצהרת האתיקה. בקצרה, מאגר הנתונים של ISIC 2017 התקבל ממאגר הנתונים הרשמי של ISIC 2017 Challenge (https://challenge.isic-archive.com/data/#2017), מאגר הנתונים של ISIC 2018 התקבל ממאגר הנתונים הרשמי של ISIC 2018 Challenge Task 1 (https://challenge.isic-archive.com/data/#2018), ומאגר Synapse התקבל ממאגר Synapse תחת מזהה accession syn3193805 (https://www.synapse.org/Synapse:syn3193805). תאריכי ההורדה המתאימים מדווחים בהצהרת האתיקה. גרסה ציבורית ראשונית של קוד המקור של MVM-UNet זמינה ב-https://github.com/LIXUEGUANG002/MVM-UNet. המאגר כולל את מימוש המודלים, מודולי רשת עיקריים, קבצי תצורה, הוראות ארגון מאגרי נתונים, סקריפטים לאימון וסקריפטי הערכה. חבילת השכפול המלאה, הכוללת קבצי קונפיגורציה סופיים, סקריפטים מלאים לניסוי, תיעוד נוסף ונקודות ביקורת מודל מאומנות, תהיה זמינה לציבור עם פרסום.
טבלה משלימה 1. ארכיטקטורת שכבה אחר שכבה של ה-Multi-view Vision Mamba UNet (MVM-UNet). הטבלה מסכמת את ארכיטקטורת הרשת הסדרתית של MVM-UNet, כולל שכבת הקלט, הטמעת פאץ', שלבי מקודד, בלוקי Multi-View Vision (MVV), פעולות מיזוג תיקונים, Multi-Stage Fusion Mamba (MFusion Mamba), שלבי מפענח, דגימה סופית וראש סגמנטציה. לכל שלב מופיעים הפעולה המתאימה, הפרמטרים העיקריים וגודל תכונת הפלט. E1–E4 מציינים את מפות התכונות של שלב המקודד המשמשות למיזוג תכונות רב-שלביות. B, H ו-W מציינים את גודל האצווה, גובה התמונה ורוחב התמונה, בהתאמה, ו-K מציין את מספר מחלקות הפלט (K = 1 עבור סגמנטציה בינארית של נגעי עור ו-K = 9 עבור סגמנטציה מרובת מחלקות של סינפסה, הכוללת מחלקת רקע אחת ושמונה מחלקות אורגן קדמיים). MFusion Mamba מייצרת תכונות מקודד רב-שלבי מאוחדות, המשולבות עם תכונות המפענח המתאימות במהלך שחזור המפענח. אנא לחצו כאן להורדת הקובץ הזה.
קובץ משלים 1. פסאודוקוד של מודול MV4D רב-תצוגה (MV4D) וממבה פיוז'ן רב-שלבית (MFusion Mamba). הקובץ המשלים מציג את זרימת העבודה האלגוריתמית של שני המודולים העיקריים המשמשים ב-MVM-UNet. אלגוריתם 1 מתאר את צינור העיבוד המלא של מודול Multi-View Four-Directional (MV4D), כולל יישור תכונות, בניית ארבעה רצפי זוגות סריקה (זיגזג, היררכי, ספירלי ורדיאלי), עיבוד מרחב מצבים סלקטיבי (S6), Fusion Mamba בתצוגת סריקה (SFusion Mamba), ושחזור מפת תכונות הפלט. אלגוריתם 2 מתאר את מודול ה-Multi-stage Fusion Mamba (MFusion Mamba), הכולל יישור תכונות מקודד רב-שלבי, מיזוג גס, היתוך עדין, אינטגרציה של מפענח ויצירת תכונת קלט המפענח המאוחד. משתנים וממדי טנזור מוגדרים בתוך האלגוריתמים. אנא לחצו כאן להורדת הקובץ הזה.
קובץ קידוד משלים 1. חבילת קוד המקור ל-MVM-UNet (MVM-UNet-master). הארכיון המשלים של ZIP מכיל את מימוש קוד המקור המלא של MVM-UNet ששימש במחקר זה. החבילה כוללת את ארכיטקטורת הרשת, מודולי Multi-View Four-Directional (MV4D) ו-Multi-stage Fusion Mamba (MFusion Mamba), קבצי קונפיגורציה, סקריפטים של אימון והערכה עבור ISIC 2017, ISIC 2018, ומערכי נתוני Synapse, פונקציות שימושיות ותיעוד פרויקט הנדרש לשחזור הניסויים המתוארים בפרוטוקול זה. החבילה כוללת גם את קובץ ה-README עם הוראות התקנה, תלות תוכנה, ארגון מערכי נתונים, ותהליכי עבודה של הדרכה והסקה. אנא לחצו כאן להורדת הקובץ הזה.
פרוטוקול זה מתאר את MVM-UNet, מסגרת סגמנטציה רפואית מבוססת ממבה. השיטה תוכננה כדי להתמודד עם שתי מגבלות של מודלים קיימים של סגמנטציה. ראשית, שיטות מבוססות CNN קונבנציונליות מוגבלות ביכולת למודל תלות לטווח ארוך ומידע היררכי הקשרי בתמונות רפואיות מורכבות43. שנית, שיטות מבוססות טרנספורמר יכולות למודל הקשר גלובלי אך בדרך כלל דורשות עלות חישובית גבוההיותר 23,25. MVM-UNet משתמשת בארכיטקטורת Mamba 13,14,15,16,17,18,19,20 להשגת מידול יעיל לטווח ארוך ומציגה סריקות מרובות תצוגות ומיזוג תכונות רב-שלביות לשיפור דיוק הסגמנטציה. מנקודת מבט של ביצוע פרוטוקולים ויכולת שחזור, מספר שלבים קריטיים להשגת תוצאות דומות לאלו שדווחו במחקר זה. ראשית, יש לשמור על חלוקת מערך הנתונים, שינוי גודל התמונה, אינטרפולציית המסכה, אסטרטגיית הנרמול והמרת ערוץ בהתאם לפרוטוקול, מכיוון שהבדלים בעיבוד המוקדם יכולים לשנות ישירות את התפלגות הקלט וגבולות המסכה. במיוחד, יש לשנות את גודל מסכות הסגמנטציה באמצעות אינטרפולציה של השכן הקרוב ביותר כדי להימנע מהכנסת ערכי תוויות לא-שלמים44. שנית, יש לבדוק את תצורת האימון, כולל רזולוציית הקלט, גודל האצווה, הגדרות האופטימיזציה, לוח זמנים לקצב למידה, זרע אקראי, מקדמי משקל אובדן, כלל בחירת נקודות ביקורת, וסף הסקה או פעולת ארגמקס, לפני השוואת התוצאות. אם תוצאות משוחזרות נמוכות בבירור מהערכים המדווחים, המשתמשים צריכים קודם כל לאמת את נתיב מערך הנתונים, פורמט ההערות, קונבנציה של תוויות רקע-קדמית, טעינת נקודות ביקורת, פיצול אימות או בדיקה, והליך חישוב המטריקה. דליפת גבולות, מסכות מפורקות או מבנים קטנים חסרים בדרך כלל מצביעים על חוסר עקביות פוטנציאלי בעיבוד מוקדם, אינטרפולציה של מסכה, בחירת נקודות ביקורת או עיבוד לאחר ההסקה.
התרומה המרכזית של MVM-UNet היא מודול MV4D. בניגוד לאסטרטגיות סריקה דו-ממדיות פשוטות שאומצו בארכיטקטורות מבוססות מודל-מרחב-מצב קודמות 14,15,16,17,18,19,20, MV4D עושה שימוש בזוגות סריקה זיגזג, היררכיים, ספירליים ורדיאליים כדי ללכוד מידע חזותי משלים. זוגות סריקה זיגזג מסייעים לאזן בין מידע מרחבי מקומי וגלובלי, זוגות סריקה היררכיים משפרים חילוץ תכונות רב-קנה מידה, זוגות סריקה ספירליים מחזקים ייצוג קווי מתאר גלובליים, וזוגות סריקה רדיאליים משפרים את חילוץ תכונות הקצוות והגבול המקומיים. SFusion Mamba משלמת אז את מודאליות הסריקה המשלימות הללו. התוצאות המייצגות וניסויי האבלציה (טבלאות 4 ו-5; איור 9) להראות כי גם המגוון של דפוסי הסריקה וגם מנגנון המיזוג תורמים לשיפור ביצועי הסגמנטציה. רכיב חשוב נוסף הוא MFusion Mamba, המשמש כמודול מיזוג תכונות בין המקודד למפענח. ארכיטקטורות בצורת U קונבנציונליות, כולל U-Net 8,21,V-Net 44, ורבים מהדגמיםהבאים 9,23,25, מעבירים בעיקר מידע דרך חיבורים מדלגים לפי שלבים. אסטרטגיה זו עשויה שלא לנצל במלואו ייצוגים משלימים של מקודדים מרובי שלבים. MFusion Mamba מתמודד עם מגבלה זו על ידי שילוב תכונות מקודד דרך מיזוג גס ומיזוג עדין לפני הפענוח. התוצאות המייצגות (טבלה 6; איור 10) מראים כי MFusion Mamba משפר באופן עקבי את ביצועי הסגמנטציה, ומצביע על כך שמיזוג תכונות רב-שלבי מפורש מועיל לסגמנטציה רפואית של תמונות.
התרומה המתודולוגית של MVM-UNet צריכה להיות מובנת כעיצוב מחדש ברמת הארכיטקטורה ולא כהמצאה של כל פעולה בודדת מאפס. ארכיטקטורות מקודד-מפענח בצורת U, חיבורים שאריתיים, שכבות הקרנה ובלוקי מודל ממבה/מרחב מצבים (SSM) נחקרו בהרחבה במחקרים קודמים 8,13,14,15,16,17,18,19,20,21,23,24,25 ,29,44. עם זאת, שילוב ישירות של רכיבים אלו אינו בהכרח מתמודד עם האתגרים הספציפיים של חלוקת תמונות רפואיות. החידוש של MVM-UNet טמון בתכנון מתואם של שלושה היבטים. ראשית, מודול MV4D מחליף דפוס סריקה יחיד או מוגבל בארבעה ענפי זוג סריקה משלימים, מה שמאפשר למודל ללכוד רציפות מרחבית, מבנה רב-קנה מידה, מידע על קווי מתאר גלובליים ופרטי גבולות מקומיים. שנית, SFusion Mamba ו-MVV Block ממזגים ומשפרים תכונות ספציפיות לסריקה לפני שהן מועברות לשלב הרשת הבא. שלישית, MFusion Mamba מאגד במפורש תכונות מקודד רב-שלבי לפני הפענוח, ומשלימה חיבורי דילוג קונבנציונליים 8,21,44 ומשפרת את השימוש במידע היררכי. תוצאות האבלציה (טבלאות 4–6; איורים 9 ו-10) בנוסף, תומכים בהיגיון עיצובי זה, ומראים כי סריקה מרובת תצוגות, מיזוג ספציפי לסריקה, ענף ההקרנה למעלה-למטה, ומיזוג תכונות רב-שלביות תורמים כולם לשיפור ביצועי הסגמנטציה. לכן, התרומה של MVM-UNet טמונה באינטגרציה ספציפית למשימה ואומת ניסויית של מידול מרחבי מבוסס ממבה ומיזוג תכונות מקודד-מפענח לצורך סגמנטציה רפואית של תמונות.
למרות ביצועיה החזקים, ל-MVM-UNet יש מספר מגבלות. ראשית, ביצועי הסגמנטציה לא השתפרו באופן עקבי עם גדלי תמונות קלט גדולים יותר, מה שמרמז שהארכיטקטורה הנוכחית עשויה שלא לנצל במלואו מידע תמונה ברזולוציה גבוהה. שנית, המודל לא הוערך באופן נרחב בתנאי דימות עם רעש גבוה או ניגודיות נמוכה, אשר נפוצים בפרקטיקה קלינית ועלולים להשפיע על עמידות הסגמנטציה. שלישית, למרות שהמודל השיג ביצועים חזקים בשלושה מערכי נתונים ציבוריים, יש צורך באישור נוסף על מאגרי דימות רפואיים גדולים ומגוונים יותר. הפרוטוקול ניתן להתאמה למשימות חלוקת תמונות רפואיות אחרות, אך יש ליישם בזהירות מספר שינויים נוספים. למשימת סגמנטציה בינארית חדשה, המשתמשים צריכים לשנות את טוען מערכי הנתונים, פרמטרי הנורמליזציה, רזולוציית הקלט וסף החזית תוך שמירה על תהליך אובדן והערכה בינארי של BCE-Dice. למשימת סגמנטציה מרובת מחלקות חדשה, המשתמשים צריכים לעדכן את מספר מחלקות הפלט, מיפוי מדד מחלקות, המרת תווית חמה אחת, קונפיגורציית הפסד CE-Dice, ומדדי הערכה לפי מחלקות44. עבור מערכי נתונים בגווני אפור, יש להתאים את תצורת ערוץ הקלט לארכיטקטורת המודל על ידי שימוש בהקרנת קלט חד-ערוצית או חזרה על התמונה בגווני אפור ליצירת קלט בשלושה ערוצים, בהתאם ליישום. השיטה עשויה לפעול בצורה לא אופטימלית כאשר מבני המטרה קטנים מאוד, הגבולות חלשים או מעורפלים, ניגודיות התמונה שונה באופן מהותי מנתוני האימון, או כאשר מערך הנתונים המטרה מציג שינוי תחום משמעותי. בתנאים אלו, ייתכן שמשתמשים יצטרכו להתאים את רזולוציית הקלט, אסטרטגיית ההגברה, איזון מחלקות, משקל ירידה או לוח זמנים מדויק, תוך שמירה על אותו פרוטוקול הערכה כדי להבטיח השוואות הוגנות.
במאגר הנתונים Synapse, MVM-UNet השיגה ביצועי סגמנטציה רב-איבריים חזקים תחת החלוקה הנפוצה של אימון 18 מקרים ובדיקות 12 מקרים. למרות שהשיטה המוצעת השיגה את ממוצע ה-DSC הגבוה ביותר מבין שיטות הבסיס המייצגות שנבדקו במחקר זה (טבלה 3), שיטות עדכניות יותר דיווחו על ביצועים גבוהים יותר של סינפס תחת הגדרות אימון שונות ופרוטוקולי הערכהשונים. לכן, אנו נמנעים מלתאר MVM-UNet כשיגה ביצועים מתקדמים ב-Synapse ובמקום זאת מתארים אותה כהשגת ביצועים חזקים במסגרת ניסוי מוערך. ממצאים אלו מצביעים על כך שביצועי MVM-UNet נובעים מההתאמה הספציפית למשימה של מידול מבוסס ממבה לחלוקת תמונה רפואית 13,14,15,16,17,18,19,20. במקום להסתמך על אסטרטגיית סריקה אחת, MVM-UNet מפרקת מידול תכונות ויזואליות למספר תצוגות סריקה משלימות ומשלבת אותן דרך SFusion Mamba. בנוסף, MFusion Mamba משפר את זרימת המידע בין המקודד למפענח על ידי איגום מפורש של תכונות מקודד רב-שלבי מעבר לחיבורי דילוג קונבנציונליים 8,21,44. עיצוב זה מאפשר למודל המוצע להשיג ביצועים חזקים הן במשימות סגמנטציה בינארית של נגעי עור והן במשימות סגמנטציה רב-איברית.
העבודה העתידית צריכה להתמקד בשיפור MVM-UNet לחלוקת תמונות רפואיות ברזולוציה גבוהה. ארכיטקטורות רב-קנה מידה עמוקות או אדפטיביות עשויות לאפשר למודל לנצל מידע תמונה ברזולוציה גבוהה בצורה יעילה יותר. מחקרים עתידיים צפויים גם להעריך את עמידות MVM-UNet בתנאי דימות רועשים, בעלי ניגודיות נמוכה ובעלי הזזת דומיין. בנוסף, אסטרטגיית הסריקה הרב-תצוגית המוצעת עשויה להיות מורחבת למשימות ניתוח תמונות רפואיות נוספות, כולל זיהוי נגעים4, מיקום איברים, סיווג גידולים וחלוקה תלת-ממדית10,11. לסיכום, MVM-UNet מספקת מסגרת יעילה וניתנת לשחזור לחלוקת תמונות רפואיות. האינטגרציה של מודול MV4D ו-MFusion Mamba מאפשרת למודל ללכוד מידע מרחבי משלים, הקשר רב-קנה מידה, מידע על קווי מתאר גלובליים, פרטי גבולות מקומיים ותכונות סמנטיות רב-שלביות. התוצאות המייצגות שהושגו על מערכי הנתונים ISIC 2017, ISIC 2018 ו-Synapse מדגימות את יעילות הארכיטקטורה המוצעת. פרוטוקול זה מספק הפניה מעשית לחוקרים המפתחים ארכיטקטורות יעילות מבוססות SSM/Mamba לחלוקת תמונותרפואיות 13,14,15,16,17,18,19,20.
המחברים מצהירים שאין להם אינטרסים פיננסיים מתחרים.
מחקר זה לא קיבל מימון חיצוני.
```html
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| Hardware - GPU workstation or GPU server | Institutional computing platform / local workstation | Custom-built local GPU workstation; Ubuntu 22.04.1 with Linux kernel 6.8.0; Intel Core i9-13900K CPU; NVIDIA A800 GPU; 128 GB RAM; 512 GB local storage. | Computational platform for training, validation, testing, ablation, and inference-only experiments. |
| Hardware - Graphics processing unit (GPU) | NVIDIA Corporation | NVIDIA A800 GPU (80 GB memory). | GPU-accelerated model training and inference. |
| Hardware - Central processing unit (CPU) | Intel Corporation / AMD | 13th Gen Intel Core i9-13900K CPU. | Host processor for data loading, preprocessing, and experiment execution. |
| Hardware - System memory (RAM) | Institutional computing platform / local workstation | 128 GB system RAM | Memory for dataset loading, preprocessing, and training. |
| Hardware - Storage | Institutional computing platform / local workstation | 2 TB NVMe solid-state drive. | Storage for datasets, checkpoints, logs, and generated prediction figures. |
| Software environment - Operating system | Canonical Ltd. | Recommended: Ubuntu 22.04.1 LTS | Operating system for the computational environment. |
| Software environment - Conda environment | Anaconda, Inc. / Miniconda | Environment name: mvmunet | Python environment used to install and isolate dependencies. |
| Software environment - Python | Python Software Foundation | Python 3.8 | Programming language used for implementation and experiment execution. |
| Software environment - CUDA toolkit | NVIDIA Corporation | CUDA Toolkit 11.8 | GPU computing backend required by PyTorch and Mamba-related packages. |
| Software environment - cuDNN | NVIDIA Corporation | cuDNN 8.7.0. | GPU-accelerated deep-learning primitives used through PyTorch. |
| Python package - PyTorch | PyTorch | torch == 2.0.1 | Deep-learning framework for model training, loss calculation, optimization, and inference. |
| Python package - Torchvision | PyTorch | torchvision == 0.14.0 | Image transform utilities used in preprocessing and augmentation. |
| Python package - Torchaudio | PyTorch | torchaudio == 0.13.0 | Installed with the recommended PyTorch environment. |
| Python package - timm | timm developers | timm == 0.4.12 | Model-component or utility dependency listed in the repository environment instructions. |
| Python package - triton | OpenAI / Triton developers | triton == 2.0.0 | Dependency used by GPU-accelerated sequence modeling components. |
| Python package - causal-conv1d | causal-conv1d developers | causal_conv1d == 1.0.0 | Efficient causal convolution dependency required by the Mamba implementation. |
| Python package - mamba-ssm | Mamba SSM developers | mamba_ssm == 1.0.1 | State-space sequence modeling package used for Mamba/S6-related components. |
| Python package - NumPy | NumPy developers | NumPy version 1.24.3. | Numerical computation and array operations. |
| Python package - SciPy | SciPy developers | SciPy version 1.10.1. | Scientific computation; scipy.ndimage.zoom is imported in utils.py. |
| Python package - SimpleITK | Insight Software Consortium | SimpleITK version 2.2.1. | Medical image input/output and preprocessing utility imported in utils.py. |
| Python package - MedPy | MedPy developers | MedPy version 0.4.0. | Medical image metric calculation package imported in utils.py. |
| Python package - scikit-image | scikit-image developers | scikit-image version 0.21.0. | Image-processing dependency listed in README. |
| Python package - scikit-learn | scikit-learn developers | scikit-learn version 1.3.2. | Machine-learning utility package listed in README. |
| Python package - matplotlib | Matplotlib developers | Matplotlib version 3.7.2. | Used for saving qualitative visualization figures. |
| Python package - h5py | h5py developers | h5py version 3.9.0. | HDF5 file support for Synapse test volumes. |
| Python package - thop | THOP developers | THOP version 0.1.1.post2209072238. | Used when calculating FLOPs and parameter-related computational cost. |
| Python package - packaging | Python Packaging Authority | packaging version 23.1. | Dependency listed in README. |
| Python package - pytest | pytest developers | pytest version 7.4.0. | Dependency listed in README. |
| Python package - chardet | chardet developers | chardet version 5.2.0. | Dependency listed in README. |
| Python package - yacs | YACS developers | yacs version 0.1.8. | Configuration utility dependency listed in README. |
| Python package - termcolor | termcolor developers | termcolor version 2.3.0. | Logging/terminal utility dependency listed in README. |
| Python package - submitit | submitit developers | submitit version 1.4.5. | Experiment/job utility dependency listed in README. |
| Python package - tensorboardX | tensorboardX developers | tensorboardX version 2.6.2.2. | Training log visualization utility listed in README. |
| Python package - ml-collections | ml_collections developers | ml-collections version 0.1.1. | Imported by configs/config_setting_synapse.py. |
| Dataset - ISIC 2017 Challenge dataset | International Skin Imaging Collaboration | ISIC 2017 skin lesion segmentation dataset | Public de-identified dermoscopic skin lesion images and masks used for binary segmentation. |
| Dataset - ISIC 2018 Challenge Task 1 dataset | International Skin Imaging Collaboration | ISIC 2018 Task 1: Lesion Boundary Segmentation | Public de-identified dermoscopic skin lesion images and masks used for binary segmentation. |
| Dataset - Synapse Multi-Atlas Labeling Beyond the Cranial Vault dataset | Synapse / Sage Bionetworks | Accession identifier: syn3193805 | Public abdominal CT multi-organ segmentation dataset. |
| Data organization - ISIC 2017 data folder | Authors / repository layout | data/isic2017/ | Expected local folder containing train and validation images/masks. |
| Data organization - ISIC 2018 data folder | Authors / repository layout | data/isic2018/ | Expected local folder containing train and validation images/masks. |
| Data organization - Synapse data folder | Authors / repository layout | data/Synapse/ | Expected local folder for Synapse lists, train_npz, and test_vol_h |
בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה
בקש הרשאה