מאמר שיטה

מסגרת רשת בצורת U של ממבה עם ראייה מרובת תצוגה לסגמנטציה של תמונות רפואיות

DOI:

10.3791/72616

7 באוגוסט 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פרוטוקול זה מתאר כיצד לבנות, לאמן ולהעריך מסגרת רשת U-Shape של Vision Mamba רב-תצפית לחלוקת תמונות רפואיות, המאפשרת סגמנטציה שחזורית של נגעי עור ואיברי בטן באמצעות הכנת מערכי נתונים סטנדרטיים, יישום מודלים והערכת ביצועים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

סגמנטציה של תמונות רפואיות דורשת שיטות חישוביות שתופסות במדויק הקשר גלובלי, גבולות מקומיים ומבנים אנטומיים רב-סקאליים, תוך שמירה על שחזור ביישומים שונים. מאמר זה מציג פרוטוקול לבניה, הדרכה והערכה של מסגרת רשת U-Shape של Vision Mamba רב-תצוגה לחלוקת תמונות רפואיות דו-ממדיות. הפרוטוקול מספק תהליך עבודה שניתן לשחזר הכולל רכישת מערכי נתונים ציבוריים, עיבוד מוקדם של תמונות ומסכה, בניית רשת, הדרכת מודלים, בחירת נקודות ביקורת, והערכת ביצועים כמותית ואיכותית. המסגרת משלבת סריקת תכונות מרובת תצוגה ללכידת מידע משלים על מרחב, קווי מתאר, קנה מידה וגבולות, ומיישמת מיזוג תכונות רב-שלבי בתוך ארכיטקטורת מקודד-מפענח בצורת U לשיפור האינטגרציה של תכונות במהלך סגמנטציה. הפרוטוקול מודגם באמצעות מאגרי נתונים זמינים לציבור על נגעי עור וחלוקת איברי בטן. במסגרת זרימת היישום המתוארת, המסגרת משיגה ביצועי סגמנטציה תחרותיים באמצעות מדדי הערכה סטנדרטיים. על ידי מעקב אחר הנהלים המוצגים בפרוטוקול זה, חוקרים יכולים לשחזר את מימוש המודל, לאמן את הרשת באמצעות הגדרות ניסוי מוגדרות, להעריך את ביצועי הסגמנטציה ולהתאים את זרימת העבודה למשימות סגמנטציה רפואיות קשורות הדורשות ניתנת לשחזור ניתנת לניתוח מבוסס למידה עמוקה.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

סגמנטציה של תמונות רפואיות היא משימה יסודית בתחומי ראיית המחשב וניתוח תמונות רפואיות 1,2,3. זה כולל חלוקת תמונה לאזורים או אובייקטים מרובים לניתוח ועיבוד נוספים. טכנולוגיה זו חשובה במיוחד בהדמיה רפואית משום שהיא מסייעת לרופאים לזהות ולאתר אזורים פתולוגיים, ובכך משפרת את הדיוק האבחוני ותכנון הטיפול. עם התקדמות טכנולוגיות הדמיה רפואית, כגון הדמיית תהודה מגנטית (MRI), טומוגרפיה ממוחשבת (CT) וטומוגרפיית פליטת פוזיטרונים (PET), הביקוש לטכניקות סגמנטציה מדויקות של תמונות רפואיות המשיך לעלות. השיטות הנוכחיות לסגמנטציה של תמונות רפואיות ניתנות לסיווג כללי לשלוש גישות עיקריות: שיטות מבוססות רשת עצבית קונבולוציונית (CNN)4, שיטות מבוססות טרנספורמר5, ושיטות מבוססות מודל-מרחב מצבים (SSM) 6,7. שיטות מבוססות CNN משתמשות בדרך כלל בארכיטקטורות רשת בצורת U לחלוקת תמונות רפואיות. הארכיטקטורה הנפוצה ביותר בקטגוריה זו היא U-Net8, שהדגימה את היעילות של ארכיטקטורת מקודד-מפענח בצורת U לסגמנטציה של תמונות ביו-רפואיות. U-Net3+ משלבת חיבורי דילוגים צפופים מ-UNet++9 עם חיבורי דילוג בקנה מידה מלא כדי לשפר את אגרגציית התכונות הרב-קניות. עם זאת, לשיטות מבוססות CNN יש יכולת מוגבלת ללכוד תלויות לטווח ארוך, ולכן ייתכן שאינן מודלים ביעילות מידע הקשרי לטווח ארוך.

שיטות מבוססות טרנספורמרים לוכדות ביעילות תלות לטווח ארוך באמצעות מנגנון תשומת הלב העצמית, שמאפשר חישוב מקבילי ומקצה משקלי תשומת לב שונים לאזורים שונים של עניין. UNETR++10 מציג את מודול תשומת לב זוגית יעילה (EPA) כדי להפחית את מספר הפרמטרים והעלות החישובית. nnFormer11 משלבת פעולות קונבולוציונליות משולבות וריכוז עצמי ומציגה מנגנון תשומת לב עצמי מבוסס נפח מקומי-גלובלי ללמידת ייצוגים וולומטריים בסגמנטציה תלת-ממדית (תלת-ממדית) של תמונות רפואיות. H2Former12 מציע משמר ראייה היברידי היררכי יעיל המשלב מנגנוני קשב עם חילוץ תכונות מבוסס CNN במקודד. עם זאת, שיטות מבוססות טרנספורמר מציגות מורכבות חישובית ריבועית עם עלייה באורך הרצף, מה שמוביל לעלות חישובית גבוהה משמעותית. איור 1 ממחיש את המוטיבציה ל-MVM-UNet ומשווה את אסטרטגיית הסריקה הרב-תצוגה המוצעת למסגרות סגמנטציה קיימות מבוססות SSM.

figure-introduction-1
איור 1. השוואה בין MVM-UNet לבין ארכיטקטורות סגמנטציה מבוססות מודל מצב-מרחב טהור (SSM) קיימות. השוואה בין מסגרת סגמנטציה קונבנציונלית המבוססת על מודל מצב טהור (SSM) לבין ארכיטקטורת Multi-View Mamba U-Net (MVM-UNet) המוצעת. הפאנל העליון ממחיש את MVM-UNet, שבו מודול Multi-View 4-Directional (MV4D) מפיק תכונות משלימות באמצעות זוגות סריקה זיגזג, היררכיים, ספירליים ורדיאליים, המשולבים על ידי Spatial Fusion Mamba (SFusion Mamba), בעוד ש-Multi-stage Fusion Mamba (MFusion Mamba) מאגד תכונות מקודד רב-סקאלה לפני הפענוח. הפאנל התחתון מציג ארכיטקטורה מייצגת מבוססת SSM טהורה המשתמשת במודולי סריקה סלקטיבית דו-ממדית (SS2D) עם סריקה צולבת. התרשים מדגיש את ההבדלים האדריכליים בין רשתות סגמנטציה מבוססות SSM קונבנציונליות לבין ה-MVM-UNet המוצע. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

שיטות מבוססות SSM משלבות את יכולת המידול הגלובלית של טרנספורמרים עם מורכבות חישובית ליניארית. ארכיטקטורת הממבה מעבדת באופן סלקטיבי מידע קלט באמצעות מודל מרחב מצבים סלקטיבי (Selective-SSM), המאפשר למודל להתאים את הפרמטרים שלו באופן דינמי בהתאם לקלט, תוך סינון מידע לא רלוונטי והדגשת תכונות אינפורמטיביות. Vim13 ו-VMamba14 מתאימים את ארכיטקטורת הממבה למשימות ראייה ממוחשבת. U-Mamba15 עושה שימוש בארכיטקטורת CNN–SSM היברידית כדי לחקור את יישום SSMs בחלוקת תמונות רפואיות, בעוד שמאמבה-UNet16 מאמץ ארכיטקטורת מקודד-מפענח מבוססת SSM לחלוטין לפיצול תמונות רפואיות. שיטות אלו משיגות ביצועים תחרותיים תוך שימוש בפרמטרים קטנים בהרבה. עם זאת, שיטות מבוססות SSM/Mamba כיום בעיקר מפיקות תכונות תמונה באמצעות פאצ'ים פשוטים של תמונה ואסטרטגיות סריקה SS2D, אשר מציבות מספר מגבלות לסגמנטציה רפואית של תמונות. ראשית, SS2D וטכניקות מבוססות פאץ' מיועדות בעיקר למשימות ראייה ממוחשבת כלליות. Local Mamba17 ו-MotionMamba 18 הציעו כי אסטרטגיית הסריקה SS2D אינה מספקת לכל המשימות הוויזואליות, משום שאסטרטגיות סריקה שונות לוכדות סוגים שונים של מידע חזותי. שנית, אסטרטגיית הסריקה של SS2D פשוטה יחסית, ומתבססת רק על כיווני סריקה אופקיים ואנכיים. כתוצאה מכך, ייתכן שהוא לא מצליח ללכוד כראוי יחסים מרחביים מורכבים ופרטים מבניים עדינים. סגמנטציה רפואית של תמונות דורשת מידול סימולטני של הקשר מרחבי גלובלי ושל תכונות אנטומיות מקומיות מדויקות. יתרה מזאת, שיטות קיימות מבוססות SSM/Mamba מאפשרות מיזוג תכונות מוגבל בין המקודד למפענח. ארכיטקטורות כמו UNet++ ו-FATNet משפרות את דיוק הסגמנטציה באמצעות מיזוג תכונות משופר, ומדגישות את חשיבות האינטגרציה היעילה של תכונות לסגמנטציה של תמונות רפואיות.

כדי להתמודד עם מגבלות אלו, מאמר זה מציע מסגרת חדשה לחלוקת תמונות רפואיות מבוססת ממבה, הנקראת MVM-UNet. כפי שמוצג באיור 1, מודול MV4D המוצע ל-Multi-View Four-Directional משמש כרכיב הליבה לחילוץ תכונות ב-MVM-UNet ותוכנן במיוחד לחלוקת תמונות רפואיות על ידי שילוב מידע מארבע אסטרטגיות סריקה שונות. כל אסטרטגיית סריקה מפיקה תכונות תמונה משלימות ומייצגת תצוגה שונה של התמונה הנכנסת. סריקת זיגזג19 מחליפה את כיוון המעבר בסוף כל שורה או עמודה, ובכך מאזנת בין מידע מרחבי מקומי וגלובלי. לעומת זאת, סכמות הסריקה הספירליתוהרדיאלית 20 מספקות כיסוי מקיף על ידי התפשטות החוצה מהמרכז או פנימה מהפריפריה. סריקההיררכית 18 לוכדת תכונות מקומיות וגלובליות בקני מידה שונים. כדי לשפר את עמידות כל אסטרטגיית סריקה, זוגות סריקה ממזגים לפני ההזנה לבלוק S6. מודול Scan-view Fusion Mamba (SFusion Mamba) משלב לאחר מכן את התכונות שהופקו מארבעת מודאליות הסריקה. כדי לנצל בצורה יעילה תכונות מקודד רב-קניות, מאמר זה מציע בנוסף מודול מיזוג ממבה רב-קנה מידה (MFusion Mamba), שאוסף וממזג את הפלטים מכל שלב מקודד לפני שהוא מעביר את התכונות הממוזגות למפענח. MVM-UNet הוערך על פי מערכי הנתונים ISIC 2017, ISIC 2018 ו-Synapse. תוצאות ניסוי מראות ש-MVM-UNet משיג ביצועי סגמנטציה תחרותיים במאגרי הנתונים ISIC 2017, ISIC 2018 ו-Synapse.

ארכיטקטורות סגמנטציה מייצגות כוללות סגמנטציה רפואית מתקדמת עוד יותר. U-Net יושמה בהצלחה גם במשימות ניתוח תמונות ביו-רפואיות כגון ספירת תאים, זיהוי ומורפומטריה21. ארכיטקטורות CNN משודרגות על ידי תשומת לב, כמו CA-Net22, משפרות ייצוג תכונות באמצעות מנגנוני קשב מקיפים. מסגרות סגמנטציה מייצגות מבוססות טרנספורמר, כולל TransUNet23, Pyramid Medical Transformer24, Swin U-Net25, TransAttUNet26 ו-TransCUNet27, מדגימות עוד יותר את היעילות של מידול תכונות גלובלי מבוסס תשומת לב לסגמנטציה של תמונות רפואיות.

עיצוב MVM-UNet מונע משתי מגבלות של שיטות סגמנטציה קיימות מבוססות SSM/Mamba. ראשית, רבים מהמודלים הנוכחיים של Vision Mamba מסתמכים על אסטרטגיות סריקה דו-ממדיות פשוטות, שעשויות להיות בלתי מספקות לתמונות רפואיות המכילות גבולות נגעים לא סדירים, אזורי מטרה קטנים ומבנים אנטומיים רב-קנפיים. שנית, ארכיטקטורות מקודד-מפענח בצורת U קונבנציונליות מעבירות בעיקר תכונות דרך חיבורי דילוג מתאימים, מה שמגביל את השימוש הישיר במידע מקודד רב-שלבי במהלך הפענוח. לכן, MVM-UNet מציגה את MV4D לשיפור מידול מרחבי רב-תצוגה ואת MFusion Mamba לאגרגציה מפורשת של תכונות מקודד רב-שלבי. עיצוב זה נועד להתאים את המידול ארוך הטווח המבוסס ממבה לדרישות הספציפיות של סגמנטציה של תמונות רפואיות.

למרות ש-MVM-UNet בנוי על פרדיגמת המקודד-מקודד הכללית ומידול רצפים מבוסס ממבה, החידוש שלו טמון באופן שבו רכיבים אלו מותאמים ומשולבים לסגמנטציה רפואית של תמונות. במקום פשוט לשלב בלוק ממבה סטנדרטי בתוך עמוד שדרה בצורת U, המסגרת המוצעת מעצבת מחדש את תהליך המידול המרחבי באמצעות מספר ענפי זוג סריקה ממוקדי משימות, מציגה את SFusion Mamba לשילוב ייצוגים ספציפיים לסריקה, משפרת את בלוק MVV עם מסלולי שאריות והקרנה, ומכניסה את MFusion Mamba בין המקודד למפענח כדי לאגד תכונות מקודד רב-שלבי לפני הפענוח. עיצוב ברמת ארכיטקטורה זה שואף להתמודד עם גבולות לא סדירים, אזורי מטרה קטנים ומבנים אנטומיים רב-קנה מידה הנצפים בדרך כלל בתמונות רפואיות.

פרוטוקול זה מתאים במיוחד למשימות סגמנטציה הדורשות מידול סימולטני של מידע הקשרי לטווח ארוך, גבולות אובייקטים לא סדירים ומבנים אנטומיים רב-קנה מידה בתמונות רפואיות דו-ממדיות. בהשוואה לשיטות סגמנטציה מבוססות CNN, עיצוב המקודד-מפענח מבוסס ממבה מספק מנגנון יעיל למידול הקשר תוך שמירה על זרימת עבודה בצורת U המוכרת לחוקרי סגמנטציה רפואית. בהשוואה לשיטות מבוססות טרנספורמר, המסגרת המוצעת נמנעת משימוש ישיר בתשומת לב עצמית ריבועית ומיועדת לחוקרים המחפשים מידול הקשר גלובלי באמצעות מנגנון מידול רצף יעיל יחסית. בהתאם לכך, פרוטוקול זה מתאים לסגמנטציה של נגעי עור, חלוקת איברים בטניים ומשימות דו-ממדיות דומות של חלוקת תמונות רפואיות, שבהן חשוב גם מידע מבני גלובלי וגם פרטי גבול מקומיים.

לפרוטוקול זה יש גם מגבלות שיש לקחת בחשבון לפני השימוש. ייתכן שהוא לא נחוץ למשימות סגמנטציה פשוטות יחסית שבהן CNN קל משקל כבר מספק ביצועים מספקים. בנוסף, הוא אינו מתוכנן ישירות לסגמנטציה נפחית תלת-ממדית מלאה ללא התאמה אדריכלית. חוקרים עם נתונים מוגבלים מאוד עם הערות, משאבי יחידת עיבוד גרפיקה (GPU) מוגבלים, או דרישה למודלים קלאסיים ניתנים לפרשנות גבוהה, צריכים גם הם לשקול את המגבלות הללו לפני יישום הפרוטוקול. בסך הכול, שיטה זו מיועדת לחוקרים המעוניינים לשחזר ולהעריך מסגרת סגמנטציה בצורת U מבוססת ממבה, המאזנת בין מידול הקשר ארוך טווח, ייצוג גבולות מקומיים ומיזוג תכונות רב-שלביות.

התרומות המרכזיות הן כדלקמן:

1. מאמר זה מציג מסגרת חלוקה רפואית חדשנית מבוססת ממבה, הנקראת MVM-UNet. בניגוד לגישות שמשלבות ישירות בלוקי ממבה מבוססי SS2D או סטנדרטיים, MVM-UNet מציגה את MV4D למודלים של תכונות תמונה רפואיות מארבע תצוגות זוג סריקה משלימות, כולל זיגזג, היררכי, ספירלי ורדיאלי.

2. מאמר זה מעצב את SFusion Mamba ואת בלוק ה-MVV כדי לשלב ייצוגים ספציפיים לסריקה ולשפר את טרנספורמציית התכונות. SFusion Mamba מאחד את התכונות שהופקו מענפי זוגות סריקה שונים, בעוד שהענפים השאריים וההקרנה למעלה-למטה בתוך בלוק MVV מספקים מסלולי תכונות משלימים שמייצבים ומעשירים ייצוגים של תכונות.

3. מאמר זה מציג את MFusion Mamba כמודול מיזוג רב-שלבי ביניים בין המקודד למפענח. בניגוד לחיבורי דילוג קונבנציונליים שמעבירים בעיקר תכונות של שלבים תואמים, MFusion Mamba מאגד במפורש תכונות מקודד רב-שלבי באמצעות מיזוג גס לדק ומספק מידע מועשר לפענוח.

4. תוצאות ניסוי נרחבות מראות כי ה-MVM-UNet המוצע משיג ביצועי סגמנטציה תחרותית במאגרי ISIC 2017 ו-ISIC 2018 וביצועים חזקים במאגר הסגמנטציה הרב-איברי של Synapse. יתרה מזאת, מחקרי אבלציה מקיפים מאמתים את תרומתו של כל רכיב בתוך MVM-UNet.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה השתמש רק במאגרי תמונות רפואיות זמינים לציבור ולא מזוהים, כולל ISIC 2017, ISIC 2018 ו-Synapse. לא נאספו משתתפים אנושיים חדשים, נבדקים בעלי חיים או רשומות רפואיות פרטיות מזוהות במחקר זה. מאגר הנתונים של ISIC 2017 ששימש במחקר זה היה מאגר הסגמנטציה של פצעי העור ISIC 2017 Challenge, שהושג ממאגר הנתונים הרשמי של International Skin Imaging Collaboration Challenge (https://challenge.isic-archive.com/data/#2017). גרסת מערך הנתונים ששימשה במחקר זה תואמת למשימת חלוקת הנגעים של ISIC 2017, הכוללת את המחיצות הרשמיות של ההדרכה, האימות והבדיקה. מערך הנתונים הורד ב-15 במרץ 2024. מאגר הנתונים של ISIC 2018 ששימש במחקר זה היה מאגר הסגמנטציה של משימת 1 של ISIC Challenge Task 1, שהתקבל ממאגר הנתונים הרשמי של International Skin Imaging Collaboration (https://challenge.isic-archive.com/data/#2018). גרסת מערך הנתונים ששימשה במחקר זה תואמת למשימה 1 של ISIC 2018: סגמנטציה של גבול הנגעים. מערך הנתונים הורד ב-8 ביולי 2024.

מאגר הנתונים של סינפס ששימש במחקר זה היה Multi-Atlas Labeling Beyond the Cranial Vault הבטני CT, שהושג ממאגר הסינפס תחת מזהה accession syn3193805 (https://www.synapse.org/Synapse:syn3193805). מאגר הנתונים ששימש במחקר זה תואם למאגר הנתונים הנפוץ ל-30 מקרי CT בבטן עם סגמנטציה רב-איברית. הארכיון שהורד היה Abdomen/RawData.zip, שהיה זמין תחת סינת accession syn3193805. לא סופקו מספר גרסה נפרד, תווית שחרור או תג שחרור מתוארך על ידי המאגר בזמן ההורדה. בהתאם לחלוקה התקנית שאומצה במחקרים קודמים, 18 מקרים שימשו להכשרה ו-12 מקרים לבדיקה. חלוקת הנתונים התבצעה לפי רשימת המקרים שבה השתמשה TransUNet23. בפרט, תיקי ההכשרה היו case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028, ו-case0037, בעוד שהמקרים היו case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025, ו-case0035. מערך הנתונים הורד ב-9 ביולי 2024. מכיוון שמחקר זה השתמש רק במאגרי נתונים ציבוריים שלא מזוהים ולא כלל איסוף נתונים חדשים של נבדקים אנושיים או מידע פרטי מזוהה, לא נדרשה אישור ועדת ביקורת מוסדית לניסויים החישוביים המתוארים בפרוטוקול זה. לא התקבלה קביעת פטור מוסדית רשמית בכתב. אם נדרש על פי מדיניות מוסדית מקומית, על החוקרים לקבל קביעת פטור מוסדי לפני ביצוע ניתוחים משניים של מאגרי נתונים זמינים לציבור. לא היה זמין מספר הפניה לפטור אתי מוסדי או מסמכי פטור רשמיים למחקר זה.

1. הכנת מערכי נתונים

  1. הורידו את מאגר הנתונים של סגמנטציה של נגעי עור ISIC לשנת 2017 מהמאגר הרשמי של שיתוף הפעולה הבינלאומי להדמיית עור. השתמש במחלקות הרשמיות של ההדרכה, האימות והבדיקה. ודאו שהמאגר מכיל 2,000 תמונות אימון, 150 תמונות אימות ו-600 תמונות בדיקה.
  2. הורד את מאגר הנתונים של חלוקת נגעי העור ISIC לשנת 2018 מהמאגר הרשמי של שיתוף הפעולה הבינלאומי להדמיית עור. השתמש במחלקות הרשמיות של ההדרכה, האימות והבדיקה. ודאו שמאגר הסגמנטציה מכיל 2,594 תמונות אימון, 100 תמונות אימות ו-1,000 תמונות בדיקה.
  3. הורד את מאגר הנתונים של סגמנטציה רב-אורגנית של Synapse. השתמשו בחלוקה הסטנדרטית הכוללת 18 מקרים (2,212 פרוסות אקסיאליות) לאימון ו-12 מקרים (1,567 פרוסות אקסיאליות) לבדיקה. אל תכניס סט אימות נפרד.
    1. שמרו את 12 מקרי הבדיקה באופן בלעדי להערכה סופית. אין להשתמש במקרי הבדיקה לאימון מודלים, כוונון היפרפרמטרים או בחירת מודל. משימת החלוקה כוללת שמונה איברים בטניים: אאורטה, כיס המרה, טחול, כליה שמאלית, כליה ימין, כבד, לבלב וקיבה.
    2. השתמש בחלוקת מערך הנתונים של סינפס הבא. 18 תיקי ההכשרה היו case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028, ו-case0037. 12 המקרים שנבדקו היו case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025, ו-case0035.
  4. ארגן כל מערך נתונים לתיקיות תמונה ומסכה נפרדות. ודא שלכל תמונה יש מסכת סגמנטציה מתאימה עם אותו מזהה מקרה.
    1. המור כל מסכת נגע עור למפת סגמנטציה בינארית של קדמת הרקע. שמור את תוויות האורגנים הרב-מחלקתיות המקוריות עבור מערך הנתונים Synapse.
    2. עבור מערכי הנתונים של ISIC 2017 ו-ISIC 2018, יש להקצות ערך תווית של 0 לפיקסלים ברקע ו-1 לפיקסלים של נגע (קדמתי) לאחר המרת מסכה בינארית. פיקסלים עם ערכי מסכה מקוריים גבוהים מ-0 מטופלים כקדמת הקדמית ומומרים ל-1, בעוד פיקסלים עם ערכי מסכה מקוריים 0 מטופלים כרקע ונשמרים כ-0. עבור מערך הנתונים של סינפסה, שמרו על ערכי התווית השלמים המקוריים, כאשר 0 מייצג את מחלקת הרקע ו-1–8 מייצג את שמונה מחלקות האיברים הקדמיים.
  5. שנו את גודל התמונות והמסכות של ISIC 2017 ו-ISIC 2018 ל-256 × 256 פיקסלים מבלי לשמור על יחס הגובה-רוחב המקורי. אל תמרחו חיתוך או ריפוד.
    1. שנו את גודל כל פרוסת CT של סינפס ואת מפת התווית המתאימה ל-224 × 224 פיקסלים. השתמש באינטרפולציה ביליניארית לתמונות RGB, באינטרפולציה של ספליין מסדר שלישי לפרוסות CT, ובאינטרפולציה של השכן הקרוב ביותר למסכות סגמנטציה.
    2. שינוי גודל תמונות בפייתון.
      1. עבור מערכי הנתונים ISIC 2017 ו-ISIC 2018, השתמשו בטרנספורמציית myResize מותאמת אישית שמיומשת ב-utils.py, שקוראת ל-torchvision.transforms.functional.resize כדי לשנות את גודל טנזורי התמונה והמסכה ל-256 × 256 פיקסלים. אין לציין מצב אינטרפולציה מפורש או טיעון אנטי-אליאסינג בטרנספורמציה זו.
      2. למערך הנתונים Synapse, השתמש ב-scipy.ndimage.zoom במערכי נתונים/dataset.py. שינוי גודל חיתוך תמונת CT ל-224 × 224 פיקסלים באמצעות אינטרפולציה של ספליין מסדר שלישי (סדר = 3), ומפות תוויות בגודל מחדש באמצעות אינטרפולציה של השכן הקרוב ביותר (סדר = 0). אל תפעיל פעולה נפרדת של אנטי-אליאסינג או הגדרה anti_aliasing=True במהלך שינוי הגודל.
  6. נרמול כל תמונת ISIC RGB לפני המרת טנזור באמצעות ממוצע ספציפי וסטיית תקן (SD) לפי מערך הנתונים באמצעות משוואה 1 כך:
    figure-protocol-1(1)
    לאחר מכן משנה את קנה המידה של התמונה המנורמלת לטווח של 0–255 באמצעות נירמול מינימום–מקסימלי.
    1. השתמש ב-μ = 159.922 ו-σ = 28.871 עבור ערכת ההכשרה של ISIC 2017 ו-μ = 148.429 ו-σ = 25.748 עבור ערכות האימות והבדיקה של ISIC 2017. השתמש ב-μ = 157.561 ו-σ = 26.706 עבור ערכת האימון ISIC 2018 ו-μ = 149.034 ו-σ = 32.022 עבור ערכות האימות והבדיקה של ISIC 2018.
    2. המרו כל תמונה מנורמלת לטנזור בצורת 3 × 256 × 256. המרו כל מסכה בינארית לטנזור בצורת 1 × 256 × 256.
    3. בצע נרמול מינימום–מקסימום באופן עצמאי עבור כל תמונה לאחר נרמול ממוצע וסטיית תקן ספציפית למאגר נתונים. באופן ספציפי, מחסר את הממוצע הספציפי למאגר הנתונים מכל תמונה וחלק בסטיית התקן המתאימה.
    4. חשב את ערכי העוצמה המינימליים והמקסימליים מהתמונה המנורמלת ושנו את גודל התמונה לטווח 0–255 באמצעות ערכי המינימום והמקסימום לכל תמונה אלו. אל תשתמש בערכים מינימליים ומקסימליים של כל מערך הנתונים עבור שלב שינוי המינימום-מקסימלי הזה.
  7. הכן כל פרוסת CT של Synapse כתמונה דו-ממדית בגווני אפור. המור כל פרוסת CT ל-float32 והוסף ממד ערוץ יחיד כדי לקבל טנזור קלט בצורות 1 × 224 × 224.
    1. שמור על כל מפה של תווית Synapse כמסכת מספר שלם חד-ערוצי, בצורות 224 × 224. אין להחיל נרמול ממוצע SD נוסף ברמת מערך הנתונים בטוען הנתונים.
    2. השתמש בקבצי Synapse המעובדים מראש בפורמט .npz עבור slice האימון ובפורמט .npy.h5 לבדיקות נפחים. טען את מערכי התמונה והתוויות ישירות מכל קובץ .npz במהלך האימון וישירות מכל קובץ .npy.h5 במהלך הבדיקה. אין להחיל חיתוך אינטנסיבי נוסף, חלונות CT, נרמול ברמת מערך הנתונים או דגימה מחדש בנפח גולמי בטוען הנתונים ששוחרר.
    3. במהלך אימון המודלים, המרו כל פרוסה דו-ממדית טעונה ל-float32, שנו את גודלה לגודל המרחב היעד באמצעות scipy.ndimage.zoom עם סדר = 3 עבור פרוסות תמונה וסדר = 0 למפות תוויות, ואז המרו את המערכים המוגדלים מחדש לטנזורים עם ממד ערוץ יחיד.
  8. יישם הגדלת נתונים רק על מערך האימונים. עבור ISIC 2017 ו-ISIC 2018, יש ליישם היפוך אופקי אקראי (p = 0.5), היפוך אנכי אקראי (p = 0.5), וסיבוב אקראי (p = 0.5) עם זווית מדגימה מ-0° עד 360°.
    1. החלו את אותה טרנספורמציה גאומטרית על כל זוג תמונה-מסכה. במהלך האימות והבדיקות, יש להחיל רק שינוי גודל, נרמול והמרת טנזור.
    2. לגבי מערך הנתונים של סינפסה, יש להחיל סיבוב אקראי והפיכת אקראית במהלך האימון. סובבו באקראי כל זוג תמונה-תווית ב-k × 90°, כאשר k ∈ {0,1,2,3}, הפכו באקראי את זוג התמונה-תווית לאורך ציר מרחבי אחד, או סובבו באקראי את זוג התמונה-תווית בזווית שנמדגם בין −20° ל-20°.
    3. אין להחיל הגדלה סטוכסטית במהלך הבדיקות.
    4. החלו הגדלת נתונים על מערך הנתונים של Synapse באמצעות הענפים הבלעדיים המיושמים בטרנספורמציית RandomGenerator.
      1. עבור כל מדגם אימון, הערך תחילה את המצב random.random() > 0.5. אם תנאי זה מתקיים, יש להחיל random_rot_flip, הכולל סיבוב אקראי של 90° (k = 0, 1, 2 או 3) ואחריו היפוך אקראי לאורך ציר מרחבי אחד.
      2. אם הענף הראשון לא נבחר, יש להעריך תנאי שני, random.random() > 0.5. אם תנאי זה מתקיים, יש להחיל random_rotate באמצעות זווית סיבוב נבחרת באקראי בין −20° ל-20°. אם אף אחד מהתנאים אינו מתקיימ, אין להחיל הרחבה סטוכסטית על הדגימה.
      3. החלו את אותה טרנספורמציה גם על תמונת הקלט וגם על מפת התווית המתאימה.
  9. הגדר את הזרע האקראי לפני טעינת מערכי נתונים, עיבוד מוקדם ואימון. השתמשו בזרעים אקראיים 1, 52 ו-100 לניסויים המרכזיים בהשוואה והשתמשו בזרעים 100 למחקרי אבלציה אלא אם צוין אחרת.
    1. אתחול את המעבד Python, NumPy, PyTorch, PyTorch CUDA ו-cuDNN לפני בניית ה-data loader. שמרו על מחיצות מערכי הנתונים, נהלי העיבוד המוקדם, הגדרות השדרוג, פרמטרי הנרמליזציה, אסטרטגיית שינוי גודל ועיבוד הערכה ללא שינוי בכל ריצות הזרע.
    2. הגדר num_workers = 0 עבור ניסויי ISIC ו-Synapse לביצוע טעינת נתונים בתהליך הראשי. לפני בניית מערך הנתונים ויצירת ה-DataLoader, אתחל את זרע האקראי הגלובלי באמצעות פונקציית set_seed כדי לזרוע את מחוללי המספרים האקראיים של Python, NumPy, PyTorch, PyTorch CUDA ו-cuDNN. אל תגדיר worker_init_fn נפרד או מחולל אקראי ספציפי ל-DataLoader, שכן אלו אינם בשימוש במימוש שפורסם.

2. בניית ארכיטקטורת MVM-UNet

  1. לבנות את ה-Multi-view Vision Mamba UNet (MVM-UNet) המוצע באמצעות ארכיטקטורת מקודד-מפענח בצורת U.
  2. הגדר את מימד התמונה הקלט ל-H × W × 3. העבר את תמונת הקלט דרך שכבת הטמעת הפאץ'.
    1. מימוש שכבת ההטמעה באמצעות קונבולוציה דו-ממדית עם גודל ליבה של 4 × 4, צעד של 4, שלושה ערוצי קלט ו-96 ערוצי יציאה.
    2. המרת מפת תכונת הקלט לרזולוציה מרחבית של H/4 × W/4 עם C = 96 ערוצי יציאה.
  3. בנה ארבעה שלבי מקודד וארבעה שלבי מפענח. הפחתת הרזולוציה המרחבית בחצי והכפלת ממד הערוץ לאחר כל שלב מקודד.
  4. השתמש בתצורת מקודד-מפענח סימטרית. הגדר את מספר בלוקי ה-MVV גם במקודד וגם במפענח ל-{2, 2, 2, 2}.
    1. הנח שני בלוקי MVV בכל שלב מקודד ושני בלוקי MVV בכל שלב מפענח.
  5. הכנס בלוק MVV לכל שלב מקודד ומפענח. השתמש במודול MV4D כמודול חילוץ תכונות מרכזי בתוך כל בלוק MVV.
  6. הכנס את מודול MFusion Mamba בין המקודד למפענח. השתמש במודול זה כדי למזג תכונות מקודד רב-שלבי לפני הפענוח.
  7. הגדר את זרימת העבודה הכוללת של MVM-UNet. השתמש ב-MV4D לחילוץ תכונות בכל המקודד.
    1. שמור על יציאות המקודד כחיבורים מדלגים. העבר את פלטי המקודד לשלבי המפענח המתאימים.
    2. העבר את תכונות המקודד ל-MFusion Mamba לפני הפענוח. העלו בהדרגה את הייצוג הממוזג דרך המפענח ויצרו את מפת הסגמנטציה הסופית באמצעות ראש הסגמנטציה.
  8. העבר את תמונת הקלט I ∈ RB×H×W×3 דרך שכבת ההטמעה כדי לקבל figure-protocol-2 את Here, C = 96.
    1. יצירת מפות תכונות מקודד: E1 ∈ RB×H/4×W/4×C, E2 ∈ RB×H/8×W/8×2 C, E3 ∈ RB×H/16×W/16×4C, ו-E4 ∈ RB×H/32×W/32×8C. השתמש בלוקי MVV המכילים MV4D בכל שלב מקודד.
    2. שמור כל תכונת מקודד עבור חיבור הדילוג המתאימה. העבר את כל תכונות המקודד ל-MFusion Mamba למיזוג תכונות רב-שלביות.
    3. יישר תכונות מקודד למרחב תכונות משותף לפני מיזוג גס ועדין בתוך MFusion Mamba. העבר את הייצוג הממוזג למפענח.
    4. העלו בהדרגה את ייצוג המפענח. ממזג את תכונות המפענח עם E3 ב-H/16 × W/16, E2 ב-H/8 × W/8, ו-E1 ב-H/4 × W/4.
    5. הגדל את תכונת המפענח הסופית לרזולוציה המקורית של התמונה. יצר את מפת figure-protocol-3 החיזוי ∈ RB×H×W×K. כאן, K = 1 עבור סגמנטציה בינארית של נגעים ו-K = 8 עבור סגמנטציה מרובת איברים בסינפסה.
    6. עיין באיור 2 לארכיטקטורת הרשת הכוללת ובטבלה משלימה 1 למפרט הארכיטקטורה המלאה שכבה-שכבה, כולל פעולות, פרמטרים עיקריים וממדי תכונות פלט לכל שלב
    7. שכבות מעבר מקודד–מפענח
      1. תכונות מקודד מדגם נמוך באמצעות שכבות מעבר של מיזוג פאצ'ים. לכל מעבר, יש לדגום ארבע קבוצות תכונות משולבות במרחב משכונה של 2 × 2, לאחד אותן לאורך ממד הערוץ, ליישם נורמליזציה שכבתית (LayerNorm), ולהקרין את התכונה 4C-ממדית המתקבלת לערוצי 2C באמצעות שכבה ליניארית ללא הטיה. פעולה זו מפחיתה את הרזולוציה המרחבית פי 2 תוך הכפלת ממד הערוץ.
      2. תכונות מפענח דגימות באמצעות שכבות מעבר שמרחיבות פאץ'. מיישמים היטל ליניארי ללא הטיה, מסדר מחדש את התכונות המורחבות במרחב כדי להגדיל את הרזולוציה פי 2, ומיישם את LayerNorm לאחר ההרחבה המרחבית. חזרו על פעולה זו כדי לשחזר בהדרגה את מפות התכונות מ-H/32 ×W/32 ל-H/16 × W/16, H/8 × W/8, ו-H/4 × W/4.
      3. יישר תכונות מקודד בתוך מודול MFusion Mamba על ידי שינוי גודלן לרזולוציה המרחבית היעד באמצעות אינטרפולציה ביליניארית (align_corners = False) ואז יישום הקרנת ערוץ ליניארית ללמידה לפני מיזוג תכונות.
    8. ראש סגמנטציה
      1. העלו את מיפוי תכונות המפענח הסופי מ-H/4 × W/4 לרזולוציה המקורית של התמונה (H × W) באמצעות שכבת הרחבת הפאץ' הסופית. החלו היטל ליניארי, מבצעים סידור מחדש מרחבי עם גורם התרחבות של 4, והחלו את LayerNorm.
      2. הקרנה את מפת הפיצ'ר המשוחזרת ל-K ערוצי פלט באמצעות קונבולוציה של 1 × 1 לאחר המרת הטנזור לפורמט ערוץ ראשון.
      3. יצירת התחזית הסופית במהלך ההערכה על ידי יישום פונקציית הפעלה סיגמואידי לסגמנטציה בינארית של נגעים או הפעלה סופטמקס ואחריה ארגמקס לסגמנטציה מרובת איברים של סינפסה. אל תפעיל פונקציית הפעלה בתוך ראש הסגמנטציה עצמו.

figure-protocol-4
איור 2. הארכיטקטורה הכוללת של Mamba U-Net רב-תצוגה (MVM-UNet). סקירה של ארכיטקטורת ה-Mamba U-Net (MVM-UNet) המוצעת ב-Multi-View. תמונת הקלט מומרת להטמעות פאץ' ומעובדת דרך ארבעה שלבי מקודד המורכבים מבלוקי Multi-View Vision (MVV) המופרדים על ידי פעולות מיזוג פאצ'ים. תכונות המקודד מאוגדות על ידי ממבה מיזוג רב-שלבית (MFusion Mamba) ומועברות למפענח דרך חיבורי דילוג. המפענח משחזר בהדרגה את הרזולוציה המרחבית באמצעות פעולות הרחבת פאץ' ומייצר את מפת הסגמנטציה הסופית דרך שכבת ההקרנה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

3. בניית מודול MV4D

  1. השתמש במודול MV4D כיחידת חילוץ תכונות בסיסית ב-MVV Block. הזן את פאצ'י תכונות הקלט לארבעה ענפי זוג סריקה. עיין באלגוריתם 1, קובץ משלים 1 לקוד הפסאודו-קוד המלא של שטח מרחבי, בניית אינדקס זוגות סריקה, איסוף רצפים, עיבוד S6/Mamba, סידור מרחבי הפוך, מיזוג זוגות סריקה, מיזוג ממבה SFusion, הקרנה ועיצוב פלט מחדש.
  2. השתמש בפרוצדורות יצירת אינדקס סריקה זיגזג, היררכי, ספירלי ורדיאלי שמיושמות במודלים/mvmunet/core.py. לכל אסטרטגיית סריקה, השתמשו בסדר הסריקה קדימה ובסדר ההפוך שלו כזוג סריקה דו-כיווני אחד.
  3. בנה את זוג הסריקה הזיגזגית. עברו על תכונות התמונה בכיוונים מתחלפים בסוף כל שורה או עמודה. השתמש בדפוס הסריקה הזה כדי לאזן בין מידע מרחבי מקומי וגלובלי.
  4. בנו את זוג הסריקה ההיררכי. לכידת תכונות בקני מידה מרחביים שונים. השתמשו בדפוס סריקה זה כדי לחזק את ההפקה של ייצוגים מקומיים וגלובליים.
  5. בנה את זוג הסריקה הספירלית. סרקו את תכונות התמונה מהמרכז לכיוון הגבול או מהגבול למרכז. השתמש בדפוס סריקה זה כדי לשפר את הפקת מידע קווי המתאר הגלובליים.
  6. בנה את זוג הסריקה הרדיאלית. סרוק תכונות תמונה לאורך כיוונים רדיאליים מרובים. השתמשו בדפוס סריקה זה כדי לשפר את חילוץ פרטי הגבול והקצוות המקומיים.
  7. ממזגים כל זוג סריקה לפני שמזינים את הרצף הממוזג לבלוק S6. השתמש בעיצוב הזוגי לשיפור עמידות כל אסטרטגיית סריקה תוך שמירה על יעילות חישובית.
  8. הזן את רצף הפלט של כל ענף זוג סריקה לבלוק S6. קבל ארבעה ייצוגי תכונות התואמים לתצוגות הסריקה הזיגזגית, ההיררכית, הספירלית והרדיאלית.
  9. מיזוג ארבעת הייצוגים של התכונות שהופקו באמצעות מודול SFusion Mamba. השתמש בשני מסלולי מיזוג מקבילים. בנתיב הראשון, יש לשלב את ארבעת התכונות על ידי חיבור לפי אלמנט.
  10. במסלול השני של SFusion Mamba, מחברים את ארבעת התכונות. עבד את הייצוג המקושר באמצעות Conv1d ו-Mamba. הקטן את ממד הערוץ באמצעות שכבת הקרנה כדי להתאים לממד פלט בלוק S6.
  11. הגדר את בלוק S6/Mamba תוך שימוש במימד התכונה C כממד המודל. השתמש בשכבת הקרנה כדי למפות כל תכונת זוג סריקה מאוחד חזרה לממד הערוץ C לפני המיזוג.
  12. ב-SFusion Mamba, בצע חיבור לפי אלמנט במסלול הראשון. לאחד את ארבעת תכונות תצוגת הסריקה במסלול השני לפני Conv1d, Mamba והקרנה ליניארית. השתמש בפעולות הנירמליזציה, ההיטל הליניארי, קונבולוציה מופרדת לפי עומק ופעולות הפעלה סביב MV4D כפי שמתואר בשלב 4.
  13. הוסף את הפלטים של שני מסלולי ההיתוך כדי קבלת הפלט הסופי של מודול MV4D.
  14. בנה ארבעה ענפי זוג סריקה משלימים במקום להשתמש רק בכיווני סריקה אופקיים ואנכיים. השתמש בסריקת זיגזג להדגשת מעבר מרחבי רציף, בסריקה היררכית לחיזוק ייצוג רב-קנה מידה, בסריקה ספירלית ללכידת מידע על קווי מתאר ממרכז לגבול, וסריקה רדיאלית לשיפור חילוץ פרטים מקומיים ממוקד גבולות.
  15. עבד כל ענף זוג סריקה באופן עצמאי. ממזג את הפיצ'רים המתקבלים באמצעות SFusion Mamba. מפה כל רצף מעובד חזרה לסדר המרחבי המקורי שלו לפני המיזוג.
  16. בהינתן מפת תכונת קלט X ∈ RB×H×W×C, שטחו אותה ל-Xseq ∈ RB×L×C, כאשר L = H × W.
  17. סדר מחדש את הרצף השטוח לפי אינדקסי הסריקה עבור כל ענף זוג סריקה. עבדו כל רצף מסודר מחדש באמצעות בלוק S6. השחזר את הרצף המעובד לסדר המרחבי המקורי.
  18. למזג את ארבעת תכונות תצוגת הסריקה דרך מסלול החיבור ומסלול SFusion Mamba כדי לקבל את הפלט הסופי של MV4D. עיין באיור 3 לארכיטקטורת MV4D ולאלגוריתם 1, קובץ משלים 1 לתהליך היישום המלא ברמת טנזור.
  19. השתמש ביישום התוכנה המלא במודלים/mvmunet/core.py. קובץ זה מכיל את מחוללי הסריקה, PairwiseScanMamba, SequenceS6, SFusion Mamba ומודול העטיפה MV4D.
  20. יצירת מדדי סריקה מרובי תצוגות
    1. יצר את אינדקסי הסריקה על ידי מעקב אחרי המימוש שפורסם ב-model/mvmunet/core.py. למפת תכונות קלט בגודל מרחבי H × W, שטח כל מיקום פיקסל לאינדקס חד-ממדי באמצעות: index = r × W + c, כאשר are ו-c מסמנים את קואורדינטות השורה והעמודה, בהתאמה.
    2. יצירת סריקת זיגזג על ידי חציית אלכסוני תמונה עם קבוע r + c. אספו את אינדקסי הפיקסלים התקפים לכל אלכסון והחליפו את כיוון המעבר על ידי הפיכת הסדר של כל אלכסון זוגי.
    3. יצר את הסריקה ההיררכית על ידי חלוקה רקורסיבית של התמונה לארבעה רבעים. בקרו ברבעים העליונים-שמאליים, העליונים-ימין, התחתונים-שמאל והתחתון-ימין ברצף עד שהגובה או הרוחב של תת-האזור לא יעלו על 2 פיקסלים, ואז עברו על שאר הפיקסלים בסדר שורה ראשית.
    4. יצר את הסריקה הספירלית על ידי חציית הגבול החיצוני של התמונה משמאל לימין לאורך השורה העליונה, מטה לאורך העמודה הימנית, ימין לשמאל לאורך השורה התחתונה, ומעלה לאורך העמודה השמאלית תוך הקטנת הגבול בהדרגה לכיוון מרכז התמונה.
    5. יצר את הסריקה הרדיאלית על ידי מיון כל פיקסל לפי המרחק הריבועי שלו ממרכז התמונה ואז לפי הזווית הפולרית שלו שמחושבת באמצעות פונקציית atan2.
    6. יצר סריקה הפוכה לכל אסטרטגיית סריקה על ידי הפיכת סדר הסריקה הקדמי המתאים. משלבים את רצפי הסריקה הקדמית והאחורה ליצירת זוג סריקה אחד לכל אסטרטגיית סריקה לפני העברת זוגות הסריקה למודול MV4D.

figure-protocol-5
איור 3. ארכיטקטורת המודול הרב-תצוגה 4-כיוונית (MV4D). מבנה מודול חילוץ תכונות רב-תצוגה 4-כיוונית (MV4D). טלאי קלט מעובדים דרך ארבעה ענפי זוג סריקה משלימים הכוללים זיגזג, היררכי, ספירלי וסריקה רדיאלית. תכונות שמופקות מארבעת הענפים מאוחדות, מעובדות באמצעות בלוקי מרחב מצבים, ומשולבות על ידי Spatial Fusion Mamba (SFusion Mamba) ליצירת ייצוג תכונות הפלט. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

4. בניית בלוק MVV

  1. בנה את בלוק MVV באמצעות ענף ראשי אחד ושני סניפים עזריים. השתמשו במבנה הכולל המוצג באיור 4.
  2. החלו נרמול שכבה על תכונת הקלט בסניף הראשי. הזן את התכונה המנורמלת לשכבה ליניארית. העבר את התכונה המומרת לקונבולוציה הניתנת להפרדה בעומק.
  3. עבד את המאפיין הטרנספורמטיבי באמצעות קונבולוציה מופרדת בעומק. הפעל את פונקציית ההפעלה של GLU. הזן את הפיצ'ר המופעל למודול MV4D.
  4. בנה את הענף המסייע הראשון כקשר שאריתי זהות. חבר את תכונת הקלט ישירות לפלט הסופי. השתמשו בענף זה כדי לשמר את הייצוג המקורי ולייצב את ההכשרה.
  5. בנה את הענף השני כענף הקרנה למטה למעלה. דחסו את תכונת הקלט באמצעות שכבת הקרנה מטה. שחזר את ממד התכונה באמצעות שכבת הקרנה כלפי מעלה.
  6. למזג את התפוקות של הסניף הראשי ושני הענפים המשניים. קבל את פלט הבלוק הסופי של MVV. עיין באיור 4 לארכיטקטורה המלאה.
  7. הגדר את הממד הנסתר של הענף הראשי שווה לממד ערוץ הקלט Cs. החלו את LayerNorm(Cs) לפני ההיטל הליניארי הראשי והשתמשו בשכבה ליניארית עם ממדים Cs→Cs. השתמשו בקונבולוציה מופרדת בעומק הכוללת קונבולוציה 3×3 עומק עם ריפוד 1, קבוצות = Cs, וללא הטיה, ואחריה קונבולוציה נקודתית של 1×1 ללא הטיה.
  8. הפעילו את פונקציית ההפעלה של GELU לאחר הקונבולוציה הניתנת להפרדה בעומק. הזנת התכונה המופעלת ל-MV4D והחלה הקרנה ליניארית בממדים CsCs. הגדר את ענף ההקרנה למטה למעלה באמצעות LayerNorm(Cs), יחס הקרנה של 4, הקרנה למטה CsC s/4, הפעלת GLU, והקרנה מעלה Cs/4→Cs.
  9. משלבים את ענף הזהות, ענף ההקרנה למטה-למעלה, והענף הראשי המעובד בנתיב השחרור באמצעות חיבור אלמנט לצורך הפלט הסופי של בלוק MVV.

figure-protocol-6
איור 4. ארכיטקטורה של בלוק Multi-View Vision (MVV). מבנה בלוק החזון הרב-תצוגה (MVV). הבלוק מורכב מענף חילוץ תכונות עיקרי הכולל את מודול Multi-View 4-Directional (MV4D) יחד עם שכבות קונבולוציה עומקית, נרמול והקרנה ליניארית. ענף הקרנה עזרי למעלה למטה מספק מודולציה של תכונות עם שער באמצעות כפל לפי אלמנט לפני חיבור שאריתי ליצירת ייצוג תכונת הפלט. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

5. בניית MFusion Mamba

  1. אסוף את מפות התכונות מכל שלבי המקודדים. יישר את תכונות המקודד למרחב ייצוג מאוחד על ידי שינוי גודל או הקרנה בעת הצורך. עיין באלגוריתם 2, קובץ משלים 1 עבור תהליך היישום המלא ברמת טנזור.
  2. שינוי גודל תכונות המקודד לרזולוציה המרחבית היעד בעת הצורך. תכונות פרויקט עם ממדים שונים של ערוץ לאותו ממד ערוץ. יישר את כל תכונות המקודד לפני מיזוג רב-שלבי.
  3. הזן את תכונות המקודד המיושר לרכיב Coarse Fusion. בצע היתוך גס באמצעות מוצר Hadamard. יצר את הייצוג המאוחד הגס.
  4. הזן את הייצוג המאוחד הגס לרכיב ההיתוך העדין. בנה שני מסלולי היתוך עדין מקבילים. עבד את שני המסלולים באופן עצמאי.
  5. עבדו את מסלול ההיתוך הדק הראשון באמצעות שכבה ליניארית. עבדו את מסלול ההיתוך הדק השני באמצעות הקרנה למעלה, Conv1d, ממבה והקרנה למטה. השחזר את ממד התכונה לאחר ההקרנה כלפי מטה.
  6. למזג את הפלטים של שני מסלולי ההיתוך העדין באמצעות מוצר האדמארד. מרח את השכבה הליניארית הסופית. קבל את פלט MFusion Mamba.
  7. הזן את פלט MFusion Mamba למפענח. פענח את הייצוג הרב-שלבי הממוזג יחד עם תכונות הדילוג של מקודד-מפענח. יצר את מפת הסגמנטציה הסופית.
  8. יישר תכונות מקודד משלבים שונים למרחב תכונות מאוחד לפני מיזוג גס. עבד את ייצוגי התכונות המיושרים באמצעות שלבי המיזוג הגס והעדין. עיין באיור 5 עבור ארכיטקטורת MFusion Mamba ואלגוריתם משלים 2 עבור זרימת העבודה המלאה ברמת טנזור.
  9. השתמש בפרמטרי היישום של MFusion Mamba כדלקמן. לכל תכונת מקודד Ei, הקרינו את ממד הערוץ מ-Ci ל-Ct. שינוי גודל תכונות מוקרנות לגודל המרחב היעד באמצעות אינטרפולציה ביליניארית עם align_corners=False בעת הצורך.
  10. החלו את מכפלת Hadamard לביצוע Coarse Fusion על פני תכונות המקודד המיושרים. הגדר את מסלול ההיתוך העדין הראשון באמצעות שכבה ליניארית עם ממדים Ct Ct. הגדר את מסלול ההיתוך הדק השני באמצעות הקרנה מעלה Ct → 2Ct, Conv1d, בלוק Mamba/S6 עם ממד מודל 2Ct, כיוון סריקה אחד, מימד מצב 16, והקרנה כלפי מטה2Ct Ct.
  11. למזג את יציאות מסלולי ההיתוך העדין באמצעות מוצר Hadamard. מיישמים הקרנה ליניארית סופית בממדים Ct ל-Ct. הזן את הייצוג הרב-שלבי הממוזג אל המפענח.
  12. פיוז תכונות מקודד רב-שלבי באמצעות MFusion Mamba
    1. אסוף את תכונות המקודד מכל ארבעת שלבי המקודד (E1,E 2, E3 ו-E4) והשתמש בהן כקלט למודול MFusion Mamba. אל תבחר רק את תכונת המקודד בשלב המתאים למיזוג המפענח.
    2. יישר את כל תכונות המקודד לרזולוציה המרחבית הנדרשת לשלב המפענח הנוכחי. שינוי גודל תכונות המקודד לרזולוציה היעד והקרינה לממד הערוץ הנדרש לפני מיזוג התכונות.
    3. חזור על הליך יישור התכונות עבור כל שלב מפענח. כאשר המפענח פועל ב-H/16 × W/16, H/8 × W/8, ו-H/4 × W/4, משנים את הגודל והקרינה E1,E 2,E 3 ו-E4 למרחב המאפיינים המתאים.
    4. למזג את תכונות המקודד הרב-שלבי המיושרים באמצעות פעולות Coarse Fusion ו-Fine Fusion של מודול MFusion Mamba, ולשלב את הייצוג הממוזג עם תכונות המפענח בקנה מידה מתאים.
    5. בצע את הקרנת הפיצ'רים, שינוי גודל ופעולות מיזוג בהתאם למימוש שפורסם ב-models/mvmunet/core.py.

figure-protocol-7
איור 5. ארכיטקטורת מודול ה-Multi-stage Fusion Mamba (MFusion Mamba). מבנה מודול ה-Multi-שלבי Fusion Mamba (MFusion Mamba). תכונות מקודד רב-קנה מידה משולבות תחילה באמצעות מיזוג גס ובהמשך מעודנות באמצעות מודול Fine Fusion הכולל הקרנה ליניארית, קונבולוציה חד-ממדית (Conv1d), בלוק ממבה ושכבות הקרנת תכונות לפני יצירת ייצוג התכונות הממוזגות של המפענח. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

6. אימון מודלים

  1. למד MVM-UNet על אובונטו 22.04.1 עם גרסת ליבת לינוקס 6.8.0. השתמש בתחנת עבודה המצוידת במעבד Intel Core i9-13900K דור 13 ובכרטיס גרפי NVIDIA A800. השתמש באותה תצורת חומרה לאורך כל האימון וההערכה.
  2. מימוש ואמן את המודל באמצעות PyTorch 2.0.1 עם CUDA 11.8. התקן את כל התלות הנדרשת בתוכנה לפני ההדרכה.
  3. השתמש באופטימייזר AdamW עם קצב למידה התחלתי של 3 × 10−5, β1 = 0.9, β2 = 0.999, ε = 1 × 10−8, ודעיכת משקל של 0.01. הגדר את גודל האצווה ל-32 אלא אם צוין אחרת.
  4. תאמן כל דגם ל-300 תקופות. השתמש בלוח זמנים לקצב למידה עם חימוש קוסינוס עםη דקות = 1 × 10−5. הגדר את גודל התמונה ל-256 × 256 עבור ISIC 2017 ו-ISIC 2018 ול-224 × 224 עבור Synapse.
  5. השתמשו בשלושה זרעים אקראיים עצמאיים (1, 52 ו-100) לניסויים המרכזיים בהשוואה המרכזית. חזור על תהליך האימון וההערכה המלא לכל זרע. דווח על התוצאות הכמותיות הסופיות כממוצע ± ה-SD בשלוש הריצונות.
  6. השתמש בזרע אקראי קבוע של 100 לכל מחקרי אבלציה אלא אם צוין אחרת. שמרו על חלוקות מערך הנתונים, אסטרטגיית העיבוד המוקדם, ארכיטקטורת הרשת, האופטימיזטור, קצב הלמידה, גודל האצווה ומספר תקופות האימון ללא שינוי בכל ניסויי האבלציה.
  7. השתמש באובדן BCE-Dice לסגמנטציה בינארית של נגעים ב-ISIC 2017 ו-ISIC 2018. הגדר את משקל הירידה של BCE ו-Dice ל-1.0. השתמשו באובדן CE-Dice ל-Synapse והגדרו גם את משקלי הירידה באנטרופיה צולבת וגם בקוביות ל-1.0.
  8. שינוי גודל, נרמול והרחבה של תמונות האימון של ISIC 2017 ו-ISIC 2018 באמצעות הליך העיבוד המוקדם המתואר בשלב 1. הפעיל שינוי גודל, סיבוב אקראי והפיכת אקראית על תמונות אימון Synapse כפי שמתואר בשלב 1. השתמש בהגדרות קדם-עיבוד זהות בכל ריצות האימון.
  9. בחרו נקודות ביקורת של המודל בהתאם לפרוטוקול האימות הספציפי למאגר נתונים. שמור את נקודת הביקורת עם ביצועי האימות הטובים ביותר ל-ISIC 2017 ו-ISIC 2018, ובצע אימות כל 30 אפוקים. לאמן את Synapse במשך 300 אפוקים ללא סט אימות ולהשתמש בנקודת הבדיקה הסופית של האימון לבדיקה.
  10. השתמש בסט האימות הרשמי רק לבחירת דגם ב-ISIC 2017 ו-ISIC 2018. אל תשתמש בערכת הבדיקה של Synapse לאימון, כיוון היפרפרמטרים או בחירת נקודות ביקורת. שמור את כל נתוני הבדיקה אך ורק להערכה סופית.
  11. השתמש בפרמטרי האימון הבאים לשחזוריות. הגדר את גודל האצווה ל-32 עבור כל מערכי הנתונים. השתמש ב-AdamW עם קצב למידה התחלתי של 3 × 10−5, β1 = 0.9, β2 = 0.999, ε = 1 × 10−8, ודעיכת משקל של 1 × 10−2.
  12. הגדר את מתזמן קצב הלמידה עם אנילינג קוסינוס עם T max = 50 ו-ηmin = 1×10−5 עבור ISIC 2017 ו-ISIC 2018. הגדר את המתזמן עם Tmax = 100 ו-ηmin = 1×10−5 עבור Synapse. שמור על תצורת המתזמן ללא שינוי בכל הניסויים החוזרים על עצמם.
  13. לאמן את כל הדגמים באמצעות אריתמטיקה FP32 מדויקת במלואה. כבה אימון דיוק מעורב אוטומטי. אל תפעיל חיתוך גרדיאנט במהלך האופטימיזציה.
  14. שמרו על הגדרות הדיוק, אסטרטגיית עדכון הגרדיאנט, קונפיגורציית האופטימיזציה, לוח הזמנים לקצב הלמידה ופרוטוקול הזרעה האקראית ללא שינוי בכל ניסויי ההשוואה, מחקרי אבלציה וריצות השחזור.
  15. בחר את נקודת הביקורת הטובה ביותר לדגם
    1. העריכו את המודל על מערך האימות לאחר כל תקופת אימון עבור מערכי הנתונים ISIC 2017 ו-ISIC 2018.
    2. חשב את אובדן ה-Binary Cross-Entropy (BCE)-Dice עבור כל אצווה של אימות וחשב את ממוצע אובדן האימות על פני כל מערך הוולידציה.
    3. שמור את המודל הנוכחי כנקודת ביקורת הטובה ביותר כאשר אובדן האימות הממוצע נמוך מההפסד המינימלי שנרשם קודם.
    4. רשמו את החיתוך הממוצע מעל איחוד (mIoU), מקדם דמיון קוביות (DSC), דיוק (Acc), ספציפיות (Spe) ורגישות (Sen) במהלך האימות לצורך ניטור ביצועים בלבד. אל תשתמש במדדים אלה כקריטריון לבחירת נקודות ביקורת.

7. הערכת מודלים

  1. הערך את המודל המאומן באמצעות מערך הבדיקות הרשמי לכל מאגר נתונים. השתמש בסט המבחנים רק להערכת ביצועים סופית.
  2. עבור ISIC 2017 ו-ISIC 2018, חשב את mIoU, DSC, Acc, Sen ו-Spe. השתמשו בחיוביים אמיתיים ברמת פיקסל (TP), חיוביים שגויות (FP), שליליות אמיתיות (TN) ושליליות שגויה (FN) לכל החישובים.
  3. החלו פונקציית הפעלה סיגמואידי על פלט המודל עבור ISIC 2017 ו-ISIC 2018. המור את מפת ההסתברות למסכת סגמנטציה בינארית באמצעות סף של 0.5. חשב את מדדי ההערכה באמצעות משוואות 2–6:
    figure-protocol-8 (2)
    figure-protocol-9 (3)
    figure-protocol-10 (4)
    figure-protocol-11 (5)
    figure-protocol-12 (6)
  4. עבור Synapse, יישם את פונקציית ההפעלה של softmax על פלט המודל. הקצה כל פיקסל או ווקסל למחלקה עם ההסתברות הגבוהה ביותר באמצעות פעולת argmax. חשב את ה-DSC ואת מרחק האוסדורף באחוזון ה-95 (HD95) עבור כל איבר קדמי ודווח על הערכים הממוצעים בכל מקרי הבדיקה.
  5. השווה MVM-UNet עם שיטות סגמנטציה מבוססות CNN, מבוססות טרנספורמר, ומודל מצב (SSM). השתמש במחיצות זהות למערכי נתונים, פרוצדורות עיבוד מקדים, רזולוציות קלט ומדדי הערכה לכל המתודות.
  6. השתמש במחיצות ההדרכה, האימות והבדיקות הרשמיות ל-ISIC 2017 ו-ISIC 2018. השתמש בחלוקה הסטנדרטית של 18 מקרי אימון ו-12 מקרי בדיקה עבור Synapse. הגדר את רזולוציית הקלט ל- עבור מערכי הנתונים של ISIC ול-Synapse.
  7. שכפל שיטות בסיסיות באמצעות היישומים הרשמיים שלהן כאשר זמינים. דיווח שיחזר תוצאות כממוצע ± ה-SD לאורך ריצות חזרות. שמור על ערכים מדווחים בספרות כפי שפורסם במקור והבחין ביניהם בהערות הטבלה המתאימות.
  8. בצע בדיקות אבלציה באמצעות זרע אקראי קבוע של 100 אלא אם צוין אחרת. שמרו על חלוקות מערכי הנתונים, הליך העיבוד המוקדם, רזולוציית קלט, אופטימייזר, לוח זמנים לקצב למידה, גודל האצווה, מספר התקנים, פונקציית האובדן ומדדי ההערכה ללא שינוי בכל ניסויי האבלציה.
  9. העריך את התרומות של MV4D, SFusion Mamba, ענף ההקרנה למעלה ולמטה בבלוק MVV, MFusion Mamba, גודל התמונה הקלט, ערך dropout, ותצורת שכבת המקודד-מפענח. שנו רק את הרכיב או הפרמטר היעד בכל ניסוי אבלציה.
  10. בצע את מבחן הדירוג החתום של וילקוקסון באמצעות תוצאות זוגיות לכל תמונה עבור ISIC 2017 ו-ISIC 2018 ותוצאות זוגיות לכל מקרה עבור Synapse. נבחן ערך p קטן מ-0.05 כדי להצביע על מובהקות סטטיסטית.
  11. העריך יעילות חישובית באמצעות אותה סביבת חומרה ורזולוציית קלט לכל השיטות. מדדו את זמן האימון לכל תקופה, זמן הסקה לכל תמונה, שיא השימוש בזיכרון GPU במהלך האימון, מספר פרמטרי המודל, ופעולות נקודה צפה (FLOPs). חשב FLOPs באמצעות מסירה קדימה אחת.
  12. בחרו דוגמאות איכותיות מייצגות רק מתוך קבוצת הבדיקות לאחר סיום הערכת המודל. השווה את התמונה המקורית, מסכת האמת הקרקעית והמסכה החזויה באמצעות מקרי בדיקה זהים בכל השיטות. בחר דוגמאות מייצגות הכוללות מטרות קטנות, גבולות לא סדירים, גבולות מעורפלים ומבנים מולטיאורגניים מייצגים.
  13. חשב מדדי הערכה וביצוע ניתוח סטטיסטי
    1. חשב את מדדי הסגמנטציה של מערכי הנתונים ISIC 2017 ו-ISIC 2018 בפייתון באמצעות NumPy ו-sklearn.metrics.confusion_matrix. הסף למפת ההסתברות החזויה ב-0.5, קבל את TP, FP, TN ו-FN ברמת הפיקסל, וחשב את mIoU, DSC, Acc, Sen ו-Spe מתוך ערכים אלו.
    2. חשב את ה-DSC וה-HD95 עבור מאגר הנתונים Synapse באמצעות medpy.metric.binary.dc ו-medpy.metric.binary.hd95, בהתאמה. מיישמים softmax ואחריהם argmax על פלט המודל לפני חישוב מדדי ההערכה.
    3. חשב את מספר ה-FLOPs והפרמטרים הניתנים לאימון באמצעות thop.profile במעבר קדימה אחד.
    4. בצע את מבחן הדירוג החתום של Wilcoxon בפייתון באמצעות scipy.stats.wilcoxon. השתמש בערכי מדדים מזווגים לכל תמונה עבור מערכי הנתונים ISIC 2017 ו-ISIC 2018 וערכי מדדים זוגיים לכל מקרה עבור מערך הנתונים Synapse.

8. הגדרת פונקציית אובדן

  1. השתמש באובדן הסטנדרטי Cross-Entropy (CE) לסגמנטציה רב-מחלקתית ובהפסד BCE סטנדרטי לסגמנטציה בינארית. השתמש בנוסחת הפסד קוביות סטנדרטית לסגמנטציה. משוואות 7–11 מגדירות את פונקציות האובדן המשמשות בפרוטוקול זה.
    figure-protocol-13(7)
    figure-protocol-14(8)
    figure-protocol-15(9)
    figure-protocol-16(10)
    figure-protocol-17(11)
  2. הגדר את משקלי הירידה BCE ו-Dice ל-1.0 עבור ISIC 2017 ו-ISIC 2018, כך figure-protocol-18ש-1 = 1.0 ו-2 figure-protocol-19 = 1.0. הגדר את משקלי הירידה של CE ו-Dice ל-1.0 עבור Synapse, כך φ1 = 1.0 ש ו-φ2 = 1.0.
  3. מיישם את פונקציות האובדן ב-utils.py. השתמש ב-nn. BCELoss לסמסטר BCE ו-nn. CrossEntropyLoss למונח CE. חשב את אובדן הקוביות הבינארי על ידי השטחת כל מסכה חזויה ומסכת אמת יסודית, חישוב אובדן הקוביות לכל מדגם, וממוצע האובדן לאורך האצווה. חשב את אובדן הקוביות הרב-מחלקות על ידי המרת מפת התווית היעד לפורמט one-hot, יישום softmax על פלט המודל, חישוב אובדן הקוביות לכל מחלקה, וממוצע האובדן בין כל המחלקות.
  4. הגדר את קבוע החלקה ל-1 עבור אובדן קוביות בינארי ו-1×10−5 עבור הפסד קוביות מרובי-מחלקות. מימוש הפסד BCE-Dice באמצעות מחלקת BceDiceLoss כאשר wb = 1 ו-wd = 1. מיישם את אובדן ה-CE-Dice באמצעות מחלקת CeDiceLoss עם loss_weight = [1, 1]. שמור על קבועי החלקה, אסטרטגיית הפחתת המשחק ויישום התוכנה ללא שינוי עבור כל מערכי הנתונים, הזרעים האקראיים והניסויים.
  5. הגדרת הפחתת ההפסדים
    1. למומש, נני. BCELoss() ו-nn. CrossEntropyLoss() מבלי לציין במפורש את טיעון ההפחתתה.
    2. השתמש בהגדרת ברירת המחדל של הפחתת הפסד PyTorch (reduction = "ממוצע") עבור שתי פונקציות האובדן. אל תשתמש בצמצום = "סכום" או בפלט אובדן לא מצומצם.

9. הגדרות שחזוריות וביצוע

  1. הורד את המימוש שפורסם מ-https://github.com/LIXUEGUANG002/MVM-UNet. השתמש במאגר יחד עם חבילות התוכנה, מערכי הנתונים, מפרטי החומרה והמשאבים החישוביים המפורטים בטבלת החומרים.
  2. שכפל את המאגר ונכנס לתיקיית הפרויקט על ידי הרצת git clone https://github.com/LIXUEGUANG002/MVM-UNet.git, ואחריו CD MVM-Unet.
  3. הגדר את ניסוי ISIC 2017 או ISIC 2018 על ידי הגדרת שם מערך הנתונים, נתיב מאגר נתונים, גודל קלט, גודל אצווה, מספר אפוקים, פונקציית אובדן, אופטימיזטור, מתזמן קצב למידה וזרע אקראי בקונפיגורציות/config_setting.py. הרץ את סקריפט האימון מהשורש של המאגר באמצעות פייתון train.py.
  4. הגדר את ניסוי Synapse על ידי הגדרת שם מערך הנתונים, נתיב נתוני האימון, נתיב נפח הבדיקה, תיקיית הרשימה, גודל הקלט, מספר מחלקות, גודל אצווה, מספר אפוקים, פונקציית אובדן, אופטימיזטור, מתזמן קצב למידה וזרע אקראי ב-configs/config_setting_synapse.py. הרץ את סקריפט האימון מהשורש של המאגר באמצעות פייתון train_synapse.py.
  5. בצע הערכה מבוססת הסקה בלבד על ידי הגדרת only_test_and_save_figs = True, best_ckpt_path לנקודת הביקורת המאומנת, ו-img_save_path לתיקיית הפלט בקובץ התצורה המתאים. הרץ train.py פייתון עבור ISIC 2017 או ISIC 2018, או הרץ train_synapse.py פייתון עבור Synapse ליצירת תוצאות חיזוי ומספרים איכותיים.
  6. השתמש בגרסת קוד המקור שפורסמה
    1. שכפול את מאגר GitHub שיצא ובדקו commit ee891b42c2f083c4990eed72f1d4463adc5e103e בסניף הראשי לפני הגדרת מערכי הנתונים, סקריפטי האימון והגדרות ההערכה.
    2. השתמש בהתחייבות זו כדי לשחזר את הניסויים שדווחו במחקר זה. לא הייתה גרסת שחרור מתויגת זמינה למאגר בזמן עדכון כתב היד.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

תוצאות צפויות ופרשנות
כאשר פרוטוקול זה מיושם נכון, מודל MVM-UNet המאומן צפוי לייצר ביצועי סגמנטציה יציבים לאורך ריצות חזרות, עם שינויים קטנים בלבד בין זרעים אקראיים שונים ברוב מדדי ההערכה. עבור ISIC 2017 ו-ISIC 2018, תוצאות מוצלחות משתקפות בערכי DSC, mIoU, Acc, Sen ו-Spe גבוהים, יחד עם מסכות נגע חזויות העוקבות מקרוב אחרי גבולות הנגעים בין אמת קרקע (איורים 6 ו-7). עבור סינפסה, תוצאות מוצלחות משתקפות בערכי DSC ממוצעים גבוהים וערכי HD95 נמוכים ברחבי האיברים הקדמיים (איור 8). במהלך ביצוע הפרוטוקול, יש לפרש מדדים כמותיים יחד עם תוצאות הסגמנטציה האיכותית המתאימה. מודל שמשיג DSC גבוה אך מציג דליפת גבול, השמטת מבנים קטנים או תחזיות מפורקות צריך להיחשב כמוצלח חלקית בלבד, ויש לאמת את תהליך העיבוד המקדים, בחירת נקודות ביקורת והגדרות הסקנה.

figure-results-1
איור 6. תוצאות סגמנטציה איכותנית מייצגת במאגר הנתונים של ISIC 2017. תוצאות סגמנטציה איכותנית מייצגות שהושגו במאגר נתוני סגמנטציה של נגעי עור של International Skin Imaging Collaboration (ISIC) לשנת 2017. כל דוגמה מציגה את התמונה הדרמוסקופית המקורית (Image), מסכת סגמנטציה של אמת קרקעית (GT) המתאימה, ואת התחזית שנוצרה על ידי MVM-UNet (Pred). מקרי בדיקה מייצגים ממחישים ביצועי סגמנטציה עבור נגעים בגודל, מורפולוגיה ומורכבות גבול משתנים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-2
איור 7. תוצאות סגמנטציה איכותנית מייצגת על מאגר הנתונים של ISIC 2018. תוצאות סגמנטציה איכותנית מייצגות שהושגו במאגר נתוני סגמנטציה של נגעי עור של International Skin Imaging Collaboration (ISIC) לשנת 2018. כל דוגמה מציגה את התמונה הדרמוסקופית המקורית (Image), מסכת סגמנטציה של אמת קרקעית (GT) המתאימה, ואת התחזית שנוצרה על ידי MVM-UNet (Pred). מקרים מייצגים מראים ביצועי סגמנטציה בין מראות נגעים שונים ומאפייני גבול. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-3
איור 8. תוצאות סגמנטציה איכותית מייצגות במאגר הנתונים של טומוגרפיה ממוחשבת של Synapse. תוצאות מייצגות של סגמנטציה איכותנית רב-איברית שהתקבלו על מאגר הסינפס Multi-Atlas Labeling מעבר ל-Cranial Vault. כל דוגמה מציגה את תמונת הטומוגרפיה הממוחשבת המקורית (תמונה), את הערות האיבר האמת הקרקעית (GT) המתאימים, ואת התחזית שנוצרה על ידי MVM-UNet (Pred). דוגמאות מייצגות ממחישות הסכמה בין סגמנטציה חזויה וייחוס בין איברי בטן מרובים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

ביצועים ב-ISIC 2017
כדי להעריך את השחזוריות של MVM-UNet, כל ניסויי ההשוואה המרכזיים חזרו על עצמם באמצעות שלושה זרעים אקראיים בלתי תלויים (1, 52 ו-100), והתוצאות מדווחות כממוצע ± SD. המובהקות הסטטיסטית הוערכה באמצעות מבחן הדירוג החתום של וילקוקסון, בהתבסס על תוצאות זוגיות לתמונה עבור ISIC 2017 ו-ISIC 2018 ותוצאות זוגיות לכל מקרה עבור Synapse. הניתוח הסטטיסטי בוצע באמצעות ערכי מדדים מזווגים במקום ממוצעים ברמת הזרע. לצורך השוואה הוגנת, תוצאות שדווחו כממוצע ± SD שוחזרו באמצעות המימושים הרשמיים תחת אותם חלוקות מאגר נתונים, רזולוציות קלט ומדדי הערכה ככל שניתן, בעוד שתוצאות הערך היחיד נשמרו מהפרסומים המקוריים המתאימים.

MVM-UNet הוערך על בסיס מאגר נתוני סגמנטציה של נגעי עור ISIC לשנת 2017 והושווה לשיטות סגמנטציה מייצגות, כולל UNet 8,21, TransUNet23, H-vmunet28, MISSFormer30, MaLUNet31, VM-UNet32, UNeXt-S33, HResFormer34, MedScale-Former35, MCAFT36, ו-H2Former12 (טבלה 1). MVM-UNet השיגה mIoU של 80.94 ± 1.01%, DSC של 91.32% ± 0.68%, דיוק של 96.58% ± 0.27%, ספציפיות של 98.31% ± 0.23%, ורגישות של 91.65% ± 0.77% בשלוש ריצות עצמאיות. בהשוואה לשיטות שנבדקו, MVM-UNet השיג את ה-mIoU, DSC והרגישות הגבוהים ביותר. תוצאות סגמנטציה איכותית מייצגות מוצגות באיור 6, כאשר המסכות החזויות עוקבות מקרוב אחרי גבולות הנגע האמת הקרקעית על פני תמונות בדיקה מייצגות.

מודלמקור.mIoU (%)DSC (%)Acc (%)Spe (%)סן (%)
UNet876.9886.9995.6597.4386.82
TransUNet2375.3281.2391.4595.7782.63
MaLUNet3178.7888.1396.1898.4784.78
VM-UNet3280.2389.0396.2997.5889.90
UNeXt-S3378.2687.8095.9597.7487.04
HResFormer3479.89 ± 1.0588.82 ± 0.6596.25 ± 0.2497.73 ± 0.2287.72 ± 0.79
H-vmunet2880.34 ± 1.0290.68 ± 0.5596.42 ± 0.1898.23 ± 0.3288.97 ± 0.88
MISSFormer3080.16 ± 0.7889.27 ± 0.6194.36 ± 0.2897.52 ± 0.3887.71 ± 0.69
H2Former1280.35 ± 0.9588.56 ± 0.7296.61 ± 0.1998.15 ± 0.1488.21 ± 0.81
מדסקייל-פורמר3580.31 ± 0.8289.11 ± 0.5995.68 ± 0.3398.24 ± 0.2189.96 ± 0.92
MCAFT3680.59 ± 0.9389.27 ± 0.6396.42 ± 0.2097.95 ± 0.1790.05 ± 0.84
MVM-UNet (שלנו)80.94 ± 1.0191.32 ± 0.6896.58 ± 0.2798.31 ± 0.2391.65 ± 0.77

טבלה 1: השוואת ביצועים במאגר הנתונים של חלוקת נגעי העור של ISIC 2017. השוואה בין MVM-UNet לבין שיטות סגמנטציה מבוססות רשת עצבית קונבולוציונית מייצגת (CNN)-, טרנספורמר-, ומודל מרחב מצבים (SSM) באמצעות חיתוך ממוצע על איחוד (mIoU), מקדם דמיון קוביות (DSC), דיוק (Acc.), ספציפיות (ספציפית) ורגישות (Sen.). התוצאות של MVM-UNet מדווחות כסטיית תקן ממוצעת ± משלושה ניסויי זרעים אקראיים עצמאיים. התוצאות שדווחו כערכים בודדים שוחזרו מהפרסומים המקוריים המתאימים.

הדוגמאות האיכותניות מראות עוד יותר ש-MVM-UNet חילקה במדויק הן נגעים קטנים והן נגעים גדולים עם גבולות לא סדירים. בדוגמאות המייצגות הללו, המסכות החזויות תאמו במידה רבה להערות האמת הקרקעית המקבילות ושמרו על גבולות הנגעים עם דליפה או פיצול מינימלית.

כדי להעריך עוד האם השיפורים שנצפו היו מובהקים סטטיסטית, בוצעו מבחני דירוג חתום של וילקוקסון באמצעות תוצאות סגמנטציה זוגיות לכל תמונה. במדד mIoU, MVM-UNet הראה שיפור מובהק סטטיסטית לעומת MCAFT, עם ערך p של 0.0114. במדד DSC, MVM-UNet גם הציג ביצועים גבוהים משמעותית מ-H-vmunet, עם ערך p של 0.0031. תוצאות אלו תומכות בכך שהשיפורים שנצפו ב-ISIC 2017 לא היו ככל הנראה מיוחסים לשונות אקראית.

בסך הכול, MVM-UNet השיגה את הביצועים הגבוהים ביותר בין השיטות שהושוו ל-mIoU, DSC ורגישות במערך הנתונים ISIC 2017 (טבלה 1). דוגמאות הסגמנטציה האיכותנית המוצגות באיור 6 תואמות את הממצאים הכמותיים הללו.

ביצועים ב-ISIC 2018
MVM-UNet הוערך בהרחבה על מאגר הנתונים של סגמנטציה של נגעי עור של ISIC 2018 והושווה לשיטות סגמנטציה מייצגות, כולל UNet 8,21, UNet++9, UTNetV237, SANet38, MaLUNet31, VM-UNet32, H-vmunet28, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35, ו-MCAFT36 (טבלה 2). MVM-UNet השיגה mIoU של 82.47% ± 1.28%, DSC של 90.65% ± 0.94%, דיוק של 96.02% ± 0.36%, ספציפיות של 97.06% ± 0.31%, ורגישות של 91.80% ± 0.82% בשלוש ריצות עצמאיות. תוצאות אלו מראות כי ביצועי MVM-UNet נשארו עקביים בין זרעים אקראיים שונים. תוצאות סגמנטציה איכותיות מייצגות מוצגות באיור 7.

מודלמקור.mIoU (%)DSC (%)Acc (%)Spe (%)סן (%)
UNet877.8687.5594.0596.6985.86
UNet++978.3187.8394.0295.7588.65
UTNetV23778.9788.2594.3296.4887.60
SANet3879.5288.5994.3995.9789.46
MaLUNet3180.2589.0494.6296.1989.74
VM-UNet3281.3589.7194.9196.1391.12
H-vmunet2881.93 ± 1.4590.46 ± 0.6295.19 ± 0.3096.82 ± 0.2188.37 ± 1.13
MISSFormer3080.27 ± 1.2189.91 ± 0.4694.76 ± 0.2797.22 ± 0.1590.84 ± 1.07
H2Former1280.40 ± 0.8390.26 ± 0.7394.89 ± 0.3896.98 ± 0.2591.57 ± 0.54
HResFormer3481.12 ± 1.1888.86 ± 0.8494.96 ± 0.3396.43 ± 0.2291.86 ± 1.01
מדסקייל-פורמר3580.97 ± 0.7490.47 ± 0.6895.02 ± 0.4195.89 ± 0.2690.65 ± 0.92
MCAFT3681.46 ± 1.0389.06 ± 0.7695.23 ± 0.2996.72 ± 0.1791.82 ± 0.57
MVM-UNet (שלנו)82.47 ± 1.2890.65 ± 0.9496.02 ± 0.3697.06 ± 0.3191.80 ± 0.82

טבלה 2: השוואת ביצועים במאגר נתוני סגמנטציה של נגעי עור ISIC לשנת 2018. השוואה בין MVM-UNet לשיטות סגמנטציה מייצגות מבוססות CNN-, Transformer- ו-SSM, תוך שימוש בחיתוך ממוצע על איחוד (mIoU), מקדם דמיון קוביות (DSC), דיוק (Acc.), ספציפיות (מיוחדת) ורגישות (סנטימנט). התוצאות של MVM-UNet מדווחות כסטיית תקן ממוצעת ± משלושה ניסויי זרעים אקראיים עצמאיים. התוצאות שדווחו כערכים בודדים שוחזרו מהפרסומים המקוריים המתאימים.

בהשוואה ל-H-vmunet, MVM-UNet שיפר את ה-mIoU ב-0.54%. בהשוואה ל-MedScale-Former, MVM-UNet שיפרה את ה-DSC ב-0.18%. MVM-UNet גם השיגה את הדיוק הגבוה ביותר בין השיטות שהושוו. הדוגמאות האיכותניות המייצגות המוצגות באיור 7 מראות חלוקה מדויקת של נגעי עור מייצגים, כולל אזורים קטנים ונגעים עם גבולות לא סדירים.

ל-ISIC 2018, מובהקות סטטיסטית הוערכה באמצעות מבחן וילקוקסון-דרגה חתום, בהתבסס על תוצאות סגמנטציה זוגיות לכל תמונה. במדד mIoU, MVM-UNet השיג שיפור מובהק סטטיסטית לעומת MCAFT, עם ערך p של < 0.001. תוצאות אלו תומכות בכך שהשיפור בביצועים שנצפה ב-ISIC 2018 לא סביר שיוחס לשונות אקראית.

בסך הכל, MVM-UNet השיג את ה-mIoU, DSC והדיוק הגבוהים ביותר בין השיטות שהושוו במאגר הנתונים של ISIC 2018 (טבלה 2). הדוגמאות האיכותניות המוצגות באיור 7 תואמות את השיפורים הכמותיים הללו.

ביצועים על סינפס
השיטה המוצעת הוערכה גם במאגר הנתונים של סגמנטציה רב-איברית של Synapse והושוותה לשיטות מייצגות, כולל UNet 8,21, Attention U-Net39, TransUNet23, TransNorm40, Swin U-Net25, TransDeepLab41, MEW-UNet42, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35, ו-MCAFT36 (טבלה 3). מאגר הנתונים של סינאפסה כלל שמונה איברי בטן: האאורטה, כיס המרה, הטחול, הכליה השמאלית, הכליה הימנית, הכבד, הלבלב והקיבה. בהתאם לפרוטוקול הניסוי הסטנדרטי, שימשו 18 מקרים (2,212 פרוסות ציריות) לאימון ו-12 מקרים (1,567 פרוסות אקסיאליות) לבדיקה. לא הוכנס סט אימות נפרד. מקרי הבדיקה שימשו אך ורק להערכה סופית ולא שימשו לאימון מודלים, כוונון היפרפרמטרים או בחירת מודל. תוצאות מייצגות של סגמנטציה איכותית של רב-איברים מוצגות באיור 8, וההשוואה הכמותית מסוכמת בטבלה 3.

מודלמקור.DSCHD95אאור.גל.ילד. (L)ילד. (R)ליב.פאן.סמל.סטו.
UNet876.8539.7889.0769.7277.7768.6993.4354.0186.6675.59
Att-UNet3977.7736.0289.5468.8877.9871.1193.5758.0487.3175.74
TransUNet2377.4831.6987.2363.1381.8777.0294.0855.8485.0675.62
טרנסנורם4078.430.2586.2365.1882.1878.6394.2255.3289.5376.02
סווין יו-נט2579.1321.5585.4766.5383.2879.6194.2956.5890.6276.59
TransDeepLab4180.1621.2586.0469.1684.0879.8893.5361.1589.0178.36
MEW-UNet4278.9221.6886.6865.3282.8780.0293.6358.3890.1674.27
MISSFormer3080.92 ± 4.2320.09 ± 1.8986.43 ± 0.9869.81 ± 4.5684.29 ± 2.1181.03 ± 3.3493.85 ± 0.8961.11 ± 4.6790.05 ± 3.7880.62 ± 1.02
H2Former1281.05 ± 2.5620.13 ± 7.2386.61 ± 3.2169.32 ± 1.2385.12 ± 4.7882.01 ± 2.8994.09 ± 2.4561.16 ± 0.7689.97 ± 4.1280.94 ± 3.56
HResFormer3480.65 ± 4.0217:48 ± 6.8989.16 ± 2.7866.94 ± 0.7884.61 ± 4.3482.15 ± 2.5693.11 ± 1.3459.92 ± 4.1291.08 ± 3.4580.75 ± 2.01
מדסקייל-פורמר3580.78 ± 1.3420.02 ± 3.7888.79 ± 4.0269.82 ± 2.5685.13 ± 0.8781.63 ± 4.7894.10 ± 2.7860.72 ± 1.8990.14 ± 1.5680.93 ± 4.56
MCAFT3681.03 ± 3.4519.98 ± 5.1289.76 ± 0.7668.96 ± 3.8984.54 ± 2.5681.98 ± 3.1294.32 ± 4.0160.85 ± 3.6789.06 ± 4.8980.91 ± 1.78
MVM-UNet (שלנו)81.26 ± 1.8918.72 ± 2.1688.53 ± 3.2269.84 ± 4.2385.37 ± 2.6982.67 ± 1.6794.41 ± 3.5661.02 ± 2.7890.19 ± 0.6781.48 ± 3.12

טבלה 3: השוואת ביצועים במאגר הנתונים של סגמנטציה רב-איברית של Synapse. השוואה בין MVM-UNet לשיטות סגמנטציה מבוססות CNN-, Transformer-ו-SSM באמצעות מקדם דמיון קוביות (DSC), מרחק האוסדורף באחוזון ה-95 (HD95), וציוני קוביות ספציפיות לאיברים עבור האאורטה (Aor.), כיס המרה (Gal.), הכליה השמאלית (Kid. (L)), הכליה הימנית (Kid. (R)), כבד (Liv.), לבלב (Pan.), טחול (Spl.), וקיבה (Sto.). התוצאות של MVM-UNet מדווחות כסטיית תקן ממוצעת ± משלושה ניסויי זרעים אקראיים עצמאיים. התוצאות שדווחו כערכים בודדים שוחזרו מהפרסומים המקוריים המתאימים.

MVM-UNet השיגה ממוצע DSC של 81.26% ± 1.89% וממוצע HD95 של 18.72 ± 2.16 בשלוש ריצות עצמאיות. התוצאות מראות ביצועי סגמנטציה יציבים במאגר הנתונים Synapse. מבין השיטות שנבדקו, MVM-UNet השיגה את ממוצע ה-DSC הגבוה ביותר ואת הממוצע השני הנמוך ביותר HD95.

עבור סינפס, מובהקות סטטיסטית הוערכה באמצעות מבחן דירוג חתום של וילקוקסון, המבוסס על ערכי DSC זוגיים לכל מקרה. MVM-UNet הראה שיפור מובהק סטטיסטית לעומת H2Former, עם ערך p של 0.026, מה שמעיד שהשיפור שנצפה בביצועי הסגמנטציה היה מובהק סטטיסטית.

תוצאות מוצלחות ובלתי אופטימליות מייצגות
תוצאות איכותיות מוצלחות מייצגות מוצגות באיורים 6–8. תוצאות מוצלחות מאופיינות במסכות חלוקה צפויות התואמות במדויק את הערות האמת הקרקעית ומגדירות במדויק את הנגע הראשי או גבולות האיברים. תוצאות מייצגות תת-אופטימליות עשויות להתרחש עבור מטרות קטנות מאוד, גבולות בעלי ניגודיות נמוכה, צורות נגע לא סדירות, איברים עם ניגודיות עוצמה חלשה, או גבולות אנטומיים עמומים, ולרוב להופיע כתת-סגמנטציה, סגמנטציה יתר, דליפת גבול או קטעי מסכה לא רציפים. כאשר נצפים תוצאות כאלה, על המשתמשים לוודא ששינוי גודל תמונה, נרמליזציה, אינטרפולציה של מסכה, בחירת נקודות ביקורת למודל, סף הסקה (עבור מערכי ISIC) או חיזוי ארגמקס (עבור Synapse), ושיטות חישוב מטריות תואמים לאלו המתוארים בפרוטוקול.

מחקר אבלציה של מודול MV4D
תרומת מודול MV4D הוערכה על ידי הוספת זוגות הסריקה הזיגזג, היררכית, הספירלית והרדיאלית, ואחריה מודול SFusion Mamba (טבלה 4; איור 9). כאשר השתמשו רק בזוג סריקת זיגזג, ביצועי הסגמנטציה היו מוגבלים. הוספת זוג הסריקה ההיררכי שיפרה משמעותית את הביצועים, מה שמעיד על היתרון בשילוב מידע רב-קנה מידה. הוספת זוגות הסריקה הספירלית והרדיאלית שיפרה עוד יותר את ביצועי הסגמנטציה על ידי שיפור הייצוג הקונטור והגבול. שילוב מודול SFusion Mamba הביא לביצועים הגבוהים ביותר מבין התצורות שנבדקו.

מודלזוג סריקת זיגזגזוג סריקה היררכיזוג סריקה ספירליתזוג סריקה רדיאליתSFusion MambaISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet56.7572.4658.0373.45
MVM-UNet72.3884.0173.4584.7
MVM-UNet75.6986.2076.9486.94
MVM-UNet76.4186.6178.2887.82
MVM-UNet80.9491.3282.4790.65

טבלה 4: מחקר אבלציה של מודול רב-תצוגה 4-כיוונית (MV4D). הביצועים שהושגו על ידי שילוב הדרגתי של זוגות הסריקה ההיררכיים, הספירליים והרדיאליים ומודול Spatial Fusion Mamba (SFusion Mamba) בארכיטקטורת זוג הסריקה-זוג הבסיסית של זיגזג. הביצועים מדווחים באמצעות חיתוך ממוצע על פני איחוד (mIoU) ומקדם דמיון קוביות (DSC) על מערכי הנתונים ISIC 2017 ו-ISIC 2018.

figure-results-4
איור 9. מחקר אבלציה של מודול רב-תצוגה 4-כיווני (MV4D). (א) שינוי בחיתוך הממוצע על פני איחוד (mIoU) לאחר שילוב סדרתי של זוג הסריקה ההיררכי, זוג הסריקה הספירלי, זוג הסריקה הרדיאלית וממבה המיזוג המרחבי (SFusion Mamba) בארכיטקטורה הבסיסית. (ב) שינוי במקדם הדמיון לקוביות (DSC) לאחר שילוב רציף של זוג הסריקה ההיררכי, זוג הסריקה הספירלי, זוג הסריקה הרדיאלית וממבה מיזוג מרחבי (SFusion Mamba) בארכיטקטורת הבסיס. (ג) שינוי ב-mIoU לאחר שילוב רציף של זוג הסריקה ההיררכי, זוג הסריקה הספירלי, זוג הסריקה הרדיאלית וממבה מיזוג מרחבי (SFusion Mamba) בארכיטקטורת הבסיס תחת ההקשר הניסויי השני. (ד) שינוי ב-DSC לאחר שילוב רציף של זוג הסריקה ההיררכי, זוג הסריקה הספירלי, זוג הסריקה הרדיאלית וממבה מיזוג מרחבי (SFusion Mamba) בארכיטקטורה הבסיסית תחת ההגדרה הניסויית השנייה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

במאגר הנתונים של ISIC 2017, מודול MV4D המלא השיג mIoU של 80.94% ו-DSC של 91.32%. מגמות הביצועים המקבילים עבור mIoU ו-DSC מוצגות באיור 9A ובאיור 9B, בהתאמה. במאגר הנתונים של ISIC 2018, מודול MV4D המלא השיג mIoU של 82.47% ו-DSC של 90.65%. מגמות הביצועים המתאימות מוצגות באיור 9C ובאיור 9D, בהתאמה.

אלא אם צוין אחרת, כל ניסויי האבלציה נערכו באמצעות זרע אקראי קבוע של 100, בעוד שתוצאות ההשוואה העיקריות דווחו כממוצע ± SD על שלושה זרעים אקראיים בלתי תלויים (1, 52 ו-100). כתוצאה מכך, תוצאות האבלציה נועדו להשוות את התרומה היחסית של רכיבים בודדים תחת מסגרת מבוקרת של זרע יחיד, ולא לשחזר את הביצועים הסופיים של רב-זרעים שדווחו בניסויי ההשוואה המרכזיים.

בסך הכל, שילוב הדרגתי של זוגות הסריקה הנוספים ומודול SFusion Mamba שיפר באופן עקבי את ביצועי הסגמנטציה, כאשר תצורת MV4D המלאה השיגה את הביצועים הגבוהים ביותר בשני מערכי הנתונים.

מחקר אבלציה של בלוק הראייה הרב-זווית (MVV)
בלוק ה-MVV הוערך על ידי השוואת ארכיטקטורת הבסיס לגרסה הכוללת את ענף ההקרנה למעלה-למטה (טבלה 5). במאגר הנתונים של ISIC 2017, הכללת ענף ההקרנה למעלה ולמטה העלתה את mIoU מ-78.83% ל-80.96% ואת ה-DSC מ-88.15% ל-91.02%. במאגר הנתונים של ISIC 2018, ה-mIoU עלה מ-80.32% ל-82.46%, בעוד שה-DSC עלה מ-89.15% ל-90.57%.

מודלבלוק MVV בסיסיהקרנה למעלה-למטהISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet78.8388.1580.3289.15
MVM-UNet80.9691.0282.4690.57

טבלה 5: מחקר אבלציה של בלוק הראייה הרב-תצוגה (MVV). השוואת ביצועים של בלוק ה-Multi-View Vision (MVV) הבסיסי עם ובלי ענף ההקרנה למעלה ולמטה. הביצועים מדווחים באמצעות חיתוך ממוצע על פני איחוד (mIoU) ומקדם דמיון קוביות (DSC) על מערכי הנתונים ISIC 2017 ו-ISIC 2018.

ניסויי האבלציה של MVV בלוק נערכו באמצעות זרע אקראי קבוע של 100. כתוצאה מכך, ביצועי התצורה המכילה את ענף ההקרנה למעלה-למטה משקפים את הגדרת האבלציה המבוקרת של זרע יחיד ועשויים להיות שונים במעט מהביצועים הממוצעים של שלושה זרעים שדווחו עבור מודל MVM-UNet המלא בניסויים המרכזיים בהשוואה המרכזית.

בסך הכל, שילוב ענף ההקרנה למעלה-למטה שיפר באופן עקבי את ביצועי הסגמנטציה בשני מערכי הנתונים, עם עליות שנצפו הן עבור mIoU והן עבור DSC.

מחקר אבלציה של מודול ה-Fusion Mamba הרב-שלבי (MFusion Mamba)
מודול MFusion Mamba הוערך על ידי השוואת אסטרטגיות היתוך גס שונות יחד עם רכיב ההיתוך העדין (טבלה 6; איור 10). ללא MFusion Mamba, MVM-UNet השיגה mIoU של 75.47% ו-DSC של 86.01% במאגר הנתונים של ISIC 2017, mIoU של 77.49% ו-DSC של 87.29% במאגר הנתונים ISIC 2018. מבין אסטרטגיות ההיתוך הגס שנבדקו, מוצר האדמארד השיג את השיפור הגדול ביותר. שילוב רכיב ההיתוך העדין שיפר עוד יותר את ביצועי הסגמנטציה. תצורת MFusion Mamba המלאה השיגה mIoU של 80.95% ו-DSC של 91.18% ב-ISIC 2017, ו-mIoU של 82.51% ו-DSC של 90.58% ב-ISIC 2018.

מודלמיזוג גס מבחינת אלמנט מקסימוםפיוז'ן גס חיבור לפי אלמנטמכפלת פיוז'ן גס של Hadamardמודול היתוך עדיןISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet75.4786.0177.4987.29
MVM-UNet76.2186.4778.3587.82
MVM-UNet76.8386.8679.1188.30
MVM-UNet78.2687.8380.0688.96
MVM-UNet80.9591.1882.5190.58

טבלה 6: מחקר אבלציה של מודול ה-Multi-שלבי Fusion Mamba (MFusion Mamba). השוואת ביצועים של אסטרטגיות היתוך גס שונות, כולל היתוך מקסימלי (Max), חיבור לפי אלמנט (⊕), ומכפלת האדמארד (⊙), יחד עם מודול ההיתוך העדין המלא. הביצועים מדווחים באמצעות חיתוך ממוצע על פני איחוד (mIoU) ומקדם דמיון קוביות (DSC) על מערכי הנתונים ISIC 2017 ו-ISIC 2018.

figure-results-5
איור 10. מחקר אבלציה של מודול ה-Multi-Stage Fusion Mamba (MFusion Mamba). (A) שינוי בחיתוך הממוצע על פני איחוד (mIoU) שהתקבל באמצעות אסטרטגיות היתוך גסות שונות (חיבור מקסימלי, לפי איברים, ומכפלת האדמר) ומודול ההיתוך העדין המלא. (ב) שינוי במקדם הדמיון לקוביות (DSC) שהושג באמצעות אסטרטגיות היתוך גסות שונות (חיבור מקסימלי, רכיב לפי איברים, ומכפלת האדמארד) ובמודול ההיתוך העדין המלא. (ג) שינוי ב-mIoU שהתקבל באמצעות אסטרטגיות היתוך גסות שונות (החיבור מקסימלי, לפי אלמנט, ומכפלת האדמארד) ומודול ההיתוך העדין המלא תחת ההגדרה הניסויית השנייה. (D) שינוי ב-DSC שהושג באמצעות אסטרטגיות היתוך גסות שונות (החיבור המקסימלי, לפי אלמנט, ומכפלת האדמר) ומודול ההיתוך העדין המלא תחת ההגדרה הניסויית השנייה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

במאגר הנתונים של ISIC 2017, תצורת MFusion Mamba המלאה השיגה mIoU של 80.95% ו-DSC של 91.18%. מגמות הביצועים המתאימות עבור mIoU ו-DSC מוצגות באיור 10A ובאיור 10B, בהתאמה. במאגר הנתונים של ISIC 2018, תצורת MFusion Mamba המלאה השיגה mIoU של 82.51% ו-DSC של 90.58%. מגמות הביצועים המתאימות מוצגות באיור 10C ואיור 10D, בהתאמה. ניסויי האבלציה של MFusion Mamba נערכו באמצעות זרע אקראי קבוע של 100. כתוצאה מכך, תצורת MFusion Mamba המלאה מייצגת את תוצאת האבלציה המבוקרת של זרע יחיד ועשויה להיות שונה במעט מהביצועים הממוצעים של שלושה זרעים שדווחו עבור מודל MVM-UNet המלא בניסויי ההשוואה המרכזיים.

בסך הכל, שילוב הדרגתי של אסטרטגיית ההיתוך הגס של מוצר האדמארד ורכיב ההיתוך העדין שיפר באופן עקבי את ביצועי הסגמנטציה, כאשר תצורת MFusion Mamba המלאה השיגה את הביצועים הגבוהים ביותר בשני מערכי הנתונים.

סיכום מחקרי אבלציה
במהלך ניסויי האבלציה, שילוב הדרגתי של ענפי זוג הסריקה ההיררכיים, הספירליים והרדיאליים, יחד עם מודול SFusion Mamba, שיפרו באופן עקבי את ביצועי הסגמנטציה (טבלה 4; איור 9). באופן דומה, הכללת ענף ההקרנה למעלה-למטה בבלוק MVV שיפרה את mIoU ו-DSC במאגרי ISIC 2017 ו-ISIC 2018 (טבלה 5). תצורת MFusion Mamba המלאה השיגה גם את הביצועים הגבוהים ביותר בין אסטרטגיות מיזוג תכונות רב-שלביות שנבדקו (טבלה 6; איור 10).

מחקר אבלציה של היפרפרמטרים
השפעות גודל הקלט וערך ההפסקה הוערכו על מערכי הנתונים של ISIC 2017 ו-ISIC 2018 (טבלה 7). שלוש רזולוציות קלט (256 × 256, 384 × 384, ו-512 × 512) הושוו. בהגדרות המוערכות, רזולוציית הקלט 256 × 256 השיגה את ביצועי הסגמנטציה הגבוהים ביותר בשני מערכי הנתונים.

מודלגודל קלט 256 × 256גודל קלט 384 × 384גודל קלט 512 × 512Dropout 0.0Dropout 0.1Dropout 0.2Dropout 0.3ISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet80.0288.9181.7689.92
MVM-UNet79.9688.8780.9789.47
MVM-UNet77.4887.2878.7688.11
MVM-UNet79.3688.5381.1389.62
MVM-UNet80.9490.1582.4990.50
MVM-UNet79.7188.7180.4689.18

טבלה 7: מחקר אבלציה של גודל התמונה הנכנסת וערך הניתוק. השוואת ביצועים של MVM-UNet באמצעות גדלים שונים של תמונות קלט וערכי dropout. ביצועי הסגמנטציה מדווחים באמצעות חיתוך ממוצע מעל איחוד (mIoU) ומקדם דמיון קוביות (DSC) על מערכי הנתונים ISIC 2017 ו-ISIC 2018.

ערכי נשירה שונים הוערכו גם הם. מבין הקונפיגורציות שנבדקו, ערך הפסקה של 0.2 השיג את ביצועי הסגמנטציה הגבוהים ביותר בשני מערכי הנתונים ולכן שימש בניסויים המרכזיים.

מחקר אבלציה של תצורת שכבת המקודד-מפענח
הוערכו תצורות שונות של שכבות מקודד-מפענח כדי לבחון את השפעת עומק הרשת על ביצועי הסגמנטציה והעלות החישובית (טבלה 8). מבין התצורות שהוערכו, הארכיטקטורה הסימטרית {2, 2, 2, 2}-{2, 2, 2, 2} השיגה את ביצועי הסגמנטציה הכוללים הגבוהים ביותר תוך שמירה על מורכבות מודל נמוכה יחסית. הגדלת עומק הרשת ל-{2, 2, 9, 2}-{2, 9, 2, 2} יצרה ביצועי סגמנטציה דומים אך הגדילה הן את מספר הפרמטרים והן את העלות החישובית.

מודלתצורת שכבת מקודד-מפענחפרמטרים (M)פלופס (G)ISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet{2,2,2,1}-{2,2,2,2}28.224.1280.0288.9181.1689.64
MVM-UNet{2,2,2,2}-{2,2,2,2}28.364.3980.9590.1782.590.41
MVM-UNet{2,2,2,3}-{2,3,2,2}30.144.8879.8388.881.5689.85
MVM-UNet{2,4,2,2}-{2,2,4,2}33.465.3279.6588.781.4589.79
MVM-UNet{2,2,9,2}-{2,9,2,2}45.637.7880.9690.0982.4890.43

טבלה 8: מחקר אבלציה של תצורות שכבת המקודד-מפענח. השוואת ביצועים של תצורות שכבות שונות של מקודד-מפענח. הטבלה מדווחת על מספר פרמטרי המודל (פרמטרים), פעולות בנקודה צפה (FLOPs), חיתוך ממוצע מעל איחוד (mIoU), ומקדם דמיון קוביות (DSC) במאגרי הנתונים ISIC 2017 ו-ISIC 2018.

השוואת עלויות חישובית
היעילות החישובית של מודל MVM-UNet הסופי הושוותה לשיטות בסיס מייצגות, כולל HResFormer, H-vmunet, MISSFormer, H2Former, MedScale-Former ו-MCAFT, תחת אותה סביבת חומרה ורזולוציית קלט (טבלה 9). המדדים שנבדקו כללו זמן אימון לכל תקופה, זמן הסקה לכל תמונה, שימוש שיא בזיכרון GPU במהלך האימון, מספר פרמטרים ניתנים לאימון (Params) ו-FLOPs. זמן האימון נמדד כזמן הנדרש להשלמת תקופת אימון אחת, זמן ההסקה נמדד כזמן העיבוד הממוצע לכל תמונת בדיקה, ו-FLOPs חושבו עבור מעבר קדימה יחיד.

שיטהמקור.זמן אימון (תקופה)זמן הסקה (ms/image)זיכרון GPU שיא (GB)פרמטרים (M)פלופס (G)
HResFormer34520213.0819.2117.00131.70
H-vmunet288827.005.010.748.97
MISSFormer3035592.8612.642.33109.45
H2Former1213029.028.833.7133.56
מדסקייל-פורמר358023.505.94.963.79
MCAFT3614534.008.730.0012.00
MVM-UNet (שלנו)10426.807.928.364.39

טבלה 9: השוואת עלויות חישובית של MVM-UNet ושיטות בסיס מייצגות. השוואת יעילות חישובית באותה סביבת חומרה ורזולוציית קלט. מדדים מדווחים כוללים זמן אימון לכל תקופה, זמן הסקה לכל תמונה, שימוש שיא בזיכרון יחידת עיבוד גרפיקה (GPU) במהלך האימון, מספר פרמטרי המודל (פרמטרים) ופעולות נקודה צפה (FLOPs). שיטות עם מימושים זמינים הוערכו באמצעות אותה סביבה ניסויית ככל שניתן.

כפי שמסוכם בטבלה 9, MVM-UNet דרש 104 שניות לתקופת אימון, 26.8 מילישניות לתמונה להסקת מסקנות, 7.9 GB של זיכרון GPU שיא ב-GPU, 28.36 מיליון פרמטרים ניתנים לכיוון ו-4.39 GFLOPs. בהשוואה ל-HResFormer, MISSFormer, H2Former ו-MCAFT, MVM-UNet דרש זמן אימון נמוך יותר, זמן הסקה נמוך יותר, שימוש שיא נמוך יותר בזיכרון GPU ופחות FLOPs. בהשוואה למודלים הקלים H-vmunet ו-MedScale-Form, MVM-UNet דרש זמן אימון ושימוש בזיכרון גדולים יותר אך שמר על מהירות הסקה דומה תוך שמירה על מורכבות חישובית נמוכה יחסית.

זמינות נתונים וקוד
מערכי הנתונים של ISIC 2017 ו-ISIC 2018 זמינים לציבור מארכיון International Skin Imaging Collaboration (ISIC), ומערך הנתונים של Synapse זמין לציבור ממאגר Synapse. פרטי רכישת מערכי הנתונים מסופקים בהצהרת האתיקה. בקצרה, מאגר הנתונים של ISIC 2017 התקבל ממאגר הנתונים הרשמי של ISIC 2017 Challenge (https://challenge.isic-archive.com/data/#2017), מאגר הנתונים של ISIC 2018 התקבל ממאגר הנתונים הרשמי של ISIC 2018 Challenge Task 1 (https://challenge.isic-archive.com/data/#2018), ומאגר Synapse התקבל ממאגר Synapse תחת מזהה accession syn3193805 (https://www.synapse.org/Synapse:syn3193805). תאריכי ההורדה המתאימים מדווחים בהצהרת האתיקה. גרסה ציבורית ראשונית של קוד המקור של MVM-UNet זמינה ב-https://github.com/LIXUEGUANG002/MVM-UNet. המאגר כולל את מימוש המודלים, מודולי רשת עיקריים, קבצי תצורה, הוראות ארגון מאגרי נתונים, סקריפטים לאימון וסקריפטי הערכה. חבילת השכפול המלאה, הכוללת קבצי קונפיגורציה סופיים, סקריפטים מלאים לניסוי, תיעוד נוסף ונקודות ביקורת מודל מאומנות, תהיה זמינה לציבור עם פרסום.

טבלה משלימה 1. ארכיטקטורת שכבה אחר שכבה של ה-Multi-view Vision Mamba UNet (MVM-UNet). הטבלה מסכמת את ארכיטקטורת הרשת הסדרתית של MVM-UNet, כולל שכבת הקלט, הטמעת פאץ', שלבי מקודד, בלוקי Multi-View Vision (MVV), פעולות מיזוג תיקונים, Multi-Stage Fusion Mamba (MFusion Mamba), שלבי מפענח, דגימה סופית וראש סגמנטציה. לכל שלב מופיעים הפעולה המתאימה, הפרמטרים העיקריים וגודל תכונת הפלט. E1–E4 מציינים את מפות התכונות של שלב המקודד המשמשות למיזוג תכונות רב-שלביות. B, H ו-W מציינים את גודל האצווה, גובה התמונה ורוחב התמונה, בהתאמה, ו-K מציין את מספר מחלקות הפלט (K = 1 עבור סגמנטציה בינארית של נגעי עור ו-K = 9 עבור סגמנטציה מרובת מחלקות של סינפסה, הכוללת מחלקת רקע אחת ושמונה מחלקות אורגן קדמיים). MFusion Mamba מייצרת תכונות מקודד רב-שלבי מאוחדות, המשולבות עם תכונות המפענח המתאימות במהלך שחזור המפענח. אנא לחצו כאן להורדת הקובץ הזה.

קובץ משלים 1. פסאודוקוד של מודול MV4D רב-תצוגה (MV4D) וממבה פיוז'ן רב-שלבית (MFusion Mamba). הקובץ המשלים מציג את זרימת העבודה האלגוריתמית של שני המודולים העיקריים המשמשים ב-MVM-UNet. אלגוריתם 1 מתאר את צינור העיבוד המלא של מודול Multi-View Four-Directional (MV4D), כולל יישור תכונות, בניית ארבעה רצפי זוגות סריקה (זיגזג, היררכי, ספירלי ורדיאלי), עיבוד מרחב מצבים סלקטיבי (S6), Fusion Mamba בתצוגת סריקה (SFusion Mamba), ושחזור מפת תכונות הפלט. אלגוריתם 2 מתאר את מודול ה-Multi-stage Fusion Mamba (MFusion Mamba), הכולל יישור תכונות מקודד רב-שלבי, מיזוג גס, היתוך עדין, אינטגרציה של מפענח ויצירת תכונת קלט המפענח המאוחד. משתנים וממדי טנזור מוגדרים בתוך האלגוריתמים. אנא לחצו כאן להורדת הקובץ הזה.

קובץ קידוד משלים 1. חבילת קוד המקור ל-MVM-UNet (MVM-UNet-master). הארכיון המשלים של ZIP מכיל את מימוש קוד המקור המלא של MVM-UNet ששימש במחקר זה. החבילה כוללת את ארכיטקטורת הרשת, מודולי Multi-View Four-Directional (MV4D) ו-Multi-stage Fusion Mamba (MFusion Mamba), קבצי קונפיגורציה, סקריפטים של אימון והערכה עבור ISIC 2017, ISIC 2018, ומערכי נתוני Synapse, פונקציות שימושיות ותיעוד פרויקט הנדרש לשחזור הניסויים המתוארים בפרוטוקול זה. החבילה כוללת גם את קובץ ה-README עם הוראות התקנה, תלות תוכנה, ארגון מערכי נתונים, ותהליכי עבודה של הדרכה והסקה. אנא לחצו כאן להורדת הקובץ הזה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פרוטוקול זה מתאר את MVM-UNet, מסגרת סגמנטציה רפואית מבוססת ממבה. השיטה תוכננה כדי להתמודד עם שתי מגבלות של מודלים קיימים של סגמנטציה. ראשית, שיטות מבוססות CNN קונבנציונליות מוגבלות ביכולת למודל תלות לטווח ארוך ומידע היררכי הקשרי בתמונות רפואיות מורכבות43. שנית, שיטות מבוססות טרנספורמר יכולות למודל הקשר גלובלי אך בדרך כלל דורשות עלות חישובית גבוההיותר 23,25. MVM-UNet משתמשת בארכיטקטורת Mamba 13,14,15,16,17,18,19,20 להשגת מידול יעיל לטווח ארוך ומציגה סריקות מרובות תצוגות ומיזוג תכונות רב-שלביות לשיפור דיוק הסגמנטציה. מנקודת מבט של ביצוע פרוטוקולים ויכולת שחזור, מספר שלבים קריטיים להשגת תוצאות דומות לאלו שדווחו במחקר זה. ראשית, יש לשמור על חלוקת מערך הנתונים, שינוי גודל התמונה, אינטרפולציית המסכה, אסטרטגיית הנרמול והמרת ערוץ בהתאם לפרוטוקול, מכיוון שהבדלים בעיבוד המוקדם יכולים לשנות ישירות את התפלגות הקלט וגבולות המסכה. במיוחד, יש לשנות את גודל מסכות הסגמנטציה באמצעות אינטרפולציה של השכן הקרוב ביותר כדי להימנע מהכנסת ערכי תוויות לא-שלמים44. שנית, יש לבדוק את תצורת האימון, כולל רזולוציית הקלט, גודל האצווה, הגדרות האופטימיזציה, לוח זמנים לקצב למידה, זרע אקראי, מקדמי משקל אובדן, כלל בחירת נקודות ביקורת, וסף הסקה או פעולת ארגמקס, לפני השוואת התוצאות. אם תוצאות משוחזרות נמוכות בבירור מהערכים המדווחים, המשתמשים צריכים קודם כל לאמת את נתיב מערך הנתונים, פורמט ההערות, קונבנציה של תוויות רקע-קדמית, טעינת נקודות ביקורת, פיצול אימות או בדיקה, והליך חישוב המטריקה. דליפת גבולות, מסכות מפורקות או מבנים קטנים חסרים בדרך כלל מצביעים על חוסר עקביות פוטנציאלי בעיבוד מוקדם, אינטרפולציה של מסכה, בחירת נקודות ביקורת או עיבוד לאחר ההסקה.

התרומה המרכזית של MVM-UNet היא מודול MV4D. בניגוד לאסטרטגיות סריקה דו-ממדיות פשוטות שאומצו בארכיטקטורות מבוססות מודל-מרחב-מצב קודמות 14,15,16,17,18,19,20, MV4D עושה שימוש בזוגות סריקה זיגזג, היררכיים, ספירליים ורדיאליים כדי ללכוד מידע חזותי משלים. זוגות סריקה זיגזג מסייעים לאזן בין מידע מרחבי מקומי וגלובלי, זוגות סריקה היררכיים משפרים חילוץ תכונות רב-קנה מידה, זוגות סריקה ספירליים מחזקים ייצוג קווי מתאר גלובליים, וזוגות סריקה רדיאליים משפרים את חילוץ תכונות הקצוות והגבול המקומיים. SFusion Mamba משלמת אז את מודאליות הסריקה המשלימות הללו. התוצאות המייצגות וניסויי האבלציה (טבלאות 4 ו-5; איור 9) להראות כי גם המגוון של דפוסי הסריקה וגם מנגנון המיזוג תורמים לשיפור ביצועי הסגמנטציה. רכיב חשוב נוסף הוא MFusion Mamba, המשמש כמודול מיזוג תכונות בין המקודד למפענח. ארכיטקטורות בצורת U קונבנציונליות, כולל U-Net 8,21,V-Net 44, ורבים מהדגמיםהבאים 9,23,25, מעבירים בעיקר מידע דרך חיבורים מדלגים לפי שלבים. אסטרטגיה זו עשויה שלא לנצל במלואו ייצוגים משלימים של מקודדים מרובי שלבים. MFusion Mamba מתמודד עם מגבלה זו על ידי שילוב תכונות מקודד דרך מיזוג גס ומיזוג עדין לפני הפענוח. התוצאות המייצגות (טבלה 6; איור 10) מראים כי MFusion Mamba משפר באופן עקבי את ביצועי הסגמנטציה, ומצביע על כך שמיזוג תכונות רב-שלבי מפורש מועיל לסגמנטציה רפואית של תמונות.

התרומה המתודולוגית של MVM-UNet צריכה להיות מובנת כעיצוב מחדש ברמת הארכיטקטורה ולא כהמצאה של כל פעולה בודדת מאפס. ארכיטקטורות מקודד-מפענח בצורת U, חיבורים שאריתיים, שכבות הקרנה ובלוקי מודל ממבה/מרחב מצבים (SSM) נחקרו בהרחבה במחקרים קודמים 8,13,14,15,16,17,18,19,20,21,23,24,25 ,29,44. עם זאת, שילוב ישירות של רכיבים אלו אינו בהכרח מתמודד עם האתגרים הספציפיים של חלוקת תמונות רפואיות. החידוש של MVM-UNet טמון בתכנון מתואם של שלושה היבטים. ראשית, מודול MV4D מחליף דפוס סריקה יחיד או מוגבל בארבעה ענפי זוג סריקה משלימים, מה שמאפשר למודל ללכוד רציפות מרחבית, מבנה רב-קנה מידה, מידע על קווי מתאר גלובליים ופרטי גבולות מקומיים. שנית, SFusion Mamba ו-MVV Block ממזגים ומשפרים תכונות ספציפיות לסריקה לפני שהן מועברות לשלב הרשת הבא. שלישית, MFusion Mamba מאגד במפורש תכונות מקודד רב-שלבי לפני הפענוח, ומשלימה חיבורי דילוג קונבנציונליים 8,21,44 ומשפרת את השימוש במידע היררכי. תוצאות האבלציה (טבלאות 4–6; איורים 9 ו-10) בנוסף, תומכים בהיגיון עיצובי זה, ומראים כי סריקה מרובת תצוגות, מיזוג ספציפי לסריקה, ענף ההקרנה למעלה-למטה, ומיזוג תכונות רב-שלביות תורמים כולם לשיפור ביצועי הסגמנטציה. לכן, התרומה של MVM-UNet טמונה באינטגרציה ספציפית למשימה ואומת ניסויית של מידול מרחבי מבוסס ממבה ומיזוג תכונות מקודד-מפענח לצורך סגמנטציה רפואית של תמונות.

למרות ביצועיה החזקים, ל-MVM-UNet יש מספר מגבלות. ראשית, ביצועי הסגמנטציה לא השתפרו באופן עקבי עם גדלי תמונות קלט גדולים יותר, מה שמרמז שהארכיטקטורה הנוכחית עשויה שלא לנצל במלואו מידע תמונה ברזולוציה גבוהה. שנית, המודל לא הוערך באופן נרחב בתנאי דימות עם רעש גבוה או ניגודיות נמוכה, אשר נפוצים בפרקטיקה קלינית ועלולים להשפיע על עמידות הסגמנטציה. שלישית, למרות שהמודל השיג ביצועים חזקים בשלושה מערכי נתונים ציבוריים, יש צורך באישור נוסף על מאגרי דימות רפואיים גדולים ומגוונים יותר. הפרוטוקול ניתן להתאמה למשימות חלוקת תמונות רפואיות אחרות, אך יש ליישם בזהירות מספר שינויים נוספים. למשימת סגמנטציה בינארית חדשה, המשתמשים צריכים לשנות את טוען מערכי הנתונים, פרמטרי הנורמליזציה, רזולוציית הקלט וסף החזית תוך שמירה על תהליך אובדן והערכה בינארי של BCE-Dice. למשימת סגמנטציה מרובת מחלקות חדשה, המשתמשים צריכים לעדכן את מספר מחלקות הפלט, מיפוי מדד מחלקות, המרת תווית חמה אחת, קונפיגורציית הפסד CE-Dice, ומדדי הערכה לפי מחלקות44. עבור מערכי נתונים בגווני אפור, יש להתאים את תצורת ערוץ הקלט לארכיטקטורת המודל על ידי שימוש בהקרנת קלט חד-ערוצית או חזרה על התמונה בגווני אפור ליצירת קלט בשלושה ערוצים, בהתאם ליישום. השיטה עשויה לפעול בצורה לא אופטימלית כאשר מבני המטרה קטנים מאוד, הגבולות חלשים או מעורפלים, ניגודיות התמונה שונה באופן מהותי מנתוני האימון, או כאשר מערך הנתונים המטרה מציג שינוי תחום משמעותי. בתנאים אלו, ייתכן שמשתמשים יצטרכו להתאים את רזולוציית הקלט, אסטרטגיית ההגברה, איזון מחלקות, משקל ירידה או לוח זמנים מדויק, תוך שמירה על אותו פרוטוקול הערכה כדי להבטיח השוואות הוגנות.

במאגר הנתונים Synapse, MVM-UNet השיגה ביצועי סגמנטציה רב-איבריים חזקים תחת החלוקה הנפוצה של אימון 18 מקרים ובדיקות 12 מקרים. למרות שהשיטה המוצעת השיגה את ממוצע ה-DSC הגבוה ביותר מבין שיטות הבסיס המייצגות שנבדקו במחקר זה (טבלה 3), שיטות עדכניות יותר דיווחו על ביצועים גבוהים יותר של סינפס תחת הגדרות אימון שונות ופרוטוקולי הערכהשונים. לכן, אנו נמנעים מלתאר MVM-UNet כשיגה ביצועים מתקדמים ב-Synapse ובמקום זאת מתארים אותה כהשגת ביצועים חזקים במסגרת ניסוי מוערך. ממצאים אלו מצביעים על כך שביצועי MVM-UNet נובעים מההתאמה הספציפית למשימה של מידול מבוסס ממבה לחלוקת תמונה רפואית 13,14,15,16,17,18,19,20. במקום להסתמך על אסטרטגיית סריקה אחת, MVM-UNet מפרקת מידול תכונות ויזואליות למספר תצוגות סריקה משלימות ומשלבת אותן דרך SFusion Mamba. בנוסף, MFusion Mamba משפר את זרימת המידע בין המקודד למפענח על ידי איגום מפורש של תכונות מקודד רב-שלבי מעבר לחיבורי דילוג קונבנציונליים 8,21,44. עיצוב זה מאפשר למודל המוצע להשיג ביצועים חזקים הן במשימות סגמנטציה בינארית של נגעי עור והן במשימות סגמנטציה רב-איברית.

העבודה העתידית צריכה להתמקד בשיפור MVM-UNet לחלוקת תמונות רפואיות ברזולוציה גבוהה. ארכיטקטורות רב-קנה מידה עמוקות או אדפטיביות עשויות לאפשר למודל לנצל מידע תמונה ברזולוציה גבוהה בצורה יעילה יותר. מחקרים עתידיים צפויים גם להעריך את עמידות MVM-UNet בתנאי דימות רועשים, בעלי ניגודיות נמוכה ובעלי הזזת דומיין. בנוסף, אסטרטגיית הסריקה הרב-תצוגית המוצעת עשויה להיות מורחבת למשימות ניתוח תמונות רפואיות נוספות, כולל זיהוי נגעים4, מיקום איברים, סיווג גידולים וחלוקה תלת-ממדית10,11. לסיכום, MVM-UNet מספקת מסגרת יעילה וניתנת לשחזור לחלוקת תמונות רפואיות. האינטגרציה של מודול MV4D ו-MFusion Mamba מאפשרת למודל ללכוד מידע מרחבי משלים, הקשר רב-קנה מידה, מידע על קווי מתאר גלובליים, פרטי גבולות מקומיים ותכונות סמנטיות רב-שלביות. התוצאות המייצגות שהושגו על מערכי הנתונים ISIC 2017, ISIC 2018 ו-Synapse מדגימות את יעילות הארכיטקטורה המוצעת. פרוטוקול זה מספק הפניה מעשית לחוקרים המפתחים ארכיטקטורות יעילות מבוססות SSM/Mamba לחלוקת תמונותרפואיות 13,14,15,16,17,18,19,20.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מצהירים שאין להם אינטרסים פיננסיים מתחרים.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה לא קיבל מימון חיצוני.

חומרים

```html

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
Hardware - GPU workstation or GPU serverInstitutional computing platform / local workstationCustom-built local GPU workstation; Ubuntu 22.04.1 with Linux kernel 6.8.0; Intel Core i9-13900K CPU; NVIDIA A800 GPU; 128 GB RAM; 512 GB local storage.Computational platform for training, validation, testing, ablation, and inference-only experiments.
Hardware - Graphics processing unit (GPU)NVIDIA CorporationNVIDIA A800 GPU (80 GB memory).GPU-accelerated model training and inference.
Hardware - Central processing unit (CPU)Intel Corporation / AMD13th Gen Intel Core i9-13900K CPU.Host processor for data loading, preprocessing, and experiment execution.
Hardware - System memory (RAM)Institutional computing platform / local workstation128 GB system RAMMemory for dataset loading, preprocessing, and training.
Hardware - StorageInstitutional computing platform / local workstation2 TB NVMe solid-state drive.Storage for datasets, checkpoints, logs, and generated prediction figures.
Software environment - Operating systemCanonical Ltd.Recommended: Ubuntu 22.04.1 LTSOperating system for the computational environment.
Software environment - Conda environmentAnaconda, Inc. / MinicondaEnvironment name: mvmunetPython environment used to install and isolate dependencies.
Software environment - PythonPython Software FoundationPython 3.8Programming language used for implementation and experiment execution.
Software environment - CUDA toolkitNVIDIA CorporationCUDA Toolkit 11.8GPU computing backend required by PyTorch and Mamba-related packages.
Software environment - cuDNNNVIDIA CorporationcuDNN 8.7.0.GPU-accelerated deep-learning primitives used through PyTorch.
Python package - PyTorchPyTorchtorch == 2.0.1Deep-learning framework for model training, loss calculation, optimization, and inference.
Python package - TorchvisionPyTorchtorchvision == 0.14.0Image transform utilities used in preprocessing and augmentation.
Python package - TorchaudioPyTorchtorchaudio == 0.13.0Installed with the recommended PyTorch environment.
Python package - timmtimm developerstimm == 0.4.12Model-component or utility dependency listed in the repository environment instructions.
Python package - tritonOpenAI / Triton developerstriton == 2.0.0Dependency used by GPU-accelerated sequence modeling components.
Python package - causal-conv1dcausal-conv1d developerscausal_conv1d == 1.0.0Efficient causal convolution dependency required by the Mamba implementation.
Python package - mamba-ssmMamba SSM developersmamba_ssm == 1.0.1State-space sequence modeling package used for Mamba/S6-related components.
Python package - NumPyNumPy developersNumPy version 1.24.3.Numerical computation and array operations.
Python package - SciPySciPy developersSciPy version 1.10.1.Scientific computation; scipy.ndimage.zoom is imported in utils.py.
Python package - SimpleITKInsight Software ConsortiumSimpleITK version 2.2.1.Medical image input/output and preprocessing utility imported in utils.py.
Python package - MedPyMedPy developersMedPy version 0.4.0.Medical image metric calculation package imported in utils.py.
Python package - scikit-imagescikit-image developersscikit-image version 0.21.0.Image-processing dependency listed in README.
Python package - scikit-learnscikit-learn developersscikit-learn version 1.3.2.Machine-learning utility package listed in README.
Python package - matplotlibMatplotlib developersMatplotlib version 3.7.2.Used for saving qualitative visualization figures.
Python package - h5pyh5py developersh5py version 3.9.0.HDF5 file support for Synapse test volumes.
Python package - thopTHOP developersTHOP version 0.1.1.post2209072238.Used when calculating FLOPs and parameter-related computational cost.
Python package - packagingPython Packaging Authoritypackaging version 23.1.Dependency listed in README.
Python package - pytestpytest developerspytest version 7.4.0.Dependency listed in README.
Python package - chardetchardet developerschardet version 5.2.0.Dependency listed in README.
Python package - yacsYACS developersyacs version 0.1.8.Configuration utility dependency listed in README.
Python package - termcolortermcolor developerstermcolor version 2.3.0.Logging/terminal utility dependency listed in README.
Python package - submititsubmitit developerssubmitit version 1.4.5.Experiment/job utility dependency listed in README.
Python package - tensorboardXtensorboardX developerstensorboardX version 2.6.2.2.Training log visualization utility listed in README.
Python package - ml-collectionsml_collections developersml-collections version 0.1.1.Imported by configs/config_setting_synapse.py.
Dataset - ISIC 2017 Challenge datasetInternational Skin Imaging CollaborationISIC 2017 skin lesion segmentation datasetPublic de-identified dermoscopic skin lesion images and masks used for binary segmentation.
Dataset - ISIC 2018 Challenge Task 1 datasetInternational Skin Imaging CollaborationISIC 2018 Task 1: Lesion Boundary SegmentationPublic de-identified dermoscopic skin lesion images and masks used for binary segmentation.
Dataset - Synapse Multi-Atlas Labeling Beyond the Cranial Vault datasetSynapse / Sage BionetworksAccession identifier: syn3193805Public abdominal CT multi-organ segmentation dataset.
Data organization - ISIC 2017 data folderAuthors / repository layoutdata/isic2017/Expected local folder containing train and validation images/masks.
Data organization - ISIC 2018 data folderAuthors / repository layoutdata/isic2018/Expected local folder containing train and validation images/masks.
Data organization - Synapse data folderAuthors / repository layoutdata/Synapse/Expected local folder for Synapse lists, train_npz, and test_vol_h

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang F, et al. Cross co-teaching for semi-supervised medical image segmentation. Pattern Recognit. 2024;152:110485.
  2. Gu Y, et al. Dual-scale enhanced and cross-generative consistency learning for semi-supervised medical image segmentation. Pattern Recognit. 2025;158:111140.
  3. Zhu X, Wang W, Zhang C, Wang H. Polyp-Mamba: A hybrid multi-frequency perception gated selection network for polyp segmentation. Inf Fusion. 2025;115:103161.
  4. Iqbal S, et al. TBConvL-Net: A hybrid deep learning architecture for robust medical image segmentation. Pattern Recognit. 2025;158:111147.
  5. Zhao Z, et al. Balanced feature fusion collaborative training for semi-supervised medical image segmentation. Pattern Recognit. 2025;157:110986.
  6. Zhou T, et al. MambaYOLACT: You only look at Mamba prediction head for head-neck lymph nodes. Artif Intell Rev. 2025;58(6).
  7. Zhao Y, et al. MGF-GCN: Multimodal interaction Mamba-aided graph convolutional fusion network for semantic segmentation of remote sensing images. Inf Fusion. 2025;122:103268.
  8. Ronneberger O, Fischer P, Brox T. U-Net: Convolutional networks for biomedical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2015.
  9. Zhou Z, Siddiquee MMR, Tajbakhsh N, Liang J. UNet++: Redesigning skip connections to exploit multiscale features in image segmentation. IEEE Trans Med Imaging. 2019;39(6):1856-1867.
  10. Shaker A, et al. UNETR++: Delving into efficient and accurate 3D medical image segmentation. IEEE Trans Med Imaging. 2024;43(9):3377-3390.
  11. Zhou HY, et al. nnFormer: Volumetric medical image segmentation via a 3D Transformer. IEEE Trans Image Process. 2023;32:4036-4045.
  12. He A, et al. H2Former: An efficient hierarchical hybrid Transformer for medical image segmentation. IEEE Trans Med Imaging. 2023;42(9):2763-2775.
  13. Zhu L, et al. Vision Mamba: Efficient visual representation learning with bidirectional state space model. In: Proceedings of the 41st International Conference on Machine Learning (ICML). 2024.
  14. Liu Y, et al. VMamba: Visual state space model. Adv Neural Inf Process Syst. 2024;37:103031-103063.
  15. Ma J, Li F, Wang B. U-Mamba: Enhancing long-range dependency for biomedical image segmentation. arXiv. 2024;arXiv:2401.04722.
  16. Wang Z, et al. Mamba-UNet: UNet-like pure visual Mamba for medical image segmentation. arXiv. 2024;arXiv:2402.05079.
  17. Huang T, et al. LocalMamba: Visual state space model with windowed selective scan. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  18. Zhang Z, et al. Motion Mamba: Efficient and long sequence motion generation. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  19. Hu VT, et al. Zigma: A DiT-style zigzag Mamba diffusion model. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  20. Rahman MM, et al. Mamba in vision: A comprehensive survey of techniques and applications. arXiv. 2024;arXiv:2410.03105.
  21. Falk T, et al. U-Net: Deep learning for cell counting, detection, and morphometry. Nat Methods. 2019;16(1):67-70.
  22. Gu R, et al. CA-Net: Comprehensive attention convolutional neural networks for explainable medical image segmentation. IEEE Trans Med Imaging. 2020;40(2):699-711.
  23. Chen J, et al. TransUNet: Rethinking the U-Net architecture design for medical image segmentation through the lens of Transformers. Med Image Anal. 2024;97:103280.
  24. Zhang Z, Zhang W. Pyramid medical Transformer for medical image segmentation. arXiv. 2021;arXiv:2104.14702.
  25. Cao H, et al. Swin-Unet: UNet-like pure Transformer for medical image segmentation. In: European Conference on Computer Vision (ECCV). Springer; 2022.
  26. Chen B, et al. TransAttUNet: Multi-level attention-guided U-Net with Transformer for medical image segmentation. IEEE Trans Emerg Top Comput Intell. 2023.
  27. Jiang S, Li J. TransCUNet: UNet cross-fused Transformer for medical image segmentation. Comput Biol Med. 2022;150:106207.
  28. Wu R, Liu Y, Liang P, Chang Q. H-vmunet: High-order Vision Mamba UNet for medical image segmentation. Neurocomputing. 2025;624:129447.
  29. Liu J, et al. Swin-UMamba: Adapting Mamba-based vision foundation models for medical image segmentation. IEEE Trans Med Imaging. 2024.
  30. Huang X, et al. MISSFormer: An effective Transformer for 2D medical image segmentation. IEEE Trans Med Imaging. 2023;42(5):1484-1494.
  31. Ruan J, et al. MALUNet: A multi-attention and lightweight U-Net for skin lesion segmentation. In: 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM). IEEE; 2022.
  32. Ruan J, Xiang S. VM-UNet: Vision Mamba UNet for medical image segmentation. arXiv. 2024;arXiv:2402.02491.
  33. Valanarasu JMJ, Patel VM. UNeXt: MLP-based rapid medical image segmentation network. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2022.
  34. Ren S, Li X. HResFormer: Hybrid residual Transformer for volumetric medical image segmentation. IEEE Trans Neural Netw Learn Syst. 2025;36(6):10558-10566.
  35. Karimijafarbigloo S, Azad R, Kazerouni A, Merhof D. MedScale-Former: Self-guided multiscale Transformer for medical image segmentation. Med Image Anal. 2025;103.
  36. Yan S, et al. Multi-scale convolutional attention frequency-enhanced Transformer network for medical image segmentation. Inf Fusion. 2025;119.
  37. Gao Y, Zhou M, Metaxas DN. UTNet: A hybrid Transformer architecture for medical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2021.
  38. Mei J, et al. SANet: A slice-aware network for pulmonary nodule detection. IEEE Trans Pattern Anal Mach Intell. 2021;44(8):4374-4387.
  39. Hu XZ, Jeon WS, Rhee SY. ATT-UNet: Pixel-wise staircase attention for weed and crop detection. In: 2023 International Conference on Fuzzy Theory and Its Applications (iFUZZY). IEEE; 2023.
  40. Wang X, et al. Transferable normalization: Towards improving transferability of deep neural networks. Adv Neural Inf Process Syst. 2019;32.
  41. Azad R, et al. TransDeepLab: Convolution-free Transformer-based DeepLabV3+ for medical image segmentation. In: International Workshop on Predictive Intelligence in Medicine (PRIME). Springer; 2022.
  42. Ruan J, Gao J, Xie M, Xiang S. Learning multi-axis representation in frequency domain for medical image segmentation. Mach Learn. 2025;114(1):10.
  43. Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press; Cambridge, MA; 2016.
  44. Milletari F, Navab N, Ahmadi SA. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. In: 2016 Fourth International Conference on 3D Vision (3DV). IEEE; 2016.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

234234SSMUNet

מאמרים קשורים