הרשמה ל-JoVE נדרשת לצפייה בתוכן זה. התחברו או התחילו בגרסת ניסיון בחינם.

מאמר מחקר

HMP-MUNet: מסגרת היברידית ללמידה עמוקה לחלוקה אוטומטית של נגעי עור בתמונות דרמוסקופיות

167 צפיות

DOI:

10.3791/69449

17 במרץ 2026

* These authors contributed equally

במאמר זה

סיכום

HMP-MUNet מציגה מסגרת היברידית ללמידה עמוקה לחלוקה אוטומטית של נגעי עור. על ידי שילוב מודלים של מצב ומרחב עם מנגנוני קשב רב-קנה מידה, הוא משפר את דיוק הסגמנטציה תוך אופטימיזציה של יעילות חישובית, ומציע פתרון חזק לאבחון סרטן העור בסביבות קליניות.

תקציר

מערכות אבחון ממוחשב לנגעים עוריים מתמודדות עם אתגרים משמעותיים בהשגת דיוק אבחוני גבוה ויעילות חישובית. גישות למידה עמוקה עכשוויות דורשות לעיתים משאבים חישוביים משמעותיים, תוך קושי ללכוד את השינויים המורכבים במורפולוגיה הטבועה בנגעים בעור בקני מידה שונים. מסדר גבוה רב-קנה מידה Parallel Vision Mamba U-Net (HMP-MUNet), מסגרת למידה עמוקה חדשנית המתמודדת עם מגבלות אלו באמצעות עיצוב ארכיטקטוני חדשני המשלב מודלים של State-Space עם יכולות עיבוד מתקדמות רב-קניות.

הגישה המתוארת במחקר זה משלבת מסגרת היברידית של U-Net המשלבת מודול מרחב מצבים מסדר גבוה למידול הקשר גלובלי, רשת מיזוג תשומת לב מורחבת רב-קנה מידה להפקת תכונות היררכית בשדות קליטה מרובים, ורשת גמישה מקבילה רב-עומקית לאופטימיזציה חישובית. ארכיטקטורה זו משתמשת במקודד-מפענח בצורת U מותאם עם ממדי ערוץ מוגברים ומנגנוני קשב מתקדמים לשיפור למידת התכונות.

הערכה מקיפה של מערכי המדדים מראה מקדם דמיון קוביות של 95.85% ב-PH2 ו-90.44% ב-ISIC2018. המודל משיג דיוק מעולה זה באמצעות פרמטרים של 7.61M בלבד, מה שמייצג ירידה מרשימה של 72.2% לעומת ארכיטקטורות Vision Mamba הקיימות, תוך שמירה על דיוק סגמנטציה גבוה. העיצוב הקל מראה פוטנציאל לפריסה במגוון סביבות קליניות ושיטות דימות, בכפוף לאימות קליני, ממרכזי דרמטולוגיה ייעודיים ועד למוסדות טיפול ראשוני.

HMP-MUNet מספקת פתרון אוטומטי לסגמנטציה של נגעי עור המשפר את עקביות האבחון ותומך בתהליכי עבודה קליניים, עם פוטנציאל לאימות נוסף בשימוש קליני. השילוב של יכולות מידול ברמה גבוהה עם שיקולי פריסה מעשיים מציע פתרון פוטנציאלי לשיפור פרוטוקולי סקר סרטן העור ולהרחבת הנגישות הרפואית ביישומי אבחון בעזרת מחשב.

מבוא

מערכות אבחון בעזרת מחשב (CAD) שואפות לשפר את שיטות ההדמיה הרפואית בין תחומי ההתמחות הקליניים, לשפר גישות לאיתור, אבחון ותכנון טיפול1. בדרמטולוגיה, שילוב של בינה מלאכותית (AI) וטכניקות דימות מתקדמות הפך לכלי קריטי לשיפור דיוק האבחון והתוצאות הקליניות, במיוחד בגילוי מוקדם של סרטן העור, שאחראי לכ-90% מכלל הממאירות. פיתוח גישות אלגוריתמיות מתוחכמות לניתוח נגעים עוריים אוטומטי תורם לקידום הרפואה המדויקת, ומאפשר תמיכה אבחנתית סטנדרטית וניתנת לשחזור המשפרת את קבלת ההחלטות הקליניות במגוון סביבות בריאות 3,4.

הדמיה דרמטולוגית מודרנית כוללת מגוון מודליות, כולל דרמוסקופיה, צילום דיגיטלי, טומוגרפיה קוהרנטית אופטיתומערכות דימות רב-ספקטרליות. אנשי מקצוע רפואיים משתמשים בתמונות דרמוסקופיות לאבחון ידני של סרטן העור באמצעות שיטות עבודה ארוכות וגוזלות זמן שדורשות מומחיות רבה6. האתגר בשמירה על עקביות אבחנתית בסביבות קליניות שונות ובמצבי הדמיה שונים הניע את פיתוח מערכות CAD המספקות ניתוח אובייקטיבי וכמותי של נגעים עוריים. סגמנטציה של נגעים עוריים מתמונות דרמוסקופיות מהווה שלב קדם-עיבוד יסודי שמשפיע ישירות על דיוק הסיווג והתועלת הקלינית7. באופן כללי, אבחון סרטן עור בעזרת מחשב כולל חמישה שלבים: רכישת תמונה, עיבוד מוקדם, סגמנטציה, חילוץ תכונות וסיווג8. הגדרת גבולות מדויקת חיונית לאפיון מדויק של נגעים, ומאפשרת לרופאים להעריך מאפיינים מורפולוגיים כגון אסימטריה, אי-סדירות בגבולות, שונות בצבע וקוטר — פרמטרים מרכזיים בקריטריונים האבחנתייםשנקבעו 9.

הופעת מודלי מצב-מרחב (SSMs), במיוחד ארכיטקטורת ממבה, מציעה מורכבות חישובית ליניארית, המשפרת את היעילות החישובית תוך שמירה על יכולות מידול תלות לטווח ארוך עדיפות10. התקדמויות אחרונות בסגמנטציה של נגעי עור11, כגון U-Net9, Att-UNet12, UTNetV213 ו-UNet++14 , הראו שיפורים משמעותיים בדיוק הסגמנטציה. לדוגמה, U-Net משיג מקדם דמיון קוביות (DSC) של 87.55% במאגר הנתונים ISIC2018, בעוד UNet++ מגיע ל-87.83%, ו-Att-UNet מגיע ל-87.91%. במאגר הנתונים PH2, U-Net מגיע ל-DSC של 90.6%, בעוד ש-C2SDG15 ו-SCR-Net16מגיעים ל-90.3% ו-89.89%, בהתאמה. HMP-MUNet משפרת את המודלים הללו על ידי שילוב מנגנון קשב רב-קנה מידה ויכולות עיבוד מקביל, הפחתת מספר הפרמטרים ב-72.2% תוך השגת דיוק מעולה עם DSC של 95.85% במערך הנתונים PH2 ו-90.44% במערך הנתונים ISIC2018. בהתחשב בחשיבות האיזון בין יכולות הלמידה של ייצוג חזותי לצריכת משאבי מחשוב, חקר ארכיטקטורות סיווג תמונות רפואיות גנריות שמשיגות פשרות אופטימליות הוא משמעותי לפיתוח מערכות אבחון קליני חכם17. מסגרת ה-SSM המרחבית המובנית משפרת את הארכיטקטורות המסורתיות של ממבה על ידי אופטימיזציה של מטריצות מעבר מצבים, שיפור יעילות חישובית והפחתת עומס זיכרון—מאפיינים חיוניים לפריסה קלינית במגוון מודאליות הדמיה18.

מחקרים עדכניים מראים כי ארכיטקטורות Vision Mamba, במיוחד אלו המשתמשות בתכנית החלפה מבוססת Vision Mamba מסדר גבוה (H-VSS), משיגות ביצועים מעולים עם מספר פרמטרים מופחת משמעותית לעומת שנאים קונבנציונליים, מה שהופך אותן למתאימות במיוחד לאינטגרציה קלינית של זרימת עבודה19. עם זאת, יישומי Vision Mamba קיימים מתמודדים עם אתגרים, כולל מגבלות צריכת זיכרון ומגבלות הרחבה בתנאי פריסה קלינית20. שיטות סגמנטציה של תמונות רפואיות כיום מחולקות בדרך כלל ל-CNN ומודלים מבוססי שנאי, כאשר CNNים מסורתיים מוגבלים על ידי מגבלות שדה קליטה, מה שהופך את לכידת תלות לטווח ארוך למאתגרת21. בהדמיה רפואית, הבחנה בין אזורים קריטיים כמו נגעים לעור בריא דורשת דיוק גבוה, מה שמחייב אימוץ פתרונות טכנולוגיים מתקדמים להתמודדותעם אתגרים אלו. ארכיטקטורות סגמנטציה עכשוויות התפתחו כדי לענות על דרישות קליניות ספציפיות, כולל יעילות חישובית ליישומים בזמן אמת, דיוק במשימות אבחון קריטיות, ועמידות בפרוטוקולי דימות מגוונים23. וריאנטים מתקדמים של U-Net הכוללים מנגנוני קשב, אסטרטגיות מיזוג תכונות רב-קנה מידה ומקודדים מבוססי שנאים הראו ביצועים מעולים בתרחישי הדמיה רפואית מורכבים12,24. חידושים ארכיטקטוניים אלו משפרים ישירות יישומים קליניים על ידי אפשרות להגדרה מדויקת של מבנים אנטומיים, זיהוי אזורים פתולוגיים וחילוץ סמנים ביולוגיים כמותיים, כולם חיוניים לרפואה מבוססת ראיות25,26. עם זאת, אתגרי האינטגרציה, כולל תאימות ממשק עם רשומות רפואיות אלקטרוניות קיימות (EMR), אחסון ושליפה של תמונות גדולות, ותאימות בין מערכות מוסדיות שונות, ממשיכים להוות מכשולים משמעותיים לאימוץ קליני נרחב27.

מאמר זה מציג את מערכת הראייה המקבילה Mamba U-Net (HMP-MUNet), מערכת CAD חדשנית שנועדה במיוחד לסגמנטציה אוטומטית של נגעים עוריים בפרקטיקה קלינית. המסגרת כאן מתמודדת עם פערים קריטיים במערכות דימות רפואיות קיימות על ידי שילוב רכיבים אדריכליים חדשניים: רשת מיזוג תשומת לב מורחבת בקנה מידה רב-קנה מידה (MSDAFN) ורשת גמישה מקבילית רב-עומק (PMFlex). ה-MSDAFN מיישם אסטרטגיות חלוקת תכונות מתקדמות המשלבות מנגנוני קשב מרחבי וערוצים עם קונבולוציות מורחבות רב-קניות, ומאפשרות זיהוי משופר של תכונות נגע עדינות בקני מידה שונים—חיוני לאבחון מדויק של סוגי נגעים מגוונים הנפגשים בפרקטיקה קלינית28. ה-PMFlex מציג יכולות עיבוד מקביליות המאפשרות ניתוח סימולטני של מספר זרמי קלט, המשפרים משמעותית את היעילות החישובית תוך שמירה על יכולות מידול ברמה גבוהה החיוניות לדיוק קליניברמה 29. HMP-MUNet, באמצעות טכניקות סגמנטציה חדשניות ואסטרטגיות חישוביות, שואפת לדחוף את גבולות האבחון של סרטן העור, ולאפשר אבחון קליני בזמן אמת ומדויק30,31.

התרומות העיקריות של מחקר זה מתיישבות עם המטרות המרכזיות של קידום CAD בהדמיה רפואית: שיפור מודל הקשר גלובלי באמצעות MSDAFN שיפור יעילות חילוץ תכונות ומיזוג למיקום מדויק של נגעים במגוון מצגות קליניות; עיבוד מקביל יעיל באמצעות PMFlex שמפחית עומס חישובי תוך שמירה על דיוק קליני, ומקל על פריסה בסביבות קליניות מוגבלות משאבים; אופטימיזציה קלינית באמצעות עיצוב מודע לחומרה, המאפשרת עיבוד יעיל של תמונות דרמוסקופיות ברזולוציה גבוהה התומכת בתהליכי עבודה קליניים בזמן אמת; ביצועים קליניים שהודגמו באמצעות הערכה מקיפה של מערכי נתונים סטנדרטיים עם מדדי ביצועים המתאימים לשילוב קליני; ופתרון אבחוני משולב המשלב מידול מסדר גבוה, ניתוח רב-קנה מידה וחישוב מקבילי המספק פתרונות מקיפים לאבחון דרמטולוגי מדויק. מחקר זה מקדם הדמיה רפואית ממוחשבת על ידי מתן פתרונות חדשניים ויישומיים קלינית, המתמודדים עם דרישות טכנולוגיות ומעשיות לניתוח נגעים עוריים אוטומטי בסביבות בריאות מודרניות.

המסגרת מיועדת להתמודד עם תמונות דרמוסקופיות ברזולוציה גבוהה, בדרך כלל ברזולוציות קלט של 256 × 256, ומספקת איזון בין יעילות חישובית לפרטי תמונה. עם זאת, שונות בציוד ובאיכות התמונה, כמו הבדלים בתאורה, גוון עור ונוכחות שיער, יכולה להשפיע על ביצועי הסגמנטציה. למרות האתגרים הללו, עיצוב המערכת מותאם לתהליכי עבודה קליניים בזמן אמת וניתן להתאמה למכשירי הדמיה שונים, מה שמבטיח ביצועים עמידים בסביבות קליניות מגוונות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

מחקר זה בוצע בהתאם להנחיות מוסדיות למחקר חישובי ועיבוד נתונים. לא היו מעורבים במחקר זה נבדקים אנושיים או בעלי חוליות.

הכנת מערך נתונים ועיבוד מוקדם

איסוף וארגון מערכי נתונים

תמונות דרמוסקופיות נאספו ממאגרי הנתונים של PH2, ISIC2018 ו-ISIC2017, עם קישורים ספציפיים שסופקו בטבלת החומרים. מאגר הנתונים של PH2 מכיל 200 תמונות ברזולוציה גבוהה (1000 × 1000 פיקסלים), ISIC2018 כולל 2,594 תמונות עם מסכות סגמנטציה מתאימות, ו-ISIC2017 כולל 2,150 תמונות עם מסכות סגמנטציה. הנתונים אורגנו למערכות אימון, אימות ובדיקות לפי פרוטוקולים סטנדרטיים, תוך הבטחת שהתמונות יהיו בפורמטים תואמים (כגון .jpg, .png או .tiff) וכוללות מסכות אמת קרקעיות מתאימות בפורמט בינארי.

הנתונים אורגנו למערכות אימון, אימות ובדיקות בהתאם לפרוטוקולים סטנדרטיים. מערכי הנתונים חולקו כך: עבור ISIC2018 הוקצו 1,815 תמונות לאימון, 259 לאימות ו-520 לבדיקות. עבור ISIC2017 הוקצו 1,500 תמונות לאימון, 220 לאימות ו-430 לבדיקה. עבור PH2, מערך הנתונים חולק ל-160 תמונות אימון, 10 תמונות אימות ו-30 תמונות בדיקה. רזולוציית תמונה עקבית של 256 × 256 פיקסלים נשמרה לאורך כל צינור העיבוד המוקדם.

הגדלת נתונים ונרמול

טכניקות הגדלת נתונים יושמו לשיפור הכללת המודלים. הוטמעו היפוך אופקי, היפוך אנכי וסיבוב אקראי בטווח של ±15°. תיקון גמא וטרנספורמציה לוגריתמית יושמו בהסתברות של 0.3 כל אחד. ערכי הפיקסלים ננורמו באמצעות סטטיסטיקות ImageNet (ממוצע = [0.485, 0.456, 0.406], סטיית תקן = [0.229, 0.224, 0.225]).

שינוי גודל כל תמונות הקלט ל-256 × 256 פיקסלים: כדי להבטיח יעילות חישובית, כל תמונות הקלט שונו לרזולוציה אחידה של 256 × 256 פיקסלים. בעוד שתמונות ברזולוציה גבוהה, כמו אלו שבמאגר הנתונים (1000 × 1000 פיקסלים), מכילות פרטים דקים ומידע טקסטורה החיוניים לזיהוי מדויק של גבולות הנגעים, הגדלת הרזולוציה לא שיפרה משמעותית את ביצועי המודל. לכן, הרזולוציה לא הוגדלה כדי לשמור על איזון בין יעילות חישובית לדיוק המודל. עבודות עתידיות עשויות לחקור לעומק את השפעות הקלטים ברזולוציה גבוהה יותר כדי לקבוע האם היתרונות בדיוק הסגמנטציה מצדיקים את עלויות החישוב המוגברות. תמונות הומרו לפורמט RGB בעת הצורך. הנתונים המעובדים מראש נשמרו בתיקיות מובנות תוך שמירה על חלוקות מערך הנתונים המקוריים.

מימוש ארכיטקטורת HMP-MUNet

עיצוב ארכיטקטורת רשת

HMP-MUNet הוגדר לפי מבנה המקודד-מפענח ההיררכי בצורת U כפי שמוצג באיור 1. הרשת הוגדרה עם הרחבה פרוגרסיבית של ערוצים: 8→16→32→64→128→256 ערוצים ברמות המקודד.

שינוי אדריכלי משמעותי בוצע על ידי הפחתת עומק הרשת מארבע רמות היררכיות לשניים, מה שמסייע לפשט את המודל ולשפר את היעילות החישובית. למרות שהעומק מצטמצם, ממדי הערוץ הוגדלו בכל רמה, מה שאפשר לרשת ללכוד תכונות עשירות וביטוי יותר. כדי לשפר עוד יותר את למידת התכונות של המודל, הוכנסו מנגנוני קשב כדי למקד את הרשת בתכונות הרלוונטיות ביותר בקני מידה שונים. מנגנוני תשומת הלב הללו מפצים ביעילות על אובדן פוטנציאלי של הפשטת תכונות היררכיות עקב הארכיטקטורה הרדודה יותר.

המקודד אותחל עם פעולות Conv2D כפולות לצורך חילוץ תכונות התחלתי מטנזורי קלט X(C, H×W). התצורה החלופית של שלושה מודולים מיוחדים יושמה: תכנית החלפה מבוססת Vision Mamba מסדר גבוה (H-VSS), רשת גמישה מקבילה רב-עומק (PMFlex), ורשת מיזוג תשומת לב מורחבת בקנה מידה רב-קנה מידה (MSDAFN).

המודל משתמש בסטטיסטיקות של ImageNet (ממוצע וסטיית תקן) לנרמל, ומונע את הצורך בחישוב מחדש עבור כל מערך נתונים, ובכך משפר את היעילות החישובית. היא מבטיחה יציבות והכללה, תוך ניצול השימוש הנרחב של ImageNet במשימות ראייה ממוחשבת. בחירה זו מפשטת את העיצוב על ידי הפחתת מורכבות העיבוד המוקדם ומשפרת את ההעברה בין מערכי נתונים, ומאפשרת למודל להכליל ביעילות על פני תמונות נגעי עור מגוונות.

מימוש תכנית החלפה מבוססת ממבה בראייה גבוהה (H-VSS)                

מודול H-VSS יושם בהתאם לארכיטקטורה באיור 2. נרמול שכבה (LN) והפעלת Hardswish (HS) הוגדרו עם חיבורים שאריתיים לפי משוואה (1):

figure-protocol-1

רכיב התיאור המרחבי המקומי (LSD) יושם כדי לשמור על קוהרנטיות מרחבית. מודול הסריקה המרחבית הסלקטיבית הדו-ממדית (SS2D) הוגדר עם דפוסי סריקה רב-כיווניים בהתאם למשוואה (2):

figure-protocol-2

עיבוד Perceptron רב-שכבתי (MLP) נוסף עם חיבורים שאריתיים כפי שמפורט במשוואה (3):

figure-protocol-3

מנגנון הסריקה הסלקטיבית הדו-ממדית מסדר גבוה (H-SS2D) מקרין תכונות קלט למרחב דו-ממדי לשיפור המידול ההקשרי.

מימוש רשת גמישה רב-עומקית מקבילית (PMFlex)

מודול PMFlex הוגדר לפי מפרטי איור 3 . נורמליזציה של שכבה יושמה על מפות תכונות קלט X(C, H×W), ואז חולקה לארבעה מקטעים לאורך ממד הערוץ לפי משוואה (4):

figure-protocol-4

כל Y_i פיצ'ר מחולק עובד דרך מודולי Visual Mamba (VMamba) משותפים. פלטים מעובדים היו מחוברים, ושיפור יושם באמצעות נרמול שכבה והקרנה כפי שמתואר במשוואה (5):

figure-protocol-5

מימוש רשת מיזוג תשומת לב מורחבת (MSDAFN) בקנה מידה רב-קנה מידה

מודול MSDAFN יושם לפי ארכיטקטורת איור 4. פעולות קונבולוציה מקבילות הוגדרו עם קצבי התרחבות של 6, 12 ו-18 להפקת תכונות רב-קנה מידה לפי משוואה (6):

figure-protocol-6

תכונות רב-קנה מידה שולבו באמצעות שרשור ערוצים כפי שמצוין במשוואה (7):

figure-protocol-7

הוטמעו מנגנוני קשב כפול לכיול מחדש של תכונות. משקלי תשומת הלב בערוץ חושבו באמצעות איגוד ממוצע גלובלי לפי המשוואה (8):

figure-protocol-8

משקל קשב בערוץ יושם כפי שמתואר במשוואה (9):

figure-protocol-9

תשומת לב מרחבית הוגדרה באמצעות פעולות קונבולוציה לפי משוואה (10):

figure-protocol-10

ערוץ ותשומת לב מרחבית שולבו כפי שמצוין במשוואה (11):

figure-protocol-11

תצורת אימון ואופטימיזציה

הגדרת הסביבה

הסביבה הניסיונית הוגדרה על מערכת Ubuntu 20.04 עם GPU (32 GB VRAM). Python 3.8, מסגרת למידה עמוקה (RRID: SCR_018536) ו-CUDA 11.8 הותקנו. גודל התמונה הנכנס הוגדר ל-256 × 256 פיקסלים למשימות נגע בעור.

פונקציית אובדן ותצורת אופטימייזר

פונקציית הפסד BceDice יושמה לאופטימיזציה של אימונים. אופטימייזר AdamW הוגדר עם קצב למידה התחלתי של 0.001, גודל אצווה של 8, ו-250 תקופת אימון. ירידה במשקל של 1 × 10⁻5 יושמה לרגולריזציה.

לגבי תצורת קו הבסיס, מחקר זה מתייחס לעבודה של ליו ואח' (2024) על מודל Vmamba, ששימש כמודל מרחב מצבים חזותי למשימת סיווג התמונההרפואית 11. התצורות והסקריפטים המדויקים ששימשו ליישום Vmamba מבוססים על עבודתם שפורסמה ומותאמים למחקר זה, עם התאמות ספציפיות שיתאימו יותר למאגר הנתונים של התמונה הרפואית.

תזמון קצב למידה הוקם באמצעות אנילינג קוסינוס עם הפעלה מחדש חמה. הגדר T_0 = 10 אפוקים לתקופת התחלה התחלתית, T_mult = 2 לכפל תקופות, ו-η_min = 1 × 10⁻6 לקצב למידה מינימלי.

אופטימיזציה של היפרפרמטרים

כדי להבטיח שחזוריות ועקביות, כל הניסויים בוצעו באמצעות זרע אקראי קבוע של 42. האופטימיזציה השיטתית של ההיפרמטר בוצעה תוך התמקדות בגודל האצווה, קצב הלמידה וקצב מסלול הנפילה. גדלי אצווה של 4, 8, 16 ו-32 הוערכו. שיעורי הלמידה של 0.0005, 0.001, 0.0015 ו-0.002 נבדקו. ביצועי האימות נבדקו באמצעות מקדם דמיון קוביות (DSC) כמדד הראשי. גדלי אצווה גדולים מ-8 עלולים לגרום לעודף זיכרון ב-GPU עם פחות מ-32GB VRAM.

הערכת מודלים והערכת ביצועים

תצורת מדדי הערכה

מדדי הערכה מקיפים, כולל חיתוך ממוצע מעל איחוד (mIoU), מקדם דמיון לקוביות (DSC), רגישות (Sen), ספציפיות (Spe) ודיוק (Acc), יושמו. המדדים חושבו לפי הניסוחים הבאים:

חיתוך ממוצע מעל איחוד (mIoU) מכמת חפיפה בין סגמנטציה חזויה לאמת קרקעית:

figure-protocol-12

מקדם דמיון קוביות (DSC) מודד עקביות של סגמנטציה. הערכים נעים בין 0 ל-1, כאשר ערכים גבוהים יותר מצביעים על ביצועים טובים יותר:

figure-protocol-13

רגישות (Sen) מודדת את יכולת המודל לזהות דגימות חיוביות:

figure-protocol-14

ספציפיות S(Spe) מעריכה זיהוי דגימה שלילי נכון:

figure-protocol-15

דיוק (Acc) מודד את נכונות החיזוי הכוללת:

figure-protocol-16

פרמטרים (M) משקפים את מורכבות המודל, ומודדים את סך הפרמטרים הניתנים לאימון הרגילים:

figure-protocol-17

כאשר Pi הוא מספר הפרמטרים בשכבת i, ו-N הוא המספר הכולל של השכבות. ספירת פרמטרים קטנה יותר מצביעה על מודלים קלים יותר המתאימים לפריסה קלינית.

פרוטוקול מחקר אבלציה

נערכו מחקרים מקיפים של אבלציה כדי לאמת את תרומת רכיבי האדריכלות בעקבות תכנון הניסוי בטבלה 1. הוערכו ארבעה וריאנטים אדריכליים: H-MUNet (בסיס ללא MSDAFN ו-PMFlex), HP-MUNet (ללא MSDAFN), HM-MUNet (ללא PMFlex), ו-HMP-MUNet (מודל מלא).

פרמטרי אימון זהים הוגדרו בכל הגרסאות: קצב למידה 0.001, גודל אצווה 8, 250 אפוקים. התכנסות האימון נעקבה, ושיפורי ביצועים אומתו בכל תוספת רכיב.

ניתוח יעילות חישובית

מדדי היעילות החישובית, כולל מספר פרמטרים, FLOPs וזמן הסקה בין ארכיטקטורות שונות, נמדדו. הערכת זמן ההסקה של המודל על GPU קליני סטנדרטי מראה שלמרות שהוא מתפקד הכי טוב על GPU בעלי ביצועים גבוהים, המודל איטי בכ-70% על חומרה נפוצה יותר. עם זאת, הוא עדיין מסוגל למהירויות הסקה יעילות, מה שהופך אותו למתאים לפריסה קלינית מעשית. מעקב אחרי שימוש בזיכרון GPU במהלך האימון כדי להבטיח יציבות מערכת. מומלץ למינימום זיכרון GPU של 16GB לגודל אצווה 8.

אימות וניתוח

בנצ'מרקינג ביצועים

ביצועי HMP-MUNet הושוו לשיטות מתקדמות בשני מערכי הנתונים. כל המודלים המושווים יושמו ואומנו תחת אותם חלוקות נתונים, עיבוד מוקדם, הגדלת נתונים ופרוטוקולי הדרכה, כדי להבטיח שהבדלי ביצועים נובעים אך ורק מהבדלים ארכיטקטוניים. התוצאות הכמותיות, כולל שיפורים ב-DSC של 2.89% ו-5.25% במאגרי הנתונים ISIC2018 ו-PH2, תועדו בהתאמה. המחקר אימת כי מספר הפרמטרים מופחת פי 4.55 בהשוואה לקו הבסיס של U-Net.

ניתוח סטטיסטי

בדיקות מובהקות סטטיסטיות בוצעו באמצעות מבחני t זוגיים להשוואת ביצועים. מרווחי ביטחון חושבו עבור המדדים המדווחים. שחזוריות הובטחה באמצעות ריצות אימון מרובות עם זרעים אקראיים שונים.

תצורות ההיפרמטר האופטימליות נרשמו כגודל אצווה 8 וקצב למידה 0.001, והשיגו DSC שיא של 0.9585 במאגר הנתונים PH2 ו-0.9044 במאגר הנתונים ISIC2018, כפי שתועד בתוצאות הניסוי. הובטחו נתוני אימות מספקים למניעת התאמת יתר. עקומות אובדן האימות נבדקו כדי להחיל קריטריונים להפסקה מוקדמת.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

עיצוב ארכיטקטורת HMP-MUNet לסגמנטציה של תמונות רפואיות

ארכיטקטורת HMP-MUNet המוצעת הראתה ביצועים יוצאי דופן במשימות חלוקת פצעים עוריים אוטומטיות. איור 1 ממחיש את ארכיטקטורת הרשת המלאה, ומציג את מבנה המקודד-מפענח ההיררכי בצורת U עם התרחבות הדרגתית של ערוצים מ-8 ל-256 ערוצים. האינטגרציה של שלושה מודולים מיוחדים בתצורה מתחלפת הוכיחה את עצמה כיעילה מאוד ללכידת תכונות מורפולוגיות מקומיות ומידע קונטקסטואלי גלובלי, החיונ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

מחקר זה מציג את HMP-MUNet (High-Scale Multi-scale Parallel Vision Mamba U-Net), מסגרת למידה עמוקה חדשנית המתמודדת עם אתגרים יסודיים באבחון בעזרת מחשב (CAD) לחלוקת פצעים עוריים באמצעות שילוב חדשני של מודלים של מצב ומרחב (SSMs) עם רכיבים אדריכליים מתקדמים1. הגישה המתוארת כאן מראה ששילוב של מנגנוני אינטראקציה בין תכונות מסדר גבוה עם תשומת לב רב-קנה מידה ועיבוד מקבילי יכול להשיג דיוק אבחוני מעולה תוך הפחתה משמעותית של עומס חישובי — דרישה קריטית לפריסה קלינית. המסגרת ה...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

המחברים מצהירים כי אין להם ניגודי עניינים הקשורים למחקר זה. אין קשרים פיננסיים בין המחברים לבין ישויות מסחריות שעלולות להשפיע באופן בלתי הולם על היצירה המוצגת בכתב היד. המחקר הזה נערך באופן עצמאי, והממצאים והמסקנות הם של המחברים בלבד. הטקסט של כתב היד עבר תיקון וליטוש בעזרת ChatGPT, שכן אנגלית אינה שפת האם של המחבר. המחברים מאשרים כי השימוש בסיוע בינה מלאכותית הוגבל לעריכת שפה בלבד ולא כלל יצירת תוכן או ניתוח שיפגעו ביושרה המדעית של העבודה.

תודות

המחברים מודים בהכרת תודה על התמיכה הכספית שסיפקה פרויקט המחקר המדעי של משרד החינוך של מחוז ליאונינג במסגרת מענק LJ212510149013 ותוכנית כללית של הקרן הלאומית למדעי הטבע של מחוז ליאונינג 2024-MSLH-377, שאפשרה מחקר זה לאפשרי. אנו מודים למשתתפי המחקר ולמוסדות שתרמו למאגרי הנתונים הזמינים לציבור ששימשו במחקר זה, שאפשרו אימות מקיף של המתודולוגיה המוצעת שלנו.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
CUDA 11.8חברת NVIDIA, סנטה קלרה, קליפורניה, ארה"בתוכנה
GPU (32GB VRAM)NVIDIAמערכת הפעלה
מאגר נתונים ISIC2017אתגר ISIChttps://challenge.isic-archive.com/dataמאגרי נתונים
מערך הנתונים ISIC2018אתגר ISIChttps://challenge.isic-archive.com/dataמאגרי נתונים
כרטיס מסך NVIDIA V100חברת NVIDIA, סנטה קלרה, קליפורניה, ארה"בחומרה
מערך הנתונים של PH2אוניברסיטת פורטוhttps://www.fc.up.pt/addi/ph2מאגרי נתונים
פייתון 3.8פייתוןRRID:SCR_018536תוכנה
PyTorch 1.13.0פייטורץ'RRID:SCR_018536תוכנה
אובונטו 20.04קנוניחומרה

מקורות

  1. Maurya, S., et al. A review on recent developments in cancer detection using machine learning and deep learning models. Biomed Signal Process Control. 80 (2), 104398(2023).
  2. Siegel, R. L., Miller, K. D., Wagle, N. S., Jemal, A. Cancer statistics, 2023. CA Cancer J Clin. 73 (1), 17-48 (2023).
  3. Esteva, A., et al. Dermatologist-level classification of skin cancer with deep neural networks. Nature. 542 (7639), 115-118 (2017).
  4. Haenssle, H. A., et al. against machine: diagnostic performance of a deep learning convolutional neural network for dermoscopic melanoma recognition in comparison to 58 dermatologists. Ann Oncol. 29 (8), 1836-1842 (2018).
  5. Argenziano, G., et al. Dermoscopy of pigmented skin lesions: results of a consensus meeting via the Internet. J Am Acad Dermatol. 48 (5), 679-693 (2003).
  6. Naeem, A., et al. SNC_Net: skin cancer detection by integrating handcrafted and deep learning-based features using dermoscopy images. Mathematics. 12 (7), 1030(2024).
  7. Celebi, M. E., et al. A state-of-the-art survey on lesion border detection in dermoscopy images. Dermoscopy Image Anal. 10, 97-129 (2015).
  8. Nachbar, F., et al. The ABCD rule of dermatoscopy: high prospective value in the diagnosis of doubtful melanocytic skin lesions. J Am Acad Dermatol. 30 (4), 551-559 (1994).
  9. Ronneberger, O., Fischer, P., Brox, T. U-net: convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  10. Gu, A., Dao, T. Mamba:linear-time sequence modeling with selective state spaces. arXiv. , (2023).
  11. Liu, Y., et al. Vmamba: visual state space model. Adv Neural Inf Process Syst. 37, 103031-103063 (2024).
  12. Zhang, J., Zhu, H., Wang, P., Ling, X. ATT squeeze U-net: a lightweight network for forest fire detection and recognition. IEEE Access. 9, 10858-10870 (2021).
  13. U-net v2: rethinking the skip connections of U-net for medical image segmentation. Peng, Y., Chen, D. Z., Sonka, M. 2025 IEEE 22nd International Symposium on Biomedical Imaging (ISBI), Houston, TX, USA, , (2025).
  14. Zhou, Z., et al. UNet++: a nested U-net architecture for medical image segmentation. Deep Learn Med Image Anal Multimodal Learn Clin Decis Support (2018). 11045, 3-11 (2018).
  15. Hu, S., Liao, Z., Xia, Y. Devil is in channels: contrastive single domain generalization for medical image segmentation. Medical Image Computing and Computer Assisted Intervention – MICCAI 2023. , Springer. Cham. (2023).
  16. Xu, W., Wang, Z. SCRNet:spatial-channel regulation network for medical ultrasound image segmentation. arXiv. arXiv. , (2025).
  17. Yue, Y., Li, Z. MedMamba: vision mamba for medical image classification. arXiv. , (2024).
  18. Efficiently modeling long sequences with structured state spaces. Gu, A., Goel, K., Ré, C. Proc Int Conf Mach Learn, 162, 8098-8109 (2022).
  19. Wu, R., Liu, Y., Liang, P., Chang, Q. UltraLight VM-UNet: parallel vision mamba significantly reduces parameters for skin lesion segmentation. arXiv. , (2024).
  20. Wu, R., Liu, Y., Liang, P., Chang, Q. H-vmunet:high-order vision mamba unet for medical image segmentation. Neurocomput. 624, 129447(2025).
  21. Fully convolutional networks for semantic segmentation. Long, J., Shelhamer, E., Darrell, T. 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Boston, MA, USA, , (2015).
  22. Chen, J., et al. TransUNet: transformers make strong encoders for medical image segmentation. arXiv. , (2021).
  23. Cao, H., et al. Swin-unet:unet-like pure transformer for medical image segmentation. Lect Notes Comput Sci. 13803, 205-218 (2023).
  24. Ibtehaz, N., Rahman, M. S. MultiResUNet: rethinking the U-net architecture for multimodal biomedical image segmentation. Neural Netw. 121, 74-87 (2020).
  25. Aruk, I., Pacal, I., Toprak, A. N. A novel hybrid ConvNeXt-based approach for enhanced skin lesion classification. Expert Syst Appl. 283, 127721(2025).
  26. Pacal, I., et al. A novel CNN-ViT-based deep learning model for early skin cancer diagnosis. Biomed Signal Process Control. 104, 107627(2025).
  27. Zhang, D. Y., et al. Implementation of digital pathology and artificial intelligence in routine pathology practice. Lab Invest. 104 (9), 102111(2024).
  28. Malunet: a multi-attention and lightweight unet for skin lesion segmentation. Ruan, J., Xiang, S., Xie, M., Liu, T., Fu, Y. 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM), Las Vegas, NV, USA, , (2022).
  29. Wu, R., et al. Mhorunet:high-order spatial interaction unet for skin lesion segmentation. Biomed Signal Process Control. 88, 105517(2024).
  30. Pacal, I., Attallah, O. Hybrid deep learning model for automated colorectal cancer detection using local and global feature extraction. Knowl Based Syst. 319, 113625(2025).
  31. Pacal, I., Attallah, O. InceptionNeXt-transformer: a novel multi-scale deep feature learning architecture for multimodal breast cancer diagnosis. Biomed Signal Process Control. 110, 108116(2025).
  32. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  33. Phillips, M., et al. Assessment of accuracy of an artificial intelligence algorithm to detect melanoma in images of skin lesions. JAMA Netw Open. 2 (10), e1913436(2019).
  34. Wang, S., et al. Linformer:self-attention with linear complexity. arXiv. , (2020).
  35. A simple framework for contrastive learning of visual representations. Chen, T., et al. Proceedings of the 37th International Conference on Machine Learning, 119, Vienna, Austria. 1597-1607 (2020).
  36. Huang, S. C., et al. Fusion of medical imaging and electronic health records using deep learning: a systematic review and implementation guidelines. NPJ Digit Med. 3, 136(2020).
  37. Litjens, G., et al. A survey on deep learning in medical image analysis. Med Image Anal. 42, 60-88 (2017).
  38. Campanella, G., et al. Clinical-grade computational pathology using weakly supervised deep learning on whole slide images. Nat Med. 25 (8), 1301-1309 (2019).
  39. Gulshan, V., et al. Development and validation of a deep learning algorithm for detection of diabetic retinopathy in retinal fundus photographs. JAMA. 316 (22), 2402-2410 (2016).
  40. McKinney, S. M., et al. International evaluation of an AI system for breast cancer screening. Nat. 577 (7788), 89-94 (2020).
  41. Krizhevsky, A., Sutskever, I., Hinton, G. E. ImageNet classification with deep convolutional neural networks. Commun ACM. 60 (6), 84-90 (2017).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

תגיות

U NetkomputerVision Mamba