מאמר שיטה

MixKNet: רשת בצורת U שונה עם פיתול ערוצים היברידי לפילוח תמונה רפואית

DOI:

10.3791/68450

15 ביולי 2025

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה מציג גרסת U-Net קלת משקל עם דיוק סגמנטציה משופר באמצעות קונבולוציה היברידית ותשומת לב ערוצית, ומשיג תוצאות חדישות ב-MoNuseg ו-GlaS עם פחות פרמטרים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

טכנולוגיית עיבוד תמונה ממוחשבת מבוססת רשת עצבית מלאכותית התפתחה במהירות בשנים האחרונות ומצאה יישומים נרחבים בתחומים מרובים. בעיבוד תמונה רפואית, UNet והגרסאות שלו הראו הצלחה רבה במשימות זיהוי נגעים, פילוח תאים ופילוח פוליפים. מחקר זה מציג רשת בצורת U שונה עם פרמטרי רשת מופחתים המושגים על ידי הקטנת עומק הרשת והגדלת ערוצי הרשת כדי לשפר את יכולת הלמידה של המודל. כדי לנטרל את הירידה ביכולת הלמידה הנגרמת מדחיסת עומק, מוצג מודול קונבולוציוני של ערוץ היברידי שיחליף את מודול הקונבולוציה של הרשת המקורית. המודל מציג מנגנון תשומת לב ערוץ בין השכבה לשכבת הפיתול הנקודתית כדי לשפר את יכולת חילוץ תכונת הערוץ המעשית. המאמר גם מסכם כי שימוש בקונבולוציה בעומק מעורב יכול לפתור ביעילות את טווח הגודל של יעד הפילוח, מה שמקשה על מודל אחד להתאים למספר מערכי נתונים. המודל המוצע משיג תוצאות חדישות בשני מערכי נתונים ציבוריים פופולריים, MoNuseg ו-GlaS, עם עלייה ממוצעת בקוביות של 1.0% ו-1.37%, בהתאמה. סך הפרמטרים של הדגם השונה מצטמצם ל-1.71M, המייצג הפחתה של פי 38.6 בהשוואה ל-UCtransNet, עם 65.6 מיליון פרמטרים.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פילוח תמונות רפואיות הוא קריטי ביישומים קליניים שונים, כולל אבחון, תכנון טיפול וניטור מחלות. שיטות עיבוד תמונה מסורתיות המבוססות על אלגוריתמים של הנדסת תכונות אינן מתאימות עוד לטיפול בכמויות הגדולות של נתונים שנוצרו בסביבות בריאות מודרניות. למרבה המזל, התקדמות טכנולוגיית הרשת העצבית המלאכותית והשיפורים ביכולות חומרת המחשב אפשרו לאמן ולפרוס מודלים של רשתות עצביות בקנה מידה גדול. כתוצאה מכך, אלגוריתמים לעיבוד ראייה ממוחשבת המבוססים על מודלים של למידת מכונה מפותחים ומיושמים ללא הרף בתחומים שונים.

מבנה המודל המייצג ביותר בפילוח סמנטי של תמונות רפואיות הוא UNet1 עם ארכיטקטורת קידוד-פענוח. המודל משתמש תחילה במקודד רב-מפלסי כדי לחלץ תכונות בקנה מידה שונה מתמונת הקלט. לאחר מכן, המפענח דוגם צעד אחר צעד תוך שילוב התכונות הסמנטיות המוצאות על ידי המקודד של הרמה המתאימה כחיבור דילוג. עם זאת, ניתן לשפר עוד יותר את הביצועים של ארכיטקטורת UNet על ידי יישום מספר שיטות. לדוגמה, מנגנוני קשב הוכחו כיעילים בשיפור הביצועים של רשתות עצביות קונבולוציוניות. מנגנונים אלה יכולים להדגיש באופן סלקטיבי את התכונות החיוניות בנתוני הקלט, מה שמוביל ללמידת ייצוג טובה יותר ודיוק סגמנטציה.

נכון לעכשיו, חוקרים רבים מתמקדים במיזוג יעיל של התכונות שחולצו על ידי המקודד בשלב הפענוח. כמה מהגרסאות הנפוצות ביותר של UNet כוללות את Attention UNet2, Recurrent UNet3 ו-V-Net4. גישות אלו משתמשות במנגנוני קשב5, כגון תשומת לב מרחבית, כדי להדגיש אזורים אינפורמטיביים של מפות התכונות ולדכא את האזורים הלא אינפורמטיביים. בנוסף, גרסאות מסוימות משלבות רשתות עצביות חוזרות כדי למדל את האופי הרציף של התמונות הרפואיות ולשפר את ייצוגי התכונות. מודלים לפני אימון, כגון VGG6, ResNet7 ו-DenseNet8, היו בשימוש נרחב כדי לשפר את הביצועים של רשתות בצורת U על ידי מינוף הידע העשיר שלהם שנלמד ממערכי נתונים בקנה מידה גדול. בנוסף, מנגנוני שנאים, כגון תשומת לב עצמית ותשומת לב מרובת ראשים, הוצגו לתלות במודל ארוך טווח ולוכדים מידע הקשרי גלובלי, מה שמוביל לביצועי פילוח טובים יותר.

עם זאת, בעוד שגרסאות אלו השתפרו לעומת UNet1 המקורי, עדיין יש להן מגבלות מסוימות בטיפול בתמונות רפואיות מורכבות בקנה מידה וצורות שונות. יתר על כן, המורכבות המוגברת של גרסאות אלה מובילה לעתים קרובות לעלויות חישוביות גבוהות יותר ולזמני הכשרה ארוכים יותר, מה שמגביל את ישימות הגרסאות הללו במסגרות מעשיות.

כדי לשפר את ארכיטקטורת UNet1 , מוצע מודל שונה בשם MixKNet (Mix Kernel Size U-form Net), המפחית את עומק הרשת תוך הגדלת מספר הערוצים לשיפור יכולת הלמידה. עם זאת, הפחתת העומק עלולה להוביל לירידה בביצועים הכוללים. כדי להקל על בעיה זו, מוצג מודול קונבולוציוני של ערוץ היברידי, המחליף את המודול העצבי הקונבולוציוני המקורי. מודול זה משלב מנגנון קשב ערוץ בין שכבות הקונבולוציה בעומק ובנקודה, במטרה לחזק את יכולתו של המודל לחלץ תכונות ערוץ יעילות.

כדי להנחות את היישום המעשי, חשוב לציין שהשיטה המוצעת הוערכה על מערכי נתונים של תמונות רפואיות בקנה מידה קטן יחסית, עם רזולוציות תמונה בודדות שנעו בין 500 × 500 ל-1000 × 1000 פיקסלים. לאימון מודל, גודל כל התמונות השתנה ל-224 ×-224 פיקסלים. היישום בוצע באמצעות PyTorch ב-NVIDIA RTX 3090 GPU יחיד. פרמטרים תפעוליים אלה מצביעים על כך שהשיטה אפשרית מבחינה חישובית עבור הגדרות ניסוי מתונות וניתנת להתאמה לגדלים מוגבלים של מערכי נתונים.

לסיכום, מאמר זה מציג שינוי חדשני במבנה הרשת בצורת U ומציג מודול קונבולוציה של ערוצים היברידיים יחד עם מנגנון תשומת לב לערוץ, שניהם משפרים את ביצועי הפילוח במערכי נתונים של תמונות רפואיות. התרומות העיקריות של עבודה זו הן כדלקמן: (1) הצעת מבנה רשת שונה בצורת U עם מודול קונבולוציה היברידי עמוק המחליף את המודול העצבי הקונבולוציוני המקורי. (2) הכנסת מנגנון קשב ערוץ בין שכבת הקונבולוציה העמוקה לשכבת הפיתול הנקודתית כדי לשפר את יכולת חילוץ תכונות הערוץ האפקטיבית של המודל. (3) השגת תוצאות חדישות בו-זמנית על שני מערכי נתונים ציבוריים פופולריים במערך הנתונים של פילוח גרעיני MoNuseg9 עם פחות פרמטרים של מודל (בהשוואה ל-UCtransNet10 עם פרמטרים של 64M) וביצועים משופרים במערך הנתונים של פילוח בלוטות GlaS11 .

שאר המאמר הזה מאורגן כדלקמן. שלב 2 מספק סקירה מקיפה של מחקרים קודמים על UNet1 והווריאציות שלו בפילוח תמונות רפואיות. נבחנים החוזקות והמגבלות של גישות קיימות, יחד עם עבודה קשורה על מנגנוני קשב, רשתות קונבולוציוניות מעורבות ויישומיהן במודלים של סגמנטציה. שלב 3 מפרט את הארכיטקטורה של מודל MixKNet המוצע, כולל שינויים במבנה UNet, שילוב של מנגנון תשומת לב לערוץ ושימוש בקונבולוציה בעומק מעורב. שלב 4 מדווח על תוצאות ניסויים נרחבים, מלווים בדיון ומחקר אבלציה כדי להעריך את התרומה של כל מרכיב. לבסוף, שלב 5 מסכם את המאמר ומתאר כיוונים פוטנציאליים למחקר עתידי.

חלק זה מתחיל בסקירה של מחקרים קודמים על UNet והגרסאות שלו בפילוח תמונות רפואיות, המתאר את החוזקות והמגבלות של השיטות הקיימות. בנוסף, נדון מחקר קשור על מנגנוני קשב ויישומיהם במודלים של סגמנטציה. נבדקות גם התפתחויות אחרונות הכוללות טכניקות קונבולוציה לעומק לשיפור ביצועי הפילוח. ניתוח השוואתי של ה-MixKNet (c) המוצע ומודלים אחרים מוצג באיור 1, שבו קווים מקווקווים מצביעים על חיבורי דילוג.

UNet והווריאציות שלו
ארכיטקטורת UNet הוצעה לראשונה על ידי Ronneberger et al. בשנת 20151 ומאז נעשה בה שימוש נרחב בפילוח תמונות רפואיות. המודל מורכב מנתיב קידוד ונתיב פענוח. המקודד מחלץ תכונות ברמה גבוהה מתמונת הקלט בזמן שהמפענח דוגם ומשלב את התכונות ליצירת מפת פילוח. מאז, בוצעו שינויים שונים בארכיטקטורת UNet כדי לשפר את ביצועיה בפילוח תמונות רפואיות. אחד השינויים הנפוצים ביותר הוא הכנסת חיבורי דילוג, שהוכחו כמשפרים את דיוק הפילוח. Zhou et al.12 הציעו גרסת UNet המשתמשת בחיבורי דילוג צפופים, המאפשרים למודל לשמר מידע מרחבי טוב יותר.

שינוי פופולרי נוסף בארכיטקטורת UNet הוא הוספת מנגנוני קשב. מנגנונים אלה יכולים לעזור למודל להדגיש באופן סלקטיבי את התכונות החשובות ביותר, מה שמוביל ללמידת ייצוג טובה יותר ודיוק סגמנטציה. כמה דוגמאות לגרסאות עם מנגנוני קשב כוללות את Attention UNet2, ResUNet עם שערי קשב13 ו-Dense-UNet עם שערי קשב14. בנוסף לשינויים לעיל, הוצעו גרסאות רבות אחרות של ארכיטקטורת UNet לפילוח תמונות רפואיות. UCTransNet10 היא גרסה של ארכיטקטורת U-Net המשלבת חיבורי דילוג ומודול שנאי. חיבורי הדילוג ב-UCTransNet10 נחשבים מחדש מנקודת מבט של ערוץ, מה שמאפשר שימוש חוזר טוב יותר בתכונות ומפחית את מספר הפרמטרים. מודול השנאי נוסף כדי ללכוד יחסי תלות ארוכי טווח ולשפר את איכות התרגום. UCTransNet10 הוכח כמשיג תוצאות חדישות במספר מדדי תרגום מכונה. Zihan ואחרים הציעו מודל למידה עמוקה בשם LViT15, אותו הם יישמו במשימות ניתוח תמונות רפואיות. כדי להרחיב את הגרסה המפוקחת למחצה של LViT15 ולפצות על המחסור באיכות בנתוני התמונה, הם הציעו את מנגנון איטרציה של תווית פסאודו אקספוננציאלית (EPI). בנוסף, כדי לשמר את התכונות המקומיות של תמונות, הם הציעו את מודול תשומת הלב ברמת הפיקסלים (PLAM), המתמקד באופן סלקטיבי בתכונות תמונה חשובות.

מנגנון קשב
מנגנוני קשב נחקרו רבות בלמידת מכונה, במיוחד בעיבוד שפה טבעית וראייה ממוחשבת. בשנים האחרונות יושמו מנגנוני קשב גם במשימות ניתוח תמונות רפואיות, כולל פילוח תמונה. Bahdanau et al.16 הציגו מנגנון קשב בתרגום מכונה עצבי כדי לשפר את איכות התרגום. המנגנון מאפשר למודל להתמקד באופן סלקטיבי בחלקים הרלוונטיים של רצף הקלט, ולשפר את איכות התרגום. מאז, הוצעו מנגנוני קשב שונים למשימות ניתוח תמונה. סוג נפוץ אחד של מנגנון קשב הוא מנגנון הקשב המרחבי, הכולל החלת משקל על כל פיקסל במפת התכונות על סמך חשיבותו. לדוגמה, Guo et al.17 הציעו מנגנון קשב מרחבי למשימת פילוח כלי הרשתית. המנגנון משתמש במנגנון שער כדי להתאים את שקלול התכונות המרחביות, ומשפר את יכולת המודל להבחין בין כלי השיט לפיקסלים שאינם כלי שיט. סוג נוסף של מנגנון קשב הוא תשומת לב ערוצית, המתמקדת בהתאמת המשקלים של מפות תכונות בין ערוצים. Hu et al.18 הציעו רשת סחיטה ועירור (SENet) המיישמת תשומת לב ערוצית על מפות התכונות, ומשפרת את הביצועים של משימת סיווג התמונה. לאחרונה, מנגנוני קשב שולבו עם רשתות עצביות קונבולוציוניות (CNNs) למשימות פילוח תמונה. לדוגמה, Chen et al.19 הציעו רשת מונחית קשב לפילוח גידולי מוח המשלבת מנגנוני קשב מרחביים וערוצים.

ההתקדמות האחרונה בלמידה מפוקחת למחצה ורב-מודאלית לניתוח תמונה רפואית וחישה מרחוק הוכיחה שיפורים מבטיחים בביצועים. יאנג ואחרים.20 הציעו UMSCS, מסגרת פילוח רב-מודאלית חדשה לא מזווגת הממנפת למידה גנרטיבית חוצה מודאליות ואסטרטגיות מפוקחות למחצה. ז'אנג ועמיתיו הציגו מספר טכניקות מתקדמות: מודל עקביות תלת-ענפית משופר ראייתית לסגמנטציה בפיקוחלמחצה 21, מסגרת למידה אב-טיפוסית מודעת לעצמה וצולב דגימה לפילוח תמונה רפואית22, וגישת אופטימיזציה היררכית מודעת לתדר זמן לזיהוי שיבוש מכ"ם צמצם סינתטי (SAR) בתחום התעופה והחלל23. עבודות אלה מדגישות ביחד את החשיבות של פיקוח היברידי ומודלים של תכונות מודעות לתחום במשימות הדמיה רפואיות והנדסיות כאחד.

קונבולוציה של עומק
קונבולוציה מבחינת עומק נועדה ללכוד מתאמים חכמים בערוץ במפות תכונות הקלט והוכחה כמשפרת את היעילות והדיוק של רשתות עצביות קונבולוציוניות.

אחד המודלים המוקדמים והמשפיעים ביותר מבחינת עומק הוא MobileNet24, שהוצע על ידי הווארד ואחרים ב-2017. MobileNet משתמשת בקונבולוציה הניתנת להפרדה מבחינת עומק, המפעילה קונבולוציה מבחינת עומק ואחריה קונבולוציה נקודתית, כדי להפחית את מספר הפרמטרים והחישוב הנדרשים לשכבות קונבולוציוניות. זה מאפשר ל-MobileNet להשיג דיוק מתקדם במשימות סיווג תמונות תוך שימוש בפחות פרמטרים משמעותית מאשר רשתות עצביות קונבולוציוניות מסורתיות. מאז הצגת MobileNet, הוצעו מספר ארכיטקטורות קונבולוציה אחרות מבחינת עומק, כולל ShuffleNet25, Xception26 ו-ResNeXt27. מודלים אלה משתנים ביישום הספציפי שלהם של קונבולוציה חכמה עמוקה, אך כולם חולקים את המטרה להפחית את המורכבות החישובית של שכבות קונבולוציה תוך שמירה או שיפור הדיוק. קונבולוציה עמוקה יושמה גם על המשימה של פילוח סמנטי, עם מודלים כמו PSPNet28 המשתמשים בקונבולוציה ניתנת להפרדה מבחינת עומק כדי להפחית את דרישות החישוב והזיכרון של שכבות קונבולוציה בקנה מידה גדול. MixNet29 מרחיב עוד יותר את הרעיון של קונבולוציה חכמה עמוקה על ידי הצגת קונבולוציה מעורבת מבחינת עומק, המשתמשת במספר גדלי ליבה כדי ללכוד תכונות בקנה מידה שונה. הוכח שהוא עולה על מודלים חדישים אחרים תוך שמירה על פרמטרים ו-FLOPs דומים. מודלים אלה הראו שיפורים משמעותיים ברמת הדיוק והיעילות על פני רשתות עצביות קונבולוציוניות מסורתיות במשימות פילוח סמנטיות שונות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

סעיף זה מתאר את ארכיטקטורת MixKNet המוצעת לפילוח תמונות רפואיות. מודל MixKNet מרחיב את ארכיטקטורת UNet, ומשלב מנגנוני קשב ושכבות קונבולוציה מעורבות בעומק. התוכנה ששימשה במחקר זה מופיעה בטבלת החומרים.

1. ארכיטקטורה כוללת

  1. ארכיטקטורת MixKNet, המוצגת באיור 2, עוקבת אחר מבנה UNet הסטנדרטי, המורכב ממקודד ומפענח. הגדר את צורת הקלט ל- 224 × 224 × 3. במקודד, השתמש בשני מודולי DownBlock - כל אחד מהם כולל קונבולוציה של 1×1 לעומק, שכבת איגום מקסימלית של 2×2 וקונבולוציה מרובת ליבות (MDConv) עם גדלי ליבה כגון [1, 3, 5] או [3-13].
  2. במפענח, השתמש בשני מודולי UpBlock - כל אחד מבצע דגימה דו-ליניארית, דלג על שרשור חיבור, קונבולוציה של 1×1 לעומק וקונבולוציה מרובת ליבות.
  3. השתמש בהפעלות ReLU לאחר כל בלוק קונבולוציוני. החל קונבולוציה סופית של 1×1 כדי לייצר את הפלט, ואחריו הפעלה סיגמואידית לפילוח בינארי, או השאר לא מופעל עבור Softmax חיצוני במשימות מרובות מחלקות.

2. צורת U שטוחה

הערה: צמצם את העומק של ארכיטקטורת הרשת העצבית כדי להקטין את המורכבות החישובית ואת גודל המודל, תוך מודעות לכך שהדבר עלול להפחית את היכולת ללמוד ייצוגי נתונים מורכבים.

  1. צמצם ארכיטקטורת UNet בת ארבע רמות לגרסה דו-רמתית, כפי שמוצג באיור 3, כדי להקטין את מספר פרמטרי המודל תוך שמירה על רכיבי הקידוד והפענוח הליבה.
    1. בנה את הארכיטקטורה השטוחה על ידי הסרת רמות 3 ו-4 מנתיבי המקודד והמפענח, ושמור על חיבורי תכונות ברמה 2.
    2. התאם את פעולות ההפחתה והדגימה בהתאם כך שיתאימו לשימוש בעומק המופחת רק שלב אחד של הפחתת דגימה לפני צוואר הבקבוק ושלב העלאה אחד אחריו.
      הערה: הפחתה זו בעומק עלולה להפחית את יכולת הלמידה של המודל, מכיוון שהיא עשויה שלא ללכוד קשרים מורכבים בין קלט לפלט. הגדלת מספר ערוצי הקונבולוציה הבסיסיים בכל שכבת מודל יכולה לעזור להתגבר על מגבלה זו על ידי שיפור יכולת המודל ללמוד תכונות מפלות. עם ערוצי קונבולוציה נוספים, המודל יכול ללכוד דפוסים ויחסים מורכבים יותר בנתוני הקלט, לפצות על העומק המופחת ולשפר את הביצועים.
  2. קחו בחשבון שהגדלת מספר ערוצי הקונבולוציה יכולה גם להעלות את המורכבות החישובית של המודל ואת השימוש בזיכרון, ולהציג פשרה עם מהירות האימון וההסקה. מצא איזון מתאים בין קיבולת המודל ליעילות חישובית.

3. מערבבים את גודל הליבה למקודד

  1. כדי לשפר את ביצועי המקודד, השתמש בגישת גודל ליבה מעורב במודול DC-CA (Depthwise Convolution and Channel Attention), כפי שמוצג באיור 4. במקום להסתמך על גודל ליבה יחיד, החל פיתולי עומק מרובים במקביל לגדלי ליבה משתנים (למשל, 1, 3, 5, 7, 9, 11, 13) כדי לחלץ תכונות בשדות קליטה מרובים.
  2. החל נורמליזציה של אצווה והפעלת ReLU על כל ענף בנפרד לפני שרשור. שרשר את הפלטים מכל ענף ליבה לאורך ממד הערוץ.
  3. השתמש בקונבולוציה נקודתית של 1×1 לאחר שרשור כדי למזג תכונות ולהקרין אותן למספר קבוע של ערוצי פלט, תוך שמירה על עקביות עם גודל הקלט הצפוי של השכבה הבאה.
    הערה: שכבת הקונבולוציה המעורבת לעומק מורכבת ממספר פיתולים בעומק עם גדלי גרעין משתנים, ואחריהם קונבולוציה נקודתית. עיצוב זה מאפשר לכידת תכונות בקנה מידה שונה, וזה קריטי במשימות פילוח תמונות רפואיות. המודול הראשון משתמש בשלושה גדלי ליבה - 1, 3 ו-5 - כדי להגדיל את שדה הקליטה, בעוד שהמודול השני משתמש בגדלי ליבה גדולים יותר ויותר קבוצות, במיוחד 3, 5, 7, 9, 11 ו-13.

4. ערוץ תשומת לב

  1. שלב מנגנון תשומת לב ערוץ במודול DC-CA כדי לשפר את ייצוג התכונות.
    1. השתמש בפיתול של 1×1 עם ריפוד "זהה" כדי ליצור מפות קשב מבחינת ערוץ. החל איגום ממוצע כללי על פני ממדים מרחביים כדי ליצור מתאר קומפקטי עבור כל ערוץ.
    2. השתמש ברשת קונבולוציונית קלת משקל המורכבת משני פיתולים של 1×1 עם הפעלת ReLU ביניהם. הימנע משיתוף משקל בין ערוצים - למד משקלי קשב ייחודיים לכל ערוץ.
    3. החל הפעלת סיגמואיד על הפלט הסופי כדי לקבל ציוני קשב מנורמלים. שקלול מחדש של מפות תכונות הקלט באמצעות כפל ערוץ.
      הערה: תן לטנזור הקלט להיות x. תשומת לב ערוץ מיושמת באמצעות הביטוי הבא:
      (תשומת לב)_tensor = σ(conv(ReLU(conv(x)))) (1)
      כאשר σ מייצג את פונקציית ההפעלה הסיגמואידית, conv היא פעולת הקונבולוציה, ו-ReLU היא פונקציית הפעלת היחידה הליניארית המתוקנת.
  2. השג את מפת הקשב על ידי ביצוע פעולת איגום ממוצעת אדפטיבית על טנזור הקשב, ואחריה הרחבתה כך שתתאים לגודל טנזור הפלט לאחר קונבולוציה עם גודל ליבה אחר y:
    תשומת לב = הרחבה(avg_pool([תשומת לב]_tensor),גודל (y)) (2)
  3. חשב את טנזור הפלט z על ידי ביצוע כפל אלמנט של טנזור הקלט y עם מפת הקשב:
    z = z * תשומת לב (3)
    כאשר * מייצג כפל לפי יסודות

5. מערכי נתונים

הערה: שני מערכי נתונים של תמונות רפואיות הזמינים לציבור, כפי שמוצג בטבלה 1 ובטבלה 2, משמשים במחקר זה: GlaS (Sirinukunwattana et al.11) ו-MoNuSeg (Kumar et al.9).

  1. השתמש במערך הנתונים של סגמנטציה של בלוטות (Sirinukunwattana et al.11), שנרכש באמצעות סורק פתולוגיה דיגיטלי ומוסבר באופן ידני כדי לפלח מבני בלוטות בודדים בתוך דגימות רקמה.
    הערה: מערך הנתונים מורכב מ-165 תמונות, כל אחת ברזולוציה של 500 ×-500 פיקסלים, יחד עם מסכות פילוח אמת קרקע מתאימות. מערך הנתונים של MoNuSeg (Kumar et al.9) כולל 51 תמונות של גרעינים מיקרוסקופיים, כל אחד ברזולוציה של 1000 ×-1000 פיקסלים.

6. פרטי היישום

  1. יישם את המודל באמצעות PyTorch ב-NVIDIA RTX 3090 GPU יחיד. השתמש באובונטו 22.04 כמערכת ההפעלה.
  2. שנה את גודל כל תמונות הקלט לגודל קבוע של 224 × 224 פיקסלים. ליישם טכניקות הגדלת נתונים כדי לשפר את גיוון ההדרכה.
    1. החל הגדלות באופן אקראי בסדר הבא: היפוך אופקי → סיבוב → היפוך אנכי → תיקון גמא → טרנספורמציה לוגריתמית → שינוי גודל אקראי.
    2. החל סיבובים אופקיים אקראיים בהסתברות של 0.5, סיבובים אנכיים בהסתברות של 0.5 וסיבובים בטווח של ±15 מעלות בהסתברות של 0.5.
    3. החל תיקון גמא בהסתברות של 0.3, טרנספורמציה לוגריתמית בהסתברות של 0.3, ושינוי קנה מידה אקראי עם מקדם קנה מידה בין 0.9 ל-1.1, המופעל בהסתברות של 0.3.
    4. נרמל תמונות באמצעות ערכים ממוצעים של [0.485, 0.456, 0.406] וסטיות תקן של [0.229, 0.224, 0.225].
  3. אמן את המודל באמצעות אופטימיזציה של אדם עם קצב למידה של 0.001 וגודל אצווה של 4. השתמש בטכניקת תזמון קצב הלמידה Cosine Calling with Warm Restarts כדי להכניס שונות ללוח הזמנים של קצב הלמידה ולמנוע התכנסות לאופטימיזציה המקומית.
    הערה: השתמש torch.optim.lr_scheduler המובנה של PyTorch. CosineAnnealingWarmRestarts. האופטימיזציה והמתזמן יושמו באופן הבא:
    אופטימיזציה = torch.optim.Adam(model.parameters(), lr=0.001, weight_decay=1e-5)
    מתזמן = torch.optim.lr_scheduler. CosineAnnealingWarmRestarts(
    אופטימיזציה, T_0=10, T_mult=2, eta_min=1E-6)
    כאן, T_0=10 מציין את מספר התקופות לפני ההפעלה מחדש הראשונה, T_mult=2 מכפיל את תקופת ההפעלה מחדש לאחר כל מחזור, ו-eta_min=1e-6 קובע את קצב הלמידה המינימלי. עדכן את קצב הלמידה בסוף כל תקופה על ידי התקשרות ל-scheduler.step().
  4. השתמש באנטרופיה צולבת בינארית כפונקציית ההפסד. יש למרוח עצירה מוקדמת כדי למנוע התאמת יתר. אמן את המודל למקסימום 5000 תקופות.
  5. הערך את ביצועי המודל באמצעות הצטלבות ממוצעת מעל איחוד (mIoU) ומקדם הקוביות.
    קוביות =(2|א∩ב|)/(|A|+|ב|) (4)
    IoU=(|א∩ב|)/(|א∪ב|) (5)
    הערה: ה-mIoU הוא היחס בין ההצטלבות בין מסכות פילוח האמת החזויה והקרקעית לאיחוד שלהן. יחד עם זאת, מקדם הקוביות הוא היחס בין פי שניים מההצטלבות לסכום מסכות פילוח האמת החזויה והקרקעית.
  6. בצע הערכה קפדנית על מערכי נתונים קטנים באמצעות שלושה סבבים של אימות צולב פי 5, וכתוצאה מכך בסך הכל 15 הערכות. ערבב באופן אקראי את פיצולי האימות הצולב בכל סיבוב כדי להבטיח שונות בין קפלים. רבד את הקיפולים על סמך התפלגות מחלקות כדי לשמור על איזון התווית בכל קיפול.
  7. חשב את הביצועים הממוצעים על פני קפלים כדי להפחית את הסיכון להתכנסות לאופטימיזציה מקומית. בצע בדיקה סטטיסטית כדי להוכיח שהגישה המוצעת משיגה שיפורים מובהקים סטטיסטית בהשוואה לשיטות דומות.
  8. הצג תחזיות אימות מייצגות במהלך האימון באיור 5 כדי להמחיש את השיפור המתקדם באיכות הפילוח. לאחר השלמת האימון, טען את נקודת הביקורת של המודל בעל הביצועים הטובים ביותר על סמך ביצועי האימות (למשל, ציון mIoU ו-Dice הגבוה ביותר).
    1. הפעל את המודל בערכת האימות כדי ליצור מסיכות פילוח חזויות באמצעות הפרמטרים השמורים.
    2. דמיין את התוצאות באמצעות Matplotlib על ידי הצגת תמונת הקלט, מסכת האמת הקרקעית והמסכה החזויה בפורמט זה לצד זה.
    3. הדגש את עליונותה של השיטה המוצעת בביצועי הפילוח על ידי סימון אזורים מייצגים בתיבות אדומות בהדמיה.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

השוואה לשיטות חדישות
ארכיטקטורת MixKNet הוערכה בשני מערכי נתונים של פילוח תמונות רפואיות, GlaS ו-MoNuSeg, והושוותה לשיטות חדישות בתחום. ההערכה בוצעה על ידי דיווח על ציוני הקוביות וה-IoU של השיטה המוצעת ומספר מודלים דומים, כפי שמוצג בטבלה 3. התוצאות מצביעות על כך שארכיטקטורת MixKNet עולה על המודלים האחרים, ומשיגה את ציוני הקוביות וה-IoU הממוצעים הגבוהים ביותר בשני מערכי הנתונים. במערך הנתונים של GlaS11, ה-MixKNet המוצע השיג ציון קוביות ממוצע של 91.18% ו...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה מציג את MixKNet, שינוי חדשני של ארכיטקטורת UNet1 לפילוח תמונות רפואיות, המשלב קונבולוציה בעומק מעורב ומנגנון תשומת לב לערוץ כדי לשפר את ביצועי הפילוח תוך הפחתה משמעותית של המורכבות החישובית. קונבולוציה של הערוץ ההיברידי משלבת מספר גרעינים קונבולוציוניים הפועלים בקבוצות ערוצים נפרדות. עיצוב זה מאפשר לרשת ללכוד מאפיינים מרחביים והקשריים מגוונים בקנה מידה שונה של שדה קליטה בתוך אותה שכבה, ולשפר את יכולתו של המודל לייצג מבנים מקומיים וגלובליים כאחד. בניגוד לפי...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מצהירים שאין אינטרסים פיננסיים מתחרים או ניגודי אינטרסים אחרים.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

האצווה השנייה של פרויקטי מחקר הרווחה החברתית של נינגבו סיטי לשנת 2023: מחקר ויישום של טכנולוגיות מפתח לזיהוי הונאות ברשת טלקום על בסיס אונטולוגיה ו-NLP (2023S169).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
מערכת הפעלה לינוקס (אובונטו 22.04)  שונות (קהילת קוד פתוח)N/A (גרסה 22.04 LTS)מערכת הפעלה בקוד פתוח לפיתוח
https://releases.ubuntu.com/22.04/
NVIDIA RTX 3090 GPUNVIDIA3090GPU בעל ביצועים גבוהים ללמידה עמוקה
https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/
PythonPython Software FoundationN/A (גרסה ≥ 3.8)שפת תכנות לפיתוח AI/ML
https://www.python.org/
PyTorchMeta AI N/A (גרסה 1.13)מסגרת למידת מכונה בקוד פתוח
https://pytorch.org/
Visual Studio Code (VS Code)MicrosoftN/Aעורך קוד קל משקל ורב עוצמה
https://code.visualstudio.com/

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ronneberger, O., Fischer, P., Brox, T. U-Net: Convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  2. Oktay, O., et al. Attention U-Net: Learning where to look for the pancreas. arXiv. , (2018).
  3. Alom, M. Z., Yakopcic, C., Hasan, M., Taha, T. M., Asari, V. K. Recurrent residual U-Net for medical image segmentation. J Med Imaging. 6 (1), 014006-014006 (2019).
  4. Milletari, F., Navab, N., Ahmadi, S. -A. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. 3DV. , 565-571 (2016).
  5. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  6. Simonyan, K., Zisserman, A. Very deep convolutional networks for large-scale image recognition. arXiv. , (2014).
  7. Deep residual learning for image recognition. He, K., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 770-778 (2016).
  8. Densely connected convolutional networks. Huang, G., Liu, Z., Van der Maaten, L., Weinberger, K. Q. Proc IEEE Conf Comput Vis Pattern Recognit, , 4700-4708 (2017).
  9. Kumar, N., et al. A dataset and a technique for generalized nuclear segmentation for computational pathology. IEEE Trans Med Imaging. 36 (7), 1550-1560 (2017).
  10. Wang, H., Cao, P., Wang, J., Zaiane, O. R. UCTransNet: Rethinking the skip connections in U-Net from a channel-wise perspective with Transformer. Proc AAAI Conf Artif Intell. 36 (3), 2441-2449 (2022).
  11. Sirinukunwattana, K., et al. Gland segmentation in colon histology images: The GlaS challenge contest. Med Image Anal. 35, 489-502 (2017).
  12. Zhou, Z., Rahman Siddiquee, M. M., Tajbakhsh, N., Liang, J. UNet++: A nested U-Net architecture for medical image segmentation. Lect Notes Comput Sci. 11045, 3-11 (2018).
  13. Diakogiannis, F. I., Waldner, F., Caccetta, P., Wu, C. ResUNet-a: A deep learning framework for semantic segmentation of remotely sensed data. ISPRS J Photogramm Remote Sens. 162, 94-114 (2020).
  14. Cai, S., Tian, Y., Lui, H., Zeng, H., Wu, Y., Chen, G. Dense-UNet: A novel multiphoton in vivo cellular image segmentation model based on a convolutional neural network. Quant Imaging Med Surg. 10 (6), 1275-1285 (2020).
  15. Li, Z., et al. LViT: Language meets Vision Transformer in medical image segmentation. IEEE Trans Med Imaging. 43 (1), 96-107 (2023).
  16. Bahdanau, D., Cho, K., Bengio, Y. Neural machine translation by jointly learning to align and translate. arXiv. , (2014).
  17. Guo, C., Szemenyei, M., Yi, Y., Zhou, W., Bian, H. Residual spatial attention network for retinal vessel segmentation. Proc ICONIP. 27, 509-519 (2020).
  18. Squeeze-and-excitation networks. Hu, J., Shen, L., Sun, G. Proc IEEE Conf Comput Vis Pattern Recognit, , 7132-7141 (2018).
  19. Chen, H., Qi, X., Yu, L., Dou, Q., Qin, J., Heng, P. -A. DCAN: Deep contour-aware networks for object instance segmentation from histology images. Med Image Anal. 36, 135-146 (2017).
  20. Yang, F., Li, X., Wang, B., Teng, P., Liu, G. UMSCS: A novel unpaired multimodal image segmentation method via cross-modality generative and semi-supervised learning. Int J Comput Vis. , 1-23 (2025).
  21. Zhang, Z., et al. An evidential-enhanced tri-branch consistency learning method for semi-supervised medical image segmentation. IEEE Trans Instrum Meas. , 1-15 (2024).
  22. Zhang, Z., et al. Self-aware and cross-sample prototypical learning for semi-supervised medical image segmentation. Med Image Comput Comput Assist Interv. 14372, 192-201 (2023).
  23. Zhang, Z., et al. A time-frequency-aware hierarchical feature optimization method for SAR jamming recognition. IEEE Trans Aerosp Electron Syst. , 1-15 (2025).
  24. Howard, A. G., et al. MobileNets: Efficient convolutional neural networks for mobile vision applications. arXiv. , (2017).
  25. ShuffleNet: An extremely efficient convolutional neural network for mobile devices. Zhang, X., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 6848-6856 (2018).
  26. Xception: Deep learning with depthwise separable convolutions. Chollet, F. Proc IEEE Conf Comput Vis Pattern Recognit, , 1251-1258 (2017).
  27. Aggregated residual transformations for deep neural networks. Xie, S., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 1492-1500 (2017).
  28. Pyramid scene parsing network. Zhao, H., Shi, J., Qi, X., Wang, X., Jia, J. Proc IEEE Conf Comput Vis Pattern Recognit, , 2881-2890 (2017).
  29. Tan, M., Le, Q. V. MixConv: Mixed depthwise convolutional kernels. arXiv. , (2019).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

U NetChannel Attention
הסרטון יגיע בקרוב

מאמרים קשורים