מחקר זה מציג גרסת U-Net קלת משקל עם דיוק סגמנטציה משופר באמצעות קונבולוציה היברידית ותשומת לב ערוצית, ומשיג תוצאות חדישות ב-MoNuseg ו-GlaS עם פחות פרמטרים.
מאמר שיטה
מחקר זה מציג גרסת U-Net קלת משקל עם דיוק סגמנטציה משופר באמצעות קונבולוציה היברידית ותשומת לב ערוצית, ומשיג תוצאות חדישות ב-MoNuseg ו-GlaS עם פחות פרמטרים.
טכנולוגיית עיבוד תמונה ממוחשבת מבוססת רשת עצבית מלאכותית התפתחה במהירות בשנים האחרונות ומצאה יישומים נרחבים בתחומים מרובים. בעיבוד תמונה רפואית, UNet והגרסאות שלו הראו הצלחה רבה במשימות זיהוי נגעים, פילוח תאים ופילוח פוליפים. מחקר זה מציג רשת בצורת U שונה עם פרמטרי רשת מופחתים המושגים על ידי הקטנת עומק הרשת והגדלת ערוצי הרשת כדי לשפר את יכולת הלמידה של המודל. כדי לנטרל את הירידה ביכולת הלמידה הנגרמת מדחיסת עומק, מוצג מודול קונבולוציוני של ערוץ היברידי שיחליף את מודול הקונבולוציה של הרשת המקורית. המודל מציג מנגנון תשומת לב ערוץ בין השכבה לשכבת הפיתול הנקודתית כדי לשפר את יכולת חילוץ תכונת הערוץ המעשית. המאמר גם מסכם כי שימוש בקונבולוציה בעומק מעורב יכול לפתור ביעילות את טווח הגודל של יעד הפילוח, מה שמקשה על מודל אחד להתאים למספר מערכי נתונים. המודל המוצע משיג תוצאות חדישות בשני מערכי נתונים ציבוריים פופולריים, MoNuseg ו-GlaS, עם עלייה ממוצעת בקוביות של 1.0% ו-1.37%, בהתאמה. סך הפרמטרים של הדגם השונה מצטמצם ל-1.71M, המייצג הפחתה של פי 38.6 בהשוואה ל-UCtransNet, עם 65.6 מיליון פרמטרים.
פילוח תמונות רפואיות הוא קריטי ביישומים קליניים שונים, כולל אבחון, תכנון טיפול וניטור מחלות. שיטות עיבוד תמונה מסורתיות המבוססות על אלגוריתמים של הנדסת תכונות אינן מתאימות עוד לטיפול בכמויות הגדולות של נתונים שנוצרו בסביבות בריאות מודרניות. למרבה המזל, התקדמות טכנולוגיית הרשת העצבית המלאכותית והשיפורים ביכולות חומרת המחשב אפשרו לאמן ולפרוס מודלים של רשתות עצביות בקנה מידה גדול. כתוצאה מכך, אלגוריתמים לעיבוד ראייה ממוחשבת המבוססים על מודלים של למידת מכונה מפותחים ומיושמים ללא הרף בתחומים שונים.
מבנה המודל המייצג ביותר בפילוח סמנטי של תמונות רפואיות הוא UNet1 עם ארכיטקטורת קידוד-פענוח. המודל משתמש תחילה במקודד רב-מפלסי כדי לחלץ תכונות בקנה מידה שונה מתמונת הקלט. לאחר מכן, המפענח דוגם צעד אחר צעד תוך שילוב התכונות הסמנטיות המוצאות על ידי המקודד של הרמה המתאימה כחיבור דילוג. עם זאת, ניתן לשפר עוד יותר את הביצועים של ארכיטקטורת UNet על ידי יישום מספר שיטות. לדוגמה, מנגנוני קשב הוכחו כיעילים בשיפור הביצועים של רשתות עצביות קונבולוציוניות. מנגנונים אלה יכולים להדגיש באופן סלקטיבי את התכונות החיוניות בנתוני הקלט, מה שמוביל ללמידת ייצוג טובה יותר ודיוק סגמנטציה.
נכון לעכשיו, חוקרים רבים מתמקדים במיזוג יעיל של התכונות שחולצו על ידי המקודד בשלב הפענוח. כמה מהגרסאות הנפוצות ביותר של UNet כוללות את Attention UNet2, Recurrent UNet3 ו-V-Net4. גישות אלו משתמשות במנגנוני קשב5, כגון תשומת לב מרחבית, כדי להדגיש אזורים אינפורמטיביים של מפות התכונות ולדכא את האזורים הלא אינפורמטיביים. בנוסף, גרסאות מסוימות משלבות רשתות עצביות חוזרות כדי למדל את האופי הרציף של התמונות הרפואיות ולשפר את ייצוגי התכונות. מודלים לפני אימון, כגון VGG6, ResNet7 ו-DenseNet8, היו בשימוש נרחב כדי לשפר את הביצועים של רשתות בצורת U על ידי מינוף הידע העשיר שלהם שנלמד ממערכי נתונים בקנה מידה גדול. בנוסף, מנגנוני שנאים, כגון תשומת לב עצמית ותשומת לב מרובת ראשים, הוצגו לתלות במודל ארוך טווח ולוכדים מידע הקשרי גלובלי, מה שמוביל לביצועי פילוח טובים יותר.
עם זאת, בעוד שגרסאות אלו השתפרו לעומת UNet1 המקורי, עדיין יש להן מגבלות מסוימות בטיפול בתמונות רפואיות מורכבות בקנה מידה וצורות שונות. יתר על כן, המורכבות המוגברת של גרסאות אלה מובילה לעתים קרובות לעלויות חישוביות גבוהות יותר ולזמני הכשרה ארוכים יותר, מה שמגביל את ישימות הגרסאות הללו במסגרות מעשיות.
כדי לשפר את ארכיטקטורת UNet1 , מוצע מודל שונה בשם MixKNet (Mix Kernel Size U-form Net), המפחית את עומק הרשת תוך הגדלת מספר הערוצים לשיפור יכולת הלמידה. עם זאת, הפחתת העומק עלולה להוביל לירידה בביצועים הכוללים. כדי להקל על בעיה זו, מוצג מודול קונבולוציוני של ערוץ היברידי, המחליף את המודול העצבי הקונבולוציוני המקורי. מודול זה משלב מנגנון קשב ערוץ בין שכבות הקונבולוציה בעומק ובנקודה, במטרה לחזק את יכולתו של המודל לחלץ תכונות ערוץ יעילות.
כדי להנחות את היישום המעשי, חשוב לציין שהשיטה המוצעת הוערכה על מערכי נתונים של תמונות רפואיות בקנה מידה קטן יחסית, עם רזולוציות תמונה בודדות שנעו בין 500 × 500 ל-1000 × 1000 פיקסלים. לאימון מודל, גודל כל התמונות השתנה ל-224 ×-224 פיקסלים. היישום בוצע באמצעות PyTorch ב-NVIDIA RTX 3090 GPU יחיד. פרמטרים תפעוליים אלה מצביעים על כך שהשיטה אפשרית מבחינה חישובית עבור הגדרות ניסוי מתונות וניתנת להתאמה לגדלים מוגבלים של מערכי נתונים.
לסיכום, מאמר זה מציג שינוי חדשני במבנה הרשת בצורת U ומציג מודול קונבולוציה של ערוצים היברידיים יחד עם מנגנון תשומת לב לערוץ, שניהם משפרים את ביצועי הפילוח במערכי נתונים של תמונות רפואיות. התרומות העיקריות של עבודה זו הן כדלקמן: (1) הצעת מבנה רשת שונה בצורת U עם מודול קונבולוציה היברידי עמוק המחליף את המודול העצבי הקונבולוציוני המקורי. (2) הכנסת מנגנון קשב ערוץ בין שכבת הקונבולוציה העמוקה לשכבת הפיתול הנקודתית כדי לשפר את יכולת חילוץ תכונות הערוץ האפקטיבית של המודל. (3) השגת תוצאות חדישות בו-זמנית על שני מערכי נתונים ציבוריים פופולריים במערך הנתונים של פילוח גרעיני MoNuseg9 עם פחות פרמטרים של מודל (בהשוואה ל-UCtransNet10 עם פרמטרים של 64M) וביצועים משופרים במערך הנתונים של פילוח בלוטות GlaS11 .
שאר המאמר הזה מאורגן כדלקמן. שלב 2 מספק סקירה מקיפה של מחקרים קודמים על UNet1 והווריאציות שלו בפילוח תמונות רפואיות. נבחנים החוזקות והמגבלות של גישות קיימות, יחד עם עבודה קשורה על מנגנוני קשב, רשתות קונבולוציוניות מעורבות ויישומיהן במודלים של סגמנטציה. שלב 3 מפרט את הארכיטקטורה של מודל MixKNet המוצע, כולל שינויים במבנה UNet, שילוב של מנגנון תשומת לב לערוץ ושימוש בקונבולוציה בעומק מעורב. שלב 4 מדווח על תוצאות ניסויים נרחבים, מלווים בדיון ומחקר אבלציה כדי להעריך את התרומה של כל מרכיב. לבסוף, שלב 5 מסכם את המאמר ומתאר כיוונים פוטנציאליים למחקר עתידי.
חלק זה מתחיל בסקירה של מחקרים קודמים על UNet והגרסאות שלו בפילוח תמונות רפואיות, המתאר את החוזקות והמגבלות של השיטות הקיימות. בנוסף, נדון מחקר קשור על מנגנוני קשב ויישומיהם במודלים של סגמנטציה. נבדקות גם התפתחויות אחרונות הכוללות טכניקות קונבולוציה לעומק לשיפור ביצועי הפילוח. ניתוח השוואתי של ה-MixKNet (c) המוצע ומודלים אחרים מוצג באיור 1, שבו קווים מקווקווים מצביעים על חיבורי דילוג.
UNet והווריאציות שלו
ארכיטקטורת UNet הוצעה לראשונה על ידי Ronneberger et al. בשנת 20151 ומאז נעשה בה שימוש נרחב בפילוח תמונות רפואיות. המודל מורכב מנתיב קידוד ונתיב פענוח. המקודד מחלץ תכונות ברמה גבוהה מתמונת הקלט בזמן שהמפענח דוגם ומשלב את התכונות ליצירת מפת פילוח. מאז, בוצעו שינויים שונים בארכיטקטורת UNet כדי לשפר את ביצועיה בפילוח תמונות רפואיות. אחד השינויים הנפוצים ביותר הוא הכנסת חיבורי דילוג, שהוכחו כמשפרים את דיוק הפילוח. Zhou et al.12 הציעו גרסת UNet המשתמשת בחיבורי דילוג צפופים, המאפשרים למודל לשמר מידע מרחבי טוב יותר.
שינוי פופולרי נוסף בארכיטקטורת UNet הוא הוספת מנגנוני קשב. מנגנונים אלה יכולים לעזור למודל להדגיש באופן סלקטיבי את התכונות החשובות ביותר, מה שמוביל ללמידת ייצוג טובה יותר ודיוק סגמנטציה. כמה דוגמאות לגרסאות עם מנגנוני קשב כוללות את Attention UNet2, ResUNet עם שערי קשב13 ו-Dense-UNet עם שערי קשב14. בנוסף לשינויים לעיל, הוצעו גרסאות רבות אחרות של ארכיטקטורת UNet לפילוח תמונות רפואיות. UCTransNet10 היא גרסה של ארכיטקטורת U-Net המשלבת חיבורי דילוג ומודול שנאי. חיבורי הדילוג ב-UCTransNet10 נחשבים מחדש מנקודת מבט של ערוץ, מה שמאפשר שימוש חוזר טוב יותר בתכונות ומפחית את מספר הפרמטרים. מודול השנאי נוסף כדי ללכוד יחסי תלות ארוכי טווח ולשפר את איכות התרגום. UCTransNet10 הוכח כמשיג תוצאות חדישות במספר מדדי תרגום מכונה. Zihan ואחרים הציעו מודל למידה עמוקה בשם LViT15, אותו הם יישמו במשימות ניתוח תמונות רפואיות. כדי להרחיב את הגרסה המפוקחת למחצה של LViT15 ולפצות על המחסור באיכות בנתוני התמונה, הם הציעו את מנגנון איטרציה של תווית פסאודו אקספוננציאלית (EPI). בנוסף, כדי לשמר את התכונות המקומיות של תמונות, הם הציעו את מודול תשומת הלב ברמת הפיקסלים (PLAM), המתמקד באופן סלקטיבי בתכונות תמונה חשובות.
מנגנון קשב
מנגנוני קשב נחקרו רבות בלמידת מכונה, במיוחד בעיבוד שפה טבעית וראייה ממוחשבת. בשנים האחרונות יושמו מנגנוני קשב גם במשימות ניתוח תמונות רפואיות, כולל פילוח תמונה. Bahdanau et al.16 הציגו מנגנון קשב בתרגום מכונה עצבי כדי לשפר את איכות התרגום. המנגנון מאפשר למודל להתמקד באופן סלקטיבי בחלקים הרלוונטיים של רצף הקלט, ולשפר את איכות התרגום. מאז, הוצעו מנגנוני קשב שונים למשימות ניתוח תמונה. סוג נפוץ אחד של מנגנון קשב הוא מנגנון הקשב המרחבי, הכולל החלת משקל על כל פיקסל במפת התכונות על סמך חשיבותו. לדוגמה, Guo et al.17 הציעו מנגנון קשב מרחבי למשימת פילוח כלי הרשתית. המנגנון משתמש במנגנון שער כדי להתאים את שקלול התכונות המרחביות, ומשפר את יכולת המודל להבחין בין כלי השיט לפיקסלים שאינם כלי שיט. סוג נוסף של מנגנון קשב הוא תשומת לב ערוצית, המתמקדת בהתאמת המשקלים של מפות תכונות בין ערוצים. Hu et al.18 הציעו רשת סחיטה ועירור (SENet) המיישמת תשומת לב ערוצית על מפות התכונות, ומשפרת את הביצועים של משימת סיווג התמונה. לאחרונה, מנגנוני קשב שולבו עם רשתות עצביות קונבולוציוניות (CNNs) למשימות פילוח תמונה. לדוגמה, Chen et al.19 הציעו רשת מונחית קשב לפילוח גידולי מוח המשלבת מנגנוני קשב מרחביים וערוצים.
ההתקדמות האחרונה בלמידה מפוקחת למחצה ורב-מודאלית לניתוח תמונה רפואית וחישה מרחוק הוכיחה שיפורים מבטיחים בביצועים. יאנג ואחרים.20 הציעו UMSCS, מסגרת פילוח רב-מודאלית חדשה לא מזווגת הממנפת למידה גנרטיבית חוצה מודאליות ואסטרטגיות מפוקחות למחצה. ז'אנג ועמיתיו הציגו מספר טכניקות מתקדמות: מודל עקביות תלת-ענפית משופר ראייתית לסגמנטציה בפיקוחלמחצה 21, מסגרת למידה אב-טיפוסית מודעת לעצמה וצולב דגימה לפילוח תמונה רפואית22, וגישת אופטימיזציה היררכית מודעת לתדר זמן לזיהוי שיבוש מכ"ם צמצם סינתטי (SAR) בתחום התעופה והחלל23. עבודות אלה מדגישות ביחד את החשיבות של פיקוח היברידי ומודלים של תכונות מודעות לתחום במשימות הדמיה רפואיות והנדסיות כאחד.
קונבולוציה של עומק
קונבולוציה מבחינת עומק נועדה ללכוד מתאמים חכמים בערוץ במפות תכונות הקלט והוכחה כמשפרת את היעילות והדיוק של רשתות עצביות קונבולוציוניות.
אחד המודלים המוקדמים והמשפיעים ביותר מבחינת עומק הוא MobileNet24, שהוצע על ידי הווארד ואחרים ב-2017. MobileNet משתמשת בקונבולוציה הניתנת להפרדה מבחינת עומק, המפעילה קונבולוציה מבחינת עומק ואחריה קונבולוציה נקודתית, כדי להפחית את מספר הפרמטרים והחישוב הנדרשים לשכבות קונבולוציוניות. זה מאפשר ל-MobileNet להשיג דיוק מתקדם במשימות סיווג תמונות תוך שימוש בפחות פרמטרים משמעותית מאשר רשתות עצביות קונבולוציוניות מסורתיות. מאז הצגת MobileNet, הוצעו מספר ארכיטקטורות קונבולוציה אחרות מבחינת עומק, כולל ShuffleNet25, Xception26 ו-ResNeXt27. מודלים אלה משתנים ביישום הספציפי שלהם של קונבולוציה חכמה עמוקה, אך כולם חולקים את המטרה להפחית את המורכבות החישובית של שכבות קונבולוציה תוך שמירה או שיפור הדיוק. קונבולוציה עמוקה יושמה גם על המשימה של פילוח סמנטי, עם מודלים כמו PSPNet28 המשתמשים בקונבולוציה ניתנת להפרדה מבחינת עומק כדי להפחית את דרישות החישוב והזיכרון של שכבות קונבולוציה בקנה מידה גדול. MixNet29 מרחיב עוד יותר את הרעיון של קונבולוציה חכמה עמוקה על ידי הצגת קונבולוציה מעורבת מבחינת עומק, המשתמשת במספר גדלי ליבה כדי ללכוד תכונות בקנה מידה שונה. הוכח שהוא עולה על מודלים חדישים אחרים תוך שמירה על פרמטרים ו-FLOPs דומים. מודלים אלה הראו שיפורים משמעותיים ברמת הדיוק והיעילות על פני רשתות עצביות קונבולוציוניות מסורתיות במשימות פילוח סמנטיות שונות.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
סעיף זה מתאר את ארכיטקטורת MixKNet המוצעת לפילוח תמונות רפואיות. מודל MixKNet מרחיב את ארכיטקטורת UNet, ומשלב מנגנוני קשב ושכבות קונבולוציה מעורבות בעומק. התוכנה ששימשה במחקר זה מופיעה בטבלת החומרים.
1. ארכיטקטורה כוללת
2. צורת U שטוחה
הערה: צמצם את העומק של ארכיטקטורת הרשת העצבית כדי להקטין את המורכבות החישובית ואת גודל המודל, תוך מודעות לכך שהדבר עלול להפחית את היכולת ללמוד ייצוגי נתונים מורכבים.
3. מערבבים את גודל הליבה למקודד
4. ערוץ תשומת לב
5. מערכי נתונים
הערה: שני מערכי נתונים של תמונות רפואיות הזמינים לציבור, כפי שמוצג בטבלה 1 ובטבלה 2, משמשים במחקר זה: GlaS (Sirinukunwattana et al.11) ו-MoNuSeg (Kumar et al.9).
6. פרטי היישום
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
השוואה לשיטות חדישות
ארכיטקטורת MixKNet הוערכה בשני מערכי נתונים של פילוח תמונות רפואיות, GlaS ו-MoNuSeg, והושוותה לשיטות חדישות בתחום. ההערכה בוצעה על ידי דיווח על ציוני הקוביות וה-IoU של השיטה המוצעת ומספר מודלים דומים, כפי שמוצג בטבלה 3. התוצאות מצביעות על כך שארכיטקטורת MixKNet עולה על המודלים האחרים, ומשיגה את ציוני הקוביות וה-IoU הממוצעים הגבוהים ביותר בשני מערכי הנתונים. במערך הנתונים של GlaS11, ה-MixKNet המוצע השיג ציון קוביות ממוצע של 91.18% ו...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
מחקר זה מציג את MixKNet, שינוי חדשני של ארכיטקטורת UNet1 לפילוח תמונות רפואיות, המשלב קונבולוציה בעומק מעורב ומנגנון תשומת לב לערוץ כדי לשפר את ביצועי הפילוח תוך הפחתה משמעותית של המורכבות החישובית. קונבולוציה של הערוץ ההיברידי משלבת מספר גרעינים קונבולוציוניים הפועלים בקבוצות ערוצים נפרדות. עיצוב זה מאפשר לרשת ללכוד מאפיינים מרחביים והקשריים מגוונים בקנה מידה שונה של שדה קליטה בתוך אותה שכבה, ולשפר את יכולתו של המודל לייצג מבנים מקומיים וגלובליים כאחד. בניגוד לפי...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
המחברים מצהירים שאין אינטרסים פיננסיים מתחרים או ניגודי אינטרסים אחרים.
האצווה השנייה של פרויקטי מחקר הרווחה החברתית של נינגבו סיטי לשנת 2023: מחקר ויישום של טכנולוגיות מפתח לזיהוי הונאות ברשת טלקום על בסיס אונטולוגיה ו-NLP (2023S169).
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| מערכת הפעלה לינוקס (אובונטו 22.04) | שונות (קהילת קוד פתוח) | N/A (גרסה 22.04 LTS) | מערכת הפעלה בקוד פתוח לפיתוח https://releases.ubuntu.com/22.04/ |
| NVIDIA RTX 3090 GPU | NVIDIA | 3090 | GPU בעל ביצועים גבוהים ללמידה עמוקה https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/ |
| Python | Python Software Foundation | N/A (גרסה ≥ 3.8) | שפת תכנות לפיתוח AI/ML https://www.python.org/ |
| PyTorch | Meta AI N | /A (גרסה 1.13) | מסגרת למידת מכונה בקוד פתוח https://pytorch.org/ |
| Visual Studio Code (VS Code) | Microsoft | N/A | עורך קוד קל משקל ורב עוצמה https://code.visualstudio.com/ |
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה
בקש הרשאה