הרשמה ל-JoVE נדרשת לצפייה בתוכן זה. התחברו או התחילו בגרסת ניסיון בחינם.

מאמר שיטה

רשת סגמנטציה של פוליפים המבוססת על קונבולציה של גלגל סיניים ותשומת לב כפולה לאבחון נגעים טרום-סרטניים במעי הגס

51 צפיות

DOI:

10.3791/71178

26 ביוני 2026

* These authors contributed equally

במאמר זה

סיכום

פרוטוקול זה מיישם רשת למידה עמוקה בצורת U המשלבת קונבולוציה של גלגל סיניים, תשומת לב כפולה ומיזוג רב-קנה מידה כדי לחלק פוליפים במעי הגס.

תקציר

סגמנטציה מדויקת של פוליפים במעי הגס היא קריטית למניעה ואבחון מוקדמים של סרטן המעי הגס. עם זאת, בשל ההטרוגניות הגבוהה של פוליפים מבחינת צורה, גודל ומרקם, וכן בשל המורכבות של סביבת המעי (כגון קפלים, השתקפויות ספקולריות ושאריות צואה), שיטות קיימות עדיין מתמודדות עם אתגרים משמעותיים באיתור גבולות ובזיהוי פוליפים קטנים. כדי להתמודד עם סוגיות אלו, מאמר זה מציע רשת סגמנטציה של פוליפים המבוססת על קונבולוציה של גלגל סיניים ותשומת לב כפולה (PWD-Net). הרשת המוצעת מאמצת ארכיטקטורת מקודד-מפענח בצורת U, שבה ResNet מאומן מראש משמש כמקודד לחילוץ תכונות מקומיות רב-רמתיות. באופן ספציפי, מודול קונבולוציה של גלגל סיניים (PCM) מוצג בשכבת צוואר הבקבוק כדי ללכוד את המבנה הגאומטרי הגלובלי ואת המידע ההקשרי הרב-כיווני של פוליפים באמצעות גרעיני קונבולוציה מסובבים בזוויות מרובות. מנגנון קשב כפול (DAM) המשלב תשומת לב ערוץ ותשומת לב מרחבית נועד לדכא רעש רקע באופן אדפטיבי ולהעצים את תכונות אזור הפוליפים. בנוסף, נעשה שימוש באסטרטגיית מיזוג תכונות רב-קנה מידה (MSF) לשילוב מידע סמנטי עמוק עם פרטי גבול רדודים, תוך הבטחת שלמות ודיוק של תוצאות הסגמנטציה. ניסויים שנערכו על מערכי הנתונים Kvasir-SEG ו-CVC-ClinicDB מראים כי PWD-Net משיג ממוצע מקדמי קוביות של 0.865 ו-0.944, וציוני IoU של 0.765 ו-0.892, בהתאמה, מה שמעלה משמעותית על השיטות המתקדמות הקיימות. מחקרי אבלציה מאמתים את יעילות כל מודול, והערכות חוצות נתונים מאשרות את יכולת ההכללה החזקה של המודל. מחקר זה מספק פתרון מדויק וחזק לחלוקת פוליפים קלינית, ומציע ערך משמעותי לאבחון מוקדם של נגעים טרום-סרטניים במעי הגס ותומך בהתערבות ממוחשבת.

מבוא

סרטן המעי הגס הוא אחד הגידולים הממאירים הנפוצים ביותר בעולם, עם שיעורי שכיחות ותמותה גבוהים באופן עקבי. מחקרים הראו שרוב סוגי סרטן המעי הגס מתפתחים מפוליפים אדנומטיים, תהליך שלוקח בדרך כלל 10–15 שנים, ומספק חלון זמן יקר ערך לגילוי מוקדם ולהתערבות. עלייה של 1% בשיעור גילוי האדנומה (ADR) יכולה להפחית את הסיכון לסרטן המעי הגס בכ-3%, ולהפחית משמעותית את תמותת המטופלים1. קולונוסקופיה, הנחשבת לסטנדרט הזהב לסקר סרטן המעי הגס, מאפשרת הסרה ישירה של פוליפים במהלך הבדיקה, ובכך מפחיתה ביעילות את שכיחות הסרטן והתמותה.

עם זאת, קולונוסקופיה קונבנציונלית תלויה מאוד בניסיון ובמיומנות של האנדוסקופיסטים. גורמים כמו שיפוט סובייקטיבי, עייפות ויזואלית והסחת דעת עלולים להוביל לשיעור החטאות של 20%–30%, מה שמשפיע ישירות על יעילות הסקר2. לכן, פיתוח מערכות זיהוי בעזרת מחשב (CAD) לסגמנטציה אוטומטית של פוליפים במעי הגס חשוב מאוד לשיפור ADR ולהפחתת אבחנות שלא נענו. סקרים קליניים עדכניים הדגישו עוד יותר את העניין בשילוב בינה מלאכותית בתהליכי הערכת נגעים אנדוסקופיים, ומחזקים את הצורך בשיטות סגמנטציה חזקות וניתנות לשחזור3.

בשנים האחרונות, למידה עמוקה השיגה התקדמות מרשימה בניתוח תמונות רפואיות, במיוחד ברשתות עצביות קונבולוציוניות (CNNs), המדגימות יכולת חזקה בחילוץ וייצוג תכונות למשימות סגמנטציהשל תמונה 4. כמודל סגמנטציה רפואי קלאסי, U-Net משתמש בארכיטקטורת מקודד-מפענח סימטרית ומדלג על חיבורים להשגת סגמנטציה מדויקת ברמת הפיקסלים, והופך לאבן דרך בתחוםזה. בהתבסס על U-Net, הוצעו ארכיטקטורות משופרות רבות כדי להתמודד עם משימות מורכבות של חלוקת תמונות רפואיות. UNet++ מצמצם את הפער הסמנטי בין מפות תכונות של המקודד למפענח על ידי הכנסת חישורים מקוננים ודילוג צפוף6. ResUNet++ משלבת בלוקים שאריתיים, מודולי סחיטה וגירור, קונבולוציות מורחבות ומנגנוני קשב, ומשיגה ביצועים חזקים בחלוקת פוליפים7. U2-Net מאמץ מבנה מקונן בצורת U דו-רמות כדי ללכוד מידע תכונות רב-קנה מידה8. בשנים האחרונות הוצע רשת חלוקה עמוקה מבוססת מקודד כפול, המנצלת מסלולי קידוד ופענוח מקבילים לשיפור דיוק הסגמנטציה9.

בינתיים, הכנסת מנגנוני קשב מספקת פתרונות חדשים לשיפור תכונות ודיכוי רעשים. Attention U-Net משתמש בשערי קשב כדי להתמקד באזורים יעדיים תוך דיכוי מידע רקע לא רלוונטי10. רשת הקשב הכפולה (DANet) משקלת באופן אדפטיבי תכונות הן מערוץ והן מממד מרחבי11, ומשפרת את תפיסת התכונות הקריטיות. רשתות Triple Attention (TANet) משפרות עוד יותר את ביצועי הסגמנטציה באמצעות בחירה אדפטיבית של תכונות רב-קנה מידה12.

עם הצלחת ארכיטקטורות טרנספורמרים בעיבוד שפה טבעית וראיית מחשב13, חוקרים החלו לחקור את יישומן בסגמנטציה רפואית של תמונות. TransUNet הייתה הראשונה שהשתמשה בטרנספורמר כמקודד למידול תלותיות לטווח ארוך ביעילות14. Swin-UNet מאמצת ארכיטקטורת טרנספורמר טהורה ומשיגה אגרגציה גלובלית יעילה של מידע באמצעות מנגנון חלון מוזז15. UTNet מציעה ארכיטקטורה היברידית המשלבת את יכולת חילוץ התכונות המקומית של CNN עם יכולת המידול הגלובלית של Transformers16.

בתחום סגמנטציה של פוליפים, Polyp-PVT עושה שימוש בממיר ראיית פירמידה כדי ללכוד מידע סמנטי גלובלי רב-קנה מידה17, בעוד UNet מקונן רב-קנה מידה משפר את ההבנה הקונטקסטואלית על ידי שילוב Transformers18. מחקרים אחרונים בחנו גם אסטרטגיות למידה עם קורלציה שלילית לסגמנטציה בין תחומיםפוליפים 19, שיפור סגמנטציה מוגבר על ידי גומפרץ20, וארכיטקטורות מבוססות קשב המשלבות הנחיית גבול21. למרות שגישות אלו משפרות במידה מסוימת את ביצועי הסגמנטציה, סגמנטציה של פוליפים עדיין מתמודדת עם מספר אתגרים. ראשית, פוליפים מציגים הטרוגניות גבוהה במורפולוגיה, בגודל ובמרקם, החל ממיקרו-פוליפים קטנים מ-5 מ"מ ועד לפוליפים גדולים העולים על 30 מ"מ, עם צורות הנעות מעגליות ואליפטיות ועד צורות לא סדירות מאוד. שנית, סביבת המעי מורכבת ומשתנה, שבה קפלים ריריים, השתקפויות ספקולריות, שאריות צואה ופסולת מזון גורמים להפרעות רקע חמורות. שלישית, פוליפים רבים בעלי גבולות מטושטשים, עשויים להיות מוסתמים חלקית על ידי קפלים, או טבולים בנוזלי מעיים, מה שהופך את מיקום הגבולות המדויק למאתגר מאוד22.

השיטות הקיימות עדיין מציבות מגבלות ברורות בהתמודדות עם אתגרים אלה. CNNים מסורתיים יעילים בהפקת מרקם מקומי ותכונות קצה; עם זאת, גרעיני קונבולוציה מרובעים קבועים אינם מתאימים ללכידת צורות גאומטריות מגוונות23, במיוחד עבור פוליפים לא סדירים במיוחד, ואינם יכולים למודל ביעילות תכונות גאומטריות רב-כיווניות. שיטות מבוססות טרנספורמרים יכולות למודל תלות גלובלית אך פחות יעילות בלכידת פרטים מקומיים עדינים ומידע על גבולות. יתרה מזאת, המורכבות החישובית הגבוהה שלהם הופכת אותם לפחות מתאימים ליישומים קליניים בזמן אמת24. גישות פילוח פוליפים עדכניות כמו PraNet, המשתמשת במודולי קשב הפוך לשיפור אזורים מרכזיים25, רשתות קשב מונחות גבול שמשפרות את חילוץ תכונות הגבול26, ו-CAFE-Net, שמאחד תכונות מקודד ומפענח דרך מנגנוני קשב צולב27, עדיין נתקלות בייצוג תכונות לא מספק ומיקום לא מדויק של הגבולות כאשר מטפלים בפוליפים קטנים28, גבולות מטושטשים ורקעים מורכבים. יתרה מזאת, רוב השיטות מתעלמות ממורפולוגיה גיאומטרית ואינן מנצלות במלואן מידע הקשרי רב-כיווני, מה שמוביל לחלוקה לא אופטימלית של פוליפים בעלי צורה לא סדירה.

לסיכום, שיטות מבוססות CNN כיום אינן מסוגלות ללכוד תכונות גאומטריות רב-כיווניות בשל התלכותן על גרעיני קונבולוציה מרובעים קבועים. גישות מבוססות טרנספורמרים מציעות מידול גלובלי אך מקריבות דיוק גבול מקומי ומטילות עלויות חישוביות גבוהות. בינתיים, אסטרטגיות קיימות לשיפור קשב והיתוך רב-קנה מידה לא אופטימיזציה משותפת במסגרת אחידה המותאמת במיוחד לחלוקת פוליפים29. פערים אלו מניעים את פיתוח שיטה המתמודדת בו-זמנית עם מידול תכונות גאומטריים, דיכוי רעש אדפטיבי ואינטגרציה של תכונות בקנה מידה חוצה קנה מידה.

כדי להתמודד עם סוגיות אלו, פרוטוקול זה מציג רשת סגמנטציה של פוליפים המבוססת על קונבולוציה של גלגל סיניים ותשומת לב כפולה (PWD-Net). הרשת המוצעת משלבת מידול תכונות גיאומטריות, שיפור קשב רב-ממדי ומיזוג תכונות רב-קנה מידה, המאפשרת סגמנטציה מדויקת של פוליפים מורכבים. התרומות העיקריות של עבודה זו מסוכמות כך: מודול הקונבולוציה של גלגל הסיניים (PCM), בהשראת מבנה גלגל הסיכות, מוצע עיצוב חדשני של גרעין קונבולוציה מסובב שלוכד תכונות גאומטריות רב-כיווניות של פוליפים באמצעות פעולות קונבולוציה בזוויות מרובות (0°, 45°, 90°, 135°, 180°, 225°, 270°, ו-315°). מודול זה מחליף את שכבת הקונבולוציה הקונבנציונלית בשלב צוואר הבקבוק, ומאפשר תפיסה יעילה של כיווני קצוות מגוונים ומשפר משמעותית את הייצוג של פוליפים בעלי צורה לא סדירה. מנגנון תשומת הלב הכפולה (DAM) מטפל ברעשי רקע כגון קפלים, השתקפויות ושאריות צואה בתמונות קולונוסקופיה. מודול קשב כפול המשלב קשב ערוץ וקשב מרחבי. בתוך חיבורי דילוג, מודול זה מדכא באופן אדפטיבי הפרעות רקע ומחזק את תגובות התכונות באזורים פוליפים על ידי זיהוי משותף של "מה" חשוב (מימד הערוץ) ו"היכן" המטרה ממוקמת (ממד מרחבי), ומבטיח שרק תכונות מעודנות מעורבות במיזוג הבא. אסטרטגיית מיזוג תכונות רב-קנה מידה (MSF) שומרת הן על מידע סמנטי עמוק והן פרטי גבול רדודים באמצעות מנגנון היררכי שהוכנס למפענח. על ידי שילוב הדרגתי של תכונות מקודד משודרגות על ידי DAM עם תכונות מפענח עם דגימה מוגברת, אסטרטגיה זו מפצה ביעילות על אובדן פרטים מרחבי הנגרם על ידי דגימה קטנה, ומאפשרת זיהוי מדויק של פוליפים קטנים והגדרת גבולות מדויקת.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

מחקר זה משתמש רק במאגרי נתוני קולונוסקופיה אנונימיים זמינים לציבור (Kvasir-SEG). לא נאספו נתונים חדשים של נבדקים אנושיים. לא נדרשו אישור אתיקה מוסדית והסכמת מטופל מדעת, כפי שאושר במדיניות הסקירה המוסדית לניתוחים רטרוספקטיביים של מאגרי נתונים ציבוריים שלא זוהו.

1. הכנת נתונים

  1. הורד את מאגר הנתונים של Kvasir-SEG מהמאגר הרשמי 33 (https://datasets.simula.no/kvasir-seg/). מאגר הנתונים מכיל 1,000 תמונות פוליפים עם מסכות אמת קרקעיות ברמת פיקסל מתאימות.
  2. חלק את מערך הנתונים באקראי לקבוצות אימון (800 תמונות), אימות (100 תמונות) ובדיקות (100 תמונות) ביחס של 8:1:1 באמצעות זרע אקראי קבוע (seed = 42). ודאו שאין חפיפה בין שלוש תתי-הקבוצות כדי למנוע דליפת נתונים.
  3. שינוי גודל כל התמונות והמסכות המתאימות ל-352 על 352 פיקסלים באמצעות אינטרפולציה ביליניארית לתמונות ואינטרפולציה של שכנים קרובים למסכות.
  4. נרמול ערכי פיקסלים ל-[0, 1] על ידי חלוקה ב-255, ואז מיישם חיסור ממוצע לפי ערוץ של ImageNet (0.485, 0.456, 0.406) ונירמול סטיית תקן (0.229, 0.224, 0.225).
  5. ייסלו את הטרנספורמציות הבאות על קבוצת האימון בלבד (לא על מערכות האימות או הבדיקות): היפוך אופקי אקראי (הסתברות = 0.5); היפוך אנכי אקראי (הסתברות = 0.5); סיבוב אקראי (טווח: −30° עד +30°, הסתברות = 0.5); שינוי גודל אקראי רב-קנה מידה (גורם קנה מידה: 0.75 עד 1.25, הסתברות = 0.5)
    הערה: החלו טרנספורמציות מרחביות זהות הן על התמונה והן על המסכה המתאימה כדי לשמור על יישור. בדוק את נכונות ההגדלה על ידי בדיקה ויזואלית של מספר זוגות תמונה-מסכה מוגברות לפני תחילת האימון.

2. ארכיטקטורה כוללת

הערה: עיין באיור 1 עבור עמוד השדרה של המקודד-מפענח ברמת המקרו של PWD-Net, ובאיור 2 לאינטגרציה ואינטראקציה של מודולי הליבה בתוך זרימת התכונות. הארכיטקטורה הכוללת מתבססת על עיצוב מקודד-מפענח בצורת U כדי להתמודד עם וריאציות בקנה מידה של פוליפים והפרעות רקע בתמונות קולונוסקופיה.

  1. עמוד שדרה ונתיב קידוד (איור 1)
    1. השתמש ב-ResNet-50 מאומן מראש ב-ImageNet (שמקורו בגן החיות הרשמי של דגמי PyTorch) כמקודד עמוד השדרה30. כוונן את כל שכבות המקודד במהלך האימון.
    2. הזן את תמונת הקולונוסקופיה הנכנסת (שגדלה ל-352 על 352 פיקסלים) דרך חמישה שלבים של בלוקים קונבולוציוניים שאריתיים כדי להפיק תכונות היררכיות. הרזולוציה המרחבית של מפות תכונות מדגימה בהדרגה מ-ל- לאורך חמשת השלבים, בעוד שממדי התעלה גדלים בהתאם (64 → 128 → 256 → 512 → 1024).
    3. בצוואר הבקבוק (שכבת המקודד העמוקה ביותר), יש להחליף את שכבת הקונבולוציה הסטנדרטית במודול קונבולוציה של גלגל הסיניים (PCM, המתואר בסעיף 3) כדי ללכוד את המורפולוגיה הגיאומטרית הגלובלית ואת המידע ההקשרי הרב-כיווני ברזולוציה נמוכה.
      הערה: חמשת שלבי המקודד מתאימים לקבוצות השכבות הסטנדרטיות של ResNet-50: conv1, layer1, layer2, layer3 ו-layer4. משקולות מאומנות מראש מספקות אתחול תכונות ברמה נמוכה ובינונית, ומקצרות את זמן ההתכנסות במאגרי נתונים רפואיים קטנים.
  2. רכיבים מרכזיים ואינטראקציה בין תכונות (איור 2 ואיור 3)
    1. החלו את מנגנון תשומת הלב הכפולה (DAM, המתואר בסעיף 4) על הפלט של כל שלב מקודד לפני שידרו למפענח באמצעות חיבורי דילוג. שלב זה מדכא באופן אדפטיבי רעש רקע הנוצר על ידי קפלי מעיים והחזרות ספקולריות, תוך חיזוק תגובת התכונות באזורים פוליפים. רק התכונות המסוננות מועברות לשכבת המפענח המתאימה.
    2. במפענח, יש לשחזר בהדרגה את הרזולוציה המרחבית באמצעות דגימה דו-ליניארית. בכל שכבת מפענח, יש לאחד את התכונות המוגברות מהשלב הקודם של המפענח עם תכונות המקודד המשופרות על ידי DAM באותה רזולוציה מרחבית.
    3. החלו שתי שכבות קונבולוציונליות עוקבות (כל אחת אחריה נרמול אצווה והפעלת ReLU) כדי למזג את המידע רב-קנה מידה. זהו אסטרטגיית מיזוג תכונות רב-קנה מידה (MSF) המתוארת בסעיף 5.
      הערה: המפענח מתקדם משכבות עמוקות לרמות רדודות (שלב 5 → שלב 1), ומבטיח שמידע על לוקליזציה סמנטית עמוקה ומידע על פרטי גבולות רדודים משולבים ביעילות בכל רמה.
  3. יצירת פלט
    1. החלו שכבה קונבולוציונית ואחריה פונקציית הפעלה של סיגמואיד על פלט המפענח הסופי כדי ליצור את מסכת החיזוי.
    2. ביניריזציה של מסכת החיזוי באמצעות סף של 0.5 כדי לקבל את תוצאת הסגמנטציה הסופית, כאשר פיקסלים עם הסתברות חזויה ≥ 0.5 מסווגים כפוליפ והפיקסלים הנותרים כרקע.

3. מודול קונבולוציה של גלגל סיניים (איור 3)

  1. מודול הקונבולוציה של גלגל הסיניים (PCM) מחליף את קונבולוציה צוואר הבקבוק הסטנדרטית כדי ללכוד תכונות גאומטריות רב-כיווניות של פוליפים. מימוש מודול זה כך:
    1. הגדר ליבת קונבולוציה בסיסית W בגודל 3 x 3 עם Cבערוצי הכניסה ו-Cערוצי יציאה .
    2. הגדר את קבוצת זוויות הסיבוב Θ = {0°, 45°, 90°, ..., 315°}. לכל זווית θ ∈ Θ, נוצר את הגרעין המסובב Wθ על ידי יישום סיבוב ביליניארי מבוסס אינטרפולציה על W. כל שמונת הגרעינים המסתובבים חולקים את אותם פרמטרים בסיסיים; רק הסידור המרחבי של המשקלים שונה.
    3. לכל זווית θ, מחשבים את מפת התכונות הספציפית לכיוון:
      figure-protocol-1
      כאשר X היא מפת תכונת הקלט.
    4. אגד את שמונת התכונות הכיווניות באמצעות רצף ערוץ לאורך ציר התעלה, ויוצר טנזור מממד (8 x Cהחוצה) x H x W. לאחר מכן מיישמים קונבולוציה של 1 על 1 כדי להקטין את ממד הערוץ חזרהל-C out, ואחריה נרמול אצווה והפעלת ReLU31:
      figure-protocol-2
      הערה: הסיבוב והאינטרפולציה מתבצעים על משקלי הליבה, לא על מפת תכונות הקלט. עיצוב זה מאפשר חילוץ תכונות רב-כיווני יעיל מבחינת פרמטרים מבלי להעלות את רזולוציית הקלט. במימוש הנוכחי, Cin = 1024 ו-Cout = 1024 בשלב צוואר הבקבוק, בהתאם לממד ערוץ הפלט של שכבת ResNet-50. עיין בחבילת הקוד המשלימה למימוש המלא.

4. מנגנון קשב כפול (איור 4)

הערה: מנגנון תשומת הלב הכפולה (DAM) מוטמע בכל חיבור דילוג כדי לדכא רעש רקע ולשפר תכונות אזור פוליפ הן מערוץ והן מממדים מרחביים.

  1. Channel Attention
    ענף תשומת הלב של הערוצים מזהה אילו ערוצי תכונה הם המידעיים ביותר. בהינתן תכונת קלט F ∈ RC×H×W:
    1. דחסו את הממדים המרחביים באמצעות Global Average Pooling לקבלת מתאר ערוץ z ∈ RC×1×1.
    2. העבר את z דרך MLP דו-שכבתי (שכבות מחוברות במלואן) עם יחס הפחתה r = 16. השכבה הראשונה מצמצמת את הממד מ-C ל-C/16 עם הפעלת ReLU; השכבה השנייה מחזירה אותו מ-C/16 ל-C באמצעות הפעלה סיגמואיד ליצירת וקטור משקל הערוץ Ac:
      figure-protocol-3
      כאשר δ מסמל ReLU ו-σ מסמל את סיגמויד.
  2. תשומת לב מרחבית
    ענף תשומת הלב המרחבית ממקם את האזורים היעדיים:
    1. מיישמים גם איגום מקסימלי וגם איכוב ממוצע לאורך ממדי הערוץ כדי ליצור שתי מפות תכונות דו-ממדיות בגודל 1 x H x W.
    2. מחברים את שני המפות לאורך ציר הערוץ ליצירת טנזור בגודל 2 x H x W. הניחו שכבה קונבולוציונית בגודל 7 על 7 ואחריה הפעלה סיגמואידית ליצירת מפת משקל מרחבית As ∈ R1×H×W:
      figure-protocol-4
  3. פיצ'ר פיוז'ן
    1. מאחד את פלטי הערוץ והקשב המרחבי עם תכונת הקלט באמצעות כפל לפי אלמנט:
      figure-protocol-5
      כאשר α ו-β הם מקדמי איזון ניתנים ללמידה, שניהם מאותחלים ל-0.5 ומתעדכנים יחד עם פרמטרי הרשת באמצעות אופטימיזציה מבוססת גרדיאנט במהלך האימון.
      הערה: עיין בחבילת הקוד המשלימים (dam_module.py) למימוש מלא.

5. מיזוג תכונות רב-קנה מידה

  1. יישמו את אסטרטגיית מיזוג תכונות רב-קנה מידה (MSF) במפענח כדי להתמודד עם אובדן פרטים מרחבי בתכונות עמוקות. בכל שלב מפענח, בצע את הדברים הבאים:
  2. העלו את מפת התכונות משלב המפענח הקודם בפקטור של 2 באמצעות אינטרפולציה בילינארית.
  3. מחברים את התכונות המוגברות עם תכונות המקודד המוגברות על ידי DAM ברזולוציה המרחבית המתאימה לאורך ציר הערוץ.
  4. הניחו שתי שכבות קונבולוציה רצופות של 3 על 3 (כל אחת אחריה נרמול אצווה והפעלה של ReLU32) כדי למזג את התכונות המקושרות.
    הערה: מיזוג חוצה רמות זה מבטיח שפרטי הגבול של פוליפים (המסופקים על ידי תכונות מקודד רדוד) ולוקאליזציה סמנטית (המסופקת על ידי תכונות עמוקות) נשמרים בו-זמנית, ויוצרים תוצאות סגמנטציה מדויקות.

6. פונקציית אובדן ותצורת אימון

  1. פונקציית אובדן
    1. פונקציית אובדן היברידית L_total מאומצת כדי לאופטימיזציה משותפת של הרשת, תוך התמודדות עם חוסר האיזון הנפוץ בין החזית לרקע במחלקות בחלוקת פוליפים.
      אובדן אנטרופיה בינארית (LBCE) מודד את דיוק הסיווג ברמת הפיקסל:
      figure-protocol-6
      כאשר N הוא סך כל הפיקסלים, yi ∈ {0,1} היא תווית אמת יסודית, ו-ŷi ∈ [0,1] היא ההסתברות החזויה.
    2. אובדן קוביות (LDice) מכמת את הדמיון הקבוצתי בין האזורים החזויים לאזורי האמת הקרקעית:
      figure-protocol-7
      figure-protocol-8
      כאשר ε הוא גורם החלקה (מוגדר ל-1 x 10⁻5) כדי להימנע מחלוקה באפס.
      הגדר λ = 0.5 כדי לאזן את התרומות של שני איבר ההפסד.
  2. תצורת אימון
    1. אתחול את המקודד עם משקולות ResNet-50 מאומנות מראש ב-ImageNet. אתחול כל שכבות המפענח, פרמטרי PCM ו-DAM באמצעות אתחול אחיד של Kaiming.
    2. הגדר את האופטימייזר ולוח הזמנים להדרכה כדלקמן. השתמש באופטימייזר אדם עם β₁ = 0.9 ו-β₂ = 0.999. הגדר את קצב הלמידה ההתחלתי ל-1 x 10⁻⁴. הפעילו לוח זמנים לקצב למידה עם אנילינג קוסינוס עםT max = 50 ו-ηmin = 1 x 10⁻⁶. השתמש בגודל אצווה של 16 ותאמן את המודל ל-50 אפוקים.
    3. לאמן את המודל ל-50 אפוקים על סט האימון (800 תמונות). בסוף כל תקופה, העריכו את המודל על מערך האימות (100 תמונות) תוך שימוש במקדם הקוביות כמדד ניטור עיקרי.
    4. שמור את נקודת הביקורת של המודל שמשיגה את מקדם הקוביות הגבוה ביותר בקבוצת הוולידציה. השתמש בנקודת ביקורת זו כמודל סופי לכל הערכות הבאות על קבוצת הבדיקה.
      הערה: עצירה מוקדמת אינה מיושמת במפורש. אסטרטגיית בחירת נקודות ביקורת קוביות לאימות הטוב ביותר משמשת כקריטריון בחירת המודל. כל הניסויים מתבצעים באמצעות סביבת החומרה והתוכנה המפורטת בטבלת החומרים. אימון ל-50 אפוקים על 800 תמונות לוקח כ-2 שעות בתצורה המתוארת. כל התוצאות המדווחות מתקבלות מריצת אימון אחת באמצעות הזרע האקראי שצוין (seed = 42). עיין בחבילת הקוד המשלים עבור סקריפט ההדרכה המלא.

7. פסאודו-קוד

  1. השתמש באלגוריתם 1 כמפת זרימת העבודה המלאה עבור PWD Net. התאם את בלוקי PCM, DAM, הארכיטקטורה הראשית וצינור האימון באלגוריתם עם הקבצים המתאימים בחבילת הקוד המשליפה.
  2. מימוש בלוק ה-PCM המוצג בקווים 4 עד 12. הגדר גרעין בסיס של קונבולוציה 3 על 3 ויצר שמונה גרעינים מסתובבים בזווית 0°, 45°, 90°, 135°, 180°, 225°, 270°, ו-315°, באמצעות אינטרפולציה בילינארית.
  3. שמור על אותם פרמטרים בסיסיים ללמידה לכל גרעיני PCM מסובבים. עבור כל זווית סיבוב, חשב מפת תכונה אחת ספציפית לכיוון.
  4. לאחד את שמונת מפות התכונות של PCM לאורך ממד הערוץ. החלו קונבולוציה של 1 על 1, נרמול אצווה והפעלה של ReLU כדי לשחזר את ממד הערוץ המקורי.
  5. מימוש בלוק ה-DAM המוצג בקווים 14 עד 19. הפעילו את Global Average Pooling ליצירת מתאר הערוץ, ואז העבירו דרך MLP דו-שכבתי עם יחס הפחתה של 16 כדי לקבל משקלי ערוצים.
  6. יצר את מפת תשומת הלב המרחבית על ידי יישום איגוד ממוצע לפי ערוץ ומקסימום איגוד על תכונת הקלט. חבר את שתי המפות ועבד אותן עם קונבולוציה של 7 על 7 ואחריה הפעלה של סיגמואיד.
  7. מאחד את ערוץ ה-DAM ויציאות הקשב המרחבי עם תכונת הקלט באמצעות כפל לפי אלמנט. שקלו את שני מפות הקשב במקדמים ניתנים ללמידה α ו-β, שניהם מאותחלים ל-0.5.
  8. בנה את ארכיטקטורת הרשת הראשית של PWD המוצגת בקווים 21 עד 32. העבר את תמונת הקלט דרך חמישה שלבים של מקודד ResNet 50 מאומן מראש כדי לקבל e1 עד e5, כאשר הרזולוציה המרחבית יורדת מ-H x W ל-H/32 x W/32.
  9. מרח PCM על e5 בצוואר הבקבוק. החלו DAM על e1 ל-e4 לפני שליחת התכונות הללו למפענח דרך חיבורי דילוג.
  10. פענח את מפת התכונות משכבות עמוקות לרמות רדודות. בכל רמת מפענח, העלו דגימה לתכונה הקודמת, חיברו אותה עם תכונת המקודד המשופר DAM המתאימה, והחלו את DoubleConv למיזוג תכונות.
  11. יצר את פלט הסגמנטציה עם קונבולוציה של 1 על 1 ואחריה הפעלה של סיגמואיד. השתמשו במפת ההסתברות הפיקסלית שהתקבלה כמסכה החזויה.
  12. מיישם את לולאת האימון שמוצגת בשורות 34 עד 39. בכל תקופה, יש לבצע הפצה קדימה דרך PWD Net ולחשב את המסכה החזויה.
  13. חשב את אובדן האימון כ-0.5 x הפסד BCE ועוד 0.5 x הפסד קוביות. עדכן את כל הפרמטרים הניתנים ללמידה עם האופטימיזציה של אדם באמצעות backpropagation.

אלגוריתם 1: סגמנטציה של פוליפים PWD-Net
1: קלט: תמונת קולונוסקופיה I ∈ RH×W×3
2: תפוקה: Segmentation mask M ∈ {0,1}(H×W)
3:
4: פונקציה PCM(X) ▷ מודול קונבולוציה בגלגל הסיניים
5: הגדר גרעין בסיס W (3 x 3), זוויות Θ = {0°, 45°, ..., 315°}
6: עבור כל θ ∈ Θ עשה
7: Wθ ← BilinearRotate(W, θ) ▷ גרעין סיבוב
8: Yθ ← Conv2d(X, Wθ) ▷ תכונות ספציפיות לכיוון
9: סוף עבור
10: Y ReLU(BN(Conv1 x 1(Concat({Y θ})))) ▷ אגרגט
11:החזרת Y
12: פונקציית סוף
13:
14: פונקציה DAM(F) ▷ מנגנון קשב כפול
15: Ac ← סיגמואיד (MLP(AvgPool(F))) ▷ קשב ערוץ (r=16)
16: As ← Sigmoid (Conv7 x 7([AvgPool(F); MaxPool(F)])) ▷ תשומת לב מרחבית
17: F' ← F ⊗ (α · Ac + β · As) ▷ מיזוג עם α ללמידה, β (init=0.5)
18: חזרה F'
19: פונקציית סוף
20:
21: פונקציה PWD-Net(I)
22: מקודד: e1,e 2,e 3,e 4, e5 ← ResNet50_Stages(I) ▷ מקודד מאומן מראש בעל 5 שלבים
23: צוואר בקבוק: b ← PCM(e5) ▷ החלו PCM בצוואר בקבוק
24: דילוג על חיבורים: si ← DAM(ei) עבור i = 1, 2, 3, 4 ▷ תכונות מקודד מסנן
25: מפענח:
26: d4 ← DoubleConv(Concat(Up(b),s 4))
27: d3 ← DoubleConv(Concat(Up(d 4),s 3))
28: d2 ← DoubleConv(Concat(Up(d 3),s 2))
29: d1 ← DoubleConv(Concat(Up(d 2),s 1))
30: M ← סיגמואיד (Conv1 x 1(d1))
31: חזרה M
32: פונקציה סופית
33:
34: אימונים:
35: לכל תקופה עשה
36: M̂ ← PWD-Net(I)
37: L ← 0.5 · BCE(M̂,M gt) + 0.5 · DiceLoss(M̂, Mgt) ▷ λ = 0.5

38: עדכן פרמטרים באמצעות backpropagation (אדם אופטימיזציהr)
39: סוף עבור

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

סידור ניסיוני
מערך נתונים

מערך הנתונים של Kvasir SEG שימש להערכת התנהגות הפיצול של PWD Net בתמונות קולונוסקופיה עם הופעות פוליפים הטרוגניות. מאגר הנתונים מכיל 1,000 תמונות פוליפים מוערות בפיקסלים וכולל שונות בגודל, צורה, מרקם, תאורה ומורכבות הרקע, מה שהופך אותו למתאים להערכת זיהוי מטרות קטנות, מיקום גבולות ועמידות להפרעות ויזואליות. מערך הנתונים חולק לתת-קבוצות אימון, אימות ומבחן, וקבוצת הבדיקות הסופית שימשה רק להערכת ביצועים. התפלגות התמונ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

מספר בחירות עיצוב בפרוטוקול PWD-Net הן קריטיות להשגת תוצאות סגמנטציה אמינות ודורשות תשומת לב קפדנית במהלך היישום. ראשית, הבחירה והאתחול של עמוד השדרה של המקודד משפיעים ישירות על התנהגות ההתכנסות והביצועים הסופיים. הפרוטוקול משתמש במקודד ResNet-50 שאומן מראש על ImageNet, המספק אתחול תכונות ברמה נמוכה ובינונית. זה חשוב במיוחד במשימות סגמנטציה רפואית של תמונות שבהן נתוני ההכשרה הזמינים מוגבלים (800 תמונות במחקר הנוכחי). כיוונון עדין של כל שכבות המקודדים, במקום הקפאתן, מאפשר לרשת להתאים את ה...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

למחברים אין מה לחשוף.

תודות

מחקר זה מומן על ידי תוכנית המחקר והפיתוח המרכזית הלאומית של סין (תוכניות מס' 2022YFC3500200 ו-2022YFC3500204).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
Adam Optimizerכלול ב-PyTorch
AlbumentationsAlbumentations Teamv1.0+ספריית הרחבת נתונים
CUDA ToolkitNVIDIAv11.3+תאוצת GPU
Kvasir-SEG datasetSimulaMethttps://datasets.simula.no/kvasir-seg/
MatplotlibMatplotlib Communityv3.4+ויזואליזציה של עקומות אימון
NumPyNumPy Communityv1.21+חישוב מספרי
NVIDIA Tesla P100NVIDIAP100-PCIE-16GBGPU לאימון ולהסקה
OpenCVOpenCV Communityv4.5+עיבוד תמונה מקדים
PythonPython Software Foundationv3.8+שפת תכנות
PyTorchMeta Platformsv1.12+מסגרת למידת עומק
ResNet-50 pretrained weightsPyTorch Model ZooImageNet-1K pretrained
UbuntuCanonical18.04+מערכת הפעלה

הדפסות חוזרות והרשאות

תגיות

רפואהגיליון 232גיליון 232ערך ריקגיליוןמנגנון קשב כפולהיתוך מאפיינים רב-קנה מידהלמידה עמוקהעיבוד תמונה רפואית