$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
מערך הנתונים כולל סך של 1,190 פרוסות CT מתוך 110 מקרים, המחולקים לשלוש קטגוריות: תקינים (55 מקרים), שפירים (15 מקרים) וממאירים (40 מקרים). כל מקרה מורכב ממספר פרוסות CT (בטווח של כ-80 עד 200 פרוסות לכל מקרה), המציעים תצפיות אקסיאליות מגוונות של אזור החזה. תמונות ה-CT התקבלו ב-DICOM באמצעות סורק SOMATOM עם פרמטרי התמונה סטנדרטיים: מתח צינור = 120 קילווולט, עובי פרוסה = 1 מ"מ, רוחב חלון = 350–1,200 יחידות הונספילד (HU), וערכי מרכז חלון = 50–600 HU, במהלך עצירת נשימה מלאה.
כל התמונות הוסרקו לחלוטין לפני הניתוח כדי להסיר כל מידע אישי מזהה (PII). מערך הנתונים אושר באופן אתי על ידי ועדות הביקורת המוסדיות של המרכזים הרפואיים המשתתפים, כאשר הסכמה בכתב בוטלה על ידי ועדת הפיקוח. המקרים כללו אנשים מרקעים מגוונים כגון עובדי ממשלה, חקלאים ותושבים ממספר מחוזות עיראקיים (כולל בגדד, וסיט, דיאלה, סלאח א-דין ובבל) עם מגוונים במגדר, גיל, רמת השכלה ומצב חיים.
מכיוון שמאגר הנתונים זמין לציבור ואינו מזוהה, לא נדרשה אישור אתי נוסף לשימוש בו במחקר זה. מערך הנתונים עומד בתנאים וההגבלות שנקבעו על ידי התורמים המקוריים ופלטפורמת האחסון.
המתודולוגיה של מחקר זה עושה שימוש בתהליך רב-שלבי שנועד ליצור מודל חיזוי בעזרת מאגר הנתונים IQ-OTH/NCCD לסרטן ריאות21. שיטה זו יוצרת במה חזקה למכשירי בריאות ממוקדי צרכן שבהם נדרשת פחות השהיה, מה שיכול להעניק דיוק טוב יותר. איור 2 מציג את מנגנון העבודה של המודל המוצע.

איור 2: דיאגרמת זרימת העבודה של המודל המוצע המתארת קדם-עיבוד, שדרוג, סיווג Vision Transformer ושלבי הערכה. אנא לחצו כאן לצפייה בגרסה גדולה יותר של איור זה.
1. תיאור מערך הנתונים
מאגר הנתונים של סרטן הריאות IQ-OTH/NCCD נאסף בבית החולים ההוראה עיראק-אונקולוגיה/המרכז הלאומי למחלות סרטן בסתיו 2019. חלק האימון במאגר הנתונים ששימש כלל 1,097 תמונות שתיאורן מוצג בטבלה 2, שממחישה את ספירת המדגמים של מחלקות שונות.
| מחלקה | מספר התמונות |
| רגיל | 416 |
| שפירים | 120 |
| ממאיר | 561 |
טבלה 2: דוגמאות של תמונות CT תקינות, שפירות וממאירות מתוך מאגר הנתונים.
מאגר הנתונים של סרטן ריאות IQ-OTH/NCCD נבחר בזכות הייצוג המקיף שלו של סריקות CT תקינות, שפירות וממאירות. בעוד שקיימים מאגרי נתונים אחרים, כגון LIDC-IDRI ו-NSCLC-Radiomics, הם מתמקדים בעיקר בזיהוי נודולים או שחסרים מספיק דגימות של מקרים שפירים. מאגר הנתונים IQ-OTH/NCCD מתאים במיוחד למחקר שלנו, שכן הוא מאפשר ל-Vision Transformer ללמוד תכונות מובחנות בכל שלוש הקטגוריות, ומאפשר סיווג חזק של דפוסים עדינים בתמונות CT ריאות.
2. קדם-עיבוד נתונים
עיבוד מוקדם הוא שלב חשוב בשיפור ביצועי המודל באמצעות עקביות והתאמות מתאימות לנתונים שיעובדו דרך הרשת העצבית. כדי להבטיח עקביות בגודל הקלט של הרשת העצבית, הגדלנו את כל התמונות לאותו מימד של 256 על 256 פיקסלים, ונירמלנו את הנתונים לערך פיקסל בין 0 ל-1 בתקווה לשפר את אימון המודלים והתכנסות. טבלה 3 מכילה את ערכי טכניקת ההגדלה.
| טכניקה | ערך |
| נרמול | - |
| שינוי גודל | image_size x image_size |
| סיבוב אקראי | פקטור=0.02 |
| רנדום-זום | height_factor=0.2, width_factor=0.2 |
טבלה 3: טכניקות הגברה יישומיות עם טווחי פרמטרים.
כדי להגדיל את עמידות המודל מול התאמת יתר ולשפר את יכולתו להכליל, מיושמות טכניקות הגדלת נתונים כמו סיבובים אקראיים וזום, המדמים זוויות וגדלים שונים של הופעות סרטן ריאות כפי שהן מופיעות אצל מטופלים שונים. סיבובים אקראיים עם זוויות שנדגמו באופן אחיד מ-0.02 רדיאנים וטרנספורמציות זום אקראיות עם גורמי גובה ורוחב משתנים יושמו במחקר זה. התמונות לאחר ההרחבה מוצגות באיור 3.

איור 3: תמונות CT לאחר השדרוג המדגימות סיבוב, זום ונרמול לשיפור הכללת המודל. אנא לחצו כאן לצפייה בגרסה גדולה יותר של איור זה.
נדרשות טכניקות קדם-עיבוד אלו, והשדרוג שימש בכל הקטגוריות כדי להבטיח את עמידות המודל.
3. ארכיטקטורת מודלים
בהתבסס על מסגרת Vision Transformer (ViT) החדשנית לטיפול יעיל בנתוני תמונה מסובכים, ארכיטקטורת המודל מיועדת לסווג סריקות CT לשלוש קטגוריות: נורמלית, שפירה וממאירות. בשיטה זו, תמונות קלט של 256 x 256 פיקסלים מעובדות. כדי להבטיח עקביות ולקדם למידת מודלים יעילה יותר, כל תמונה עוברת מספר פעולות קדם-עיבוד, כגון שינוי גודל ונירמול. כדי לשפר את עמידות המודל לשינויים בקנה מידה ובכיוון התמונה, העיצוב מתחיל בשכבת הגדלת נתונים המשתמשת בשיטות הכוללות נרמליזציה, שינוי גודל, סיבובים אקראיים של 0.02 רדיאן וזום אקראי של עד 20%. לאחר ההגדלה, המודל מוציא 16 פאצ'ים בגודל 16 על 16 פיקסלים מכל תמונה, כך שלכל תמונה יש 256 פאצ'ים.
אלגוריתם 1 מגדיר את זרימת העבודה, המודל המוצע וכיצד הוא נבנה, ואת הכוונון המדויק שמתבצע ביחס למודל.
אלגוריתם 1: סיווג סרטן ריאות באמצעות Vision Transformers
קלט: סט תמונות CT I מתוך מאגר הנתונים IQ-OTH/NCCD
פלט: תוצאות סיווג C לקטגוריות: נורמלי, שפיר, ממאיר
עיבוד מוקדם:
for each image i in I do
i <- Resize(i, 256 x 256) // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i) // Apply random rotations and zooms
end for
הגדרת הדגם:
Initialize Vision Transformer (ViT) Model
Set number of patches P = 16 x 16
Set number of heads H = 6 in multi-head attention
הדרכה:
for epoch = 1 to MaxEpochs do
for each batch b in I do
Patches <- ExtractPatches(b, P)
EncodedPatches <- PatchEncoder(Patches)
AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
ClassLogits <- TransformerEncoder(AttentionWeights)
Loss <- ComputeLoss(ClassLogits, TrueLabels)
UpdateModelWeights(Loss)
end for
if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
break
end if
end for
אימות:
Split data into TrainingSet (80%) and ValidationSet (20%)
ComputeValidationMetrics(ValidationSet)
הערכה:
C <- Classify(I)
ComputePerformanceMetrics(C)
Return C
כדי לשמר את הקשרים המרחביים בין התיקונים, פאצ'ים אלו מושטחים (משוואה 1) לווקטורים בממדים 768 (כי לכל פאץ' יש 16 x 16 x 3 = 768) ואז נשלחים דרך שכבת קידוד פאץ', שמקרינה כל וקטור למרחב 64 ממדי על ידי שילוב הטמעות מיקומיות. ליבת הארכיטקטורה מורכבת משמונה שכבות שנאי, שכל אחת כוללת מנגנון תשומת לב רב-ראשי עם שישה ראשים, המאפשרים למודל להתמקד בחלקים שונים של התמונה בו-זמנית וללכוד מגוון רחב של תכונות. הוא מיוצג באמצעות משוואות 2, 3 ו-4.

כאשר μ הוא הממוצע ו-σ2 הוא השונות של הקלט x, ו-ε הוא קבוע קטן שמונע חלוקה באפס.

כאשר Q היא מטריצת השאילתה, K היא מטריצת המפתח, V היא מטריצת הערכים, ו-dk הוא ממד וקטורי המפתח.


כאשר WiQ, WiK ו-WiV הם מטריצות המשקל שנלמדו עבור שאילתות, מפתחות וערכים, בהתאמה, ו-WO היא מטריצת המשקל הפלט.
דיאגרמת הבלוקים של המודל המוצע מוצגת באיור 4.

איור 4: דיאגרמת בלוקים של מודל Vision Transformer עם ראש MLP, המפרטת שכבות עיבוד עיקריות וארכיטקטורה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
כל שכבת טרנספורמר כוללת תפיסה רב-שכבתית (MLP) עם יחידות נסתרות שמוגדלות תחילה עד 128 ואז חזרה ל-64, מה שמרחיב ודחס את זרימת המידע כדי ללכוד תלות מורכבות.
Dropout מיושם באופן אסטרטגי בקצב של 0.1 בתוך מנגנוני הקשב ו-MLPs כדי למנוע התאמת יתר. הפלט ממקודד השנאי מעובד דרך ראש MLP המורכב משתי שכבות צפופות עם 2,048 ו-1,024 יחידות, בהתאמה, תוך שימוש ביחידות שגיאה ליניאריות גאוסיות (GELU) להפעלה, שהוכח כיעיל ביישומי למידה עמוקה. זה מושג באמצעות משוואה 5.

כאשר W1 ו-W2 הן מטריצות משקל, b1 ו-b2 הן הטיות, ו-GELU היא פונקציית ההפעלה שבה משתמשים.
השתמשו ב-dropout של 0.1 בשכבות השנאים כדי למנוע התאמת יתר מבלי לאבד מידע על תכונות חשובות. פונקציית ההפעלה של GELU שימשה בשל תכונותיה הלא-ליניאריות החלקות, המעודדות זרימת גרדיאנט והתכנסות במודלים מבוססי שנאי. ה-dropout מוסדר באמצעות משוואה 6.
כאשר p הוא שיעור הנשירה (למשל, 0.1 או 0.5), ושכבת הנשירה מגדירה באקראי שבר p מיחידות הקלט לאפס במהלך האימון.
שיעור נשירה של 0.5 בשכבות אלו מסייע עוד יותר במניעת התאמת יתר. השכבה האחרונה של המודל היא שכבת לוגיט (משוואה 7) שמפיקה שלושה לוגיטים מסוג המתאימים לקטגוריות נורמלית, שפירה וממאירות, באמצעות פונקציית אובדן אנטרופיה צולבת קטגורית דלילה (משוואה 8) המתאימה להגדרת סיווג רב-מחלקית זו.


כאשר zi הוא וקטור הלוגיטס של המחלקה i, SoftMax(zi)) מייצג את ההסתברויות החזויות, ו-yi הוא תווית המחלקה האמיתית.
המודל מורכב באמצעות אופטימייזר AdamW (משוואות 9, 10, 11, 12 ו-13), הרחבה של אופטימייזר אדם שמטפלת ביעילות רבה יותר בירידה במשקל, עם קצב למידה של 0.001 ודעיכת משקל של 0.0001, מה שמייעל הן את מהירות הלמידה והן את יציבות המודל.





כאשר mt ו-vt הם המומנטים הראשונים והשניים של הגרדיאנטים,
והם
הרגעים המתוקנים על ידי הטיה, η הוא קצב הלמידה, ו-ε הוא קבוע קטן למניעת חלוקה באפס.
המודל, כאשר הוא מאומן, משתמש בגודל אצווה של 32 כדי לנצל את האצת GPU לחישוב מהיר יותר, ומוגדר לאימון ל-100 אפוקים.
אבל לאימון יש מנגנון עצירה מוקדם של אובדן אימות כדי להגביל את האימון כאשר המודל מפסיק להשתפר, כדי לחסוך משאבים חישוביים ולמנוע אימון יתר של 5 תקופות רצופות. ביצועי המודל נמדדים באמצעות מדדים כמו דיוק קטגורי דליל ודיוק שני המובילים, שמעשירים את יכולת הסיווג של המודל בין הקטגוריות החזויות הסבירות ביותר. קריאות חוזרות לאימון מודל כוללות נקודות ביקורת שיצילו את המודל בעל הביצועים הגבוהים ביותר בהתאם לדיוק האימות כדי להבטיח שהגרסה המוצלחת ביותר של המודל תישמר לאחר סיום תהליך האימון. ארכיטקטורה חזקה ומתוכננת היטב זו מנצלת את יכולות הטרנספורמרים לעיבוד נתוני הדמיה רפואית בגישה מתקדמת מאוד לשימוש בשיטות בינה מלאכותית עכשווית ליישומים מרכזיים באבחון רפואי.
4. הכשרה ואימות
המודל אומן בסביבת Kaggle באמצעות כרטיס מסך NVIDIA P100, ובמהלך תהליך האימון נעשה שימוש בירידת גרדיאנט מיני-אצווה עם גודל אצווה של 32. האופטימיזציה ששימשה באימון הייתה AdamW עם קצב למידה של 0.001 וירידה במשקל של 0.0001; זו הייתה איזון טוב בין התכנסות מהירה לבין רגולריזציה מסוימת. המודל אומן ל-100 תקופות, אך נעשה שימוש בעצירה מוקדמת על אובדן אימות עם סבלנות של 5 תקופות. בפשטות, אם האימון לא שיפר את אובדן האימות במשך 5 תקופות רציפות, האימון היה נעצר בגלל התאמת יתר ויעילות חישובית. ברוב המקרים, מודל זה החזיר משקלים מהתקופה עם אובדן האימות הנמוך ביותר, מה שמעיד שהוא מתפקד בצורה מיטבית ולא נדרש להריץ את כל 100 האפוקים. סך הכל כ-32 דקות לאימון הדוגמן.
במהלך ההכשרה, המדדים כללו דיוק קטגורי דליל ודיוק בשני הראשונים, שנבדקו הן בערכות אימון והן במערכות אימות. מדדים אלו מספקים תובנות לגבי כמה פעמים מודל חוזה את המחלקה הנכונה והאם המחלקה הנכונה נמצאת בין שתי התחזיות העליונות, דבר שחשוב ביישומים רפואיים כי סיווגים שגויים בביטחון גבוה עלולים לגרום להשלכות משמעותיות. עקומות הלמידה לאובדן ודיוק מוצגות באיור 5.
.
איור 5: עקומות דיוק והפסד של אימון ואימות לאורך 50 תקופות המראות למידה יציבה והתאמת יתר מינימלית. אנא לחצו כאן כדי לצפות בגרסה רחבה יותר של איור זה.
במחקר הנוכחי לא בוצעה אימות הדדי. הגדרה זו אפשרה ניסויים יעילים בארכיטקטורת המודלים, כולל התאמות לשכבות שנאי ולגדלי ראשי MLP, תוך הבטחת הכללה טובה של המודל על נתוני אימות בלתי נראים.
5. ניתוח סטטיסטי
ביצועי מודל Vision Transformer נותחו סטטיסטית בהתבסס על מאגר נתוני סרטן הריאות IQ-OTH/NCCD. דיוק, זיכרון, ציון F1 ודיוק חושבו באמצעות משוואות 14,15,16,17 בהתאמה. ארבעת המדדים הללו נחשבים למדדים המקובלים לשימוש במשימות סיווג, בכך שהם יכולים לחשוף מידע על ביצועי המודל בסיווג ובסיווג לפי כל מחלקה.




הזיכרון הוא מדד ליכולת המודל לזהות את כל המקרים הרלוונטיים במחלקה, בעוד דיוק הוא היחס של זיהויים חיוביים שהיו נכונים בפועל. ציון הפורמולה 1 מאזן בין זיכרון לדיוק כאשר שניהם חשובים.
מדדי הביצועים ששימשו להקצאה זו היו משוואת מקדם הקורלציה של מת'יוס (MCC) 18- ומשוואת קאפה של כהן 19.


כאשר P0 הוא ההסכמה הנצפית בעוד Pe הוא ההסכמה הצפויה.
ה-MCC הוא מדד מקיף של ביצועי הסיווג, תוך התחשבות הן בחיוביים אמיתיים והן בשליליים, חיוביים שגויים ושליליים שגויים. ערכו יכול להיות בין -1 ל-1, כאשר 1 הוא חיזוי מושלם, 0 הוא חיזוי אקראי, ו-1 הוא אי-הסכמה מוחלטת בין התוויות החזויות לאמיתיות. ה-MCC היה בעל ערך להשוואות בין ביצועי מודלים שונים כאשר הוא מיושם על מערכי נתונים לא מאוזנים וסיפק מדד מאוזן ללא קשר לגודל המחלקות השונים.
כחלק מניתוח סטטיסטי נוסף, חושב ציון F2, שהתמקד בקריאת החזרה, כפי שמוצג במשוואה 20.

ביצועי המודל גם נמדדו באמצעות שגיאת ממוצעת בריבוע (MSE), שגיאת שורש ממוצעת בריבוע (RMSE) ושגיאה ממוצעת מוחלטת (MAE) - שהן בדרך כלל מדידות למשימות רגרסיה אך שונו כאן למשימת הסיווג כדי לכמת את גודל השגיאה בממוצע ללא התחשבות בכיוון.
כדי לקבוע האם יהיה מעשי לשלב ViTs במכשירי בריאות ממוקדי צרכן, ביצענו תוצאות הערכת ביצועים מקיפות שהתמקדו אך ורק ביעילות הזמנית של המודל. יצרנו פונקציות שמדווחות על הזמן הנדרש לחזות תמונה אחת או פשוט מספר תמונות, שכן זה הופך לרלוונטי במיוחד ליישומים בזמן אמת. עבור כל תמונה, לפני שמתחילים לחזות, הנתונים מעובדים מראש כך שיהיו בצורת התמונה הרצויה על ידי המודל. הזמן שבו התחזית התחילה וזמן השלמת התחזית רשמנו כדי לקבל את תוצאות הזמן וההשהייה. הזמן וההשהיה הממוצעת חושבו באמצעות משוואה 21 ומשוואה 22 בהתאמה.


איפה:
- N הוא מספר התמונות (דגימות).
- TEND הוא הזמן שנרשם לאחר חיזוי התמונה ה-i.
- Tstart הוא הזמן שנרשם לפני חיזוי התמונה ה-i.
נערכו ניסויים נוספים להערכת עמידות מודל Vision Transformer שהצענו על ידי הכנסת רעש וטשטוש שיטתי לתמונות. רעש גאוסיאני נוסף לכל פיקסל עם מקדם רעש של 0.4 תוך חיתוך ערכי פיקסלים בטווח [0,1]. גורם הטשטוש הופחת באמצעות טשטוש גאוסי עם גודל גרעין של 45× 45. ניסויים אלו נועדו להעריך את המודל באופן מקיפה תחת ירידות איכות תמונה תפיסתיות מדומות.