מאמר מחקר

מסגרת ממוחשבת ניתנת להסבר לסיווג נגעים בעור באמצעות למידה עמוקה

60 צפיות

DOI:

10.3791/72639

25 באוגוסט 2026

במאמר זה

סיכום

מאמר זה מציג מסגרת מבוססת CNN הניתנת להסבר לסיווג נגעים בעור, המשלבת דיוק אבחנתי גבוה עם יכולת פירוש של המודל. המסגרת מסווגת תמונות של נגעים ומייצרת הסברים ויזואליים לתחזיותיה. התוצאות מדגימות ביצועים חזקים ושקיפות משופרת, התומכות בקבלת החלטות קלינית ומסייעות לרופאי עור בגילוי מוקדם של מחלות עור.

תקציר

השימוש ברשתות נוירונים קונבולוציוניות עמוקות למטרת אבחון מחלות בעור הוכח במחקרים שונים כמי שמניב רמות דיוק דומות לאלו המושגות על ידי רופאי עור. עם זאת, עדיין קיימים אתגרים רבים, כולל ביצועים נמוכים והכללה לקויה במקרים מסוימים, וכן יכולת פרשנות נמוכה הקשורה לשימוש במודלים של "קופסה שחורה". מצב זה יוצר מכשולים משמעותיים ליישום מעשי, שכן הוא דורש יכולת הסבר בנוסף לאבחון מדויק, מה שמחייב מציאת פתרון. כדי להתגבר על הקשיים שהוזכרו, פותחה במחקר זה מסגרת למידה עמוקה ניתנת להסבר לסיווג נגעי עור (EDLF-SLC). המסגרת משתמשת בגישות שונות בלמידת מכונה ובבינה מלאכותית ניתנת להסבר (XAI) כדי להבטיח שיפורים הן בדיוק והן בפרשנות באופן תלת-שלבי. בשלב הראשוני, ייצוגים עמוקים שהופקו ממספר ארכיטקטורות CNN מאומנות מראש ממוזגים כדי לשמר מידע מבחין משלים שנלמד על ידי ארכיטקטורות רשת שונות לפני הסיווג באמצעות SVM עם גרעין פונקציית בסיס רדיאלית. לאחר מכן, מסווגי Support Vector Machine (SVM) עם גרעין פונקציית בסיס רדיאלית משמשים לסיווג המאפיינים שהתקבלו. לבסוף, התחזיות של המודל מפורשות באמצעות הסברים מקומיים ניתנים לפרשנות ללא תלות במודל (LIME). תוצאות ניסיוניות מראות כי EDLF-SLC מגיע ל-88.0% בדיוק (accuracy), 89.0% בדיוק חזוי (precision), 87.0% ברגישות (recall) ו-88.0% במדד F1, מה שמעיד על ביצועים תחרותיים בהשוואה למספר שיטות שדווחו לאחרונה תחת התנאים הניסיוניים שנבחנו במחקר זה.

מבוא

נגעים בעור מהווים דאגה מרכזית בדרמטולוגיה ובאונקולוגיה, כיוון שהם נעים בין חריגות שפירות לסרטנים ממאירים כגון מלנומה, הצורה הקטלנית ביותר של סרטן העור. בשנת 2020, המלנומה הייתה אחראית לכ-325,000 מקרים חדשים ומעל ל-57,000 מקרי מוות ברחבי העולם1. למרות שהתקדמות בסינונים ובטיפולים שיפרה את תוצאות המטופלים, אבחון מאוחר וגישה מוגבלת לשירותי בריאות ממשיכים לתרום לשיעורי תמותה גבוהים ולאובדן שנות חיים, במיוחד בקרב אוכלוסיות צעירות2,3.

האבחנה המסורתית מסתמכת בעיקר על בדיקה חזותית ודרמוסקופיה, מה שהופך את התהליך לתלוי במומחיות של הקלינאים וחשוף לסובייקטיביות, לשונות בין בודקים, לביופסיות מיותרות ולזמני בדיקה ממושכים4,5,6. כדי להתגבר על מגבלות אלה, למידה עמוקה, ובמיוחד CNNs, הגיחה כפתרון יעיל לסיווג אוטומטי של נגעים בעור. מודלים המבוססים על CNN, כולל DDCNN-F7, YOLOv7-XAI8 ומספר ארכיטקטורות אחרות9,10,11,12,13, הדגימו דיוק אבחנתי גבוה על ידי למידה אוטומטית של מאפייני תמונה מבדילים. למרות הצלחתם, רוב מודלי הלמידה העמוקה פועלים כ"קופסאות שחורות", מה שמגביל את אמון הקלינאים ומעכב את אימוצם בפרקטיקה רפואית שגרתית. לכן, הוצגו טכניקות של בינה מלאכותית ניתנת להסבר כדי לשפר את שקיפות המודל על ידי אספקת הסברים חזותיים לתחזיות. בין שיטות אלו, Local Interpretable Model-Agnostic Explanations מייצרת הסברים מקומיים ניתנים לפירוש על ידי זיהוי אזורי התמונה המשפיעים ביותר על החלטות המודל14.

סיווג נגעים בעור התפתח מהערכה קלינית מסורתית למערכות אבחון מתקדמות מבוססות בינה מלאכותית (AI), מתוך צורך בזיהוי מדויק, אמין ומוקדם של סרטן העור. התפתחות זו התקדמה דרך חמישה שלבים מרכזיים — שיטות אבחון מסורתיות, אבחון מסייע במחשב (CAD), למידה מכונה (ML), למידה עמוקה (DL), ולאחרונה, בינה מלאכותית ניתנת להסבר (XAI) ולמידה פדרטיבית (FL) — המשקפים מאמצים מתמידים לשיפור דיוק האבחון, העקביות, יכולת ההרחבה והאמינות הקלינית, תוך התגברות על מגבלות הבדיקה הקונבנציונלית. שיטות חישוביות מוקדמות ניסו לחקות חשיבה קלינית באמצעות מתארי תמונה שהוגדרו ידנית ונגזרו מכלל ה-ABCD, כולל אסימטריה, אי-סדירות של הגבול, שונות בצבע וקוטר הנגע. מאפיינים אלה שולבו עם רשתות בייזיאניות, עצי החלטה, מערכות מומחים ומודלים של הסקת מסקנות עמומה (fuzzy inference) כדי לתמוך באבחון מלנומה, כאשר מספר מחקרים דיווחו על דיוקי סיווג העולים על 90%15,16,17. למרות ששיטות אלו סיפקו בסיס חשוב לאבחון מסייע במחשב, הן היו תלויות לחלוטין במאפיינים שהונדסו ידנית ובכללי אבחון שהוגדרו מראש. כתוצאה מכך, הן הפגינו חוסן מוגבל מול שינויים באיכות התמונה, מורפולוגיית הנגע, התאורה ותנאי הרכישה.

כדי לטפל בחסרונות אלה, הופיעו מערכות CAD קלאסיות כשלב ביניים בין ניתוח תמונות קונבנציונלי לבין מסגרות מודרניות המבוססות על AI. מערכות CAD שילבו מיצוי מאפיינים ידני עם מסווגים קונבנציונליים כדי לשפר את העקביות האבחנתית ולסייע בקבלת החלטות קליניות. מספר גישות היברידיות שילבו קיבץ היררכי (hierarchical clustering) עם רשתות עצביות רקורסיביות וארכיטקטורות של זיכרון לטווח קצר ארוך (long short-term memory), והשיגו דיוקי סיווג המתקרבים ל-99.5%18. מסגרות CAD אחרות שילבו מסווגי gradient boosting עם הסברים מבוססי SHAP, והפגינו דיוק אבחנתי תחרותי תוך שיפור השקיפות של המודל19. למרות שמערכות אלה ייצגו שיפור משמעותי לעומת גישות המבוססות על כללים בלבד, הן המשיכו להסתמך במידה רבה על מיצוי מאפיינים ידני, עיבוד מקדים נרחב, מערכי נתונים מתויגים בקפידה וצינורות עיבוד רב-שלביים.

טכניקות של למידת מכונה קידמו עוד יותר את הסיווג האוטומטי של נגעי עור על ידי הפיכת הלמידה למבוססת נתונים במקום תכנון כללים מפורשים. מסגרות היברידיות המשלבות רשתות נוירונים קונבולוציוניות (CNN) עם מסווגי למידת מכונה קונבנציונליים, כולל רגרסיה לוגיסטית ו-k-nearest neighbors, הדגימו ביצועי סיווג חזקים במאגרי נתונים סטנדרטיים, והשיגו רמות דיוק העולות על 95%9. למידה רב-מודלית בפיקוח עצמי (Self-supervised multimodal learning) שיפרה עוד יותר את ייצוג המאפיינים על ידי ניצול משותף של תמונות דרמוסקופיות וקליניות, ובכך הפחיתה את התלות באנוטציה ידנית נרחבת תוך שיפור ביצועי הסיווג20. מחקרים נוספים שילבו CNNs עם ניתוח מבדיל מוכלל (generalized discriminant analysis), דסקריפטורי SURF ואלגוריתמי אופטימיזציה כדי לשפר אתBהבחנה בין מאפיינים ואת דיוק הסיווג21. טכניקות לבחירת מאפיינים אוטומטית המשתמשות ב-DenseNet-201, InceptionV3 ואלגוריתמי אופטימיזציה של עצי בינאריים שיפרו עוד יותר את ייצוג המאפיינים תוך שמירה על ביצועים דיאגנוסטיים תחרותיים22. גישות של למידה בהעברה (Transfer learning) המשתמשות בארכיטקטורות מאומנות מראש כגון AlexNet ו-GoogLeNet הדגימו גם הן יכולת סיווג מבטיחה למרות נתוני אימון מוגבלים23. עם זאת, רוב שיטות ה-ML המשיכו להישען על נהלי עיבוד מקדים שתוכננו בקפידה, אסטרטגיות אופטימיזציה ידניות, מאגרי נתונים מאוזנים וכיוונון נרחב של היפר-פרמטרים. התיקוף החיצוני המוגבל שלהן והרגישות לחוסר איזון בין מחלקות הגבילו עוד יותר את יישומן המעשי בסביבות קליניות מגוונות.

הכנסת ה-DL שינתה באופן מהותי את הסיווג האוטומטי של נגעי עור על ידי מתן אפשרות ללמידה מקצה לקצה ישירות מנתוני תמונות גולמיים. רשתות CNN ביטלו את הצורך בהנדסת מאפיינים ידנית תוך שיפור משמעותי של הביצועים האבחנתיים במספר מערכי נתונים של benchmark. רוב הגישות המבוססות על CNN הדגימו שיפורים משמעותיים בסיווג נגעים באמצעות ארכיטקטורות מתוחכמות יותר ויותר. מודלי CNN מודעי-סימטריה בחנו מאפייני נגעים בעלי משמעות קלינית אך השיגו דיוק מאוזן בינוני בלבד24. גישות אחרות שילבו ארכיטקטורות EfficientNet עם הסברי LIME ו-SHAP כדי לשפר את יכולת הפרשנות תוך הצגת מדדים כמותיים של מהימנות25. מערכות DL היברידיות המשלבות סגמנטציה של נגעים, למידת אנסמבל ו-CNN השיגו ביצועים מצוינים במספר מערכי נתונים של ISIC, אך נותרו רגישות לאיכות הסגמנטציה ולאיזון בין המחלקות26.

לאחרונה, ארכיטקטורות היברידיות מתוחכמות יותר שיפרו עוד יותר את דיוק הסיווג באמצעות שילוב של טכניקות DL משלימות. רשתות Adversarial Generative מותניות בשילוב עם YOLOv5 וניתוח רכיבים בלתי תלויים (ICA) השיגו דיוקי סיווג העולים על 99%, אם כי המורכבות החישובית שלהם הגבילה את הפריסה המעשית שלהן 27. באופן דומה, ארכיטקטורות היברידיות של LSTM–ResNet למדו ביעילות ייצוגים מרחביים-זמניים, אך דרשו משאבים חישוביים גדולים משמעותית28. מודלים מבוססי Transformer, כולל Sap-Former, ניצלו מידע הקשרי גלובלי כדי לשפר את ייצוג התכונות, אך דרשו עיבוד מקדים נרחב, מערכי נתונים רחבי היקף עם תוויות והספק חישובי משמעותי29. חלופות קלות יותר כגון S-MobileNet ניסו לאזן בין יעילות חישובית לדיוק אבחנתי30, בעוד ששיטות של התאמת דומיין ללא פיקוח (unsupervised domain adaptation) שיפרו את ההכללה בין דומיינים למרות יעילות מופחתת כאשר היו זמינים דגימות אימון מוגבלות בלבד31. רשתות היברידיות עם מנגנוני קשב (Attention), המשלבות מודולי קשב קונבולוציוניים שונו ולמידת ensemble של snapshots, הדגימו גם הן ביצועים מבטיחים לסיווג נגעי עור של אבעבועות קוף, אם כי אתגרים הקשורים לחוסר איזון בין מחלקות, גיוון בתמונות ויכולת הסבר מוגבלת נותרו ללא פתרון32. ארכיטקטורות שאריות (residual) מותאמות אישית, המשתמשות בתכנוני רשת עמוקים יותר ובפונקציות הפסד היברידיות, שיפרו עוד יותר את דיוק הסיווג מעבר ל-99%, אך גררו עומס חישובי וזמן אימון גדולים במידה ניכרת33. מחקרי סקירה מקיפים הגיעו למסקנה עקבית כי DL עולה באופן משמעותי על גישות מסורתיות של תכונות ידניות (handcrafted) על ידי למידה אוטומטית של ייצוגי תמונות מבחנים, תוך זיהוי סימולטני של אתגרים מתמשכים הקשורים לארטיפקטים של דימות, שונות בתאורה, מורכבות חישובית והכללה קלינית מוגבלת34.

אף על פי שלמידה עמוקה (DL) שיפרה באופן דרמטי את הדיוק האבחנתי, חששות בנוגע לשקיפות המודל, הערכת אי-ודאות ופריסה קלינית מהימנה עוררו עניין גובר בבינה מלאכותית ניתנת להסבר (XAI) ובלמידה פדרטיבית. מספר מחקרים בחנו טכניקות לכימות אי-ודאות, כולל conformal prediction, Monte Carlo dropout ו-evidential deep learning, והראו כי הערכת ביטחון מהימנה יכולה לשפר משמעותית את התמיכה בקבלת החלטות, למרות שהיא מטילה מגבלות חישוביות ומגבלות הקשורות לנתונים35. מסגרות למידה הדדית מבוססות Transformer הוצעו גם הן כדי לטפל בחוסר איזון בין מחלקות תוך שיפור יעילות למידת התכונות36. גישות אחרות שילבו רשתות CNN ברזולוציה מלאה עם טכניקות אופטימיזציה מבוססות גרף כדי לשפר את סגמנטציית וסיווג הנגעים37, בעוד שמסגרות למידה עמוקה היברידיות המשלבות מספר ייצוגי תכונות משלימים השיגו דיוקי סיווג המתקרבים ל-99.5%, למרות הדרישה לעיבוד מקדים נרחב38.

מחקרים עדכניים מתמקדים יותר ויותר בשילוב של יכולת הסבר (explainability) ישירות בתוך מסגרות של DL כדי להגביר את אמון הקלינאים ולהקל על האימוץ הקליני המעשי. מערכות ניתנות להסבר המשתמשות במספר ארכיטקטורות של רשתות נוירונים קונבולוציוניות (CNN) יחד עם Grad-CAM ו-Score-CAM הצליחו למקם אזורי נגעים רלוונטיים לאבחנה תוך שמירה על ביצועי סיווג תחרותיים הן במאגרי נתונים פנימיים והן בחיצוניים39. מסגרות היברידיות של CNN–Transformer המשלבות תמונות דרמוסקופיות עם מטא-נתונים קליניים שיפרו עוד יותר את ביצועי הניבוי, תוך שימוש ב-SHAP וב-Grad-CAM ליצירת הסברים חזותיים בעלי משמעות קלינית40. ארכיטקטורות היברידיות נוספות מבוססות-transformer המשלבות EfficientNetV2S, Swin Transformers, רשתות Xception שונו ומנגנוני תשומת לב גרפיים (graph attention), לכדו ביעילות מאפייני נגעים גלובליים ומקומיים משלימים, אם כי מספר הפרמטרים הגבוה שלהן והביצועים המוגבלים במחלקות מיעוט הגבילו את הפריסה המעשית שלהן41. באופן דומה, מסגרות היברידיות של YOLOv8–Vision Transformer הדגימו שיפור במיקום נגעים, בסיווג רב-מחלקתי ובפרשנות חזותית באמצעות הרחבה אדפטיבית (adaptive augmentation) יחד עם הסברי SHAP ו-Grad-CAM; עם זאת, שיטות אלו המשיכו להסתמך בעיקר על מאגרי נתוני ייחוס והפגינו חוסן מוגבל עבור קטגוריות נגעים של מיעוט42. מספר מאמרי סקירה סיכמו פיתוחים אלו, תוך הדגשה הן של ההתקדמות המרשימה שהושגה על ידי טכניקות למידה עמוקה מודרניות והן של האתגרים המתמידים הקשורים ליעילות חישובית, יכולת הסבר, תלות במאגרי נתונים ותיקוף קליני43,44,45. טבלה 1 מסכמת מספר עבודות שפורסמו לאחרונה המשתמשות באלגוריתמים של למידה עמוקה לסיווג נגעים בעור.

למרות ההתקדמות המרשימה שהושגה על ידי שיטות DL אחרונות בסיווג נגעי עור, רוב הגישות הקיימות נותרות מוגבלות בשל מורכבות חישובית גבוהה, תלות במאגרי נתונים גדולים ומתוייגים, יכולת פרשנות מוגבלת של המודל ותיקוף לא מספיק בסביבות קליניות מגוונות בעולם האמיתי. כדי להתגבר על מגבלות אלו, מאמר זה מציע את מסגרת ה-EDLF-SLC, המשלבת מאפיינים משלימים שהופקו ממספר ארכיטקטורות CNN יחד עם מסווג SVM לסיווג חסון ומדויק. המסגרת עושה שימוש נוסף בעיבוד מקדים משופר לשיפור איכות התמונה ולטיפול בחוסר איזון במחלקות, תוך שילוב טכניקת LIME כדי לספק הסברים ויזואליים לחיזויים בודדים, ובכך להגביר את שקיפות המודל ואת האמינות הקלינית שלו.

לתרומות של מחקר זה יש שלושה היבטים. ראשית, המחברים מציעים מסגרת עבודה חסונה, EDLF-SLC, המשלבת רשתות נוירונים קונבולוציוניות (CNNs) מתקדמות עם מסווג של מכונה וקטורית תומכת (SVM) כדי להשיג סיווג מדויק ואמין של נגעים בעור. שנית, המחברים מיישמים טכניקות עיבוד מקדים משופרות כדי לטפל בחוסר איזון בין המחלקות ולהפחית רעשים בתמונות, ובכך משפרים את איכות תמונות הקלט ואת הביצועים הכוללים של מודל הסיווג. שלישית, המחברים משלבים את שיטת LIME (Local Interpretable Model-agnostic Explanations) כדי להציג באופן ויזואלי ולפרש תחזיות בודדות של המודל על ידי הדגשת אזורי התמונה המשפיעים ביותר על החלטות הסיווג, ובכך משפרים את השקיפות והיכולת לפרש את מסגרת העבודה המוצעת.

פרוטוקול

מחקר זה לא כלל גיוס משתתפים אנושיים או איסוף נתונים מזהים של מטופלים. כל הניסויים בוצעו באמצעות מערך נתוני נגעי העור ISIC 2020 הזמין לציבור, אשר הושג ממאגר Kaggle; לפיכך, לא נדרשו אישור של ועדת אתיקה מוסדית והסכמה מדעת. כל החומרים ששימשו במחקר זה נמצאים ב- טבלת חומרים.

חילוץ ומיזוג מאפיינים
תמונות של נגעי עור עובדו באמצעות מספר מודלי CNN מאומנים מראש. וקטורי מאפיינים עמוקים שחולצו מארכיטקטורות ה-CNN הנבחרות שורשרו כדי לבנות ייצוג מאפיינים מאוחד עבור כל תמונת נגע עור. אסטרטגיית המיזוג שנבחרה משמרת מידע חזותי משלים שנלמד על ידי ארכיטקטורות CNN שונות, מה שמאפשר למסווג ה-SVM העוקב לנצל הן מאפייני מרקם ברמה נמוכה והן ייצוגים סמנטיים ברמה גבוהה יותר. למרות שטכניקות להורדת ממדיות, כגון ניתוח רכיבים ראשיים (PCA) או בחירת מאפיינים מבוססת מידע הדדי, עשויות להפחית את ממדיות המאפיינים, הייצוג הממוזג המלא נשמר במכוון כיוון שמרחב המאפיינים הממוזג נותר ניתן לניהול חישובי עבור מסווג ה-RBF-SVM שנעשה בו שימוש, תוך שימור מידע אבחנתי משלים שחולץ ממבני ה-CNN ההטרוגניים.

סיווג
וקטורי התכונות המאוחדים שימשו לאימון מסווג SVM עם גרעין RBF. נעשה שימוש בטכניקות לאופטימיזציה של היפר-פרמטרים כדי לקבוע את הגדרות הסיווג האופטימליות. לאחר מכן, המסווג קטל את נגעי העור למחלקות המתאימות להם.

ניתנות להסבר
כדי לשפר את יכולת הפרשנות, נעשה שימוש ב-LIME ליצירת הסברים ויזואליים המדגישים את אזורי התמונה שתורמים באופן המשמעותי ביותר לתוצאות הסיווג. הסברים אלו יסייעו לקליניקאים להבין ולתקף את החלטות המודל.

תוכנית הערכה
המסגרה המוצעת הוערכה באמצעות מערך נתונים סטנדרטי (benchmark) של נגעי עור. הביצועים נבחנו באמצעות Accuracy, Precision, Recall ו-F1-Score. ניסויים השוואתיים נערכו מול גישות קיימות של למידת מכונה ולמידה עמוקה כדי להדגים את יעילותה של המסגרת המוצעת.

תוצאות צפויות
המחקר היה צפוי להניב מערכת מדויקת וניתנת לפירוש לסיווג נגעי עור. תוצאות ניסיוניות ראשוניות מעידות כי EDLF-SLC משיג דיוק של 88.0%, רגישות (precision) של 89.0%, recall של 87.0% ומדד F1-score של 88.0%, ובכך עולה בביצועיו על מספר שיטות מתחרות. שילוב הסברים באמצעות LIME היה צפוי להגביר את רמת האמון ולהקל על אימוץ מערכות אבחון מבוססות בינה מלאכותית בפרקטיקה הקלינית.

חשיבות
מחקר זה תורם לתחום הגדל של בינה מלאכותית ניתנת להסבר (Explainable AI) בתחום הבריאות, על ידי התייחסות לאתגרי ביצועים ושקיפות באבחון נגעים בעור. למסגרת המוצעת יש פוטנציאל לסייע לרופאי עור בקבלת החלטות אבחנתיות אמינות וניתנות לפירוש יותר, ובסופו של דבר לשפר את הטיפול במטופלים. יתרה מכך, בחלק זה, סיפקו המחברים מידע בנוגע לחומרים ולמתודולוגיה שיושמה במחקר זה. באופן ספציפי, המחברים פתחו בתיאור מערך הנתונים ששימש לניסויים והמשיכו לדיון מפורט במסגרת הלמידה העמוקה הניתנת להסבר לסיווג נגעים בעור.

ערכת נתונים
העבודה המוצגת מתבססת על ערכת הנתונים ISIC 2020 הזמינה לציבור (International Skin Imaging Collaboration), אליה ניתן לגשת באתר Kaggle (https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign). מאגר ה-ISIC מוכר כאחד המשאבים הטובים ביותר בתחום ההדמיה הדרמטולוגית, מאחר שהוא מספק מגוון רחב של תמונות דרמוסקופיות של סוגים שונים של נגעים בעור, כפי שמוצג ב-איור 1. באופן משמעותי, ערכת הנתונים כוללת תמונות של מצבים שפירים וממאירים כאחד, מה שהופך אותה למועילה לביצוע משימות סיווג בינארי של סרטן העור 46. בערכת הנתונים הנוכחית ישנן 3,297 תמונות, מתוכן 1,800 שפירות ו-1,497 ממאירות. לצורך ניסויים יעילים יותר, היה צורך לחלק את הנתונים למערכת אימון ומערכת בדיקה. בפרט, ישנן 2,637 תמונות אימון, הכוללות 1,440 שפירות ו-1,197 ממאירות, בעוד שמערכת הבדיקה מורכבת מ-660 תמונות, מתוכן 360 שפירות ו-300 ממאירות. סיכום של ערכת הנתונים מוצג ב-טבלה 2.

מודל ה-EDLF-SLC המוצע
במאמר זה הוצע פתרון יעיל ומובן לסיווג נגעי עור לקטגוריות שפירות וממאירות, תוך שימוש בטכניקה חדשנית של למידה עמוקה הניתנת להסבר, המבוססת על גישה היברידית המשלבת את היתרונות של מספר מודלים של רשתות נוירונים קונבולוציוניות (CNN) שאומנו מראש. רשתות נוירונים קונבולוציוניות הוכחו כיעילות ביותר בחילוץ מאפיינים סמנטיים ברמה גבוהה מתמונות רפואיות. תוך שימוש ביכולת זו, מסגרת הלמידה העמוקה הניתנת להסבר לסיווג נגעי עור המוצעת (EDLF-SLC) מנצלת מספר מודלי CNN שאומנו מראש כדי להשיג ביצועים מעולים. כדי להבטיח את השקיפות הדרושה בתהליך קבלת ההחלטות הרפואיות, הוטמעה בגישה המוצעת שיטת LIME ליצירת הסברים מקומיים קריאים לבני אדם עבור תוצאות הפלט. ניתן לחלק את המסגרת השלמה לשלושה שלבים עיקריים, כפי שמוצג ב-איור 2>, והם: (1) עיבוד מקדים של נתונים, (2) חילוץ מאפיינים וסיווג, ו-(3) יכולת פרשנות.

ארכיטקטורת מודל ואינטגרציה
כשלב מקדימ, נבחרו שבעה מודלים פופולריים של למידה עמוקה (MobileNetV2, ResNet50, EfficientNetB0, Xception, InceptionResNetV2, NASNetLarge, ו-MobileNet) והוערכו בנפרד על סט נתוני האימות, וארבעת המודלים היעילים ביותר (ResNet50, EfficientNetB0, MobileNet, ו-Xception) נבחרו לשלב חילוץ התכונות. במסגרת המוצעת, כל תמונת קלט x הועברה באופן עצמאי דרך המודלים המאומנים מראש שנבחרו. השכבה האחרונה עם חיבור מלא (fully connected layer) הוסרה מכל אחד מהמודלים הללו, ווקטורי תכונות הופקו מהשכבות הקודמות. fResNet50(x), fEfficientNetB0(x), fMobileNet(x), ו-fXception(x) מתייחסים לווקטורי התכונות הפלט מכל אחד מהמודלים שהוזכרו לעיל. באמצעות שרשור וקטורי תכונות אלה, מתקבל וקטור תכונות מאוחד חדש F(xi):

F(xi) = [f(ResNet50)(xi);f(EfficientNetB0)(xi);f(MobileNet)(xi);f(Xception)(xi)] (1)

לאחר מכן, F(xiהועבר דרך מסווג SVM עם גרעין פונקציית בסיס רדיאלית (RBF) כדי לקבל את תוצאת הסיווג. האלגוריתם המלא עבור המסגרת המוצעת מוצג ב- קובץ משלים 1.

המסגרת המוצעת מאמצת מיזוג ישיר ברמת המאפיינים (feature-level fusion), מכיוון שכל ארכיטקטורת CNN מאומנת לומדת מאפיינים מבחינים שונים של נגעי עור באמצעות ארכיטקטורת הרשת הייחודית שלה וההיררכיה של המאפיינים שנלמדו. כתוצאה מכך, שרשור ייצוגי מאפיינים הטרוגניים אלו משמר מידע משלים התורם לאפיון מקיף יותר של הנגע לפני השלב של הסיווג. למרות ששיטות להפחתת ממדיות, כגון ניתוח רכיבים ראשיים (PCA) או בחירת מאפיינים מבוססת מידע הדדי (mutual information), יכולות להפחית את ממדיות הייצוג הממוזג, וקטור המאפיינים הממוזג המלא נשמר במכוון מאחר שממדיותו נשארת ניתנת לניהול חישובי עבור מסווג ה-RBF-SVM שנבחר, ובו בזמן שהיא משמרת מידע אבחנתי משלים שהוצא על ידי רשתות ה-CNN השונות. עיצוב זה, לפיכך, נותן עדיפות לשימור ייצוגים עמוקים משלימים על פני הסרת מאפיינים שעשויים להיות אינפורמטיביים לפני הסיווג.

הכנת נתונים
הכנת הנתונים כללה עיבוד מקדמי ופיצול של מערך הנתונים למערכי אימון ובדיקה. העיבוד המקדמי נועד לשפר את איכות הנתונים על ידי ביטול אי-עקביות, מחיקת רכיבים כפולים, עיצוב תמונות הקלט וביצוע נרמול תכונות (feature scaling) לצורך אימון יציב של מודל איכותי. כל התמונות נורמלו לטווח של [−1, 1] באמצעות נרמול Z-score:

נוסחת ערך מנורמל (X-μ)/σ, מושג סטטיסטי, תרשים משוואה. (2)

כאשר µ ו-σ מייצגים את ערך הממוצע ואת סטיית התקן של התמונה המתאימה, בהתאמה. מערך הנתונים חולק לשתי תתי-קבוצות, כלומר, קבוצת אימון (70.0%) וקבוצת בדיקה (30.0%).

הגדלת נתונים (Data augmentation)
כדי למנוע התאמת יתר (overfitting) ולהגביר את יכולת ההכללה של המודל, נעשה שימוש במספר טכניקות הגדלה עבור קבוצת האימון. הגדלת תמונות כוללת שינוי של התמונות במטרה להרחיב באופן מלאכותי את מערך הנתונים מבלי לשנות מאפיינים חיוניים של המצבים הרפואיים. צינור העיבוד להגדלה נבנה באמצעות ה-Keras Sequential API. נעשה שינוי באמצעות טרנספורמציות כגון היפוך אופקי אקראי, סיבוב בזווית קטנה, שינוי גודל (resizing), קנה מידה (scaling), התאמת בהירות/ניגודיות, זום ותנועות מינוריות. דוגמאות מייצגות של תמונות מוגדלות מוצגות ב-איור 3.

מודלים מאומנים מראש
מספר מודלים של למידה עמוקה מאומנים מראש אומצו במסגרת המוצעת לצורך חילוץ מאפיינים מתמונות הקלט. מודלים אלו כוללים את MobileNet, ResNet50, EfficientNetB0, Xception, NASNetLarge, Inception-ResNet-v2 ו-MobileNetV2. MobileNet ו-MobileNetV2 הם מודלים קלילים של למידה עמוקה לביצועי חישוב יעילים באמצעות קונבולוציות ניתנות להפרדה לפי עומק (depth-wise separable convolutions). ResNet50 משתמש במנגנון של חיבורים שיוריים (residual connections) לאימון המודל, ובכך נמנע מבעיית הגרדיאנטים הנעלמים במהלך האימון. EfficientNetB0 יוצר איזון בין יעילות לדיוק באמצעות גישה של סקאלינג מורכב (compound scaling). Xception מרחיב את רשת Inception באמצעות קונבולוציות ניתנות להפרדה לפי עומק. NASNetLarge כולל שימוש בחיפוש ארכיטקטורה עצבית (neural architecture search) לבניית מבני רשת עצבית עמוקה אופטימליים, ו-Inception-ResNet-v2 בונה היבריד של מודל Inception ומנגנון החיבורים השיוריים. וקטורי מאפיינים שחולצו מ-ResNet50 (1,024 מאפיינים), EfficientNetB0 (1,280 מאפיינים), MobileNet (1,024 מאפיינים) ו-Xception (2,048 מאפיינים) שורשרו יחד כדי להפיק ייצוג מאוחד במימדיות של 5,376. אסטרטגיית מיזוג זו נבחרה כדי לשמר ייצוגים משלימים שנלמדו על ידי ארכיטקטורות CNN שונות, במקום לצמצם את הייצוג לפני הסיווג. וקטור המאפיינים שנוצר מועבר לאחר מכן למסווג RBF-SVM, הקובע את גבול ההחלטה הבלתי-ליניארי האופטימלי בתוך מרחב המאפיינים הממוזג.

מודל בינה מלאכותית הניתן להסבר (LIME)
על מנת לספק פרשנות מקומית מסוימת של תחזיות המודל, המחברים מאמצים את השיטה של יצירת הסברים מקומיים קריאים לבני אדם עבור כל תחזית ספציפית של המודל, שיטה הנקראת LIME47. עבור כל תמונת קלט, LIME מחלק אותה תחילה ליחידות קטנות יותר הנקראות superpixels. לאחר מכן נוצרים שיבושים (perturbations) מהתמונה המקורית, ותחזיות ממודל הרשת העמוקה נאמדות עבור כל אחד מהשיבושים. לאחר מכן, מותאם מודל ליניארי משוקלל על השיבושים תוך שימוש במשקולות התלויות בקרבתם למופת הקלט המקורי. לאחר התאמת המודל הליניארי, נאמדים מדדי חשיבות המאפיינים, המצביעים על תפקידו של כל superpixel בתחזית התגית הסופית. מדדי חשיבות אלו מודגשים חזותית בתמונת ההסבר הסופית. אלגוריתם LIME מוצג בקובץ משלים 2.

תוצאות

הערכת הביצועים של מסגרת הסיווג שפותחה מבוססת על מדדי הערכה מסורתיים הנגזרים ממטריצת בלבול (confusion matrix). מטריצת בלבול מאפשרת קבלת הבנה מלאה של ביצועי המסווג באמצעות ייצוג מספר הסיווגים הנכונים והשגויים שבוצעו עבור כל מחלקה שהוגדרה. באופן זה, ניתן לנתח את כל סוגי השגיאות. לדוגמה, הן תוביות חיוביות (false positives) והן תוביות שליליות (false negatives) הן חשובות במיוחד באבחון מחלות. ערכים גבוהים של תוביות חיוביות עשויים להעיד על רגישות גבוהה של המסווג, אך במקביל, כמויות גדולות של תוביות שליליות מעידות על רגישות נמוכה שלו ומהוות סיכונים בריאותיים פוטנציאליים. במאמר זה נעשה שימוש במדדי הביצועים הבאים: דיוק (accuracy), רבדיות (precision), רגישות (recall), מדד F1-score, סגוליות (specificity), שיעור החיוביים האמיתיים (TPR) ושיעור החיוביים השגויים (FPR). הנוסחאות למדדים אלה מפורטות להלן:

דיוק=(TP+TN)/(TP+TN+FP+FN) (3)

דיוק TP/(TP+FP) (4)

נוסחת חישוב Recall, TP/(TP+FN), המשמשת בניתוח נתונים עבור מדדי ביצועים. (5)

נוסחת F1 score; F1=(2×Precision×Recall)/(Precision+Recall); הערכת יעילות.(6)

נוסחת סגוליות, משוואה לחישוב שיעור השליליים האמיתיים, דיאגרמה לימודית. (7)

משוואות עבור שיעור החיוביים האמיתיים ושיעור החיוביים השגויים, טבלת נוסחאות לניתוח סטטיסטי. (8)

במקרה זה, TP מייצג את מספר סרטני העור הזליאניים שזוהו על ידי המסגרת, בעוד ש-TN מציין את מספר הנגעים השפירים. בתורו, FP מדגים את מספר ההחלטות השגויות כאשר נגעים מסווגים כזליאניים למרות שהם למעשה שפירים. FN משקף את מספר הדגימות השפירות שזוהו באופן שגוי. בכל הנוגע לסיווג סרטן העור, מזעור השליליים השגויים (false negatives) הוא קריטי ביותר בשל ההשפעות השליליות הפוטנציאליות הנובעות מכך.

ביצועי מודלי הבסיס
כל הניסויים החישוביים בוצעו בסביבת הענן של Google Colab. ראוי לציין כי פלטפורמה זו מאפשרת הרצת מופעים של מכונות וירטואליות המשתמשות ב-Ubuntu 20.04 מוגדר מראש כמערכת ההפעלה שלהן. לצורך אימון מודלי הבסיס, נעשה שימוש בגרסה 3.9 של Python ובגרסה 2.3.1 של ספריית PyTorch. בנוסף, לכל צמתי החישוב היו מפרטים זהים, דהיינו, מעבד Intel Xeon בתדר של 2.2 GHz, מעבד גרפי NVIDIA Tesla T4, זיכרון RAM של 16 GB ונפח אחסון של 70 GB. לפיכך, הגדרה ניסיונית זו אפשרה לצמצם את השונות הנובעת מפלטפורמות חומרה שונות ולהגביר את האמינות והשחזוריות של התוצאות. סיכום מלא של הסביבה הניסיונית מופיע ב-טבלה 3.

איור 4 מציג עקומות למידה המתאימות ל-100 תקופות (epochs) אימון עבור ארכיטקטורת ResNet-50. האימון בוצע על בסיס סט נתונים המכיל 2,110 תמונות, בעוד שגודלו של סט נתוני האימות היה שווה ל-660 תמונות. כפי שניתן לראות, במהלך האימון, הדיוק עלה באופן עקבי עד לכמעט 90.0%. במקביל, נצפתה עלייה בדיוק ב-50 התקופות הראשונות; לאחר נקודה זו, הדיוק הפך לכמעט קבוע, דבר שיכול להיחשב כסימן להתכנסות של המודל. עבור האימות, המודל הראה ערך AUC השווה ל-86.0%, ובכך הדגים תכונות הבחנה סבירות.

מטריצת הבלבול המוצגת ב-איור 5 מאפיינת את ביצועי מודל ה-ResNet-50 במונחים של דיוק סיווג עבור סט בדיקה הכולל 660 תמונות. במהלך ההערכה, המודל זיהה נכונה 310 מתוך 360 דגימות שפירות (benign) ו-239 מתוך 300 דגימות ממאירות (malignant). עם זאת, מספר גבוה יחסית של דגימות ממאירות סווגו באופן שגוי, מה שהוביל לערך גבוה יחסית של שליליים שגויים (false negatives). יש לבחון תוצאה זו בפירוט רב יותר בשל ההשלכות החמורות של סוג זה של טעות בעת שימוש במסווג באופן מעשי. בסך הכל, המודל הגיע לדיוק (accuracy) של 83.0%, עם רמת דיוק (precision) של 83.3%, רגישות (recall) של 83.3%, ומדד F1-score של 83.3%.

טבלה 4 מכילה תיאור מפורט של מאפייני הביצועים עבור מודל ResNet-50 עבור שתי המחלקות. המסווג הראה התנהגות מאוזנת יחסית מבחינת הדיוק (precision); עבור דגימות שפירות, ערכו היה 83.0%, בעוד שדגימות ממאירות הניבו דיוק של 84.0%. באופן דומה, ערכי הרגישות (recall) הגיעו ל-88.0% עבור נגעים שפירים ו-78.0% עבור נגעים ממאירים. ה-Support בטבלה מייצג את מספר הדגימות המתאימות לכל מחלקה.

מודל EDLF-SLC המוצע
איור 6 ממחיש את ה-AUC של האימון והתיקוף של המודל המוצע לאורך 300 epochs. מדד ה-AUC משקף את יכולתו של המודל להבחין בין מחלקות שפירות למגוריות, כאשר ערכים גבוהים יותר מעידים על ביצועי הבחנה טובים יותר. כפי שניכר, ה-AUC של האימון עולה בעקביות לאורך תהליך האימון, ומגיע לערך מקסימלי של 1.00 בערך ב-epoch 200. גם ה-AUC של התיקוף משתפר בהדרגה במהלך שלבי האימון הראשוניים; עם זאת, הוא מתחיל להתייצב לאחר כ-150 epochs, מה שמרמז על התכנסות של המודל. ה-AUC הסופי של התיקוף, העומד על 0.95, מדגים יכולת הכללה חזקה והפרדה יעילה בין המחלקות.

מטריצת הבלבול של המודל המוצע, המוצגת ב-איור 7, מראה כי המודל סיווג נכון 299 דגימות שפירות ו-272 דגימות ממאירות, בעוד שסיווג בטעות 28 מקרים שפירים כממאירים ו-61 מקרים ממאירים כשפירים. בסך הכל, המודל השיג 571 תחזיות נכונות ו-89 סיווגים שגויים. בולט כי המספר הגבוה של תוצאות שגויות מסוג false negatives (מקרים ממאירים שסווגו בטעות כשפירים) מדגיש מגבלה קריטית, שכן לטעויות own כאלו עשויות להיות השלכות קליניות משמעותיות. עם זאת, ביצועי הסיווג הכלליים נותרים חסונים. בניגוד לגישות של בחירת מאפיינים (feature-selection) המסירות ממדים באופן מכוון לפני הסיווג, המסגרת המוצעת שומרת על הייצוג העמוק הממוזג והמלא שנוצר על ידי מספר ארכיטקטורות CNN הטרוגניות. תכנון זה אומץ מכיוון שכל backbone מחלץ מאפייני נגעים משלימים, ושמירה על הייצוג המלא מאפשרת למסווג ה-SVM לנצל את המידע המבדיל המשולב ללא השמטת מאפיינים שעשויים להיות אינפורמטיביים. כתוצאה מכך, אסטרטגיית מיזוג המאפיינים שאומצה נותנת עדיפות ללמידת ייצוגים משלימים תוך שמירה על היתכנות חישובית.

איור 8 מציג דוגמאות מייצגות של תוצאות סיווג שהופקו על ידי המודל המוצע. התוצאות מדגימות כי המודל מקצה ציוני ביטחון גבוהים למקרים שסווגו נכון. באופן ספציפי, מקרים שפירים מראים הסתברויות חיזוי גבוהות (למשל, 99.84% ו-99.85%), בעוד שמקרים ממאירים מראים אף הם רמות ביטחון גבוהות (למשל, 99.98% ו-99.96%). ממצאים אלו מעידים כי המודל יכול להבדיל ביעילות בין נגעים שפירים לממאירים, גם בתרחישים מאתגרים מבחינה חזותית. כדי לשפר את יכולת הפירוש, נעשה שימוש במסגרת LIME כדי להפיק הסברים מקומיים לחיזויי המודל, כפי שמוצג ב-איור 9A–D. LIME מקריבה את גבול ההחלטה המורכב של המודל באמצעות מודל ליניארי הניתן לפירוש מקומי. עבור כל תמונת קלט, השיטה מייצרת דגימות מופרעות על ידי מיסוך סלקטיבי של a superpixels והערכת החיזויים התואמים. לאחר מכן מותאם מודל ליניארי משוקלל לדגימות אלו, כאשר המשקולות נקבעות על בסיס קרבה לקלט המקורי באמצעות גרעין פונקציית בסיס רדיאלית. המקדמים המתקבלים מייצגים את התרומה של כל superpixel לחיזוי הסופי ומוגדרים כ:

נוסחת משוואת רגרסיה ליניארית, E(Y)=B0+ΣBjXj, המתארת מרכיבים של מודל סטטיסטי. (9)

כאשר Xj ∈ {0, 1} מציין את נוכחותו או היעדרו של הסופר-פיקסל ה-j, Bj מייצג את משקל התרומה המתאים, ו-B0 הוא חיזוי הבסיס. מקדמים חיוביים (Bj > 0) מעידים על אזורים התורמים למחלקה הממאירה, בעוד שמקדמים שליליים (Bj < 0) תואמים למאפיינים שפירים. הוויזואליזציות המבוססות על LIME, המוצגות ב-איור 9B, D, מדגישות את האזורים המשפיעים ביותר התורמים לכל החלטת סיווג. עבור נגעים שפירים, המודל מדגיש אזורים המתאפיינים בפיגמנטציה אחידה וגבולות מוגדרים היטב. לעומת זאת, במקרים ממאירים, האזורים המודגשים תואמים למאפיינים בעלי משמעות קלינית כגון גבולות לא סדירים, הטרוגניות בצבע ומרקמים לא טיפוסיים. עוצמת האזורים המודגשים משקפת את גודל המקדמים Bj המתאימים.

תוצאות אלו מדגימות כי מודל ה-EDLF-SLC מתמקד במאפיינים בעלי משמעות קלינית התואמים לקריטריונים דרמטולוגיים מבוססים, כגון כלל ה-ABCD. התאמה זו משפרת את יכולת הפירוש ואמינות המודל, ובכך הופכת אותו למתאים יותר לתמיכה בהחלטות קליניות. יתרה מכך, איור 10 מציג תוצאות ויזואליזציה השוואתיות שהתקבלו באמצעות טכניקות הסביריות נוספות, הכוללות את Grad-CAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM ו-EigenCAM, המאששות עוד יותר את העקביות של האזורים הבולטים שזוהו בשיטות שונות. ביחס לביצועי מודל ה-EDLF-SLC המוצע ושבעה מודלי בסיס לאחר אימון של 100 epochs, ניתן לראות השוואה ב-טבלה 5. מודל ה-EDLF-SLC השיג ביצועים תחרותיים של 0.88 בכל מדד שנבדק בהשוואה לארכיטקטורות הבסיס שנבחנו בהקשר הניסויי. ל-EfficientNetB0 ול-ResNet50 היו תוצאות טובות אף הן, עם דיוקים של 0.85 ו-0.83, בה odpowiedם. לעומת זאת, Inception-ResNetV2 הציג את ביצועי הסיווג הגרועים ביותר מבין המודלים שנבדקו. מאידך, למרות דיוק סיווג נמוך יחסית, היעילות החישובית שלו הייתה עדיין דומה לזו של מודלי הבסיס. מודל ה-EDLF-SLC המוצע הדגים ביצועים תחרותיים ביחס למודלי הבסיס שנבדקו תחת התנאים הניסוייים שאומצו.

כדי להעריך את ביצועי המסגרת המוצעת ביחס לגישות קיימות, Table 6 מציג השוואה עם שיטות מייצגות מהמצב העדכני ביותר (state-of-the-art) לסיווג נגעים בעור. לדוגמה, 47 דיווחו על דיוק של 0.86, בעוד ש-48 השתמשו במודל מבוסס אנסמבל שהשיג דיוק דומה אך רמות נמוכות יותר של דיוק (precision), רגישות (recall) ומדד F1. מחקרים אחרונים המבוססים על למידת אנסמבל ומספר ארכיטקטורות CNN25,49 דיווחו על רמות דיוק של עד 0.87. תחת התנאים הניסיוניים שאומצו, מסגרת ה-EDLF-SLC המוצעת השיגה דיוק של 0.88 תוך שימוש בארכיטקטורה מאוחדת הניתנת להסבר, ללא צורך ברכיבים נוספים כגון מודלים לסגמנטציה של נגעים.

זמינות נתונים
הנתונים התומכים בממצאי מחקר זה זמינים באופן פתוח ב-Kaggle בכתובת https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign.

ניתוח נגעי עור, סיווג מלנומה; תמונות אבחנתיות, תוצאות בדיקה דרמוסקופית.
איור 1: תמונות דרמוסקופיות מייצגות מתוך מאגר הנתונים של ISIC המדגימות את שתי מחלקות האבחנה ששימשו במחקר זה. הדגימות מסומנות כשפירות (0) וממאירות (1), תוך הדגשת השונות במורפולוגיה, בצבע ובמרקם של הנגעים לאורך מאגר הנתונים. אנא לחצו כאן כדי להציג גרסה מוגדלת של איור זה.

זרימת עבודה של ניתוח מאגר נתוני נגעי עור; חילוץ מאפיינים מבוסס CNN, תרשים סיווג SVM.
איור 2: זרימת עבודה מלאה של מסגרת ה-EDLF-SLC המוצעת. הפרוטוקול מתחיל ברכישת תמונות מ-ISIC 2020, ולאחריה עיבוד מקדמי, הרחבת נתונים (data augmentation), חלוקת מאגר הנתונים, חילוץ מאפיינים עמוקים באמצעות ארבע ארכיטקטורות CNN מאומנות מראש, מיזוג מאפיינים, סיווג SVM, הערכת ביצועים ויצירת הסברים מבוססי LIME. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

טכניקת מיקרוסקופיה לבחינת דפוסי נגעי עור, תמונות מוגדלות מזוויות שונות, ניתוח רפואי.
איור 3: דוגמאות לתמונות מוגברות של נגעי עור שנוצרו באמצעות טכניקות של הגברת נתונים (data augmentation). אלו כוללות היפוך אופקי ואנכי, סיבוב, שינוי קנה מידה וכוונון בהירות. טרנספורמציות אלו מגדילות את הגיוון במערך הנתונים, משפרות את חסינות המודל ומפחיתות את הסיכון להתאמת יתר (overfitting) במהלך האימון. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

תוצאת אימון עקומת ROC, AUC מול תקופה (epoch), תרשים המראה את מגמות דיוק האימות והאימון של המודל.
איור 4: שטח תחת העקומה של מאפיין הפעולה של המקלט (ROC-AUC) באימון ובאימות של מודל ResNet-50 לאורך 100 תקופות אימון. העקומה הכחולה מייצגת את ה-AUC של האימון, בעוד שהעקומה הכתום מייצגת את ה-AUC של האימות. העקומות מראות התכנסות מהירה במהלך תקופות האימון הראשוניות, ולאחריהן אופטימיזציה יציבה עם ביצועי אימות גבוהים באופן עקבי, דבר המעיד על למידה יעילה והכללה משביעה רצון על מערך נתוני האימות. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של איור זה.

תרשים מטריצת בלבול עבור ResNet-50 בניתוח סיווג נגעים שפירים לעומת ממאירים.
איור 5: מטריצת בלבול של מודל ResNet-50 על מערך נתוני הבדיקה. השורות מייצגות את תוויות המחלקה האמיתיות (0 = שפיר, 1 = ממאיר), בעוד שהעמודות מייצגות את תוויות המחלקה החזויות. האיברים באלכסון מציינים דגימות שסווגו נכון (310 שפירות ו-239 ממאירים), בעוד שהאיברים מחוץ לאלכסון מייצגים דגימות שסווגו באופן שגוי, כולל 50 חיוביים שגויים (false positives) ו-61 שליליים שגויים (false negatives). אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

עקומות ROC-AUC, מודל EDLF-SLC, אימון לעומת ולידציה, גרף, 300 תקופות (epochs), ניתוח נתונים.
איור 6: השטח תחת העקומה של מאפיין תפעול קולט (ROC-AUC) באימון ובולידציה עבור מודל ה-EDLF-SLC המוצע לאורך 300 תקופות אימון. העקומה הכחולה מייצגת את ה-AUC של האימון, בעוד שהעקומה הכתCומה מייצגת את ה-AUC של הולידציה. המודל מראה התכנסות מהירה במהלך תקופות האימון הראשונות, ולאחריה אופטימיזציה יציבה עם ערכי AUC גבוהים ועקביים לאימון ולולידציה לאורך שאר התקופות. ביצועי הולידציה המתמשכים מדגימים יכולת הכללה טובה והתנהגות למידה יציבה של מסגרת ה-EDLF-SLC המוצעת על מערך נתוני הולידציה. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

תרשים מטריצת בלבול עבור מודל EDLF-SLC המראה את דיוק הסיווג של נגעים שפירים וממאירים.
איור 7: מטריצת בלבול של מודל ה-EDLF-SLC המוצע על מערך נתוני הבדיקה. השורות מייצגות את תוויות המחלקות האמיתיות (0 = שפיר, 1 = ממאיר), בעוד שהעמודות מייצגות את תוויות המחלקות החזויות. האיברים באלכסון מציינים דגימות שסווגו נכון (299 שפירים ו-272 ממאירים), בעוד שהאיברים מחוץ לאלכסון תואמים לדגימות שסווגו באופן שגוי, כולל 61 חיוביים שגויים (false positives) ו-28 שליליים שגויים (false negatives). אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

ניתוח דרמטולוגי: תמונות המראות תחזיות של סיווג נגעים בעור, שפירים לעומת ממאירים.
איור 8: דוגמאות לתחזיות שהופקו על ידי מודל ה-EDLF-SLC המוצע. איור זה ממחיש את רמות הביטחון בסיווג של נגעים שפירים וממאירים ומדגים את היכולת ההבחנית של המודל. אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.

ניתוח גבולות נגעים בעור; דיאגרמות A-D מראות את תהליך ההבחנה בין הנגע לקונטור בדרמטולוגיה.
איור 9: הסברים מקומיים מבוססי LIME של מודל ה-EDLF-SLC המוצע. האיור מדגיש את אזורי הסופר-פיקסלים המשפיעים ביותר התורמים להחלטות הסיווג של המודל. (A) תמונה דרמוסקופית מקורית של נגע עור שפיר. (B) הסבר LIME עבור הנגע השפיר, כאשר סופר-פיקסלים מודגשים מצביעים על האזורים שתרמו ביותר לתחזית השפירה. (C) תמונה דרמוסקופית מקורית של נגע עור ממאיר. (D) הסבר LIME עבור הנגע הממאיר, המראה את אזורי הסופר-פיקסלים המבדילים שהשפיעו באופן דומיננטי על הסיווג כממאיר. גבולות צהובים מתוחמים את הסופר-פיקסלים המשפיעים שזוהו על ידי LIME, בעוד שאתרים בצבע אפור מייצגים אזורים עם תרומה מינימלית לתחזית. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

ניתוח תמונה באמצעות שיטות GradCAM; תרשים של תוצאות גולמיות ושכבות חפיפה להסברים חזותיים.
איור 10: השוואה בין שיטות הסביריות המבוססות על מיפוי הפעלת מחלקות (CAM) שיושמו על מודל ה-EDLF-SLC המוצע. האיור משווה את מפות הלוקליזציה שנוצרו על ידי GradCAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM ו-EigenCAM עבור אותה תמונה דרמוסקופית. הפאנל הראשון מציג את תמונת הקלט המקורית, ולאחריה מפות ההפעלה הגולמיות התואמות ושכבות חפיפה של מפות חום (heatmaps) שנוצרו על ידי כל שיטת הסביריות. הוויזואליזציות ממחישות את ההבדלים בלוקליזציה מרחבית ומדגישות את אזורי התמונה התורמים בצורה החזקה ביותר להחלטת הסיווג של מסגרת ה-EDLF-SLC המוצעת. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

סימוכיןשנהסט נתוניםגודל נתוניםחילוץ מאפייניםשיטהדיוק
92022HAM10000 dataset10015 תמונות של נגעי עורמאפייני צבע וצורהאלגוריתמי ML ומודלי Convolutional NN95.1%
192023PH2 dataset200 תמונות מתויגותמאפיינים של אסימטריה, פסיים, נקודות/גלובולות ואזורי רגרסיהמודלי ML94.0%
302024HAM10000 dataset10000 תמונותמאפייני צבע וצורהS-MobileNet97.7%
282025סטים של ISIC2020 ו-HAM10000ISIC2020 (12,670 תמונות) ו-HAM10000 (10,015 תמונות)צבע וצורהResidual network-Long Short-Term Memory (R-LSTM50)95.7% (ISIC2020); 94.2% (HAM10000)
322026Monkeypox Skin Lesion Dataset (MSLD)770 תמונותהקשר ומרקםDenseNet121, Xception, InceptionV3 ו-CBAM88% (DenseNet121)
392025HAM1000038,569 תמונותהקשר ומרקםMobileNet, ResNet50, InceptionV3, ו-EfficientNet93.6% (MobileNet)
402025ISIC 20192357 תמונותהקשר ומרחבDL רב-מודאלי מבוסס CNN-transformer98.71%
412026ISIC 201925,000 תמונותהקשר ומרקםTransXV2S95.26%
422025HAM1000010,015 תמונותצבע וצורהViT עם YOLOv893%

טבלה 1: השוואה ספרותית. סיכום של מספר עבודות שפורסמו לאחרונה המשתמשות באלגוריתמים של למידה עמוקה לסיווג נגעי עור.

סט נתוניםשפירממאירסה"כ
נתוני אימון144011972637
נתוני בדיקה360300660
סך כל הנתונים180014973297

טבלה 2: התפלגות מערך הנתונים. התפלגות של דגימות שפירות וממאירות במערך הנתונים ISIC 2020, כולל חלוקה למערכי אימון ובדיקה.

רכיבמפרט
מערכת הפעלהUbuntu 20.04
שפת תכנותPython 3.9
מסגרת DLPyTorch 2.3.1
אופטימייזרAdam
תזמון קצב למידה1e−3
מספר תקופות (epochs)100/300
CPU2 vCPU 2.2 GHz
GPUTesla T4 (16 GB) × 1
RAM16 GB
פרמטרים הניתנים לאימון2,430,353 (9.27 MB)
פרמטרים שאינם ניתנים לאימון133,434,397 (509.01 MB)

טבלה 3: מפרט המערכת. מפרט מפורט של הסביבה החישובית, כולל מסגרות תוכנה ומשאבי חומרה ששימשו לאימון ולהערכה של המודל.

מחלקהדיוק (Precision)רגישות (Recall)מדד F1תמיכה (Support)
מחלקה שפירה0.830.880.85360
מחלקה ממאירה0.840.780.81300
דיוק כללי (Accuracy)--0.832660
ממוצע מאקרו0.840.830.83660
ממוצע משוקלל0.840.830.83660

טבלה 4: דוח סיווג. ביצועי הסיווג של מודל ה-ResNet-50 על מערך הנתונים לבדיקה, כולל דיוק (precision), רגישות (recall), מדד F1-score ותמיכה (support) עבור כל מחלקה.

מודלדיוקדיוקהסריקה מחדש (Recall)מדד F1זמן (שנייה)
NASNetLarge0.770.760.770.762002.47
EfficientNetB00.850.850.850.85734.8
Xception0.80.810.80.8732.23
ResNetV20.630.640.630.6111072.34
MobileNet0.790.80.790.79629.29
MobileNetV20.770.790.770.77660.5
ResNet500.830.830.830.83749.77
EDLF-SLC0.880.890.870.883279.77

טבלה 5: השוואת ביצועי המודל. ביצועים השוואתיים של מודל ה-EDLF-SLC המוצע ומודלי למידה עמוקה בסיסיים במונחים של דיוק (accuracy), דיוק חזוי (precision), רגישות (recall), מדד F1 וזמן חישוב.

מודלדיוקדיוקהסמקה (Recall)מדד F1
ResNet-18 [25]0.850.850.850.85
ResNet-50 עם SVM [50]0.870.880.980.93
מודלי DL היברידיים + SVM [48]0.860.840.80.84
מודלים היברידיים של למידה עמוקה (DL) + SVM [49]0.860.80.60.68
EDLF-SLC מוצע0.880.890.870.88

טבלה 6: מדדי השוואת מודלים. השוואת ביצועים בין מסגרת ה-EDLF-SLC המוצעת לבין גישות state-of-the-art עדכניות לסיווג נגעים בעור.

קובץ משלים 1: אלגוריתם 1. זרימת העבודה של מסגרת ה-EDLF-SLC המוצעת, המפרטת עיבוד מקדמי של נתונים, מיצוי מאפיינים עמוקים באמצעות ארכיטקטורות CNN מרובות, סיווג מבוסס SVM, והסבירות המבוססת על LIME לניבוי נגעים בעור. אנא לחצו כאן כדי להוריד קובץ זה.

קובץ משלים 2: אלגוריתם 2. תהליך העבודה של תהליך ההסבר המקומי מבוסס LIME, הממחיש יצירת superpixel, דגימת הפרעות, בניית מודל פ proxy וויזואליזציה של אזורי התמונה התורמים ביותר להחלטת הסיווג. אנא לחץ כאן כדי להוריד קובץ זה.

דיון

מסגרת הלמידה העמוקה ההסברית המוצעת לסיווג נגעים בעור (EDLF-SLC) מדגימה כי שילוב של ייצוגי מאפיינים עמוקים משלימים עם בינה מלאכותית הסברית יכול לשפר הן את ביצועי הסיווג והן את שקיפות המודל. על ידי שילוב של מספר ארכיטקטורות CNN מאומנות מראש (ResNet50, EfficientNetB0, MobileNet ו-Xception) לחילוץ מאפיינים ושימוש במכונת וקטורים תומכים (SVM) לסיווג סופי, המסגרת מנצלת את היתרונות של מחלצי מאפיינים שונים כדי להפיק ייצוגי נגעים עשירים ומבחינים יותר מאלו המתקבלים מרשת שלד אחת. יתרה מכך, שילוב של הסברים מקומיים הניתנים לפירוש ללא תלות במודל (LIME) מספק הסברים חזותיים מקומיים, המאפשרים לקלינאים להבין את אזורי התמונה התורמים ביותר לכל תחזית ומגבירים את הביטחון בהחלטות האבחנתיות של המודל.

תוצאות ניסיוניות מדגימות כי EDLF-SLC משיג ביצועים תחרותיים בהשוואה למודלי CNN בסיסיים, כולל MobileNet, Xception ו-ResNet50, מה שמדגיש את יעילותן של מיזוג מאפיינים משלימים וסיווג מבוסס SVM. השוואה לגישות עדכניות מהשורה הראשונה (state-of-the-art) מאששת עוד יותר את התחרותיות של המסגרת המוצעת. לדוגמה, שני מחקרים48,49 דיווחו על דיוקים של כ-0.86 תוך שימוש בשיטות מבוססות אנסמבל, בעוד שמסגרות היברידיות אחרות של CNN-SVM25,50,51,52,53 השיגו דיוקים של עד 0.87 אך הסתמכו על ארכיטקטורות מורכבות יותר ומודולים נוספים של עיבוד מקדים או סגמנטציה. בניגוד לכך, המסגרת המוצעת משיגה דיוק של 0.88 תוך שימוש בארכיטקטורה יעילה ומפושטת יחסית ללא צורך בסגמנטציה מפורשת של הנגעים, ובו-זמנית מספקת תחזיות ניתנות לפירוש באמצעות LIME. תוצאות אלו מצביעות על כך ששילוב של מחלצי מאפייני CNN משלימים לפני סיווג SVM יכול לשפר את ביצועי האבחון תוך שמירה על פשטות ארכיטקטונית ושקיפות.

למרות שהמסגרת המוצעת משפרת את דיוק הסיווג ואת יכולת הפירוש, שיפור זה מגיע על חשבון עלות חישובית מוגברת. זמן האימון הכולל של EDLF-SLC הוא כ-3279.77 s, גבוה משמעותית ממודלי CNN בודדים כגון ResNet50 (749.77 s) ו-MobileNet (629.29 s). עומס חישובי נוסף זה נובע מאימון של מספר רשתות CNN מאומנות מראש וביצוע מיזוג מאפיינים לפני הסיווג. פשרה כזו נצפית לעיתים קרובות בגישות למידה היברידיות ומכלולים (ensemble learning), שבהן ביצועים חיזויים משופרים מושגים במחיר של דרישות חישוביות גבוהות יותר. עם זאת, במערכות תמיכה בהחלטות קליניות, דיוק אבחנתי, חוסן ואמינות נחשבים בדרך כלל לחשובים יותר מיעילות האימון, מכיוון שהם משפיעים ישירות על תוצאות הטיפול בחולה.

יתרון חשוב נוסף של המסגרת המוצעת הוא יכולת ההסבר שלה. בניגוד למודלים קונבנציונליים של למידה עמוקה שפועלים לעיתים קרובות כ"קופסאות שחורות", EDLF-SLC משלב את LIME כדי לספק הסברים ויזואליים ספציפיים למקרה על תהליך החיזוי. הסברים אלו מסייעים לקלינאים לוודא שהמודל מתמקד באזורים רלוונטיים קלינית בנגע, ובכך משפרים את השקיפות, תומכים בפירוש הקליני ומקלים על האמון באבחנה מסייעת מבוססת בינה מלאכותית. כתוצאה מכך, המסגרת המוצעת מציעה איזון מעשי בין ביצועי חיזוי לבין יכולת פרשנות של המודל, מה שהופך אותה לכלי מבטיח לתמיכה בקבלת החלטות ממוחשבת לסיווג נגעי עור.

למרות תוצאות מעודדות אלו, יש להכיר במספר מגבלות. ראשית, המסגרת הוערכה באמצעות מערך הנתונים הציבורי ISIC בלבד, ויכולת ההכללה שלה על גבי תמונות שנרכשו בתנאים קליניים שונים, באמצעות מכשירי דימות שונים ובאוכלוסיות חולים שונות, טרם תוקפה. שנית, שימוש במספר ארכיטקטורות CNN מאומנות מראש מעלה בהכרח את המורכבות החישובית ואת זמן האימון בהשוואה למודלים בעלי שלד (backbone) יחיד. שלישית, במהלך הניסויים אומצו הגדרות היפר-פרמטרים קבועות, ואופטימיזציה נוספת עשויה לשפר את הביצועים ואת יכולת ההסתגלות על פני מערכי נתונים שונים. לבסוף, למרות ש-LIME משפרת את שקיפות המודל, ההסברים שלה הם מקומיים ותלויים בהפרעה (perturbation), כלומר, עקביות ההסברים עשויה להשתנות בין הרצות ויש לתקפה עוד יותר עם מומחים לרמטולוגיה לפני פריסה קלינית שגרתית.

מחקרים עתידיים יתמקדו בתיקוף המסגרת המוצעת באמצעות מספר מאגרי נתונים רחבי היקף ומרובי מרכזים של נגעי עור, אופטימיזציה של היעילות החישובית באמצעות מיזוג תכונות קל-משקל וטכניקות לדחיסת מודלים, בחינת אסטרטגיות מתקדמות לאופטימיזציה של היפר-פרמטרים, והרחבת המסגרת לסיווג רב-מחלקתי של נגעי עור. יתרה מכך, שילוב של טכניקות נוספות של בינה מלאכותית ניתנת להסבר (explainable AI) וביצוע הערכות קליניות פרוספקטיביות עם רופאי עור יחזקו עוד יותר את האמינות, יכולת הפירוש וההיתכנות המעשית של המסגרת המוצעת בסביבות קליניות בעולם האמיתי.

גילויים

המחברים מצהירים כי אין ניגוד עניינים.

תודות

המחברים מבקשים להביע את תודתם הכנה לאוניברסיטת טאיף על אספקת סביבת המחקר והתמיכה המוסדית שסייעו להשלמת עבודה זו.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
ISIC 2020 Skin Lesion DatasetInternational Skin Imaging Collaboration (ISIC)ISIC 2020 Challenge Datasetמאגר תמונות דרמוסקופיות המשמש לפיתוח והערכה של מודלים.
KerasKeras Teamאינטגרציה עם TensorFlowבנייה ואימון של מודלי למידה עמוקה.
LIME (Local Interpretable Model-Agnostic Explanations)Ribeiro et al.חבילת Pythonיצירת הסברים ויזואליים מקומיים לתחזיות המודל.
MatplotlibMatplotlib Developersהגרסה התואמת העדכנית ביותרויזואליזציה של עקומות למידה, מטריצות בלבול (confusion matrices) וגרפי הערכה.
NumPyNumPy Developersהגרסה התואמת העדכנית ביותרחישובים מספריים ומניפולציה של מערכים.
NVIDIA Tesla T4 GPUNVIDIA Corporation16 GB VRAMהאצת אימון המודל והסקה (inference).
PandasPandas Development Teamהגרסה התואמת העדכנית ביותרעיבוד נתונים וניהול תוצאות ניסויים.
Pretrained CNN ModelsTensorFlow/Keras ApplicationsResNet50, EfficientNetB0, MobileNet, Xceptionחילוץ מאפיינים עמוקים מתמונות דרמוסקופיות.
PythonPython Software Foundationגרסה 3.9שפת התכנות המשמשת למימוש.
PyTorchPyTorch Foundationגרסה 2.3.1מסגרת למידה עמוקה המשמשת לחילוץ מאפיינים ומימוש מודלים.
Scikit-learnScikit-learn Developersהגרסה התואמת העדכנית ביותרSupport Vector Machine (SVM), מדדי הערכה ועיבוד מקדמי של נתונים.
Support Vector Machine (RBF Kernel)Scikit-learnSVCסיווג של ייצוגי מאפיינים עמוקים ממוזגים.
TensorFlowGoogle LLCגרסה 2.xמסגרת למידה עמוקה לאימון מודלים והסקה.
Ubuntu Operating SystemCanonical Ltd.Ubuntu 20.04סביבת ההפעלה הניסויית.

מקורות

  1. Chan S, Reddy V, Myers B, Thibodeaux Q, Brown-Stone N, Liao W. Machine learning in dermatology: current applications, opportunities, and limitations. Dermatol Ther (Heidelb). 2020;10:365-386.
  2. Olsen CM. Global trends in melanoma mortality differ by sex and age. Br J Dermatol. 2020;183(6):985-986.
  3. Sun Y, Shen Y, Liu Q, Zhang H, Jia L, Chai Y, et al. Global trends in melanoma burden: a comprehensive analysis from the Global Burden of Disease Study, 1990-2021. J Am Acad Dermatol. 2025;92(1):100-107.
  4. Monika MK, Vignesh NA, Kumari CU, Kumar M, Lydia EL. Skin cancer detection and classification using machine learning. Mater Today Proc. 2020;33:4266-4270.
  5. Hosny KM, Elshora D, Mohamed ER, Vrochidou E, Papakostas GA. Deep learning and optimization-based methods for skin lesions segmentation: a review. IEEE Access. 2023.
  6. Baghdadi NA, Farghaly Abdelaliem SM, Malki A, Gad I, Ewis A, Atlam ES. Advanced machine learning techniques for cardiovascular disease early detection and diagnosis. J Big Data. 2023;10(1):144.
  7. Veeramani N, Jayaraman P, Krishankumar R, Ravichandran KS, Gandomi AH. DDCNN-F: double decker convolutional neural network feature fusion as a medical image classification framework. Sci Rep. 2024;14(1).
  8. Veeramani N, Jayaraman P. YOLOv7-XAI: multiclass skin lesion diagnosis using explainable artificial intelligence with fair decision making. Int J Imaging Syst Technol. 2024;34(6).
  9. Shetty B, Fernandes R, Rodrigues AP, Chengoden R, Bhattacharya S, Lakshmanna K. Skin lesion classification of dermoscopic images using machine learning and convolutional neural network. Sci Rep. 2022;12(1):18134.
  10. Ali AR, Li J, Yang G, O'Shea SJ. A machine learning approach to automatic detection of irregularity in skin lesion border using dermoscopic images. PeerJ Comput Sci. 2020;6:e268.
  11. Pham TTH, Luu TN, Nguyen TV, Huynh NT, Phan QH, Le TH. Polarimetric imaging combining optical parameters for classification of mice non-melanoma skin cancer tissue using machine learning. Heliyon. 2023;9(11).
  12. Liu N, Rejeesh M, Sundararaj V, Gunasundari B. ACO-KELM: anti coronavirus optimized kernel-based softplus extreme learning machine for classification of skin cancer. Expert Syst Appl. 2023;232:120719.
  13. Masud M, Almars AM, Rokaya MB, Meshref H, Gad I, Atlam ES. A novel lightweight convolutional neural network model to predict Alzheimer's disease applying weighted loss function. J Disabil Res. 2024;3(4):20240042.
  14. Kumar A, Veeraiah V, Gongada TN, Ahamad S, Khan H, Gupta A. Explainable machine learning models for clinical decision support systems. In: 2024 15th International Conference on Computing Communication and Networking Technologies (ICCCNT). Piscataway (NJ): IEEE; 2024. p. 1-6.
  15. Shahzad K, Wasim M, Pires IM, Garcia NM. Multi-classification of skin lesions using a deep learning-based convolutional neural network. Procedia Comput Sci. 2024;241:588-593.
  16. Celebi ME, Kingravi HA, Uddin B, Iyatomi H, Aslandogan YA, Stoecker WV, et al. A methodological approach to the classification of dermoscopy images. Comput Med Imaging Graph. 2007;31(6):362-373.
  17. Li CX, Shen CB, Xue K, Shen X, Jing Y, Wang ZY, et al. Artificial intelligence in dermatology: past, present, and future. Chin Med J (Engl). 2019;132(17):2017-2020.
  18. Ramprasad M, Nagesh S, Sahith V, Lankalapalli RK. Hierarchical agglomerative clustering based skin lesion detection with region-based neural networks classification. Meas Sens. 2023;29:100865.
  19. Khater T, Ansari S, Mahmoud S, Hussain A, Tawfik H. Skin cancer classification using explainable artificial intelligence on pre-extracted image features. Intell Syst Appl. 2023;20:200275.
  20. Wang H, Ahn E, Bi L, Kim J. Self-supervised multi-modality learning for multi-label skin lesion classification. Comput Methods Programs Biomed. 2025;265:108729.
  21. Thapar P, Rakhra M, Alsaadi M, Quraishi A, Deka A, Naga Ramesh JV. A hybrid grasshopper optimization algorithm for skin lesion segmentation and melanoma classification using deep learning. Healthc Anal. 2024;5:100326.
  22. Kumar S, Nath VK, Hazarika D. Blend of deep features and binary tree growth algorithm for skin lesion classification. Symmetry (Basel). 2023;15(12):2213.
  23. Chandrahaas BV, Mohanty SN, Panda SK, et al. An empirical study on classification of monkeypox skin lesion detection. EAI Endorsed Trans Pervasive Health Technol. 2023;9:e4.
  24. Talavera-Martínez L, Bibiloni P, Giacaman A, Taberner R, de Paz Hernando LJD, González-Hidalgo M. A novel approach for skin lesion symmetry classification with a deep learning model. Comput Biol Med. 2022;145:105450.
  25. Ieracitano C, Morabito FC, Hussain A, Suffian M, Mammone N. TIXAI: a trustworthiness index for explainable artificial intelligence in skin lesion classification. Neurocomputing. 2025;630:129701.
  26. Hasan MK, Elahi MTE, Alam MA, Jawad MT, Martí R. DermoExpert: skin lesion classification using a hybrid convolutional neural network through segmentation, transfer learning, and augmentation. Inform Med Unlocked. 2022;28:100819.
  27. Koparde S, Kotwal J, Deshmukh S, Adsure S, Chaudhari P, Kimbahune V. Conditional generative adversarial networks and YOLOv5 Darknet-based skin lesion localization and classification using an independent component analysis model. Inform Med Unlocked. 2024;47:101515.
  28. Padhy S, Dash S, Kumar N, Singh SP, Kumar G, Moral P. Temporal integration of ResNet features with LSTM for enhanced skin lesion classification. Results Eng. 2025;25:104201.
  29. Xin C, Liu Z, Ma Y, Wang D, Zhang J, Li L, et al. Transformer-guided self-adaptive network for multi-scale skin lesion image segmentation. Comput Biol Med. 2024;169:107846.
  30. Sulthana R, Chamola V, Hussain Z, Albalwy F, Hussain A. A novel end-to-end deep convolutional neural network-based skin lesion classification framework. Expert Syst Appl. 2024;246:123056.
  31. Chamarthi S, Fogelberg K, Brinker TJ, Niebling J. Mitigating the influence of domain shift in skin lesion classification: a benchmark study of unsupervised domain adaptation methods. Inform Med Unlocked. 2024;44:101430.
  32. Maity S, Paul S, Guha S, Dasgupta S, Ghosh M. Automated classification of monkeypox skin lesions using a hybrid deep learning model. Biomed Signal Process Control. 2026;126:110955.
  33. Nasir S, Bilal M, Khalidi H. Detection and classification of skin cancer by using CNN-enabled cloud storage data access control algorithm based on blockchain technology. Int J Theor Appl Comput Intell. 2025:145-169.
  34. Saba T. Computer vision for microscopic skin cancer diagnosis using handcrafted and non-handcrafted features. Microsc Res Tech. 2021;84(6):1272-1283.
  35. Fayyad J, Alijani S, Najjaran H. Empirical validation of conformal prediction for trustworthy skin lesion classification. Comput Methods Programs Biomed. 2024;253:108231.
  36. Liu P, Qian W, Li H, Cao J. A relationship-aware mutual learning method for lightweight skin lesion classification. Digit Commun Netw. 2025;11(3):603-612.
  37. Adla D, Reddy GVR, Nayak P, Karuna G. A full-resolution convolutional network with a dynamic graph cut algorithm for skin cancer classification and detection. Healthc Anal. 2023;3:100154.
  38. Thamizhamuthu R, Maniraj SP. Deep learning-based dermoscopic image classification system for robust skin lesion analysis. Trait Signal. 2023;40(3).
  39. Di Giammarco M, Santone A, Cesarelli M, Martinelli F, Mercaldo F. A method for skin lesion detection and localization by means of deep learning and reliable prediction explainability. Image Vis Comput. 2025;162:105675.
  40. Haq IU, Joarder HA, Khan AA, Shi X, Alsayaydeh JAJ, Yusof MFB, et al. XAAI-ledger: an explainable CNN-transformer-based multimodal deep learning framework for early detection of melanoma and non-melanoma skin cancers using dermoscopic and clinical data. Biomed Signal Process Control. 2026;123:110410.
  41. Saeed K, Shehzad M, Malik MGA, Ahmed S, Azar AT. TransXV2S-NET: a novel hybrid deep learning architecture with dual-contextual graph attention for multi-class skin lesion classification. Knowl Based Syst. 2026;337:115407.
  42. AbuAlkebash H, Saleh RAA, Ertunç HM. Automated explainable deep learning framework for multiclass skin cancer detection and classification using hybrid YOLOv8 and vision transformer (ViT). Biomed Signal Process Control. 2025;108:107934.
  43. Hasan MK, Ahamad MA, Yap CH, Yang G. A survey, review, and future trends of skin lesion segmentation and classification. Comput Biol Med. 2023;155:106624.
  44. Li H, Pan Y, Zhao J, Zhang L. Skin disease diagnosis with deep learning: a review. Neurocomputing. 2021;464:364-393.
  45. Wu Y, Chen B, Zeng A, Pan D, Wang R, Zhao S. Skin cancer classification with deep learning: a systematic review. Front Oncol. 2022;12:893972.
  46. Fanconic. Skin cancer: malignant vs benign dataset. Kaggle; 2023. Available from: https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign
  47. Ribeiro MT, Singh S, Guestrin C. "Why should I trust you?": Explaining the predictions of any classifier. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD '16). New York (NY): ACM; 2016. p. 1135-1144.
  48. Bassel A, Abdulkareem AB, Alyasseri ZAA, Sani NS, Mohammed HJ. Automatic malignant and benign skin cancer classification using a hybrid deep learning approach. Diagnostics (Basel). 2022;12(10):2472.
  49. Bhardwaj A, Rege PP. Skin lesion classification using deep learning. In: Advances in Signal and Data Processing: Select Proceedings of ICSDP 2019. Singapore: Springer; 2021. p. 575-589.
  50. Keerthana D, Venugopal V, Nath MK, Mishra M. Hybrid convolutional neural networks with SVM classifier for classification of skin cancer. Biomed Eng Adv. 2023;5:100069.
  51. Ahmed A, Siam AI, Atwa MA, Atwa EM, Abdelrahim EM, Atlam ES. An explainable YOLO-based deep learning framework for pneumonia detection from chest X-ray images. Algorithms. 2025;18(11):703.
  52. Farsi M, ZainEldin H, Sayed RF, El-Agamy ES, Atlam SA, Alsaedi M, et al. Deep learning for pathology: YOLOv8 with EigenCAM for reliable colorectal cancer diagnostics. Bioengineering (Basel). 2025;12(11):1203.
  53. Atwa EA, Atlam ES, Ahmed A, Atwa MA, Abdelrahim EM, Siam AI. Interpretable deep learning models for arrhythmia classification based on ECG signals using the PTB-XL dataset. Diagnostics (Basel). 2025;15(15):1950.

הדפסות חוזרות והרשאות

תגיות

בינה מלאכותית ניתנת להסבררשתות נוירונים קונבולוציוניותמכונת וקטורים תומכיםפרשנות של מודליםהיתוך מאפייניםCNN מאומנת מראשהסברי LIMEאבחון מחלות