מאמר מחקר

אבחון מוקדם מבוסס אינטליגנציה חישובית של מחלת אסתמה: מחקר מקרה בערב הסעודית

DOI:

10.3791/70040

16 ביוני 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחקר הנוכחי בוחן מספר אלגוריתמים של למידת מכונה על מאגר נתונים סעודי לזיהוי אסתמה. בניגוד לגישות מתקדמות המשתמשות בלמידת מכונה על מאגרי נתונים קליניים לאבחון אסתמה, התוכנית המוצעת משיגה ביצועים טובים יותר, עם שיפור של 3.9% בדיוק האבחון.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

לפי מחקרים, זוהתה עלייה במחלות כרוניות, כולל אסתמה. מספר חולי האסטמה בערב הסעודית מהווה סיבה לדאגה בשל תנאי מזג האוויר ואורח החיים, במיוחד בעידן שלאחר המגפה. היא דורשת פתרון להפחתת זיהומים על ידי פיתוח מערכת חכמה לזיהוי אסתמה בשלב מוקדם, ובכך למנוע את המחלה או לאפשר טיפול מוקדם. במחקר זה, למידת מכונה שימשה לפיתוח כלים למעקב אחר תסמיני אסתמה בשלב מוקדם. למרות שהיו ניסיונות קודמים רבים ליישם למידת מכונה כדי לחזות את הופעת האסתמה. עם זאת, התמקדות בזיהוי המחלה בשלב שלפני התסמינים, במיוחד בהקשר הסעודי, היא תחום מוזנח יחסית. מאגר הנתונים למחקר הנוכחי התקבל מבית החולים האוניברסיטאי המלך פאהד, דמאם, ערב הסעודית, וכלל בדיקות סטנדרטיות שבוצעו על מטופלים, כולל בדיקות דם, בדיקות ויראליות ובדיקות ביוכימיה. מערך הנתונים מכיל 17 תכונות משמעותיות וכולל מידע עבור 328 חולי אסתמה: 165 חיוביים ו-163 שליליים. השיטות שנבחרו ליישום כאן הן יערות אקראיים (RF), רשתות עצביות מלאכותיות (ANN), מכונות וקטוריות תמיכה (SVM) ובייז נאיביות (NB). כל אחת מהשיטות הללו נבחרה על פי תכונותיה הייחודיות. התוצאה הניסויית הראתה כי גישות RF, SVM ו-ANN הניבו 94%, שזהו הדיוק הגבוה ביותר ושיפור ב-3.9% לעומת הטכנולוגיה המתקדמת. ראוי לציין כי תשע מתוך שבעה-עשר התכונות האפשריות שימשו להשגת הדיוק הנ"ל. למרות ש-RF, SVM ו-ANN משיגים את אותו דיוק, ל-ANN יש עלות שגיאה גבוהה יותר. לכן, RF ו-SVM עדיפים על פי דפוס התוצאות, ולכן הם מוצעים לבעיה זו.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

לאחר מחקר נרחב, החוקרים הבחינו שמחלות כרוניות הפכו נפוצות יותרויותר 1. אסתמה היא מחלה דלקתית כרונית בדרכי הנשימה, המתאפיינת בפרקים חוזרים של קוצר נשימה וצפצופים. השכיחות של אסתמה משתנה ברחבי העולם, ונעה בין 1 ל-20% בקרב ילדים ומבוגרים, ומשפיעה על מיליוניאנשים ברחבי העולם. שינויים רחבי היקף אלו קשורים לשינויים סביבתיים, כולל במדינות שונות, וכן לשימוש בכלי הערכה שונים ובהגדרות אפידמיולוגיות מגוונות של אסתמה. לאסתמה שיעור תמותה נמוך יחסית בניגוד למספר מחלות כרוניות ידועות אחרות2. עם זאת, דיווחים מציינים כי דפוס האסתמה בממלכת ערב הסעודית עולהב-3.4.

אסתמה היא מצב דלקתי כרוני שגורם לצמצום הלומן. הצמצום מסלול התעופה נגרם מהרחבת פליטת נוזלי הגוף, וכן מעיבוי מחלקי הסימפונות עקב בצקת, פיברוזיס תת-אפיתליאלי והיפרטרופיה של שריר חלק. מערכות פתופיזיולוגיות המונעות על ידי סוגי תאים שונים, כולל תאי חיסון, שימשו להערכתמצבים אלו. בשל תנאי מזג אוויר קשים ואורח חיים ביתי בעיקר בערב הסעודית, אסתמה היא אחת המחלות הכרוניות הנפוצות ביותר. מספר סקרים הראו את שיעור האסתמה6 המכריע. המחלה הפכה לבעיה משמעותית, ודורשת מערכת תגובה מוקדמת שתסייע בהפחתת מספר האירועים ותאפשר תיווך מוקדם למניעת או ריפוי המחלה בשלב מוקדם יותר.

בניגוד ליחידים, לאסתמה יש השפעה עמוקה על קהילות ומשפחות. אם לא נשלטים, הוא מטיל מגבלות חמורות על חיי המטופל ומונע ממנו לעסוק בפעילויות יומיומיות רבות. בערב הסעודית, תנאי מזג אוויר קשים, כולל אווירה חמה, סופות חול נרחבות ושימוש מופרז במערכות מיזוג וקירור פנימיות, הם גורמים משמעותיים לאסתמה. אגודת החזה הסעודית (STS) השקיעה מאמצים בולטים לספק את התרופות הטובות ביותר לזיהומים בדרכי הנשימה7. עם זאת, יש צורך באבחנה פרואקטיבית של אסתמה כדי להפחית את שיעור ההדבקה, במיוחד בסיטואציה שלאחר מגפה (COVID-19). הוסקה גם כי היסטוריה משפחתית, עישון ונזלת אלרגית הם בין גורמי הסיכון המשמעותיים ביותר להתפתחות אסתמה בקרב מבוגרים סעודים. הומלץ מחקר נוסף כדי לחקור גורמים נוספים שמניחים את הבסיס למחקר.

במחקר זה, בהתחשב במחקרים קודמים על אבחון אסתמה, המטרה היא לשפר את דיוק האבחון. הטכניקות המוצעות, כולל יער אקראי (RF), רשת עצבית מלאכותית (ANN), מכונת וקטור תמיכה (SVM) וביייס נאיבי (NB), שימשו במחקרים קודמים, והניבו שיפורים ניכרים בתוצאות האבחון. לדוגמה, חוקרים השתמשו ב-ANN, SVM ו-NB במחקרים 8,9,10. במחקר הנוכחי נחקרו גישות למידת מכונה כדי לסייע כמערכת התרעה מוקדמת שמזהה אפילו את הסימנים הקטנים של מחלת אסתמה בשלבים המוקדמים ביותר (שלב טרום-סימפטומטי). השכיחות של מחלות אסתמה בערב הסעודית, במיוחד בעידן שלאחר המגפה, עם גורמים כמו אורח חיים פנימי עקב תנאי מזג אוויר קשים, תעלות מיזוג אוויר וסופות חול הם בין הגורמים המרכזיים. עם זאת, אין מחקר ראוי לציון הבודק את הגורמים המרכזיים שנצפו לאחרונה. כדי להתמודד עם פער מחקר זה, המחקר הנוכחי שואף לחקור את תפקיד למידת המכונה בגילוי מוקדם של אסתמה בקרב מבוגרים סעודים. יתרה מזאת, המטרה העיקרית היא להשיג את הדיוק הגבוה ביותר האפשרי עם התכונות המועטות ביותר. למרות שהיו ניסיונות מוכרים בעבר להשתמש בלמידת מכונה כדי לחזות את נוכחות מחלת האסטמה 8,9,10. המחקר הנוכחי שואף להשתמש במאגר נתונים סעודי שהושג לראשונה מבית חולים ציבורי במחוז המזרחי, תוך התמקדות באבחון המחלה בשלב מוקדם (אבחנה מונעת). למידת מכונה (ML) מוכרת כשיטה להפקת ידע מנתוניםשנאספו 11,12. הוא מספק דיוק חיזוי שהושג מתהליך הלמידה של מופעים קודמים באמצעות טכניקות שונות של למידת מכונה. למידת מכונה כוללת שיטות, אלגוריתמים ואסטרטגיות רבות לטיפול בבעיות אנליטיות וחיזוי בתחומים רפואיים רחבים, כגון גילוי מוקדם של קיומם של מחלות13,14.

נערכו מספר מחקרים לחיזוי מחלת אסתמה באמצעות טכניקות שונות. החוקרים פיתחו רשת עצבית מלאכותית (ANN) לסיווג אסתמה בהתאם לבדיקות המטופל הדינמיות והסטטיות8. הפרמטרים הנמדדים של ספירומטריה, אוסצילומטריית אימפולס (IOS), שמיעה, תוצאות אלרגיה ומידע על תסמינים משמשים ב-ANN. המידע המוגדר מאפשר ל-ANN להציע את הסיווג המתאים לאסתמה. באופן דומה, חוקרים ערכו מחקר כדי להתמודד עם האתגרים באבחוןמחלות חזה. מכונות וקטור תמיכה (SVM) ושיטות SVM אדפטיביות (ASVM) שימשו לאבחון מחלות חזה כגון אסתמה. דיוק הסיווג הטוב ביותר לכל מחלות החזה הושג באמצעות שיטת ASVM. החוקרים השתמשו במספר מבני רשת עצבית, כגון NN רב-שכבתי (MLNN) עם אלגוריתם התפשטות אחורית (BPA) עם שכבה אחת ושתיים נסתרות, NN הסתברותי (PNN), קוונטיזציה וקטורית למידה (LVQ) ו-NN רגרסיה כללית (GRNN), לאבחון מחלות חזה, כולל מחלת אסתמה15. בנוסף, חלקם ערכו מחקר השוואתי שנועד לאבחן מחלות חזה באמצעות מערכת חיסון מלאכותית (AIS). המחקרים שהוזכרו יישמו מבנים שונים לאבחון בעיות מחלות חזה באמצעות מאגרי הנתונים השונים שלהם. באסתמה, התוצאה הגבוהה ביותר הושגה באמצעות AIS עם דיוק כולל של 90.91%16. יתרה מזאת, חוקרים חקרו את היעילות של NN עמוק (DNN) לשיפור הדיוק באבחון אסתמה והשוו את ביצועי החיזוי של אלגוריתמים שונים של למידת מכונה, במיוחד עם רגרסיה לוגיסטית ו-SVM. המחקר הראה כי המבחן האמפירי שהשתמש במודל סימני האסתמה היה יעיל יותר לאבחון מדויק של אסתמה9. מחקר נוסף הראה את היכולת המשמעותית של למידת מכונה המשתמשת בנתוני מעקב מרחוק לחזות החמרה של אסתמה לפני שהן מתרחשות, באמצעות גישות למידת מכונה נבחרות כמו SVM ו-Naïve Bayes ליישום הניסוישלהם 10.

מלבד זאת, חוקרים השתמשו במספר טכניקות למידת מכונה לאבחון מוקדם של מחלת האלצהיימר (AD), כולל SVM, k-NN, הגברת אדפטיבית (AdaBoost) והגברת גרדיאנט אקסטרים (XGBoost)17. חוקרים ערכו מחקר לאבחון ראשוני של סוכרת, על ידי חקירת ארבע גישות למידת מכונה: NB, SVM, K-NN ו-ANN. שלושת התכונות המובילות במאגר הנתונים הסעודי הציגו את הדיוק הממוצע הגבוה ביותר של 68%. ביצועי טכניקות המדידה הושוו על פי דיוק, דיוק, זיכרון וציון F1. ה-ANN השיג את דיוק הסיווג הגבוה ביותר של 77.5%18. באופן דומה, אותה קבוצת חוקרים ניסתה את ביצועי ארבע טכניקות סיווג — NB, SVM, K-NN ו-ANN — לאבחון מונע של מחלת כליות כרונית, כפי שהוחל על מאגר הנתונים הסעודי19. יתרה מזאת, המחברים ערכו מחקר לאבחון פרימיטיבי של סרטן בלוטת התריס באמצעות ארבע טכניקות למידת מכונה: ANN, SVM, RF ו-NB. באמצעות 14 מאפיינים של מאגר הנתונים הסעודי, השיגו המחברים את הדיוק הממוצע הגבוה ביותר של 95%. ביצועי טכניקות המדידה הושוו באמצעות דיוק, דיוק, זיכרון וציון F1. ה-RF השיג את דיוק הסיווג הגבוה ביותר של 90.91%20. החוקרים גם ערכו שני מחקרים שהניבו תוצאות מרשימות באבחון פרואקטיבי של דלקת מפרקים שגרונית. מספר טכניקות למידת מכונה, כגון SVM, רגרסיה לוגיסטית (LR) ו-AdaBoost, נבחרו לרשימה הקצרה ושימשו כטכניקות מועמדות לאנסמבל הצבעה. בהתחלה נעשה שימוש במערך נתונים אחד, והשני אוזן על ידי יישום SMOTE. טכניקת קבוצת ההצבעה החדשנית נבדקה על ידי שתי שיטות בחירת תכונות עוקבות. כלומר, בחירה קדימה ואחורית משמשת כדי למצוא את תת-הקבוצה הטובה ביותר של מרחב התכונות שמציגה את המדדים הגבוהים ביותר לכל טכניקה. באמצעות 30 תכונות מהנתונים המקוריים וטכניקת בחירת תכונה קדימה סדרתית, האחוזים שהושגו היו מבטיחים, עם דיוק, זיכרון ודיוק של 94.03%, 96%, ו-93.51%, בהתאמה.באופן דומה, שיטות חכמות נוספות ברפואה ובתחומים קשורים ניתן למצוא במחקרים רבים 22,23,24,25,26.

הטכניקות המוצעות בעבודה זו הן RF, SVM, ANN ו-NB בשל התוצאות המרשימות שלהן לבעיות דומות. במחקר הנוכחי, התוצאות שהושגו דרך הניסויים. לאחר שלבי אופטימיזציה שונים ובחירת תכונות, הוכח כי הטכניקות המוצעות מבטיחות לאבחון אסתמה באמצעות מאגר הנתונים הממוקד.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

סעיף זה מתאר את אלגוריתמי למידת המכונה שנבדקו בגישה המוצעת לאבחון אסתמה. הקריטריונים והסיבות לבחירת השיטה המוצעת מבוססים על סקירת ספרות מקיפה והיסטוריה ארוכה של טיפול באבחון מונע של מספר מחלות כרוניות 27,28,29,30,31. האלגוריתמים הללו הניבו תוצאות מבטיחות. כל החומרים והכלים ששימשו במחקר זה מופיעים בטבלת החומרים.

מכונות וקטור תמיכה (SVM)
אלגוריתם SVM הוא בין האלגוריתמים המוצלחים ביותר בזיהוי וסיווג תבניות32. הוא משתמש בסיווג בינארי, שבו הוא מסווג קבוצת וקטורי אימון לשתי מחלקות. הוא שייך למשפחת אלגוריתמי הלמידה המפוקחת, שבהם התוצר הרצוי נוצר תחת פיקוח32. בהשוואה לאלגוריתמים אחרים של סיווג בלמידת מכונה, SVM מספק תוצאות טובות יותר לביצועי סיווג. לכן, הוא שימש רבות ביישומים רבים כגון זיהוי דיבור, פנים וכתב יד. יתרה מזאת, SVM יושם גם בתחומים שונים, כולל חיזוי מחלות וחיזוי מלאי. בנוסף, בשל חוסר הרגישות שלו לרעש או התאמת יתר, SVM מסוגל להתמודד עם נתונים לא מאוזנים, מקרה טיפוסי באבחון רפואי, שבו מקרים חיוביים הם פחות מהמקרים השליליים32.

בסיווג, SVM מפריד בין שתי מחלקות על ידי שרטוט גבול החלטה, שבו הוא יכול לחזות את התוויות על ידי הבחנה בין וקטורי תכונה אחד או יותר32. גבול ההחלטה נקרא היפר-מישור, שהוא הרחוק ביותר מנקודות הנתונים הקרובות ביותר של כל מחלקה. נקודות הנתונים הללו נקראות וקטורי תמיכה. איור 1 מציג כמה היפר-מישורים מועמדים בנתונים נפרדים ליניארית. משוואה 1 מדגימה את משוואת ההיפר-מישור, בעוד שמשוואות 2 ו-3 מציגות את האיברים הממוקמים מעל ומתחת למישור32:

figure-protocol-1משוואת היפר-מישור (1)

כאן, w הוא וקטור המייצג משקל, x הוא וקטור המייצג את הקלט, ו-b. מייצג הטיה פוטנציאלית.

figure-protocol-2לכל j, כך ש figure-protocol-3 = +1 (2)

figure-protocol-4לכל i, כך ש figure-protocol-5 = -1 (3)

figure-protocol-6
איור 1: SVM טיפוסי עם שתי מחלקות נפרדות. איור זה מציג SVM טיפוסי עם שתי מחלקות נפרדות. קיצורים; SVM = מכונת וקטור תמיכה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

רשת עצבית מלאכותית (ANN)
ANN היא טכניקת אינטליגנציה חישובית במחשוב רך המדמה את תפקוד מערכת המוח האנושית. יש לו מספר עצום של נוירונים מקושרים33. זהו אחד האלגוריתמים המפוקחים של למידת מכונה שיכולים ללמוד ממאגרי נתונים לדוגמה ולשפר את ביצועיהם באמצעות למידה, וליצור פלטים שימושיים33. הארכיטקטורה של ANN מורכבת ממספר שכבות: שכבת קלט, שכבה נסתרת ושכבת פלט. כל אחד מהם מורכב מקבוצה של נוירונים מחוברים33.

הנוירון שמקבל את הנתונים מבחוץ מבצע עיבוד מסוים ואז שולח את הנתונים לשכבה אחרת הנקראת שכבת הקלט. מטרת שכבת הקלט אינה לבצע תהליך מורכב על הנתונים; זה פשוט לשכפל את ערך הקלט ולשלוח אותו לשכבההבאה 33. שכבת הפלט מכילה נוירונים שמייצרים נתונים עבור תוכנית המשתמש. בין שתי השכבות הללו, השכבה הנסתרת ממוקמת כשכבה אופציונלית לביצוע תהליכים חישוביים. השכבה הנסתרת משמשת כשכבה ביניים שמקבלת קלטים מנוירוני הקלט, מבצעת עליהם פעולות מתמטיות, ואז מעבירה את התוצאות לשכבהאחרת 33. איור 2 מציג את ארכיטקטורת ה-ANN.

figure-protocol-7
איור 2: הזנה קדימה והפצה אחורית במבנה ANN טיפוסי. איור זה מציג רשת הזנה קדימה עם התפשטות אחורית במבנה ANN טיפוסי. קיצורים; ANN = רשת עצבית מלאכותית. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

ה-NN עם הזנה קדימה הוא גישה שמאחסנת נתוני קלט בכיוון קדימה. בכיוון ההפוך, תהליך ההפצה לאחור מתרחש כאשר משקלי הרשת העצבית מתעדכנים בגישה לאחור כדי לקבל את הגרדיאנטים, תוך שימוש ברשת עצבית עם מספר שכבות נסתרות. החיסרון בתהליך זה הוא היעלמות או התפוצצות של גרדיאנטים. פונקציית ההפעלה שומרת על המאפיינים הלא-ליניאריים של ה-ANN שלהם, מה שמאפשר לה ללמוד יחסים מפורטים בין נתוני קלט לפלט, כפי שהוכרז כקירוב אוניברסלי. איור 3 מציג את הארכיטקטורה הראשית של רשת העצבים המלאכותית. הוא גם ממחיש את פונקציית ההפעלה המופעלת על פלט כל נוירון, שמייצגת את סכום כל משקלי הקלט. ההטיה מחזיקה את סכום כל המשקלים ונכללת בקלטהנוירון 33.

figure-protocol-8
איור 3: נוירון פרספטרון יחיד טיפוסי עבור ANN. איור זה מציג נוירון פרספטרון יחיד של ANN טיפוסי. קיצורים; ANN = רשת עצבית מלאכותית. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

יער אקראי (RF)
RF הוא אחד מאלגוריתמי הסיווג הבולטים בלמידת מכונה. הוא מורכב ממספר עצי החלטה נפרדים העובדים יחד כהרכב ומפיקים את התוצר הסופי29. הרעיון הבסיסי מאחורי הביצועים המוצלחים של ה-RF הוא שהוא מורכב מעצים רבים ללא קורלציה בינונית (היוצרים יער), הפועלים כועדה. לכן, הם יהיו יעילים יותר מכל המודלים שרצים באופן עצמאי34. אלגוריתם ה-RF פותח בעיקר על ידי קבוצת חוקרים35. כדי להבין טוב יותר כיצד פועל RF, חשוב להבין עצי החלטה35. הוא רלוונטי באותה מידה הן לבעיות בדידות והן בבעיות רציפות, ובפרט סיווג, גילוי ורגרסיה, בהתאמה36. ככל שיש יותר עצים ביער, כך התוצאה תהיה קרובה יותר לדיוק, אך עם מורכבות חישובית נוספת36, כפי שמוצג באיור 4.

figure-protocol-9
איור 4: סכמת יער אקראי. איור זה מציג סכמטיקה של יער אקראי טיפוסי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

נאייב בייס (NB)
בייז נאיבי (NB) הוא אלגוריתם סיווג המשתמש במשפט בייס לסיווג עצמים. זו שיטה מאוד פופולרית המיושמת ברוב תחומי הרפואה, במיוחד לאבחון תסמינים. בשיטה זו, האובייקטים לוקחים את הנחות העצמאות העיקריות, מה שהופך את הקשר בין התכונות לעצמאי זה מזה. בשל אופיו התמים, הוא נחשב לאחד האלגוריתמים הפשוטים ביותר לסיווג בלמידת מכונה37. בהתבסס על מאגר הנתונים הנתון, NB קובע את הסבירות לפלט מסוים. מודל ה-NB פשוט לפיתוח, יכול לנהל נתונים משמעותיים, והוא אלגוריתם מתוחכם וקל מבחינה חישובית. בנוסף, הוא מספק פונקציות צנועות, מה שמוביל לידע מספרי ונומינלי. עמידות ופרשנויות למידה פשוטות הן גם היתרונות הפוטנציאליים של מסווג NB. אם הוא מיושם על כמות מוגבלת של נתונים, הוא יוביל לתוצאה יחסית לא מדויקת. זה תלוי ברשומות עצומות, שנחשבות לפחות מדויקות בהשוואה לטכניקות אחרות.

ניתוח סטטיסטי
ניתוח סטטיסטי של מאגר הנתונים מסייע להמחשה והבנת דפוס הנתונים לעיבוד ומידול נתונים טובים יותר. בהקשר זה, בוצעו הצעדים הבאים. ראשית, כדי לבדוק האם המאפיינים הדמוגרפיים אינם מאוזנים בין קבוצות חיוביות ושליליות, כולל גיל ומגדר, מתבצע ניתוח סטטיסטי על תוכנת SPSS. שנית, לאסוף את הנתונים הכמותיים באמצעות מבחן t מדגם עצמאי אם התפלגות נורמלית וההומוגניות של השונות היו קיימות, או מבחן Man-Whitney U. לבסוף, הנתונים הקטגוריים נאספו באמצעות מבחן חי-בריבוע או מבחן פישרהמדויק 38.

מימוש
תיאור מערך הנתונים
מערך הנתונים של המחקר הנוכחי התקבל מבית החולים האוניברסיטאי המלך פהד בדמאם, ערב הסעודית, לאחר אישור ועדת הביקורת המוסדית (IRB). הנתונים נאספו לפי בדיקות סטנדרטיות בקרב המטופלים. אסתמה מאובחנת לעיתים קרובות באמצעות בדיקות סטנדרטיות בקרב מטופלים, כולל בדיקות דם, בדיקות וירוס ובדיקות ביוכימיה. למחקר הנוכחי, המטופלים והביקורת הבריאה (HC) גויסו והוערכו קלינית בהתבסס על מיון סטנדרטי ובדיקות פתולוגיות שנערכו בבית החולים בהמלצות רופאי המחלקה. הקריטריונים להכללה קלינית וההדרה הוגדרו על ידי הרופאים בהתבסס על תוצאות המעבדה. בהמשך, סופקו הנתונים המוסמכים והמאומתים למחקר. מערך הנתונים מכיל שבעה-עשר תכונות, שכן הן זמינות לכל חולי האסתמה. מערך הנתונים כולל 328 מקרים בסך הכל, מתוכם 165 חיוביים לאסתמה ו-163 מקרים שליליים לאסתמה. התפלגות המגדר והגיל בקבוצות החיוביות והשליליות מפורטת בטבלה 1.

מופעיםחיובישלילי
זכר14510738
נקבה18357126
סך הכל328164164

טבלה 1: התפלגות מגדרית במאגר הנתונים. טבלה זו מציגה את התפלגות המגדר במאגר הנתונים.

טבלה 2 מציגה את התפלגות הגיל בין שתי המחלקות.

טווח גילאיםהתפלגות גיל (כיתה = 1)התפלגות גילאים (מחלקה = 0)
1–100.0591130
11–200.1133010.060869
21–300.0837430.177947
31–400.1576320.164912
41–500.177340.164912
51–600.1970440.099566
61–700.1083740.047619
71–800.0788170.025974
81–900.0197040.012987
91–1000.0049260.012987

טבלה 2: התפלגות גיל במערכי נתונים. טבלה זו מציגה את התפלגות הגילאים במאגר הנתונים.

הגיל (p < 0.001 במבחן Man-Whitney U) והמגדר (p < 0.001 בבדיקת חי-בריבוע) לא היו מאוזנים בין הקבוצות החיוביות והשליליות. עם זאת, אין הטיה בתהליך הגיוס. סבורים כי ההתפלגות הלא מאוזנת עשויה לשקף את התפלגות הגיל הייחודית של קבוצת מטופלים זו. קריטריוני ההכללה כוללים גורמים קליניים לנוכחות והיעדר המחלה; דמוגרפיה, כולל מגדר, גיל ואוכלוסייה מקומית, נלקחות בחשבון. יתרה מזאת, הנתונים נאספו בהסכמה מדעת. גיל ומגדר כלולים כתכונות פוטנציאליות בסט התכונות, כפי שמוזכר להלן. עם זאת, ניתוחים מפורשים מבוססי גיל ומגדר אינם בתחום המחקר ונשארים כעבודה עתידית.

מערך הנתונים נשמר כערכים מספריים. עמודת "מחלקה" מכילה את הערכים 0 ו-1, כאשר 0 מייצג את "המטופל התקין" ו-1 מייצג את "מטופל האסתמה".
בהקשר זה, נעשה שימוש בשבעה-עשר התכונות הבאות:
מחלקה: (0 = "נורמלי", 1 = "חולה אסתמה")

1. גיל בשנים (גיל)

2. מגדר (1 = זכר, 0 = נקבה): מין

3. בזופילים (BASO)

4. אאוזינופילים (EOS)

5. המטוקריט (HCT)

6. המוגלובין (HGB)

7. לימפוציטים (LYM)

8. המוגלובין קורפוסקולרי ממוצע (MCH)

9. ריכוז ההמוגלובין הממוצע בקורפוסקולר (MCHC)

10. נפח גופית ממוצע (MCV)

11. מונוציטים (מונוציטים)

12. נפח ממוצע של טסיות (MPV)

13. תפקוד הנויטרופילים (NEUT)

14. ספירת טסיות (PLATELET_COUNT)

15. ספירת תאי דם אדומים (RBC)

16. רוחב התפלגות תאי אדומה (RDW)

17. תאי דם לבנים (WBC)

מאפיינים סטטיסטיים של מאגר הנתונים
להבנה טובה יותר, ניתוח סטטיסטי של מאגר הנתונים מוצג בטבלאותהבאות 38. טבלה 3 מציגה את הערכים הממוצעים, החציוניים, סטיית התקן המקסימלית והמינימום עבור מערך הנתונים הנבחן.

ממוצעחציוןסטיית תקןמקסמין
גיל39.13618.136932
מגדר0.44200.497410
בסו0.070.070.07010.720
EOS0.2310.2290.204820
HCT40.8840.76.031356.53.4
HGB13.6713.454.344681.35.9
לימפ2.5952.332.184333.40.4
MCH26.78273.317734.52.6
MCHC32.71332.101743.115
MCV81.1582.89.442610213
מונונו1.1890.6136.1198950.2
MPV9.2179.2171.729713.40
NEUT4.234.232.3074160.6
PLATELET_COUNT279.7272.585.4736850
RBC5.677511.6152152.1
RDW14.7213.415.7692960
WBC6.7776.5053.583633.41.1
מחלקה0.50.50.500810

טבלה 3: מאפיינים סטטיסטיים של מאגר הנתונים. טבלה זו מפרטת את התכונות הסטטיסטיות של הנתונים.

בנוסף, טבלה 4 מציגה את מקדם המתאם שהושג בין כל תכונה לתכונת המחלקה. הערכים שלו נעים בין 0 (הכי פחות מתואם) ל-1 (הכי מתוכם). הוא נוסף כניתוח סטטיסטי ראשוני כדי להסביר את מאפייני מאגר הנתונים. MPV, מגדר, HGB, MCHC וגיל הם בין התכונות המשמעותיות ביותר.

זוגות תכונותמקדם קורלציה
גיל0.212473
מגדר0.423584
בסו-0.33242
EOS0.048184
HCT-0.376843
HGB0.275277
לימפ0.055856
MCH0.128111
MCHC0.272635
MCV0.013022
מונונו0.055476
MPV0.564992
NEUT0.031185
PLATELET_COUNT0.095253
RBC0.030787
RDW0.025979
WBC0.148842
מחלקה1

טבלה 4: קורלציה עם תכונת מחלקה. טבלה זו מציגה את המתאם בין התכונות (מאפיינים) לבין מאפיין המחלקה (Class).

סידור ניסיוני
במחקר הנוכחי, שפת התכנות פייתון משמשת לעיבוד מוקדם של מערך הנתונים שנאסף. עקב טעות אנוש, ערכים מסוימים חסרים במהלך הזנת הנתונים והבחירה. טכניקות אימפוטציה שימשו לטיפול בערכים חסרים במאגר הנתונים. זה נעשה על ידי החלפת ערכים חסרים בממוצע של התכונה. בגלל הפשטות שלו, תאימות המודלים ושימור ערכי ממוצע המדגם, כפי שנדון עם אנשי מקצוע בתחום הבריאות. יתרה מזאת, בחירת תכונות מתבצעת באמצעות מקדמי קורלציה לדירוג התכונות. התכונות עם ערכי קורלציה גבוהים יותר נבחרו לניתוח לצד מערך התכונות המלא. ספריות פייתון שימשו ליישום הגישה המוצעת, לכיוון היפרפרמטרים ולקבלת תוצאות. בחירת התכונות וההסרה בוצעו באמצעות שיטת בחירת תכונות לזיהוי קבוצות התכונות בדיוק הגבוה ביותר. בנוסף, פייתון שימשה להערכת דיוק באמצעות שיטות אימות צולב של 10 פעמים והערכת יחס חלוקה ישיר, כפי שמוגדר במשוואות39,40. לבסוף, ממוצע כל תוצאות שיטות ההערכה חושב כדי להשוות את שיטות ההערכה ולקבוע את השיטה עם הדיוק הממוצע הטוב ביותר38. בנוסף, נוצרו מטריצות בלבול באמצעות הפרמטרים האופטימליים של SVM, ANN, RF ו-NB. לאחר מכן, בוצעה השוואה בין יחס חיובי שגוי (FP), שלילי שגוי (FN), חיוביים אמיתיים (TP) ושליליים אמיתיים (TN) באמצעות חישוב ציון F1, שהוא מדד יעיל להשוואת השיטה הטובהביותר 41,42.

מדדי הערכה
כדי להעריך את ביצועי הגישה המוצעת, נלקחים בחשבון ארבעה מדדי ביצועים מוכרים. כלומר, דיוק, דיוק, שחזור וציון F1. דיוק הסיווג הוא המדד העיקרי מכיוון שאחוז המקרים המסווגים נכון מחושב עבור כל מופע. דיוק הוא מספר נקודות ה-TP הכולל הצפוי. הריקול הוא מספר ה-TP הגבוה מכל חיובי בפועל. ביצועים עם ציון F1 בכל מחלקה. בהתאם ליכולת הפלטים, מתקבלים המדדים הבאים 43,44,45:

חיובי אמיתי (TP): תוצאה של אבחון נכון כאסטמה.

חיובי שגוי (FP): תוצאה של אבחון שגוי של אסתמה.

שלילי אמיתי (TN): תוצאה של מקרים נכונים שאובחנו כלא אסתמה.

שלילי שגוי (FN): תוצאה של אבחון שגוי כלא אסתמה.

figure-protocol-10(4)

figure-protocol-11(5)

figure-protocol-12(6)

אסטרטגיית אופטימיזציה
כדי לקבוע את הפרמטרים האופטימליים לכל אחת מהגישות המוצעות, נעשה שימוש בטכניקת חיפוש רשת. ערכי פרמטרים ספציפיים אפשריים ממוקמים בשיטת חיפוש הרשת. לכן, הוא יכול לפתח את הביצועים הטובים ביותר לשיפור הדיוק.

איורים 5–7 מציגים את תוצאות טכניקת חיפוש הרשת עבור כל ארבע הגישות המוצעות ואת תהליך היישום על מאגר הנתונים בעזרת שמונה-עשר המאפיינים המובילים. איור 5 מציג את דיוקי SVM שהתקבלו עם ערכי פרמטרים שונים. ערכי הקלט עבור Cost ו-Gamma המתאימים למספר סוגי גרעינים הם כדלקמן:

סוגי גרעינים: ליניארי, רדיאלי, סיגמואידי ופולינומי.

גמא: 0.001 ו-0.0001.

עלות: 1, 10, 100 ו-1000.

figure-protocol-13
איור 5: SVM עם סוגי עלות וגמא שונים. איור זה מדגים התנהגות SVM עם סוגי עלות וגמא שונים. קיצורים; SVM = מכונת וקטור תמיכה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

עבור ה-RF, ערכי הקלט השיטתיים המצוינים באיור 6 הם כדלקמן:

שמות הפרמטרים, יחד עם הערכים שלהם, מסופקים להלן:

מספר תכונות: 'אוטומטי', 'sqrt'.

עומק מקסימלי: 1, 3, 5, 7.

דגימות: 2, 3, 4, 5.

דגימות מינימוניות עלה: 2, 3, 4, 5.

figure-protocol-14
איור 6: RF עם ערכי עומק שונים ועלי דגימה מינימליים. איור זה מציג התנהגות RF בעומקים שונים וערכי עלי דגימה מינימליים. קיצורים; RF = יער אקראי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

עבור ה-ANN, ערכי הקלט האנליטיים מצוינים באיור 7.

שמות הפרמטרים, יחד עם הערכים שלהם, הם הבאים:

גדלי שכבות נסתרים: (50, 50, 50), (50, 100, 50), ו-(100,).
הפעלה: 'טאנה' ו'רלו'.
סולבר: 'sgd' ו-'אדם'.
אלפא: 0.1, 0.01, 0.001, 0.0001, 0.5, 0.005, 0.0005, ו-0.05.
קצב למידה: 'קבוע' ו'אדפטיבי'.

figure-protocol-15
איור 7: ANN עם ערכי אלפא שונים וגדלי שכבות נסתרים. איור זה מציג את התנהגות ה-ANN עם ערכי אלפא שונים וגדלי שכבות נסתרים. קיצורים; ANN = רשת עצבית מלאכותית. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

מסווגפרמטרערך
SVMגמא0.0001
סוג גרעין'RBF'
עלות 'C'10
מצב אקראי42
RFעומק מקסימלי3
מינ דגימות עלים2
פיצול מינימום דגימות2
מצב אקראי42
אןהפעלה'רלו'
אלפא0.001
גודל השכבה הנסתרת(50,50,50)
קצב למידה'קבוע'
פותר'אדם'
מצב אקראי42

טבלה 5: סיכום הפרמטרים האופטימליים עבור המסווגים המוצעים. טבלה זו מסכמת את הפרמטרים האופטימליים שהושגו עבור המסווגים המוצעים.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

השפעת בחירת התכונות
במחקר הנוכחי, שיטת מקדם המתאם המבוססת על ביטול תכונות רקורסיבית משמשת לבחירת התכונות. מקדם המתאם משמש לסדר את התכונות מהגבוה ביותר לנמוך ביותר לפי ערכי המתאם שלהם. הסרת תכונות רקורסיבית משמשת לסייע בבחירת התכונות המתאימות למודל, שכן היא מסירה בהדרגה את התכונות החלשות עד שנשארת רק אחת. כל תהליך מריץ את ארבעת המסווגים הנבחרים עם אימות צולב של 10 פעמים כדי למצוא את הקבוצה המדויקת ביותר. להלן תהליך השיטה של האלימינציה:

ראשית...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחקר הנוכחי עושה שימוש במספר אלגוריתמים של למידת מכונה, כולל SVM, ANN, RF ו-NB. לאחר ביצוע מספר ניסויים, כיוונון עדין של היפרפרמטרים ובחירת תכונות, הוסכם כי SVM, ANN ו-RF מציגים דיוק אבחוני מרשים של 94%, בעוד ש-NB נמוך יחסית עם 83.33%. התוצאות אומתו באמצעות אימות צולב של 10 פעמים ובחירת תכונות אופטימלית, וכן יחס הפיצול הטוב ביותר. לפי הנתונים שניתנו, שבעה עשר פרמטרים של המטופלים דורגו לפי ערכי מקדם המתאם שלהם, והוכח כי MPV נמוך ו-GENDER הם בעלי הקשר החיובי הגבוה ביותר לאסתמה. מצד שני, H...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מאגר הנתונים התקבל מבית החולים לפי IRB-2020-09-429. המחברים מצהירים שאין להם ניגודי עניינים לדווח בנוגע למחקר הנוכחי. המחקר נוסף למאגר Research Square כהדפסה מוקדמת עם הציוןהבא 50.

תרומות המחברים:
הקונספטואליזציה בוצעה על ידי S.O., M.I.B.A. ו-A.R.; הפיקוח בוצע על ידי S.O., M.I.B.A. ו-J.A.; כתיבת הטיוטה המקורית בוצעה על ידי S.S.A., E.A. ו-Z.A.; היישום בוצע על ידי S.A.A., Y.A. ו-R.A.; האימות בוצע על ידי J.A., M.A. ו-S.D.; אוצרות הנתונים בוצעה על ידי A.B., Y.A., E.A. ו-Z.A.; סקירה ועריכה בוצעו על ידי A.R., S.D. ו-A.B.; ניהול הפרויקט בוצע על ידי A.R., S.D. ו-M.A. ורכישת המימון בוצעה על ידי A.B., S.D. ו-A.R.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מבקשים להודות לתמיכת אנשי מקצוע בתחום הבריאות באימות ממצאי המחקר.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
Excel 365MicrosoftExcel 365משמש לאחסון נתונים גולמיים בפורמט csv
מחשב נייד/מכונהDellXPS9320RAM 16GB, Intel(R) Core(TM) i7-1260P דור 12
Mlxtend 0.23.4Google colab Notebook Mlxtend 0.23.4משמש לבניית מודל אימון 
Numpy 2.0.2Google colab Notebook Numpy 2.0.2משמש לבניית מודל אימון 
Pandas 2.2.2Google colab Notebook Pandas 2.2.2משמש לבניית מודל אימון 
Python 3.12.12Google colab Notebook Python 3.12.12משמש לבניית מודל אימון 
Sklearn 1.6.1Google colab Notebook Sklearn 1.6.1משמש לבניית מודל אימון 
SPSS IBM, USAגרסה 26.0משמש לניתוח סטטיסטי
XGbbost 3.1.2Google colab Notebook XGbbost 3.1.2משמש לבניית מודל אימון 

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

מאמרים קשורים