פרוטוקול זה מתאר תהליך חישובי ליצירת והערכת מודלים משולבים של למידת מכונה לחיזוי מחלות לב, תוך שימוש בנתוני בנצ'מרק נגישים לציבור בתוך מבנה עיבוד מוקדם והערכה שניתן לשחזר.
Research Article
פרוטוקול זה מתאר תהליך חישובי ליצירת והערכת מודלים משולבים של למידת מכונה לחיזוי מחלות לב, תוך שימוש בנתוני בנצ'מרק נגישים לציבור בתוך מבנה עיבוד מוקדם והערכה שניתן לשחזר.
מאמר זה מציג הערכת סימון חישובית של אלגוריתמים של למידה קבוצתית בחיזוי מחלות לב, תוך שילוב אלגוריתמים שונים של למידת מכונה, כגון הצבעה קשה, הצבעה רכה וערימה, במסגרת אחת. ההערכה בוצעה באמצעות מאגר נתונים קרדיווסקולריים זמין לציבור שנאספו ממאגר Kaggle (https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final), הכולל 1,190 מקרים ו-11 מאפיינים קליניים. התהליך כולל עיבוד נתונים מוקדם, הכולל טיפול בערכים חסרים, הסרת חריגים, שינוי משתנים בקנה מידה ואיזון מחלקות כדי להבטיח בחירת תכונות קלט אחידה, המבוססת על יער אקראי (RF), לביטול תכונות מיותרות. מבין המודלים שנבדקו, מסווג האנסמבל המצטבר השיג את הדיוק הכולל הגבוה ביותר של 91.88% במאגר הנתונים של הבדיקה. למרות שמדדים נוספים כמו דיוק, זיכרון וציון F1 חושבו לניתוח השוואתי, הדגש במחקר זה נשאר על הבנצ'מרקינג מתודולוגי ולא על אימות קליני.
מסווגי בסיס שונים, כולל Decision Tree, Random Forest, AdaBoost ו-XGBoost, מיושמים ונבדקים באופן עצמאי. מודלים אלו משולבים באמצעות טכניקות קבוצתיות עם הצבעה קשה, הצבעה רכה וערימה. בערימה, רגרסיה לוגיסטית משמשת כמטא-מודל, שמאומן על תחזיות מאומתות צולב של דגימות מחוץ לקפל כדי למנוע התאמת יתר.
ההערכות מתבצעות תוך שימוש בדיוק כקריטריון העיקרי להשוואה, כך שניתן להשוות באופן אחיד בין מערכות סיווג בודדות ואסטרטגיות השילוב שלהן באותה סביבת עיבוד מוקדם ואימות. למרות שניתנים מדדי ביצועים להשוואת, הדגש בגישה הוא על פיתוח והערכת אסטרטגיות ולא בהערכה הקלינית שלהן.
פרוטוקול זה מקל על השוואת אלגוריתמים של למידת מכונה קבוצתית על מאגרי נתונים קרדיווסקולריים זמינים לציבור ועוזר לבצע השוואה שיטתית בין גישות עיבוד נתונים מוקדם וקונפיגורציית אנסמבל.
מערכי נתונים ציבוריים של מחלות לב וכלי דם משמשים באופן נרחב כבעיות ייחוס במחקר למידת מכונה להערכת אלגוריתמים של סיווג וטכניקות מידול חיזוי 1,2,3. מערכי נתונים כאלה, המכילים מאפיינים קליניים ודמוגרפיים, מספקים בסיס סטנדרטי וניתן לשחזור להשוואת אסטרטגיות קדם-עיבוד, שיטות בחירת תכונות וארכיטקטורות למידה קבוצתית בתנאים ניסיוניים מבוקרים. כתוצאה מכך, הם משמשים לעיתים קרובות להערכת התנהגות אלגוריתמית ולא לתמוך בהסקה קלינית או בפריסה בעולם האמיתי 4,5.
מחקרים קודמים בחנו שיטות שונות של למידת מכונה לחיזוי מחלות לב-וכלי דם, כגון רגרסיה לוגיסטית (LR), מכונות וקטור תמיכה (SVM), יערות אקראיים (RF) ומודלים של הגברת גרדיאנטים 6,7,8,9. לאחרונה, מחקרים התמקדו בטכניקות למידה קבוצתית, כגון הצבעה קשה, הצבעה רכה וערימה, כדי להפוך את המודלים ליציבים יותר ולשפר את ביצועיהם 10,11,12,13,14. עם זאת, ההבדלים באופן שבו הנתונים מוכנים, מטפלים במאפיינים, מתבצע האימות והתוצאות שנמדדות במחקרים הללו מקשים על השוואת התוצאות המדווחות ישירות. כדי לספק סקירה הקשרתית רחבה של קטגוריות מחלות לב וכלי דם המדווחות לעיתים קרובות בספרות, מוצג איור מושגי באיור 1.

איור 1: המחשה מושגית של קטגוריות מחלות לב וכלי דם המדווחות נפוצות, כלולה רק לרקע הקשרי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
איור 1 כלול אך ורק לצורך התייחסות הקשרתית ברמה גבוהה ואינו מייצג נתונים שמקורם במאגר הנתונים שנבחן במחקר זה או מפלטים מהפרוטוקול החישובי המוצע.
במיוחד, עבודות רבות קיימות מדגישות תוצאות ביצועים מבלי לבודד בבירור את תרומתן של רכיבים מתודולוגיים בודדים, כגון תזמון בחירת תכונות, איזון מחלקות או תצורת אנסמבל 15,16,17,18. שונות זו מדגישה את הצורך במסגרת בנצ'מרקינג שניתנת לשחזור שמעריכה באופן שיטתי שיטות למידת מכונה קבוצתית באמצעות צינור עיבוד מקדים עקבי ופרוטוקול הערכה על מאגר נתונים זמין לציבור.
השערה היא שגישות למידה קבוצתיות, במיוחד שיטות ערימה, ידגימו דיוק סיווג משופר וביצועים מאוזנים לפי מחלקות בהשוואה למסווגי בסיס בודדים כאשר יוערכו בתנאי עיבוד מוקדם ואימות סטנדרטיים.
בהתאם לכך, מטרת מחקר זה היא לבצע ניתוח השוואה חישובית של גישות למידת מכונה קבוצתית לחיזוי מחלות לב וכלי דם באמצעות מאגר נתונים זמין לציבור של Kaggle. התהליך כולל עיבוד נתונים סטנדרטי, שימוש באלגוריתם Random Forest לדירוג חשיבות התכונות, וכן שימוש בטכניקות שונות של אנסמבל, הכוללות הצבעה קשה, הצבעה רכה וערימה. רגרסיה לוגיסטית משמשת כאלגוריתם מטא-מסווג בערימה. זה מבטיח שלא תהיה התאמה יתר, שכן הוא משתמש בתחזיות מאומתות צולבות.
מחקר זה מיועד אך ורק כחקירת השוואת נתונים ציבורית. ממצאיו מוגבלים על ידי הסתמכות על מערך נתונים יחיד והטיות ספציפיות אפשריות, ולכן אינם מרמזים על אימות קליני או פריסת. אימות חיצוני באמצעות מערכי נתונים עצמאיים והערכה פרוספקטיבית יידרש לפני שניתן יהיה לשקול יישום קליני.
השאלות המחקריות הבאות מנחות את המחקר הזה:
מחקר זה בוחן כיצד גישות שונות של למידת מכונה קבוצתית, כולל הצבעה קשה, הצבעה רכה וערימה, משוות בדיוק הסיווג כאשר הן מיושמות על מאגר נתונים ציבורי של מחלות לב וכלי דם.
Access restricted. Please log in or start a trial to view this content.
פרוטוקול זה תיאר תהליך חישובי שניתן לשחזור להשוואת מודלים של למידת מכונה קבוצתית באמצעות מאגר נתונים ציבורי של מחלות לב וכלי דם.
בחירת מאגר הנתונים
המחקר השתמש במאגר נתונים של מחלות לב וכלי דם זמין לציבור, שהושג ממאגר Kaggle. מערך הנתונים כלל 1190 מופעים וכלל 11 תכונות. לאימון מודלים, 80% מהנתונים נוצלו, בעוד ש-20% הנותרים הוקצו להערכת ביצועים. טבלה 1 הציגה תיאור מפורט של תכונות מערך הנתונים. מערך הנתונים נטען לפייתון (גרסה 3.9) באמצעות ספריית ה-pandas (גרסה 1.5.3). שלמות מערכי הנתונים נבדקה על ידי בדיקת ערכים חסרים, רשומות כפולות וסוגי נתונים לא עקביים.
טבלה 1 מסכמת את המאפיינים הדמוגרפיים, הקליניים והניסיוניים הכלולים במאגר מחלות לב וכלי דם, יחד עם סוגי הנתונים והפורמטים המקודדים. תכונות אלו היוו את משתני הקלט לכל הליכי ההערכה וההערכה של מודלים לאחר מכן.
| סל. לא | שם תכונה | סוג נתונים | תיאור |
| 1 | גיל | נומרי | גיל המטופל בשנים. |
| 2 | מין | נומינלי | זכר מיוצג כ-1, ונקבה כ-0. |
| 3 | סוג כאב בחזה | קטגורי | 1: טיפוסי 2: אנגינה טיפוסית 3: כאב לא אנגינלי 4: ללא תסמינים |
| 4 | לחץ דם במנוחה | מספרי | לחץ הדם במנוחה נמדד במילימטרים של כספית (mmHg). |
| 5 | רמת הכולסטרול | נומרי | כולסטרול בסרום במיליגרם לדציליטר (mg/dL). |
| 6 | סוכר בצום | נומינלי | רמות סוכר בדם מעל 120 מ"ג/ד"ל בצום מיוצגות כ-1 עבור נכון ו-0 עבור שקרי. |
| 7 | אקג במנוחה | קטגורי | שלושה ערכים מובחנים מוקצים כדלקמן: 0 עבור נורמלי, 1 עבור חריגות בגל ST-T, ו-2 עבור היפרטרופיה של החדר השמאלי. |
| 8 | קצב לב מקסימלי | נומרי | קצב לב שיא שהושג |
| 9 | אנגינה תרגילית | נומינלי | אנגינה הנגרמת על ידי פעילות גופנית, כאשר 0 מייצג NO ו-1 מייצג כן. |
| 10 | אולדפיק | נומרי | דיכאון ST בזמן פעילות גופנית בהשוואה למצב המנוחה. |
| 11 | שיפוע ST | קטגורי | שיפוע מקטעי ST במהלך שיא פעילות גופנית מסווג כך: 0: נורמלי 1: עלייה 2: שטוח 3: ירידה בשיפוע |
טבלה 1: תיאור מאפייני מאגר הנתונים המשמשים לחיזוי מחלות לב.
עיבוד מוקדם של הנתונים
עיבוד נתונים מוקדם בוצע באמצעות ספריות פייתון. שורות שהכילו ערכים חסרים הוסרו באמצעות פנדה. פונקציית DataFrame.dropna(). יוצאי דופן בתכונות מספריות זוהו והוסרו באמצעות שיטת טווח בין-רבעוני (IQR) והדמיה מבוססת תרשימת קופסה, הממחישה את ההתפלגות והזוהות בין תכונות (איור 2). כל המשתנים המספריים הוגדלו באמצעות פונקציית StandardScaler מספריית scikit-learn (גרסה 1.2.2). אי-איזון מחלקתי טופל באמצעות דגימה תת-אקראית כדי לקבל התפלגות מחלקות מאוזנת לפני הכשרת המודלים.

איור 2: תרשים קופסה של כל התכונות במאגר הנתונים למחלות לב וכלי דם. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
מקדם המתאם של פירסון (PCC) שימש להערכת הקשרים בין התכונות. מטריצת המתאם שנוצרת, המוצגת כמפת חום, ממחישה את עוצמת וכיוון הקורלציות הזוגיות של תכונות ומדגישה תכונות מיותרות לאלימינציה (איור 3).

איור 3: מטריצת קורלציה עבור מאגר הנתונים של מחלות לב. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
המודל יוצר מפת חום של מטריצת המתאמים, שהיא אסתטית ומאפשרת הבנה מהירה יותר של קורלציות בין תכונות שונות בנתונים. מפת חום זו משתמשת בצבעים כדי להראות כמה ובאיזה כיוון ערכים קשורים, מה שהופך אותה לכלי חשוב בניתוח נתונים חקר. צבעים בהירים מראים מתאמים חיוביים גבוהים יותר, צבעים כהים מראים מתאמים שליליים גבוהים יותר, ויותר ירוקים מראים מתאמים קרובים לאפס.
חילוץ תכונות
בחירת התכונות בוצעה באמצעות חשיבות תכונה ביער אקראי שמיושמה דרך RandomForestClassifier בספריות למידת מכונה בקוד פתוח. ציוני חשיבות המאפיינים חושבו בהתבסס על הירידה הממוצעת בזיהום, ותכונות דורגו בהתאם. המאפיינים בדירוג N נשמרו לניתוח מאוחר יותר. בחירת תכונות יושמה לאחר סיום כל שלבי הקדם-עיבוד ולפני חלוקת רכבת-בדיקה, כדי להבטיח שימוש במערך תכונות קבוע ועקבי בכל מודלי הסיווג וקונפיגורציות האנסמבל (איור 4).

איור 4: ציוני חשיבות תכונה שחושבים באמצעות חשיבות תכונות יער אקראי. תכונות מדורגות לפי ערך חשיבות מנורמל. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
המאפיינים דורגו בהתבסס על הירידה הממוצעת בזיהום באמצעות חשיבות תכונות יער אקראי עם random_state = 42; עם זאת, כל התכונות הזמינות (N = 11) נשמרו לאימון דגם מאוחר יותר. בחירת תכונות יושמה לאחר עיבוד מוקדם ולפני חלוקת רכבת-בדיקה, כדי להבטיח סט תכונות קבוע בכל המודלים.
הכשרת דגמים ובניית אנסמבל
מערך הנתונים חולק לתת-קבוצות אימון ובדיקות באמצעות יחס פיצול של 80:20 עם פונקציית train_test_split()). נתוני ההדרכה שימשו אך ורק לפיתוח מודלים ובניית אנסמבל, בעוד שנתוני הבדיקה נשמרו להערכת ביצועים. מסווגי בסיס, כולל Decision Tree, Random Forest, AdaBoost ו-XGBoost, אומנו על מערך הנתונים של האימון באמצעות הגדרות ברירת מחדל של היפרפרמטרים אלא אם צוין אחרת.
מודלים של הצבעה קשה ומערכת הצבעה רכה נבנו באמצעות VotingClassifier, כאשר משקלים שווים הוקצו לכל מסווגי הבסיס כדי להבטיח השוואה אובייקטיבית. מודל אנסמבל ערימה יושם באמצעות רגרסיה לוגיסטית כמטה-מסווג. המטה-מסווג אומן על תחזיות מחוץ לקפל שנוצרו באמצעות אימות צולב של 5 פעמים של מסווגי הבסיס, מה שהפחית התאמת יתר ואפשר הערכה בלתי מוטית של ביצועי האנסמבל.
המודל המוצע
מסגרת האנסמבל המוצעת יושמה לבניית מסווג מורכב המשתמש באסטרטגיות למידה קבוצתיות מרובות. כל נתוני ההדרכה היו סטנדרטיים, וצעדי קדם-עיבוד זהים יושמו על נתוני הבדיקה כדי להבטיח עקביות בין שלבי ההדרכה וההערכה. מסווגי הבסיס שולבו באמצעות הצבעה קשה, הצבעה רכה ומנגנוני הצטברות, ומסווג המטא-ערימה אומן באמצעות רגרסיה לוגיסטית על תחזיות מאומתות צולבות. הארכיטקטורה הכוללת וזרימת הנתונים של מסגרת האנסמבל (איור 5).

איור 5: ארכיטקטורה של המודל המוצע. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
רמה I:
ברמה I של מסגרת האנסמבל, ארבעה מסווגים בסיסיים — Random Forest, Decision Tree, XGBoost ו-AdaBoost — אומנו באמצעות מאגר הנתונים המורחב של האימונים. מסווגי הבסיס הללו שולבו לבניית מודלים של הצבעה קשה ומודלים של הצבעה רכה. משקלים שווים הוקצו לכל מסווגי הבסיס כדי לשמור על אובייקטיביות ולמנוע הטיה הנובעת מכיוונון משקל דיפרנציאלי במהלך בניית האנסמבל.
רמה II:
ברמה II, יושם מסווג אנסמבל ערימה על ידי שילוב תחזיות שנוצרו על ידי מסווגי הבסיס. מסווגי הבסיס אומנו באמצעות אימות צולב של 5 קיפולים, ונוצרו תחזיות מחוץ לקיפול לכל קיפול. תחזיות מחוץ לקפל אלו שימשו לאחר מכן כתכונות קלט לאימון מטא-מסווג רגרסיה לוגיסטית, ובכך להפחית התאמת יתר ואפשר הערכה בלתי מוטה של ביצועי האנסמבל.
Access restricted. Please log in or start a trial to view this content.
סעיף זה מציג את השפעות עיבוד הנתונים ובחירת התכונות, משווה את ביצועי מסווגי היחידים והקבוצתיים ומסכם תוצאות הבנצ'מרקינג על פני מדדי הערכה סטנדרטיים. עיבוד נתונים מוקדם, כולל הסרת ערכים חסרים, איזון מחלקות והרחבת תכונות, יצר התפלגויות קלט עקביות בכל המסווגים. מודלים שאומנו על נתונים מעובדים מראש הראו שונות מופחתת בביצועים במהלך ריצות אימות צולב של 5 פעמים וחלוקות רכבת-מבחן בהשוואה לקווי בסיס לא מעובדים. במיוחד, איזון מחלקות שיפר באופן עקבי את הזיכרון בין מחלקות המיעוט בכל המודלים שנבדקו.
דירוג ...
Access restricted. Please log in or start a trial to view this content.
מחקר זה מראה שלמידה קבוצתית מבוססת ערימה השיגה באופן עקבי ביצועי סיווג טובים ויציבים יותר בהשוואה למסווגים בודדים ולהרכבים מבוססי הצבעה בתנאי עיבוד מוקדם והשוואה סטנדרטיים.
העקביות בביצועי הרכב שנצפתה במחקר זה מחזקת את חשיבות הקפדנות המתודולוגית במחקר השוואתי בלמידת מכונה 19,20,21,22,23,24,25.<...
Access restricted. Please log in or start a trial to view this content.
המחברים מצהירים כי אין להם ניגודי עניינים הקשורים למחקר זה. אין מערכות יחסים פיננסיות, אישיות או מקצועיות שהשפיעו על התוצאות, הניתוחים או המסקנות שהוצגו בכתב היד הזה.
המחברים מכירים בשימוש במאגרי נתונים ציבוריים ובמשאבי תוכנה בקוד פתוח שתמכו במחקר זה. המחברים מודים גם למוסדותיהם, כולל אוניברסיטת סרי סרי בבובנסוואר ואוניברסיטת SOA בבובנסוואר, על סיפוק הסביבה האקדמית ומתקני המחקר הנדרשים לביצוע עבודה זו.
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| AdaBoostClassifier | מפתחי scikit-learn | לא זמין | מסווג בוסטינג אנסמבל המשמש לבניית ביצועים |
| מחברת יופיטר | פרויקט יופיטר | לא זמין | סביבת מחברת חישובית |
| קגל הארט סטטלוג (קליבלנד– הונגריה) מערך נתונים | קגל | לא זמין | מאגר נתונים קרדיווסקולריים ציבורי (1190 מקרים, 11 מאפיינים נוספים). כתובת: https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final |
| רגרסיה לוגיסטית | מפתחי scikit-learn | לא זמין | מטא-מסווג המשמש באנסמבל ערימה |
| Matplotlib | צוות הפיתוח של Matplotlib | לא זמין | ספריית ויזואליזציית נתונים |
| NumPy | מפתחי NumPy | לא זמין | ספריית חישוב נומרי |
| פנדות (גרסה 1.5.3) | צוות פיתוח הפנדות | לא זמין | עיבוד נתונים וטיפול |
| פייתון (גרסה 3.9) | קרן התוכנה של פייתון | לא זמין | סביבת התכנות המשמשת ליישום |
| RandomForestClassifier | מפתחי scikit-learn | לא זמין | מסווג בסיס וחישוב חשיבות תכונות |
| סיבורן | צוות הפיתוח של סיבורן | לא זמין | ויזואליזציה במפת חום של מטריצת קורלציה |
| StandardScaler | מפתחי scikit-learn | לא זמין | פונקציית קנה מידה של תכונות |
| VotingClassifier | מפתחי scikit-learn | לא זמין | הטמעת קבוצת הצבעה קשה ורכה |
| XGBoostClassifier | DMLC | לא זמין | מסווג הגברת גרדיאנט המשמש כלומד בסיסי |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission