Research Article

הערכה השוואתית של גישות למידת מכונה קבוצתית לחיזוי מחלות לב

DOI:

10.3791/70124

April 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פרוטוקול זה מתאר תהליך חישובי ליצירת והערכת מודלים משולבים של למידת מכונה לחיזוי מחלות לב, תוך שימוש בנתוני בנצ'מרק נגישים לציבור בתוך מבנה עיבוד מוקדם והערכה שניתן לשחזר.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מאמר זה מציג הערכת סימון חישובית של אלגוריתמים של למידה קבוצתית בחיזוי מחלות לב, תוך שילוב אלגוריתמים שונים של למידת מכונה, כגון הצבעה קשה, הצבעה רכה וערימה, במסגרת אחת. ההערכה בוצעה באמצעות מאגר נתונים קרדיווסקולריים זמין לציבור שנאספו ממאגר Kaggle (https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final), הכולל 1,190 מקרים ו-11 מאפיינים קליניים. התהליך כולל עיבוד נתונים מוקדם, הכולל טיפול בערכים חסרים, הסרת חריגים, שינוי משתנים בקנה מידה ואיזון מחלקות כדי להבטיח בחירת תכונות קלט אחידה, המבוססת על יער אקראי (RF), לביטול תכונות מיותרות. מבין המודלים שנבדקו, מסווג האנסמבל המצטבר השיג את הדיוק הכולל הגבוה ביותר של 91.88% במאגר הנתונים של הבדיקה. למרות שמדדים נוספים כמו דיוק, זיכרון וציון F1 חושבו לניתוח השוואתי, הדגש במחקר זה נשאר על הבנצ'מרקינג מתודולוגי ולא על אימות קליני.

מסווגי בסיס שונים, כולל Decision Tree, Random Forest, AdaBoost ו-XGBoost, מיושמים ונבדקים באופן עצמאי. מודלים אלו משולבים באמצעות טכניקות קבוצתיות עם הצבעה קשה, הצבעה רכה וערימה. בערימה, רגרסיה לוגיסטית משמשת כמטא-מודל, שמאומן על תחזיות מאומתות צולב של דגימות מחוץ לקפל כדי למנוע התאמת יתר.

ההערכות מתבצעות תוך שימוש בדיוק כקריטריון העיקרי להשוואה, כך שניתן להשוות באופן אחיד בין מערכות סיווג בודדות ואסטרטגיות השילוב שלהן באותה סביבת עיבוד מוקדם ואימות. למרות שניתנים מדדי ביצועים להשוואת, הדגש בגישה הוא על פיתוח והערכת אסטרטגיות ולא בהערכה הקלינית שלהן.

פרוטוקול זה מקל על השוואת אלגוריתמים של למידת מכונה קבוצתית על מאגרי נתונים קרדיווסקולריים זמינים לציבור ועוזר לבצע השוואה שיטתית בין גישות עיבוד נתונים מוקדם וקונפיגורציית אנסמבל.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מערכי נתונים ציבוריים של מחלות לב וכלי דם משמשים באופן נרחב כבעיות ייחוס במחקר למידת מכונה להערכת אלגוריתמים של סיווג וטכניקות מידול חיזוי 1,2,3. מערכי נתונים כאלה, המכילים מאפיינים קליניים ודמוגרפיים, מספקים בסיס סטנדרטי וניתן לשחזור להשוואת אסטרטגיות קדם-עיבוד, שיטות בחירת תכונות וארכיטקטורות למידה קבוצתית בתנאים ניסיוניים מבוקרים. כתוצאה מכך, הם משמשים לעיתים קרובות להערכת התנהגות אלגוריתמית ולא לתמוך בהסקה קלינית או בפריסה בעולם האמיתי 4,5.

מחקרים קודמים בחנו שיטות שונות של למידת מכונה לחיזוי מחלות לב-וכלי דם, כגון רגרסיה לוגיסטית (LR), מכונות וקטור תמיכה (SVM), יערות אקראיים (RF) ומודלים של הגברת גרדיאנטים 6,7,8,9. לאחרונה, מחקרים התמקדו בטכניקות למידה קבוצתית, כגון הצבעה קשה, הצבעה רכה וערימה, כדי להפוך את המודלים ליציבים יותר ולשפר את ביצועיהם 10,11,12,13,14. עם זאת, ההבדלים באופן שבו הנתונים מוכנים, מטפלים במאפיינים, מתבצע האימות והתוצאות שנמדדות במחקרים הללו מקשים על השוואת התוצאות המדווחות ישירות. כדי לספק סקירה הקשרתית רחבה של קטגוריות מחלות לב וכלי דם המדווחות לעיתים קרובות בספרות, מוצג איור מושגי באיור 1.

איור 1
איור 1: המחשה מושגית של קטגוריות מחלות לב וכלי דם המדווחות נפוצות, כלולה רק לרקע הקשרי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

איור 1 כלול אך ורק לצורך התייחסות הקשרתית ברמה גבוהה ואינו מייצג נתונים שמקורם במאגר הנתונים שנבחן במחקר זה או מפלטים מהפרוטוקול החישובי המוצע.

במיוחד, עבודות רבות קיימות מדגישות תוצאות ביצועים מבלי לבודד בבירור את תרומתן של רכיבים מתודולוגיים בודדים, כגון תזמון בחירת תכונות, איזון מחלקות או תצורת אנסמבל 15,16,17,18. שונות זו מדגישה את הצורך במסגרת בנצ'מרקינג שניתנת לשחזור שמעריכה באופן שיטתי שיטות למידת מכונה קבוצתית באמצעות צינור עיבוד מקדים עקבי ופרוטוקול הערכה על מאגר נתונים זמין לציבור.

השערה היא שגישות למידה קבוצתיות, במיוחד שיטות ערימה, ידגימו דיוק סיווג משופר וביצועים מאוזנים לפי מחלקות בהשוואה למסווגי בסיס בודדים כאשר יוערכו בתנאי עיבוד מוקדם ואימות סטנדרטיים.

בהתאם לכך, מטרת מחקר זה היא לבצע ניתוח השוואה חישובית של גישות למידת מכונה קבוצתית לחיזוי מחלות לב וכלי דם באמצעות מאגר נתונים זמין לציבור של Kaggle. התהליך כולל עיבוד נתונים סטנדרטי, שימוש באלגוריתם Random Forest לדירוג חשיבות התכונות, וכן שימוש בטכניקות שונות של אנסמבל, הכוללות הצבעה קשה, הצבעה רכה וערימה. רגרסיה לוגיסטית משמשת כאלגוריתם מטא-מסווג בערימה. זה מבטיח שלא תהיה התאמה יתר, שכן הוא משתמש בתחזיות מאומתות צולבות.

מחקר זה מיועד אך ורק כחקירת השוואת נתונים ציבורית. ממצאיו מוגבלים על ידי הסתמכות על מערך נתונים יחיד והטיות ספציפיות אפשריות, ולכן אינם מרמזים על אימות קליני או פריסת. אימות חיצוני באמצעות מערכי נתונים עצמאיים והערכה פרוספקטיבית יידרש לפני שניתן יהיה לשקול יישום קליני.

השאלות המחקריות הבאות מנחות את המחקר הזה:

מחקר זה בוחן כיצד גישות שונות של למידת מכונה קבוצתית, כולל הצבעה קשה, הצבעה רכה וערימה, משוות בדיוק הסיווג כאשר הן מיושמות על מאגר נתונים ציבורי של מחלות לב וכלי דם.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פרוטוקול זה תיאר תהליך חישובי שניתן לשחזור להשוואת מודלים של למידת מכונה קבוצתית באמצעות מאגר נתונים ציבורי של מחלות לב וכלי דם.

בחירת מאגר הנתונים
המחקר השתמש במאגר נתונים של מחלות לב וכלי דם זמין לציבור, שהושג ממאגר Kaggle. מערך הנתונים כלל 1190 מופעים וכלל 11 תכונות. לאימון מודלים, 80% מהנתונים נוצלו, בעוד ש-20% הנותרים הוקצו להערכת ביצועים. טבלה 1 הציגה תיאור מפורט של תכונות מערך הנתונים. מערך הנתונים נטען לפייתון (גרסה 3.9) באמצעות ספריית ה-pandas (גרסה 1.5.3). שלמות מערכי הנתונים נבדקה על ידי בדיקת ערכים חסרים, רשומות כפולות וסוגי נתונים לא עקביים.

טבלה 1 מסכמת את המאפיינים הדמוגרפיים, הקליניים והניסיוניים הכלולים במאגר מחלות לב וכלי דם, יחד עם סוגי הנתונים והפורמטים המקודדים. תכונות אלו היוו את משתני הקלט לכל הליכי ההערכה וההערכה של מודלים לאחר מכן.

סל. לאשם תכונהסוג נתוניםתיאור
1גילנומריגיל המטופל בשנים.
2מיןנומינליזכר מיוצג כ-1, ונקבה כ-0.
3סוג כאב בחזהקטגורי1: טיפוסי 2: אנגינה טיפוסית 3: כאב לא אנגינלי 4: ללא תסמינים
4לחץ דם במנוחהמספרילחץ הדם במנוחה נמדד במילימטרים של כספית (mmHg).
5רמת הכולסטרולנומריכולסטרול בסרום במיליגרם לדציליטר (mg/dL).
6סוכר בצוםנומינלירמות סוכר בדם מעל 120 מ"ג/ד"ל בצום מיוצגות כ-1 עבור נכון ו-0 עבור שקרי.
7אקג במנוחהקטגורישלושה ערכים מובחנים מוקצים כדלקמן: 0 עבור נורמלי, 1 עבור חריגות בגל ST-T, ו-2 עבור היפרטרופיה של החדר השמאלי.
8קצב לב מקסימלינומריקצב לב שיא שהושג
9אנגינה תרגיליתנומינליאנגינה הנגרמת על ידי פעילות גופנית, כאשר 0 מייצג NO ו-1 מייצג כן.
10אולדפיקנומרידיכאון ST בזמן פעילות גופנית בהשוואה למצב המנוחה.
11שיפוע STקטגורישיפוע מקטעי ST במהלך שיא פעילות גופנית מסווג כך: 0: נורמלי 1: עלייה 2: שטוח 3: ירידה בשיפוע

טבלה 1: תיאור מאפייני מאגר הנתונים המשמשים לחיזוי מחלות לב.

עיבוד מוקדם של הנתונים
עיבוד נתונים מוקדם בוצע באמצעות ספריות פייתון. שורות שהכילו ערכים חסרים הוסרו באמצעות פנדה. פונקציית DataFrame.dropna(). יוצאי דופן בתכונות מספריות זוהו והוסרו באמצעות שיטת טווח בין-רבעוני (IQR) והדמיה מבוססת תרשימת קופסה, הממחישה את ההתפלגות והזוהות בין תכונות (איור 2). כל המשתנים המספריים הוגדלו באמצעות פונקציית StandardScaler מספריית scikit-learn (גרסה 1.2.2). אי-איזון מחלקתי טופל באמצעות דגימה תת-אקראית כדי לקבל התפלגות מחלקות מאוזנת לפני הכשרת המודלים.

איור 2
איור 2: תרשים קופסה של כל התכונות במאגר הנתונים למחלות לב וכלי דם. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

מקדם המתאם של פירסון (PCC) שימש להערכת הקשרים בין התכונות. מטריצת המתאם שנוצרת, המוצגת כמפת חום, ממחישה את עוצמת וכיוון הקורלציות הזוגיות של תכונות ומדגישה תכונות מיותרות לאלימינציה (איור 3).

איור 3
איור 3: מטריצת קורלציה עבור מאגר הנתונים של מחלות לב. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

המודל יוצר מפת חום של מטריצת המתאמים, שהיא אסתטית ומאפשרת הבנה מהירה יותר של קורלציות בין תכונות שונות בנתונים. מפת חום זו משתמשת בצבעים כדי להראות כמה ובאיזה כיוון ערכים קשורים, מה שהופך אותה לכלי חשוב בניתוח נתונים חקר. צבעים בהירים מראים מתאמים חיוביים גבוהים יותר, צבעים כהים מראים מתאמים שליליים גבוהים יותר, ויותר ירוקים מראים מתאמים קרובים לאפס.

חילוץ תכונות
בחירת התכונות בוצעה באמצעות חשיבות תכונה ביער אקראי שמיושמה דרך RandomForestClassifier בספריות למידת מכונה בקוד פתוח. ציוני חשיבות המאפיינים חושבו בהתבסס על הירידה הממוצעת בזיהום, ותכונות דורגו בהתאם. המאפיינים בדירוג N נשמרו לניתוח מאוחר יותר. בחירת תכונות יושמה לאחר סיום כל שלבי הקדם-עיבוד ולפני חלוקת רכבת-בדיקה, כדי להבטיח שימוש במערך תכונות קבוע ועקבי בכל מודלי הסיווג וקונפיגורציות האנסמבל (איור 4).

איור 4
איור 4: ציוני חשיבות תכונה שחושבים באמצעות חשיבות תכונות יער אקראי. תכונות מדורגות לפי ערך חשיבות מנורמל. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

המאפיינים דורגו בהתבסס על הירידה הממוצעת בזיהום באמצעות חשיבות תכונות יער אקראי עם random_state = 42; עם זאת, כל התכונות הזמינות (N = 11) נשמרו לאימון דגם מאוחר יותר. בחירת תכונות יושמה לאחר עיבוד מוקדם ולפני חלוקת רכבת-בדיקה, כדי להבטיח סט תכונות קבוע בכל המודלים.

הכשרת דגמים ובניית אנסמבל
מערך הנתונים חולק לתת-קבוצות אימון ובדיקות באמצעות יחס פיצול של 80:20 עם פונקציית train_test_split()). נתוני ההדרכה שימשו אך ורק לפיתוח מודלים ובניית אנסמבל, בעוד שנתוני הבדיקה נשמרו להערכת ביצועים. מסווגי בסיס, כולל Decision Tree, Random Forest, AdaBoost ו-XGBoost, אומנו על מערך הנתונים של האימון באמצעות הגדרות ברירת מחדל של היפרפרמטרים אלא אם צוין אחרת.

מודלים של הצבעה קשה ומערכת הצבעה רכה נבנו באמצעות VotingClassifier, כאשר משקלים שווים הוקצו לכל מסווגי הבסיס כדי להבטיח השוואה אובייקטיבית. מודל אנסמבל ערימה יושם באמצעות רגרסיה לוגיסטית כמטה-מסווג. המטה-מסווג אומן על תחזיות מחוץ לקפל שנוצרו באמצעות אימות צולב של 5 פעמים של מסווגי הבסיס, מה שהפחית התאמת יתר ואפשר הערכה בלתי מוטית של ביצועי האנסמבל.

המודל המוצע
מסגרת האנסמבל המוצעת יושמה לבניית מסווג מורכב המשתמש באסטרטגיות למידה קבוצתיות מרובות. כל נתוני ההדרכה היו סטנדרטיים, וצעדי קדם-עיבוד זהים יושמו על נתוני הבדיקה כדי להבטיח עקביות בין שלבי ההדרכה וההערכה. מסווגי הבסיס שולבו באמצעות הצבעה קשה, הצבעה רכה ומנגנוני הצטברות, ומסווג המטא-ערימה אומן באמצעות רגרסיה לוגיסטית על תחזיות מאומתות צולבות. הארכיטקטורה הכוללת וזרימת הנתונים של מסגרת האנסמבל (איור 5).

איור 5
איור 5: ארכיטקטורה של המודל המוצע. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

רמה I:
ברמה I של מסגרת האנסמבל, ארבעה מסווגים בסיסיים — Random Forest, Decision Tree, XGBoost ו-AdaBoost — אומנו באמצעות מאגר הנתונים המורחב של האימונים. מסווגי הבסיס הללו שולבו לבניית מודלים של הצבעה קשה ומודלים של הצבעה רכה. משקלים שווים הוקצו לכל מסווגי הבסיס כדי לשמור על אובייקטיביות ולמנוע הטיה הנובעת מכיוונון משקל דיפרנציאלי במהלך בניית האנסמבל.

רמה II:
ברמה II, יושם מסווג אנסמבל ערימה על ידי שילוב תחזיות שנוצרו על ידי מסווגי הבסיס. מסווגי הבסיס אומנו באמצעות אימות צולב של 5 קיפולים, ונוצרו תחזיות מחוץ לקיפול לכל קיפול. תחזיות מחוץ לקפל אלו שימשו לאחר מכן כתכונות קלט לאימון מטא-מסווג רגרסיה לוגיסטית, ובכך להפחית התאמת יתר ואפשר הערכה בלתי מוטה של ביצועי האנסמבל.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

סעיף זה מציג את השפעות עיבוד הנתונים ובחירת התכונות, משווה את ביצועי מסווגי היחידים והקבוצתיים ומסכם תוצאות הבנצ'מרקינג על פני מדדי הערכה סטנדרטיים. עיבוד נתונים מוקדם, כולל הסרת ערכים חסרים, איזון מחלקות והרחבת תכונות, יצר התפלגויות קלט עקביות בכל המסווגים. מודלים שאומנו על נתונים מעובדים מראש הראו שונות מופחתת בביצועים במהלך ריצות אימות צולב של 5 פעמים וחלוקות רכבת-מבחן בהשוואה לקווי בסיס לא מעובדים. במיוחד, איזון מחלקות שיפר באופן עקבי את הזיכרון בין מחלקות המיעוט בכל המודלים שנבדקו.

דירוג ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה מראה שלמידה קבוצתית מבוססת ערימה השיגה באופן עקבי ביצועי סיווג טובים ויציבים יותר בהשוואה למסווגים בודדים ולהרכבים מבוססי הצבעה בתנאי עיבוד מוקדם והשוואה סטנדרטיים.

העקביות בביצועי הרכב שנצפתה במחקר זה מחזקת את חשיבות הקפדנות המתודולוגית במחקר השוואתי בלמידת מכונה 19,20,21,22,23,24,25.<...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מצהירים כי אין להם ניגודי עניינים הקשורים למחקר זה. אין מערכות יחסים פיננסיות, אישיות או מקצועיות שהשפיעו על התוצאות, הניתוחים או המסקנות שהוצגו בכתב היד הזה.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מכירים בשימוש במאגרי נתונים ציבוריים ובמשאבי תוכנה בקוד פתוח שתמכו במחקר זה. המחברים מודים גם למוסדותיהם, כולל אוניברסיטת סרי סרי בבובנסוואר ואוניברסיטת SOA בבובנסוואר, על סיפוק הסביבה האקדמית ומתקני המחקר הנדרשים לביצוע עבודה זו.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
AdaBoostClassifierמפתחי scikit-learnלא זמיןמסווג בוסטינג אנסמבל המשמש לבניית ביצועים
מחברת יופיטרפרויקט יופיטרלא זמיןסביבת מחברת חישובית
קגל הארט סטטלוג (קליבלנד– הונגריה) מערך נתוניםקגללא זמיןמאגר נתונים קרדיווסקולריים ציבורי (1190 מקרים, 11 מאפיינים נוספים). כתובת: https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final
רגרסיה לוגיסטיתמפתחי scikit-learnלא זמיןמטא-מסווג המשמש באנסמבל ערימה
Matplotlibצוות הפיתוח של Matplotlibלא זמיןספריית ויזואליזציית נתונים
NumPyמפתחי NumPyלא זמיןספריית חישוב נומרי
פנדות (גרסה 1.5.3)צוות פיתוח הפנדותלא זמיןעיבוד נתונים וטיפול
פייתון (גרסה 3.9)קרן התוכנה של פייתוןלא זמיןסביבת התכנות המשמשת ליישום
RandomForestClassifierמפתחי scikit-learnלא זמיןמסווג בסיס וחישוב חשיבות תכונות
סיבורןצוות הפיתוח של סיבורןלא זמיןויזואליזציה במפת חום של מטריצת קורלציה
StandardScalerמפתחי scikit-learnלא זמיןפונקציית קנה מידה של תכונות
VotingClassifierמפתחי scikit-learnלא זמיןהטמעת קבוצת הצבעה קשה ורכה
XGBoostClassifierDMLCלא זמיןמסווג הגברת גרדיאנט המשמש כלומד בסיסי

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Libby, P., Bonow, R. O., et al. Braunwald’s Heart Disease: A Textbook of Cardiovascular Medicine. Elsevier Health Sci. 9, (2011).
  2. Nayak, O., Pallapothala, T., Gupta, G. P. Heart disease prediction framework using soft voting-based ensemble learning techniques. Convergence of Big Data Technologies and Computational Intelligent Techniques. IGI Global. , IGI Global. 147-165 (2023).
  3. Gaidai, O., Yan, P., Xing, Y. Future world cancer death rate prediction. Sci Rep. 13 (1), 303(2023).
  4. Imran, M., et al. A hybrid ensemble framework for cardiac disease risk stratification with machine learning. J Popul Ther Clin Pharmacol. 30 (18), 1336-1353 (2023).
  5. Elhneiti, M., Al-Hussami, M. Predicting risk factors of heart disease among Jordanian patients. Health. 9 (2), 237-247 (2017).
  6. Sevakula, R. K., Verma, N. K. Assessing generalization ability of majority vote point classifiers. IEEE Trans Neural Netw Learn Syst. 28 (12), 2985-2997 (2017).
  7. Li, H., et al. Ensemble learning for overall power conversion efficiency of all-organic dye-sensitized solar cells. IEEE Access. 6, 34118-34126 (2018).
  8. Chicco, D., Jurman, G. Machine learning can predict survival of patients with heart failure from serum creatinine and ejection fraction alone. BMC Med Inform Decis Mak. 20 (1), 16(2020).
  9. Predicting the survival of heart failure patients in unbalanced data sets. Türkmenoğlu, B. K., Yildiz, O. In Proc. 29th Signal Process Commun Appl Conf (SIU), , IEEE. 1-4 (2021).
  10. Wang, B., et al. A multi-task neural network architecture for renal dysfunction prediction in heart failure patients with electronic health records. IEEE Access. 7, 178392-178400 (2019).
  11. Amin, M. S., Chiam, Y. K., Varathan, K. D. Identification of significant features and data mining techniques in predicting heart disease. Telemat Inform. 36, 82-93 (2019).
  12. Gao, X. Y., et al. Improving the accuracy for analyzing heart diseases prediction based on the ensemble method. Complexity. 2021, 1-10 (2021).
  13. Hasan, N., Bao, Y. Comparing different feature selection algorithms for cardiovascular disease prediction. Health Technol. 11, 49-62 (2021).
  14. Pan, C., et al. Impact of categorical and numerical features in ensemble machine learning frameworks for heart disease prediction. Biomed Signal Process Control. 76, 103666(2022).
  15. Renugadevi, G., et al. Predicting heart disease using hybrid machine learning model. J Phys Conf. 1916 (1), 012208(2021).
  16. Rani, P., et al. A decision support system for heart disease prediction based upon machine learning. J Reliab Intell Environ. 7 (3), 263-275 (2021).
  17. Fayez, M., Kurnaz, S. Novel method for diagnosis diseases using advanced high-performance machine learning system. Appl Nanosci. 11, 1-7 (2021).
  18. Mohri, M., Rostamizadeh, A., Talwalkar, A. Introduction. Foundations of Machine Learning. , 2nd ed, MIT Press. 1-7 (2018).
  19. Kelleher, J. D., Mac Namee, B., D’Arcy, A. Fundamentals of Machine Learning for Predictive Data Analytics. , MIT Press. (2020).
  20. Wittek, P. Quantum Machine Learning: What Quantum Computing Means to Data Mining. , Academic Press. (2014).
  21. Sridhar, C., et al. Optimal medical image size reduction model creation using recurrent neural network and GenPSOWVQ. J Healthc Eng. 2022, 1-12 (2022).
  22. Dalal, S., et al. A hybrid machine learning model for timely prediction of breast cancer. Int J Model Simul Sci Comput. 14 (4), 2341023(2023).
  23. Edeh, M. O., et al. Artificial intelligence-based ensemble learning model for prediction of hepatitis C disease. Front Public Health. 10, 892371(2022).
  24. Latha, C. B. C., Jeeva, S. C. Improving the accuracy of prediction of heart disease risk based on ensemble classification techniques. Inform Med Unlocked. 16, 100203(2019).
  25. Bhatt, C. M., et al. Effective heart disease prediction using machine learning techniques. Algorithms. 16 (2), 88(2023).
  26. Khan, A., et al. A novel study on machine learning algorithm-based cardiovascular disease prediction. Health Soc Care Community. 2023, 1-12 (2023).
  27. García-Ordás, M. T., et al. Heart disease risk prediction using deep learning techniques with feature augmentation. Multimed Tools Appl. 82, 1-15 (2023).
  28. Tiwari, A., Chugh, A., Sharma, A. Ensemble framework for cardiovascular disease prediction. Comput Biol Med. 146, 105624(2022).
  29. Chowdary, K. R., et al. Early heart disease prediction using ensemble learning techniques. J Phys Conf Ser. 2325 (1), 012051(2022).
  30. Alqahtani, A., et al. Cardiovascular disease detection using ensemble learning. Comput Intell Neurosci. 2022, 1-10 (2022).
  31. Naser, M. A., et al. A review of machine learning’s role in cardiovascular disease prediction: recent advances and future challenges. Algorithms. 17 (2), 78(2024).
  32. Vara, N. V. D. S. S., et al. AI-assisted medical imaging and heart disease diagnosis using ensemble classifiers. J Artif Intell Gen Sci. 6 (1), 210-229 (2024).
  33. Gnanavelu, A., et al. Cardiovascular disease prediction using machine learning metrics. J Young Pharm. 17 (1), 226-233 (2025).
  34. Pal, P., et al. Interactive cardiovascular disease prediction system using learning techniques. Results Control Optim. 19, 100560(2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Ensemble LearningHeart Disease PredictionMachine Learning AlgorithmsStacking ClassifierHard VotingSoft VotingRandom ForestData PreprocessingFeature SelectionCardiovascular Dataset

Related Articles