Research Article

التقييم المقارن لأساليب التعلم الآلي الجماعية للتنبؤ بأمراض القلب

DOI:

10.3791/70124

April 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يحدد هذا البروتوكول عملية حسابية لإنشاء وتقييم نماذج تعلم آلي متكاملة للتنبؤ بأمراض القلب باستخدام بيانات مرجعية متاحة للجمهور ضمن هيكل معالجة وتقييم قابلة للتكرار.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقدم هذه الورقة تقييما حسابيا على الطاولة لخوارزميات التعلم الجماعي في التنبؤ بأمراض القلب، حيث يجمع بين خوارزميات تعلم الآلة المختلفة مثل التصويت القاسي، والتصويت الناعم، والتكديس، في إطار واحد. تم إجراء التقييم باستخدام مجموعة بيانات القلب والأوعية الدموية المتاحة للجمهور تم الحصول عليها من مستودع كاجل (https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final) والتي تضم 1,190 حالة و11 ميزة سريرية. تتضمن العملية معالجة البيانات مسبقا، والتي تشمل التعامل مع القيم المفقودة، إزالة القيم الشاذة، تحجيم المتغيرات وتوازن الفئات لضمان استخدام اختيار موحد لميزات الإدخال، بناء على الغابة العشوائية (RF)، لإزالة الميزات غير الضرورية. من بين النماذج التي تم تقييمها، حقق مصنف مجموعة التكديس أعلى دقة إجمالية بلغت 91.88٪ في مجموعة بيانات الاختبار. على الرغم من حساب مقاييس إضافية مثل الدقة، والاسترجاع، ودرجة F1 للتحليل المقارن، إلا أن تركيز هذه الدراسة لا يزال على المقارنة المنهجية بدلا من التحقق السريري.

يتم تطبيق واختبار مصنفات أساسية مختلفة، بما في ذلك شجرة القرار، الغابة العشوائية، AdaBoost، وXGBoost، بشكل مستقل. ثم تدمج هذه النماذج باستخدام تقنيات الجماعة مع التصويت القوي، والتصويت الناعم، والتكديس. في التكديس، يستخدم الانحدار اللوجستي كنموذج فوقي، والذي يتم تدريبه على التنبؤات المتبادلة للعينات خارج الطي لتجنب الإفراط في التوافق.

تجرى التقييمات باستخدام الدقة كمعيار أساسي للمقارنة، بحيث يمكن مقارنة أنظمة التصنيف الفردية واستراتيجيات التركيب بينها بشكل موحد في نفس بيئة المعالجة المسبقة والتحقق من الصحة. على الرغم من تقديم مقاييس أداء للمؤشرات المقارنة، إلا أن تركيز النهج يكمن في تطوير وتقييم الاستراتيجيات وليس في تقييمها السريري.

يسهل هذا البروتوكول مقارنة خوارزميات التعلم الآلي الجماعية على مجموعات بيانات القلب والأوعية الدموية المتاحة للجمهور، ويساعد في إجراء مقارنة منهجية بين أساليب المعالجة المسبقة للبيانات وتكوين المجموعات.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تستخدم مجموعات بيانات أمراض القلب والأوعية الدموية المتاحة للجمهور على نطاق واسع كمعايير في أبحاث تعلم الآلة لتقييم خوارزميات التصنيف وتقنيات النمذجة التنبؤية 1,2,3. توفر هذه المجموعات من البيانات، التي تحتوي على سمات سريرية وديموغرافية، أساسا موحدا وقابلا للتكرار لمقارنة استراتيجيات المعالجة المسبقة، وطرق اختيار الميزات، وهياكل التعلم الجماعي تحت ظروف تجريبية مضبوطة. وبالتالي، تستخدم عادة لتقييم السلوك الخوارزمي بدلا من دعم الاستنتاج السريري أو النشر الواقعي 4,5.

بحثت أبحاث سابقة في طرق تعلم الآلة المختلفة للتنبؤ بأمراض القلب والأوعية الدموية، مثل الانحدار اللوجستي (LR)، وآلات الدعم المتجهة (SVM)، والغابات العشوائية (RF) ونماذج تعزيز التدرج6،7،8،9. في الآونة الأخيرة، ركزت الدراسات على تقنيات التعلم الجماعي، مثل التصويت الصعب، والتصويت الناعم، والتكديس، لجعل النماذج أكثر استقرارا وتحسين أدائها10، 11، 12، 13، 14. ومع ذلك، فإن الفروق في كيفية إعداد البيانات، وكيفية التعامل مع الميزات، وإجراء التحقق، وقياس النتائج عبر هذه الدراسات تجعل من الصعب مقارنة النتائج المبلغ عنها مباشرة. لتقديم نظرة عامة سياقية شاملة لفئات أمراض القلب والأوعية الدموية التي يتم الإبلاغ عنها عادة في الأدبيات، يتم عرض توضيحي مفاهيمي في الشكل 1.

الشكل 1
الشكل 1: توضيح مفاهيمي لفئات أمراض القلب والأوعية الدموية الشائعة المبلغ عنها، مدرج فقط للخلفية السياقية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 1 مدرج فقط للرجوع السياقي عالي المستوى ولا يمثل البيانات المستمدة من مجموعة البيانات التي تم تحليلها في هذه الدراسة أو من أي مخرجات من البروتوكول الحاسوبي المقترح.

على وجه الخصوص، تركز العديد من الأعمال القائمة على نتائج الأداء دون عزل واضح لمساهمة المكونات المنهجية الفردية، مثل توقيت اختيار الميزات، موازنة الفئات، أو تكوين الفرقة15، 16، 17، 18. يبرز هذا التفاوت الحاجة إلى إطار عمل معياري قابل لإعادة الإنتاج يقيم بشكل منهجي طرق التعلم الآلي المجمعة باستخدام خط معالجة مسبقة متسق وبروتوكول تقييم على مجموعة بيانات متاحة للجمهور.

يفترض أن أساليب التعلم الجماعي، وخاصة طرق التكديس، ستظهر دقة تصنيف محسنة وأداء متوازنا حسب الفئة مقارنة بالمصنفات الأساسية الفردية عند تقييمها تحت ظروف المعالجة المبدئية والتحقق الموحدة.

وبناء عليه، فإن هدف هذه الدراسة هو إجراء تحليل معياري حسابي لأساليب التعلم الآلي الجماعية للتنبؤ بأمراض القلب والأوعية الدموية باستخدام مجموعة بيانات كاجل متاحة للجمهور. تتضمن العملية معالجة بيانات موحدة مسبقة، واستخدام خوارزمية الغابة العشوائية لترتيب أهمية الميزات، بالإضافة إلى استخدام تقنيات تجميعية مختلفة تشمل التصويت الجاد، والتصويت الناعم، والتكديس. يستخدم الانحدار اللوجستي كخوارزمية التصنيف الفوقي في التكديس. هذا يضمن عدم وجود فائض في التوافق، حيث يستخدم التنبؤات المتبادلة.

تهدف هذه الدراسة فقط إلى تحقيق مقارنة بيانات عامة. نتائجها محدودة بالاعتماد على مجموعة بيانات واحدة وتحيزات محتملة خاصة بمجموعة البيانات، وبالتالي لا تعني التحقق السريري أو النشر. سيكون من الضروري التحقق الخارجي باستخدام مجموعات بيانات مستقلة وتقييم مستقبلي قبل النظر في أي تطبيق سريري.

توجه هذه الدراسة أسئلة بحثية تالية:

تفحص هذه الدراسة كيف تقارن طرق التعلم الآلي الجماعية المختلفة، بما في ذلك التصويت القاسي، والتصويت الناعم، والتكديس، من حيث دقة التصنيف عند تطبيقها على مجموعة بيانات أمراض القلب والأوعية الدموية المتاحة للجمهور.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

وصف هذا البروتوكول سير عمل حسابي قابل للتكرار لمقارنة نماذج التعلم الآلي الجماعية باستخدام مجموعة بيانات أمراض القلب والأوعية الدموية المتاحة للجمهور.

اختيار مجموعة البيانات
استخدمت الدراسة مجموعة بيانات أمراض القلب والأوعية الدموية المتاحة للجمهور تم الحصول عليها من مستودع كاغل. تكونت مجموعة البيانات من 1190 نسخة واحتوت على 11 ميزة. في تدريب النماذج، تم استخدام 80٪ من البيانات، بينما تم تخصيص 20٪ المتبقية لتقييم الأداء. قدم الجدول 1 وصفا مفصلا لميزات مجموعة البيانات. تم تحميل مجموعة البيانات إلى بايثون (الإصدار 3.9) باستخدام مكتبة بانداس (الإصدار 1.5.3). تم التحقق من سلامة مجموعة البيانات من خلال فحص القيم المفقودة، والسجلات المكررة، وأنواع البيانات غير المتسقة.

يلخص الجدول 1 السمات الديموغرافية والسريرية والتجريبية المدرجة في مجموعة بيانات أمراض القلب والأوعية الدموية، إلى جانب أنواع بياناتها وصيغها المشفرة. شكلت هذه الميزات المتغيرات المدخلة لجميع إجراءات تدريب وتقييم النماذج اللاحقة.

لااسم الفيلمنوع البياناتالوصف
1العمررقميعمر المريض بالسنوات.
2الجنساسمييمثل الذكر ك 1، والأنثى يمثل ك0.
3نوع ألم الصدرتصنيفي1: نموذجي 2: الذبحة الصدرية النموذجية 3: ألم غير ذبائي 4: بدون أعراض
4BP S في الراحةرقميضغط الدم أثناء الراحة يقاس بالمليمترات من الزئبق (mmHg).
5مستوى الكوليسترولرقميالكوليسترول في المصل بملليغرام لكل ديسيلتر (ملغ/ديسيلتر).
6سكر الدم الصائماسميمستويات السكر في الدم التي تزيد عن 120 ملغ/ديسيلتر أثناء الصيام تمثل ب 1 للصحيح و0 للكاذب.
7تخطيط القلب أثناء الراحةتصنيفيتم تخصيص ثلاث قيم مميزة كما يلي: 0 للطبيعي، 1 للشذوذ في موجة ST-T، و2 لتضخم البطين الأيسر.
8أقصى معدل ضربات قلبرقميالوصول إلى ذروة معدل ضربات القلب
9تمرين الذبحة الصدريةاسميالذبحة الصدرية الناتجة عن التمارين، حيث 0 تمثل NO و1 تمثل نعم.
10أولدبيكرقميالاكتئاب أثناء التمرين مقارنة بحالة الراحة.
11منحدر STتصنيفييصنف ميل مقطع ST أثناء ذروة التمارين كما يلي: 0: طبيعي 1: صعود 2: مستو 3: انخفاض

الجدول 1: وصف ميزات مجموعة البيانات المستخدمة للتنبؤ بأمراض القلب.

المعالجة المسبقة للبيانات
تم إجراء معالجة البيانات المسبقة باستخدام مكتبات بايثون. تمت إزالة الصفوف التي تحتوي على قيم مفقودة باستخدام pandas. دالة DataFrame.dropna(). تم تحديد وإزالة المؤشرات الشاذة في السمات الرقمية باستخدام طريقة النطاق الربعي (IQR) والتصور المعتمد على مخطط الصندوق، الذي يوضح التوزيع والمؤشرات الشاذة المكتشفة عبر الميزات (الشكل 2). تم تكبير جميع المتغيرات الرقمية باستخدام دالة StandardScaler من مكتبة scikit-learn (الإصدار 1.2.2). تم معالجة اختلال التوازن الطبقي من خلال تقليل العينات العشوائية للحصول على توزيع متوازن للفئات قبل تدريب النماذج.

الشكل 2
الشكل 2: مخطط الصندوق لجميع السمات في مجموعة بيانات أمراض القلب والأوعية الدموية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

تم استخدام معامل الارتباط (PCC) لبيرسون لتقييم العلاقات بين الخصائص. توضح مصفوفة الارتباط الناتجة، التي تصور كخريطة حرارية، قوة واتجاه ارتباطات الميزات الزوجية وتبرز السمات الزائدة للإزالة (الشكل 3).

الشكل 3
الشكل 3: مصفوفة الارتباط لمجموعة بيانات أمراض القلب. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

ينتج عن النموذج خريطة حرارية لمصفوفة الارتباط تبدو جميلة من الناحية الجمالية وتتيح فهما أسرع للارتباطات بين الميزات المختلفة في البيانات. تستخدم هذه الخريطة الحرارية الألوان لإظهار مدى واتجاه القيم مرتبطة، مما يجعلها أداة مهمة في تحليل البيانات الاستكشافي. الألوان الفاتحة تظهر ارتباطات إيجابية أعلى، والألوان الداكنة تظهر ارتباطات سلبية أعلى، والألوان الخضراء تظهر ارتباطات قريبة من الصفر.

استخراج الميزات
تم اختيار الميزات باستخدام أهمية ميزات الغابة العشوائية التي تم تنفيذها عبر RandomForestClassifier في مكتبات التعلم الآلي مفتوحة المصدر. تم حساب درجات أهمية الميزات بناء على متوسط انخفاض الشوائب، وتم تصنيف الميزات وفقا لذلك. تم الاحتفاظ بالميزات المصنفة N العليا للتحليل لاحقا. تم تطبيق اختيار الميزات بعد الانتهاء من جميع خطوات المعالجة المسبقة وقبل تقسيم القطار والاختبار، مما يضمن استخدام مجموعة ميزات ثابتة ومتسقة عبر جميع نماذج التصنيف وتكوينات المجموعات (الشكل 4).

الشكل 4
الشكل 4: درجات أهمية الميزات المحسوبة باستخدام أهمية ميزة الغابة العشوائية. يتم تصنيف الميزات حسب قيمة الأهمية الطبيعية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

تم تصنيف الميزات بناء على متوسط انخفاض الشوائب باستخدام أهمية ميزات الغابة العشوائية ب random_state = 42؛ ومع ذلك، تم الاحتفاظ بجميع الميزات المتاحة (N = 11) في تدريب النماذج اللاحق. تم تطبيق اختيار الميزات بعد المعالجة المسبقة وقبل تقسيم القطار والاختبار، لضمان وجود مجموعة ميزات ثابتة عبر جميع النماذج.

تدريب النماذج وبناء الفرقة
تم تقسيم مجموعة البيانات إلى مجموعات تدريب واختبار باستخدام نسبة تقسيم 80:20 مع دالة train_test_split(). تم استخدام بيانات التدريب حصريا لتطوير النماذج وبناء المجموعة، بينما تم تخصيص بيانات الاختبار لتقييم الأداء. تم تدريب المصنفات الأساسية، بما في ذلك شجرة القرار، الغابة العشوائية، AdaBoost، وXGBoost، على مجموعة بيانات التدريب باستخدام إعدادات المعلمات الفائقة الافتراضية ما لم يذكر خلاف ذلك.

تم بناء نماذج التصويت الصارم والتصويت الناعم باستخدام VotingClassifier، مع تخصيص أوزان متساوية لجميع المصنفات الأساسية لضمان المقارنة الموضوعية. تم تنفيذ نموذج مجموعة تكديس باستخدام الانحدار اللوجستي كمصنف فوقي. تم تدريب المصنف الفوقي على التنبؤات خارج الطية التي تم إنشاؤها من خلال التحقق المتقاطع بخمس أبعاد للمصنفات الأساسية، مما قلل من الإفراط في التوافق ومكن تقديرا غير متحيز لأداء المجموعة.

النموذج المقترح
تم تنفيذ إطار العمل المقترح لبناء مصنف مركب باستخدام استراتيجيات تعلم جماعية متعددة. تم توحيد جميع بيانات التدريب، وتم تطبيق خطوات معالجة مسبق متطابقة على بيانات الاختبار لضمان الاتساق بين مراحل التدريب والتقييم. تم دمج المصنفات الأساسية باستخدام التصويت القاسي، والتصويت الناعم، وآليات التكديس، وتم تدريب المصنف الفوقي على التكديس باستخدام الانحدار اللوجستي على التنبؤات المتبادلة. البنية العامة وتدفق البيانات لإطار عمل المجموعات (الشكل 5).

الشكل 5
الشكل 5: هندسة النموذج المقترح. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

المستوى الأول:
في المستوى الأول من إطار العمل، تم تدريب أربعة مصنفين أساسيين—Random Forest، Decision Tree، XGBoost وAdaBoost—باستخدام مجموعة بيانات التدريب الموسعة. تم دمج هذه المصنفات الأساسية لبناء نماذج مجموعات تصويت صارم وتصويت ناعم. تم تخصيص أوزان متساوية لجميع المصنفات الأساسية للحفاظ على الموضوعية ومنع التحيز الناتج عن ضبط الأوزان التفاضلي أثناء بناء المجموعة.

المستوى الثاني:
في المستوى الثاني، تم تنفيذ مصنف مجموعات التكديس من خلال دمج التنبؤات التي تولدها المصنفات الأساسية. تم تدريب المصنفات الأساسية باستخدام التحقق المتقاطع من 5 أبعاد، وتم توليد توقعات خارج الطية لكل طية. ثم تم استخدام هذه التنبؤات خارج الطين كميزات إدخال لتدريب مصنف ميتا للانحدار اللوجستي، مما قلل من الإفراط في التوافق وتمكين تقدير غير متحيز لأداء الفرقة.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعرض هذا القسم تأثيرات معالجة البيانات المسبقة واختيار الميزات، ويقارن أداء المصنفين الفرديين والجماعيين، ويلخص نتائج المقارنة عبر مقاييس التقييم القياسية. المعالجة المسبقة للبيانات، بما في ذلك إزالة القيم المفقودة، وموازنة الفئات، وتوسيع الميزات، أنتجت توزيعات إدخال متسقة عبر جميع المصنفات. أظهرت النماذج المدربة على بيانات معالجة مسبقا تباينا في الأداء عبر عمليات التحقق المتقاطع المتكررة من 5 مرات وتقسيمات التدريب-الاختبار مقارنة بالخطوط الأساسية غير المعالجة. على وجه الخصوص، حسن توازن الفئات باستمرار استدعاء الأقليات و...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تظهر هذه الدراسة أن التعلم الجماعي القائم على التكديس حقق باستمرار أداء تصنيف متفوق وأكثر استقرارا مقارنة بالمصنفين الفرديين والمجموعات القائمة على التصويت تحت ظروف المعالجة المبدئية والمعيارية المعيارية.

يعزز اتساق أداء الفرقة الذي لوحظ في هذه الدراسة أهمية الصرامة المنهجية في أبحاث التعلم الآلي المقارن 19,20,21,22,23,24,25.

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلفون أنهم لا يواجهون تضارب مصالح مرتبط بهذا العمل البحثي. لم تؤثر أي علاقات مالية أو شخصية أو مهنية على النتائج أو التحليل أو الاستنتاجات المقدمة في هذا المخطوط.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعترف المؤلفون باستخدام مجموعات البيانات المتاحة للجمهور وموارد البرمجيات مفتوحة المصدر التي دعمت هذه الدراسة. كما يشكر المؤلفون مؤسساتهم، بما في ذلك جامعة سري سري في بوبانسوار وجامعة SOA في بوبانسوار، على توفير البيئة الأكاديمية والمرافق البحثية اللازمة لإجراء هذا العمل.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
AdaBoostClassifierمطورو scikit-learnلا يوجدمصنف تعزيز المجموعات المستخدم في المقارنة المرجعية
دفتر جوبيترمشروع جوبيترلا يوجدبيئة دفتر الحوسبة
سجل كاجل هارت (كليفلاند&ndash؛ مجموعة بيانات المجر)كاجللا يوجدمجموعة بيانات القلب والأوعية الدموية العامة (1190 حالة، 11 ميزة). الرابط: https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final
الانحدار اللوجستيمطورو scikit-learnلا يوجدالمصنف الميتا المستخدم في مجموعة التكديس
ماتبلوتليبفريق تطوير ماتبلوتليبلا يوجدمكتبة تصور البيانات
نومبايمطورو نومبيلا يوجدمكتبة الحوسبة العددية
الباندا (الإصدار 1.5.3)فريق تطوير الباندالا يوجدمعالجة البيانات والتعامل معها
بايثون (الإصدار 3.9)مؤسسة بايثون للبرمجياتلا يوجدبيئة البرمجة المستخدمة في التنفيذ
مصنف الغابات العشوائيمطورو scikit-learnلا يوجدالمصنف الأساسي وحساب أهمية الميزات
سيبورنفريق تطوير سيبورنلا يوجدتصور خريطة الحرارة لمصفوفة الارتباط
ستاندردسكالرمطورو scikit-learnلا يوجددالة تحجيم الميزات
تصنيف التصويتمطورو scikit-learnلا يوجدتنفيذ مجموعة التصويت الصلبة والناعمة
XGBoostClassifierDMLCلا يوجدمصنف تعزيز التدرج يستخدم كمتعلم أساسي

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Libby, P., Bonow, R. O., et al. Braunwald’s Heart Disease: A Textbook of Cardiovascular Medicine. Elsevier Health Sci. 9, (2011).
  2. Nayak, O., Pallapothala, T., Gupta, G. P. Heart disease prediction framework using soft voting-based ensemble learning techniques. Convergence of Big Data Technologies and Computational Intelligent Techniques. IGI Global. , IGI Global. 147-165 (2023).
  3. Gaidai, O., Yan, P., Xing, Y. Future world cancer death rate prediction. Sci Rep. 13 (1), 303(2023).
  4. Imran, M., et al. A hybrid ensemble framework for cardiac disease risk stratification with machine learning. J Popul Ther Clin Pharmacol. 30 (18), 1336-1353 (2023).
  5. Elhneiti, M., Al-Hussami, M. Predicting risk factors of heart disease among Jordanian patients. Health. 9 (2), 237-247 (2017).
  6. Sevakula, R. K., Verma, N. K. Assessing generalization ability of majority vote point classifiers. IEEE Trans Neural Netw Learn Syst. 28 (12), 2985-2997 (2017).
  7. Li, H., et al. Ensemble learning for overall power conversion efficiency of all-organic dye-sensitized solar cells. IEEE Access. 6, 34118-34126 (2018).
  8. Chicco, D., Jurman, G. Machine learning can predict survival of patients with heart failure from serum creatinine and ejection fraction alone. BMC Med Inform Decis Mak. 20 (1), 16(2020).
  9. Predicting the survival of heart failure patients in unbalanced data sets. Türkmenoğlu, B. K., Yildiz, O. In Proc. 29th Signal Process Commun Appl Conf (SIU), , IEEE. 1-4 (2021).
  10. Wang, B., et al. A multi-task neural network architecture for renal dysfunction prediction in heart failure patients with electronic health records. IEEE Access. 7, 178392-178400 (2019).
  11. Amin, M. S., Chiam, Y. K., Varathan, K. D. Identification of significant features and data mining techniques in predicting heart disease. Telemat Inform. 36, 82-93 (2019).
  12. Gao, X. Y., et al. Improving the accuracy for analyzing heart diseases prediction based on the ensemble method. Complexity. 2021, 1-10 (2021).
  13. Hasan, N., Bao, Y. Comparing different feature selection algorithms for cardiovascular disease prediction. Health Technol. 11, 49-62 (2021).
  14. Pan, C., et al. Impact of categorical and numerical features in ensemble machine learning frameworks for heart disease prediction. Biomed Signal Process Control. 76, 103666(2022).
  15. Renugadevi, G., et al. Predicting heart disease using hybrid machine learning model. J Phys Conf. 1916 (1), 012208(2021).
  16. Rani, P., et al. A decision support system for heart disease prediction based upon machine learning. J Reliab Intell Environ. 7 (3), 263-275 (2021).
  17. Fayez, M., Kurnaz, S. Novel method for diagnosis diseases using advanced high-performance machine learning system. Appl Nanosci. 11, 1-7 (2021).
  18. Mohri, M., Rostamizadeh, A., Talwalkar, A. Introduction. Foundations of Machine Learning. , 2nd ed, MIT Press. 1-7 (2018).
  19. Kelleher, J. D., Mac Namee, B., D’Arcy, A. Fundamentals of Machine Learning for Predictive Data Analytics. , MIT Press. (2020).
  20. Wittek, P. Quantum Machine Learning: What Quantum Computing Means to Data Mining. , Academic Press. (2014).
  21. Sridhar, C., et al. Optimal medical image size reduction model creation using recurrent neural network and GenPSOWVQ. J Healthc Eng. 2022, 1-12 (2022).
  22. Dalal, S., et al. A hybrid machine learning model for timely prediction of breast cancer. Int J Model Simul Sci Comput. 14 (4), 2341023(2023).
  23. Edeh, M. O., et al. Artificial intelligence-based ensemble learning model for prediction of hepatitis C disease. Front Public Health. 10, 892371(2022).
  24. Latha, C. B. C., Jeeva, S. C. Improving the accuracy of prediction of heart disease risk based on ensemble classification techniques. Inform Med Unlocked. 16, 100203(2019).
  25. Bhatt, C. M., et al. Effective heart disease prediction using machine learning techniques. Algorithms. 16 (2), 88(2023).
  26. Khan, A., et al. A novel study on machine learning algorithm-based cardiovascular disease prediction. Health Soc Care Community. 2023, 1-12 (2023).
  27. García-Ordás, M. T., et al. Heart disease risk prediction using deep learning techniques with feature augmentation. Multimed Tools Appl. 82, 1-15 (2023).
  28. Tiwari, A., Chugh, A., Sharma, A. Ensemble framework for cardiovascular disease prediction. Comput Biol Med. 146, 105624(2022).
  29. Chowdary, K. R., et al. Early heart disease prediction using ensemble learning techniques. J Phys Conf Ser. 2325 (1), 012051(2022).
  30. Alqahtani, A., et al. Cardiovascular disease detection using ensemble learning. Comput Intell Neurosci. 2022, 1-10 (2022).
  31. Naser, M. A., et al. A review of machine learning’s role in cardiovascular disease prediction: recent advances and future challenges. Algorithms. 17 (2), 78(2024).
  32. Vara, N. V. D. S. S., et al. AI-assisted medical imaging and heart disease diagnosis using ensemble classifiers. J Artif Intell Gen Sci. 6 (1), 210-229 (2024).
  33. Gnanavelu, A., et al. Cardiovascular disease prediction using machine learning metrics. J Young Pharm. 17 (1), 226-233 (2025).
  34. Pal, P., et al. Interactive cardiovascular disease prediction system using learning techniques. Results Control Optim. 19, 100560(2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Ensemble LearningHeart Disease PredictionMachine Learning AlgorithmsStacking ClassifierHard VotingSoft VotingRandom ForestData PreprocessingFeature SelectionCardiovascular Dataset

Related Articles