يحدد هذا البروتوكول عملية حسابية لإنشاء وتقييم نماذج تعلم آلي متكاملة للتنبؤ بأمراض القلب باستخدام بيانات مرجعية متاحة للجمهور ضمن هيكل معالجة وتقييم قابلة للتكرار.
Research Article
يحدد هذا البروتوكول عملية حسابية لإنشاء وتقييم نماذج تعلم آلي متكاملة للتنبؤ بأمراض القلب باستخدام بيانات مرجعية متاحة للجمهور ضمن هيكل معالجة وتقييم قابلة للتكرار.
تقدم هذه الورقة تقييما حسابيا على الطاولة لخوارزميات التعلم الجماعي في التنبؤ بأمراض القلب، حيث يجمع بين خوارزميات تعلم الآلة المختلفة مثل التصويت القاسي، والتصويت الناعم، والتكديس، في إطار واحد. تم إجراء التقييم باستخدام مجموعة بيانات القلب والأوعية الدموية المتاحة للجمهور تم الحصول عليها من مستودع كاجل (https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final) والتي تضم 1,190 حالة و11 ميزة سريرية. تتضمن العملية معالجة البيانات مسبقا، والتي تشمل التعامل مع القيم المفقودة، إزالة القيم الشاذة، تحجيم المتغيرات وتوازن الفئات لضمان استخدام اختيار موحد لميزات الإدخال، بناء على الغابة العشوائية (RF)، لإزالة الميزات غير الضرورية. من بين النماذج التي تم تقييمها، حقق مصنف مجموعة التكديس أعلى دقة إجمالية بلغت 91.88٪ في مجموعة بيانات الاختبار. على الرغم من حساب مقاييس إضافية مثل الدقة، والاسترجاع، ودرجة F1 للتحليل المقارن، إلا أن تركيز هذه الدراسة لا يزال على المقارنة المنهجية بدلا من التحقق السريري.
يتم تطبيق واختبار مصنفات أساسية مختلفة، بما في ذلك شجرة القرار، الغابة العشوائية، AdaBoost، وXGBoost، بشكل مستقل. ثم تدمج هذه النماذج باستخدام تقنيات الجماعة مع التصويت القوي، والتصويت الناعم، والتكديس. في التكديس، يستخدم الانحدار اللوجستي كنموذج فوقي، والذي يتم تدريبه على التنبؤات المتبادلة للعينات خارج الطي لتجنب الإفراط في التوافق.
تجرى التقييمات باستخدام الدقة كمعيار أساسي للمقارنة، بحيث يمكن مقارنة أنظمة التصنيف الفردية واستراتيجيات التركيب بينها بشكل موحد في نفس بيئة المعالجة المسبقة والتحقق من الصحة. على الرغم من تقديم مقاييس أداء للمؤشرات المقارنة، إلا أن تركيز النهج يكمن في تطوير وتقييم الاستراتيجيات وليس في تقييمها السريري.
يسهل هذا البروتوكول مقارنة خوارزميات التعلم الآلي الجماعية على مجموعات بيانات القلب والأوعية الدموية المتاحة للجمهور، ويساعد في إجراء مقارنة منهجية بين أساليب المعالجة المسبقة للبيانات وتكوين المجموعات.
تستخدم مجموعات بيانات أمراض القلب والأوعية الدموية المتاحة للجمهور على نطاق واسع كمعايير في أبحاث تعلم الآلة لتقييم خوارزميات التصنيف وتقنيات النمذجة التنبؤية 1,2,3. توفر هذه المجموعات من البيانات، التي تحتوي على سمات سريرية وديموغرافية، أساسا موحدا وقابلا للتكرار لمقارنة استراتيجيات المعالجة المسبقة، وطرق اختيار الميزات، وهياكل التعلم الجماعي تحت ظروف تجريبية مضبوطة. وبالتالي، تستخدم عادة لتقييم السلوك الخوارزمي بدلا من دعم الاستنتاج السريري أو النشر الواقعي 4,5.
بحثت أبحاث سابقة في طرق تعلم الآلة المختلفة للتنبؤ بأمراض القلب والأوعية الدموية، مثل الانحدار اللوجستي (LR)، وآلات الدعم المتجهة (SVM)، والغابات العشوائية (RF) ونماذج تعزيز التدرج6،7،8،9. في الآونة الأخيرة، ركزت الدراسات على تقنيات التعلم الجماعي، مثل التصويت الصعب، والتصويت الناعم، والتكديس، لجعل النماذج أكثر استقرارا وتحسين أدائها10، 11، 12، 13، 14. ومع ذلك، فإن الفروق في كيفية إعداد البيانات، وكيفية التعامل مع الميزات، وإجراء التحقق، وقياس النتائج عبر هذه الدراسات تجعل من الصعب مقارنة النتائج المبلغ عنها مباشرة. لتقديم نظرة عامة سياقية شاملة لفئات أمراض القلب والأوعية الدموية التي يتم الإبلاغ عنها عادة في الأدبيات، يتم عرض توضيحي مفاهيمي في الشكل 1.

الشكل 1: توضيح مفاهيمي لفئات أمراض القلب والأوعية الدموية الشائعة المبلغ عنها، مدرج فقط للخلفية السياقية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
الشكل 1 مدرج فقط للرجوع السياقي عالي المستوى ولا يمثل البيانات المستمدة من مجموعة البيانات التي تم تحليلها في هذه الدراسة أو من أي مخرجات من البروتوكول الحاسوبي المقترح.
على وجه الخصوص، تركز العديد من الأعمال القائمة على نتائج الأداء دون عزل واضح لمساهمة المكونات المنهجية الفردية، مثل توقيت اختيار الميزات، موازنة الفئات، أو تكوين الفرقة15، 16، 17، 18. يبرز هذا التفاوت الحاجة إلى إطار عمل معياري قابل لإعادة الإنتاج يقيم بشكل منهجي طرق التعلم الآلي المجمعة باستخدام خط معالجة مسبقة متسق وبروتوكول تقييم على مجموعة بيانات متاحة للجمهور.
يفترض أن أساليب التعلم الجماعي، وخاصة طرق التكديس، ستظهر دقة تصنيف محسنة وأداء متوازنا حسب الفئة مقارنة بالمصنفات الأساسية الفردية عند تقييمها تحت ظروف المعالجة المبدئية والتحقق الموحدة.
وبناء عليه، فإن هدف هذه الدراسة هو إجراء تحليل معياري حسابي لأساليب التعلم الآلي الجماعية للتنبؤ بأمراض القلب والأوعية الدموية باستخدام مجموعة بيانات كاجل متاحة للجمهور. تتضمن العملية معالجة بيانات موحدة مسبقة، واستخدام خوارزمية الغابة العشوائية لترتيب أهمية الميزات، بالإضافة إلى استخدام تقنيات تجميعية مختلفة تشمل التصويت الجاد، والتصويت الناعم، والتكديس. يستخدم الانحدار اللوجستي كخوارزمية التصنيف الفوقي في التكديس. هذا يضمن عدم وجود فائض في التوافق، حيث يستخدم التنبؤات المتبادلة.
تهدف هذه الدراسة فقط إلى تحقيق مقارنة بيانات عامة. نتائجها محدودة بالاعتماد على مجموعة بيانات واحدة وتحيزات محتملة خاصة بمجموعة البيانات، وبالتالي لا تعني التحقق السريري أو النشر. سيكون من الضروري التحقق الخارجي باستخدام مجموعات بيانات مستقلة وتقييم مستقبلي قبل النظر في أي تطبيق سريري.
توجه هذه الدراسة أسئلة بحثية تالية:
تفحص هذه الدراسة كيف تقارن طرق التعلم الآلي الجماعية المختلفة، بما في ذلك التصويت القاسي، والتصويت الناعم، والتكديس، من حيث دقة التصنيف عند تطبيقها على مجموعة بيانات أمراض القلب والأوعية الدموية المتاحة للجمهور.
Access restricted. Please log in or start a trial to view this content.
وصف هذا البروتوكول سير عمل حسابي قابل للتكرار لمقارنة نماذج التعلم الآلي الجماعية باستخدام مجموعة بيانات أمراض القلب والأوعية الدموية المتاحة للجمهور.
اختيار مجموعة البيانات
استخدمت الدراسة مجموعة بيانات أمراض القلب والأوعية الدموية المتاحة للجمهور تم الحصول عليها من مستودع كاغل. تكونت مجموعة البيانات من 1190 نسخة واحتوت على 11 ميزة. في تدريب النماذج، تم استخدام 80٪ من البيانات، بينما تم تخصيص 20٪ المتبقية لتقييم الأداء. قدم الجدول 1 وصفا مفصلا لميزات مجموعة البيانات. تم تحميل مجموعة البيانات إلى بايثون (الإصدار 3.9) باستخدام مكتبة بانداس (الإصدار 1.5.3). تم التحقق من سلامة مجموعة البيانات من خلال فحص القيم المفقودة، والسجلات المكررة، وأنواع البيانات غير المتسقة.
يلخص الجدول 1 السمات الديموغرافية والسريرية والتجريبية المدرجة في مجموعة بيانات أمراض القلب والأوعية الدموية، إلى جانب أنواع بياناتها وصيغها المشفرة. شكلت هذه الميزات المتغيرات المدخلة لجميع إجراءات تدريب وتقييم النماذج اللاحقة.
| لا | اسم الفيلم | نوع البيانات | الوصف |
| 1 | العمر | رقمي | عمر المريض بالسنوات. |
| 2 | الجنس | اسمي | يمثل الذكر ك 1، والأنثى يمثل ك0. |
| 3 | نوع ألم الصدر | تصنيفي | 1: نموذجي 2: الذبحة الصدرية النموذجية 3: ألم غير ذبائي 4: بدون أعراض |
| 4 | BP S في الراحة | رقمي | ضغط الدم أثناء الراحة يقاس بالمليمترات من الزئبق (mmHg). |
| 5 | مستوى الكوليسترول | رقمي | الكوليسترول في المصل بملليغرام لكل ديسيلتر (ملغ/ديسيلتر). |
| 6 | سكر الدم الصائم | اسمي | مستويات السكر في الدم التي تزيد عن 120 ملغ/ديسيلتر أثناء الصيام تمثل ب 1 للصحيح و0 للكاذب. |
| 7 | تخطيط القلب أثناء الراحة | تصنيفي | تم تخصيص ثلاث قيم مميزة كما يلي: 0 للطبيعي، 1 للشذوذ في موجة ST-T، و2 لتضخم البطين الأيسر. |
| 8 | أقصى معدل ضربات قلب | رقمي | الوصول إلى ذروة معدل ضربات القلب |
| 9 | تمرين الذبحة الصدرية | اسمي | الذبحة الصدرية الناتجة عن التمارين، حيث 0 تمثل NO و1 تمثل نعم. |
| 10 | أولدبيك | رقمي | الاكتئاب أثناء التمرين مقارنة بحالة الراحة. |
| 11 | منحدر ST | تصنيفي | يصنف ميل مقطع ST أثناء ذروة التمارين كما يلي: 0: طبيعي 1: صعود 2: مستو 3: انخفاض |
الجدول 1: وصف ميزات مجموعة البيانات المستخدمة للتنبؤ بأمراض القلب.
المعالجة المسبقة للبيانات
تم إجراء معالجة البيانات المسبقة باستخدام مكتبات بايثون. تمت إزالة الصفوف التي تحتوي على قيم مفقودة باستخدام pandas. دالة DataFrame.dropna(). تم تحديد وإزالة المؤشرات الشاذة في السمات الرقمية باستخدام طريقة النطاق الربعي (IQR) والتصور المعتمد على مخطط الصندوق، الذي يوضح التوزيع والمؤشرات الشاذة المكتشفة عبر الميزات (الشكل 2). تم تكبير جميع المتغيرات الرقمية باستخدام دالة StandardScaler من مكتبة scikit-learn (الإصدار 1.2.2). تم معالجة اختلال التوازن الطبقي من خلال تقليل العينات العشوائية للحصول على توزيع متوازن للفئات قبل تدريب النماذج.

الشكل 2: مخطط الصندوق لجميع السمات في مجموعة بيانات أمراض القلب والأوعية الدموية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
تم استخدام معامل الارتباط (PCC) لبيرسون لتقييم العلاقات بين الخصائص. توضح مصفوفة الارتباط الناتجة، التي تصور كخريطة حرارية، قوة واتجاه ارتباطات الميزات الزوجية وتبرز السمات الزائدة للإزالة (الشكل 3).

الشكل 3: مصفوفة الارتباط لمجموعة بيانات أمراض القلب. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
ينتج عن النموذج خريطة حرارية لمصفوفة الارتباط تبدو جميلة من الناحية الجمالية وتتيح فهما أسرع للارتباطات بين الميزات المختلفة في البيانات. تستخدم هذه الخريطة الحرارية الألوان لإظهار مدى واتجاه القيم مرتبطة، مما يجعلها أداة مهمة في تحليل البيانات الاستكشافي. الألوان الفاتحة تظهر ارتباطات إيجابية أعلى، والألوان الداكنة تظهر ارتباطات سلبية أعلى، والألوان الخضراء تظهر ارتباطات قريبة من الصفر.
استخراج الميزات
تم اختيار الميزات باستخدام أهمية ميزات الغابة العشوائية التي تم تنفيذها عبر RandomForestClassifier في مكتبات التعلم الآلي مفتوحة المصدر. تم حساب درجات أهمية الميزات بناء على متوسط انخفاض الشوائب، وتم تصنيف الميزات وفقا لذلك. تم الاحتفاظ بالميزات المصنفة N العليا للتحليل لاحقا. تم تطبيق اختيار الميزات بعد الانتهاء من جميع خطوات المعالجة المسبقة وقبل تقسيم القطار والاختبار، مما يضمن استخدام مجموعة ميزات ثابتة ومتسقة عبر جميع نماذج التصنيف وتكوينات المجموعات (الشكل 4).

الشكل 4: درجات أهمية الميزات المحسوبة باستخدام أهمية ميزة الغابة العشوائية. يتم تصنيف الميزات حسب قيمة الأهمية الطبيعية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
تم تصنيف الميزات بناء على متوسط انخفاض الشوائب باستخدام أهمية ميزات الغابة العشوائية ب random_state = 42؛ ومع ذلك، تم الاحتفاظ بجميع الميزات المتاحة (N = 11) في تدريب النماذج اللاحق. تم تطبيق اختيار الميزات بعد المعالجة المسبقة وقبل تقسيم القطار والاختبار، لضمان وجود مجموعة ميزات ثابتة عبر جميع النماذج.
تدريب النماذج وبناء الفرقة
تم تقسيم مجموعة البيانات إلى مجموعات تدريب واختبار باستخدام نسبة تقسيم 80:20 مع دالة train_test_split(). تم استخدام بيانات التدريب حصريا لتطوير النماذج وبناء المجموعة، بينما تم تخصيص بيانات الاختبار لتقييم الأداء. تم تدريب المصنفات الأساسية، بما في ذلك شجرة القرار، الغابة العشوائية، AdaBoost، وXGBoost، على مجموعة بيانات التدريب باستخدام إعدادات المعلمات الفائقة الافتراضية ما لم يذكر خلاف ذلك.
تم بناء نماذج التصويت الصارم والتصويت الناعم باستخدام VotingClassifier، مع تخصيص أوزان متساوية لجميع المصنفات الأساسية لضمان المقارنة الموضوعية. تم تنفيذ نموذج مجموعة تكديس باستخدام الانحدار اللوجستي كمصنف فوقي. تم تدريب المصنف الفوقي على التنبؤات خارج الطية التي تم إنشاؤها من خلال التحقق المتقاطع بخمس أبعاد للمصنفات الأساسية، مما قلل من الإفراط في التوافق ومكن تقديرا غير متحيز لأداء المجموعة.
النموذج المقترح
تم تنفيذ إطار العمل المقترح لبناء مصنف مركب باستخدام استراتيجيات تعلم جماعية متعددة. تم توحيد جميع بيانات التدريب، وتم تطبيق خطوات معالجة مسبق متطابقة على بيانات الاختبار لضمان الاتساق بين مراحل التدريب والتقييم. تم دمج المصنفات الأساسية باستخدام التصويت القاسي، والتصويت الناعم، وآليات التكديس، وتم تدريب المصنف الفوقي على التكديس باستخدام الانحدار اللوجستي على التنبؤات المتبادلة. البنية العامة وتدفق البيانات لإطار عمل المجموعات (الشكل 5).

الشكل 5: هندسة النموذج المقترح. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
المستوى الأول:
في المستوى الأول من إطار العمل، تم تدريب أربعة مصنفين أساسيين—Random Forest، Decision Tree، XGBoost وAdaBoost—باستخدام مجموعة بيانات التدريب الموسعة. تم دمج هذه المصنفات الأساسية لبناء نماذج مجموعات تصويت صارم وتصويت ناعم. تم تخصيص أوزان متساوية لجميع المصنفات الأساسية للحفاظ على الموضوعية ومنع التحيز الناتج عن ضبط الأوزان التفاضلي أثناء بناء المجموعة.
المستوى الثاني:
في المستوى الثاني، تم تنفيذ مصنف مجموعات التكديس من خلال دمج التنبؤات التي تولدها المصنفات الأساسية. تم تدريب المصنفات الأساسية باستخدام التحقق المتقاطع من 5 أبعاد، وتم توليد توقعات خارج الطية لكل طية. ثم تم استخدام هذه التنبؤات خارج الطين كميزات إدخال لتدريب مصنف ميتا للانحدار اللوجستي، مما قلل من الإفراط في التوافق وتمكين تقدير غير متحيز لأداء الفرقة.
Access restricted. Please log in or start a trial to view this content.
يعرض هذا القسم تأثيرات معالجة البيانات المسبقة واختيار الميزات، ويقارن أداء المصنفين الفرديين والجماعيين، ويلخص نتائج المقارنة عبر مقاييس التقييم القياسية. المعالجة المسبقة للبيانات، بما في ذلك إزالة القيم المفقودة، وموازنة الفئات، وتوسيع الميزات، أنتجت توزيعات إدخال متسقة عبر جميع المصنفات. أظهرت النماذج المدربة على بيانات معالجة مسبقا تباينا في الأداء عبر عمليات التحقق المتقاطع المتكررة من 5 مرات وتقسيمات التدريب-الاختبار مقارنة بالخطوط الأساسية غير المعالجة. على وجه الخصوص، حسن توازن الفئات باستمرار استدعاء الأقليات و...
Access restricted. Please log in or start a trial to view this content.
تظهر هذه الدراسة أن التعلم الجماعي القائم على التكديس حقق باستمرار أداء تصنيف متفوق وأكثر استقرارا مقارنة بالمصنفين الفرديين والمجموعات القائمة على التصويت تحت ظروف المعالجة المبدئية والمعيارية المعيارية.
يعزز اتساق أداء الفرقة الذي لوحظ في هذه الدراسة أهمية الصرامة المنهجية في أبحاث التعلم الآلي المقارن 19,20,21,22,23,24,25.
Access restricted. Please log in or start a trial to view this content.
يعلن المؤلفون أنهم لا يواجهون تضارب مصالح مرتبط بهذا العمل البحثي. لم تؤثر أي علاقات مالية أو شخصية أو مهنية على النتائج أو التحليل أو الاستنتاجات المقدمة في هذا المخطوط.
يعترف المؤلفون باستخدام مجموعات البيانات المتاحة للجمهور وموارد البرمجيات مفتوحة المصدر التي دعمت هذه الدراسة. كما يشكر المؤلفون مؤسساتهم، بما في ذلك جامعة سري سري في بوبانسوار وجامعة SOA في بوبانسوار، على توفير البيئة الأكاديمية والمرافق البحثية اللازمة لإجراء هذا العمل.
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| AdaBoostClassifier | مطورو scikit-learn | لا يوجد | مصنف تعزيز المجموعات المستخدم في المقارنة المرجعية |
| دفتر جوبيتر | مشروع جوبيتر | لا يوجد | بيئة دفتر الحوسبة |
| سجل كاجل هارت (كليفلاند&ndash؛ مجموعة بيانات المجر) | كاجل | لا يوجد | مجموعة بيانات القلب والأوعية الدموية العامة (1190 حالة، 11 ميزة). الرابط: https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final |
| الانحدار اللوجستي | مطورو scikit-learn | لا يوجد | المصنف الميتا المستخدم في مجموعة التكديس |
| ماتبلوتليب | فريق تطوير ماتبلوتليب | لا يوجد | مكتبة تصور البيانات |
| نومباي | مطورو نومبي | لا يوجد | مكتبة الحوسبة العددية |
| الباندا (الإصدار 1.5.3) | فريق تطوير الباندا | لا يوجد | معالجة البيانات والتعامل معها |
| بايثون (الإصدار 3.9) | مؤسسة بايثون للبرمجيات | لا يوجد | بيئة البرمجة المستخدمة في التنفيذ |
| مصنف الغابات العشوائي | مطورو scikit-learn | لا يوجد | المصنف الأساسي وحساب أهمية الميزات |
| سيبورن | فريق تطوير سيبورن | لا يوجد | تصور خريطة الحرارة لمصفوفة الارتباط |
| ستاندردسكالر | مطورو scikit-learn | لا يوجد | دالة تحجيم الميزات |
| تصنيف التصويت | مطورو scikit-learn | لا يوجد | تنفيذ مجموعة التصويت الصلبة والناعمة |
| XGBoostClassifier | DMLC | لا يوجد | مصنف تعزيز التدرج يستخدم كمتعلم أساسي |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission