$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
جمع البيانات
استخدمت هذه الدراسة مجموعة بيانات التنبؤ بالموافقة على القروض المتوفرة على Kaggle. تم استخراج مجموعة البيانات في فبراير 2025 وتتكون من 4269 سجلا تهدف إلى تقييم بيانات القروض والتنبؤ بنتائج الموافقة على القروض. يتضمن 12 عمودا تتضمن معلومات مفصلة عن الملامح الديموغرافية للمتقدمين ، مثل الحالة الوظيفية ، والمعالين ، والعاملين لحسابهم الخاص ، ومبلغ القرض ، ومدة القرض ، ودرجات CIBIL ، والخلفية المالية ، والسمات الخاصة بالقرض. تم استيراد مجموعة البيانات باستخدام مكتبة Pandas وفحصها بصريا باستخدام df.head () لفهم هيكلها وجودتها.
المعالجة المسبقة للبيانات
خلال مرحلة المعالجة المسبقة للبيانات ، تضمنت الخطوة الأولى إزالة عمود المعرف (loan_id) نظرا لافتقاره إلى القيمة التنبؤية وإمكانية إدخال الضوضاء في النموذج. تضمنت الخطوة الثانية ترميز الملصقات ، حيث تم تحويل المتغيرات الفئوية مثل التعليم والعاملين لحسابهم الخاص و loan_status إلى تمثيلات رقمية. تم إجراء هذا التحويل باستخدام Label Encoder من وحدة sklearn.preprocessing. على وجه التحديد ، تم ترميز التعليم على أنه 0 للخريجين و 1 لغير المتخرجين. self_employed 0 ل لا و 1 لنعم ، و loan_status ، المتغير المستهدف ، ك 0 لغير معتمد و 1 للموافق عليه. كانت هذه التحويلات ضرورية لضمان التوافق مع نماذج التعلم الآلي ، والتي تتطلب مدخلات رقمية ، خاصة لتطبيقات الإقراض الرقمي. تم فصل الميزات عن المتغير المستهدف باستخدام X = df.drop (["loan_status"] ، المحور = 1) و y = df ["loan_status]. قدم هذا الإعداد أساسا شاملا لفحص العوامل التي تؤثر على قرارات الموافقة على القروض باستخدام سجلات القروض التاريخية لتدريب نماذج التعلم الآلي الجماعية المتعددة. كان الغرض من هذه النماذج هو تحسين الدقة والمتانة الإجمالية من خلال الجمع بين نقاط القوة التنبؤية لمصنفات متعددة.
ثم تم تقسيم مجموعة البيانات المعالجة إلى مجموعات فرعية للتدريب والاختبار باستخدام وظيفة train_test_split من sklearn.model_selection ، مع استخدام 80٪ من البيانات للتدريب و 20٪ مخصصة للاختبار. وقد كفل ذلك تدريب النموذج على جزء كبير بما فيه الكفاية من البيانات مع الاحتفاظ بعينة تمثيلية لتقييم الأداء. مع تنظيف مجموعة البيانات وتنظيمها واستكشافها إحصائيا، تم وضع الأساس لتنفيذ إطار عمل قوي للتعلم الآلي يهدف إلى تعزيز الدقة التنبؤية في تصنيف الموافقة على القروض. تم إجراء تطوير النموذج باستخدام أربع خوارزميات للتعلم الآلي قائمة على المجموعة: نموذج تعزيز التدرج ، و AdaBoost ، ونموذج تعزيز التدرج الفعال ، ومصنف الأشجار الإضافية. تم اختيار هذه لأدائها المثبت في مهام التصنيف التي تتضمن بيانات جدولية منظمة. تم إنشاء مثيل لمصنف نموذج تعزيز التدرج ، الذي تم تنفيذه من مكتبة نموذج تعزيز التدرج ، بالإعدادات الافتراضية (التكرارات = 1000 ، معدل التعلم = 0.1 ، العمق = 6 ، المطول = خطأ). تم تدريبه باستخدام. تناسب (x_train ، y_train) وتم تقييمه باستخدام .predict (X_test). على الرغم من أن نموذج تعزيز التدرج يعالج تلقائيا ترميز البيانات الفئوية ، إلا أنه لم يتم استخدام هذه الميزة لأن البيانات قد تم ترميزها بالفعل. تم تنفيذ AdaBoost Classifier (التعزيز التكيفي ، الذي يحسن المتعلمين الضعفاء) باستخدام مجموعة sklearn. تم تكوين AdaBoost Classifier باستخدام n_estimators = 100 و learning_rate = 1.0 ، باستخدام جذوع القرار كمقدر أساسي افتراضي. تم تدريبه وتقييمه بطريقة مماثلة ، مما ساهم في المتانة من خلال الترجيح التكراري للحالات التي تم تصنيفها بشكل خاطئ. تم تكوين تعزيز التدرج الفعال ، الذي تم تنفيذه من خلال مكتبة نموذج تعزيز التدرج الفعال (LGBMClassifier) ، باستخدام n_estimators = 100 و learning_rate = 0.1 و max_depth = -1 (عمق الشجرة غير المقيد). يتفوق هذا النموذج ، المعروف بسرعته وكفاءته ، بشكل خاص على مجموعات البيانات الكبيرة ذات الميزات عالية الأبعاد باستخدام أشجار القرار المعززة للتدرج المحسن.
أخيرا ، تم استخدام ExtraTrees Classifier من sklearn.ensemble مع n_estimators = 100 و criterion = "gini" كاستراتيجية تقسيم. على عكس الغابة العشوائية ، تقدم Extra Trees مزيدا من العشوائية عن طريق تحديد نقاط القطع بشكل عشوائي ، مما يساعد على تقليل تباين النموذج وتحسين التعميم. تم إجراء المجموعة باستخدام مصنف التراص الخاص ب scikit-learn ، والذي يعزز التعميم من خلال تجميع التنبؤات من المتعلمين الأساسيين. تم تقييم كل نموذج باستخدام مقاييس التصنيف القياسية ، بما في ذلك الدقة والدقة ودرجة F1 وتحليل الأخطاء ومصفوفة الارتباك. تم حساب هذه المقاييس باستخدام وظائف من وحدة sklearn.metrics لضمان مقارنة الأداء الموحدة عبر جميع النماذج.
تم حفظ النموذج الأفضل أداء (بناء على الدقة ودرجة F1) للنشر باستخدام مكتبة Python. dump(model، "best_model.pkl")، لضمان إمكانية إعادة استخدام النموذج المدرب دون الحاجة إلى إعادة التدريب. لمحاكاة تطبيق في العالم الحقيقي ، تم إنشاء مصفوفة إدخال عينة تحتوي على 11 ميزة باستخدام NumPy وتمريرها إلى وظيفة النموذج .predict (). على سبيل المثال ، أعاد متجه الإدخال [[0 ، 1 ، 1،4100000 ، 12200000 ، 8 ، 417 ، 2700000 ، 2200000 ، 8800000 ، 33000000]] تنبؤا ب 1 ، مما يشير إلى الموافقة على القرض. تم إجراء جميع التجارب في بيئة Python 3.10 باستخدام Google Notebook على Kaggle. تم تطوير النموذج وتقييمه باستخدام مكتبات scikit-learn (v1.3) ونموذج تعزيز التدرج ونموذج تعزيز التدرج الفعال. تم توثيق جميع المعلمات الفائقة بشكل صريح ، وتم ذكر الإعدادات الافتراضية بوضوح عند الاقتضاء. اتبعت إجراءات الترميز النهج الذي وصفته Pedregosa وتم تنفيذها في scikit-learn46. تضمن هذه المنهجية الشاملة والشفافة أن البروتوكول التجريبي قابل للتكرار بالكامل ويلتزم بالمعايير الأكاديمية الصارمة في أبحاث التعلم الآلي.
ويبين الشكل 1 هيكل المنهجية المقترحة، بما في ذلك مرحلة قسم ميزة إعداد البيانات، والتدريب على النموذج وتقييمه.
يقدم هذا البحث إطار عمل التعلم الجماعي للتكديس الذي يجمع بين قدرات أربعة مصنفات قوية: نموذج تعزيز التدرج ، و AdaBoost ، ونموذج تعزيز التدرج الفعال ، و Extra Trees للتنبؤ بقرارات الموافقة على القروض بناء على السجلات المالية التاريخية. من خلال الجمع بين استراتيجيات التعزيز والتعبئة داخل بنية النموذج المكدسة46. يتغلب النهج بشكل فعال على أوجه القصور الفردية لهذه النماذج ، مثل التحيز والتباين ، مما يضفي على دقة التنبؤ المعززة وتعميم النموذج. يساهم كل متعلم أساسي بنقاط قوة فريدة من نوعها ، ويتميز نموذج تعزيز التدرج بكفاءة مع المتغير الفئوي ، وهو مصمم للتعامل مع الميزات الفئوية عالية الود ويؤدي داخليا ترميز الهدف باستخدام التعزيز المطلوب47. هذا يتجنب الإفراط في التركيب من خلال ضمان استخدام البيانات السابقة فقط في إحصاءات الحوسبة. في الصيغة
,
يمثل كل Ht (X) شجرة قرار مدربة على بقايا النموذج السابق ، ويشير Nt إلى مساهمة التعلم الخاصة بالخطوة. يقوم AdaBoost أو Adaptive Boost بضبط وزن كل مثيل أثناء التدريب ويركز على نقاط البيانات التي تم تصنيفها بشكل خاطئسابقا 48. في الصيغة

يعكس αt أداء المتعلم الضعيف t-th ht (x) ، مع التركيز بشكل أكبر على العينات التي تم تصنيفها بشكل خاطئ سابقا. يشتمل نموذج تعزيز التدرج الفعال على أخذ العينات من جانب واحد (GOSS) المستند إلى التدرج وتجميع الميزات الحصري لأداء أسرع. يوفر تعزيز التدرج الفعال سرعة عالية وأداء عاليين على البيانات واسعة النطاق49.

ft (xi) تمثل شجرة القرار الجديدة المضافة لتقليل الخسارة l (•) بينما Ω (ft) هو مصطلح تنظيم . في المقابل ، تقلل الأشجار الإضافية من التباين عن طريق إضافة العشوائية في تقسيمات شجرة القرار50. يعتمد على مبادئ التعبئة ولكنه يضخ عشوائية إضافية أثناء تقسيم العقدة إلى قاعدة التنبؤ الخاصة به

يحسب متوسط مخرجات M الأشجار العشوائية المدربة بشكل مستقل. لكل تقسيم ، تختار الأشجار الإضافية عتبات عشوائية للميزات وتختار الأفضل بينها ، وبالتالي تقليل التباين وتقديم تنوع عال عبر الأشجار ، مما يحسن التعميم. يتم دمج هذه النماذج بشكل جماعي من خلال مصنف التراص ، والذي يتعلم الجمع بين مخرجاتها على النحو الأمثل لتحديد ما إذا كان يجب الموافقة على القرض. تم تقييم إطار العمل باستخدام مقاييس التصنيف المشتركة واختباره باستخدام عينات المدخلات الحية ، مما يدل على أهميته العملية في بيئات الإقراض الرقمي51. يتم دمج هذه النماذج بشكل جماعي باستخدام مصنف التراص ، والذي يتعلم مزج مخرجاتها بشكل مثالي لتحديد نتائج قبول القروض. تم تقييم أداء النموذج باستخدام مقاييس تصنيف مهمة مثل الدقة والدقة والاستدعاء ودرجة F1 و AUC-ROC ، بالإضافة إلى مصفوفة الارتباك ، لتحديد قدرته على تقليل أخطاء النوع الأول والنوع الثاني. للحفاظ على توازن الفصل ، تم استخدام تقسيم اختبار القطار الطبقي بنسبة 80:20 ، مع التحقق المتبادل بمقدار 5 أضعاف لضمان المتانة وتقليل تباين العينة. علاوة على ذلك ، تم تقييم النموذج بناء على ملفات تعريف واقعية لمقدمي طلبات القروض التي تضمنت معلومات مثل التاريخ الائتماني والدخل وحالة التوظيف ومبلغ القرض ، مما أدى إلى الأحكام الثنائية وتصنيفات الاحتمالات. يوضح هذا الاختبار المكون من مرحلتين فعالية النموذج وعدالته وعمليته في سياقات الإقراض الرقمي في الوقت الفعلي. تكمن حداثة هذا العمل في تصميم المجموعة الهجينة المصممة لتسجيل الائتمان ، مما يجعله نموذجا قويا وقابلا للتفسير وقابلا للتكرار للمنصات المالية الحديثة52 .