$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Veri toplama
Bu çalışmada Kaggle'da bulunan Kredi Onay Tahmin Veri Seti kullanılmıştır. Veri seti Şubat 2025'te çıkarıldı ve kredi verilerini değerlendirmeyi ve kredi onay sonuçlarını tahmin etmeyi amaçlayan 4269 kayıttan oluşuyor. Başvuru sahiplerinin istihdam durumu, bakmakla yükümlü oldukları kişiler, serbest meslek sahipleri, kredi tutarı, kredi vadesi, CIBIL puanları, mali geçmiş ve krediye özgü özellikler gibi demografik profillerine ilişkin ayrıntılı bilgileri içeren 12 sütun içerir. Veri kümesi, Pandas kitaplığı kullanılarak içe aktarıldı ve yapısını ve kalitesini anlamak için df.head () kullanılarak görsel olarak incelendi.
Veri ön işleme
Veri ön işleme aşamasında ilk adım, tahmin değerinin olmaması ve modele gürültü getirme potansiyeli nedeniyle tanımlayıcı sütunun (loan_id) kaldırılmasını içeriyordu. İkinci adım, eğitim, serbest meslek sahibi ve loan_status gibi kategorik değişkenlerin sayısal temsillere dönüştürüldüğü etiket kodlamayı içeriyordu. Bu dönüşüm, sklearn.preprocessing modülünden Label Encoder kullanılarak gerçekleştirildi. Spesifik olarak, eğitim Mezun için 0 ve Mezun Değil için 1 olarak kodlandı; Hayır için 0 ve Evet için 1 ve hedef değişken loan_status Onaylanmadı için 0 ve Onaylandı için 1 olarak self_employed. Bu dönüşümler, özellikle dijital kredi uygulamaları için sayısal girdiler gerektiren makine öğrenimi modelleriyle uyumluluğu sağlamak için gerekliydi. Özellikler, X=df.drop (["loan_status"], axis=1) ve y=df ["loan_status] kullanılarak hedef değişkenden ayrıldı. Bu kurulum, birden fazla topluluk makine öğrenimi modelini eğitmek için geçmiş kredi kayıtlarını kullanarak kredi onay kararlarını etkileyen faktörleri incelemek için kapsamlı bir temel sağladı. Bu modellerin, birden fazla sınıflandırıcının tahmin güçlerini birleştirerek genel doğruluğu ve sağlamlığı artırması amaçlanmıştır.
İşlenen veri kümesi daha sonra sklearn.model_selection'deki train_test_split işlevi kullanılarak eğitim ve test alt kümelerine bölündü ve verilerin %80'i eğitim için kullanıldı ve %20'si test için ayrıldı. Bu, performans değerlendirmesi için temsili bir örnek tutarken modelin verilerin yeterince büyük bir kısmı üzerinde eğitilmesini sağladı. Veri kümesinin temizlenmesi, yapılandırılması ve istatistiksel olarak araştırılmasıyla, kredi onayı sınıflandırmasında tahmin doğruluğunu artırmayı amaçlayan sağlam bir makine öğrenimi çerçevesinin uygulanmasının temeli atıldı. Model geliştirme, dört topluluk tabanlı makine öğrenimi algoritması kullanılarak gerçekleştirildi: Gradyan Artırma Modeli, AdaBoost, Verimli Gradyan Artırma Modeli ve Ekstra Ağaç Sınıflandırıcı. Bunlar, yapılandırılmış, tablo halindeki verileri içeren sınıflandırma görevlerinde kanıtlanmış performansları nedeniyle seçilmiştir. Gradient Boosting Model kitaplığından uygulanan Gradient Boosting Model Sınıflandırıcısı, varsayılan ayarlarla (yinelemeler=1000, öğrenme oranı=0.1, derinlik=6, ayrıntılı=False) başlatıldı. Kullanılarak eğitildi. fit (x_train, y_train) ve .predict (X_test) ile değerlendirildi. Gradyan Artırma Modeli kategorik veri kodlamasını otomatik olarak işlese de, veriler zaten etiketle kodlanmış olduğundan bu özellik kullanılmadı. AdaBoost Sınıflandırıcısı (zayıf öğrencileri iyileştiren Adaptive Boosting) sklearn-ensemble kullanılarak uygulandı. AdaBoost Sınıflandırıcı, varsayılan temel tahmin aracı olarak karar kütükleri kullanılarak n_estimators=100 ve learning_rate=1.0 ile yapılandırıldı. Benzer bir şekilde eğitildi ve değerlendirildi, yanlış sınıflandırılmış örneklerin yinelemeli ağırlıklandırılması yoluyla sağlamlığa katkıda bulundu. Verimli Gradyan Artırma Modeli kitaplığı (LGBMClassifier) aracılığıyla uygulanan Verimli Gradyan Artırma, n_estimators=100, learning_rate=0.1 ve max_depth=-1 (sınırsız ağaç derinliği) ile yapılandırıldı. Hızı ve verimliliğiyle bilinen bu model, optimize edilmiş gradyan artırıcı karar ağaçlarını kullanarak özellikle yüksek boyutlu özelliklere sahip büyük veri kümelerinde öne çıkıyor.
Son olarak, bölme stratejisi olarak sklearn.ensemble dosyasındaki ExtraTrees Sınıflandırıcısı n_estimators=100 ve criterion="gini" ile kullanıldı. Rastgele Orman'dan farklı olarak Ekstra Ağaçlar, kesme noktalarını rastgele seçerek daha fazla rastgelelik sağlar, bu da model varyansını azaltmaya ve genellemeyi geliştirmeye yardımcı olur. Topluluk, temel öğrencilerden gelen tahminleri toplayarak genellemeyi geliştiren scikit-learn'ün Yığınlama Sınıflandırıcısı kullanılarak gerçekleştirildi. Her model, doğruluk, kesinlik, F1 puanı, hata analizi ve karışıklık matrisi dahil olmak üzere standart sınıflandırma ölçümleri kullanılarak değerlendirildi. Bu ölçümler, tüm modellerde standartlaştırılmış performans karşılaştırması sağlamak için sklearn.metrics modülündeki işlevler kullanılarak hesaplandı.
En iyi performans gösteren model (doğruluk ve F1 puanına göre) Python kitaplığı kullanılarak dağıtım için kaydedildi. dump(model, "best_model.pkl"), eğitilen modelin yeniden eğitime gerek kalmadan yeniden kullanılabilmesini sağlar. Gerçek dünyadaki bir uygulamayı simüle etmek için NumPy kullanılarak 11 özellik içeren örnek bir giriş dizisi oluşturuldu ve model .predict () işlevine iletildi. Örneğin, girdi vektörü [[0, 1, 1,4100000, 12200000, 8, 417, 2700000, 2200000, 8800000, 3300000]], kredi onayını gösteren 1'lik bir tahmin döndürdü. Tüm deneyler, Kaggle'da Google Not Defteri kullanılarak bir Python 3.10 ortamında gerçekleştirildi. Model geliştirme ve değerlendirme, scikit-learn (v1.3), Gradient Boosting Model ve Efficient Gradient Boosting Model kütüphaneleri kullanılarak gerçekleştirilmiştir. Tüm hiperparametreler açıkça belgelendi ve uygun olduğunda varsayılanlar açıkça belirtildi. Kodlama prosedürleri, Pedregosa tarafından açıklanan yaklaşımı izledi ve scikit-learn46'da uygulandı. Bu kapsamlı ve şeffaf metodoloji, deneysel protokolün tamamen tekrarlanabilir olmasını ve makine öğrenimi araştırmalarında katı akademik standartlara uymasını sağlar.
Veri hazırlama aşaması özellik bölümünü, model eğitimini ve değerlendirmesini kapsayan önerilen metodolojinin yapısı Şekil 1'de gösterilmektedir.
Bu araştırma, dört güçlü sınıflandırıcının yeteneklerini bir araya getiren bir yığın topluluğu öğrenme çerçevesi sunar: Gradyan Artırma Modeli, AdaBoost, Verimli Gradyan Artırma Modeli, ve Geçmiş mali kayıtlara dayalı olarak kredi onay kararlarını tahmin etmek için Ekstra Ağaçlar. Yığılmış model mimarisi46 içinde hem artırma hem de torbalama stratejilerini birleştirerek. Yaklaşım, bu modellerin önyargı ve varyans gibi bireysel eksikliklerinin etkili bir şekilde üstesinden gelerek, gelişmiş tahmin doğruluğu ve model genellemesine katkıda bulunur. Her temel öğrenci benzersiz güçlere katkıda bulunur Gradyan Artırma Modeli kategorik değişkenle verimlidir, yüksek samimiyete sahip kategorik özellikleri işlemek için tasarlanmıştır ve sıralı güçlendirme47'yi kullanarak dahili olarak hedef kodlamayı gerçekleştirir. Bu, bilgi işlem istatistiklerinde yalnızca geçmiş verilerin kullanılmasını sağlayarak aşırı uydurmayı önler. Formülde
,
Her HT (X), önceki modelin artıkları üzerinde eğitilmiş bir karar ağacını temsil ederve NT, adıma özgü öğrenme katkısını belirtir. AdaBoost veya Adaptive Boosting, eğitim sırasında her örneğin ağırlığını ayarlar ve daha önce yanlış sınıflandırılmış veri noktalarınaodaklanır 48. Formülde

αT , T'inci zayıf öğrenci HT(X)'in performansını yansıtır ve daha önce yanlış sınıflandırılmış örneklere daha fazla vurgu yapar. Verimli Gradyan Artırma Modeli: Daha hızlı performans için gradyan tabanlı tek taraflı örnekleme (GOSS) ve özel özellik paketlemeyi içerir. Verimli Gradyan Artırma, büyük ölçekli verilerde yüksek hız ve performans sunar49.

ft(xi), l(•) kaybını en aza indirmek için eklenen yeni karar ağacını temsil ederken, Ω(ft) bir düzenlileştirme terimidir. Güçlendirme algoritmalarının aksine, Ekstra Ağaçlar, karar ağacı bölmelerine rastgelelik ekleyerek varyansı azaltır50. Torbalama ilkelerine dayanır, ancak tahmin kuralına düğüm bölünmesi sırasında ekstra rastgelelik enjekte eder

M bağımsız olarak eğitilmiş rastgele ağaçların çıktılarının ortalamasını alır. Ekstra ağaçlar, her bölme için özellikler için rastgele eşikler seçer ve bunlar arasından en iyisini seçer, böylece varyansı azaltır ve ağaçlar arasında yüksek çeşitlilik sunar, bu da genellemeyi geliştirir. Bu modeller, bir kredinin onaylanıp onaylanmayacağına karar vermek için çıktılarını en uygun şekilde birleştirmeyi öğrenen bir istifleme sınıflandırıcısı aracılığıyla toplu olarak entegre edilir. Çerçeve, ortak sınıflandırma ölçütleri ile değerlendirildi ve canlı girdi örnekleriyle test edildi, bu da dijital borç verme ortamlarındaki pratik uygunluğunu gösterdi51. Bu modeller, kredi kabul sonuçlarını belirlemek için çıktılarını ideal şekilde harmanlamayı öğrenen bir istifleme sınıflandırıcısı kullanılarak toplu olarak birleştirilir. Modelin performansı, hem Tip I hem de Tip II hataları azaltma kapasitesini belirlemek için doğruluk, kesinlik, geri çağırma, F1 puanı ve AUC-ROC gibi önemli sınıflandırma ölçütlerinin yanı sıra bir karışıklık matrisi kullanılarak değerlendirildi. Sınıf dengesini korumak için, sağlamlığı sağlayan ve numune değişkenliğini azaltan 80 kat çapraz doğrulama ile katmanlı 20:5 tren testi bölünmesi kullanıldı. Ayrıca model, kredi geçmişi, gelir, istihdam durumu ve kredi tutarı gibi bilgileri içeren, ikili yargılar ve olasılık derecelendirmeleri veren gerçekçi kredi başvuru sahibi profilleri üzerinde değerlendirildi. Bu iki aşamalı test, modelin gerçek zamanlı dijital borç verme bağlamlarındaki etkinliğini, adilliğini ve pratikliğini göstermektedir. Bu çalışmanın yeniliği, kredi puanlaması için özel olarak tasarlanmış hibrit topluluk tasarımında yatmaktadır ve bu da onu modern finansal platformlar için sağlam, yorumlanabilir ve tekrarlanabilir bir model haline getirmektedir52 .