$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Dataverzameling
Deze studie maakte gebruik van de Loan Approval Prediction Dataset die beschikbaar is op Kaggle. De dataset is geëxtraheerd in februari 2025 en bestaat uit 4269 records die gericht zijn op het evalueren van leninggegevens en het voorspellen van de resultaten van de goedkeuring van leningen. Het bevat 12 kolommen met gedetailleerde informatie over de demografische profielen van aanvragers, zoals arbeidsstatus, personen ten laste, zelfstandigen, geleend bedrag, looptijd van de lening, CIBIL-scores, financiële achtergrond en leningspecifieke kenmerken. De dataset is geïmporteerd met behulp van de Panda's-bibliotheek en visueel geïnspecteerd met behulp van df.head () om de structuur en kwaliteit ervan te begrijpen.
Voorverwerking van gegevens
Tijdens de voorverwerkingsfase van de gegevens bestond de eerste stap uit het verwijderen van de identificatiekolom (loan_id) vanwege het ontbreken van voorspellende waarde en het potentieel om ruis in het model te introduceren. De tweede stap betrof labelcodering, waarbij categorische variabelen zoals opleiding, zelfstandigen en loan_status werden omgezet in numerieke weergaven. Deze transformatie is uitgevoerd met behulp van Label Encoder van de sklearn.preprocessing-module. Concreet werd onderwijs gecodeerd als 0 voor Graduate en 1 voor Not Graduate; self_employed als 0 voor Nee en 1 voor Ja, en loan_status, de doelvariabele, als 0 voor Niet goedgekeurd en 1 voor Goedgekeurd. Deze conversies waren nodig om compatibiliteit te garanderen met machine learning-modellen, die numerieke invoer vereisen, met name voor digitale leentoepassingen. De kenmerken werden gescheiden van de doelvariabele met behulp van X=df.drop ("loan_status"], as=1) en y=df ["loan_status]. Deze opzet bood een uitgebreide basis voor het onderzoeken van de factoren die van invloed zijn op beslissingen over de goedkeuring van leningen, met behulp van historische leningrecords om meerdere ensemble machine learning-modellen te trainen. Deze modellen waren bedoeld om de algehele nauwkeurigheid en robuustheid te verbeteren door de voorspellende kracht van meerdere classificaties te combineren.
De verwerkte dataset werd vervolgens opgesplitst in subsets voor training en testen met behulp van de train_test_split functie van sklearn.model_selection, waarbij 80% van de gegevens werd gebruikt voor training en 20% werd gereserveerd voor testen. Dit zorgde ervoor dat het model werd getraind op een voldoende groot deel van de gegevens, terwijl een representatieve steekproef voor prestatie-evaluatie behouden bleef. Nadat de dataset was opgeschoond, gestructureerd en statistisch was verkend, werd de basis gelegd voor de implementatie van een robuust machine learning-raamwerk dat gericht is op het verbeteren van de voorspellende nauwkeurigheid bij de classificatie van leninggoedkeuringen. De modelontwikkeling werd uitgevoerd met behulp van vier op ensembles gebaseerde machine learning-algoritmen: Gradient Boosting Model, AdaBoost, Efficient Gradient Boosting Model en Extra Trees Classifier. Deze werden geselecteerd vanwege hun bewezen prestaties bij classificatietaken met gestructureerde, tabellarische gegevens. De modelclassificatie voor het versterken van verloop, geïmplementeerd vanuit de bibliotheek voor het verhogen van het verloopmodel, is geïnstantieerd met standaardinstellingen (iteraties=1000, leersnelheid=0,1, depth=6, uitgebreid=onwaar). Het werd getraind met behulp van. fit (x_train, y_train) en geëvalueerd met .predict (X_test). Hoewel het Gradient Boosting Model automatisch categorische gegevenscodering verwerkt, werd deze functie niet gebruikt omdat de gegevens al op het label waren gecodeerd. De AdaBoost Classifier (Adaptive Boosting, die zwakke leerlingen verbetert) werd geïmplementeerd met behulp van sklearn-ensemble. AdaBoost Classifier is geconfigureerd met n_estimators=100 en learning_rate=1.0, met behulp van beslissingsstompen als de standaard basisschatter. Het werd op een vergelijkbare manier getraind en geëvalueerd, waarbij robuustheid werd bijgedragen door iteratieve weging van verkeerd geclassificeerde instanties. De Efficient Gradient Boosting, geïmplementeerd via de Efficient Gradient Boosting Model-bibliotheek (LGBMClassifier), is geconfigureerd met n_estimators=100, learning_rate=0,1 en max_depth=-1 (onbeperkte boomdiepte). Dit model, dat bekend staat om zijn snelheid en efficiëntie, blinkt vooral uit in grote datasets met hoogdimensionale functies met behulp van geoptimaliseerde beslissingsbomen voor het stimuleren van gradiënten.
Ten slotte werd de ExtraTrees Classifier van sklearn.ensemble gebruikt met n_estimators=100 en criterion="gini" als splitsingsstrategie. In tegenstelling tot Random Forest introduceert Extra Trees nog meer willekeur door willekeurig afkappunten te selecteren, wat helpt om modelvariantie te verminderen en generalisatie te verbeteren. Het ensemble werd uitgevoerd met behulp van de Stacking Classifier van scikit-learn, die de generalisatie verbetert door voorspellingen van de basisleerlingen samen te voegen. Elk model werd geëvalueerd met behulp van standaard classificatiestatistieken, waaronder nauwkeurigheid, precisie, F1-score, foutanalyse en de verwarringsmatrix. Deze statistieken zijn berekend met behulp van functies uit de sklearn.metrics-module om een gestandaardiseerde prestatievergelijking voor alle modellen te garanderen.
Het best presterende model (op basis van nauwkeurigheid en F1-score) werd opgeslagen voor implementatie met behulp van de Python-bibliotheek. dump(model, "best_model.pkl"), zodat het getrainde model opnieuw kan worden gebruikt zonder dat er opnieuw training nodig is. Om een toepassing in de echte wereld te simuleren, werd een voorbeeldinvoerarray met 11 functies gemaakt met behulp van NumPy en doorgegeven aan de functie .predict () van het model. De invoervector [[0, 1, 1,4100000, 12200000, 8, 417, 2700000, 2200000, 8800000, 3300000]] retourneerde bijvoorbeeld een voorspelling van 1, wat de goedkeuring van de lening aangeeft. Alle experimenten werden uitgevoerd in een Python 3.10-omgeving met behulp van Google Notebook op Kaggle. De ontwikkeling en evaluatie van het model werden uitgevoerd met behulp van de bibliotheken scikit-learn (v1.3), Gradient Boosting Model en Efficient Gradient Boosting Model. Alle hyperparameters werden expliciet gedocumenteerd en waar van toepassing werden de standaardinstellingen duidelijk vermeld. De coderingsprocedures volgden de aanpak beschreven door Pedregosa en werden geïmplementeerd in scikit-learn46. Deze uitgebreide en transparante methodologie zorgt ervoor dat het experimentele protocol volledig reproduceerbaar is en voldoet aan strenge academische normen voor onderzoek naar machine learning.
De structuur van de voorgestelde methodologie, die de fase van de gegevensvoorbereiding, de functiesectie, de modeltraining en de evaluatie omvat, wordt weergegeven in figuur 1.
Dit onderzoek introduceert een leerraamwerk voor stapelensembles dat de mogelijkheden van vier krachtige classificaties samenbrengt: Gradient Boosting Model, AdaBoost, Efficient Gradient Boosting Model en Extra Trees om beslissingen over de goedkeuring van leningen te voorspellen op basis van historische financiële gegevens. Door zowel boost- als bagging-strategieën te combineren binnen gestapelde modelarchitectuur46. De aanpak overwint effectief de individuele tekortkomingen van deze modellen, zoals bias en variantie, wat bijdraagt aan een verbeterde voorspellingsnauwkeurigheid en modelgeneralisatie. Elke basisleerling draagt unieke sterke punten bij Gradient Boosting Model is efficiënt met categorische variabele, het is ontworpen voor het verwerken van categorische kenmerken met een hoge hartelijkheid en voert intern doelcodering uit met behulp van geordende boosting47. Dit voorkomt overfitting door ervoor te zorgen dat alleen gegevens uit het verleden worden gebruikt in computerstatistieken. In de formule
,
Elke ht (x) vertegenwoordigt een beslissingsboom die is getraind op residuen van het vorige model, en nt geeft de stapspecifieke leerbijdrage aan. AdaBoost of Adaptive Boosting past het gewicht van elke instantie aan tijdens de training en richt zich op eerder verkeerd geclassificeerde gegevenspunten48. In de formule

αt weerspiegelt de prestaties van de t-de zwakke leerling ht(x), waarbij meer nadruk wordt gelegd op eerder verkeerd geclassificeerde steekproeven. Efficiënt model voor het versterken van gradiënten Bevat op gradiënt gebaseerde eenzijdige sampling (GOSS) en exclusieve functiebundeling voor snellere prestaties. Efficient Gradient Boosting biedt hoge snelheid en prestaties op grootschalige gegevens49.

Ft(xi) vertegenwoordigt de nieuwe beslissingsboom die is toegevoegd om het verlies l(•) te minimaliseren, terwijl Ω(ft) een regularisatieterm is. In tegenstelling tot het stimuleren van algoritmen, vermindert Extra Trees de variantie door willekeur toe te voegen in beslissingsboomsplitsingen50. Het vertrouwt op bagging-principes, maar injecteert extra willekeur tijdens het splitsen van knooppunten in zijn voorspellingsregel

Gemiddelde van de output van M onafhankelijk getrainde gerandomiseerde bomen. Voor elke splitsing selecteert Extra trees willekeurige drempels voor objecten en kiest de beste daaruit, waardoor de variantie wordt verminderd en een hoge diversiteit tussen bomen wordt geboden, wat de generalisatie verbetert. Deze modellen worden gezamenlijk geïntegreerd via een stapelclassificator, die leert hun output optimaal te combineren om te beslissen of een lening moet worden goedgekeurd. Het raamwerk werd geëvalueerd met gemeenschappelijke classificatiemetrieken en getest met live invoermonsters, wat de praktische relevantie ervan in digitale leenomgevingen aantoonde51. Deze modellen worden gezamenlijk gecombineerd met behulp van een stapelclassificator, die leert hun output idealiter te mengen om de resultaten van de acceptatie van leningen te bepalen. De prestaties van het model werden beoordeeld aan de hand van belangrijke classificatiemetingen zoals nauwkeurigheid, precisie, herinnering, F1-score en AUC-ROC, evenals een verwarringsmatrix om te bepalen of het in staat is om zowel Type I- als Type II-fouten te verminderen. Om het evenwicht in de klas te behouden, werd een gestratificeerde 80:20 trein-testverdeling gebruikt, waarbij 5-voudige kruisvalidatie de robuustheid garandeerde en de variabiliteit van de steekproef verminderde. Bovendien werd het model geëvalueerd op realistische profielen van leningaanvragers met informatie zoals kredietgeschiedenis, inkomen, arbeidsstatus en geleend bedrag, wat binaire oordelen en waarschijnlijkheidsbeoordelingen opleverde. Deze tweefasentest toont de werkzaamheid, eerlijkheid en bruikbaarheid van het model aan in real-time digitale leencontexten. De nieuwigheid van dit werk ligt in het hybride ensembleontwerp dat is afgestemd op kredietscores, waardoor het een robuust, interpreteerbaar en reproduceerbaar model is voor moderne financiële platforms52 .