Research Article

Approche d’ensemble d’empilement pour prédire l’approbation d’un prêt à l’aide de techniques d’apprentissage automatique

DOI:

10.3791/68832

September 23rd, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude développe un modèle d’ensemble d’empilement intégrant XGBoost, CatBoost (Gradient Boosting Model), LightGBM (Efficient Gradient Boosting Model), AdaBoost et Extra Trees pour prédire les approbations de prêts à l’aide des données Kaggle. Avec une précision de 98 %, il identifie les principaux prédicteurs tels que le revenu et la cote de crédit, favorisant ainsi des décisions justes et efficaces en matière d’approbation et/ou de rejet de prêt.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les innovations en matière de prêts numériques et de technologie financière ont bouleversé les systèmes bancaires établis, modifiant l’inclusion financière et la disponibilité du crédit dans les pays du monde entier. Cette étude examine comment les plateformes de prêt entre pairs (P2P) et numériques évoluent, en mettant l’accent sur la façon dont des technologies telles que l’intelligence artificielle et l’apprentissage automatique modifient la façon dont les prêts sont approuvés. Une étude approfondie de la littérature met en évidence les opportunités et les problèmes de l’écosystème des prêts numériques, tels que l’évaluation des risques algorithmiques, la confiance des clients, l’exclusion financière et les failles réglementaires. Cet article suggère une approche solide d’apprentissage automatique qui utilise un modèle d’ensemble d’empilement pour prévoir avec précision les approbations de prêts afin de résoudre ces problèmes. Les données ont été prétraitées à l’aide du partitionnement d’essai, de l’analyse exploratoire et de l’encodage des étiquettes à l’aide d’un ensemble de données Kaggle accessible au public qui comprenait les données démographiques des candidats, les caractéristiques financières et les antécédents de crédit. Avec XGBoost servant de méta-apprenant, l’ensemble intègre les classificateurs Gradient Boosting Model, Efficient Gradient Boosting, AdaBoost et Extra Trees en tant qu’apprenants de base. Avec une précision de 98 %, le modèle a été évalué à l’aide de mesures telles que l’exactitude, la précision, le rappel, le score F1 et les mesures d’erreur (MAE - Erreur absolue moyenne, MSE - Erreur quadratique moyenne et RMSE - Erreur quadratique moyenne). Selon les études de corrélation, des facteurs tels que les actifs, les revenus et les scores CIBIL ont un impact significatif sur l’approbation des prêts. Surpassant les méthodes conventionnelles, le modèle a montré un équilibre et une généralisation entre les deux classes. L’utilité de ces modèles pour les déterminations de crédit automatisées et fondées sur les données est soulignée dans la conclusion de l’article.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dans la dernière phase de la transformation technologique du secteur bancaire, de nouveaux fournisseurs de services financiers perturbateurs venus de l’extérieur du système bancaire établi sont entrés sur le marché1. Les grandes entreprises technologiques (grandes entreprises technologiques qui se concentrent principalement sur les prêts directs ou auprès d’institutions financières) et les FinTech (technologies financières, y compris des modèles tels que les prêts P2P et les alternatives de crédit en ligne aux banques traditionnelles) font des percées substantielles dans le secteur financier, posant un défi aux banques traditionnelles malgré les efforts des banques pour s’adapter au paysage numérique2. Cette évolution rapide signale un changement dans l’écosystème financier, où les acteurs non traditionnels remodèlent de plus en plus la façon dont les services financiers sont accessibles et fournis3. L’émergence du prêt numérique a une corrélation négative avec le crédit bancaire, ce qui suggère qu’à mesure que de nouveaux prêteurs entrent sur le marché, la banque traditionnelle pourrait céder la place au crédit numérique alternatif4. Cette transition a été catalysée par la crise financière mondiale de 2008, qui a considérablement réduit la confiance des clients dans les services financiers et a contribué à l’expansion des technologies financières ou des entreprises Fintech5. Fintech est le terme désignant la combinaison de la technologie et de la finance, qui fait référence à l’application de la technologie pour fournir des solutions financières6. Au fur et à mesure que la Fintech mûrissait, l’une de ses applications les plus transformatrices a été observée dans l’essor des prêts P2P, également appelés services de prêt en ligne7. La principale innovation du prêt P2P est la mise en relation directe des prêteurs et des emprunteurs. Les emprunteurs soumettent des demandes de petits prêts non garantis, et les plateformes de prêt sont utilisées par plusieurs investisseurs pour évaluer et financer les demandes de prêt8. Le prêt P2P fonctionne de la même manière qu’une banque, mais il utilise Internet et une technologie de pointe pour permettre les prêts en ligne et les arrangements de dette 9. Le succès et l’évolutivité de ce modèle sont devenus évidents avec le lancement de ZOPA.com, la première plateforme P2P de l’histoire, qui a fait ses débuts au Royaume-Uni en 2005. Depuis, les prêts en ligne ont connu une croissance considérable, atteignant plus de 100 milliards de dollars en 2015, et devraient atteindre plus de 1 billion de dollars en 202510. Les prêts numériques, en particulier dans les économies émergentes, ont encore évolué avec l’intégration de la technologie financière11. L’intégration de la fintech dans les prêts numériques renforce l’inclusion financière, en particulier dans les marchés émergents. Les paiements mobiles et les solutions blockchain permettent les transactions P2P et les micro-prêts, réduisant ainsi les obstacles aux services financiers12. Ce changement de paradigme est motivé par l’intégration de technologies telles que la blockchain, l’intelligence artificielle (IA), l’apprentissage automatique et les systèmes de paiement numérique pour créer un environnement financier plus inclusif, efficace et centré sur le client13. Les plateformes de prêt numériques utilisent la technologie pour accélérer les demandes, économiser des dépenses et améliorer l’évaluation du risque de crédit, ce qui permet aux petites entreprises et aux particuliers de recevoir du financement plus rapidement14. Ils utilisent le big data, la blockchain, l’IA et l’apprentissage automatique pour améliorer l’évaluation des emprunteurs, réduire les coûts et promouvoir l’inclusion financière15. L’apprentissage automatique, en particulier, a révolutionné la gestion des risques en exploitant des sources de données alternatives16. Elle surpasse les approches traditionnelles d’évaluation du crédit en exploitant des données non traditionnelles, en améliorant les notations des emprunteurs et en prévoyant les développements économiques17. Cette méthode réduit le risque de défaut en augmentant la précision des évaluations des emprunteurs et en aidant à prédire les changements dans l’économie18. L’un des effets les plus importants du prêt numérique est sa capacité à résoudre les difficultés de l’inclusion financière, en particulier dans les économies émergentes et les zones marginalisées19.

Afin de prévoir l’acceptation des prêts avec une grande précision à l’aide d’un ensemble de données Kaggle structurées, cet article propose un nouveau modèle d’ensemble d’empilement qui combine le modèle Gradient Boosting, le modèle Efficient Gradient Boosting, l’AdaBoost, les Extra Trees et le XGBoost. Pour améliorer l’adaptabilité prédictive et la généralisation, cette méthode combine plusieurs apprenants avancés avec XGBoost comme méta-classificateur, contrairement aux recherches antérieures qui utilisent fréquemment des modèles uniques ou des classificateurs conventionnels. Le modèle a obtenu de bons résultats dans les catégories de prêts acceptés et rejetés, avec un taux de précision impressionnant de 98 %. Ce développement méthodologique offre un moyen pratique et extensible d’automatiser les décisions d’approbation de prêt dans les contextes de prêt numérique, en particulier dans les écosystèmes financiers en développement.

L’objectif de cette recherche est de créer un modèle d’ensemble d’empilement solide pour les prêts numériques qui prédit avec précision l’acceptation des prêts en combinant le modèle Gradient Boosting, le modèle Efficient Gradient Boosting, AdaBoost, Extra Trees et XGBoost. De plus, il cherche à examiner comment des variables démographiques et financières importantes (revenu, valeur des actifs et score limité CIBIL-Credit Information Bureau (Inde)) affectent les choix de prêts, à évaluer la performance du modèle d’ensemble par rapport à des modèles plus conventionnels utilisant des mesures de classification et d’erreur, et à souligner comment les approches d’ensemble peuvent augmenter l’efficacité, la généralisation et l’équité. L’objectif principal est d’analyser statistiquement comment les caractéristiques du demandeur influencent l’approbation des prêts et d’évaluer les performances des algorithmes d’apprentissage d’ensemble.

Le P2P et les prêts numériques continuent de transformer le paysage financier à l’échelle mondiale, présentant à la fois des opportunités et des défis.

Les prêts numériques transforment rapidement le paysage financier mondial, offrant une alternative à la banque traditionnelle20. Cette perspective mondiale souligne comment les contextes régionaux façonnent de manière unique la maturité des prêts numériques. Les prêts numériques se développent mais restent technologiquement immatures, tandis que l’automatisation et le scoring prédictif apportent de l’efficacité, et que les plateformes dépendent encore fortement des systèmes tiers pour la vérification des antécédents, ce qui limite la robustesse21. Malgré son expansion rapide, l’exclusion financière reste un problème majeur à l’échelle mondiale, avec environ 44 % des adultes dans les pays en développement n’ayant pas accès aux services financiers formels, nécessitant une réforme urgente, de meilleures infrastructures et des initiatives d’alphabétisation numérique. De telles limites apparaissent également dans d’autres points forts convergents du secteur, les défis permanents dans le traitement des données et l’intégration des systèmes22. À mesure que l’intégration numérique s’approfondit, les vulnérabilités de sécurité dans l’espace Fintech s’intensifient. Pour y remédier, un cadre axé sur la sécurité a été proposé afin de protéger les transactions numériques23. Des évolutions similaires sont observées dans d’autres marchés émergents. Au Kenya, si l’argent mobile et les applications de prêt numérique ont amélioré l’accès aux services financiers, la confidentialité des données reste une préoccupation persistante et les réglementations récentes ont un impact limité, ce qui suggère que des mécanismes d’application plus solides, des audits formels et des directives de développement claires sont nécessaires24. Cela reflète une tendance plus large selon laquelle les cadres réglementaires sont souvent à la traîne par rapport à l’innovation fintech. Le paysage réglementaire de la fintech est différent de celui de la banque traditionnelle. Par exemple, à moins que les prêts ne soient à haut risque, les forces de l’ordre ont moins d’effet sur les taux d’intérêt dans la fintech25. En particulier, il est fortement nécessaire d’améliorer la supervision, l’utilisation de l’analyse des données et les mises à jour réglementaires pour freiner la croissance illégale des fintechs et les atteintes à la vie privée26. Au-delà de la réglementation, le succès des prêts numériques dépend également de la confiance, de sorte que la confiance joue un rôle essentiel dans les décisions de prêt. La confiance dans les brouettes est plus influente que dans les intermédiaires27.

Une évolution parallèle est visible dans l’écosystème de prêt numérique de l’Inde28. L’activité de prêt numérique se développe rapidement, en raison des progrès de la fintech, des mesures réglementaires utiles mises en œuvre par la Reserve Bank of India (RBI) et d’une augmentation de la confiance des consommateurs suite à l’épidémie de COVID-1929. Cependant, l’innovation s’accompagne de risques. Bien que les applications ou les plateformes de prêt numérique sans licence améliorent l’accès, elles présentent de graves risques pour les consommateurs, tels que le harcèlement, les taux d’intérêt élevés et l’utilisation abusive des données en raison de la faiblesse de la réglementation. Il est donc essentiel de renforcer la protection et la responsabilisation des consommateurs pour promouvoir l’inclusion financière responsable30. Les dangers de défaut de paiement des emprunteurs et de demandes frauduleuses sont considérables pour les prêts numériques ; De bonnes mesures de protection des consommateurs protègent non seulement les consommateurs, mais influencent également positivement les performances financières, car la sécurité et la transparence des données améliorent les indicateurs de rentabilité tels que le rendement des actifs (ROA) et le rendement des capitaux propres (ROE)31. À l’échelle mondiale, l’accent est mis sur l’amélioration des opérations, notamment sur l’amélioration des systèmes d’octroi de prêts, l’encouragement de l’utilisation de la technologie mobile et l’élaboration de stratégies claires pour répondre aux normes réglementaires et aux attentes des consommateurs32. Pour faire face à ces risques, l’analyse avancée et l’IA sont de plus en plus utilisées pour prédire les prêteurs à haut risque, la détection des valeurs aberrantes à l’aide d’indicateurs tels que les prêts échoués, la durée de remboursement et la notation de crédit s’est avérée efficace33. En utilisant le modèle socio-technique comme guide, nous avons découvert que les risques proviennent à la fois des parties prenantes et du manque d’interdépendances entre la conception de la plateforme et les composants organisationnels34. L’adoption de modèles dynamiques comme UTAUT2 domine pour expliquer l’adoption par les utilisateurs, la confiance émergeant comme un prédicteur clé de l’intention d’emprunt35. Des algorithmes de détection des fraudes basés sur l’apprentissage automatique, tels que les modèles Random Forest et SVM, sont également utilisés36. Selon les résultats de l’étude, les modèles d’apprentissage automatique peuvent évaluer de manière adéquate les informations de crédit personnelles et déterminer la probabilité de défaut de paiement d’un prêt. Le réseau neuronal profond a obtenu les meilleurs résultats (précision : 0,94)37. L’étude, qui a utilisé Naïve Bayes avec une précision de 94 %, a révélé que des caractéristiques telles que le taux d’intérêt, le temps de remboursement, la description, la cote de crédit, l’historique de prêt, le sexe et la cote de crédit ont un impact substantiel sur la réussite du prêt38. Pendant ce temps, les probabilités de risques de remboursement anticipé et de défaut existent, les événements importants qui entraînent la résiliation du prêt et la perte de profit pour les créanciers ont été prédits à l’aide d’une régression logistique multivariée, et la précision globale du modèle était de 76,63 %39. Selon l’étude, les revenus des clubs de prêt peuvent être augmentés avec une grande précision de 68 % en utilisant un modèle efficace de renforcement du gradient pour prévoir le risque de défaut sur les plateformes de prêt numériques40. Parallèlement, des modèles d’IA plus sophistiqués évoluent, tels que l’apprentissage multivue profond, qui combinent diverses variables (telles que l’utilisation des applications et les modèles comportementaux) et fonctionnent mieux que les techniques conventionnelles, en particulier dans les situations où les données historiques sont limitées41. Des études menées en Chine confirment que l’amélioration des prévisions de défaut et de l’inclusion financière, avec des modèles tels que le modèle Gradient Boosting et LGBM, surpasse les évaluations traditionnelles basées sur le crédit42, la modélisation dynamique du système permet également de simuler les fluctuations des taux d’intérêt sur les plateformes P2P, offrant un aperçu du comportement des investisseurs emprunteurs dans diverses conditions43. Il a été démontré que le modèle efficace de boosting de gradient améliore la prédiction par défaut et la rentabilité de la plateforme40, tandis que les réseaux neuronaux profonds surpassent également les modèles traditionnels lorsqu’ils sont correctement entraînés37, et stabiliser les marchés numériques grâce à une meilleure gestion des risques44Pour assurer la durabilité, les technologies réglementaires gagnent du terrain, telles que l’automatisation des processus robotiques, qui aident les institutions financières à aligner les exigences réglementaires sur les plans d’affaires, améliorant ainsi la conformité et l’efficacité opérationnelle45. Tableau 1 Résume les principales études qui explorent l’application de l’apprentissage automatique dans les processus numériques de prêt et d’approbation de prêt.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Collecte de données

Cette étude a utilisé l’ensemble de données de prédiction de l’approbation des prêts disponible sur Kaggle. L’ensemble de données a été extrait en février 2025 et se compose de 4269 enregistrements visant à évaluer les données sur les prêts et à prévoir les résultats de l’approbation des prêts. Il comprend 12 colonnes contenant des informations détaillées sur les profils démographiques des candidats, tels que le statut d’emploi, les personnes à charge, les travailleurs indépendants, le montant du prêt, la durée du prêt, les scores CIBIL, les antécédents financiers et les attributs spécifiques au prêt. L’ensemble de données a été importé à l’aide de la bibliothèque Pandas et inspecté visuellement à l’aide de df.head () pour comprendre sa structure et sa qualité.

Prétraitement des données

Au cours de la phase de prétraitement des données, la première étape a consisté à supprimer la colonne d’identification (loan_id) en raison de son manque de valeur prédictive et de son potentiel d’introduction de bruit dans le modèle. La deuxième étape impliquait l’encodage des étiquettes, où des variables catégorielles telles que l’éducation, les travailleurs autonomes et les loan_status étaient converties en représentations numériques. Cette transformation a été effectuée à l’aide de l’encodeur d’étiquettes du module sklearn.preprocessing. Plus précisément, le niveau de scolarité a été codé comme 0 pour les diplômés et 1 pour les non-diplômés ; self_employed comme 0 pour Non et 1 pour Oui, et loan_status, la variable cible, comme 0 pour Non approuvé et 1 pour Approuvé. Ces conversions étaient nécessaires pour assurer la compatibilité avec les modèles d’apprentissage automatique, qui nécessitent des entrées numériques, en particulier pour les applications de prêt numérique. Les caractéristiques ont été séparées de la variable cible à l’aide de X=df.drop (["loan_status"], axis=1) et y=df ["loan_status]. Cette configuration a fourni une base complète pour examiner les facteurs influençant les décisions d’approbation de prêt à l’aide des enregistrements de prêts historiques pour entraîner plusieurs modèles d’apprentissage automatique d’ensemble. Ces modèles étaient destinés à améliorer la précision et la robustesse globales en combinant les forces prédictives de plusieurs classificateurs.

L’ensemble de données traité a ensuite été divisé en sous-ensembles d’entraînement et de test à l’aide de la fonction train_test_split de sklearn.model_selection, avec 80 % des données utilisées pour l’entraînement et 20 % réservées pour les tests. Cela a permis de s’assurer que le modèle était entraîné sur une portion suffisamment importante des données tout en conservant un échantillon représentatif pour l’évaluation des performances. Une fois l’ensemble de données nettoyé, structuré et exploré statistiquement, les bases ont été jetées pour la mise en œuvre d’un cadre d’apprentissage automatique robuste visant à améliorer la précision prédictive dans la classification des approbations de prêts. Le développement du modèle a été réalisé à l’aide de quatre algorithmes d’apprentissage automatique basés sur des ensembles : Gradient Boosting Model, AdaBoost, Efficient Gradient Boosting Model et Extra Trees Classifier. Ceux-ci ont été sélectionnés pour leurs performances éprouvées dans les tâches de classification impliquant des données tabulaires structurées. Le classificateur de modèle Gradient Boosting, implémenté à partir de la bibliothèque Gradient Boosting Model, a été instancié avec les paramètres par défaut (itérations = 1000, taux d’apprentissage = 0,1, profondeur = 6, verbose = False). Il a été formé à l’aide. ajuster (x_train, y_train) et évalué avec .predict (X_test). Bien que le modèle de boosting de gradient gère automatiquement l’encodage des données catégorielles, cette fonctionnalité n’a pas été utilisée car les données avaient déjà été encodées par étiquette. Le classificateur AdaBoost (Adaptive Boosting, qui améliore les apprenants faibles) a été implémenté à l’aide de sklearn-ensemble. AdaBoost Classifier a été configuré avec n_estimators=100 et learning_rate=1.0, en utilisant les souches de décision comme estimateur de base par défaut. Il a été entraîné et évalué de la même manière, contribuant à la robustesse grâce à la pondération itérative des instances mal classifiées. L’Efficient Gradient Boosting, implémenté via la bibliothèque Efficient Gradient Boosting Model (LGBMClassifier), a été configuré avec n_estimators=100, learning_rate=0,1 et max_depth=-1 (profondeur d’arbre sans restriction). Ce modèle, connu pour sa rapidité et son efficacité, excelle particulièrement sur les grands ensembles de données avec des caractéristiques de grande dimension en utilisant des arbres de décision optimisés favorisant le gradient.

Enfin, le classificateur ExtraTrees de sklearn.ensemble a été utilisé avec n_estimators=100 et criterion="gini » comme stratégie de fractionnement. Contrairement à la forêt aléatoire, les arbres supplémentaires introduisent davantage d’aléatoire en sélectionnant des points de coupe au hasard, ce qui permet de réduire la variance du modèle et d’améliorer la généralisation. L’ensemble a été réalisé à l’aide du classificateur d’empilement de scikit-learn, qui améliore la généralisation en agrégeant les prédictions des apprenants de base. Chaque modèle a été évalué à l’aide de mesures de classification standard, notamment l’exactitude, la précision, le score F1, l’analyse des erreurs et la matrice de confusion. Ces métriques ont été calculées à l’aide des fonctions du module sklearn.metrics afin d’assurer une comparaison standardisée des performances entre tous les modèles.

Le modèle le plus performant (basé sur la précision et le score F1) a été enregistré pour le déploiement à l’aide de la bibliothèque Python. dump(model, « best_model.pkl »), garantissant que le modèle formé peut être réutilisé sans qu’il soit nécessaire de le réentraîner. Pour simuler une application réelle, un exemple de tableau d’entrée contenant 11 fonctionnalités a été créé à l’aide de NumPy et transmis à la fonction .predict() du modèle. Par exemple, le vecteur d’entrée [[0, 1, 1,4100000, 12200000, 8, 417, 2700000, 2200000, 8800000, 3300000]] a renvoyé une prédiction de 1, indiquant l’approbation du prêt. Toutes les expériences ont été menées dans un environnement Python 3.10 à l’aide de Google Notebook sur Kaggle. Le développement et l’évaluation du modèle ont été réalisés à l’aide des bibliothèques scikit-learn (v1.3), Gradient Boosting Model et Efficient Gradient Boosting Model. Tous les hyperparamètres ont été documentés explicitement, et les valeurs par défaut ont été clairement indiquées, le cas échéant. Les procédures d’encodage ont suivi l’approche décrite par Pedregosa et ont été implémentées dans scikit-learn46. Cette méthodologie complète et transparente garantit que le protocole expérimental est entièrement reproductible et respecte des normes académiques rigoureuses en matière de recherche sur l’apprentissage automatique.

La structure de la méthodologie suggérée, qui englobe la phase de préparation des données, la section des caractéristiques, l’entraînement et l’évaluation du modèle, est illustrée à la figure 1.

Cette recherche présente un cadre d’apprentissage d’ensemble d’empilement qui rassemble les capacités de quatre classificateurs puissants : Gradient Boosting Model, AdaBoost, Efficient Gradient Boosting Model et Extra Trees pour prédire les décisions d’approbation de prêt en fonction des dossiers financiers historiques. En combinant à la fois des stratégies de boosting et d’ensachage au sein d’une architecture de modèle empilé46. L’approche permet de surmonter efficacement les lacunes individuelles de ces modèles, telles que le biais et la variance, ce qui permet d’améliorer la précision des prédictions et la généralisation du modèle. Le modèle de boosting de gradient est efficace avec des variables catégorielles, il est conçu pour gérer des caractéristiques catégorielles à haute cordialité et effectue en interne l’encodage cible à l’aide d’un boosting ordonné47. Cela permet d’éviter le surajustement en veillant à ce que seules les données passées soient utilisées dans le calcul des statistiques. Dans la formule

figure-protocol-1,

Chaque ht (x) représente un arbre de décision entraîné sur les résidus du modèle précédent, et nt désigne la contribution à l’apprentissage spécifique à l’étape. AdaBoost, ou Adaptive Boosting, ajuste le poids de chaque instance pendant l’entraînement et se concentre sur des points de données précédemment mal classifiés48. Dans la formule
figure-protocol-2

αt reflète les performances du t-ième apprenant faible ht(x), en mettant davantage l’accent sur des échantillons précédemment mal classés. Modèle efficace d’amplification du gradient Intègre l’échantillonnage unilatéral basé sur le gradient (GOSS) et un regroupement de fonctionnalités exclusives pour des performances plus rapides. Efficient Gradient Boosting offre une vitesse et des performances élevées sur les données à grande échelle49.

figure-protocol-3

ft(xi) représente le nouvel arbre de décision ajouté pour minimiser la perte l(•) tandis que Ω(ft) est un terme de régularisation . Contrairement aux algorithmes de boost, Extra Trees réduit la variance en ajoutant du caractère aléatoire dans les divisions d’arbre de décision50. Il s’appuie sur des principes de bagging mais injecte un caractère aléatoire supplémentaire lors de la division des nœuds dans sa règle de prédiction

figure-protocol-4

Calcule la moyenne des résultats de M arbres aléatoires entraînés indépendamment. Pour chaque fractionnement, Extra trees sélectionne des seuils aléatoires pour les entités et choisit les meilleures d’entre elles, réduisant ainsi la variance et offrant une grande diversité entre les arbres, ce qui améliore la généralisation. Ces modèles sont intégrés collectivement par le biais d’un classificateur d’empilement, qui apprend à combiner de manière optimale leurs résultats pour décider si un prêt doit être approuvé. Le cadre a été évalué à l’aide de mesures de classification communes et testé à l’aide d’échantillons d’entrée en direct, démontrant ainsi sa pertinence pratique dans les environnements de prêt numérique51. Ces modèles sont combinés collectivement à l’aide d’un classificateur d’empilement, qui apprend à combiner leurs sorties idéalement pour déterminer les résultats de l’acceptation des prêts. Les performances du modèle ont été évaluées à l’aide d’importantes mesures de classification telles que l’exactitude, la précision, le rappel, le score F1 et l’AUC-ROC, ainsi que d’une matrice de confusion, afin de déterminer sa capacité à réduire les erreurs de type I et de type II. Pour maintenir l’équilibre entre les classes, une répartition stratifiée 80:20 de l’entraînement et des tests a été utilisée, avec une validation croisée en 5 parties, garantissant la robustesse et réduisant la variabilité de l’échantillon. De plus, le modèle a été évalué sur des profils de demandeurs de prêts réalistes qui comprenaient des informations telles que les antécédents de crédit, le revenu, la situation d’emploi et le montant du prêt, ce qui a permis d’obtenir des jugements binaires et des cotes de probabilité. Ce test en deux phases démontre l’efficacité, l’équité et la praticité du modèle dans des contextes de prêt numérique en temps réel. La nouveauté de ce travail réside dans la conception d’ensemble hybride adaptée à la notation de crédit, ce qui en fait un modèle robuste, interprétable et reproductible pour les plateformes financières modernes52 .

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Analyse de corrélation des caractéristiques

La carte thermique de corrélation des caractéristiques (figure 2) a fourni des informations utiles sur les interrelations entre les différents attributs. De fortes corrélations positives ont été trouvées entre le revenu, le montant annuel du prêt et les variables liées aux actifs tels que la valeur des actifs de luxe et la...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le modèle d’ensemble d’empilement pour la prédiction de l’approbation des prêts fonctionne exceptionnellement bien sur diverses mesures d’évaluation, faisant preuve d’une grande précision et d’une grande fiabilité. La carte thermique des corrélations a révélé que les indicateurs financiers tels que le revenu annuel, le montant du prêt et la valeur des actifs sont fortement interdépendants, soulignant leur importance dans l’évolution des prêts, tandis que les scores CIBIL ont une forte co...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’auteur ne déclare aucun conflit d’intérêts lié à cette recherche.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette recherche a été financée par l’Université VIT-AP, Amaravati, Inde.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Kagglehttps://www.kaggle.com/
Pandashttps://pandas.pydata.org/
Bibliothèque de modèlesIBMhttps://www.ibm.com

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. European Systemic Risk Board. Reports of the Advisory Scientific Committee. , Elsevier. (2012).
  2. Vives, X. The impact of FinTech on banking. Eur Econ. 2, 97-105 (2017).
  3. Jacobides, M. G., Drexler, M., Rico, J. Rethinking the future of financial services: A structural and evolutionary perspective on regulation. J Financ. , https://papers.ssrn.com/sol3/papers.cfm?abstract_id=3078138 (2014).
  4. Cuadros-Solas, P. J., Cubillas, E., Salvador, C. Does alternative digital lending affect bank performance? Cross-country and bank-level evidence. Int Rev Financ Anal. 90, 102873(2023).
  5. Murinde, V., Rizopoulos, E., Zachariadis, M. The impact of the FinTech revolution on the future of banking: Opportunities and risks. Int Rev Financ Anal. 81, 102103(2022).
  6. Hurani, J., Abdel-haq, M. K., Camdzic, E. FinTech Implementation Challenges in the Palestinian Banking Sector. Int J Financial Stud. 12 (4), 122(2024).
  7. Sumit, A., Jian, Z. FinTech Lending and Payment Innovation: A Review. Asia-Pacific J Financ Stud. 1 (1), 11-15 (2020).
  8. Balyuk, T. FinTech Lending and Bank Credit Access for Consumers. Manage Sci. 69 (1), 555-575 (2023).
  9. Novaliando, M. A., Purwokerto, U. M. Legal Protection of Consumer Personal Data in the Case of Fintech Peer to Peer Lending. Proc Series Soc Sci Humanities. 14, 118-124 (2023).
  10. Huang, R. H. Online P2P Lending and Regulatory Responses in China Opportunities and Challenges. Eur Bus Organ Law Rev. 19 (1), 63-92 (2018).
  11. Puschmann, T. Fintech. Bus Inf Syst Eng. 59 (1), 69-76 (2017).
  12. Ebirim, G. U., Odonkor, B. Enhancing Global Economic Inclusion With Fintech Innovations and Accessibility. Financ Account Res J. 6 (4), 648-673 (2024).
  13. Sanyaolu, T. O., Adeleke, A. G., Azubuko, A. F., Osundare, O. F. Exploring fintech innovations and their potential to transform the future of financial services and banking. Int J Sch Res Sci Technol. 5 (1), 054-072 (2024).
  14. Omowole, B. M., Urefe, O., Mokogwu, C., Ewim, S. E. Integrating fintech and innovation in microfinance Transforming credit accessibility for small businesses Integrating fintech and innovation in microfinance Transforming credit accessibility for small businesses. Eur J Innov Manag. 27 (9), 562-581 (2024).
  15. Umavezi, J. U. Innovations in Lending-Focused FinTech Leveraging AI to Transform Credit Accessibility and Risk Assessment. IJCATR. 14 (1), 46-61 (2025).
  16. Leo, M., Sharma, S., Maddulety, K. Machine learning in banking risk management: A literature review. Risks. 7 (1), 2319-8656 (2019).
  17. Bazarbash, M. FinTech in Financial Inclusion: Machine Learning Applications in Assessing Credit Risk. IMF Work Pap. 2019 (109), 1(2019).
  18. Berg, T., Burg, V., Gombovi, A., Puri, M. On the Rise of the Fintech. Rev Financ Studies. 33 (7), 2845-2897 (2020).
  19. Gomber, P., Kauffman, R. J., Parker, C., Weber, B. W. On the Fintech Revolution Interpreting the Forces of Innovation , Disruption and Transformation in Financial Services. J Manag Informat Syst. 35 (1), 220-265 (2018).
  20. Anakpo, G., Xhate, Z., Mishi, S. The Policies, Practices, and Challenges of Digital Financial Inclusion for Sustainable Development The Case of the Developing Economy. FinTech. 2 (2), 327-343 (2023).
  21. Digital Lending High Level System Architecture in Indonesia. Sarungu, C. M. 2020 1st Int Conf Informat Technol Adv Mech Elect Eng, , 159-164 (2020).
  22. Allioui, H., Mourdi, Y. Exploring the Full Potentials of IoT for Better Financial Growth and Stability: A Comprehensive Survey. Sensors. 23 (19), 8015(2023).
  23. Fintech future business & Cyber vulnerabilities and challenges. Venkata, T., Rao, V. 2023 IEEE 8th Int. Conf. Softw. Eng. Comput. Syst, , 1-4 (2023).
  24. Flores, A. M., He, M., Wu, W., Munyaka, I. N. S. A License to Prey Investigating the Impact of Digital Loan App Regulations on Permission Requests and Privacy Policies in the Kenyan Market. 2024 IEEE Int Symp Technol Soc. , 1-5 (2024).
  25. Peng, H., Ji, J., Sun, H., Xu, H. Legal enforcement and fintech credit: International evidence. J Empir Financ. 72, 214-231 (2023).
  26. Suryono, R. R., Budi, I., Purwandari, B. Detection of fintech P2P lending issues in Indonesia. Heliyon. 7 (4), e06782(2021).
  27. Chen, D., Lai, F., Lin, Z. A trust model for online peer-to-peer lending a lender ' s perspective. Info Techno Manag. 15 (4), 239-254 (2014).
  28. Migozzi, J., Urban, M., Wójcik, D. You should do what India does': FinTech ecosystems in India reshaping the geography of finance. Geoforum. 151, 2023(2024).
  29. Asamani, A., Majumdar, J. An Empirical Study of Digital Lending in India and the Variables Associated with its Adoption. Administration Review. 21 (3), 1-13 (2024).
  30. Mark, T. Digital Lending in Emerging Economies: the Nexus Between Financial Innovation and Consumer Protection. Am. J. Financ. Account. 7 (1), 145-168 (2023).
  31. Imanuddin, I., Dewi Anggraeni, R. R., Fridayani, S. Construction of Consumer Protection Against Illegal Online Loan Transactions As a Means of IUS Constituendum in Indonesia. J IUS Kaji Huk dan Keadilan. 11 (3), 539-556 (2023).
  32. Katsamakas, E., Sanchez-Cartas, J. M. A computational model of the effects of borrower default on the stability of P2P lending platforms. Eurasian Econ Rev. 14 (3), 597-618 (2024).
  33. Li, H., Zhang, Y., Zhang, N., Jia, H. Detecting the Abnormal Lenders from P2P Lending Data. Procedia Comput Sci. 91, 357-361 (2016).
  34. Bao, T., Ding, Y., Gopal, R., Möhlmann, M. Throwing Good Money After Bad: Risk Mitigation Strategies in the P2P Lending Platforms. Inf Syst Front. 26 (4), 1453-1473 (2024).
  35. Mudjahidin, A. A., Hidayat,, Aristio, A. P. Conceptual model of use behavior for peer-to-peer lending in Indonesia. Procedia Comput Sci. 197 (2021), 215-222 (2021).
  36. Identifying Features for Detecting Fraudulent Loan Requests on P2P Platforms. Xu, J., Chen, D., Chau, M. 2016 IEEE Conf Intell Secur Informatics, , 79-84 (2016).
  37. Research on Personal Loan Default Assessment Based on Machine Learning. Liu, G. ITM Web of Conferences, 01012, 1-14 (2025).
  38. An application of Naive Bayes classification for credit scoring in e-lending platform. Vedala, R., Kumar, B. R. Proc 2012 Int Conf Data Sci Eng. ICDSE 2012, , 81-84 (2012).
  39. Li, Z., Li, K., Yao, X., Wen, Q. Predicting Prepayment and Default Risks of Unsecured Consumer Loans in Online Lending. Emerg Mark Financ Trade. 55 (1), 118-132 (2019).
  40. Ko, P. C., Lin, H., Do, T., Huang, Y. F. P2P Lending Default Prediction Based on AI and Statistical Models. Entropy. 24 (6), 1-23 (2022).
  41. Loan Fraud Users Detection in Online Lending Leveraging Multiple Data Views. Zhao, S., et al. Proc 37th AAAI Conf Artif Intell AAAI 2023, 37, 5428-5436 (2023).
  42. Fu, G., Sun, M., Xu, Q. An Alternative Credit Scoring System in China's Consumer Lending Market: A System Based on Digital Footprint Data. SSRN Electron J. , 1-51 (2020).
  43. Pang, S., Deng, C., Chen, S. System Dynamics Models of Online Lending Platform Based on Vensim Simulation Technology and Analysis of Interest Rate Evolution Trend. Comput Intell Neurosci. 2022, 9776138(2022).
  44. Tu, Y., Yan, X., Wang, H. Game Theory Analysis of Chinese DC/EP Loan and Internet Loan Models in the Context of Regulatory Goals. Sustain. 15 (9), 1-15 (2023).
  45. Von Solms, J. Integrating Regulatory Technology ( RegTech ) into the digital transformation of a bank Treasury. J Bank Regul. 22 (2), 152-168 (2021).
  46. Barupal, D. K., Fiehn, O. Generating the blood exposome database using a comprehensive text mining and database fusion approach. Environ Health Perspect. 127 (9), 2825-2830 (2019).
  47. Wolpert, D. H. Stacked generalization. Neur Netw. 5 (2), 2941-2259 (1992).
  48. Prokhorenkova, L., Gusev, G., Vorobev, A., Dorogush, A. V., Gulin, A. Catboost: Unbiased boosting with categorical features. Adv Neural Inf Process Syst. , 6638-6648 (2018).
  49. Freund, Y., Schapire, R. E. A Decision-Theoretic Generalization of On-Line Learning and an Application to Boosting. J Comput Syst Sci. 55 (1), 119-139 (1997).
  50. LightGBM: An effective decision tree gradient boosting method to predict customer loyalty in the finance industry. Machado, M. R., Karray, S., De Sousa, I. T. 14th Int Conf Comput Sci Educ ICCSE, , 1111-1116 (2019).
  51. Geurts, P., Ernst, D., Wehenkel, L. Extremely randomized trees. Mach Learn. 63 (1), 3-42 (2006).
  52. Sagi, O., Rokach, L. Ensemble learning: A survey. Wiley Interdiscip Rev Data Min Knowl Discov. 8 (4), 1-18 (2018).
  53. Khandani, A. E., Kim, A. J., Lo, A. W. Consumer credit-risk models via machine-learning algorithms. J Bank Financ. 34 (11), 2767-2787 (2010).
  54. Chen, Y. From Statistical Interpretations to Explainable AI in Machine Learning Enhancing Decision-Making in the Lending Industry. , Doctor of Philosophy, The University of Edinburgh. (2024).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Stacking EnsembleLoan Approval PredictionMachine Learning TechniquesDigital LendingPeer To Peer LendingAlgorithmic Risk AssessmentGradient BoostingXGBoost ModelCredit ScoringFinancial Inclusion

Related Articles