本研究开发了一种堆叠集成模型,结合XGBoost、CatBoost(梯度提升模型)、LightGBM(高效梯度提升模型)、AdaBoost和Extra Trees,利用Kaggle数据预测贷款审批结果。该模型准确率达到98%,识别出收入和信用评分等关键预测因子,有助于实现公平且高效的贷款批准或拒绝决策。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本研究开发了一种堆叠集成模型,结合XGBoost、CatBoost(梯度提升模型)、LightGBM(高效梯度提升模型)、AdaBoost和Extra Trees,利用Kaggle数据预测贷款审批结果。该模型准确率达到98%,识别出收入和信用评分等关键预测因子,有助于实现公平且高效的贷款批准或拒绝决策。
数字借贷与金融科技的创新颠覆了传统的银行体系,改变了全球各国的金融包容性与信贷可获得性。本研究探讨了点对点(P2P)及数字借贷平台的发展,重点分析人工智能与机器学习等技术如何改变贷款审批方式。通过对现有文献的系统性综述,揭示了数字借贷生态系统中的机遇与挑战,包括算法风险评估、客户信任、金融排斥以及监管漏洞等问题。为应对上述问题,本文提出一种基于堆叠集成模型的强效机器学习方法,以精确预测贷款审批结果。研究采用公开的Kaggle数据集,包含申请人的 demographics(人口统计特征)、财务特征及信用历史,通过训练集-测试集划分、探索性分析及标签编码对数据进行预处理。该集成模型以XGBoost作为元学习器,基础学习器包括梯度提升模型(Gradient Boosting Model)、高效梯度提升(Efficient Gradient Boosting)、AdaBoost以及极端随机树(Extra Trees)分类器。模型评估指标包括准确率、精确率、召回率、F1分数以及误差指标(MAE-平均绝对误差、MSE-均方误差、RMSE-均方根误差),结果显示模型准确率达到98%。相关性分析表明,资产、收入及CIBIL评分等因素对贷款审批具有显著影响。该模型在两个类别上均表现出优于传统方法的平衡性与泛化能力。论文最后强调了此类模型在实现自动化、数据驱动型信贷决策中的实际应用价值。
在银行业的最新一轮技术转型中,来自传统银行体系之外的颠覆性新型金融服务提供商已进入市场1。大型科技公司(BigTech,主要专注于直接放贷或与金融机构合作放贷)和金融科技公司(FinTech,即金融技术,包括P2P借贷和在线信贷等替代传统银行的模式)正在大举进军金融领域,尽管银行已努力适应数字化环境,但仍对其构成挑战2。这一快速演变标志着金融生态系统的转变,非传统参与者正日益重塑金融服务的获取与提供方式3。数字借贷的兴起与银行信贷呈负相关关系,表明随着新贷款方进入市场,传统银行信贷可能逐渐被替代性数字信贷所取代4。2008年全球金融危机(GFC)进一步加速了这一转变,该危机严重削弱了客户对金融服务的信任,并推动了金融科技(Fintech)企业的扩张5。金融科技是指技术与金融的结合,即利用技术提供金融解决方案6。随着金融科技的成熟,其最具变革性的应用之一便是P2P借贷(又称在线借贷服务)的兴起7。P2P借贷的主要创新在于直接匹配出借人与借款人。借款人提交小额无担保贷款申请,多个投资者通过借贷平台评估并资助贷款请求8。P2P借贷的功能类似于银行,但通过互联网....
访问受限。请登录或开始试用以查看此内容。
数据收集
本研究使用了Kaggle平台上提供的贷款审批预测数据集。该数据集于2025年2月提取,包含4269条记录,旨在评估贷款数据并预测贷款审批结果。数据集共有12列,涵盖了申请人人口统计特征的详细信息,包括就业状况、受抚养人数、是否为自雇人士、贷款金额、贷款期限、CIBIL信用评分、财务背景以及与贷款相关的特定属性。通过Pandas库导入数据集后,使用df.head()函数进行可视化检查,以了解其结构和数据质量。
数据预处理
在数据预处理阶段,第一步是移除标识符列(loan_id),因为该列不具备预测价值,且可能为模型引入噪声。第二步是进行标签编码,将教育程度(education)、是否自雇(self-employed)和贷款状态(loan_status)等分类变量转换为数值形式。该转换通过 sklearn.preprocessing 模块中的 Label Encoder 实现。具体编码方式为:教育程度中“Graduate”编码为 0,“Not Graduate”编码为 1;是否自雇中“No”编码为 0,“Yes”编码为 1;贷款状态(目标变量)中“Not Approved”编码为 0,“Approved”编码为 1。这些转换对于确保与机器学习模型的兼容性至关重要,因为模型需要数值型输入,尤其是在数字信....
访问受限。请登录或开始试用以查看此内容。
特征相关性分析
特征相关性热图(图2)提供了有关不同属性之间相互关系的有用信息。收入、年度贷款金额与资产相关变量(如奢侈品资产价值和银行资产价值)之间存在较强的正相关性,表明申请人的财务状况在贷款评估中具有重要作用。有趣的是,CIBIL 评分与贷款状态之间存在显著的负相关(-0.77),说明信用评分较高的申请人获得贷款批准的可能性显著更高,这与典型的金融风险评估方法一致。
混淆矩阵评估
图3 展.......
访问受限。请登录或开始试用以查看此内容。
用于贷款审批预测的堆叠集成模型在各项评估指标上均表现出色,展现出极高的准确性和可靠性。相关性热图显示,年收入、贷款金额和资产价值等财务指标之间存在强烈关联,凸显了它们在贷款评估中的重要性;而CIBIL评分与贷款状态呈显著负相关,进一步强化了其在信用评估中的关键作用。该模型的混淆矩阵显示错误率较低,854个样本中准确识别出839个,仅出现15次误分类。分类指标显示整体准确率达到98%,对于获批和拒批两类样本,精确率、召回率和F-1分数均持续达到或超过0.98,表明不存在显著的类别不平衡或偏差。MAE、MSE和RMSE等误差矩阵指标均较低,说明模型具有良好的稳健性和预测准确性。可视化指标进一步强调了模型在两类样本上的均衡且一致的表现。该集成模型采用梯度提升模型、高效梯度提升模型、极端随机树(Extra Trees)和AdaBoost作为基学习器,XGBoost作为元学习器,性能优于以往方法。凭借其强大的泛化能力以及通过SHAP或LIME等工具实现的可解释性潜力,该模型为现实世界中的金融决策提供了切实有效的解决方案。
本研究通过提出一种用于数字借贷中贷款审批预测的强效机器学习框架,推动了.......
访问受限。请登录或开始试用以查看此内容。
作者声明本研究不存在利益冲突。
本研究由印度阿马拉瓦蒂的VIT-AP大学资助。
....访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Kaggle | https://www.kaggle.com/ | ||
| Pandas | https://pandas.pydata.org/ | ||
| 模型库 | IBM | https://www.ibm.com |
访问受限。请登录或开始试用以查看此内容。