基于梯度提升树(Gradient Boosting)的小额消费贷违约预测模型,核心目标是精准识别高风险用户,降低信贷坏账率,提升审批效率。
传统信贷审批依赖人工审核,存在效率低、主观性强、风险识别不准等问题。本项目通过数据驱动建模,实现自动化风险评估,为信贷审批提供客观决策依据。
公开数据集:Credit Risk Dataset(Kaggle公开数据集,包含用户基本信息、贷款信息、还款记录等特征)
- 数据处理:pandas、numpy
- 特征工程:pandas、seaborn(相关性分析)
- 建模工具:scikit-learn(逻辑回归、梯度提升树、Pipeline、模型评估)
- 可视化:matplotlib、seaborn
-
数据加载与清洗:01_数据加载与清洗.ipynb
- 加载原始数据,处理异常值(如年龄>80)、缺失值(中位数填充)
- 输出清洗后的数据集:clean_data.csv
-
特征工程:02_特征工程.ipynb
- 构建核心特征(还款压力比、贷款等级风险分等)
- 相关性分析与低价值特征剔除
- 输出特征工程后的数据集:featured_data.csv
-
模型训练与评估:03_模型训练与评估.ipynb
- 数据集拆分(训练集:测试集=8:2)
- 模型对比:逻辑回归 vs 梯度提升树
- 最优模型:梯度提升树(AUC=0.9285)
- 模型评估:AUC、违约召回率、准确率等核心指标
- 保存最优模型:models/gradient_boosting_model.pkl
| 指标 | 结果 | 业务价值解读 |
|---|---|---|
| AUC | 0.9285 | 风险区分能力超行业优秀水平 |
| 违约召回率 | 71% | 71%的违约用户可被提前拦截 |
| 准确率 | 92.7% | 误判率低,优质用户通过率高 |
- 克隆仓库:
git clone https://github.com/你的用户名/credit-risk-prediction.git