Skip to content

Repository files navigation

信贷风险预测模型(Credit Risk Prediction)

基于梯度提升树(Gradient Boosting)的小额消费贷违约预测模型,核心目标是精准识别高风险用户,降低信贷坏账率,提升审批效率。

项目背景

传统信贷审批依赖人工审核,存在效率低、主观性强、风险识别不准等问题。本项目通过数据驱动建模,实现自动化风险评估,为信贷审批提供客观决策依据。

数据集来源

公开数据集:Credit Risk Dataset(Kaggle公开数据集,包含用户基本信息、贷款信息、还款记录等特征)

技术栈

  • 数据处理:pandas、numpy
  • 特征工程:pandas、seaborn(相关性分析)
  • 建模工具:scikit-learn(逻辑回归、梯度提升树、Pipeline、模型评估)
  • 可视化:matplotlib、seaborn

核心流程(模块化拆分)

  1. 数据加载与清洗:01_数据加载与清洗.ipynb

    • 加载原始数据,处理异常值(如年龄>80)、缺失值(中位数填充)
    • 输出清洗后的数据集:clean_data.csv
  2. 特征工程:02_特征工程.ipynb

    • 构建核心特征(还款压力比、贷款等级风险分等)
    • 相关性分析与低价值特征剔除
    • 输出特征工程后的数据集:featured_data.csv
  3. 模型训练与评估:03_模型训练与评估.ipynb

    • 数据集拆分(训练集:测试集=8:2)
    • 模型对比:逻辑回归 vs 梯度提升树
    • 最优模型:梯度提升树(AUC=0.9285)
    • 模型评估:AUC、违约召回率、准确率等核心指标
    • 保存最优模型:models/gradient_boosting_model.pkl

核心效果

指标 结果 业务价值解读
AUC 0.9285 风险区分能力超行业优秀水平
违约召回率 71% 71%的违约用户可被提前拦截
准确率 92.7% 误判率低,优质用户通过率高

快速复现

  1. 克隆仓库:
    git clone https://github.com/你的用户名/credit-risk-prediction.git

About

关于信贷违约风险预测,对公开原始数据集进行数据预处理,特征工程以及模型预测和评估的全流程实战项目

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages