Skip to content

Repository files navigation

基于后训练的 LLM 数学推理能力增强

项目简介

针对大语言模型在数学推理任务中存在多步推理不稳定、答案生成易偏差等问题,本项目基于 MS-Swift 框架,以 Qwen 系列模型为基座,系统复现并对比 SFT、LoRA-SFT、DPO 与 GRPO 等主流后训练方法,分析不同算法对数学推理能力的增强效果。

实验结果

在统一训练预算下,基于 GSM8K、MATH 等 Benchmark 对不同后训练方法进行评测,对比其在推理准确率、训练稳定性、参数效率和资源开销等方面的表现,分析不同策略之间的性能权衡关系。

Method GSM8K MATH-500 GAOKAO AIME25
Base Model 84.69 66.60 TBD 3.33
Full SFT TBD TBD TBD TBD
LoRA-SFT TBD TBD TBD TBD
DPO TBD TBD TBD TBD
PPO TBD TBD TBD TBD
GRPO TBD TBD TBD TBD
DAPO TBD TBD TBD TBD
Agent TBD TBD TBD TBD

技术方案

模型

后训练方法

  • Full SFT
  • LoRA-SFT
  • DPO
  • GRPO

训练框架

  • MS-Swift
  • Transformers
  • DeepSpeed
  • vLLM

评测数据集

  • GSM8K
  • MATH

实验发现

About

后训练提升数学推理能力

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages