Skip to content

PanzhangZP/LLM_RL

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

2 Commits
 
 
 
 
 
 
 
 
 
 

Repository files navigation

大语言模型与多模态大模型强化学习

从数学基础、经典强化学习,到 RLHF、RLVR、多模态推理与智能体训练的一套中文公开教材

本教材面向第一次系统学习强化学习的读者,也面向希望把零散的 LLM/MLLM 后训练知识整理成完整体系的工程师与研究者。全书采用“直觉 → 定义 → 可复核推导 → 小例子 → 算法 → 工程实现 → 失败模式 → 练习”的顺序,目标不是记住算法缩写,而是建立能够独立读论文、诊断训练和设计实验的能力。

资料调研、链接与新人可读性最后核对日期:2026-07-12

你最终会掌握什么

学完后,你应当能够:

  1. 从 MDP、Bellman 方程和占用度量推导价值方法与策略梯度;
  2. 解释 REINFORCE、Actor–Critic、GAE、TRPO、PPO 的假设、偏差—方差与适用边界;
  3. 把自回归语言模型严格写成 token 级或序列级决策过程;
  4. 从偏好概率模型推导奖励模型与 DPO,而不是只会调用训练器;
  5. 独立设计 PPO、RLOO、GRPO、RLVR、过程奖励与搜索/自博弈训练;
  6. 把同一套方法迁移到图像、视频、音频、GUI、工具调用和具身任务;
  7. 估算显存、吞吐、采样成本,理解训推不一致与同步/异步数据流;
  8. 识别奖励黑客、长度偏置、评测污染和不确定性误用;
  9. 建立可复现的训练—评测—安全门禁,并读懂新算法到底改了哪一项。

全书知识地图

数学工具
  └─ 概率、期望、KL、优化、重要性采样
      └─ 强化学习基础
          ├─ MDP / POMDP / Bellman / 占用度量
          ├─ DP / MC / TD / Q-learning
          └─ 策略梯度 / Actor–Critic / GAE / PPO
              └─ 语言模型后训练
                  ├─ LLM 作为策略与序列决策过程
                  ├─ 偏好数据 / 奖励模型 / RLHF-PPO
                  ├─ DPO 家族(离线直接对齐)
                  ├─ RLVR / RLOO / GRPO / 搜索 / 自博弈
                  └─ 多轮工具与智能体 RL
                      └─ 多模态与具身
                          ├─ 感知、grounding、幻觉与多模态奖励
                          ├─ 视觉推理 / 生成 / 视频 / 音频
                          └─ GUI、网页、机器人与长时程控制
                              └─ 系统、评测、安全与研究前沿

目录

导论

第一部分 强化学习地基

  1. 数学预备:概率、信息论、优化与重要性采样
  2. 从决策问题到 MDP 与 POMDP
  3. 价值方法:DP、MC、TD、SARSA 与 Q-learning
  4. 策略梯度、REINFORCE 与 Actor–Critic
  5. GAE、TRPO 与 PPO:稳定更新的来龙去脉

第二部分 大语言模型强化学习

  1. 把语言模型看成策略
  2. 偏好数据与奖励模型
  3. RLHF-PPO:目标、推导与完整训练环路
  4. 直接偏好对齐:DPO、IPO、KTO、ORPO 与 SimPO
  5. 可验证奖励强化学习:REINFORCE、RLOO、GRPO 与 RLVR
  6. 过程监督、信用分配、搜索与自博弈

第三部分 多模态大模型与智能体

  1. 多模态大模型基础:表示、融合与对齐
  2. 多模态反馈、奖励模型、grounding 与幻觉
  3. 多模态强化学习:感知、推理与生成
  4. 工具、GUI、网页与具身智能体 RL

第四部分 从算法到可靠系统

  1. 大规模训练系统:rollout、并行、调度与训推一致性
  2. 评测、安全、奖励黑客与上线监控
  3. 端到端项目:从问题定义到可复现实验
  4. 研究前沿:如何判断下一篇 RL 论文是否真的有用

附录与实验

三条推荐路线

目标 建议顺序 预计投入
快速建立全局观 00 → 02 → 04 → 06 → 08 → 10 → 12 → 16 → 17 20–30 小时
后训练工程师 01–11 → 16–18 → 两个实验 80–120 小时
多模态/智能体研究者 01–10 → 12–19 → 论文复现 120–200 小时

预计投入包含手推公式、完成练习和复现实验;只阅读正文会更快,但很难形成稳定能力。

阅读约定

  • 推导写出可公开复核的中间等式、假设与结论;读者应在纸上重算。
  • 直觉帮助建立心智模型,但不能替代定义或实验。
  • 工程检查点给出日志、断言和失败症状,用于真实训练诊断。
  • 证据等级区分数学恒等式、论文实验观察、工程经验与尚待验证的假说。
  • 显示公式使用 GitHub 支持的 math 围栏;短符号使用 Unicode 或 HTML 上下标。
  • 算法名并不自动等于“强化学习”。书中会明确区分在线 RL、离线偏好优化、行为克隆和推理时搜索。

如何使用本仓库

教材本身没有运行时依赖。两个小实验只依赖 Python 3 标准库:

python3 labs/01_bandit_reinforce.py
python3 labs/02_toy_alignment.py

检查本地链接、公式围栏和常见 GitHub 渲染问题:

python3 scripts/validate_markdown.py

内容边界与安全说明

本书讲清算法和系统设计,但不会把单一论文结果包装成普遍定律。模型能力、框架 API 与评测集会快速变化;涉及具体版本的内容均链接到来源,并以原理为主。任何高风险领域部署都不能用离线基准替代领域专家审查、真实用户研究和持续监控。

About

从强化学习基础到 LLM、MLLM、RLHF、RLVR 与智能体训练的中文系统教材

Topics

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages