从数学基础、经典强化学习,到 RLHF、RLVR、多模态推理与智能体训练的一套中文公开教材
本教材面向第一次系统学习强化学习的读者,也面向希望把零散的 LLM/MLLM 后训练知识整理成完整体系的工程师与研究者。全书采用“直觉 → 定义 → 可复核推导 → 小例子 → 算法 → 工程实现 → 失败模式 → 练习”的顺序,目标不是记住算法缩写,而是建立能够独立读论文、诊断训练和设计实验的能力。
资料调研、链接与新人可读性最后核对日期:2026-07-12。
学完后,你应当能够:
- 从 MDP、Bellman 方程和占用度量推导价值方法与策略梯度;
- 解释 REINFORCE、Actor–Critic、GAE、TRPO、PPO 的假设、偏差—方差与适用边界;
- 把自回归语言模型严格写成 token 级或序列级决策过程;
- 从偏好概率模型推导奖励模型与 DPO,而不是只会调用训练器;
- 独立设计 PPO、RLOO、GRPO、RLVR、过程奖励与搜索/自博弈训练;
- 把同一套方法迁移到图像、视频、音频、GUI、工具调用和具身任务;
- 估算显存、吞吐、采样成本,理解训推不一致与同步/异步数据流;
- 识别奖励黑客、长度偏置、评测污染和不确定性误用;
- 建立可复现的训练—评测—安全门禁,并读懂新算法到底改了哪一项。
数学工具
└─ 概率、期望、KL、优化、重要性采样
└─ 强化学习基础
├─ MDP / POMDP / Bellman / 占用度量
├─ DP / MC / TD / Q-learning
└─ 策略梯度 / Actor–Critic / GAE / PPO
└─ 语言模型后训练
├─ LLM 作为策略与序列决策过程
├─ 偏好数据 / 奖励模型 / RLHF-PPO
├─ DPO 家族(离线直接对齐)
├─ RLVR / RLOO / GRPO / 搜索 / 自博弈
└─ 多轮工具与智能体 RL
└─ 多模态与具身
├─ 感知、grounding、幻觉与多模态奖励
├─ 视觉推理 / 生成 / 视频 / 音频
└─ GUI、网页、机器人与长时程控制
└─ 系统、评测、安全与研究前沿
- 数学预备:概率、信息论、优化与重要性采样
- 从决策问题到 MDP 与 POMDP
- 价值方法:DP、MC、TD、SARSA 与 Q-learning
- 策略梯度、REINFORCE 与 Actor–Critic
- GAE、TRPO 与 PPO:稳定更新的来龙去脉
- 把语言模型看成策略
- 偏好数据与奖励模型
- RLHF-PPO:目标、推导与完整训练环路
- 直接偏好对齐:DPO、IPO、KTO、ORPO 与 SimPO
- 可验证奖励强化学习:REINFORCE、RLOO、GRPO 与 RLVR
- 过程监督、信用分配、搜索与自博弈
- 附录 A:符号表与术语表
- 附录 B:核心推导速查
- 附录 C:学习路线、练习使用法与研究训练
- 附录 D:带注释的一手资料索引
- 实验 1:两臂老虎机与 REINFORCE
- 实验 2:偏好模型、DPO 与序列级策略梯度
| 目标 | 建议顺序 | 预计投入 |
|---|---|---|
| 快速建立全局观 | 00 → 02 → 04 → 06 → 08 → 10 → 12 → 16 → 17 | 20–30 小时 |
| 后训练工程师 | 01–11 → 16–18 → 两个实验 | 80–120 小时 |
| 多模态/智能体研究者 | 01–10 → 12–19 → 论文复现 | 120–200 小时 |
预计投入包含手推公式、完成练习和复现实验;只阅读正文会更快,但很难形成稳定能力。
- 推导写出可公开复核的中间等式、假设与结论;读者应在纸上重算。
- 直觉帮助建立心智模型,但不能替代定义或实验。
- 工程检查点给出日志、断言和失败症状,用于真实训练诊断。
- 证据等级区分数学恒等式、论文实验观察、工程经验与尚待验证的假说。
- 显示公式使用 GitHub 支持的
math围栏;短符号使用 Unicode 或 HTML 上下标。 - 算法名并不自动等于“强化学习”。书中会明确区分在线 RL、离线偏好优化、行为克隆和推理时搜索。
教材本身没有运行时依赖。两个小实验只依赖 Python 3 标准库:
python3 labs/01_bandit_reinforce.py
python3 labs/02_toy_alignment.py检查本地链接、公式围栏和常见 GitHub 渲染问题:
python3 scripts/validate_markdown.py本书讲清算法和系统设计,但不会把单一论文结果包装成普遍定律。模型能力、框架 API 与评测集会快速变化;涉及具体版本的内容均链接到来源,并以原理为主。任何高风险领域部署都不能用离线基准替代领域专家审查、真实用户研究和持续监控。