面向小白的 Agentic RL(智能体强化学习)系统教程 — 24 篇中文 Markdown,配套可运行的 TRL 最小示例。
搜「Agentic RL 教程」「GRPO 入门」「LLM 强化学习」「verl TRL 实战」都能找到这里。
Agentic RL 是把大语言模型(LLM)训练成能规划、用工具、多轮交互的智能体(Agent)的方法。
本仓库不是论文搬运,而是一条能跟着走的自学路线:
| 你现在的水平 | 从这里开始 |
|---|---|
| 完全零基础,没听过 RL | 01 - 什么是 Agentic RL |
| 懂 LLM,想搞懂 SFT / RLHF / GRPO | 03 - LLM 与 Post-Training → 08 - GRPO 深度解析 |
| 想动手跑训练 | minimal-verl/ 最小示例 + 15 - 第一个训练实战 |
核心理念:小模型 + Agentic RL,在垂直任务上可以超越更大的通用 LLM。
| 章节 | 主题 | 难度 |
|---|---|---|
| 01 | Agentic RL 概念与愿景 | 入门 |
| 02 | 强化学习入门(MDP、策略梯度) | 入门 |
| 03 | LLM 与 Post-Training(SFT / RLHF / DPO / GRPO) | 入门 |
| 04 | 从 LLM RL 到 Agentic RL | 入门 |
| 05 | 应用场景全景 | 入门 |
| 章节 | 主题 | 难度 |
|---|---|---|
| 06 | PPO 算法详解 | 中级 |
| 07 | DPO 直接偏好优化 | 中级 |
| 08 | GRPO 深度解析(2025–2026 主流) | 中级 |
| 09 | RLVR 可验证奖励 | 中级 |
| 10 | Reward Shaping 奖励设计 | 中级 |
| 章节 | 主题 | 难度 |
|---|---|---|
| 11 | 训练框架选型(verl / TRL) | 中级 |
| 12 | 数据准备与 SFT | 中级 |
| 13 | 训练环境搭建 | 中级 |
| 14 | 奖励函数设计 | 中级 |
| 15 | 第一个完整训练实战 | 实战 |
| 章节 | 主题 |
|---|---|
| 16 | 网页导航 Agent |
| 17 | 代码 Agent |
| 18 | 搜索增强 Agent |
| 19 | 垂直领域 Agent |
| 20 | 评估与 Benchmark |
| 章节 | 主题 |
|---|---|
| 21 | 异步 Rollout 与分布式训练 |
| 22 | 多 Agent / Multi-Agent RL |
| 23 | 前沿论文与研究方向 |
| 24 | 学习总结与进阶路径 |
minimal-verl/ 是一个真正能跑的精简项目,目标不是训出生产模型,而是理解整条链路:
人造数据 → SFT → GRPO → 评估
- 模型:Qwen2.5-0.5B(Mac M 系列可用 MPS)
- 任务:中文情感三分类
- 框架:TRL
GRPOTrainer(比 verl 更适合入门)
cd minimal-verl
uv sync
uv run python scripts/00_check_env.py # 环境验证(5 步)详细进度见 minimal-verl/docs/PROGRESS.md。
- 想入门 LLM 强化学习 / RLHF / GRPO 的开发者
- 想训练 Agent(工具调用、多轮交互)但不知道从哪下手
- 看过 verl、DeepSeek-R1 新闻,想搞懂背后训练流程
- 中文学习者,希望有结构化路线而不是零散博客
Agentic RL · 智能体强化学习 · GRPO · PPO · DPO · RLHF · RLVR · LLM Post-Training · verl · TRL · Qwen · SFT · Reward Shaping · 工具调用 Agent · 小模型 RL
由 @cookiespiggy 维护 — 持续更新教程与可运行示例,欢迎 Star ⭐ 和 Issue 反馈。
MIT — 教程内容可自由学习、引用,请注明出处。