BreakRL 是一份双语、失败优先的强化学习讲义。每章先讲清一个机制,再把它去掉,让你看见失败。第 12–14 章用玩具序列任务和两位数加法讲机制,不能替代真实的 RLHF、DPO 或 GRPO 训练。
中文是源件,英文是译本;文件名无后缀为中文,-en 为英文。
打开最小演示拖动数据覆盖率:覆盖率低时,教学示意图会让损失一路下降而回报塌缩。它不训练模型。
阅读不需要装任何东西:站点只渲染已保存的实验输出。要重跑某一章,用下表的 Colab,或装本地环境改 notebook。下表是其余各章;从上面这三步开始,不必从第 1 章读起。
阅读循环是:
- 读正文,看问题、公式和机制;
- 打开 notebook,在小任务上看算法怎么跑;
- 对比消融:跑完了不等于方法可用。
| 阶段 | 章节 | 重点 |
|---|---|---|
| 基础 | 1–3 | 探索、MDP、时序差分学习 |
| 深度强化学习 | 4–8 | DQN、策略梯度、Actor-Critic、PPO、SAC |
| 新视角 | 9–11 | 离线强化学习、模型式强化学习、Decision Transformer |
| 玩具后训练 | 12–14 | 玩具序列与两位数加法上的 RLHF、DPO、GRPO/RLVR |
| # | 章节 | 正文 | 实验 | 运行 |
|---|---|---|---|---|
| 1 | 多臂老虎机:探索与利用 | Notebook | Colab | |
| 2 | 马尔可夫决策过程:序列决策形式化 | Notebook | Colab | |
| 3 | 时序差分学习:长期价值估计 | Notebook | Colab | |
| 4 | DQN:神经网络价值学习 | Notebook | Colab | |
| 5 | Policy Gradient / REINFORCE:直接优化策略 | Notebook | Colab | |
| 6 | Actor-Critic / A2C:价值辅助策略更新 | Notebook | Colab | |
| 7 | PPO:约束策略更新 | Notebook | Colab | |
| 8 | SAC:最大熵连续控制 | Notebook | Colab | |
| 9 | 离线强化学习:CQL 与 IQL | Notebook | Colab | |
| 10 | 模型式强化学习:从环境模型到 Dyna-Q | Notebook | Colab | |
| 11 | Decision Transformer:序列建模的强化学习 | Notebook | Colab | |
| 12 | RLHF:从偏好到奖励 | Notebook | Colab | |
| 13 | DPO:不训奖励模型的偏好优化 | Notebook | Colab | |
| 14 | GRPO 与 RLVR:可验证奖励 | Notebook | Colab |
训练不收敛时,从症状查起:回报塌缩、Q 值一路涨但策略变差、离线损失正常而回报塌缩、代理奖励上涨而真实质量下降。
先看图鉴第 8 条(离线损失正常,回报塌缩),或浏览完整图鉴。每条按「症状 → 机制 → 复现 → 修复」展开。
站点展示已保存的 notebook 输出,阅读时不会训练模型。
零安装: 点上表的 Colab。第一个代码单元会克隆本仓库、装实验依赖并进入章节目录,让相对路径可用。有些章节在 CPU 上一分钟内跑完;PPO 大约一小时,Decision Transformer 在 CPU 上可能要几小时。
本地运行用 Python 3.10、PyTorch 与 Gymnasium:
conda create -n rl_env python=3.10
conda activate rl_env
python -m pip install -r requirements.txt
python -m ipykernel install --user --name rl_env --display-name rl_env
python tools/run_jupyter.py打开 book/notes/<chapter>/<chapter>.ipynb,选 rl_env 内核。
教学、学习或研究用途见 CITATION.cff。正文、PDF、TeX、图和生成数据用 CC BY 4.0;notebook 与辅助脚本中的代码用 MIT License。发布历史见 docs/CHANGELOG.md。
贡献指南见 docs/CONTRIBUTING.md。
| 路径 | 用途 |
|---|---|
book/ |
在线书:章节、实验、最小演示、失败图鉴 |
book/chapters.yml |
章节唯一清单,各处表格由此生成 |
tools/ |
一致性检查、Colab 引导、构建辅助 |
docs/ |
贡献指南、安全策略、变更日志 |
assets/ |
README 品牌图与演示 GIF |

