Author
赵世钰(Shiyu Zhao)
Link
https://link.springer.com/book/10.1007/978-981-97-3944-8
Tags
RL
Post-training
Score
TBD
Completed
加入清单
Preview
优先级 1|豆瓣 9.8|精读 30–40h|建立 PPO、GRPO 与 policy gradient 的统一数学骨架
Status
Done
Type
Book
Last edited time
Sep 5, 2026 04:55 PM
优先级 1 · 精读 · 30–40 小时
完成标准:能够不看资料重新推导核心公式,并把它们连接到 PPO、GRPO 与 LLM post-training。
为什么现在读
你已经在使用和分析 PPO、GRPO、KL penalty、advantage 与 contextual bandit,但部分理解仍以单个公式为单位。这本书的价值是把 Bellman equation、采样估计、policy gradient 和 actor-critic 压缩成同一套数学结构。
阅读路径
- Basic concepts 与 Markov decision process
- Bellman equation 与 Bellman optimality equation
- Monte Carlo、stochastic approximation 与 temporal-difference learning
- Value-function approximation
- Policy gradient 与 actor-critic
- 自己补写 PPO clipping、GAE 与 GRPO group-relative advantage
必须产出
一份 10–15 页的推导笔记:Bellman → REINFORCE → baseline → advantage → actor-critic → PPO → GRPO
独立解释 reward 为什么不能直接穿过 sampled token 反向传播到 policy
推导 baseline 为什么不改变 policy-gradient estimator 的期望
用一个小型环境实现 REINFORCE 与 actor-critic,并比较 estimator variance
最容易混淆
- 真正的优化目标与 Monte Carlo estimator 不是同一个对象
- Advantage 是相对基线的 credit signal,不是额外 reward
- PPO clipping 约束一次更新,不等于约束长期 policy drift
- Token-level loss 与 trajectory-level return 的 credit assignment 不能混为一谈
停止规则
不要追求逐页完成。能够独立重建上述推导链,并把 PPO/GRPO 放回统一框架后,本书的当前任务即完成。