Skip to content

01 · 强化学习的数学原理

Author
赵世钰(Shiyu Zhao)
Link
https://link.springer.com/book/10.1007/978-981-97-3944-8
Tags
RL
Post-training
Score
TBD
Completed
加入清单
Preview
优先级 1|豆瓣 9.8|精读 30–40h|建立 PPO、GRPO 与 policy gradient 的统一数学骨架
Status
Done
Type
Book
Last edited time
Sep 5, 2026 04:55 PM
🎯
优先级 1 · 精读 · 30–40 小时
完成标准:能够不看资料重新推导核心公式,并把它们连接到 PPO、GRPO 与 LLM post-training。

为什么现在读

你已经在使用和分析 PPO、GRPO、KL penalty、advantage 与 contextual bandit,但部分理解仍以单个公式为单位。这本书的价值是把 Bellman equation、采样估计、policy gradient 和 actor-critic 压缩成同一套数学结构。

阅读路径

  1. Basic concepts 与 Markov decision process
  1. Bellman equation 与 Bellman optimality equation
  1. Monte Carlo、stochastic approximation 与 temporal-difference learning
  1. Value-function approximation
  1. Policy gradient 与 actor-critic
  1. 自己补写 PPO clipping、GAE 与 GRPO group-relative advantage

必须产出

一份 10–15 页的推导笔记:Bellman → REINFORCE → baseline → advantage → actor-critic → PPO → GRPO
独立解释 reward 为什么不能直接穿过 sampled token 反向传播到 policy
推导 baseline 为什么不改变 policy-gradient estimator 的期望
用一个小型环境实现 REINFORCE 与 actor-critic,并比较 estimator variance

最容易混淆

  • 真正的优化目标与 Monte Carlo estimator 不是同一个对象
  • Advantage 是相对基线的 credit signal,不是额外 reward
  • PPO clipping 约束一次更新,不等于约束长期 policy drift
  • Token-level loss 与 trajectory-level return 的 credit assignment 不能混为一谈

停止规则

不要追求逐页完成。能够独立重建上述推导链,并把 PPO/GRPO 放回统一框架后,本书的当前任务即完成。
Loading...