10 notes / Bellman → Flow-GRPO
强化学习训练
从 agent 与 environment 的一次交互出发,依次建立 return、value、Bellman、TD、policy gradient 和 actor-critic,再看 DQN、PPO、TD3/SAC、offline/model-based RL 如何选择,最后把同一套语言映射到 LLM 的 GRPO 与 flow-matching 生成模型的 Flow-GRPO。
Part I · 所有 RL 算法共用的语言
MDP、回报与探索
状态、动作、奖励、策略、轨迹和折扣回报怎样组成一个可学习的序列决策问题。
Value、Bellman、MC 与 TD
理解 V/Q/advantage、bootstrap、on/off-policy,以及偏差—方差如何进入更新。
Q-learning 与 DQN
replay buffer、target network 和 Double Q 怎样让神经网络学离散动作价值。
Policy Gradient、Actor-Critic 与 GAE
从 REINFORCE 的 log-derivative trick 到 baseline、critic 和多步 advantage。
Part II · 主流控制算法与训练边界
PPO:Clipped Policy Update
看懂 probability ratio、clip、GAE、value/entropy loss,以及一次完整 rollout-update 循环。
DDPG、TD3 与 SAC
连续动作如何用 actor 最大化 Q;双 critic、target smoothing 与 maximum entropy 分别解决什么。
Offline RL、IQL/CQL 与 World Model
没有在线探索时为什么会有 extrapolation error,以及 learned dynamics 怎样用 imagined rollout 提高数据效率。
Part III · 从机器人策略到基础模型 post-training
LLM 的 RLHF 与 RLVR
把 token 当 action、response 当 trajectory,理解 reward、KL、reference、rollout 与 credit assignment。
GRPO:不用 Critic 的相对优势
同一 prompt 采样一组答案,用组内奖励作 baseline,再做 clipped policy optimization。
Flow-GRPO:从 ODE 到可探索的 SDE
为什么确定性 flow sampler 没有直接可用的 policy likelihood,以及 ODE-to-SDE 与 denoising reduction 如何解决它。
PPO、SAC、GRPO 与 Flow-GRPO解决的训练对象和数据边界不同。PPO 常用于可大量并行采样的控制策略;SAC 用 replay 提高连续控制的数据复用;GRPO 面向同一输入可采样多条输出并比较奖励的语言模型;Flow-GRPO 又为 flow-matching 生成轨迹重新构造了随机 policy。不能只按最终 reward 把它们横向排成一列。