Learning series · first draft

10 notes / Bellman → Flow-GRPO

强化学习训练

从 agent 与 environment 的一次交互出发,依次建立 return、value、Bellman、TD、policy gradient 和 actor-critic,再看 DQN、PPO、TD3/SAC、offline/model-based RL 如何选择,最后把同一套语言映射到 LLM 的 GRPO 与 flow-matching 生成模型的 Flow-GRPO。

10 篇独立文章3 个训练域:控制、语言、生成资料快照:2026-08-30

Part I · 所有 RL 算法共用的语言

01问题定义

MDP、回报与探索

状态、动作、奖励、策略、轨迹和折扣回报怎样组成一个可学习的序列决策问题。

02价值学习

Value、Bellman、MC 与 TD

理解 V/Q/advantage、bootstrap、on/off-policy,以及偏差—方差如何进入更新。

03离散动作

Q-learning 与 DQN

replay buffer、target network 和 Double Q 怎样让神经网络学离散动作价值。

04直接优化策略

Policy Gradient、Actor-Critic 与 GAE

从 REINFORCE 的 log-derivative trick 到 baseline、critic 和多步 advantage。

Part II · 主流控制算法与训练边界

05On-policy

PPO:Clipped Policy Update

看懂 probability ratio、clip、GAE、value/entropy loss,以及一次完整 rollout-update 循环。

06Continuous off-policy

DDPG、TD3 与 SAC

连续动作如何用 actor 最大化 Q;双 critic、target smoothing 与 maximum entropy 分别解决什么。

07数据与模型

Offline RL、IQL/CQL 与 World Model

没有在线探索时为什么会有 extrapolation error,以及 learned dynamics 怎样用 imagined rollout 提高数据效率。

Part III · 从机器人策略到基础模型 post-training

08语言模型 RL

LLM 的 RLHF 与 RLVR

把 token 当 action、response 当 trajectory,理解 reward、KL、reference、rollout 与 credit assignment。

09Group relative

GRPO:不用 Critic 的相对优势

同一 prompt 采样一组答案,用组内奖励作 baseline,再做 clipped policy optimization。

10Flow matching RL

Flow-GRPO:从 ODE 到可探索的 SDE

为什么确定性 flow sampler 没有直接可用的 policy likelihood,以及 ODE-to-SDE 与 denoising reduction 如何解决它。

先避免一个算法排行榜误区:

PPO、SAC、GRPO 与 Flow-GRPO解决的训练对象和数据边界不同。PPO 常用于可大量并行采样的控制策略;SAC 用 replay 提高连续控制的数据复用;GRPO 面向同一输入可采样多条输出并比较奖励的语言模型;Flow-GRPO 又为 flow-matching 生成轨迹重新构造了随机 policy。不能只按最终 reward 把它们横向排成一列。