先记住一句话
策略后训练的核心不是算法缩写,而是闭环:当前 policy 产生什么分布的数据、反馈怎样变成学习信号、更新后如何在不伤害通用能力与安全的前提下再部署。
1. 为什么 SFT 之后还需要后训练
Behavior cloning 优化 demo action likelihood,却没有直接优化任务成功率。它的典型缺口是:
- 只见专家状态,没学会从自身小错误恢复。
- 长任务中每步局部合理,整体仍可能失败。
- 多种示范质量被同权模仿,犹豫和绕路也进入 policy。
- 目标指标可能是完成、安全、速度与平滑的组合,action loss 无法完整表达。
2. 反馈信号的光谱
| 反馈 | 学习方式 | 优点 | 风险 |
|---|---|---|---|
| 专家接管/纠错 | DAgger、intervention BC | 标签密、直接告诉正确动作 | 介入不一定完美,切换有延迟 |
| 成功/失败 | value/Q、offline/online RL | 直接面向任务结果 | 稀疏、credit assignment 难 |
| 阶段进度 | dense reward、progress value | 长任务更易学 | 奖励定义可能被钻空子 |
| 轨迹偏好 | ranking/preference optimization | 可表达平滑、安全、效率 | 标注成本与偏好不一致 |
| 自动 verifier | VLM/状态成功判定 | 规模化 | verifier 错误会被 policy 利用 |
3. 五类常见更新方法
A. 只模仿纠错
让基础 policy rollout,人类在危险或即将失败时接管,将 intervention state 与 corrective action 加回 SFT。它简单稳定,直接补 covariate shift;但若人类纠错犹豫或时序错位,盲目 BC 会一起学进去。
B. 质量加权的 behavior cloning
用成功、return、advantage 或 critic 分数给样本加权,只强化比当前 policy 更好的动作。这是从监督学习到 RL 的连续过渡,通常比直接 online policy gradient 稳定。
C. Offline RL / value learning
从 demo、失败 rollout、intervention 混合数据学习 Q/V,再提取更偏向高价值动作的 policy。关键是控制 distribution shift:critic 对数据外动作常过度乐观,需 conservative/implicit 目标或限制 actor 靠近数据。
D. Online RL
新 policy 持续采样,再用真实 reward 更新。它最直接针对 policy-induced distribution,却最昂贵和危险。flow/diffusion policy 的动作 likelihood 与 credit assignment 比普通 Gaussian policy 更复杂,常需专门的 matching、group-relative 或 value-guided 更新。
E. Preference / reward-model post-training
比较两条 rollout 谁更安全、快或自然,训练 reward/value model,再做 policy optimization。它能编码“成功但不漂亮”的差异,但必须防 reward hacking,并周期性用真实闭环验收。
4. 数据闭环长什么样
versioned policy
→ shadow / guarded rollout
→ observation + proposed action + committed action
→ reward / success / failure reason / intervention
→ replay buffer(按 policy version 与 task 分层)
→ value / reward / actor update
→ offline gates + canary robot
→ promote or rollback必须同时保存 policy 提议的动作和安全层真正执行的动作,否则训练会把 safety controller 的纠正归功于 actor。异步系统还要保存 inference start/end 和 action commit 边界。
5. 怎样不把 generalist 训成 narrow specialist
- 混入 foundation replay,或对旧 policy 做 KL / feature / action distillation。
- 只更新 adapter/action expert,冻结部分 VLM。
- 按 task 设 replay quota,防热门失败吞掉长尾能力。
- 每次更新跑 capability regression suite,不只看目标任务。
- 对 critic/reward model 做 held-out calibration,防止闭环越训越偏。
6. 真机 online learning 的安全边界
从低风险状态与短 horizon 开始;动作经过 workspace、速度、力、碰撞与 watchdog 约束;新 policy 先离线 replay、仿真/数字孪生、shadow,再少量 canary rollout。紧急停止和 rollback 属于学习系统本身,不是外围运维。
7. 四个后训练计算
例 1:介入率
500 次 rollout 中人工介入 75 次,intervention rate=$75/500=15%$。更新后 40/500=8%,下降 7 个百分点;但还要确认没有通过提前停止来“躲避介入”。
例 2:质量加权 BC
三条样本 loss 为 [0.2,0.8,0.4],质量权重 [1,0.25,0.5]。归一化 weighted loss=$(0.2+0.2+0.2)/(1+0.25+0.5)=0.343$,而非直接除以 3。
例 3:TD target
即时 reward 0.2、下一状态 value 0.8、$γ=0.95$,target=$0.2+0.95×0.8=0.96$。若当前 Q=0.6,TD error=0.36。
例 4:安全层归因
Actor 提议 0.12 m 动作,安全层 clip 到 0.05 m 后成功。训练必须保存两者;否则成功会错误强化越界的 0.12 m,而实际产生结果的是 0.05 m。
用同一批新增 rollout,比“全部 BC”“只 BC intervention”“质量加权 BC”“value/RL 更新”。否则无法知道收益来自算法,还是仅仅来自多收了目标域数据。
自测
1. 为什么 intervention 不应默认当完美专家?
人类介入有反应延迟、犹豫和切换瞬态;应结合结果/价值筛选,而非无差别模仿。
2. 为什么要同时记录 proposed 与 executed action?
安全层可能修改动作;不区分会让 actor 学到错误的行为—结果归因。
3. Offline RL 的主要危险是什么?
critic 对训练数据分布外的动作估值不可靠,actor 可能利用这种过高估计。
原始资料
SOP 比较 fleet-scale HG-DAgger 与 RL;Learning While Deploying 结合 intervention、value 与 flow-policy 更新;ROVE 处理不完美人类介入;Z-1 探索 flow-based VLA 的 GRPO 后训练。