先记住一句话

策略后训练的核心不是算法缩写,而是闭环:当前 policy 产生什么分布的数据、反馈怎样变成学习信号、更新后如何在不伤害通用能力与安全的前提下再部署。

versioned policyguarded rolloutreward / interventionBC / value / RL updateoffline gatescanary + rollback
产生数据current policy rollout
标注后果success / return / correction
更新weighted BC / critic / actor
门禁promote or rollback
后训练首先是数据分布闭环;算法只决定怎样消费这些反馈。

1. 为什么 SFT 之后还需要后训练

Behavior cloning 优化 demo action likelihood,却没有直接优化任务成功率。它的典型缺口是:

  • 只见专家状态,没学会从自身小错误恢复。
  • 长任务中每步局部合理,整体仍可能失败。
  • 多种示范质量被同权模仿,犹豫和绕路也进入 policy。
  • 目标指标可能是完成、安全、速度与平滑的组合,action loss 无法完整表达。

2. 反馈信号的光谱

反馈学习方式优点风险
专家接管/纠错DAgger、intervention BC标签密、直接告诉正确动作介入不一定完美,切换有延迟
成功/失败value/Q、offline/online RL直接面向任务结果稀疏、credit assignment 难
阶段进度dense reward、progress value长任务更易学奖励定义可能被钻空子
轨迹偏好ranking/preference optimization可表达平滑、安全、效率标注成本与偏好不一致
自动 verifierVLM/状态成功判定规模化verifier 错误会被 policy 利用

3. 五类常见更新方法

A. 只模仿纠错

让基础 policy rollout,人类在危险或即将失败时接管,将 intervention state 与 corrective action 加回 SFT。它简单稳定,直接补 covariate shift;但若人类纠错犹豫或时序错位,盲目 BC 会一起学进去。

B. 质量加权的 behavior cloning

用成功、return、advantage 或 critic 分数给样本加权,只强化比当前 policy 更好的动作。这是从监督学习到 RL 的连续过渡,通常比直接 online policy gradient 稳定。

C. Offline RL / value learning

从 demo、失败 rollout、intervention 混合数据学习 Q/V,再提取更偏向高价值动作的 policy。关键是控制 distribution shift:critic 对数据外动作常过度乐观,需 conservative/implicit 目标或限制 actor 靠近数据。

D. Online RL

新 policy 持续采样,再用真实 reward 更新。它最直接针对 policy-induced distribution,却最昂贵和危险。flow/diffusion policy 的动作 likelihood 与 credit assignment 比普通 Gaussian policy 更复杂,常需专门的 matching、group-relative 或 value-guided 更新。

E. Preference / reward-model post-training

比较两条 rollout 谁更安全、快或自然,训练 reward/value model,再做 policy optimization。它能编码“成功但不漂亮”的差异,但必须防 reward hacking,并周期性用真实闭环验收。

4. 数据闭环长什么样

versioned policy
   → shadow / guarded rollout
   → observation + proposed action + committed action
   → reward / success / failure reason / intervention
   → replay buffer(按 policy version 与 task 分层)
   → value / reward / actor update
   → offline gates + canary robot
   → promote or rollback

必须同时保存 policy 提议的动作和安全层真正执行的动作,否则训练会把 safety controller 的纠正归功于 actor。异步系统还要保存 inference start/end 和 action commit 边界。

5. 怎样不把 generalist 训成 narrow specialist

  • 混入 foundation replay,或对旧 policy 做 KL / feature / action distillation。
  • 只更新 adapter/action expert,冻结部分 VLM。
  • 按 task 设 replay quota,防热门失败吞掉长尾能力。
  • 每次更新跑 capability regression suite,不只看目标任务。
  • 对 critic/reward model 做 held-out calibration,防止闭环越训越偏。

6. 真机 online learning 的安全边界

从低风险状态与短 horizon 开始;动作经过 workspace、速度、力、碰撞与 watchdog 约束;新 policy 先离线 replay、仿真/数字孪生、shadow,再少量 canary rollout。紧急停止和 rollback 属于学习系统本身,不是外围运维。

7. 四个后训练计算

例 1:介入率

500 次 rollout 中人工介入 75 次,intervention rate=$75/500=15%$。更新后 40/500=8%,下降 7 个百分点;但还要确认没有通过提前停止来“躲避介入”。

例 2:质量加权 BC

三条样本 loss 为 [0.2,0.8,0.4],质量权重 [1,0.25,0.5]。归一化 weighted loss=$(0.2+0.2+0.2)/(1+0.25+0.5)=0.343$,而非直接除以 3。

例 3:TD target

即时 reward 0.2、下一状态 value 0.8、$γ=0.95$,target=$0.2+0.95×0.8=0.96$。若当前 Q=0.6,TD error=0.36。

例 4:安全层归因

Actor 提议 0.12 m 动作,安全层 clip 到 0.05 m 后成功。训练必须保存两者;否则成功会错误强化越界的 0.12 m,而实际产生结果的是 0.05 m。

最重要的实验对照:

用同一批新增 rollout,比“全部 BC”“只 BC intervention”“质量加权 BC”“value/RL 更新”。否则无法知道收益来自算法,还是仅仅来自多收了目标域数据。

自测

1. 为什么 intervention 不应默认当完美专家?

人类介入有反应延迟、犹豫和切换瞬态;应结合结果/价值筛选,而非无差别模仿。

2. 为什么要同时记录 proposed 与 executed action?

安全层可能修改动作;不区分会让 actor 学到错误的行为—结果归因。

3. Offline RL 的主要危险是什么?

critic 对训练数据分布外的动作估值不可靠,actor 可能利用这种过高估计。

原始资料

SOP 比较 fleet-scale HG-DAgger 与 RL;Learning While Deploying 结合 intervention、value 与 flow-policy 更新;ROVE 处理不完美人类介入;Z-1 探索 flow-based VLA 的 GRPO 后训练。