先记住一句话

回归给一个中心答案,自回归逐项建模,diffusion/flow 从噪声生成整个连续 chunk;选择取决于动作多模态程度、控制频率和可接受延迟。

condition选择 action distribution回归 / token / noisy chunk采样或积分反归一化receding horizon
回归condition → mean
|
自回归bin₁ → bin₂ → …
|
Diffusion / flownoise → continuous chunk
三类方法对“有多少个合理答案”作出不同假设,必须在同样延迟和闭环协议下比较。

1. 单点回归为何会平均

若绕障碍向左和向右都正确,MSE 最优预测可能是两者均值——直接撞向障碍。L1/Huber 更鲁棒,但仍主要估计条件分布的中心。对接近单峰、低频技能,简单回归常是很强 baseline;不要为了时髦跳过它。

2. 离散/自回归

把每个动作维量化为 bin,可用 cross-entropy 建模多个峰;也能把时间和维度展成 token 序列。问题是误差受 bin resolution 限制,生成延迟随 token 数增加,且维度顺序引入人为条件依赖。并行 token 解码和连续后处理可缓解。

3. Diffusion policy

训练:clean action chunk a₀ + noise ε → noisy a_t
      model(condition, a_t, t) → 预测 ε / score / velocity

推理:random noise → 多步迭代去噪 → coherent action chunk

它能表示多峰、高维时间序列,并天然输出平滑 chunk。代价是多次网络 forward。Diffusion Policy 还把它放入 receding horizon:不断基于新观测重新生成未来,而不是一次执行到底。

4. Flow matching

最简直线路径把 noise 与 clean action 插值:x_t = (1-t)·noise + t·action,网络学习把样本沿路径推向数据的 velocity field。推理从噪声出发解 ODE,Euler 少步即可得到 action。与 diffusion 的直觉相近,但训练目标和求解器表述更直接;π0 与 GR00T 使用这一家族。

5. Action chunk 为什么有效

  • 一次预测多步,减少大模型调用频率。
  • 让网络直接学习动作之间的时间相关性,而非每步抖动。
  • 长 horizon 帮助意图一致,短执行窗口保留闭环反应。
  • chunk 内越靠后越不确定,可只执行前缀或对重叠预测加权。

action horizon、execution horizon 和 observation history 是三个不同超参。输出 50 步不代表要 open-loop 执行 50 步。

6. 速度技巧改变的不只是工程

技巧省什么潜在代价
少步 Euler / consistency采样 forward分布近似变粗
KV cache重复条件 token 计算要求条件前缀在步骤间静态
parallel decoding逐维/逐步串行需改变训练输出接口
action-only WAM inferencefuture video token失去推理期显式 future coupling
异步 chunk等待造成的停顿新旧 chunk 一致性问题

7. 四种生成计算

例 1:MSE 平均两个模式

同一状态下正确动作是 -1 或 +1,各一半。预测 0 的期望 MSE=$0.5(0+1)^2+0.5(0-1)^2=1$;预测 +1 的期望 MSE=$0.5×4+0=2$,所以回归偏好不可执行的中点 0。

例 2:forward noising

Clean action 0.8、噪声 -0.5,取 $\bar α=0.64$:$x_t=0.8×0.8+0.6×(-0.5)=0.34$。

例 3:flow Euler step

当前 $x=0.2$,网络 velocity 0.6,步长 $Δt=0.25$,Euler 更新 $x'=0.2+0.25×0.6=0.35$;4 步需要 4 次网络评估。

例 4:端到端采样延迟

每次 action network 12 ms,8 步去噪为 96 ms;若减少到 4 步是 48 ms。10 Hz 预算 100 ms 时前者几乎没有预处理与通信余量。

公平比较:

同时画 success rate、端到端 P50/P95 latency、控制频率、采样步数和 GPU;只报“模型 forward”会漏掉图像传输、预处理和网络往返。

自测

1. MSE 为什么会生成两个策略的平均?

条件分布多峰时,平方误差的最优点估计是条件均值,而均值未必是有效动作。

2. action horizon 和 execution horizon 有何区别?

前者是一次预测的未来长度;后者是重新观察和规划前实际执行多少步。

3. Flow matching 推理为何仍需若干步?

需要数值积分学习到的 velocity field,把噪声沿时间路径变成动作样本。

原始资料

Diffusion Policyπ0OpenVLA-OFT 分别展示 diffusion、flow matching 与并行连续解码。