先记住一句话
回归给一个中心答案,自回归逐项建模,diffusion/flow 从噪声生成整个连续 chunk;选择取决于动作多模态程度、控制频率和可接受延迟。
1. 单点回归为何会平均
若绕障碍向左和向右都正确,MSE 最优预测可能是两者均值——直接撞向障碍。L1/Huber 更鲁棒,但仍主要估计条件分布的中心。对接近单峰、低频技能,简单回归常是很强 baseline;不要为了时髦跳过它。
2. 离散/自回归
把每个动作维量化为 bin,可用 cross-entropy 建模多个峰;也能把时间和维度展成 token 序列。问题是误差受 bin resolution 限制,生成延迟随 token 数增加,且维度顺序引入人为条件依赖。并行 token 解码和连续后处理可缓解。
3. Diffusion policy
训练:clean action chunk a₀ + noise ε → noisy a_t
model(condition, a_t, t) → 预测 ε / score / velocity
推理:random noise → 多步迭代去噪 → coherent action chunk它能表示多峰、高维时间序列,并天然输出平滑 chunk。代价是多次网络 forward。Diffusion Policy 还把它放入 receding horizon:不断基于新观测重新生成未来,而不是一次执行到底。
4. Flow matching
最简直线路径把 noise 与 clean action 插值:x_t = (1-t)·noise + t·action,网络学习把样本沿路径推向数据的 velocity field。推理从噪声出发解 ODE,Euler 少步即可得到 action。与 diffusion 的直觉相近,但训练目标和求解器表述更直接;π0 与 GR00T 使用这一家族。
5. Action chunk 为什么有效
- 一次预测多步,减少大模型调用频率。
- 让网络直接学习动作之间的时间相关性,而非每步抖动。
- 长 horizon 帮助意图一致,短执行窗口保留闭环反应。
- chunk 内越靠后越不确定,可只执行前缀或对重叠预测加权。
action horizon、execution horizon 和 observation history 是三个不同超参。输出 50 步不代表要 open-loop 执行 50 步。
6. 速度技巧改变的不只是工程
| 技巧 | 省什么 | 潜在代价 |
|---|---|---|
| 少步 Euler / consistency | 采样 forward | 分布近似变粗 |
| KV cache | 重复条件 token 计算 | 要求条件前缀在步骤间静态 |
| parallel decoding | 逐维/逐步串行 | 需改变训练输出接口 |
| action-only WAM inference | future video token | 失去推理期显式 future coupling |
| 异步 chunk | 等待造成的停顿 | 新旧 chunk 一致性问题 |
7. 四种生成计算
例 1:MSE 平均两个模式
同一状态下正确动作是 -1 或 +1,各一半。预测 0 的期望 MSE=$0.5(0+1)^2+0.5(0-1)^2=1$;预测 +1 的期望 MSE=$0.5×4+0=2$,所以回归偏好不可执行的中点 0。
例 2:forward noising
Clean action 0.8、噪声 -0.5,取 $\bar α=0.64$:$x_t=0.8×0.8+0.6×(-0.5)=0.34$。
例 3:flow Euler step
当前 $x=0.2$,网络 velocity 0.6,步长 $Δt=0.25$,Euler 更新 $x'=0.2+0.25×0.6=0.35$;4 步需要 4 次网络评估。
例 4:端到端采样延迟
每次 action network 12 ms,8 步去噪为 96 ms;若减少到 4 步是 48 ms。10 Hz 预算 100 ms 时前者几乎没有预处理与通信余量。
同时画 success rate、端到端 P50/P95 latency、控制频率、采样步数和 GPU;只报“模型 forward”会漏掉图像传输、预处理和网络往返。
自测
1. MSE 为什么会生成两个策略的平均?
条件分布多峰时,平方误差的最优点估计是条件均值,而均值未必是有效动作。
2. action horizon 和 execution horizon 有何区别?
前者是一次预测的未来长度;后者是重新观察和规划前实际执行多少步。
3. Flow matching 推理为何仍需若干步?
需要数值积分学习到的 velocity field,把噪声沿时间路径变成动作样本。
原始资料
Diffusion Policy、π0 与 OpenVLA-OFT 分别展示 diffusion、flow matching 与并行连续解码。