先记住一句话
WAM 的共同点是用未来世界信号塑造动作模型;它不必在部署时生成漂亮视频,关键是未来信息是否真的改善了 action representation 与闭环泛化。
1. 从 policy 到 world-action joint model
普通 policy: (past observation, language, state) → action
world model: (past observation, action) → future observation
WAM: (past observation, language, state)
→ action + future representation
并允许二者在训练/推理中交换信息未来目标迫使网络理解对象移动、接触结果、遮挡解除和任务进度,而不是只在当前像素到动作间找捷径。但高维视频有大量与控制无关的变化,怎样选 future representation 是第一关键。
2. 四种未来监督
| 未来目标 | 优点 | 问题 |
|---|---|---|
| RGB / video latent | 保留完整场景演化,可视化 | 昂贵,浪费容量在纹理和光照 |
| 冻结视觉 encoder latent | 聚焦语义/空间,适合无 action 视频 | encoder 可能忽略接触细节 |
| 对象/slot state | 可寻址、易做对象级干预 | 对象分解和持续身份本身很难 |
| latent action / event | 压缩关键变化、推理便宜 | latent 是否对应可执行意图需验证 |
3. Joint-WAM、video-first 与 implicit WAM
Imagine then act
先生成目标或未来视频,action decoder 再读未来。解释直观,但视频误差与延迟会传给动作。
Joint denoising
future video 与 action 同时生成并相互 attention。耦合强,信息流与 scheduler 更复杂。
Video co-training only
训练时有 future loss,推理移除 video branch。速度快,测试时没有显式想象。
Future latent alignment
预测冻结 encoder 的未来特征,不重建像素。介于 policy 与完整生成式 WAM 之间。
4. 用一种通用设计理解联合序列
[video_cond | video_denoise | state | action]
clean noised clean noised
\___________ shared Transformer __________/
↓ ↓
video velocity action velocity视频可经冻结 VAE 变成 latent patch,action/state 经 MLP 变成 token。不同模态可以共享 Transformer,同时使用各自的噪声水平、位置编码和输入输出投影。
attention mask 决定 action 是否读取待生成的未来视频。若 action 只看 observed video + state,就可在推理时删除 video_denoise token,执行更快的 action-only loop;若 action 读取 future token,则保留更直接的 future conditioning,但要付出视频计算。
5. 两个 loss 相加并不保证互相帮助
联合目标通常形如 L = L_video + λ L_action。真正问题不只是 λ:
- 视频 token 数远多于 action token,梯度结构与 batch 统计不同。
- 两个目标可能争抢容量,也可能通过共享 attention 正迁移。
- 未来 horizon 太短只学光流,太长则多模态且不可预测。
- 数据有 video 无 action 时,mask 和 mixture 决定它是否帮助 policy。
因此要做 matched ablation:相同 robot 数据和计算,比较 action-only、future latent、video co-training、joint inference,而不是只比最终大模型。
6. 怎样证明模型真的用了世界知识
- 未来预测质量与 action success 的相关性,而非只展示最好视频。
- 对象位置、背景、视角、干扰物和接触属性的 OOD。
- 遮掉/交换 future token,观察动作因果变化。
- 分别测 action-only 与 joint inference 的速度—成功率曲线。
- 长 horizon rollout 中检查世界模型误差是否累积。
7. WAM 的四个量级计算
例 1:联合 loss 权重
Video loss 0.8、action loss 0.12,目标 $L=L_{video}+λL_{action}$,取 $λ=5$,总 loss=$0.8+5×0.12=1.4$;但 loss 数值相等不代表梯度范数相等。
例 2:future horizon
数据 10 Hz,预测未来索引 [5,10,20],对应 0.5、1.0、2.0 秒;改成 20 Hz 而不改索引,物理 horizon 全部减半。
例 3:action-only 省 token
Observed 256、future 512、state 8、action 32 tokens。Joint 序列 808,action-only 296;dense score 数比约 $(808/296)^2≈7.45$,实际加速还受网络和 mask kernel 影响。
例 4:长 rollout 误差
假设每步位置预测有独立零均值标准差 1 cm,25 步随机累积标准差约 $√25×1=5$ cm;若误差有同向 bias 1 cm,最坏可线性积到 25 cm。
视频建模的收益究竟来自训练期 representation learning,还是推理期显式 future conditioning?Fast-WAM 类工作正是把两者拆开验证。
自测
1. WAM 一定要在推理时生成 RGB 吗?
不一定。可以只在训练时做视频/latent 预测,或在推理时保留紧凑 future latent。
2. 为什么 action 不读 video_denoise 能加速?
待生成视频不再是动作依赖项,可移除其大量 token,只对 action 做少步去噪。
3. video loss 下降为何未必提升 policy?
模型可能主要拟合纹理等控制无关变化,或多任务梯度冲突、未来 horizon 不合适。