先记住一句话

WAM 的共同点是用未来世界信号塑造动作模型;它不必在部署时生成漂亮视频,关键是未来信息是否真的改善了 action representation 与闭环泛化。

observed video + statefuture targetjoint / separate denoisingshared representationaction-only / imagine-then-act
条件past + language + state
双目标future latent + action
信息流选择mask controls dependency
部署fast action or joint rollout
Attention mask 决定动作是否依赖待生成未来;这直接决定推理时能否删掉视频 token。

1. 从 policy 到 world-action joint model

普通 policy:   (past observation, language, state) → action
world model:    (past observation, action) → future observation
WAM:            (past observation, language, state)
                         → action + future representation
                并允许二者在训练/推理中交换信息

未来目标迫使网络理解对象移动、接触结果、遮挡解除和任务进度,而不是只在当前像素到动作间找捷径。但高维视频有大量与控制无关的变化,怎样选 future representation 是第一关键。

2. 四种未来监督

未来目标优点问题
RGB / video latent保留完整场景演化,可视化昂贵,浪费容量在纹理和光照
冻结视觉 encoder latent聚焦语义/空间,适合无 action 视频encoder 可能忽略接触细节
对象/slot state可寻址、易做对象级干预对象分解和持续身份本身很难
latent action / event压缩关键变化、推理便宜latent 是否对应可执行意图需验证

3. Joint-WAM、video-first 与 implicit WAM

Imagine then act

先生成目标或未来视频,action decoder 再读未来。解释直观,但视频误差与延迟会传给动作。

Joint denoising

future video 与 action 同时生成并相互 attention。耦合强,信息流与 scheduler 更复杂。

Video co-training only

训练时有 future loss,推理移除 video branch。速度快,测试时没有显式想象。

Future latent alignment

预测冻结 encoder 的未来特征,不重建像素。介于 policy 与完整生成式 WAM 之间。

4. 用一种通用设计理解联合序列

[video_cond | video_denoise | state | action]
      clean       noised       clean    noised
        \___________ shared Transformer __________/
                 ↓                       ↓
          video velocity          action velocity

视频可经冻结 VAE 变成 latent patch,action/state 经 MLP 变成 token。不同模态可以共享 Transformer,同时使用各自的噪声水平、位置编码和输入输出投影。

attention mask 决定 action 是否读取待生成的未来视频。若 action 只看 observed video + state,就可在推理时删除 video_denoise token,执行更快的 action-only loop;若 action 读取 future token,则保留更直接的 future conditioning,但要付出视频计算。

5. 两个 loss 相加并不保证互相帮助

联合目标通常形如 L = L_video + λ L_action。真正问题不只是 λ:

  • 视频 token 数远多于 action token,梯度结构与 batch 统计不同。
  • 两个目标可能争抢容量,也可能通过共享 attention 正迁移。
  • 未来 horizon 太短只学光流,太长则多模态且不可预测。
  • 数据有 video 无 action 时,mask 和 mixture 决定它是否帮助 policy。

因此要做 matched ablation:相同 robot 数据和计算,比较 action-only、future latent、video co-training、joint inference,而不是只比最终大模型。

6. 怎样证明模型真的用了世界知识

  1. 未来预测质量与 action success 的相关性,而非只展示最好视频。
  2. 对象位置、背景、视角、干扰物和接触属性的 OOD。
  3. 遮掉/交换 future token,观察动作因果变化。
  4. 分别测 action-only 与 joint inference 的速度—成功率曲线。
  5. 长 horizon rollout 中检查世界模型误差是否累积。

7. WAM 的四个量级计算

例 1:联合 loss 权重

Video loss 0.8、action loss 0.12,目标 $L=L_{video}+λL_{action}$,取 $λ=5$,总 loss=$0.8+5×0.12=1.4$;但 loss 数值相等不代表梯度范数相等。

例 2:future horizon

数据 10 Hz,预测未来索引 [5,10,20],对应 0.5、1.0、2.0 秒;改成 20 Hz 而不改索引,物理 horizon 全部减半。

例 3:action-only 省 token

Observed 256、future 512、state 8、action 32 tokens。Joint 序列 808,action-only 296;dense score 数比约 $(808/296)^2≈7.45$,实际加速还受网络和 mask kernel 影响。

例 4:长 rollout 误差

假设每步位置预测有独立零均值标准差 1 cm,25 步随机累积标准差约 $√25×1=5$ cm;若误差有同向 bias 1 cm,最坏可线性积到 25 cm。

关键研究问题:

视频建模的收益究竟来自训练期 representation learning,还是推理期显式 future conditioning?Fast-WAM 类工作正是把两者拆开验证。

自测

1. WAM 一定要在推理时生成 RGB 吗?

不一定。可以只在训练时做视频/latent 预测,或在推理时保留紧凑 future latent。

2. 为什么 action 不读 video_denoise 能加速?

待生成视频不再是动作依赖项,可移除其大量 token,只对 action 做少步去噪。

3. video loss 下降为何未必提升 policy?

模型可能主要拟合纹理等控制无关变化,或多任务梯度冲突、未来 horizon 不合适。

原始资料

FLARE 代表隐式未来;Fast-WAM 拆分训练期视频建模与推理期想象;OA-WAM 探索对象可寻址未来表示。