先记住一句话

离线指标回答“是否拟合记录数据”,闭环成功率回答“自己的动作能否持续把世界推向目标”;二者都需要,但不能互相替代。

unit/data checksoffline open-loopsim closed-loopreal canaryOOD axesfailure taxonomy
便宜shape / loss / replay
因果执行simulation rollout
真实证据robot trials
解释CI + breakdown + videos
评测逐级变贵,因此先用便宜门禁排 bug,再把真机预算花在可信候选上。

1. 四层证据

层级测量适合发现不能证明
Unit/datashape、mask、反归一化、replaypipeline bug策略能力
Offline open-loopaction error、NLL、视频 loss拟合、训练稳定闭环恢复
Simulation closed-loopsuccess、progress、collision大规模因果执行真实视觉/接触
Real robot任务成功、安全、延迟最终系统价值未覆盖分布的普遍性

2. 为什么 action MSE 会骗人

  • 多峰专家动作中,另一条成功路径会被算成高误差。
  • 位置误差小不代表 gripper timing 正确。
  • 每步小 bias 在 rollout 中积分成大偏移。
  • test frames 与 train frames 同场景泄漏。
  • 模型可能复制当前 state,在静止段得到很好数字。

离线仍有用:逐维误差、horizon-wise error、gripper F1、trajectory smoothness、future latent/video metrics 可快速定位问题,但要与 rollout 相关性一起看。

3. 成功率也需要实验设计

报告 trial 数和置信区间;固定 reset protocol;盲化或脚本化 success 判定;记录 timeout、collision、human intervention 与部分进度。20 次里 16 次成功,不等于一个精确的 80% 真值。

4. OOD 要分轴,而不是统称 generalization

  • 新对象实例 / 类别 /材质。
  • 新位置、朝向、容器与几何。
  • 新背景、光照、干扰物与人。
  • 新相机位姿或缺失视角。
  • 语言 paraphrase、组合与否定。
  • 新任务组合、长度与恢复。
  • 新 embodiment 或 controller。

每次只系统改变一两个轴,才能知道模型依赖什么。把所有东西一起换掉只说明“失败”,不能指导下一轮。

5. 评测 WAM 的附加维度

  1. world quality:未来对象/几何/接触是否正确,而非只看像素 PSNR。
  2. action quality:joint vs action-only inference 的成功率。
  3. causal use:swap/mask future representations 后动作如何变化。
  4. efficiency:video/action steps、token 数、缓存和端到端 latency。
  5. long-horizon stability:闭环反复想象时是否 drift。

6. 一个最小评测表

model/checkpoint + dataset revision + code commit
task / reset seed / object / scene / camera condition
success / progress / failure taxonomy / intervention
inference P50/P95 / control Hz / GPU / action steps
video + state + proposed action + executed action

视频不是装饰,而是可审计的证据。定量表旁随机抽样全部结果,不能只挑成功案例。

7. 四个评测数字

例 1:成功率与标准误

50 次成功 40 次,估计 $p=0.8$。近似标准误 $√(0.8×0.2/50)=0.0566$,95% 区间粗略为 $0.8±1.96×0.0566≈[0.689,0.911]$。

例 2:相对与绝对提升

Baseline 60%,新模型 72%。绝对提升 12 个百分点;相对提升 $(72-60)/60=20%$。两种说法不能混用。

例 3:分层汇总

简单任务 90/100,困难任务 10/20,总体 100/120=83.3%。若按任务层等权,平均为 $(90%+50%)/2=70%$;必须说明权重。

例 4:P50 与 P95

100 次 inference 中大多数 60 ms,但最慢 5 次约 180 ms,则 P50 约 60 ms、P95 接近 180 ms。控制 buffer 必须按尾延迟而非均值设计。

比较原则:

只改变一个主要因素。模型、数据、训练步数、action representation、采样步数和控制频率同时变化时,结果不能归因于某个 technique。

自测

1. action loss 低为何仍可能 rollout 失败?

闭环会进入训练未覆盖状态,小误差累积;loss 也无法完整衡量多峰动作和任务终态。

2. 为什么要报告 trial 数?

成功率是有限 Bernoulli 试验估计,样本少时不确定性很大。

3. OOD 为什么要拆轴?

控制变量后才能定位模型对对象、几何、场景、语言或本体中哪一项泛化。

基准资料

Octo 在多平台上做适配评测;OpenVLA 报告多任务/多本体闭环;DROID 展示场景与对象分布对鲁棒性的影响。