先记住一句话
离线指标回答“是否拟合记录数据”,闭环成功率回答“自己的动作能否持续把世界推向目标”;二者都需要,但不能互相替代。
1. 四层证据
| 层级 | 测量 | 适合发现 | 不能证明 |
|---|---|---|---|
| Unit/data | shape、mask、反归一化、replay | pipeline bug | 策略能力 |
| Offline open-loop | action error、NLL、视频 loss | 拟合、训练稳定 | 闭环恢复 |
| Simulation closed-loop | success、progress、collision | 大规模因果执行 | 真实视觉/接触 |
| Real robot | 任务成功、安全、延迟 | 最终系统价值 | 未覆盖分布的普遍性 |
2. 为什么 action MSE 会骗人
- 多峰专家动作中,另一条成功路径会被算成高误差。
- 位置误差小不代表 gripper timing 正确。
- 每步小 bias 在 rollout 中积分成大偏移。
- test frames 与 train frames 同场景泄漏。
- 模型可能复制当前 state,在静止段得到很好数字。
离线仍有用:逐维误差、horizon-wise error、gripper F1、trajectory smoothness、future latent/video metrics 可快速定位问题,但要与 rollout 相关性一起看。
3. 成功率也需要实验设计
报告 trial 数和置信区间;固定 reset protocol;盲化或脚本化 success 判定;记录 timeout、collision、human intervention 与部分进度。20 次里 16 次成功,不等于一个精确的 80% 真值。
4. OOD 要分轴,而不是统称 generalization
- 新对象实例 / 类别 /材质。
- 新位置、朝向、容器与几何。
- 新背景、光照、干扰物与人。
- 新相机位姿或缺失视角。
- 语言 paraphrase、组合与否定。
- 新任务组合、长度与恢复。
- 新 embodiment 或 controller。
每次只系统改变一两个轴,才能知道模型依赖什么。把所有东西一起换掉只说明“失败”,不能指导下一轮。
5. 评测 WAM 的附加维度
- world quality:未来对象/几何/接触是否正确,而非只看像素 PSNR。
- action quality:joint vs action-only inference 的成功率。
- causal use:swap/mask future representations 后动作如何变化。
- efficiency:video/action steps、token 数、缓存和端到端 latency。
- long-horizon stability:闭环反复想象时是否 drift。
6. 一个最小评测表
model/checkpoint + dataset revision + code commit
task / reset seed / object / scene / camera condition
success / progress / failure taxonomy / intervention
inference P50/P95 / control Hz / GPU / action steps
video + state + proposed action + executed action视频不是装饰,而是可审计的证据。定量表旁随机抽样全部结果,不能只挑成功案例。
7. 四个评测数字
例 1:成功率与标准误
50 次成功 40 次,估计 $p=0.8$。近似标准误 $√(0.8×0.2/50)=0.0566$,95% 区间粗略为 $0.8±1.96×0.0566≈[0.689,0.911]$。
例 2:相对与绝对提升
Baseline 60%,新模型 72%。绝对提升 12 个百分点;相对提升 $(72-60)/60=20%$。两种说法不能混用。
例 3:分层汇总
简单任务 90/100,困难任务 10/20,总体 100/120=83.3%。若按任务层等权,平均为 $(90%+50%)/2=70%$;必须说明权重。
例 4:P50 与 P95
100 次 inference 中大多数 60 ms,但最慢 5 次约 180 ms,则 P50 约 60 ms、P95 接近 180 ms。控制 buffer 必须按尾延迟而非均值设计。
只改变一个主要因素。模型、数据、训练步数、action representation、采样步数和控制频率同时变化时,结果不能归因于某个 technique。
自测
1. action loss 低为何仍可能 rollout 失败?
闭环会进入训练未覆盖状态,小误差累积;loss 也无法完整衡量多峰动作和任务终态。
2. 为什么要报告 trial 数?
成功率是有限 Bernoulli 试验估计,样本少时不确定性很大。
3. OOD 为什么要拆轴?
控制变量后才能定位模型对对象、几何、场景、语言或本体中哪一项泛化。