先记住一句话
真实 robot demo 提供可执行动作,人类视频提供规模与语义,仿真提供覆盖和精确标签,自主数据提供 policy 自己会遇到的状态;没有一种来源能单独解决全部问题。
1. 数据来源的能力矩阵
| 来源 | 动作标签 | 优势 | 主要偏差 |
|---|---|---|---|
| 人类遥操作 | 有 | 真实接触、目标明确、可快速教新技能 | 操作者风格、延迟、只覆盖专家轨迹 |
| kinesthetic / leader-follower | 有 | 精细双臂与接触动作 | 硬件昂贵、示范人体工学限制 |
| 仿真/规划器 | 有且精确 | 规模、状态真值、失败与反事实 | 视觉和动力学 sim-to-real gap |
| 人类视频 | 通常无 robot action | 超大规模、对象交互、任务语义 | 手与机器人本体差异、动作不可直接执行 |
| 自主 rollout | 有 | 覆盖 policy-induced distribution | 大量失败、风险与自我强化偏差 |
2. 为什么只收成功 demo 仍会失败
behavior cloning 只看到专家常走的窄轨迹。一旦模型有小误差,状态会偏离示范分布,接下来再也没有正确样本指导它回来,这就是 covariate shift。可用几类办法补洞:
- 采集恢复、重抓、推回、退出碰撞等 correction data。
- 让当前 policy rollout,人类在必要时介入,记录 intervention。
- 系统加入起始位姿、对象、光照、背景与相机扰动。
- 保留失败并标注原因,用于价值、成功预测或对比监督;不要直接把失败动作当正例 BC。
3. 任务覆盖不是对象数量
一个真正有用的 coverage grid 至少含:技能(抓/放/插/倒)、对象属性(大小、柔软、透明)、几何位置、场景、语言表达、任务长度、扰动类型和失败恢复。只换 100 个颜色不同的杯子,仍可能只覆盖同一个 grasp manifold。
4. 人类视频怎样被利用
没有机器人 action 时,不能直接监督 action head,但可以训练视觉表征、未来预测、目标状态、手/物体轨迹或 latent action。随后用少量 robot data 把“观察到的意图和变化”接到可执行控制。GR00T N1.5 的 FLARE 路线就是用 future latent alignment 让无 action 的人类 ego video 参与世界表征训练。
5. 收数据前先定义验收协议
- 明确成功终态与允许的中间策略,不只写自然语言任务名。
- 规定 reset 分布,避免 collector 每次把对象放同一点。
- 记录中止、重录、失败和 intervention,而非只留“漂亮视频”。
- 实时看相机、state/action、帧率、drop 和磁盘,坏数据越晚发现越贵。
- 每天做小规模训练/replay sanity check,避免收完一周才发现动作含义反了。
6. 采集计划的数字账本
例 1:工时与轨迹数
8 位操作者,每人每天 6 小时,每条轨迹含 reset 平均 90 s:一天理论上 $8×6×3600/90=1{,}920$ 条。若 QA 淘汰 15%,可用约 1,632 条。
例 2:成功数据不是全部信息
1,000 次 rollout 中 650 成功、200 可恢复失败、150 硬失败。BC 正例成功率是 65%;若只保存 650 条,模型完全看不到占 35% 的失败状态。
例 3:coverage grid
4 种技能 × 5 类对象 × 3 个位置区 × 2 种光照 = 120 cells。若每 cell 目标 20 条,至少需 2,400 条。
例 4:存储预算
两路压缩视频各 3 MB/s,加 state/action 0.2 MB/s,一条 30 s episode 约 $(3+3+0.2)×30=186$ MB;10,000 条约 1.86 TB。
DROID 的价值不只是 76k trajectories,而是跨 564 scenes、86 tasks、50 collectors 的真实分布变化;Open X-Embodiment 的价值则是跨机构和跨机器人组合经验。
自测
1. 为什么人类视频不能直接当 robot BC action?
人体本体、动力学和控制接口不同,而且视频通常没有与 robot command 同语义的动作标签。
2. correction data 在补什么?
补 policy 偏离专家轨迹后会访问的状态以及从这些状态恢复的动作。
3. 为什么数据 diversity 不等于对象数?
泛化还由技能、几何、场景、语言、时间长度和扰动等多个轴决定。
原始资料
DROID、Open X-Embodiment 与 BridgeData V2 展示三种规模化真实数据路径;FLARE 展示无动作视频共训。