先记住一句话

真实 robot demo 提供可执行动作,人类视频提供规模与语义,仿真提供覆盖和精确标签,自主数据提供 policy 自己会遇到的状态;没有一种来源能单独解决全部问题。

能力缺口选择数据来源定义 coverage grid采集 + 在线 QA标注成功/介入小训验收
Demo可执行正例
+
Correction偏离后的恢复
+
Simulation覆盖 + 真值
+
Human video语义 + 规模
数据组合应由能力缺口驱动,并明确每种来源能监督哪些 loss。

1. 数据来源的能力矩阵

来源动作标签优势主要偏差
人类遥操作真实接触、目标明确、可快速教新技能操作者风格、延迟、只覆盖专家轨迹
kinesthetic / leader-follower精细双臂与接触动作硬件昂贵、示范人体工学限制
仿真/规划器有且精确规模、状态真值、失败与反事实视觉和动力学 sim-to-real gap
人类视频通常无 robot action超大规模、对象交互、任务语义手与机器人本体差异、动作不可直接执行
自主 rollout覆盖 policy-induced distribution大量失败、风险与自我强化偏差

2. 为什么只收成功 demo 仍会失败

behavior cloning 只看到专家常走的窄轨迹。一旦模型有小误差,状态会偏离示范分布,接下来再也没有正确样本指导它回来,这就是 covariate shift。可用几类办法补洞:

  • 采集恢复、重抓、推回、退出碰撞等 correction data。
  • 让当前 policy rollout,人类在必要时介入,记录 intervention。
  • 系统加入起始位姿、对象、光照、背景与相机扰动。
  • 保留失败并标注原因,用于价值、成功预测或对比监督;不要直接把失败动作当正例 BC。

3. 任务覆盖不是对象数量

一个真正有用的 coverage grid 至少含:技能(抓/放/插/倒)、对象属性(大小、柔软、透明)、几何位置、场景、语言表达、任务长度、扰动类型和失败恢复。只换 100 个颜色不同的杯子,仍可能只覆盖同一个 grasp manifold。

4. 人类视频怎样被利用

没有机器人 action 时,不能直接监督 action head,但可以训练视觉表征、未来预测、目标状态、手/物体轨迹或 latent action。随后用少量 robot data 把“观察到的意图和变化”接到可执行控制。GR00T N1.5 的 FLARE 路线就是用 future latent alignment 让无 action 的人类 ego video 参与世界表征训练。

5. 收数据前先定义验收协议

  1. 明确成功终态与允许的中间策略,不只写自然语言任务名。
  2. 规定 reset 分布,避免 collector 每次把对象放同一点。
  3. 记录中止、重录、失败和 intervention,而非只留“漂亮视频”。
  4. 实时看相机、state/action、帧率、drop 和磁盘,坏数据越晚发现越贵。
  5. 每天做小规模训练/replay sanity check,避免收完一周才发现动作含义反了。

6. 采集计划的数字账本

例 1:工时与轨迹数

8 位操作者,每人每天 6 小时,每条轨迹含 reset 平均 90 s:一天理论上 $8×6×3600/90=1{,}920$ 条。若 QA 淘汰 15%,可用约 1,632 条。

例 2:成功数据不是全部信息

1,000 次 rollout 中 650 成功、200 可恢复失败、150 硬失败。BC 正例成功率是 65%;若只保存 650 条,模型完全看不到占 35% 的失败状态。

例 3:coverage grid

4 种技能 × 5 类对象 × 3 个位置区 × 2 种光照 = 120 cells。若每 cell 目标 20 条,至少需 2,400 条。

例 4:存储预算

两路压缩视频各 3 MB/s,加 state/action 0.2 MB/s,一条 30 s episode 约 $(3+3+0.2)×30=186$ MB;10,000 条约 1.86 TB。

规模的真义:

DROID 的价值不只是 76k trajectories,而是跨 564 scenes、86 tasks、50 collectors 的真实分布变化;Open X-Embodiment 的价值则是跨机构和跨机器人组合经验。

自测

1. 为什么人类视频不能直接当 robot BC action?

人体本体、动力学和控制接口不同,而且视频通常没有与 robot command 同语义的动作标签。

2. correction data 在补什么?

补 policy 偏离专家轨迹后会访问的状态以及从这些状态恢复的动作。

3. 为什么数据 diversity 不等于对象数?

泛化还由技能、几何、场景、语言、时间长度和扰动等多个轴决定。

原始资料

DROIDOpen X-EmbodimentBridgeData V2 展示三种规模化真实数据路径;FLARE 展示无动作视频共训。