先记住一句话

跨本体学习不是把动作补零后混训,而是把可迁移的任务空间规律共享,把机器人特定的 sensor/action interface 显式条件化或参数隔离。

per-robot schema统一 task-space / slotsembodiment conditionshared backbone专用 decoderleave-one-robot-out eval
共享vision + language + task structure
条件化robot ID / morphology
隔离state/action adapters
执行robot-specific controller
共享越靠语义越自然;越接近电机与关节,越需要本体专用接口。

1. 哪些知识有机会共享

  • 语言目标、对象类别、属性和语义关系。
  • reach → grasp → transport → place 等技能结构。
  • 对象运动与接触后的视觉变化。
  • 末端在任务空间中的局部运动模式。

较难直接共享的是 joint topology、workspace、controller 响应、hand DOF、相机安装和动作频率。越靠高层语义越容易共享,越靠底层动力学越需要 embodiment 信息。

2. 三种统一接口

接口方法适用边界
统一 EEF都转成相对 SE(3) + gripper/hand机械臂相似时强;全身/灵巧手信息可能丢失
统一 padded vector补到 max dim + dimension mask工程简单;维度位置要有稳定语义
token/slot schema按 body part/actuator 编码 token拓扑灵活;需要更复杂 positional/type encoding

3. 告诉模型“我是谁”

可用 embodiment ID/token、robot description、kinematic parameters 或图结构。只给 ID 能记住训练机器人,但难零样本泛化;给关节限制、link geometry、camera pose 等结构描述,更可能迁移到新本体,却要求数据 schema 一致。

4. 参数共享的粒度

全共享 + ID

参数效率高,易正迁移;冲突大时互相干扰。

共享 backbone + 专用 head

语义共享、动作解码隔离;新增 robot 需新 head。

Category-specific layers

只让 action/state projection 按 embodiment 选择矩阵;主 Transformer 共享。

MoE / adapters

按本体或 token 路由部分参数,容量更大但训练/负载复杂。

一个实用折中是共享视觉与 Transformer,让 action/state encoder/decoder 使用 per-embodiment 参数;动作维度 padding 后以 mask 排除不存在的维度。

5. Mixture imbalance 与负迁移

大数据 robot 会统治 gradient,小数据 robot 可能只成为噪声。需要按 robot/task 分层采样,并报告每个 embodiment 的 performance,而非只报总体均值。负迁移可通过 gradient similarity、per-domain loss、leave-one-robot-out ablation 检查。

6. 什么才算跨本体泛化

  1. 同任务、训练过的 robot:只是多域训练。
  2. 新任务、训练过的 robot:任务泛化。
  3. 新 robot、少量 finetune:transfer/adaptation。
  4. 完全没见过 robot、仅给 morphology:严格 zero-shot embodiment generalization。

论文与实验必须说清是哪一层,不能把“9 个 robot 上分别微调成功”写成零样本 generalist。

7. 跨本体的四个数字

例 1:padding mask

Robot A 有 7 维动作、B 有 12 维,统一到 12。A 的 mask 是前 7 个 1、后 5 个 0;若未 mask,5 个虚维会占 $5/12=41.7%$ 的逐维 loss。

例 2:mixture imbalance

A 有 1M windows、B 有 50k。按 window 均匀,B 概率 $50k/1.05M≈4.76%$;按 robot 均匀则 50%,相当于对 B 过采 10.5 倍。

例 3:任务空间尺度

同一个 normalized delta 0.5,若 A 每步最大 4 cm,命令 2 cm;B 最大 10 cm,命令 5 cm。共享 normalized policy 仍必须用 per-robot scale 解码。

例 4:少样本适配

从零训练需 20k demos 达到 70% success;预训练初始化用 2k 达到 70%,样本效率提升 10 倍。应同时报告最终上限,避免只看达到阈值的速度。

最实用的目标:

先追求一个强 pretrained initialization,能用少量目标 robot 数据快速适配;这通常比直接追求陌生硬件零样本控制更可验证。

自测

1. 为什么相对 EEF action 便于共享?

它抽象掉部分关节拓扑,以任务空间局部运动表达意图。

2. padding 后为何还要 embodiment-specific layer?

同一维度位置在不同 robot 上可能有不同语义/尺度,控制映射也不同。

3. “cross-embodiment”最容易被混淆的评测是什么?

在训练见过的多个 robot 上测试,不代表对未见 robot 的零样本泛化。

原始资料

Open X-Embodiment / RT-X 提供跨 22 个 robot 的标准化数据研究;Octo 研究对新 sensor/action space 的适配。