先记住一句话
跨本体学习不是把动作补零后混训,而是把可迁移的任务空间规律共享,把机器人特定的 sensor/action interface 显式条件化或参数隔离。
1. 哪些知识有机会共享
- 语言目标、对象类别、属性和语义关系。
- reach → grasp → transport → place 等技能结构。
- 对象运动与接触后的视觉变化。
- 末端在任务空间中的局部运动模式。
较难直接共享的是 joint topology、workspace、controller 响应、hand DOF、相机安装和动作频率。越靠高层语义越容易共享,越靠底层动力学越需要 embodiment 信息。
2. 三种统一接口
| 接口 | 方法 | 适用边界 |
|---|---|---|
| 统一 EEF | 都转成相对 SE(3) + gripper/hand | 机械臂相似时强;全身/灵巧手信息可能丢失 |
| 统一 padded vector | 补到 max dim + dimension mask | 工程简单;维度位置要有稳定语义 |
| token/slot schema | 按 body part/actuator 编码 token | 拓扑灵活;需要更复杂 positional/type encoding |
3. 告诉模型“我是谁”
可用 embodiment ID/token、robot description、kinematic parameters 或图结构。只给 ID 能记住训练机器人,但难零样本泛化;给关节限制、link geometry、camera pose 等结构描述,更可能迁移到新本体,却要求数据 schema 一致。
4. 参数共享的粒度
全共享 + ID
参数效率高,易正迁移;冲突大时互相干扰。
共享 backbone + 专用 head
语义共享、动作解码隔离;新增 robot 需新 head。
Category-specific layers
只让 action/state projection 按 embodiment 选择矩阵;主 Transformer 共享。
MoE / adapters
按本体或 token 路由部分参数,容量更大但训练/负载复杂。
一个实用折中是共享视觉与 Transformer,让 action/state encoder/decoder 使用 per-embodiment 参数;动作维度 padding 后以 mask 排除不存在的维度。
5. Mixture imbalance 与负迁移
大数据 robot 会统治 gradient,小数据 robot 可能只成为噪声。需要按 robot/task 分层采样,并报告每个 embodiment 的 performance,而非只报总体均值。负迁移可通过 gradient similarity、per-domain loss、leave-one-robot-out ablation 检查。
6. 什么才算跨本体泛化
- 同任务、训练过的 robot:只是多域训练。
- 新任务、训练过的 robot:任务泛化。
- 新 robot、少量 finetune:transfer/adaptation。
- 完全没见过 robot、仅给 morphology:严格 zero-shot embodiment generalization。
论文与实验必须说清是哪一层,不能把“9 个 robot 上分别微调成功”写成零样本 generalist。
7. 跨本体的四个数字
例 1:padding mask
Robot A 有 7 维动作、B 有 12 维,统一到 12。A 的 mask 是前 7 个 1、后 5 个 0;若未 mask,5 个虚维会占 $5/12=41.7%$ 的逐维 loss。
例 2:mixture imbalance
A 有 1M windows、B 有 50k。按 window 均匀,B 概率 $50k/1.05M≈4.76%$;按 robot 均匀则 50%,相当于对 B 过采 10.5 倍。
例 3:任务空间尺度
同一个 normalized delta 0.5,若 A 每步最大 4 cm,命令 2 cm;B 最大 10 cm,命令 5 cm。共享 normalized policy 仍必须用 per-robot scale 解码。
例 4:少样本适配
从零训练需 20k demos 达到 70% success;预训练初始化用 2k 达到 70%,样本效率提升 10 倍。应同时报告最终上限,避免只看达到阈值的速度。
先追求一个强 pretrained initialization,能用少量目标 robot 数据快速适配;这通常比直接追求陌生硬件零样本控制更可验证。
自测
1. 为什么相对 EEF action 便于共享?
它抽象掉部分关节拓扑,以任务空间局部运动表达意图。
2. padding 后为何还要 embodiment-specific layer?
同一维度位置在不同 robot 上可能有不同语义/尺度,控制映射也不同。
3. “cross-embodiment”最容易被混淆的评测是什么?
在训练见过的多个 robot 上测试,不代表对未见 robot 的零样本泛化。
原始资料
Open X-Embodiment / RT-X 提供跨 22 个 robot 的标准化数据研究;Octo 研究对新 sensor/action space 的适配。