先记住一句话
预训练建立宽能力,robot co-training 建立动作接口,SFT/finetune 把能力压到目标任务;每一阶段都要决定数据 mixture、可训练参数和需要保留的旧能力。
1. 一条常见 curriculum
Internet image-text / VLM
↓ semantic prior
human + robot video prediction / future latent
↓ physical visual representation
heterogeneous robot action pretraining
↓ generalist VLA policy
target embodiment multi-task SFT
↓ deployable base policy
rollout / intervention / reward post-training
↓ robust specialist实际项目可跳过部分阶段,但必须知道缺失信号会由哪里补。只有小型目标域 demo 时,通常冻结大部分 VLM 并训练 action modules;数据足够大才考虑联合更新。
2. Staged 与 joint co-training
Staged
先 video/domain adaptation,再 action training。调试清晰,能用无动作数据;阶段切换可能遗忘。
Joint
视频、语言、action 多目标同时训练。表示协同,但 mixture 和 gradient conflict 更难控制。
常见折中是交替 batch:有动作 episode 算 action + future loss,无动作 human/video batch 只算 future/representation loss,通过 mask 保持统一训练循环。
3. 冻结、全量微调与 adapter
| 策略 | 何时合适 | 风险 |
|---|---|---|
| 冻结 VLM | 目标数据少,预训练语义强 | 难适应特殊视角/空间细节 |
| 只训 adapter/action head | 快速适配和多机器人 | 瓶颈容量不足 |
| LoRA/部分解冻 | 需要视觉域适配又要保知识 | 选择层和 LR 敏感 |
| 全量微调 | 大规模、多样目标数据 | 昂贵、灾难性遗忘 |
4. Loss 与 batch 不应靠直觉配
记录每个 objective 的 raw loss、加权 loss、gradient norm 和有效 token 数。视频 MSE 与 action MSE 数值相近,不代表对 shared backbone 的影响相近。可用固定比例、uncertainty weighting、gradient balancing,或更简单地交替优化;选择应由 matched ablation 支撑。
5. SFT 的真正作用
机器人 SFT 本质上是 behavior cloning:在目标条件下提高 demo action likelihood。它能教会新动作空间、相机、task vocabulary 和控制风格,但不能自动修复 covariate shift。高质量、覆盖 reset 分布的少量数据通常比重复的海量帧更有价值。
6. 防止“专精后变笨”
- 保留一部分 pretraining/generalist replay data。
- 对冻结 teacher 做 feature/logit/action distillation。
- 使用低学习率、adapter 或分层学习率。
- 同时跟踪目标成功率和原有 capability suite。
- 按 task/robot 检查 regression,而非只看总体平均。
7. 进入后训练前的门槛
基础 policy 至少要在安全 reset 分布上偶尔成功,数据/action 语义已验证,rollout 系统能准确记录 observation、committed action、奖励、intervention 和 policy version。否则 RL/online improvement 只会放大系统 bug。
8. Curriculum 的四个计算
例 1:交替 batch
每 10 个 batch 中 6 个 robot action、3 个 human video、1 个 target SFT,则长期占比 60%/30%/10%。Action loss 只在 7 个有动作来源的 batch 上有效。
例 2:加权多任务 loss
Raw video/action loss 为 0.8/0.1,权重 0.5/4,总 loss=$0.5×0.8+4×0.1=0.8$。两项贡献各 0.4,但 shared gradient 仍可能方向冲突。
例 3:分层学习率
VLM LR=$1e-5$、connector=$5e-5$、action head=$1e-4$;后两者分别是 VLM 的 5 倍与 10 倍,使新接口更新更快。
例 4:防遗忘 replay
Fine-tune 100k samples,目标域 80%、generalist replay 20%,即每 epoch 80k/20k。若 generalist suite 从 75% 掉到 60%,绝不能只报告目标任务从 40% 升到 85%。
广义 post-training 可以包含目标域 SFT;下一篇专门讨论基础 SFT 之后,利用 policy 自身 rollout、价值、奖励和人类纠错继续优化。
自测
1. 为什么无 action 视频能进入 joint curriculum?
它可提供 future/representation loss,action loss 用 mask 跳过。
2. 小数据微调为什么常冻结 VLM?
减少过拟合和语义遗忘,把有限监督集中到动作接口。
3. 为什么 SFT 不能解决所有闭环失败?
它主要学习 demo 分布,policy 偏离后访问的状态仍缺监督。
原始资料
GR00T N1 展示异构数据 mixture;GR00T N1.5 展示冻结 VLM、FLARE 与目标 robot post-training;OpenVLA 展示 generalist pretrain 后高效微调。