先记住一句话

预训练建立宽能力,robot co-training 建立动作接口,SFT/finetune 把能力压到目标任务;每一阶段都要决定数据 mixture、可训练参数和需要保留的旧能力。

VLM / video pretrainrobot action co-traintarget-domain SFTrollout datapost-trainregression suite
阶段 1学语义与世界表示
阶段 2学通用动作接口
阶段 3目标硬件适配
守门新能力 ↑,旧能力不崩
每次阶段切换都改变数据、可训练参数和优化目标,必须保留可比较 checkpoint。

1. 一条常见 curriculum

Internet image-text / VLM
          ↓ semantic prior
human + robot video prediction / future latent
          ↓ physical visual representation
heterogeneous robot action pretraining
          ↓ generalist VLA policy
target embodiment multi-task SFT
          ↓ deployable base policy
rollout / intervention / reward post-training
          ↓ robust specialist

实际项目可跳过部分阶段,但必须知道缺失信号会由哪里补。只有小型目标域 demo 时,通常冻结大部分 VLM 并训练 action modules;数据足够大才考虑联合更新。

2. Staged 与 joint co-training

Staged

先 video/domain adaptation,再 action training。调试清晰,能用无动作数据;阶段切换可能遗忘。

Joint

视频、语言、action 多目标同时训练。表示协同,但 mixture 和 gradient conflict 更难控制。

常见折中是交替 batch:有动作 episode 算 action + future loss,无动作 human/video batch 只算 future/representation loss,通过 mask 保持统一训练循环。

3. 冻结、全量微调与 adapter

策略何时合适风险
冻结 VLM目标数据少,预训练语义强难适应特殊视角/空间细节
只训 adapter/action head快速适配和多机器人瓶颈容量不足
LoRA/部分解冻需要视觉域适配又要保知识选择层和 LR 敏感
全量微调大规模、多样目标数据昂贵、灾难性遗忘

4. Loss 与 batch 不应靠直觉配

记录每个 objective 的 raw loss、加权 loss、gradient norm 和有效 token 数。视频 MSE 与 action MSE 数值相近,不代表对 shared backbone 的影响相近。可用固定比例、uncertainty weighting、gradient balancing,或更简单地交替优化;选择应由 matched ablation 支撑。

5. SFT 的真正作用

机器人 SFT 本质上是 behavior cloning:在目标条件下提高 demo action likelihood。它能教会新动作空间、相机、task vocabulary 和控制风格,但不能自动修复 covariate shift。高质量、覆盖 reset 分布的少量数据通常比重复的海量帧更有价值。

6. 防止“专精后变笨”

  • 保留一部分 pretraining/generalist replay data。
  • 对冻结 teacher 做 feature/logit/action distillation。
  • 使用低学习率、adapter 或分层学习率。
  • 同时跟踪目标成功率和原有 capability suite。
  • 按 task/robot 检查 regression,而非只看总体平均。

7. 进入后训练前的门槛

基础 policy 至少要在安全 reset 分布上偶尔成功,数据/action 语义已验证,rollout 系统能准确记录 observation、committed action、奖励、intervention 和 policy version。否则 RL/online improvement 只会放大系统 bug。

8. Curriculum 的四个计算

例 1:交替 batch

每 10 个 batch 中 6 个 robot action、3 个 human video、1 个 target SFT,则长期占比 60%/30%/10%。Action loss 只在 7 个有动作来源的 batch 上有效。

例 2:加权多任务 loss

Raw video/action loss 为 0.8/0.1,权重 0.5/4,总 loss=$0.5×0.8+4×0.1=0.8$。两项贡献各 0.4,但 shared gradient 仍可能方向冲突。

例 3:分层学习率

VLM LR=$1e-5$、connector=$5e-5$、action head=$1e-4$;后两者分别是 VLM 的 5 倍与 10 倍,使新接口更新更快。

例 4:防遗忘 replay

Fine-tune 100k samples,目标域 80%、generalist replay 20%,即每 epoch 80k/20k。若 generalist suite 从 75% 掉到 60%,绝不能只报告目标任务从 40% 升到 85%。

术语边界:

广义 post-training 可以包含目标域 SFT;下一篇专门讨论基础 SFT 之后,利用 policy 自身 rollout、价值、奖励和人类纠错继续优化。

自测

1. 为什么无 action 视频能进入 joint curriculum?

它可提供 future/representation loss,action loss 用 mask 跳过。

2. 小数据微调为什么常冻结 VLM?

减少过拟合和语义遗忘,把有限监督集中到动作接口。

3. 为什么 SFT 不能解决所有闭环失败?

它主要学习 demo 分布,policy 偏离后访问的状态仍缺监督。

原始资料

GR00T N1 展示异构数据 mixture;GR00T N1.5 展示冻结 VLM、FLARE 与目标 robot post-training;OpenVLA 展示 generalist pretrain 后高效微调。