先记住一句话
Offline RL 的核心风险是对 dataset 未覆盖 action 的 Q 外推过高;model-based RL 的核心风险是策略主动利用 learned dynamics 的模型误差。
1. BC、Off-policy RL 与 Offline RL
| 方法 | 数据 | 学习目标 |
|---|---|---|
| Behavior Cloning | 固定 demonstrations | 最大似然模仿 action,不显式用 reward |
| Online off-policy RL | replay + 持续新交互 | 可用新数据纠正 critic/policy |
| Offline RL | 训练期间完全固定 dataset | 利用 reward 改进 behavior,但不能在线验证 |
BC 简单稳定,却会模仿好坏样本且遇到 covariate shift;offline RL 试图从混合质量数据选出更好行为,但改得越远,越可能离开数据 support。
2. Extrapolation error
Bellman target 需要下一状态的高价值 action。若 actor/Q maximization 选到 dataset 中没出现的 action,network 可能凭函数外推给它虚高 Q;没有在线环境返回真实后果,错误会 bootstrap 放大。
dataset action coverage 低 → unseen-action Q error → policy selects error → target error compounds3. CQL:让 Q 更保守
Conservative Q-Learning 在 Bellman error 外增加 regularizer:压低 policy/广泛采样 action 的 Q,相对抬高 dataset action 的 Q,使 learned policy 的 value estimate 更保守。它避免盲目相信 OOD action,代价是可能过度保守,且 penalty 权重需要调节。
4. IQL:不在训练 target 查询未见 action
- 用 expectile regression 从 dataset actions 的 Q 拟合高 expectile
V(s); - 用
r+γV(s')训练 Q,target 不显式对 OOD action max; - 按
exp(β A(s,a))加权 behavior cloning,让高 advantage dataset actions 权重更大。
expectile 越高越偏向 dataset 内较优 action;temperature 决定 actor 离 behavior 多远。IQL 仍依赖数据里存在可组合的好行为,不能凭空创造未覆盖技能。
5. Offline-to-online
常见机器人路径是 demonstrations/offline logs 预训练,再谨慎 online fine-tune。切换时需处理 critic calibration、exploration、replay 新旧比例和安全 constraint;一个 offline 高分 policy 直接加大探索噪声可能危险。
6. Model-based RL
real data D → learn dynamics p(z_{t+1}|z_t,a_t), reward, continuation
↓
imagined rollouts
↓
train actor + critic
↓
collect selected new real data
已知模型可直接做 planning/MPC;learned world model 则从 observations 学 latent dynamics。Dyna 混合 real 与 simulated updates;Dreamer 在 latent model 中想象 trajectory 并训练 actor/critic。
7. World model 学什么
- encoder 把高维 observation 压成 latent state;
- dynamics 预测 action 后 latent 如何变化;
- reward/continuation head 预测回报与终止;
- decoder/reconstruction 或 representation losses 保持信息;
- actor/critic 在 imagined latent trajectory 上优化。
像素重建很准不等于 control-relevant dynamics 准;模型可能浪费容量预测纹理,却漏掉接触、不可逆事件和 rare failure。
8. Model bias 和 uncertainty
长 imagined rollout 会复合误差,actor 还会寻找模型“漏洞”。常见缓解包括短 rollout、model ensemble/uncertainty penalty、定期收真实数据、latent regularization、保守 planning 和只在数据 support 内优化。
9. 选择地图
| 条件 | 优先 baseline | 原因 |
|---|---|---|
| 只有高质量 expert data | BC / diffusion/flow policy | 先建立可用策略,避免 value error |
| 固定混合质量带 reward 数据 | IQL/CQL + BC baseline | 显式管理 OOD action |
| 可持续交互但很昂贵 | SAC/TD3 或 model-based | 重用 experience / imagined data |
| 像素输入、跨多任务、需规划 | world model/Dreamer 类 | 学习 latent dynamics 与 imagination |
| 仿真极便宜且并行 | PPO baseline | 系统简单,吞吐弥补 sample reuse |
10. 四个 offline/model-based 手算
例 1:behavior cloning NLL
Dataset action 在 policy 下概率为 0.25,单样本 BC loss=−log(0.25)=1.386;把概率提升到 0.5 后 loss=0.693。BC 只奖励复现 dataset action,不直接看 return。
例 2:conservative Q gap
Critic 对 dataset action 估 Q=4,对未见 action 估 Q=9。若 regularizer 简化为 λ(Q_ood−Q_data) 且 λ=0.2,额外 penalty=0.2×5=1,迫使 OOD 乐观付出代价。
例 3:IQL advantage weighting
Dataset action Q=6、state value V=4,advantage=2。温度 β=0.5 时 imitation weight=exp(βA)=exp(1)≈2.718;Q=3 的 action advantage=−1,weight≈0.607。
例 4:model error 复合
若每一步 position prediction 最坏误差增加 2 cm,忽略反馈耦合,10-step rollout 已可能偏 20 cm。若真实 dynamics 又随偏差改变,误差可更快增长,因此 imagination horizon 不能只按算力拉长。
Offline RL 不是把 SAC 的 replay buffer 冻住就结束。SAC actor 会优化到 dataset 外 action,critic 没有真实数据纠错;专门的 conservatism/support constraint 正是为此存在。
自测
1. 为什么 dataset 更大仍可能 coverage 不足?
大量重复常见状态/action 不等于覆盖 policy 想访问的关键决策和失败边界。
2. IQL 为什么仍可比纯 BC 更好?
它用 learned advantage 给 dataset action 加权,优先模仿回报更好的行为。
3. world model rollout 为什么不能无限延长?
每一步预测误差复合,actor 还可能把 trajectory 推到训练分布外并利用模型漏洞。