先记住一句话

Offline RL 的核心风险是对 dataset 未覆盖 action 的 Q 外推过高;model-based RL 的核心风险是策略主动利用 learned dynamics 的模型误差。

审计 dataset support训练 behavior/value/model限制 OOD actions短 horizon imaginationuncertainty 筛选真实评估
Fixed dataD={(s,a,r,s′)}
LearnQ / world model
Policy querypossibly OOD a
Guardconservatism / uncertainty
Dataset 外没有 environment 在线纠错;算法必须主动限制 critic 或 model 对 OOD 决策的乐观。

1. BC、Off-policy RL 与 Offline RL

方法数据学习目标
Behavior Cloning固定 demonstrations最大似然模仿 action,不显式用 reward
Online off-policy RLreplay + 持续新交互可用新数据纠正 critic/policy
Offline RL训练期间完全固定 dataset利用 reward 改进 behavior,但不能在线验证

BC 简单稳定,却会模仿好坏样本且遇到 covariate shift;offline RL 试图从混合质量数据选出更好行为,但改得越远,越可能离开数据 support。

2. Extrapolation error

Bellman target 需要下一状态的高价值 action。若 actor/Q maximization 选到 dataset 中没出现的 action,network 可能凭函数外推给它虚高 Q;没有在线环境返回真实后果,错误会 bootstrap 放大。

dataset action coverage 低 → unseen-action Q error → policy selects error → target error compounds

3. CQL:让 Q 更保守

Conservative Q-Learning 在 Bellman error 外增加 regularizer:压低 policy/广泛采样 action 的 Q,相对抬高 dataset action 的 Q,使 learned policy 的 value estimate 更保守。它避免盲目相信 OOD action,代价是可能过度保守,且 penalty 权重需要调节。

4. IQL:不在训练 target 查询未见 action

  1. 用 expectile regression 从 dataset actions 的 Q 拟合高 expectile V(s)
  2. r+γV(s') 训练 Q,target 不显式对 OOD action max;
  3. exp(β A(s,a)) 加权 behavior cloning,让高 advantage dataset actions 权重更大。

expectile 越高越偏向 dataset 内较优 action;temperature 决定 actor 离 behavior 多远。IQL 仍依赖数据里存在可组合的好行为,不能凭空创造未覆盖技能。

5. Offline-to-online

常见机器人路径是 demonstrations/offline logs 预训练,再谨慎 online fine-tune。切换时需处理 critic calibration、exploration、replay 新旧比例和安全 constraint;一个 offline 高分 policy 直接加大探索噪声可能危险。

6. Model-based RL

real data D → learn dynamics p(z_{t+1}|z_t,a_t), reward, continuation
                         ↓
                  imagined rollouts
                         ↓
                  train actor + critic
                         ↓
             collect selected new real data

已知模型可直接做 planning/MPC;learned world model 则从 observations 学 latent dynamics。Dyna 混合 real 与 simulated updates;Dreamer 在 latent model 中想象 trajectory 并训练 actor/critic。

7. World model 学什么

  • encoder 把高维 observation 压成 latent state;
  • dynamics 预测 action 后 latent 如何变化;
  • reward/continuation head 预测回报与终止;
  • decoder/reconstruction 或 representation losses 保持信息;
  • actor/critic 在 imagined latent trajectory 上优化。

像素重建很准不等于 control-relevant dynamics 准;模型可能浪费容量预测纹理,却漏掉接触、不可逆事件和 rare failure。

8. Model bias 和 uncertainty

长 imagined rollout 会复合误差,actor 还会寻找模型“漏洞”。常见缓解包括短 rollout、model ensemble/uncertainty penalty、定期收真实数据、latent regularization、保守 planning 和只在数据 support 内优化。

9. 选择地图

条件优先 baseline原因
只有高质量 expert dataBC / diffusion/flow policy先建立可用策略,避免 value error
固定混合质量带 reward 数据IQL/CQL + BC baseline显式管理 OOD action
可持续交互但很昂贵SAC/TD3 或 model-based重用 experience / imagined data
像素输入、跨多任务、需规划world model/Dreamer 类学习 latent dynamics 与 imagination
仿真极便宜且并行PPO baseline系统简单,吞吐弥补 sample reuse

10. 四个 offline/model-based 手算

例 1:behavior cloning NLL

Dataset action 在 policy 下概率为 0.25,单样本 BC loss=−log(0.25)=1.386;把概率提升到 0.5 后 loss=0.693。BC 只奖励复现 dataset action,不直接看 return。

例 2:conservative Q gap

Critic 对 dataset action 估 Q=4,对未见 action 估 Q=9。若 regularizer 简化为 λ(Q_ood−Q_data) 且 λ=0.2,额外 penalty=0.2×5=1,迫使 OOD 乐观付出代价。

例 3:IQL advantage weighting

Dataset action Q=6、state value V=4,advantage=2。温度 β=0.5 时 imitation weight=exp(βA)=exp(1)≈2.718;Q=3 的 action advantage=−1,weight≈0.607。

例 4:model error 复合

若每一步 position prediction 最坏误差增加 2 cm,忽略反馈耦合,10-step rollout 已可能偏 20 cm。若真实 dynamics 又随偏差改变,误差可更快增长,因此 imagination horizon 不能只按算力拉长。

常见误解:

Offline RL 不是把 SAC 的 replay buffer 冻住就结束。SAC actor 会优化到 dataset 外 action,critic 没有真实数据纠错;专门的 conservatism/support constraint 正是为此存在。

自测

1. 为什么 dataset 更大仍可能 coverage 不足?

大量重复常见状态/action 不等于覆盖 policy 想访问的关键决策和失败边界。

2. IQL 为什么仍可比纯 BC 更好?

它用 learned advantage 给 dataset action 加权,优先模仿回报更好的行为。

3. world model rollout 为什么不能无限延长?

每一步预测误差复合,actor 还可能把 trajectory 推到训练分布外并利用模型漏洞。

一手资料

CQL 用 conservative Q regularization 管理 OOD action;IQL 避免查询 unseen actions;DreamerV3 展示 learned world model + imagination 的完整训练路径。