先记住一句话

历史解决“刚才发生了什么”,三维解决“东西在哪里”,接触信号解决“力和约束怎样变化”;它们共同缓解 manipulation 的部分可观测性。

多视角 + proprio + force按 view/time 编码3D fusionbelief / memorycontact-aware actionreset memory
历史估计速度与阶段
+
三维位置、尺度、遮挡
+
接触力、滑移、约束
Belief当前不可见物理状态
三种信号互补,不应把不同相机误当时间帧,也不能让跨 episode memory 泄漏。

1. 为什么是 POMDP

真实状态包含对象 pose、速度、摩擦、接触模式、关节力和遮挡后物体,但策略只能看到有限传感器。相同 RGB 可能对应“已经抓住”“刚好贴着但没抓住”两种状态,需要历史动作、夹爪状态或力觉区分。

2. 历史的四种实现

方法优点问题
堆叠若干帧最简单、训练稳定窗口固定、token 昂贵
视频 encoder直接建模短期运动预训练与多视角设计复杂
recurrent/memory token状态紧凑、可延续更久闭环 drift、训练跨段困难
KV / episodic memory保留长上下文并可检索缓存增长、陈旧信息与重置边界

episode reset 时必须清 memory;训练只见短 clip、部署却让 state 无限递归,会造成 train–test mismatch。应对不同 history length、丢帧和错误动作做鲁棒性测试。

3. 多视角不是简单沿时间拼起来

不同相机同一时刻看到同一世界。如果把 view 2 当作 view 1 的下一帧,模型会学到伪时间关系。应提供 view identity,并让每个 view 的 temporal position 独立;还可用 calibrated geometry 做 cross-view fusion。常见实现包括 per-view encoding、独立时间位置、learned view embedding 和跨视角 attention。

4. 显式 3D 表示的选择

  • Point cloud:直接、保尺度,数据量与噪声较大。
  • Voxel / BEV:规则 grid 便于卷积/attention,分辨率和空间范围取舍明显。
  • Object-centric pose/slot:紧凑、适合规划,依赖检测与跟踪。
  • Implicit 3D feature:从多视角/视频学空间表示,灵活但难解释。

选择应看任务:桌面抓取的关键是局部几何,布料需要形变状态,插接任务需要接触与公差,长时移动操作还要地图与对象持久性。

5. 接触改变了观测模型

视觉在接触瞬间常最差:手遮住物体、位移很小,但力变化最关键。joint torque、wrench、tactile image、motor current 与 gripper width 都可提供接触证据。需要同步、校零、去漂移,并在训练中处理不同硬件的量程。

6. Contact-rich policy 常见结构

慢视觉/VLM:目标、对象、阶段
      ↓
中频 action policy:EEF / hand chunk
      ↓
高频 tactile/force residual 或 WBC:接触稳定与保护

把所有东西都塞进低频 VLA 未必合理。高频 reflex 可专门处理滑移、力限和碰撞;上层只输出意图。是否端到端由数据频率和 latency 决定,不是由“foundation model”标签决定。

7. 四个 belief 计算

例 1:两帧估速度

物体位置从 0.40 m 到 0.43 m,间隔 0.1 s,平均速度 $(0.43-0.40)/0.1=0.3$ m/s;单帧无法得到这个方向与速度。

例 2:历史 token 成本

2 views、每帧 196 tokens、4 帧历史,共 $2×196×4=1{,}568$ visual tokens;只用当前帧是 392,dense score 量级约增加 $(1568/392)^2=16$ 倍。

例 3:voxel 分辨率

1 m³ 工作空间用 2 cm voxel,每边 50 格,共 $50³=125{,}000$ voxels;改为 1 cm 后 $100³=1{,}000{,}000$,数量增 8 倍。

例 4:接触阈值与迟滞

设置 8 N 进入接触、5 N 退出。力序列 7→9→6→4 N 的状态为 off→on→on→off;迟滞避免在 8 N 附近噪声导致高速抖动。

诊断提示:

目标可见时能 reach、接触后失败,优先检查 contact observation、gripper state、控制带宽和 action representation;不要只加更强 VLM。

自测

1. 为什么一张 RGB 不能判断是否抓牢?

遮挡和外观可能相同,抓取约束、滑移与力状态需要历史或接触信号。

2. 多视角为何要有 view identity?

否则模型难区分相机来源,并可能把跨视角拼接误当时间运动。

3. 为什么高频触觉 residual 可与 VLA 分层?

接触反射需要更低延迟,语义规划更新较慢,两者时间尺度不同。

原始资料

3D Diffusion Policy 展示紧凑点云表示;OA-WAM 探索对象 slot 的持久地址与动态内容。