先记住一句话

好的高低层接口要同时满足 semantic sufficiency、geometric executability、temporal stability 和 embodiment portability;纯文本可读但空间弱,纯 latent 带宽高但难验证。

VLM 理解 instruction/scene选择 interface type绑定 frame/units校验 reachabilitycontroller 执行progress/timeout 回传
Semantic plan“绕桌左侧”
Spatial contractpixel / point / node
Geometrydepth + frame
Trajectoryfeasible controls
文本说明意图,显式空间目标保证可测与可执行,latent residual 可补充难以命名的视觉细节。

1. 把 action 当 token

最直接做法把 forward/left/right/stop 加入词表,以视觉历史和 instruction 为 prefix 做 next-token prediction。它复用 LM loss 和 decoder,但一个 token 常只移动 0.25 m/转 15°:长路线要大量 VLM calls,动作碎片且延迟大。

2. 先把视觉翻成文字

NavGPT 每一步输入视觉观察的文本描述、历史和可探索方向,用 LLM 显式分解 subgoal、识别 landmark、追踪进度和调整计划。它证明 LLM 有 zero-shot navigational reasoning,但论文也明确 zero-shot R2R 仍落后于训练 specialist;caption 会丢几何并引入 hallucination。

3. Mid-level language action

NaVILA 不让 VLA 直接输出腿关节,而是输出含空间量的语言动作,例如“向前 75 cm”,再交给 visual locomotion RL policy。语言成为跨 embodiment 的中层 command:上层处理 instruction,底层处理地形和本体动力学。接口仍需固定语法、单位和可执行范围。

4. Pixel goal

VLM 输出当前图像上的 (u,v),空间 grounding 比“向前”更细,也保持第一人称视觉的跨机器人性。问题是同一 pixel 对应一条 3D ray,不含深度;落在障碍物/不可达区时要由 local policy 容错。相机视野看不到目标时,还需先主动转头/低头。

5. Point、frontier 与 map node

深度/标定可把 pixel 变成 3D point;在线 map 可把语言对齐到 frontier/path/node。接口更可验证,可检查 collision/free-space 和 global connectivity,但依赖 localization、mapping 与坐标系,sim-to-real 误差会直接污染 planner。

6. Continuous trajectory

轻量 diffusion/flow policy 可一次输出多 waypoint 或 action chunk,动作平滑且可高频更新。若直接从 VLM hidden state 预测 trajectory,语义与控制耦合紧;若从显式 goal + latent plan 条件生成,则更容易分层诊断,但训练两系统的一致性变重要。

7. 接口比较

输出语义几何控制效率可审计
atomic token
language subtask低–中最高
pixel goal2D
3D/map goal
latent plan潜在高隐式最高

8. 数据如何决定输出能力

action-token 模型需要 observation→action conversations;pixel planner 需要把未来 trajectory 投影到可见图像并处理 occlusion;language action 可由 trajectory 自动转写但要避免语言模板单一;latent plan 需要 downstream trajectory loss 才知道该压缩什么。输出形式不是 inference wrapper,而是训练 label 的定义。

9. 一组有边界的结果

InternVLA-N1 报告其 RGB-only System 2 在 R2R-CE val-unseen 达 SR 55.4、SPL 52.1,论文表中 NaVILA 为 54.0/49.0;加 RGB-D System 1 后为 58.2/54.0。该表用 † 标出使用额外数据的方法,因此只能说明这一完整 recipe 有效,不能把 1.4 SR 全归因于某一种 interface。

10. 最值得保留的“双通道”

工程上很有吸引力的是显式 spatial contract + 隐式 residual latent:坐标/可达区域给安全和解释,latent 携带地标语义、路线进度与策略偏好;controller 必须能在 latent 缺失或 stale 时退化到显式 contract。

11. 四个 spatial interface 手算

例 1:discrete action vocabulary

若每步有 forward/left/right/stop 4 tokens,长度 20 的 action sequence 组合数是 4²⁰≈1.10×10¹²;语言模型必须靠状态约束,而不是枚举。

例 2:pixel 到 camera ray

相机 fx=500 px、cx=320,goal pixel u=420,则 normalized horizontal coordinate=(420−320)/500=0.2,bearing≈atan(0.2)=11.3°。

例 3:depth 变 3D goal

上例 ray depth z=2 m,简化 pinhole 得 camera-frame x=0.2×2=0.4 m,goal≈(0.4,0,2.0) m。Depth 缺失时 pixel 目标仍不能直接决定移动距离。

例 4:validity horizon

Planner goal 有效 0.8 s,robot 0.5 m/s,期间最多移动 0.4 m。若 controller 1.2 s 后仍在执行,goal age 已超期 0.4 s,应请求更新而非盲目继续。

接口设计原则:

不要让 planner 输出任意自然语言后期待 controller “自己懂”。定义 grammar、units、coordinate frame、validity horizon、confidence、completion condition 和 fallback,才是机器人协议。

自测

1. 为什么 pixel goal 具有跨 embodiment 潜力?

它在视觉坐标中表达“看见的目标”,不直接绑定轮式/腿式机器人的关节动作;各自 local policy 负责执行。

2. 为什么 language action 仍需 schema?

自由文本可能模糊、缺单位、超出能力或有多种解析;受约束语法才能成为可靠控制接口。

3. 显式 goal + latent 的好处是什么?

goal 提供可解释/可约束的主要方向,latent 补充难以离散化的语义与上下文,同时允许独立做一致性检查。

一手资料

NavGPT使用文本化观察和显式 LLM 推理;NaVILA输出空间化 mid-level language action;InternVLA-N1 报告给出 pixel-goal System 2 的基准与传感器条件。