先记住一句话
在 VLN 中,System 2 最可靠的角色往往不是凭空生成坐标,而是在几何模块保证可达性的候选集合上做语义判断、进度追踪与失败恢复。
1. 纯文本代理:NavGPT
NavGPT 把当前视角 caption、可探索方向、历史轨迹和 instruction 填入 prompt,让 LLM 输出显式 thought/action。优点是无需导航训练即可展示 subgoal decomposition、commonsense、landmark tracking 和 replanning;缺点是 vision→caption 形成有损 bottleneck,zero-shot 性能仍落后 specialist。
2. 为什么 top-down map 有用
ego image 只显示局部,LLM 很难维持旋转、尺度与连通性。top-down occupancy/semantic map 显式给出 visited/free/obstacle/frontier、agent pose 和候选路径,使“左边那条走廊是否通向厨房”从隐式 3D imagination 变成有结构的视觉比较。
3. SEDualVLN 的 Mapping
System 2 用 feed-forward 3D mapping 在线构建轻量 3D map,再导出 2D frontier map。每个 frontier 是“下一块值得探索的未知边界”,而不是让 GPT-4o 在所有像素中自由选点。A* 在 3D map 上为每个 frontier 生成 collision-free candidate path。
4. Rendering:把 path 变成 VLM 熟悉的输入
单看 top-down polyline 不足以判断沿路会看到哪些 landmarks。SEDualVLN 沿候选 A* path 插值 virtual camera poses,渲染 RGB sequence;再用 CLIP similarity 去掉相邻冗余帧,控制 MLLM token 数。这相当于用 simulator/map 做短程“视觉 rollout”。
5. Reasoning:两阶段而非一问到底
- Self-perception:给 GPT-4o top-down 3D map,描述当前空间和附近环境;
- Simulated motion:逐个比较 candidate path 的 rendered sequence 与原 instruction,选择最匹配 frontier。
输出仍是 waypoint,System 1 在 System 2 思考时继续执行原子动作;scheduler 以约 20:1 的 S1:S2 频率协作。
6. 报告效果与代价
| SEDualVLN 设置 | R2R SR / 平均时间(s) | RxR SR / 平均时间(s) |
|---|---|---|
| System 1 only | 62.8 / 48.9 | 58.5 / 53.6 |
| System 2 only | 59.8 / 294.3 | 56.6 / 313.8 |
| S1+S2, 20:1 | 67.3 / 57.3 | 63.9 / 63.9 |
论文的 ablation 显示协作相对 S1 提升 SR 4.5/5.4 点;相对纯 S2 提升 7.5/7.3 点且平均时间约缩短 6 倍。代价是 System 1 和 mapping/System 2 各占一张 RTX 4090,且作者把真实 mapping distortion 列为主要限制。
7. Zero-shot agent loop:Uni-LaViRA
2026 的 Uni-LaViRA 把 MLLM 输出限制为两种其原生较擅长的动作:semantic directional language action 与 pixel visual target;TODO List Memory 每步重写未完成 subgoals,把它们放回最近 context;Second Chance Backtrack 在失败后回到错误前状态,并把失败 subtrajectory 加入下一次规划。论文报告无需 robot-data training 的多任务结果,但模块、传感器和 benchmark 条件仍需逐项对齐。
8. 工具增强的关键边界
| 工具负责 | 语言模型负责 |
|---|---|
| 可达性、碰撞、坐标变换 | instruction/landmark 语义 |
| 候选生成、A*、frontier | 候选排序与解释 |
| 地图更新与轨迹记录 | subgoal progress、异常判断 |
| 安全约束与 emergency stop | 高层恢复建议 |
把 hard geometry/safety 留给可验证工具,比让自由文本直接驱动 actuator 更稳健。
9. 仍然存在的 failure chain
mapping error → 错 frontier → 错 rendered views → MLLM 合理地选择错误 candidate。工具并不会消灭 compounding error,只是使每段可观测。系统应传 uncertainty、遮挡与 map age,而非把地图渲染成看似确定的图片。
10. 值得借鉴的设计
先用 cheap module 建候选,只有多个候选语义难分或进度异常时调用 MLLM;输出 candidate ID + evidence + confidence,而非任意坐标;保留可回放的 map/path/reasoning trace;低层持续安全执行且可否决 stale/unsafe waypoint。
11. 四个 tool-augmented 计算
例 1:occupancy-map 尺寸
20 m×20 m 区域、resolution=0.05 m/cell,每边 400 cells,共 160,000 cells。每格 1 byte 约 156 KiB;resolution 减半到 0.025 m,cell 数会变四倍。
例 2:frontier 路径代价
候选 A geodesic 4 m、语义 penalty 2;B geodesic 6 m、penalty 0。Cost=distance+1.5×penalty 时 A=7、B=6,选 B;权重应在 validation 上校准。
例 3:tool latency
Mapping 30 ms、candidate extraction 20 ms、render 40 ms、VLM 450 ms、planning 10 ms,总 slow-loop latency=550 ms。Robot 0.6 m/s 时已移动 0.33 m。
例 4:failure-chain 成功率
Map 正确率 0.95、candidate recall 0.9、reasoner 选对 0.85、controller 完成 0.95,独立简化下端到端≈0.95×0.9×0.85×0.95=69.1%;每个“看起来不错”的组件相乘后会明显下降。
不是“调用 GPT 更多次”,而是将 sensing、mapping、planning、rendering、verification 与 recovery 组成有 typed state 和失败边界的闭环。
自测
1. 为什么先生成 frontier candidates?
把无限的空间输出约束为可探索、可达的有限集合,让 MLLM 专注语义排序,减少几何 hallucination。
2. rendered path sequence 比终点截图多什么?
展示沿路的视觉变化和 landmarks,可判断整段候选路径是否遵循 instruction,而不只终点看起来像目标。
3. SEDualVLN 的数字说明什么?
慢 MLLM 单独用既慢也不够强;与快速 spatially enhanced policy 低频协作形成更好的质量—时间点。
一手资料
NavGPT展示文本化 zero-shot reasoning;SEDualVLN给出 Mapping–Rendering–Reasoning pipeline 与 ablation;Uni-LaViRA给出 TODO memory 与 backtrack agent loop。