先记住一句话
经典 VLN 的 language 注入核心是:instruction 表示作为 K/V,被当前视角、历史状态或地图节点反复查询,最后产生各候选位置/动作的 compatibility score。
1. Seq2Seq:instruction 压入 recurrent state
encoder 把 word sequence 编码成 hidden states;decoder 每步用当前 observation、上一步 action 和 recurrent memory,通过 attention 选择相关 words,再预测下一动作。优点是端到端清晰;瓶颈是单一 recurrent state 容易遗忘长路线,局部 action error 会累积。
2. CMA:双向 cross-modal 对齐
Cross-Modal Attention 类方法不只把整句压成一个向量,而是在每步让 visual/history context attention 到 instruction tokens,也让语言相关表示对齐当前 panorama。这样“经过沙发后右转”的关注词可随进度变化;但 memory 仍常由 recurrent state 承担。
3. Transformer 与预训练
BERT/Vision-Language Transformer 把 words、views、orientation 和 history tokens 放进更深 cross-modal layers,通过 masked language、masked region、action prediction、trajectory ranking 等任务预训练。收益不只来自 language knowledge,也来自更强的 optimization 与大规模路径数据。
4. DUET:局部细节 + 全局拓扑
DUET 在线建立 visited/current/navigable nodes 的 topological map。coarse-scale graph transformer 让 instruction 与全局 nodes 做长程 reasoning;fine-scale encoder 保留当前位置 panoramic details;dynamic fusion 合并两套 action scores。
instruction tokens
↙ cross-modal attention ↘
global graph nodes local panoramic views
↘ global score local score ↙
dynamic fusion → next node / stop这是一种可学习的“慢规划 + 快局部辨认”,只是没有独立的大 VLM planner。
5. BEVBert:先把空间整理好再对齐语言
直接在多个 panorama 上 attention 会看到重复且不一致的局部观察。BEVBert 构建 local metric BEV map 聚合几何,global topological map 表达导航依赖,再对 map representation 做 multimodal pretraining。它说明 language grounding 的上限常被 spatial representation 限制,而不只是语言模型大小。
6. ETPNav:规划—控制显式分层
ETPNav 在 VLN-CE 中自组织 predicted waypoints 构造 evolving topological map,cross-modal transformer 用 instruction 给 graph nodes 打分形成高层 plan,随后 obstacle-avoiding controller 执行。论文报告相对当时方法在 R2R-CE/RxR-CE 有超过 10%/20% 改进,但这是其自身实验条件下的结果。
7. 语言到底在哪里起作用
| 位置 | 对齐对象 | 常见失败 |
|---|---|---|
| word↔view | landmark、方向、局部候选 | 重复外观/遮挡 |
| word↔history | 完成进度、过去 landmark | 遗忘/错误累积 |
| word↔map node | 全局 frontier/回退位置 | map/localization 错 |
| word↔stop head | 任务完成条件 | 到过不停/过早停止 |
8. Specialist 的优势
固定 action space 和 benchmark 上,specialist map policy 往往更快、可训练闭环、几何先验明确;语言 embedding 可在每一步低成本复用。VLM 带来开放词汇和预训练知识,但若每个 0.25 m 动作都 autoregressive decode,就可能在控制频率上倒退。
9. 它们为何仍不够
specialist 往往绑定传感器/场景分布、instruction style 与 graph abstraction;遇到开放目标、自然反馈、常识推断和全新 embodiment 时迁移困难。System 2 路线的价值在于把 foundation-model knowledge 引入,但应保留这些方法已验证的 map、history 和 low-level control 结构。
10. 四个 cross-modal 决策手算
例 1:candidate softmax
三个方向 compatibility logits=[2.0,1.0,0.0],概率约 [0.665,0.245,0.090]。若 stop logit=2.5 加入同一 softmax,stop 会占最大概率,说明 stop head 的标定非常关键。
例 2:local/global score 融合
候选 A 的 local=0.9、global=0.3;B 为 0.5、0.8。权重 local 0.4、global 0.6:A=0.54,B=0.68,最终选 B,尽管当前视图 A 更像 landmark。
例 3:topological shortest path
Graph edges A–B=2 m、B–D=3 m、A–C=1 m、C–D=6 m。A 到 D 经 B 是 5 m,经 C 是 7 m;global planner 应选 A-B-D,而非只因 A-C 首边更短。
例 4:history memory cost
每步保存 768D FP16 token,200 steps 是 768×2×200=307,200 bytes≈0.293 MiB 每 episode;全量 self-attention 的 score cost 又随 200² 增长,常需压缩/地图节点。
更强 language encoder 无法替代 spatial memory。VLN 的长期进展常来自表示“去过哪里、可去哪、当前在哪”的结构,与跨模态模型共同提升。
自测
1. DUET 为什么要双尺度?
全局图适合长程 exploration/planning,但 node 表示粗;当前 panorama 保留细粒度 grounding,两者动态融合。
2. 地图为什么也是一种 memory?
它把历史观察按空间节点组织,保留连通性和未访问 frontier,比单一 recurrent vector 更适合回退与全局决策。
3. 经典 VLN 与 dual-system 的连续性是什么?
都在分解全局计划和局部行动;区别主要是 slow module 的预训练、计算方式、接口和运行时频率。