先记住一句话

经典 VLN 的 language 注入核心是:instruction 表示作为 K/V,被当前视角、历史状态或地图节点反复查询,最后产生各候选位置/动作的 compatibility score。

encode instructionencode viewscross-modal alignmentupdate recurrent/map memoryscore candidatesmove/stop
Language memoryK_L,V_L
queried by
View/historyQ_t
Aligned stateh_t
+
Topologyvisited/frontier nodes
Scorescandidate + stop
Language grounding 与 spatial memory 是互补模块:前者判断“指令指什么”,后者保存“我在哪里、去过哪里”。

1. Seq2Seq:instruction 压入 recurrent state

encoder 把 word sequence 编码成 hidden states;decoder 每步用当前 observation、上一步 action 和 recurrent memory,通过 attention 选择相关 words,再预测下一动作。优点是端到端清晰;瓶颈是单一 recurrent state 容易遗忘长路线,局部 action error 会累积。

2. CMA:双向 cross-modal 对齐

Cross-Modal Attention 类方法不只把整句压成一个向量,而是在每步让 visual/history context attention 到 instruction tokens,也让语言相关表示对齐当前 panorama。这样“经过沙发后右转”的关注词可随进度变化;但 memory 仍常由 recurrent state 承担。

3. Transformer 与预训练

BERT/Vision-Language Transformer 把 words、views、orientation 和 history tokens 放进更深 cross-modal layers,通过 masked language、masked region、action prediction、trajectory ranking 等任务预训练。收益不只来自 language knowledge,也来自更强的 optimization 与大规模路径数据。

4. DUET:局部细节 + 全局拓扑

DUET 在线建立 visited/current/navigable nodes 的 topological map。coarse-scale graph transformer 让 instruction 与全局 nodes 做长程 reasoning;fine-scale encoder 保留当前位置 panoramic details;dynamic fusion 合并两套 action scores。

instruction tokens
   ↙ cross-modal attention ↘
global graph nodes       local panoramic views
   ↘ global score        local score ↙
          dynamic fusion → next node / stop

这是一种可学习的“慢规划 + 快局部辨认”,只是没有独立的大 VLM planner。

5. BEVBert:先把空间整理好再对齐语言

直接在多个 panorama 上 attention 会看到重复且不一致的局部观察。BEVBert 构建 local metric BEV map 聚合几何,global topological map 表达导航依赖,再对 map representation 做 multimodal pretraining。它说明 language grounding 的上限常被 spatial representation 限制,而不只是语言模型大小。

6. ETPNav:规划—控制显式分层

ETPNav 在 VLN-CE 中自组织 predicted waypoints 构造 evolving topological map,cross-modal transformer 用 instruction 给 graph nodes 打分形成高层 plan,随后 obstacle-avoiding controller 执行。论文报告相对当时方法在 R2R-CE/RxR-CE 有超过 10%/20% 改进,但这是其自身实验条件下的结果。

7. 语言到底在哪里起作用

位置对齐对象常见失败
word↔viewlandmark、方向、局部候选重复外观/遮挡
word↔history完成进度、过去 landmark遗忘/错误累积
word↔map node全局 frontier/回退位置map/localization 错
word↔stop head任务完成条件到过不停/过早停止

8. Specialist 的优势

固定 action space 和 benchmark 上,specialist map policy 往往更快、可训练闭环、几何先验明确;语言 embedding 可在每一步低成本复用。VLM 带来开放词汇和预训练知识,但若每个 0.25 m 动作都 autoregressive decode,就可能在控制频率上倒退。

9. 它们为何仍不够

specialist 往往绑定传感器/场景分布、instruction style 与 graph abstraction;遇到开放目标、自然反馈、常识推断和全新 embodiment 时迁移困难。System 2 路线的价值在于把 foundation-model knowledge 引入,但应保留这些方法已验证的 map、history 和 low-level control 结构。

10. 四个 cross-modal 决策手算

例 1:candidate softmax

三个方向 compatibility logits=[2.0,1.0,0.0],概率约 [0.665,0.245,0.090]。若 stop logit=2.5 加入同一 softmax,stop 会占最大概率,说明 stop head 的标定非常关键。

例 2:local/global score 融合

候选 A 的 local=0.9、global=0.3;B 为 0.5、0.8。权重 local 0.4、global 0.6:A=0.54,B=0.68,最终选 B,尽管当前视图 A 更像 landmark。

例 3:topological shortest path

Graph edges A–B=2 m、B–D=3 m、A–C=1 m、C–D=6 m。A 到 D 经 B 是 5 m,经 C 是 7 m;global planner 应选 A-B-D,而非只因 A-C 首边更短。

例 4:history memory cost

每步保存 768D FP16 token,200 steps 是 768×2×200=307,200 bytes≈0.293 MiB 每 episode;全量 self-attention 的 score cost 又随 200² 增长,常需压缩/地图节点。

历史教训:

更强 language encoder 无法替代 spatial memory。VLN 的长期进展常来自表示“去过哪里、可去哪、当前在哪”的结构,与跨模态模型共同提升。

自测

1. DUET 为什么要双尺度?

全局图适合长程 exploration/planning,但 node 表示粗;当前 panorama 保留细粒度 grounding,两者动态融合。

2. 地图为什么也是一种 memory?

它把历史观察按空间节点组织,保留连通性和未访问 frontier,比单一 recurrent vector 更适合回退与全局决策。

3. 经典 VLN 与 dual-system 的连续性是什么?

都在分解全局计划和局部行动;区别主要是 slow module 的预训练、计算方式、接口和运行时频率。

一手资料

DUET提出 dual-scale graph transformer;BEVBert提出 hybrid metric/topological map pretraining;ETPNav在连续环境中分解 topological planning 与 obstacle-avoiding control。