先记住一句话
当前证据支持“好的层级接口与 fast–slow coordination 有价值”;尚不足以证明“更长自然语言思维链普遍导致更好的真实机器人决策”。
1. 当前代表结果快照
| 工作 | 核心干预 | 论文内结果 | 关键边界 |
|---|---|---|---|
| DualVLN | pixel+latent goal,2/30 Hz | R2R SR 64.3 vs StreamVLN 56.9 | 额外数据;完整 controller stack |
| SEDualVLN | spatial S1 + map/render S2 | R2R SR 67.3;S1 only 62.8 | 两张 4090;GPT-4o/map |
| slow4fast | 反思经验→attention fusion | OOD basic SR 比 GR-DUET +2.2 | GSA-R2R 与固定 schema |
| OneTwoVLA | 自适应文本 reasoning/action | 3 个长程任务平均 87%,+30/+24 点 | 每任务 20 trials,作者自建任务 |
| Fast-ThinkAct | 文本 teacher→latent plan | 最多降 89.3% reasoning latency | “最多”值;跨基准配置不同 |
2. SEDualVLN 是较强的组件证据
同一论文里 S1→S1+S2 在 R2R/RxR SR 分别 +4.5/+5.4;S2 单独既慢(约 294/314 s)又较弱,组合在 57/64 s 完成。它较直接支持 fast–slow coordination。可是 full S1 还加入 VGGT spatial alignment 与 passage extraction,因此与外部 baselines 的全部差值不能只算给 S2。
3. Spatial representation 可能比 MLLM 品牌重要
SEDualVLN 在相同框架下 GPT-4o、Qwen2.5-VL、Gemini 的 R2R SR 为 67.3、67.1、66.9,差距很小;而移除 global spatial supervision 后 R2R SR 61.3,差 6 点。至少在该 setup,给模型正确空间表示比换更强通用 MLLM 更关键。
4. “更强语言跟随”不等于 System 2 因果
GR00T N1.5 报告 real GR-1 language following 46.6%→93.3%,总体 success 43.3%→83.0%;但版本同时改变冻结 VLM、adapter/LN、grounding model、FLARE 和数据。它强烈说明 grounding/architecture recipe 有效,却不是独立 System 2 ablation。
5. Static SOTA 在动态环境会塌
DualVLN 在 Social-VLN 的 SR 从 64.3 降至 37.2,且 human collision rate 35.4。动态人群改变了 observation、可达性和计划有效期,暴露静态 benchmark 没覆盖的预测与安全问题。System 2 若思考更慢,反而可能增加 stale decision。
6. Reasoning trace 的因果陷阱
- CoT 与动作共享 backbone,提升可能来自额外监督而非文本内容;
- reasoning 是事后合理化,打乱后 action 不变;
- teacher 生成的 ECoT 把 oracle future 泄漏进训练;
- 评价者又是同系列 LLM,产生 self-preference;
- 更长 trace 增加 latency,却只报告 accuracy。
ZR-0 明确 mask action expert 不看生成 ECoT,是诚实的 training-only auxiliary route;不能再把它描述成 inference-time CoT planner。
7. Baseline 公平性清单
- 同一 scene/instruction split 与成功阈值;
- 同一 RGB/depth/odometry/panorama 输入;
- 同一额外 robot/VL/synthetic 数据;
- 同一 action/controller 与 collision model;
- 同一硬件、batch、online/offline service;
- 同时报告 quality、average/tail latency、GPU memory/energy;
- oracle/wrong/shuffled plan 与 compute-budget intervention。
8. 常见失败分类
| 失败 | 症状 | 需要的能力 |
|---|---|---|
| 语义 hallucination | 不存在的门/物体/subtask | grounding verifier、ask user |
| 空间 hallucination | 坐标落墙/路径不可达 | map constraint、uncertainty |
| 能力错配 | S2 指令 S1 做不到 | affordance/capability model |
| 计划过期 | 执行时 scene 已变化 | timestamp、trigger、prediction |
| 进度丢失 | 重复 subtask/不会停 | event memory、completion head |
| 恢复失败 | 偏离后继续错计划 | backtrack/search/safe fallback |
9. 结果应该画成 Pareto frontier
横轴可用额外 FLOPs/调用次数/TTFT,纵轴用 success 或 risk-adjusted success;再按 HCR、SPL、energy 分层。固定频率 S2、adaptive S2、always-on VLM 和纯 S1 应在同一 compute budget 下比较,而不是各报一个最优点。
10. 当前结论的置信度
- 较强:显式空间结构、分层 control frequency、局部 policy 可提升连续 VLN;
- 中等:latent plan 能比纯坐标/固定 hidden state 提供额外信息;
- 初步:adaptive textual reasoning 能广泛优于分离式 dual system;
- 不足:可读 CoT 本身忠实地表达了动作因果、并在动态真实环境稳定提升安全。
11. 四个 evidence 计算
例 1:绝对与相对提升
SR 从 60% 到 66%,absolute gain=6 percentage points,relative gain=(66−60)/60=10%。论文写“提升 10%”必须说明是哪一种。
例 2:小样本波动
50 episodes 多成功 3 次,SR 就从 60% 变 66%。仅 3 个 episode 决定 6 points;应报告多 seed/置信区间,而不是把小数点后一位当稳定结论。
例 3:动态场景失效分解
静态 SR=80%。动态环境中 perception 保留率 0.9、map validity 0.8、controller recovery 0.85,简化乘积后 SR≈0.8×0.9×0.8×0.85=49.0%。
例 4:Pareto 支配
Method A SR=70%、latency=500 ms;B=68%、200 ms;C=65%、600 ms。A 与 B 各有 tradeoff,均在 frontier;C 同时成功率更低且更慢,被 A/B 支配。
先找同论文、同输入、同数据、同 controller 的 ablation;再看跨论文 SOTA。前者更接近因果证据,后者更多反映完整系统 recipe。
自测
1. 为什么 SEDualVLN 的 MLLM 对比值得注意?
三种大模型结果很近,而 spatial supervision 消融差得更多,提示 bottleneck 主要可能在空间表示而非模型品牌。
2. 如何测试 latent plan 是否携带任务信息?
跨 episode shuffle、换 wrong/oracle latent、线性 probe 目标/进度,并观察 action 与成功率的单调变化。
3. 为什么只报 SR 会奖励慢推理?
它不惩罚昂贵调用、控制停顿、过期计划和碰撞风险;真实系统需要受 latency/energy/safety 约束的成功。
一手资料
数字来自 DualVLN、SEDualVLN、slow4fast、OneTwoVLA 与 GR00T N1.5 的原始表格/消融;不同表不做直接统一排名。