先记住一句话

最有前景的 System 2 不是常开模式,而是 uncertainty/progress/error 驱动的预算控制器:平时走快路,遇到分叉、OOD 或失败才检索、搜索、验证和更新计划。

fast action proposalestimate uncertainty/progressgate compute budgetretrieve/search/rolloutverify evidenceact and update memory
Fast policyaction + confidence
low confidence
Budget controllerhow much compute?
Information toolsmemory / search / CoT
evidence
Revised actionor safe fallback
Memory 与 search 都是在花 compute 换信息;gate 的目标是降低风险,而不是最大化思考长度。

1. slow4fast:让慢经验回流快策略

fast module 是 DUET policy,记录时间、viewpoint、local topology、instruction、action、visual description、stop probability 等 episode memory。Llama3.2-Vision 用结构化 CoT prompt 反思成功/失败,输出 scene type、spatial context/rule、navigation strategy、历史成功率等 experience。

2. Experience 如何注入

运行时按当前 scene/context 检索经验,经 encoder 变为 F_e;visual features 作 query、experience embeddings 作 K/V 做 multi-head attention,再 concat/linear 回原维度,替代原 visual representation 进入 action policy。这里语言知识最终以 dense retrieval feature 进入快网络。

3. 结果与边界

在 GSA-R2R basic instructions 上,相对 GR-DUET,slow4fast 报告 residential/non-residential SR +1.5/+2.2 点;scene-style Test-N SR 50.7 vs 48.1。ablation 中 fast-slow reasoning 比 instruction-style conversion 贡献更广。但它依赖由 VLM 生成的 viewpoint descriptions和特定 experience schema,是否跨 benchmark/真实机器人持续积累仍未知。

4. Hume:System 2 也可以是 value search

Hume 在低频 VLA 上重复采样多个 action candidates,用 value-query head 估计 state-action value 并选一个;轻量 reactive System 1 再做 cascaded action denoising、高频执行。这里“慢思考”主要是 sample-and-rank,不需要长文本 CoT,说明 test-time compute 可以直接作用于 action distribution。

5. OneTwoVLA:同一模型决定想还是做

模型先预测 decision token:[BOR] 进入文本 reasoning,[BOA] 生成 flow-matching action chunk。reasoning 包含 scene description、high-level plan、history summary、next step;它只在 subtask 完成、检测错误或需要人类输入等关键 interval 标注。

6. 为什么 adaptive trigger 重要

always-reason 会在每步付 VLM latency,还可能根据几百毫秒前的 scene 给过期指令。OneTwoVLA 报告三个真实长程任务平均 87% success,相对同数据 flat π₀ +30 点、固定调用 Gemini 的 dual system +24 点;但每个 task 20 trials、任务与数据来自作者设置,证据还需更广复现。

7. Fast-ThinkAct:把文字压回 latent

teacher 用文本 reasoning 与 action-aligned visual preference 学 plan;student 产生 compact latent CoT;verbalizer 约束 latent 仍可解码成语言;action model 从 visual plan representations 学动作。论文报告相对 reasoning VLA 最多降低 89.3% inference latency(约 9.3× speedup),指向“训练时可解释、推理时紧凑”的折中。

8. Training-time 与 inference-time 的两条路

路线代表动作是否看 reasoning主要收益
显式 runtime reasoningOneTwoVLA看最新文本 R交互、恢复、可读
latent runtime reasoningFast-ThinkAct看 latent plan低时延、高带宽
training-only ECoTZR-0mask 后不看生成 ECoTrepresentation/cross-embodiment
optional subtask plannerDSWAM复杂任务时看 subtask保持 WAM 快路径

9. 好 trigger 应看什么

  • action entropy / candidate value gap;
  • map disagreement、unseen frontier 与 localization uncertainty;
  • goal progress 停滞、重复轨迹、collision/contact anomaly;
  • instruction ambiguity 或 user correction;
  • plan age 与观测分布漂移。

单纯每 N 秒调用只是一条 baseline。trigger 也要训练/calibrate,并把 false negative(该想没想)纳入安全评测。

10. 记忆必须能被推翻

experience library 会过期、互相冲突或把一次偶然成功当规则。每条经验应有来源、环境条件、成功/失败计数、置信度与时间;retrieved guidance 应受 current evidence verifier 检查。否则 memory 把一次 hallucination 永久放大。

11. 四个 adaptive-reasoning 计算

例 1:cosine retrieval

Query q=(1,0),memory A=(0.8,0.6)、B=(0.2,0.98),都近似 unit norm;cosines 分别 0.8 与 0.2,因此先取 A。Similarity 高仍需检查场景时间与反证。

例 2:value search

候选 left 的 immediate score=1、future value=4;right 为 2 和 2。γ=0.8 时 left=1+0.8×4=4.2,right=3.6,search 选择短期较差但长期更好的 left。

例 3:trigger threshold

Policy entropy 在直廊=0.2、分叉=1.1,设 threshold=0.8,只在分叉触发 500 ms reasoning。若 100 steps 中 15 次触发,额外总 compute=7.5 s,而常开需 50 s。

例 4:expected value of compute

额外 search 成本等价 0.05 reward,能把失败概率从 0.20 降到 0.08,失败损失=1;expected benefit=(0.20−0.08)×1−0.05=0.07,值得触发。若只降到 0.17,则净值 −0.02。

核心统一视角:

memory retrieval、candidate search、CoT 和 world-model rollout 都是在购买额外信息。研究重点应从“有没有 System 2”转为“何时花多少 compute,得到的信息是否能降低决策风险”。

自测

1. slow4fast 与普通 RAG 的差别是什么?

检索内容来自 agent 自己的导航轨迹反思,并被编码后直接融合进 action policy,而不只是回答文本问题。

2. Hume 为什么也能叫 slow thinking?

它用额外采样和 value evaluation 比较候选动作;deliberation 的载体是 search/value,不必是自然语言。

3. adaptive reasoning 最大的评测缺口是什么?

要同时测成功质量、触发 precision/recall、额外 compute/latency 与 stale-plan failures,而不只总 SR。

一手资料

slow4fast-VLN给出 experience schema 与 attention fusion;Hume采用 value-guided candidate selection;OneTwoVLA使用 BOR/BOA;Fast-ThinkAct蒸馏 verbalizable latent planning。