先记住一句话
最有前景的 System 2 不是常开模式,而是 uncertainty/progress/error 驱动的预算控制器:平时走快路,遇到分叉、OOD 或失败才检索、搜索、验证和更新计划。
1. slow4fast:让慢经验回流快策略
fast module 是 DUET policy,记录时间、viewpoint、local topology、instruction、action、visual description、stop probability 等 episode memory。Llama3.2-Vision 用结构化 CoT prompt 反思成功/失败,输出 scene type、spatial context/rule、navigation strategy、历史成功率等 experience。
2. Experience 如何注入
运行时按当前 scene/context 检索经验,经 encoder 变为 F_e;visual features 作 query、experience embeddings 作 K/V 做 multi-head attention,再 concat/linear 回原维度,替代原 visual representation 进入 action policy。这里语言知识最终以 dense retrieval feature 进入快网络。
3. 结果与边界
在 GSA-R2R basic instructions 上,相对 GR-DUET,slow4fast 报告 residential/non-residential SR +1.5/+2.2 点;scene-style Test-N SR 50.7 vs 48.1。ablation 中 fast-slow reasoning 比 instruction-style conversion 贡献更广。但它依赖由 VLM 生成的 viewpoint descriptions和特定 experience schema,是否跨 benchmark/真实机器人持续积累仍未知。
4. Hume:System 2 也可以是 value search
Hume 在低频 VLA 上重复采样多个 action candidates,用 value-query head 估计 state-action value 并选一个;轻量 reactive System 1 再做 cascaded action denoising、高频执行。这里“慢思考”主要是 sample-and-rank,不需要长文本 CoT,说明 test-time compute 可以直接作用于 action distribution。
5. OneTwoVLA:同一模型决定想还是做
模型先预测 decision token:[BOR] 进入文本 reasoning,[BOA] 生成 flow-matching action chunk。reasoning 包含 scene description、high-level plan、history summary、next step;它只在 subtask 完成、检测错误或需要人类输入等关键 interval 标注。
6. 为什么 adaptive trigger 重要
always-reason 会在每步付 VLM latency,还可能根据几百毫秒前的 scene 给过期指令。OneTwoVLA 报告三个真实长程任务平均 87% success,相对同数据 flat π₀ +30 点、固定调用 Gemini 的 dual system +24 点;但每个 task 20 trials、任务与数据来自作者设置,证据还需更广复现。
7. Fast-ThinkAct:把文字压回 latent
teacher 用文本 reasoning 与 action-aligned visual preference 学 plan;student 产生 compact latent CoT;verbalizer 约束 latent 仍可解码成语言;action model 从 visual plan representations 学动作。论文报告相对 reasoning VLA 最多降低 89.3% inference latency(约 9.3× speedup),指向“训练时可解释、推理时紧凑”的折中。
8. Training-time 与 inference-time 的两条路
| 路线 | 代表 | 动作是否看 reasoning | 主要收益 |
|---|---|---|---|
| 显式 runtime reasoning | OneTwoVLA | 看最新文本 R | 交互、恢复、可读 |
| latent runtime reasoning | Fast-ThinkAct | 看 latent plan | 低时延、高带宽 |
| training-only ECoT | ZR-0 | mask 后不看生成 ECoT | representation/cross-embodiment |
| optional subtask planner | DSWAM | 复杂任务时看 subtask | 保持 WAM 快路径 |
9. 好 trigger 应看什么
- action entropy / candidate value gap;
- map disagreement、unseen frontier 与 localization uncertainty;
- goal progress 停滞、重复轨迹、collision/contact anomaly;
- instruction ambiguity 或 user correction;
- plan age 与观测分布漂移。
单纯每 N 秒调用只是一条 baseline。trigger 也要训练/calibrate,并把 false negative(该想没想)纳入安全评测。
10. 记忆必须能被推翻
experience library 会过期、互相冲突或把一次偶然成功当规则。每条经验应有来源、环境条件、成功/失败计数、置信度与时间;retrieved guidance 应受 current evidence verifier 检查。否则 memory 把一次 hallucination 永久放大。
11. 四个 adaptive-reasoning 计算
例 1:cosine retrieval
Query q=(1,0),memory A=(0.8,0.6)、B=(0.2,0.98),都近似 unit norm;cosines 分别 0.8 与 0.2,因此先取 A。Similarity 高仍需检查场景时间与反证。
例 2:value search
候选 left 的 immediate score=1、future value=4;right 为 2 和 2。γ=0.8 时 left=1+0.8×4=4.2,right=3.6,search 选择短期较差但长期更好的 left。
例 3:trigger threshold
Policy entropy 在直廊=0.2、分叉=1.1,设 threshold=0.8,只在分叉触发 500 ms reasoning。若 100 steps 中 15 次触发,额外总 compute=7.5 s,而常开需 50 s。
例 4:expected value of compute
额外 search 成本等价 0.05 reward,能把失败概率从 0.20 降到 0.08,失败损失=1;expected benefit=(0.20−0.08)×1−0.05=0.07,值得触发。若只降到 0.17,则净值 −0.02。
memory retrieval、candidate search、CoT 和 world-model rollout 都是在购买额外信息。研究重点应从“有没有 System 2”转为“何时花多少 compute,得到的信息是否能降低决策风险”。
自测
1. slow4fast 与普通 RAG 的差别是什么?
检索内容来自 agent 自己的导航轨迹反思,并被编码后直接融合进 action policy,而不只是回答文本问题。
2. Hume 为什么也能叫 slow thinking?
它用额外采样和 value evaluation 比较候选动作;deliberation 的载体是 search/value,不必是自然语言。
3. adaptive reasoning 最大的评测缺口是什么?
要同时测成功质量、触发 precision/recall、额外 compute/latency 与 stale-plan failures,而不只总 SR。
一手资料
slow4fast-VLN给出 experience schema 与 attention fusion;Hume采用 value-guided candidate selection;OneTwoVLA使用 BOR/BOA;Fast-ThinkAct蒸馏 verbalizable latent planning。