我的判断
未来主线会从“VLM 直接出动作”走向“可验证的 semantic-spatial contract + compact latent residual + uncertainty-gated test-time compute + always-on safety controller”。
1. 第一优先:可执行的语义—空间 Contract
planner 不只输出文本或 latent,而输出 typed plan:
{subgoal, target_region_3d, allowed_corridor,
completion_predicate, confidence, valid_until,
required_capability, fallback}显式字段供 map/safety/human 检查,latent residual 补充难离散的语义。executor 回传 progress、reject reason 与 estimated capability,形成双向协议,解决 S2 不知道 S1 会什么的问题。
2. 第二优先:Uncertainty-gated Compute
训练一个 trigger,基于 action entropy、value gap、map conflict、OOD score、progress stall 和 plan age 决定:继续 S1、调用轻量 verifier、做完整 S2 search,或询问人类。优化目标不是 trigger accuracy,而是在延迟/能耗预算下最小化任务风险。
3. 第三优先:Active Perception
DualVLN 的转头/低头是起点。更一般地,S2 应选择能最大化 information gain 的 sensing action:靠近门牌、绕到遮挡后、调整相机/身体姿态、询问用户。要把“看什么”与“做什么”共同规划,而不是在看不清时继续 hallucinate。
4. World Model 不应只生成漂亮视频
用 latent plan condition world model,对候选 subgoal/trajectory rollout 未来视觉、碰撞、可见 landmark 与 completion probability;再用 calibrated critic 排序。评价重点是 counterfactual ranking 和 failure prediction,不是视频观感。InternVLA-N1 已用 latent plan condition video model,下一步要把它闭环接入 selection。
5. 异步 Temporal Alignment
把 plan 视为有时间域的 object:绑定 reference observation、robot pose distribution、生成/接收时间、预计完成范围。executor 用 observation-to-plan alignment 估计 progress;scene change 超阈值即失效。训练时系统化注入 delay/jitter/dropout,而非只在部署时希望网络容错。
6. Memory 要带证据与反证
episodic memory 存原始 event/trajectory,semantic memory 存抽象规则;每条规则附 provenance、适用环境、置信度、成功/失败计数和最后验证时间。retrieval 后先用 current map/vision falsify,再注入 policy。研究重点是 continual update 与避免错误经验自我强化。
7. Language Reasoning 要做因果校验
建立 plan intervention benchmark:提供 oracle、plausible-wrong、spatially-impossible、stale 和 adversarial instructions/CoT;测 action 是否正确接受、拒绝或要求澄清。对 latent 也做 swap/probe/causal mediation。解释只有在可干预时才不是装饰。
8. Cross-embodiment 的正确分界
S2 学 embodiment-agnostic intent、对象关系、可达区域和 subtask graph;S1/S0 学本体 affordance、动力学、接触与控制。接口中显式声明 capability/constraint。ZR-0 的 dense ECoT 与 DSWAM 的 optional subtask planner 都在探索把共享认知与本体动作分开。
9. Safety 与恢复要进入主指标
需要动态人/物、遮挡、地图漂移、网络延迟、低电量、actuator saturation 与用户打断。报告 success-without-violation、HCR/collision、minimum clearance、recovery success、safe-stop rate 和人类介入次数。S2 可建议,独立 safety layer 必须能 veto。
10. 三个具体可做实验
- Uncertainty-Gated DualVLN:用 ensemble/value/map disagreement 触发 S2,在固定 GPU-seconds 下比较 fixed 2 Hz 与 adaptive;
- Bidirectional Plan Contract:pixel+3D region+latent+completion predicate,加入 executor reject token,测试 capability mismatch 和 stale plans;
- Causal Language Injection Suite:系统交换 instruction/subgoal/latent/memory,测每层 language sensitivity、faithfulness 与 safety response。
11. 不太值得单独押注什么
- 每个 control step 都生成长 CoT;
- 没有 schema 的自由文本作为唯一 planner-controller bridge;
- 只在静态 R2R val-unseen 追 SR 小数点;
- 只展示 attention heatmap,不做 plan intervention;
- 不报告延迟/硬件/额外数据的“zero-shot”真实机器人视频。
12. 一条两阶段路线
近期:把 dual-system 做成可靠系统——typed interface、async state、trigger、verifier、动态 benchmark。中期:让 memory/world model 产生可验证的 counterfactuals,用真实 failure data 学会何时搜索、何时询问、何时停止,并跨 embodiment 蒸馏为快策略。
13. 四个研究设计手算
例 1:contract validity
Goal validity=1.0 s、planner latency=0.4 s,发送到 executor 时只剩 0.6 s。Robot 0.5 m/s,最多安全沿此 goal 再走 0.3 m;超出需 refresh。
例 2:uncertainty calibration
系统把 100 个决策都报 80% confidence,最终只有 62 个正确,calibration gap=18 percentage points。用未经校准的 0.8 作为 safety trigger 会过度信任。
例 3:active perception 的价值
转头观察耗时 0.3 s,可把选错路概率从 0.25 降到 0.05;若走错平均浪费 4 s,期望节省=(0.25−0.05)×4−0.3=0.5 s,值得主动看。
例 4:实验样本账本
比较 baseline、always-reason、adaptive 三方法,每方法 5 seeds、每 seed 200 episodes,总需 3×5×200=3000 episodes;还应分 familiar/OOD/dynamic strata 报告。
不是一个永远“慢思考”的机器人,而是一个知道自己的计划何时可信、何时过期、何时超出能力,并能用最少额外计算恢复到安全有效轨迹的机器人。
自测
1. 为什么 typed contract 比自然语言 subtask 更可靠?
它明确坐标、完成条件、有效期、能力和 fallback,可被 planner、controller 与 safety layer 自动验证。
2. adaptive trigger 应如何评价?
在固定 compute/latency budget 下比较风险与成功,并分别统计漏触发、误触发、stale-plan 和恢复表现。
3. world model 最重要的指标是什么?
能否正确排序候选未来、预测失败并改善闭环决策,而不是生成画面是否逼真。
趋势依据
DualVLN验证 explicit+latent 与 async;OneTwoVLA验证 adaptive trigger;Fast-ThinkAct探索 latent reasoning;ZR-0探索 dense training-only ECoT;DSWAM把 System 2 变为按需 subtask planner。这一节的优先级与组合方案是基于这些结果的研究判断,而非原论文共同结论。