我的判断

未来主线会从“VLM 直接出动作”走向“可验证的 semantic-spatial contract + compact latent residual + uncertainty-gated test-time compute + always-on safety controller”。

定义 typed contract建立 fast baseline加入 calibrated uncertainty按风险触发 tools/world modelsafety filter 执行用恢复/成本指标迭代
Planner outputgoal + latent + confidence
contract
Executorprogress + uncertainty
trigger
Extra computeobserve / search / predict
guarded by
Safetyconstraints + fallback
研究对象应是可验证的闭环 contract:谁产生什么、何时有效、谁能拒绝、失败后怎样恢复。

1. 第一优先:可执行的语义—空间 Contract

planner 不只输出文本或 latent,而输出 typed plan:

{subgoal, target_region_3d, allowed_corridor,
 completion_predicate, confidence, valid_until,
 required_capability, fallback}

显式字段供 map/safety/human 检查,latent residual 补充难离散的语义。executor 回传 progress、reject reason 与 estimated capability,形成双向协议,解决 S2 不知道 S1 会什么的问题。

2. 第二优先:Uncertainty-gated Compute

训练一个 trigger,基于 action entropy、value gap、map conflict、OOD score、progress stall 和 plan age 决定:继续 S1、调用轻量 verifier、做完整 S2 search,或询问人类。优化目标不是 trigger accuracy,而是在延迟/能耗预算下最小化任务风险

3. 第三优先:Active Perception

DualVLN 的转头/低头是起点。更一般地,S2 应选择能最大化 information gain 的 sensing action:靠近门牌、绕到遮挡后、调整相机/身体姿态、询问用户。要把“看什么”与“做什么”共同规划,而不是在看不清时继续 hallucinate。

4. World Model 不应只生成漂亮视频

用 latent plan condition world model,对候选 subgoal/trajectory rollout 未来视觉、碰撞、可见 landmark 与 completion probability;再用 calibrated critic 排序。评价重点是 counterfactual ranking 和 failure prediction,不是视频观感。InternVLA-N1 已用 latent plan condition video model,下一步要把它闭环接入 selection。

5. 异步 Temporal Alignment

把 plan 视为有时间域的 object:绑定 reference observation、robot pose distribution、生成/接收时间、预计完成范围。executor 用 observation-to-plan alignment 估计 progress;scene change 超阈值即失效。训练时系统化注入 delay/jitter/dropout,而非只在部署时希望网络容错。

6. Memory 要带证据与反证

episodic memory 存原始 event/trajectory,semantic memory 存抽象规则;每条规则附 provenance、适用环境、置信度、成功/失败计数和最后验证时间。retrieval 后先用 current map/vision falsify,再注入 policy。研究重点是 continual update 与避免错误经验自我强化。

7. Language Reasoning 要做因果校验

建立 plan intervention benchmark:提供 oracle、plausible-wrong、spatially-impossible、stale 和 adversarial instructions/CoT;测 action 是否正确接受、拒绝或要求澄清。对 latent 也做 swap/probe/causal mediation。解释只有在可干预时才不是装饰。

8. Cross-embodiment 的正确分界

S2 学 embodiment-agnostic intent、对象关系、可达区域和 subtask graph;S1/S0 学本体 affordance、动力学、接触与控制。接口中显式声明 capability/constraint。ZR-0 的 dense ECoT 与 DSWAM 的 optional subtask planner 都在探索把共享认知与本体动作分开。

9. Safety 与恢复要进入主指标

需要动态人/物、遮挡、地图漂移、网络延迟、低电量、actuator saturation 与用户打断。报告 success-without-violation、HCR/collision、minimum clearance、recovery success、safe-stop rate 和人类介入次数。S2 可建议,独立 safety layer 必须能 veto。

10. 三个具体可做实验

  1. Uncertainty-Gated DualVLN:用 ensemble/value/map disagreement 触发 S2,在固定 GPU-seconds 下比较 fixed 2 Hz 与 adaptive;
  2. Bidirectional Plan Contract:pixel+3D region+latent+completion predicate,加入 executor reject token,测试 capability mismatch 和 stale plans;
  3. Causal Language Injection Suite:系统交换 instruction/subgoal/latent/memory,测每层 language sensitivity、faithfulness 与 safety response。

11. 不太值得单独押注什么

  • 每个 control step 都生成长 CoT;
  • 没有 schema 的自由文本作为唯一 planner-controller bridge;
  • 只在静态 R2R val-unseen 追 SR 小数点;
  • 只展示 attention heatmap,不做 plan intervention;
  • 不报告延迟/硬件/额外数据的“zero-shot”真实机器人视频。

12. 一条两阶段路线

近期:把 dual-system 做成可靠系统——typed interface、async state、trigger、verifier、动态 benchmark。中期:让 memory/world model 产生可验证的 counterfactuals,用真实 failure data 学会何时搜索、何时询问、何时停止,并跨 embodiment 蒸馏为快策略。

13. 四个研究设计手算

例 1:contract validity

Goal validity=1.0 s、planner latency=0.4 s,发送到 executor 时只剩 0.6 s。Robot 0.5 m/s,最多安全沿此 goal 再走 0.3 m;超出需 refresh。

例 2:uncertainty calibration

系统把 100 个决策都报 80% confidence,最终只有 62 个正确,calibration gap=18 percentage points。用未经校准的 0.8 作为 safety trigger 会过度信任。

例 3:active perception 的价值

转头观察耗时 0.3 s,可把选错路概率从 0.25 降到 0.05;若走错平均浪费 4 s,期望节省=(0.25−0.05)×4−0.3=0.5 s,值得主动看。

例 4:实验样本账本

比较 baseline、always-reason、adaptive 三方法,每方法 5 seeds、每 seed 200 episodes,总需 3×5×200=3000 episodes;还应分 familiar/OOD/dynamic strata 报告。

最终目标:

不是一个永远“慢思考”的机器人,而是一个知道自己的计划何时可信、何时过期、何时超出能力,并能用最少额外计算恢复到安全有效轨迹的机器人。

自测

1. 为什么 typed contract 比自然语言 subtask 更可靠?

它明确坐标、完成条件、有效期、能力和 fallback,可被 planner、controller 与 safety layer 自动验证。

2. adaptive trigger 应如何评价?

在固定 compute/latency budget 下比较风险与成功,并分别统计漏触发、误触发、stale-plan 和恢复表现。

3. world model 最重要的指标是什么?

能否正确排序候选未来、预测失败并改善闭环决策,而不是生成画面是否逼真。

趋势依据

DualVLN验证 explicit+latent 与 async;OneTwoVLA验证 adaptive trigger;Fast-ThinkAct探索 latent reasoning;ZR-0探索 dense training-only ECoT;DSWAM把 System 2 变为按需 subtask planner。这一节的优先级与组合方案是基于这些结果的研究判断,而非原论文共同结论。