Learning series · first draft

18 notes / data → model → robot

具身操作模型

从一条机器人 episode 出发,逐层理解 VLM、VLA、World Action Model、动作生成、跨本体训练、闭环评测与真实部署。目标不是记模型名,而是能自己判断一个系统为什么工作、为什么失败。

18 篇独立文章4 条主线状态:初稿待学习

Part I · 先把数据世界建对

01全局地图

VLM、VLA 与 WAM 到底是什么

从感知、语义、预测到控制,先看懂不同模型在闭环中的职责与边界。

02最小数据单元

一条 Episode 的数据模型

图像、状态、动作、语言、时间戳和 episode 边界怎样共同定义监督样本。

03观测可信度

传感器、标定与时间同步

多相机、内外参、控制延迟和时间对齐为何经常比模型大小更决定上限。

04控制语义

动作空间与坐标系

关节/末端、绝对/相对、世界/基座/工具坐标,以及旋转表示和归一化。

Part II · 数据从哪里来,怎样变成训练信号

05采集

遥操作、仿真、人类视频与自主数据

不同数据源提供什么监督,带来什么偏差,为什么“更多”不等于“更好”。

06数据工程

清洗、切窗、混合与采样

从原始 episode 到 batch:质量门槛、delta indices、mask、统计量和配比。

07语义地基

VLM、Grounding 与空间理解

VLM 带来开放词汇语义,却为什么不会自动获得几何、接触和可执行性。

08策略模型

VLA 的架构家族

动作 token、连续 action expert、双系统架构和端到端联合训练的取舍。

Part III · 怎样生成动作并学习世界

09世界—动作联合

WAM 与未来预测

显式视频想象、未来 latent 对齐、联合 token 建模,以及训练收益与推理成本。

10生成头

回归、自回归、Diffusion 与 Flow Matching

多峰动作分布怎样表达,action chunk 为什么有效,采样步数又如何影响延迟。

11泛化

跨本体与统一动作接口

不同机器人维度、动力学和相机怎样共训,哪些知识能迁移,哪些必须隔离。

12训练路径

预训练、共训与后训练

视频预训练、动作监督、目标域微调如何分阶段组织,并避免灾难性遗忘。

Part IV · 后训练、实时执行与真实闭环

13策略后训练

从 SFT 到纠错、价值与 RL

用 rollout、成功信号、人类介入和偏好继续改进预训练策略,而不丢掉通用能力。

14时序后训练

RTC 一类的实时策略技巧

异步 chunk、prefix conditioning、temporal ensemble、延迟模拟与快速 flow policy。

15物理状态

历史、三维与接触

遮挡、深度、多视角、力觉与记忆如何补足单帧 RGB 的部分可观测性。

16证据

离线指标与闭环评测

为什么低 action loss 不等于高成功率,以及怎样设计可复现的 OOD 试验。

17部署

闭环控制、系统延迟与安全

从 policy server 到机器人控制器,怎样管理时钟、故障、限幅与紧急停止。

18研究方法

失败诊断、数据飞轮与研究路线

把失败还原到数据—表示—策略—控制链路,并设计真正能回答问题的实验。