18 notes / data → model → robot
具身操作模型
从一条机器人 episode 出发,逐层理解 VLM、VLA、World Action Model、动作生成、跨本体训练、闭环评测与真实部署。目标不是记模型名,而是能自己判断一个系统为什么工作、为什么失败。
Part I · 先把数据世界建对
VLM、VLA 与 WAM 到底是什么
从感知、语义、预测到控制,先看懂不同模型在闭环中的职责与边界。
一条 Episode 的数据模型
图像、状态、动作、语言、时间戳和 episode 边界怎样共同定义监督样本。
传感器、标定与时间同步
多相机、内外参、控制延迟和时间对齐为何经常比模型大小更决定上限。
动作空间与坐标系
关节/末端、绝对/相对、世界/基座/工具坐标,以及旋转表示和归一化。
Part II · 数据从哪里来,怎样变成训练信号
遥操作、仿真、人类视频与自主数据
不同数据源提供什么监督,带来什么偏差,为什么“更多”不等于“更好”。
清洗、切窗、混合与采样
从原始 episode 到 batch:质量门槛、delta indices、mask、统计量和配比。
VLM、Grounding 与空间理解
VLM 带来开放词汇语义,却为什么不会自动获得几何、接触和可执行性。
VLA 的架构家族
动作 token、连续 action expert、双系统架构和端到端联合训练的取舍。
Part III · 怎样生成动作并学习世界
WAM 与未来预测
显式视频想象、未来 latent 对齐、联合 token 建模,以及训练收益与推理成本。
回归、自回归、Diffusion 与 Flow Matching
多峰动作分布怎样表达,action chunk 为什么有效,采样步数又如何影响延迟。
跨本体与统一动作接口
不同机器人维度、动力学和相机怎样共训,哪些知识能迁移,哪些必须隔离。
预训练、共训与后训练
视频预训练、动作监督、目标域微调如何分阶段组织,并避免灾难性遗忘。
Part IV · 后训练、实时执行与真实闭环
从 SFT 到纠错、价值与 RL
用 rollout、成功信号、人类介入和偏好继续改进预训练策略,而不丢掉通用能力。
RTC 一类的实时策略技巧
异步 chunk、prefix conditioning、temporal ensemble、延迟模拟与快速 flow policy。
历史、三维与接触
遮挡、深度、多视角、力觉与记忆如何补足单帧 RGB 的部分可观测性。
离线指标与闭环评测
为什么低 action loss 不等于高成功率,以及怎样设计可复现的 OOD 试验。
闭环控制、系统延迟与安全
从 policy server 到机器人控制器,怎样管理时钟、故障、限幅与紧急停止。
失败诊断、数据飞轮与研究路线
把失败还原到数据—表示—策略—控制链路,并设计真正能回答问题的实验。