先记住一句话
VLA 的核心选择是:哪些模态共享参数和 attention,动作是离散 token 还是连续变量,语义主干与动作专家怎样交换信息。
1. 离散 action token
image tokens + language tokens
↓ decoder-only LM
[bin_x, bin_y, bin_z, bin_rot, gripper]RT-2/OpenVLA 一类方法把连续动作各维量化到 bins,再像文字一样 next-token prediction。优点是复用成熟 LLM 训练接口和统一输出词表;代价是量化误差、逐 token 延迟,以及不同动作维之间的串行依赖。
2. 连续 action expert
VLM semantic tokens ──cross-attention──┐
robot state + noisy action chunk ─────┤ action DiT
noise/time embedding ─────────────────┘
↓
denoised continuous actionsπ0 与 GR00T N1/N1.5 属于这类代表。VLM 负责语义与视觉条件,动作 expert 用 diffusion/flow matching 表达连续、多峰 action chunk。语义网络可以低频,动作模块更小、更适合并行生成。
3. 统一 Transformer 与双系统
统一序列
视觉、文本、state、action 都成为 token,共享 self-attention。跨模态交互直接,但序列长、mask 和位置编码复杂。
双系统
VLM/System 2 负责慢语义,action expert/System 1 负责快控制。接口清晰,却可能形成语义瓶颈。
现实模型经常是混合体:VLM 内部统一处理图文,动作 DiT 通过 cross-attention 读取它;或者视频/action 在另一个统一 DiT 中共享权重。
4. State 放在哪里
- 作为少量 token 与视觉 token 拼接。
- 注入 action expert 的 AdaLN/conditioning。
- 每个 action step 对应一个 state token。
- 只给 action 分支,不污染通用 VLM。
state 虽低维,却消除了视觉无法确定的关节构型、夹爪和速度信息。去掉 state 的 ablation 对理解模型是否靠 proprioception 非常重要。
5. 模态怎样融合
| 机制 | 信息流 | 特性 |
|---|---|---|
| 拼接 + self-attention | 所有 token 相互读取 | 表达强、计算随总长度增长 |
| cross-attention | action query 读取 VLM key/value | 模块化、便于冻结 VLM |
| FiLM/AdaLN | 条件调制每层归一化 | 便宜,但条件压缩较强 |
| MoT/MoE | 不同模态/路由走不同参数 | 容量大,工程和负载更复杂 |
6. 看参数量要拆开看
总参数量不能直接代表控制成本。要分别报告:冻结/训练参数、VLM 与 action expert 大小、视觉 token 数、action horizon、denoising steps、控制频率和端到端 latency。一个 7B VLA 若缓存视觉语义并并行输出 chunk,可能比小型逐 token 模型更实用,反之亦然。
7. 架构量级手算
例 1:动作 token 量化
范围 [-0.05,0.05] m 分成 256 bins,步宽 $0.10/256=0.0003906$ m。值 0.012 m 的索引为 $floor((0.012+0.05)/0.10×256)=158$。
例 2:自回归动作延迟
14 维动作每维一个 token,每 token 8 ms,则单步动作仅解码就需 $14×8=112$ ms;并行连续 head 一次 20 ms 可显著降低延迟。
例 3:融合序列成本
视觉 392、文字 48、state 8、action 32 tokens,总长 480,score 数 $480²=230{,}400$;若 action 只 cross-attend 448 个条件,cross scores 为 $32×448=14{,}336$。
例 4:训练参数比例
冻结 7B VLM,只训练 300M action expert 和 20M connector,可训练参数 320M,占总 7.32B 的 $320/7320≈4.37%$;前向仍要执行冻结主干。
在相同数据、action representation、control frequency 和评测 protocol 下比较;否则“模型架构提升”经常混入数据与部署差异。
自测
1. 动作 token 化的主要好处与代价是什么?
复用语言模型的离散预测接口;代价是量化和自回归延迟,并可能不适合高精度连续控制。
2. action expert 为什么适合冻结 VLM?
它能保留 VLM 语义知识,同时单独学习机器人连续动作分布。
3. 为什么总参数量不足以判断部署速度?
速度还取决于活跃参数、token 数、缓存、解码并行性、采样步数和硬件。