先记住一句话

VLA 的核心选择是:哪些模态共享参数和 attention,动作是离散 token 还是连续变量,语义主干与动作专家怎样交换信息。

vision + text + stateshared / separate encodersfusiondiscrete LM / continuous expertchunk decode
慢语义VLM tokens
融合self- / cross-attention
快动作token logits / vector field
输出continuous chunk
架构名之外,要追踪每种模态的 token 数、可见关系、loss 与推理循环。

1. 离散 action token

image tokens + language tokens
              ↓ decoder-only LM
     [bin_x, bin_y, bin_z, bin_rot, gripper]

RT-2/OpenVLA 一类方法把连续动作各维量化到 bins,再像文字一样 next-token prediction。优点是复用成熟 LLM 训练接口和统一输出词表;代价是量化误差、逐 token 延迟,以及不同动作维之间的串行依赖。

2. 连续 action expert

VLM semantic tokens ──cross-attention──┐
robot state + noisy action chunk ─────┤ action DiT
noise/time embedding ─────────────────┘
                                      ↓
                           denoised continuous actions

π0 与 GR00T N1/N1.5 属于这类代表。VLM 负责语义与视觉条件,动作 expert 用 diffusion/flow matching 表达连续、多峰 action chunk。语义网络可以低频,动作模块更小、更适合并行生成。

3. 统一 Transformer 与双系统

统一序列

视觉、文本、state、action 都成为 token,共享 self-attention。跨模态交互直接,但序列长、mask 和位置编码复杂。

双系统

VLM/System 2 负责慢语义,action expert/System 1 负责快控制。接口清晰,却可能形成语义瓶颈。

现实模型经常是混合体:VLM 内部统一处理图文,动作 DiT 通过 cross-attention 读取它;或者视频/action 在另一个统一 DiT 中共享权重。

4. State 放在哪里

  • 作为少量 token 与视觉 token 拼接。
  • 注入 action expert 的 AdaLN/conditioning。
  • 每个 action step 对应一个 state token。
  • 只给 action 分支,不污染通用 VLM。

state 虽低维,却消除了视觉无法确定的关节构型、夹爪和速度信息。去掉 state 的 ablation 对理解模型是否靠 proprioception 非常重要。

5. 模态怎样融合

机制信息流特性
拼接 + self-attention所有 token 相互读取表达强、计算随总长度增长
cross-attentionaction query 读取 VLM key/value模块化、便于冻结 VLM
FiLM/AdaLN条件调制每层归一化便宜,但条件压缩较强
MoT/MoE不同模态/路由走不同参数容量大,工程和负载更复杂

6. 看参数量要拆开看

总参数量不能直接代表控制成本。要分别报告:冻结/训练参数、VLM 与 action expert 大小、视觉 token 数、action horizon、denoising steps、控制频率和端到端 latency。一个 7B VLA 若缓存视觉语义并并行输出 chunk,可能比小型逐 token 模型更实用,反之亦然。

7. 架构量级手算

例 1:动作 token 量化

范围 [-0.05,0.05] m 分成 256 bins,步宽 $0.10/256=0.0003906$ m。值 0.012 m 的索引为 $floor((0.012+0.05)/0.10×256)=158$。

例 2:自回归动作延迟

14 维动作每维一个 token,每 token 8 ms,则单步动作仅解码就需 $14×8=112$ ms;并行连续 head 一次 20 ms 可显著降低延迟。

例 3:融合序列成本

视觉 392、文字 48、state 8、action 32 tokens,总长 480,score 数 $480²=230{,}400$;若 action 只 cross-attend 448 个条件,cross scores 为 $32×448=14{,}336$。

例 4:训练参数比例

冻结 7B VLM,只训练 300M action expert 和 20M connector,可训练参数 320M,占总 7.32B 的 $320/7320≈4.37%$;前向仍要执行冻结主干。

架构比较原则:

在相同数据、action representation、control frequency 和评测 protocol 下比较;否则“模型架构提升”经常混入数据与部署差异。

自测

1. 动作 token 化的主要好处与代价是什么?

复用语言模型的离散预测接口;代价是量化和自回归延迟,并可能不适合高精度连续控制。

2. action expert 为什么适合冻结 VLM?

它能保留 VLM 语义知识,同时单独学习机器人连续动作分布。

3. 为什么总参数量不足以判断部署速度?

速度还取决于活跃参数、token 数、缓存、解码并行性、采样步数和硬件。

原始资料

RT-2OpenVLAπ0GR00T N1 覆盖两条主要动作解码路线。