⏱ ~86 min

T06 · VLA 五段演进 —— 从动作 token 化到双系统人形

核心问题:怎么让一个预训练大模型(LLM/VLM)直接当机器人 policy,输出连续控制动作?这条线解决的是「互联网语义知识 → 低层 motor 控制」的桥梁问题。
状态:🟢 活跃(2025 主战场在人形 VLA + 双系统;2026 转向 cross-embodiment zero-shot / reasoning + 双系统 / World Action Models 合流)

T06 VLA 五段演进主线

🎯 你将学到什么

  1. 看懂 VLA 三年演进如何反复回答「连续动作怎么塞进 token 框架」与「大模型慢推理 vs 机器人快控制」两个根本问题
  2. 掌握 RT-1 / RT-2 / OpenVLA 的离散 action token 化机制(256 bin),以及 RT-2 co-fine-tune 如何让 web 知识涌现迁移到控制
  3. 理解 π0 的 flow matching action expert 为何是 VLA 从「操作」迈向「灵巧家务」的分水岭
  4. 能解释 GR00T N1 / Helix 双系统架构(System-2 VLM + System-1 DiT/flow)为何成为人形 VLA 的事实标准
  5. 区分 VLA(端到端)与 SayCan 式技能库、VLM + low-level policy 等分层范式的机制差异
本页内容

基础解释

一句话直觉

让懂互联网图文的大模型,直接吐出机器人关节指令。

难点在大模型"想得慢",机器人要"动得快"。

好比一位博学教授当车间主任。

脑子灵光,但手脚慢,得配个快手领班。

从基础理解

要解决的问题

传统机器人学把"看、想、动"分成三层。

能不能让一个网络一口气做完?

从像素和文字,直接出机器人动作。

这条线就叫"视觉-语言-动作"(VLA)模型 📎

演进脉络(五个台阶)

  • 动作当词。每个关节角切成几百档当"词"喂给模型 📎
  • 网络知识涌进来。机器人数据与网络图文混训,大模型"见过的杯子、红色"自动帮上忙 📎
  • 开源跨本体。二十多家机构把数据格式统一,开源模型单卡就能微调 📎 📎
  • 走向灵巧。换成连续动作头,能做叠衣服这类细活 📎
  • 双系统分层。大脑慢想意图,小脑快出动作 🌐 🌐

方法核心(大白话)

把机器人动作当成"另一种语言",教给大模型。

它在网络上学到的"杯子、红色、递给",就和动作绑在同一个脑区。

所以它听得懂"把那个红杯子递给我"。

可大模型推理一次要几百毫秒,机器人每秒要动几十上百次。

一张网兜不住这两头。

于是拆成两层:大模型慢慢想目标,小网络飞速出动作。

中间靠一个"意图向量"传话。

一句话类比

VLA 之于机器人,就像请一位懂多国语言的教授下车间。

他看图纸、听指令,直接喊工人怎么干。

2025 年这位教授还多了个"小脑助手",他想、助手动。

一、这条线索在解决什么

VLA(Vision-Language-Action)的根本问题是:大模型在互联网图文上学到的常识("杯子是拿来喝水的"、"红色的苹果在绿色背景里更容易抓"),怎么变成机器人手臂的关节指令? 传统机器人学里,感知、规划、控制是割裂的三层;VLA 想用一个大神经网络把这三层焊在一起,端到端从像素和语言直接出动作。

这件事之所以难,是因为大模型本质是「离散 token + 自回归」的,而机器人控制是「连续向量 + 高频闭环」的——两者从表示到时序都对不齐。VLA 三年(2022-2025)的演进,本质是反复回答两个问题:(1) 怎么把连续动作塞进 token 框架? (2) 大模型的慢推理和机器人的快控制怎么共存?

这条线和相邻线索的边界:VLA 是端到端范式,区别于「VLM + low-level policy」的分层范式([SayCan 等,见第三节辨析]);区别于 world model 路线(VLA 直接出动作,world model 出下一帧预测);区别于纯 BC(VLA 有预训练语义先验,BC 从零学)。

二、时间线(关键转折点)

2022 年底 RT-1 第一次证明「Transformer + 大规模真机数据」可以做真机 policy,但只是单本体、离散 token。半年后 PaLM-E 把 VLM 嵌入到 embodied 任务,验证了"VLM-as-policy"可行。真正的分水岭是 2023 年中 RT-2——它把动作当 token 喂给大规模 VLM,第一次展现了 emergent ability(chain-of-thought、符号理解),证明 web 知识能迁移到控制。

2023 年底 Open X-Embodiment 把 22 个本体的数据统一成 RLDS 格式,成为所有后续开源 VLA 的数据基石。2024 年中 OpenVLA 把 RT-2 开源化(Prismatic VLM 架构),单卡可微调,是开源 VLA 的里程碑。2024 年底 π0 用 flow matching action head 把 VLA 推向灵巧家务,是范式转换。进入 2025,主战场转到人形:GR00T N1、Helix 用双系统分层解决"VLM 慢推理 vs 机器人快控制"的根本矛盾。

下面把每一段拆开讲透。

三、关键转折的深度解析

转折 1 · RT-1(2022-12):动作 token 化,让 Transformer 能当 policy

  • 前作的缺陷:2022 年之前,真机操作 policy 基本是小 CNN/MLP,数据几百条演示,泛化差。Transformer 在 NLP/CV 已经称王,但没人把它做成大规模真机 policy,因为连续动作没法直接塞进 Transformer 的离散输出。
  • 新方法的核心 idea:RT-1 [Brohan 2022, arxiv:2212.06817] 的解法粗暴但有效——把每个动作维度离散化成 256 个 bin。具体地,RT-1 的动作空间是 11 维(7 维手臂:x/y/z/roll/pitch/yaw/gripper;3 维底盘;1 维终止标志位),每维独立用 256 bin 量化,于是每个动作变成 11 个离散 token。视觉用 FiLM-EfficientNet 编码成 image token,和语言指令 token 一起喂进 Transformer,输出就是 11 个动作 token(每个 token 是词表里 256 个 bin 之一)。
  • 为什么是突破:这一步让 Transformer 的整套 NLP 基建(attention、scaling law、大数据训练)可以直接搬到机器人控制。RT-1 在 13 万条真机演示上训练,第一次展示了「大规模数据 + Transformer」在真机操作上的 zero-shot 泛化(新物体、新背景、新光照)。
  • 留下的新问题:(1) 256 bin 的离散化损失精度,灵巧操作做不了;(2) 单本体,跨机器人要重训;(3) 没有语义先验,所有知识都来自那 13 万条机器人数据。这三条分别被 π0、OpenX、RT-2 解决。

💡 核心洞察:RT-1 用「256 bin 离散化」这一粗暴但有效的工程妥协,第一次把连续动作硬塞进 NLP 的 token 框架——这条路线后来被 RT-2/OpenVLA 推到顶峰,又被 π0 的连续 flow head 彻底取代,但「让 Transformer 直接当 policy」的奠基功绩属于它。

PDF 正文补充(来自 OpenX 论文 Sec.IV.B,对 RT-1 架构的精确刻画):RT-1 实际只有 35M 参数(不是「Transformer 大模型」级别),输入 15 幅图像 history + 自然语言;每张图过 ImageNet 预训练的 EfficientNet,语言转 USE embedding,通过 FiLM 层交织产生 81 个 vision-language token,喂入 decoder-only Transformer,输出离散化 action token。RT-1 推理频率 3-10 Hz(OpenX Fig.3)。

转折 2 · PaLM-E(2023-03):连续 embedding 直接注入 LLM 词表

  • 前作的缺陷:RT-1 的「动作离散化」是输出端的事;输入端怎么把图像/状态这种连续信号塞进语言模型,当时没解决。
  • 新方法的核心 idea:PaLM-E [Driess 2023, arxiv:2303.03378] 的关键工程细节是绕过离散 token 层,直接把连续观测映射进 PaLM 的语言 embedding 空间。具体做法:图像过 ViT(最大用 ViT-22B)、机器人状态向量(关节角等)过浅 MLP,输出的是和 PaLM token embedding 同维度的连续向量。这些向量作为"多模态 token"插进文本序列——文本里预先放占位符(如 Enc(...)),encoder 输出替换这些占位位置。于是输入是「视觉 token + 状态 token + 文本 token」的混合序列,PaLM 照常 attention,输出文本计划。最大做到 562B 参数(PaLI-X 版)。
  • 为什么是突破:第一次证明「多模态输入不用离散化」也能让大模型理解——这比 RT-1 的输出端离散化更进一步,连输入端的语义对齐都解决了。PaLM-E 在 Long-horizon 任务("把可乐罐拿给站在红色区域的人")上展现规划能力,是 VLM-as-planner 的开山。
  • 留下的新问题:PaLM-E 主要做高层规划(输出文本子目标),低层执行还是接现成 policy,不是端到端 VLA。把"VLM 理解 + 端到端动作输出"焊到一起,是 RT-2 的事。

转折 3 · RT-2(2023-07):VLA 范式确立,web 知识的涌现迁移

  • 前作的缺陷:RT-1 有动作 token 但无语义先验;PaLM-E 有语义但不出动作。两者都是"半套"。
  • 新方法的核心 idea(以下精确细节来自 RT-2 PDF Sec.3 + RT-2 项目页 emergent ability 三类评测,详见 P-RT2-2023.md):RT-2 [Brohan 2023, arxiv:2307.15818] 把这两半焊起来:拿一个大规模 VLM(PaLI-X 55B / PaLM-E 12B),和机器人数据 co-fine-tune
  • 动作 token 化的精确机制(PDF Sec.3 "Vision-Language-Action Models"):动作空间是 8 维 = 1 维 terminate + 3 维 Δpos + 3 维 Δrot + 1 维 gripper_extension(不是 RT-1 的 11 维——RT-2 把本体缩到 6-DoF EE + gripper + terminate)。7 个连续维度(除 terminate 外)各均匀离散化成 256 bins,每个动作因此表示为 8 个整数,如 "1 128 91 241 5 101 127"。要从 VLM 现有词表里保留 256 个 token 当 action token,选法因 VLM 而异:PaLI-X 词表里 0-999 的整数都有独立 token,直接用整数 0-255 对应 256 个 bin;PaLM-E 选词表中出现频率最低的 256 个 token(least frequently used),减少对自然语言能力的破坏。训练时把动作 token 直接和文本 token 一样做 cross-entropy,推理时自回归吐出 8 个 token 再 de-tokenize 回连续动作。
  • co-fine-tuning(关键 trick):不是只在机器人数据上 fine-tune,而是机器人数据与原始 web 视觉-语言数据混训(约 1:1 配比)。论文消融证明 co-fine-tune 明显优于 naïve fine-tune——web 数据保住了 VLM 的语义理解能力,反过来让机器人泛化更好。
  • emergent ability 的具体例子(PDF Sec.4 + 项目页 Human/Robot Evaluation):RT-2 最震撼的不是机器人任务本身,而是它继承了 VLM 在 web 数据上学到的能力,且这些能力机器人数据里根本没有。论文把这些能力分成三类评测:
  • 符号理解(symbol understanding):指令"把物体放到画着 <Star> 的杯子上",机器人能正确识别星形图标——但机器人训练数据里从没出现过星形。
  • 推理(reasoning,含 chain-of-thought):指令"把草莓放进正确碗",模型能先输出推理 token("草莓是水果,水果碗是这个")再出动作;CoT 版本明显比直出动作成功率高(PDF Sec.4 Chain-of-Thought 评测)。
  • 人类图标识别(human recognition):指令"把物体递给画着 <person wearing crown> 的人",能识别皇冠人物。
  • 为什么是突破:这把"用网络知识喂机器人"从口号变成实验证据。之前所有人都在猜"大模型有常识,应该能帮机器人",RT-2 第一次定量证明:只要你把动作当语言、co-fine-tune,web 知识会自动迁移到控制。这是 VLA 这个名字真正立起来的一刻。
  • web 知识为什么能迁移:本质是因为动作 token 和语言 token 共享同一个 Transformer 的所有参数(embedding、attention、FFN)。语言任务里学到的"红色、杯子、递给"这些概念,在动作任务里被复用——模型把视觉概念和动作输出绑在同一个表征空间里。这是后续所有 VLA 的理论基础。
  • 部署细节(PDF Sec.3 末):模型托管在云端服务、机器人通过网络查询——55B PaLI-X 跑 1-3 Hz、5B 跑约 5 Hz(PDF 原话)。这是「VLA 推理慢」问题首次被定量暴露,直接催生后续双系统架构。
  • 留下的新问题:55B 太大没法本地部署;离散 action token 仍限制灵巧度;单本体。开源、灵巧、跨本体这三条分别由 OpenVLA、π0、OpenX 解决。

💡 核心洞察:RT-2 用 co-fine-tune 把动作 token 与语言 token 绑进同一个表征空间——「机器人学」第一次可以站在 LLM 的语义地基上盖楼,web 知识迁移从口号变成可定量的 emergent ability。

转折 4 · Open X-Embodiment(2023-10):跨本体数据转折点

  • 前作的缺陷:RT-1/RT-2 都是 Google 自己的 Everyday Robot 本体,数据不开放,别人复现不了,跨本体是否可行也没证据。
  • 新方法的核心 idea:Open X-Embodiment / RT-X [OpenX Collaboration 2023, arxiv:2310.08864] 是工程意义大于算法意义的转折:21 家机构联合把各自的数据(1M+ 真机轨迹、22 种本体、527 个技能)整理统一。统一的关键是 RLDS(Reinforcement Learning Datasets)episode 格式——一套标准化的 steps: [observation, action, reward, ...] schema,让 22 个本体的异构数据(有的图像分辨率不同、有的动作维度不同、有的有力觉)能塞进同一个 tf.data.Dataset 管道。下游训练不用为每个数据集写适配代码。
  • 跨本体正向迁移的实验证据:在 OpenX 上训练 RT-1-X(RT-1 架构)和 RT-2-X(RT-2 架构),对比只在本体自己数据上训练的原版。结果是:RT-X 在 5/5 个评测本体上都比单本体原版好,平均提升显著。这是第一次定量证明「跨本体数据混合训练有正向迁移」——之前大家都担心"不同本体动作空间不同会互相干扰",OpenX 用实验否定了这个担忧。机制上是 VLM 的视觉/语言表征跨本体共享,只有 action head 的最后一层是本体特化的。
  • 为什么是突破:OpenX 成为后续所有开源 VLA 的数据基石——Octo、OpenVLA、RDT 全部在 OpenX 上预训练。它本质上是机器人学的"ImageNet 时刻":在这之前每个组用自己的数据,之后大家有了公共基准。
  • 留下的新问题:1M 轨迹对 LLM 的几十 T token 来说仍少 4-5 个数量级;跨本体 scaling law 的天花板在哪未知(详见第六节)。

💡 核心洞察:OpenX 用实验否定了「不同本体动作空间不同会互相干扰」的直觉——只要 VLM 视觉/语言表征跨本体共享、只让 action head 最后一层本体特化,混合训练就有正向迁移,这是机器人学「ImageNet 时刻」的方法论根据。

转折 5 · OpenVLA(2024-06):开源 VLA 里程碑

  • 前作的缺陷:RT-2 是闭源 55B,普通人摸不到。需要一个"RT-2 的开源平替"。
  • 新方法的核心 idea:OpenVLA [Kim 2024, arxiv:2406.09246] 用 Prismatic VLM 架构拼出 7B 的开源 VLA:(1) LLaMA-2 7B 作语言 backbone;(2) 视觉编码器双流融合——SigLIP(提供语义级视觉理解)+ DINOv2(提供空间/几何特征),两者 token 拼接;(3) action head 沿用 RT-2 式 256 bin 离散 token。在 970k OpenX 子集上训练,代码/权重/数据全开源,单张 A100 可 LoRA 微调适配新机器人。
  • 为什么 SigLIP + DINOv2 双流是关键:单独 SigLIP 擅长"这是什么"(语义),不擅长"在哪"(空间);单独 DINOv2 反过来。操作任务两个都要(既要认出杯子,又要知道杯子精确位置),所以融合。这个双流设计后来被 CogACT 等沿用(GR00T N1 走另一条路:Eagle-2 VLM = SmolLM2 + SigLIP-2 单流视觉编码,但同样强调空间细节——取 LLM 第 12 层中间层 feature 而非 final layer,保留更多 spatial/visual 信息给 action head)。
  • 为什么是开源里程碑:在 OpenVLA 之前,开源 VLA(Octo 27M/93M)太小,能力远不如闭源 RT-2。OpenVLA 第一次让开源 7B 在通用 manipulation 评测上反超闭源 RT-2-X 55B(OpenVLA 论文报告绝对成功率更高),且微调门槛极低(几十条数据 + 单卡)。之后 RL-VLA、VLA-RFT、RL Token 等 RL finetune 工作基本都以 OpenVLA 为起点。
  • 留下的新问题:仍是离散 token,灵巧不行;7B 推理延迟几百 ms,高频闭环够呛。这两条被 π0 和双系统架构解决。

转折 6 · π0(2024-10):flow matching action head,VLA 走向灵巧

这是 VLA 从「操作」迈向「灵巧」的分水岭,单独一篇笔记 P-pi0-2024.md 详述(基于 PDF Sec.IV–V + Appendix B/C/D 的精确数字),这里讲核心。

  • 前作的缺陷:所有前作(RT-1 到 OpenVLA)都是离散 action token,灵巧家务(叠衣服、收桌子)做不了——动作连续、多模态、高频,256 bin 离散化损失太大。
  • 新方法的核心 idea:π0 [Black 2024, arxiv:2410.24164] 在 PaliGemma 3B VLM(Gemma 2B 语言模型 + SigLIP ViT)上接一个独立的 action expert,用 flow matching 生成连续 action chunk(H=50)。
  • 架构精确配置(Appendix B)
  • Gemma 2B 语言模型{width=2048, depth=18, mlp_dim=16384, num_heads=18, num_kv_heads=1, head_dim=256},multi-query attention。
  • Action expert{width=1024, mlp_dim=4096},约 300M 参数从零初始化(不经 VLM 预训练)。整体约 3.3B 参数
  • Attention mask(关键加速 trick)3-block causal = [image+lang] / [state $q_t$] / [noisy actions $a^\tau$]块内全双向、块间 causal——state 块看不到 action 块,所以 state 的 K/V 可在 10 步 flow matching 推理时缓存。action expert 与 VLM 共享 self-attention 层的 K/V、但不共享 FFN/token embedding 参数——本质是 mixture-of-experts with 2 experts(image+lang token 路由到 VLM expert、state+action token 路由到 action expert)。
  • Flow matching timestep 注入:每个 noisy action $a^\tau_{t'}$ 先用 MLP 编码 W3·swish(W2·concat(W1·a^τ, ϕ(τ)))($\phi$ 是 sinusoidal PE),再线性投影解码为 $v_\theta$。action expert 没用 DiT/AdaLN-Zero(只在 π0-small baseline 里用 DiT)。
  • Flow matching 数学(Sec.IV + Appendix B):从高斯先验 $A^0_t \sim \mathcal{N}(0,I)$ 到动作分布 $A^1_t$ 用 linear-Gaussian / optimal-transport 路径:$q(A^\tau_t \mid A_t) = \mathcal{N}(\tau A_t, (1-\tau)I)$,即 $A^\tau_t = \tau A_t + (1-\tau)\epsilon$。目标向量场 $u(A^\tau_t \mid A_t) = A_t - \epsilon$。训练 loss:$\mathcal{L}_\tau(\theta) = \mathbb{E}_{p(A_t|o_t),\, q(A^\tau_t|A_t)}\big[\|v_\theta(A^\tau_t, o_t) - (A_t - \epsilon)\|^2\big]$。action expert 输出 $v_\theta$,用 full bidirectional attention(action token 互相 attend)。
  • 关键采样 trick(Appendix B,⚠️ 与图像生成相反):$t$ 不用 logit-normal,而是从 shifted Beta 采样:$p(\tau) = \text{Beta}(\frac{s-\tau}{s};\, \alpha=\mathbf{1.5},\, \beta=\mathbf{1})$,cutoff $s=0.999$——偏向低 τ(高噪声)端。作者论证:图像生成中间时刻最有效,但机器人动作预测不同——观测 $o_t$ 信息量极大,使预测 $\mathbb{E}[A_t|o_t]$(即 τ→1 低噪声时退化的均值)本身就难,所以故意多采高噪声样本强化学习。
  • 推理(Sec.IV + Appendix D):从 $A^0_t \sim \mathcal{N}(0,I)$ 出发,固定 10 步 Euler ODE 积分($\delta=0.1$)。关键加速:prefix $o_t$ 的 K/V 跨 10 步缓存,每步只重算 action token 部分。
  • 推理延迟(Table I,RTX 4090 单卡,3 张相机图):image encoders 14 ms + observation forward pass 32 ms + 10×action forward pass 27 ms = 总 on-board 73 ms(off-board + Wi-Fi 86 ms)。20 Hz 机型(UR5e/Franka)每 0.8 s 推一次(执行 16 步),50 Hz 双臂每 0.5 s 推一次(执行 25 步)。作者发现 temporal ensembling 反而降性能,所以选择开环执行 chunk、不聚合
  • 数据规模(Sec.V):自家 903M timesteps / 10000 小时灵巧操作 + 9.1% 公开数据(OXE/Bridge v2/DROID);跨 7 种本体(UR5e 单/双臂、Franka、Trossen/ARX/AgileX 双臂、Mobile Trossen/ARX/Fibocom),所有 $q_t, a_t$ 统一 pad 到 18 维(最大本体 = 双 6-DoF 臂 + 2 夹爪 + 移动底座 + 升降躯干),小本体 zero-pad、缺图位 mask。任务权重按 $n^{0.43}$ 加权 down-weight 过表达组合。Pre-training(700k steps,全混合)+ Post-training(高质 curated fine-tune 到具体任务,5–100+ 小时数据) 分离。
  • flow matching 相比 diffusion 的三大优势:(1) 路径直(rectified flow 是直线,10 步够,diffusion 要几百步);(2) 训练稳(回归目标无界,不像 diffusion 噪声预测要夹在 $[-1,1]$,跨本体混合不会炸);(3) 天然多模态(不同 $a_0$ 流向不同模态,能表达"同一任务多种抓法")。这三点合起来,让 VLA 第一次在叠衣服这类连续灵巧任务上跑通。
  • 架构上为什么必须 action expert:VLM 的 token embedding 是为语言设计的,直接让它输出连续动作会破坏语义表征。action expert 是一组独立参数,通过共享 attention 看到 VLM 的图像/语言 token,但用自己的 FFN 出动作——本质是局部 MoE / 专家分支。这套"VLM backbone + flow/diffusion action head + action expert"骨架被 RDT-1B、CogACT、GR00T N1 全部继承。
  • 为什么是突破:第一次证明端到端 VLA 能做叠衣服、装购物袋这种长程灵巧家务;openpi 开源后成为开源社区默认起点。后续 π0.5(加高层语言推理)、Hi Robot(多轮纠错)都在这之上叠加。
  • 留下的新问题:3.3B + 10 步 ODE 推理几十 ms,高频闭环仍不够;flow 10 步比纯自回归(1 步)慢一个量级。这就是双系统架构的动机。

💡 核心洞察:π0 用 flow matching 取代离散 action token 是 VLA 范式拐点——连续动作头 + action expert 让 VLA 第一次能输出多模态连续动作,「离散 256 bin」路线从此退场,「VLM backbone + flow/diffusion action head」成为后续人形 VLA 的事实骨架。

转折 7 · 人形 VLA + 双系统(2025):解决"慢推理 vs 快控制"的根本矛盾

进入 2025,VLA 主战场转到人形机器人,核心矛盾爆发:7B 级 VLM 单步推理几百 ms(5-10Hz),但灵巧控制要 30Hz+,人形全身要 100Hz+。 单模型不可能同时满足。三家给出相同处方——双系统分层

GR00T N1(NVIDIA,2025-03)[Bjorck 2025, arxiv:2503.14734]

开源人形 VLA,双系统架构灵感来自 Kahneman《思考,快与慢》:

  • System-1(action expert,120Hz):一个 Diffusion Transformer(DiT)(层数论文未明确,Fig.3 标"xN"),接收 System-2 的 latent + 实时机器人 state,用 flow matching 去噪出精确 motor command,120Hz 出动作。
  • 为什么必须分层:人形 upper body 几十个关节,要做精细抓取 + 平衡,120Hz 是底线;但 VLM 理解"把那个红色杯子递给我"需要几百 ms。两者频率差两个数量级,塞进一个网络必然顾此失彼。分层后 System-2 慢思考、System-1 快执行,latent plan 作为桥梁(System-2 每秒更新一次 plan,System-1 在两次更新间持续出动作)。
  • 配套大规模合成数据 pipeline(与 Cosmos world model、Isaac Lab、Isaac GR00T Mimic 整合),后续 N1.5 / N1.7 持续迭代。

Helix(Figure AI,2025-02)[Adcock 2025, figure.ai/news/helix]

闭源,首个对整个人形上半身(手腕、躯干、头、单根手指,35 DoF)做高频连续控制的 VLA:

  • System-2(S2)7B VLM,跑 7-9Hz,处理视觉和语言,输出一个 latent 语义向量
  • System-1(S1)80M visuomotor transformer,跑 200Hz,把 S2 的 latent 向量 + 实时 state 转成连续动作。
  • 200Hz 怎么实现的:关键是 S1 只有 80M(不是 7B),小模型推理极快,单步几 ms。S2 7-9Hz 出 latent,S1 在两次 latent 更新间持续以 200Hz 平滑出动作。这本质是"用一个小的高速马达控制器,去追随一个大慢思考器给出的目标轨迹"。
  • 为什么 Helix 是突破:第一次让单套 VLA 同时控制人形全身上半身 35 DoF 且 200Hz 闭环,demo 里两个人形机器人无需预先协调就能合作搬东西。

为什么 SayCan 式技能库 ≠ 双系统

两者都叫"分层",机制完全不同(这是必须辨析的点):

  • SayCan [Ahn 2022, arxiv:2204.01691]离散技能选择:LLM 给每个候选技能打语义分,affordance 函数给物理可行性分,两分数相乘选技能。技能库是预定义的、有限的(如"抓"、"放"、"倒"),LLM 不参与动作执行。
  • GR00T N1 / Helix 双系统连续动作生成:System-2 不是选离散技能,而是输出 latent 向量喂给 System-1;System-1 是端到端 policy,动作是连续生成的,不限于预定义技能集。这是端到端 VLA 在 2025 的自我分层化——保留 VLA 的连续性优势,同时解决延迟。

💡 核心洞察:双系统不是 SayCan 的离散技能选择——System-2 输出的是连续 latent 向量而非「技能 ID」,System-1 是端到端 policy 而非预定义技能库;这把「快思考/慢思考」的认知理论真正落到了 VLA 架构里,是 2025 人形 VLA 的分水岭。

2026 最新进展

2026 上半年 VLA 沿「跨本体 zero-shot / test-time scaling / reasoning + 双系统 / 双臂双手灵巧 / World Action Models 合流」五条轴线深化——双系统骨架(System-2 VLM × System-1 DiT/flow matching)成为事实标准,新工作多在这之上做 spécialisation:

  • Patch Policy:dense ViT 特征的轻量控制支线:Patch Policy [Zhou et al., arXiv:2607.18236] 不把预训练 ViT 的视觉信息压成单个 CLS/global token,也不让策略背负整套 VLM,而是让轻量 Transformer 直接读取冻结的 dense patch grid;block-causal attention 保留帧内空间交互与跨时间因果。作者在四套仿真和三套真机操作环境中报告,相对 global-pooled 表征提升 40%,并以约 OpenVLA-OFT 0.7% 的参数量超过其报告结果 18%。这组数字只适用于作者的评测套件,但它清晰提出了 T06 的一条中间路线:VLM 级空间表征,不必等于 VLM 级控制成本。项目页和仓库已公开,但训练代码尚未发布。
  • 跨本体 zero-shot(OpenX 路线的收口):LAP-3B [Zha et al., arxiv:2602.10556](Princeton,Majumdar Lab / Ren)直接用自然语言文本表示低层动作,让动作监督信号与预训练 VLM 的输入-输出分布对齐——无需学习型 tokenizer、无需昂贵标注、无本体专属结构。LAP-3B 是首个完全无本体专属微调就能对新机器人实现实质 zero-shot 迁移的 VLA,平均成功率 >50%(较此前最强 VLA 翻倍),是 2026 上半年跨本体 VLA 的标志性收口。
  • Test-time scaling 从 LLM 迁入 VLA:E-TTS [Ye et al., arxiv:2606.27268] 用 vision-language verifier 对候选动作做 history-aware 迭代细化,是输出端的验证/筛选路线;RoboTTT [Jiang et al., arxiv:2607.15275] 则在 GR00T N1.7 中插入测试时训练层,把流入的视觉-动作历史压进持续更新的快速权重,以固定推理成本把上下文扩到 8K 步。两者共同说明 test-time scaling 已进入 VLA,但接口不同:前者增加“想得更久”的验证回路,后者让策略在执行中保留并利用“经历得更久”的上下文。
  • Reasoning VLA + 双系统(ECoT 监督对齐跨本体表征):ZR-0 [Li et al., arxiv:2606.30552](RUC + Kuaishou + ByteDance,2.6B)用密集 Embodied Chain-of-Thought(ECoT) 监督对齐 VLM 中的跨本体表征:System-2 VLM 训练时生成结构化 ECoT 推理,System-1 DiT 通过 flow matching 出连续 action chunk;推理时可完全跳过 ECoT 生成而无性能损失。在 60M 帧 / 1000 小时 / 400K+ 轨迹的 ProcCorpus-60M(96.8% 帧带 ECoT 标注)预训练后跨 LIBERO / RoboTwin 2.0 / RoboCasa GR-1 + xArm 真机均强,给「用推理监督对齐 VLA 表征」首个大规模实证。
  • 开源双臂-双手高 DoF VLA(× T11):Dexora [Zhang et al., arxiv:2605.18722](清华 + 同济 + 小米)是首个开源的原生支持双臂-双手高 DoF 操作的 VLA 系统,混合遥操管线(外骨骼背包采粗臂运动 + Apple Vision Pro 无标记手部追踪采手指)同时驱动物理双臂双手平台与 MuJoCo 数字孪生,构建 embodiment-matched 合成语料 + 真机示教的大规模训练集——填补了 VLA 多限于单夹爪或单灵巧手的空白,是 2026 双臂 VLA 基础设施代表作。
  • World Action Models 合流(× T09):复旦综述 WAM Survey [Wang et al., arxiv:2605.12090] 首次系统综述 World Action Models(WAMs),把「预测状态建模」与「动作生成」统一为联合分布,建立 Cascaded vs Joint WAMs 分类法——把 VLA × world model 合流方向正式立起来。OSCAR [Wu & Gao, arxiv:2606.04463](Alberta / NVIDIA)用 2D kinematic skeleton 渲染作跨本体统一条件表示(机械臂与人手同一表示),在单张 GH200 上微调 Cosmos-Predict2.5-2B 构建 action-conditioned video WM,部署到 RoboArena 做策略评估——首次展示虚拟世界策略评估与真机评估强相关,是迈向「机器人策略纯虚拟世界评估」愿景的关键一步。
  • 全身运动 VLA(loco-manipulation):WOLF-VLA [Boukheddimi et al., arxiv:2606.25591](2026-06,IFAC WC 2026)把最优控制生成的动态一致人形 locomotion 数据与 VLA 框架结合,从自然语言指令生成全身运动——填补了 VLA 多聚焦上半身 manipulation、locomotion 与 manipulation 长期割裂的空白。它在图中单列为「VLA × whole-body」分支:关键增量是把动态可行的全身运动数据接入 VLA,而不是推理或世界模型扩展。

📌 关键要点

  1. VLA 三年(2022-2025)演进的本质,是反复回答两个问题:连续动作怎么塞进 token 框架 + 大模型慢推理与机器人快控制怎么共存
  2. RT-2 是确立范式的分水岭:用 co-fine-tune 把 VLM 在 web 数据上的语义/符号/推理能力迁移到控制端,第一次定量证明 emergent ability
  3. Open X-Embodiment 是机器人学的「ImageNet 时刻」——22 本体 RLDS 统一成为后续所有开源 VLA(Octo / OpenVLA / RDT)的数据基石,且跨本体正向迁移成立
  4. π0 用 flow matching action expert + action chunking 把 VLA 推向叠衣服等灵巧家务,离散 action token 路线由此被连续 head 取代
  5. 双系统(System-2 VLM 慢推理 + System-1 DiT/flow 快执行)是 2025 人形 VLA 的事实标准,解决「7B 推理慢 vs 100Hz+ 控制频率」的根本矛盾,区别于 SayCan 式离散技能选择

四、相似概念辨析

概念 A概念 B区别何时用哪个
VLA(端到端)VLM + low-level policy(分层)VLA 一个网络从像素语言直接出动作;VLM+low-level 是 VLM 出文本/latent 子目标,喂给独立的 low-level policy(BC/RL)执行任务简单、延迟要求不高 → VLA;长程、高频、需要可解释规划 → VLM+low-level。但 2025 趋势是两者融合(VLA 内部双系统化)
双系统(GR00T N1/Helix)SayCan 式技能库双系统是连续 latent 传递;SayCan 是离散技能选择 + affordance 打分双系统要端到端训练 + 大量 teleop 数据;SayCan 数据门槛低但技能有限
离散 action token(RT-1/RT-2/OpenVLA)连续 action head(π0/RDT/GR00T N1 DiT)前者把动作当 token 自回归;后者用 flow/diffusion 生成连续动作简单操作 + 快推理 → 离散 token;灵巧多模态动作 → 连续 head
flow matching(π0)diffusion(RDT-1B/Diffusion Policyflow 路径直、推理步数少(10 步);diffusion 路径弯、步数多(几十~几百)但要成熟工具链都能做多模态动作;π0 flow 更快,RDT diffusion 生态更成熟

五、与其他线索的交叉点

  • 与 [T05 diffusion-policy-lineage]:π0 / RDT-1B / CogACT 是 Diffusion Policy([Chi 2023])和 ACT([Zhao 2023])的 action chunking + 多模态思想在 VLA 上的落地。flow/diffusion action head 是这两条线的合流点。
  • 与 [T09 world-model-as-simulator]:3D-VLA 把 VLA + 3D 表示 + generative world model 整合,world model 既当数据源又当评估器。这是 VLA 和 world model 两条线的合流。
  • 与 [T07 humanoid-teleop-stack] / [T10 vla-wbc-integration]:人形 VLA(GR00T N1、Helix、HumanVLA)几乎都用「VLA 出上半身/末端期望 + WBC 出关节力矩」分层,VLA 不直接跑 locomotion。这是 VLA 和 locomotion 的接口问题(开放,见第六节)。
  • 与 [T02 online-adaptation]:RL finetune(RL-VLA、VLA-RFT、RL Token)是把 VLA 当起点做在线优化,是 VLA 和 RL 的交叉。

六、当前局限与开放问题

  1. 推理延迟 vs 灵巧控制频率(最尖锐):7B VLA 单步几百 ms,灵巧要 30Hz+,人形要 100Hz+。当前三条解法:(a) 双系统(Helix 200Hz S1 + 7B S2,GR00T N1 120Hz System-1);(b) action chunking(π0 一次出 50 步,摊薄推理成本);(c) 小 VLA(TinyVLA、RoboMamba)。判断:双系统是当前最可行路径,因为单模型不可能既大又快;但双系统的 latent 接口如何训练(System-2 的 latent 怎么对齐 System-1 的输入)仍是开放问题。
  2. 跨本体泛化的上限:OpenX 1M 够吗?目前看跨本体正向迁移成立(OpenX 实验证据),但跨本体 + 跨任务 + 新本体的 zero-shot 仍弱于专门微调。判断:1M 远不够,LLM 有几十 T token,机器人数据少 4-5 个数量级。合成数据(Cosmos、GR00T Mimic)+ AutoRT 式自主采集是补齐方向。
  3. VLA + locomotion WBC 接口标准:语言 / 关节角 / latent 三种接口都有人用,没有共识。状态对齐(VLA 的视觉坐标系和 WBC 的本体坐标系)和延迟同步(VLA 慢、WBC 快)是工程难点。这是 2025-2026 最重要的开放问题之一。
  4. 泛化 vs 专用:通用 VLA 在跨本体/跨任务上仍弱于专门微调策略;RL finetune 是新希望(证明 PPO 在 OpenVLA 上比纯 SFT 显著提升泛化)。
  5. 评估方法学:真机评测昂贵不可复现,1X WM 提出 world model 当评估器(见 [T09]),但 WPE 研究发现 world model 会"幻觉成功",可靠性待验证。

七、涉及里程碑论文

  • [Brohan 2022, arxiv:2212.06817] RT-1 —— 动作 token 化(256 bin × 11 维),Transformer 当真机 policy 的开山
  • [Driess 2023, arxiv:2303.03378] PaLM-E —— 连续观测注入 PaLM 词表,VLM-as-policy 可行性
  • [Brohan 2023, arxiv:2307.15818] RT-2 —— VLA 范式确立,emergent ability 证明 web 知识迁移
  • [Ahn 2022, arxiv:2204.01691] SayCan —— LLM 技能选择 + affordance,分层对比组
  • [OpenX Collaboration 2023, arxiv:2310.08864] Open X-Embodiment / RT-X —— 22 本体 RLDS 统一,跨本体正向迁移证据
  • [Octo Team 2024, arxiv:2405.12213] Octo —— 开源轻量通用 policy(27M/93M)
  • [Kim 2024, arxiv:2406.09246] OpenVLA —— 开源 VLA 里程碑(Prismatic = LLaMA-2 + SigLIP + DINOv2)
  • [Black 2024, arxiv:2410.24164] π0 —— flow matching action head,VLA 走向灵巧(详见 P-pi0-2024.md
  • [Liu 2024, arxiv:2410.07864] RDT-1B —— diffusion 1B 操作 foundation model
  • [Adcock 2025, figure.ai/news/helix] Helix —— 人形上半身 200Hz 双系统 VLA(7B S2 + 80M S1)
  • [Bjorck 2025, arxiv:2503.14734] GR00T N1 —— 开源人形 VLA + System-2/System-1 双系统(DiT action head @ 120Hz)
  • [Physical Intelligence 2025, arxiv:2504.16054] π0.5 —— π0 + 高层语言推理 + 异构数据,open-world 家庭
  • [Gemini Robotics Team 2025, arxiv:2503.20020] Gemini Robotics —— Gemini 2.0 衍生 VLA + ER 双模型族

八、参考文献与延伸阅读

  • 本仓库内的相关论文笔记:P-pi0-2024.md(π0 flow matching 详解)
  • 本仓库内的相关线索:T05 Diffusion Policy 谱系(diffusion/flow action head 谱系)、T09 World Model 作模拟器(VLA + world model 合流)、T10 VLA+WBC 分层集成(VLA + locomotion 接口)
  • 外部:RT-2 项目页 robotics-transformer2.github.io(emergent ability 三类评测);π0 博客 pi.website/blog/pi0;GR00T N1 白皮书;Helix 官方页 figure.ai/news/helix;OpenX 项目页 robotics-transformer-x.github.io

可选复盘:常见误区

澄清:"VLA 就是给大模型接个机械臂" —— 错。难点不在硬件,而在大模型是"离散文字、慢慢生成",机器人是"连续动作、高频闭环",两头对不上。VLA 的全部功夫都在填这道缝:把动作变成词、把频率拆成两层。

"VLA 就是给大模型接个机械臂" —— 错。难点不在硬件,而在大模型是"离散文字、慢慢生成",机器人是"连续动作、高频闭环",两头对不上。VLA 的全部功夫都在填这道缝:把动作变成词、把频率拆成两层。

VLA 是表示和时序的双重对齐工程。

澄清:"大模型懂常识,接上机器人就能干" —— 错。光有大模型不够,还得和机器人数据"混训"(co-fine-tune)。只拿机器人数据硬微调,会把网络知识忘光;混训才保住"杯子、红色"这些概念能迁移到动作 。

"大模型懂常识,接上机器人就能干" —— 错。光有大模型不够,还得和机器人数据"混训"(co-fine-tune)。只拿机器人数据硬微调,会把网络知识忘光;混训才保住"杯子、红色"这些概念能迁移到动作 📎

网络知识能迁移,前提是训练时不被冲掉。

澄清:"双系统 = 技能库选一个执行" —— 错。早期的技能库(如 SayCan)是从几个预定义动作里"挑一个",是离散选择 。2025 的双系统(GR00T N1、Helix)是连续生成:大脑出一个意图向量,小脑端到端地连续出动作,不限于固定技能集 。

"双系统 = 技能库选一个执行" —— 错。早期的技能库(如 SayCan)是从几个预定义动作里"挑一个",是离散选择 📎。2025 的双系统(GR00T N1、Helix)是连续生成:大脑出一个意图向量,小脑端到端地连续出动作,不限于固定技能集 🌐

双系统是"连续意图传递",不是"离散技能选择"。

可选复盘:检查点

Q1

用"教授 + 领班"类比,向一个没学过机器人的朋友解释:为什么 VLA 在 2025 年纷纷拆成两层?只靠一层不行吗?

查看参考答案
  • 核心矛盾:大模型推理慢(几百毫秒一次),机器人要动得快(每秒几十到上百次动作);一个网络同时满足两头做不到,会顾此失彼。
  • 类比锚:教授=大模型,脑子灵光(懂指令、有常识)但手脚慢;领班=小网络,反应快但没主见。教授想目标、领班出动作,两层配合才能既聪明又及时。
  • 结论:只靠一层不行。单用大模型 → 太慢跟不上控制频率;单用小网络 → 没常识、听不懂复杂指令。拆两层是用'分工'化解'慢思考 vs 快控制'的根本矛盾。
Q2

VLA 这条线的"五段演进"里,第二段(网络知识涌进来)的关键做法是什么?为什么不能只拿机器人数据硬微调?

查看参考答案
  • 关键做法:把机器人数据和原始的网络图文数据'混在一起'一起微调(co-fine-tuning / 混训)。
  • 为什么不能硬微调:只拿机器人数据微调,大模型会把网上学到的'杯子、红色、递给'这些概念忘光(灾难性遗忘),反过来损害机器人任务上的泛化。
  • 混训的好处:网络数据保住了语义理解能力,机器人数据教会动作,两者互相成全——所以网上学到的常识能迁移到控制。
Q3

"动作当词"(第一段)具体是把什么变成了什么?这一步让哪项现成的技术可以直接搬过来用?

查看参考答案
  • 做法:把每个关节角(连续数值)切成几百档(如 256 档),每一档当成一个离散的'词'(token),于是连续动作变成了一串离散的词。
  • 搬过来用的技术:大语言模型/Transformer 的整套基建——注意力、自回归生成、大数据训练这套在自然语言上成熟的技术,可以直接拿来生成机器人动作。
  • 意义:让'用大模型出机器人动作'从概念变成工程上可做的事。
Q4

假如一个 VLA 模型推理一次要 300 毫秒,但人形机器人要每秒出 100 次动作。用"大脑慢想、小脑快动"的思路,说说你会怎么分工?两层之间传什么?

查看参考答案
  • 分工:大模型(大脑)以低频(如几 Hz)跑,理解场景和指令、想出目标;小网络(小脑)以高频(100 Hz)跑,实时把目标翻译成连续动作。
  • 两层之间传什么:一个'意图向量'(latent / 目标向量)——大模型把它作为目标喂给小网络,小网络在两次更新之间持续地高频出动作去追随这个目标。
  • 可行性依据:小网络参数小、单步推理几毫秒,所以能跑高频;大模型不必每步都跑,靠小脑兜住中间的几百毫秒。
Q5

有人问"双系统不就是先选技能、再执行吗?",请用 刚学到的内容纠正他。两条各举一个机制上的差别。

查看参考答案
  • 纠正:双系统不是'从几个预定义技能里挑一个',而是大模型输出一个连续的意图向量,喂给小网络端到端地连续生成动作。
  • 差别一(输出形态):技能库是离散选择(从有限动作集里选一个);双系统是连续生成(动作不限于固定技能集,是端到端网络连续出的)。
  • 差别二(大模型的角色):技能库里大模型只负责'打分/选哪一个',不参与动作执行;双系统里大模型给出意图向量、小网络基于它生成动作,两者协同贯穿整个执行过程。
  • (对照点)技能库代表:SayCan;双系统代表:GR00T N1 / Helix。

可选复盘:FAQ

Q1:VLA 和"大模型当规划器、再调一个低层控制器"(分层范式)有什么区别?

VLA 是一个网络从像素和语言直接出动作,端到端。分层范式是大模型出文本子目标,喂给一个独立的低层 policy 去执行。VLA 简单直接但推理慢;分层层级清晰、可解释。2025 年的趋势是两者融合:VLA 内部自己分出"快慢两层",本质是把分层范式吸收进来 🌐

Q2:为什么 VLA 推理这么慢?

因为大模型本体就有几十亿参数,每生成一个动作 token 都要跑一次完整的前向传播。早期 55B 的模型在云端跑,一秒只能出 1 到 3 次动作 📎。后续通过开源小模型(7B)、动作分块(一次出几十步)、双系统(快小脑兜底)把延迟逐步压下来。

Q3:VLA 现在上真机了吗?

能上,但有条件。叠衣服、收桌子这类家务 demo 已经在双臂和单人形上跑通 📎;人形全身 200Hz 闭环也有(Helix) 🌐。但跨本体、跨任务的零样本泛化仍弱于专门微调的策略,真机评测也贵且难复现。这是当前最活跃的开放方向之一。