深度⏱ ~2 min
里程碑
⭐ 为何重要

首次证明大规模 web VLM 可通过 co-finetune 直接输出机器人动作 token,把互联网知识迁移到操作控制。打通了高层语义理解与低层控制统一到一个 transformer 的路径,确立了 VLA 作为通用机器人 policy 的范式。是后来所有 VLA 工作的理论与实践源头。

机器人Google Everyday Robots / X-arm
数据集Web VLM data + robotic demos (OpenX)
上真机
实时
输入模态vision,language
📍 演进位置
建立在
催生

论文:Brohan et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818. 🌐

一句话直觉

让大模型直接吐机器人动作。秘诀是把动作当成"另一种外语"。VLA 之于机器人,就像 GPT 之于文本——一份大脑,多一种输出。难点恰恰在桥接:把看懂图、听懂话翻译成连续控制,不是简单多挂一个输出头。(RT-2 自己只在一种机械臂上验证;换本体要更难一层,那是 RT-2-X 的故事。)

是什么·为什么

要解决的问题:让懂网络图文的大模型,顺便也能开机器人。📎

老办法:要么小模型从零学动作(如 RT-1)。📎要么让大模型当指挥官、再调小模型执行。两条路都把"理解"和"出动作"切成两半。大模型的知识进不到动作里。

RT-2 的转身:在已训好的视觉语言模型上继续微调📎让它直接输出动作 token。关键叫 co-fine-tune:机器人数据和网络数据混训。这样模型不会把网络知识忘光。

你会看到:模型能用训练里没出现过的概念。陌生图标、算术、西班牙语指令都能对付。📎网络知识真的迁移到了动作上。

一句话类比:RT-2 把动作当成 VLM 的另一种外语。就像给会聊天的人教手语。同一个大脑,换一种输出。

怎么做

核心机制:选一个已训好的视觉语言模型(如 PaLI-X 55B)。📎把机器人动作离散成一串整数 token,像文字一样喂进词表。再让模型用 next-token prediction 学着输出这些"动作词"。📎

动作怎么变 token:一条动作 = 6-DoF 末端位姿(3 维位移 + 3 维旋转)+ 1 维夹爪开合 + 1 维完成信号。📎每个连续维度切成 256 个 bin。整条动作就是 8 个 token,像 "1 128 91 241 5 101 127 255" 这种串。

关键 trick · co-fine-tune:不只用机器人数据训。原始网络数据(图文问答、captioning)和机器人数据按比例混进每个 batch。📎具体做法是上调机器人数据的采样权重——否则网络数据量太大,机器人样本会被淹没。配比是走钢丝:机器人占比太低学不到动作,太高又把网络知识忘光。论文 Appendix 给了 PaLM-E 的配方:robotics 约占 mixture 的 66%。PaLI-X 的配比没披露。📎

输出约束:普通 VLM 可输出任意自然语言。RT-2 在机器人任务下必须输出合法动作 token。decoding 时把词表里的非法 token 全部 mask 掉。📎这样模型不会回答"对不起我不知道"。

常见误区(先抛一个):"RT-2 是从零训的吧?"——不是。📎论文 ablation 明确:去掉 VLM 预训练,5B from-scratch 性能极差,作者因此主动跳过 55B from-scratch 的评估(是"训了 5B 已经太差、不值得再投算力验 55B",不是"55B 跑不起来")。VLM 预训练是必须的起点,不是可选优化。

深度

Token 化的精确分解(论文 Sec. 3.2):6-DoF 末端位移(Δxyz + Δroll/pitch/yaw)+ 1 维 gripper extension + 1 维离散 terminate = 8 个 token / action📎注意常见误读:网上流传的"11 维 × 256 bin"是 RT-1 的设计(含 base 移动 3 维 + mode 1 维),不是 RT-2。RT-2 是 7 维连续 + 1 维离散。连续维度用 min-max 边界均匀切 256 bin(OpenVLA 后来改成 quantile 边界)。📎

词表映射(Sec. 3.2)——两种基础 VLM 用不同策略

  • PaLI-X:整数 ≤1000 各有独立 token,直接把 action bin 关联到对应整数 token——无需覆盖词表。
  • PaLM-E:没有数字专用 token,覆盖词表里最不常用的 256 个 token(OpenVLA 后来继承这个套路)。

论文把这种 override 视为一种 symbol tuning(Wei et al. 2023),之前 VLM 工作已证有效。

Emergent 能力(最关键发现,Sec. 4.2):在机器人训练数据完全没出现过的任务上做 A/B testing(Fisher 1936),约 6000 条评估轨迹📎三类涌现:

能力类别测试例子结果
符号理解"move apple to 3"、"push coke can on top of heart"RT-2-PaLI-X 最佳,超次优 baseline 约 3× 平均成功率(RT-1 为其中之一)
推理视觉 "move the apple to cup with same color";数学 "move X near the sum of two plus one";西班牙语PaLM-E-12B 在数学类反超 PaLI-X-55B(预训练数学数据多)
人类识别"move the coke can to the person with glasses"显著超 RT-1 / VC-1 baseline

CoT 版本(Sec. 4.4):额外只 fine-tune 几百个 gradient step(不重训),augment 训练数据加 "Plan" 步骤:

"Instruction: I'm hungry. Plan: pick rxbar chocolate. Action: 1 128 124 136 121 158 111 255"

让模型先输出自然语言 plan,再吐 action token。定性观察:CoT 版本能处理更复杂的复合指令。这是首次把 LLM 的 CoT 范式带进机器人 policy——后续 GR00T / OpenVLA / Helix 都沿袭。📎

Scaling + co-fine-tune ablation(Sec. 4.3 图 6b)

  • From scratch(不用 VLM 预训练权重):5B from-scratch 性能极差;作者因此主动跳过 55B from-scratch 的评估——是"5B 已经太差、不值得再投算力验 55B",不是"55B 跑不起来"(姊妹篇 OpenX Table II 里 from-scratch 的 RT-2-X 5B 能跑,只是几乎学不到东西)。VLM 预训练仍是必须的起点。
  • Fine-tune only(仅 robot data)vs Co-fine-tune(web + robot):co-fine-tune 在所有 size 上都泛化更好——保留 web data 防止 "forget VLM 概念"。
  • Size scaling:5B → 55B 显著提升泛化。

实时推理(Sec. 3.3):55B 跑在 multi-TPU 云服务,机器人联网查询。

  • RT-2-PaLI-X 55B:1–3 Hz
  • RT-2-PaLI-X 5B:~5 Hz

论文称这是当时直接闭环控制的最大模型("by over an order of magnitude")。📎

局限

  1. 闭源:权重、13 万真机数据、PaLI-X 预训练三项都不公开。→ 催生 OpenVLA(2024.06 开源 7B)。[未确认]
  2. 离散 action token 精度有限:256 bin 做不了精细灵巧操作。→ 催生 π0(flow matching 连续 action)。[未确认]
  3. 推理慢:55B 自回归生成,单步几百 ms,做不了高频控制。→ 催生双系统(GR00T N1、Helix)。[未确认]
  4. 数据规模仍小:13 万条轨迹相对 LLM 数十 T token 是九牛一毛。→ OpenX-Embodiment 在试图解决。[未确认]

研究者视角

图谱定位:RT-2 是 T06 VLA 五段演进里第二段「VLA 范式确立」的里程碑📎它把"用大模型做机器人"从 SayCan 式「LLM 当规划器 + 专门 policy」翻成「一个 VLM 直接出动作」。后续 OpenVLA、π0、GR00T N1 全是这条线。

继承 / 催生

  • 建立在:RT-1(动作 token 化 + 大规模真机 Transformer policy)、PaLI-X / PaLM-E(VLM 预训练)。
  • 直接催生:RT-2-X(55B 跨本体,Open X-Embodiment 联合)、OpenVLA(开源 7B 替代)、π0(flow matching 替代离散 token)、GR00T N1(双系统)。
  • 副产品:把 LLM 的 CoT 范式带进机器人 policy。📎

Open problems

  1. 离散 token 的精度天花板:256 bin 在灵巧操作上注定不够。连续 action head(flow matching / diffusion)能否在保留 VLM 语义先验的同时突破精度?π0 已部分回答,但高频闭环仍难。[未确认]
  2. 数据效率:13 万条真机轨迹已是当时最大,但仍比 LLM 数据少 6 个数量级。VLA 怎么像 LLM 一样吃下网络规模数据?OpenX、机器人基础模型路线仍在试。[未确认]
  3. 跨本体统一:RT-2 只在一个本体上训。跨本体(单臂 → 双臂 → 人形)的统一 policy 怎么做?RT-2-X / OpenVLA-OFT 在尝试。[未确认]

常见误区

"RT-2 是从零训的" —— 错。论文 Sec. 4.3 ablation 明确:去掉 VLM 预训练,5B from-scratch 性能极差,作者因此主动跳过 55B from-scratch 的评估(是"5B 已经太差、不再值得验 55B",不是"55B 跑不起来")。📎

VLM 预训练是必须的起点,co-fine-tune 是保留网络知识的关键 trick。

"RT-2 的动作是 11 维 × 256 bin" —— 错。这是把 RT-1 的设计(含 base 移动 3 维 + mode 1 维)张冠李戴。📎

RT-2 是 7 维连续(6-DoF 末端 + gripper)+ 1 维离散 terminate = 8 token

"RT-2 用 human feedback 训" —— 错。RT-2 的数据来自 RT-1 的 13 万条真机 teleop 轨迹(Brohan et al. 2022),是监督模仿,不是 RLHF📎

监督 fine-tune,每条轨迹带自然语言指令。

"emergent ability 是营销话术" —— 错。论文 Sec. 4.2 做了约 6000 条 A/B testing 轨迹定量评估,三类涌现能力都有数字支撑。📎

是实证发现,不是口号。

"RT-2 跑在机器人机载 GPU 上" —— 错。55B 部署在 multi-TPU 云服务,机器人联网查询,1–3 Hz。📎

是云端推理、低频闭环,不是机载高频控制。

检查点

Q1

RT-1 也是 Transformer policy,也用动作 token 化。那 RT-2 比 RT-1 多做的那一件事是什么,让网络知识能进到动作里?(提示:想想"从零训"和"在已训好的模型上继续训"的差别。)

💡 参考答案

  • RT-2 在已经预训练好的视觉语言模型(VLM)上继续微调(co-fine-tune),而 RT-1 是从零训的小模型。
  • 因为复用了 VLM 预训练权重,VLM 里已学到的网络图文知识才能顺着权重流到动作输出。
  • 对照:RT-1 从零训,网络知识进不到动作里;RT-2 的关键就是"在已训好的 VLM 上继续训"这一步。
Q2

RT-2 把动作离散成 256 bin。这套设计为什么在灵巧操作(叠衣服、拧螺丝)上先天吃亏?请用"动作是连续、光滑、多模态的"角度解释。

💡 参考答案

  • 灵巧动作是连续、光滑的;离散成 256 阶阶梯会丢精度,细腻的搓/扭/拽被粗糙化。
  • 灵巧动作还是多模态的(同一刻有多种合理走法);离散 token 表达多模态分布先天吃力。
  • 结论:256 bin 对"抓取-放置"够用,但精细灵巧操作上分辨率不够。
Q3

co-fine-tune 时为什么要把机器人数据的采样权重调高?(提示:网络数据和机器人数据的量级差几个数量级。)

💡 参考答案

  • 网络数据(图文问答、captioning)量级远大于机器人数据(差几个数量级)。
  • 若等比例采样,机器人样本几乎被网络数据淹没,模型学不到动作。
  • 所以要把小数据那一类(机器人)的上调采样权重;r2 已补论文 PaLM-E 配方:robotics 约占 mixture 的 66%。
Q4

用"教手语"或自己举的类比,向没学过机器学习的人解释 RT-2 的核心 trick。好的类比通常会同时带出三件事:(a) VLM 已经预训练好、不是从零训;(b) 动作被当成一种新语言 token;(c) co-fine-tune 让模型不忘旧语言。

💡 参考答案

  • 给一个已经会说话的人教手语——这个人就是预训练好的 VLM。
Q5

假如你只有 1 万条机器人数据和一个 7B 开源 VLM,照搬 RT-2 论文的 from-scratch 训练(不用 VLM 预训练权重)能成功吗?为什么?

💡 参考答案

  • 不能。RT-2 的整个卖点就是复用 VLM 预训练好的网络知识(入门层 反复强调"在已训好的 VLM 上继续微调")。
  • 不用预训练权重 = 扔掉全部网络知识 = 退化成 RT-1 那种从零训的困境;论文 Sec.4.3 ablation 也显示 from-scratch 5B 性能极差。
  • 而且 1 万条对 7B 模型数据量远远不够。两个理由都指向"不能"。
  • r2 纠偏(red-team major#2):from-scratch 是"性能极差",不是"跑不起来"——结论(VLM 预训练关键)保留,但别用假因果撑。

FAQ

Q1:RT-2 能在真机上闭环跑吗?

能,但慢。55B 部署在 multi-TPU 云,机器人联网查询,1–3 Hz。📎这是当时直接闭环控制的最大模型(按论文说法 by over an order of magnitude)。

Q2:为什么 RT-2 不沿用 RT-1 的 11 维动作设计?

RT-2 用的是 7 维连续(6-DoF 末端 + gripper)+ 1 维 terminate = 8 token。📎RT-1 的 11 维含 base 移动和 mode,是为带移动底盘的本体设计的。RT-2 聚焦桌面操作,不需要 base 维。

Q3:PaLI-X 和 PaLM-E 谁更强?

看任务。PaLI-X-55B 总体最强(符号理解、人类识别);PaLM-E-12B 在数学推理反超(预训练数学数据多)。📎规模不是唯一因素,预训练数据分布也决定具体能力。

Q4:学术团队能复现 RT-2 吗?

基本不能。55B 权重、13 万真机数据、PaLI-X 预训练都闭源。[未确认]换 OpenVLA(开源 7B 替代,Prismatic VLM 架构,970k OpenX 数据)更现实——但要分清:微调单卡可(LoRA),预训练仍需 64×A100×2 周 ≈ 21,500 A100-hours,普通学术组复现不起。

Q5:CoT 版本和普通版有啥区别?

CoT 版让模型先输出自然语言 plan、再吐 action token。📎只额外 fine-tune 几百个 gradient step,不重训。定性观察:复合指令上表现更好。是首次把 LLM 的 CoT 范式带进机器人 policy。