⏱ ~20 min
里程碑
⭐ 为何重要

首次证明大规模 web VLM 可通过 co-finetune 直接输出机器人动作 token,把互联网知识迁移到操作控制。打通了高层语义理解与低层控制统一到一个 transformer 的路径,确立了 VLA 作为通用机器人 policy 的范式。是后来所有 VLA 工作的理论与实践源头。

建立在
催生
机器人Google Everyday Robots / X-arm
数据集Web VLM data + robotic demos (OpenX)
上真机
实时
输入模态vision,language

RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

作者 / 机构:Anthony Brohan, Noah Brown, Justice Carbajal, ..., Google DeepMind(庞大团队)
发表:arXiv 2023.07(后续被广泛引用,奠定 VLA 范式)
arxiv:2307.15818 · 代码:闭源 · 项目页:robotics-transformer2.github.io
在线索中的位置:属于 T06「VLA 五段演进」,是第二段「VLA 范式确立」的里程碑
一句话定位:第一次把大规模 VLM(PaLI-X、PaLM-E)直接 fine-tune 成机器人 policy,证明 web 知识能 emergent 转移到机器人动作——VLA 这个范式就是它立起来的。

动机

前作 RT-1(2022.12)已经证明 Transformer 能当大规模真机 policy,但有两个根本局限:

  1. 从零学起:RT-1 只用机器人数据训练,没有利用互联网上海量的视觉-语言知识。
  2. 无语义泛化:遇到没见过的物体/指令就崩。

Google DeepMind 的核心 question:能不能直接复用已经在 web 数据上预训练好的 VLM(PaLI-X 55B、PaLM-E 12B),让它顺便输出机器人动作?如果能,VLM 里学到的「皇冠是权力的象征」「星形图标」「chain-of-thought 推理」这些知识,能不能 emergent 转移到机器人?(注:PaLM-E 原论文最大变体到 562B,但 RT-2 实际只用了 12B 版本。)

方法核心

RT-2 的关键 trick:把机器人动作当成「另一种外语」


传统 VLM:输入 (图像, "把杯子放到左边") → 输出文本 "好的,杯子在左边"
RT-2    :输入 (图像, "把杯子放到左边") → 输出文本 "动作token序列"

基础 VLM 选择(论文 Sec. 3.1)

RT-2 不训新 VLM,而是直接 fine-tune 两个已有 VLM:

  • PaLI-X(Chen et al. 2023a):5B 和 55B 两种规模
  • PaLM-E(Driess et al. 2023):12B

分别记作 RT-2-PaLI-X(5B/55B)和 RT-2-PaLM-E(12B)。这两个 VLM 已经在 web-scale 数据上预训练好(视觉问答、captioning、image-text 交错),RT-2 在它们之上做 action fine-tune。

动作 token 化(论文 Sec. 3.2,精确纠正

精确分解(论文 Sec. 3.2 原文):

  • 6-DoF 末端位移:Δpos(x/y/z)+ Δrot(roll/pitch/yaw)= 6 维连续
  • gripper extension:1 维连续(夹爪开合度)
  • terminate command:1 维离散(任务完成信号)
  • 连续维度(前 7 维)uniformly 离散成 256 bin(注意 RT-1 旧设计用 min-max 边界,OpenVLA 后来改成 quantile 边界,但 RT-2 仍是 min-max)。
  • 离散 terminate 是 0/1 整数。
  • 整条 action = 8 个 token("terminate Δposx Δposy Δposz Δrotx Δroty Δrotz gripper_extension"),如「1 128 91 241 5 101 127 255」(论文 Sec. 3.2 实例)。

Token 词表映射(论文 Sec. 3.2)——两种 VLM 用不同策略

  • PaLI-X:整数 ≤1000 各有独立 token,直接把 action bin 关联到对应整数 token——无需覆盖词表。
  • PaLM-E:没有数字专用 token,覆盖词表里最不常用的 256 个 token(OpenVLA 后来继承这个套路)。
  • 论文把这种「override existing tokens」视为一种 symbol tuning(Wei et al. 2023),之前 VLM 工作已证有效。

Output constraint(论文 Sec. 3.2)——RT-2 与标准 VLM 的关键区别:标准 VLM 可输出任意自然语言,但 RT-2 必须输出合法 action token。所以在机器人任务 prompt 下,decoding 时强制只在合法 action token 上采样(mask 词表其余 token);标准 VQA 任务下仍允许全词表。这避免模型输出 "对不起我不知道" 这类无效动作。

Co-fine-tuning(论文 Sec. 3.2 Co-Fine-Tuning,关键 trick

不是从零训,而是在已预训练的 VLM 上继续 fine-tune机器人数据和原始 web 数据混合

  • Web 数据:PaLI-X/PaLM-E 原始训练数据(VQA + captioning + 交错 image-text),保持 VLM 的语义理解。
  • 机器人数据:RT-1 的 13 万条真机轨迹(Brohan et al. 2022,13 台机器人 17 个月采集的 office kitchen 环境,每条带自然语言指令:动词「pick/open/place into」+ 名词「7up can/drawer/napkin」)。
  • 配比(论文 Sec. 3.2 原话):「balance the ratios of robot and web data in each training batch by increasing the sampling weight on the robot dataset」——通过上调机器人数据采样权重让每个 batch 里两者比例平衡。论文未给精确数值。

为什么 co-fine-tune 关键(论文 Sec. 4.3 ablation):相比「只用 robot data fine-tune」,co-fine-tune 让模型不忘记 VLM 预训练概念,泛化更好;相比「from scratch」根本训不出来(5B from scratch 性能极差,55B from scratch 直接没跑)。

实时推理(论文 Sec. 3.3)

55B VLM 没法跑在机器人机载 GPU 上。RT-2 的工程方案:部署在 multi-TPU 云服务,机器人通过网络查询。

  • RT-2-PaLI-X-55B:1–3 Hz
  • RT-2-PaLI-X-5B:~5 Hz

这是当时直接闭环控制的最大模型(按论文说法「by over an order of magnitude」)。

为什么重要

1. VLA 范式确立

RT-2 之前,「用大模型做机器人」是 SayCan 式的(LLM 当规划器,下游接专门 policy)。RT-2 之后,端到端 VLA 成为主流——一个 VLM 直接出动作。后续 OpenVLA、π0、GR00T N1 都是这条线。

2. Emergent Ability(最关键的实验发现,论文 Sec. 4.2)

RT-2 在机器人训练数据里完全没出现过的任务上做了定量 + 定性测试。论文用 A/B testing(Fisher 1936)让所有模型在完全相同条件下轮流评估,约 6000 条评估轨迹

三类 emergent 能力(论文 Sec. 4.2 Quantitative Evaluations):

能力类别测试例子(论文 Sec. 4.2)结果
Symbol understanding(符号理解)"move apple to 3"、"push coke can on top of heart"RT-2-PaLI-X 最佳,超 RT-1 3× 平均成功率
Reasoning(推理)视觉推理 "move the apple to cup with same color";数学 "move X near the sum of two plus one";多语言 "mueve la manzana al vaso verde"(西班牙语)PaLM-E-12B 在数学类反超 PaLI-X-55B(因为 PaLM-E 预训练数学数据多)
Human recognition(人类识别)"move the coke can to the person with glasses"显著超 RT-1 / VC-1 baseline

Chain-of-thought 版本(论文 Sec. 4.4)——额外只 fine-tune 几百个 gradient step(不重训),augment 训练数据加 "Plan" 步骤:

"Instruction: I'm hungry. Plan: pick rxbar chocolate. Action: 1 128 124 136 121 158 111 255"

让模型先输出自然语言 plan,再吐 action token。定性观察:CoT 版本能处理更复杂的复合指令。这是首次把 LLM 的 CoT 范式带进机器人 policy——后续 GR00T/OpenVLA/Helix 都沿袭这个思路。

核心结论:web 知识 → 机器人动作的迁移是真实的,不是口号。语义概念(数字、图标、颜色、语言、人脸)能从 VLM 预训练转移到 robot control,即使这些概念从未在 robot data 出现——这是 VLA 这条路最重要的实证基础。

3. Scaling + co-fine-tune ablation(论文 Sec. 4.3)

论文 Sec. 4.3 做了关键 ablation(图 6b):

  • From scratch(不用 VLM 预训练权重):5B 都训不动,55B 直接没跑——证明 VLM 预训练是必须的。
  • Fine-tune(仅 robot data)vs Co-fine-tune(web + robot):co-fine-tune 在所有 model size 上都比 fine-tune-only 泛化更好——保留 web data 防止「forget VLM 概念」。
  • Size scaling:5B → 55B 显著提升泛化。

PaLI-X 55B 版本比小模型明显更强,证明 VLA 也吃 scale。这直接催生了后来的 RT-2-X(55B,跨本体)、OpenVLA(7B 开源)。

局限

  1. 闭源:权重、数据都不公开,学术界只能看论文。→ 直接催生了 OpenVLA(2024.06 开源)。
  2. 离散 action token 的表达力限制:256 bin 离散化精度有限,做不了精细灵巧操作。→ 催生了 π0(2024.10,flow matching 连续 action)。
  3. 推理慢:55B 模型自回归生成,单步几百 ms,做不了高频控制。→ 催生了双系统(GR00T N1、Helix)。
  4. 数据规模仍小:13 万条轨迹相对 LLM 数十 T token 是九牛一毛。→ OpenX-Embodiment 在试图解决。

复现要点

  • 复现门槛:⭐⭐⭐⭐⭐(几乎不可复现)
  • 闭源 55B 模型 + 闭源 13 万真机数据 + 闭源 PaLI-X 预训练权重,三项都拿不到。
  • 替代方案:直接复现 OpenVLA(2024.06)——它是 RT-2 的开源 7B 替代,Prismatic VLM 架构,970k OpenX 数据,单卡可微调。OpenVLA 几乎是「学术版 RT-2」。
  • 想理解 RT-2 的核心 idea,读论文 + 跑 OpenVLA 微调就够。

相关

  • 建立在:RT-1(动作 token 化 + 大规模真机 Transformer)、PaLM-E/PaLI-X(VLM 预训练)
  • 引出:RT-2-X(跨本体 55B)、OpenVLA(开源 7B)、π0(flow matching 替代离散 token)、GR00T N1(双系统)
  • 本仓库线索:T06 VLA 五段演进 第二段
  • 本仓库论文笔记:P-pi0-2024.md(π0 解决了 RT-2 的离散 action 限制)