里程碑
机器人Google Everyday Robots / X-arm
数据集Web VLM data + robotic demos (OpenX)
上真机
实时
输入模态vision,language

RT-2:让机器人「看图说话」的大脑,顺便学会「看图做动作」

Anthony Brohan 等(Google DeepMind,54 位作者)。arXiv:2307.15818,2023 年 7 月。 项目页 · VLAfoundation_models线索 T02

🧠 一句话心智模型:把「机器人动作」当成一种新语言——离散化成 8 个数字 token(7 维连续动作 + 1 终止指令),假装它们是普通的文字 token。然后拿一个已经在互联网上看过上亿张图文的视觉-语言大模型(VLM)同时学会"看图回答问题"和"看图输出动作"。结果机器人就白嫖到了互联网上的世界知识:它能听懂"把草莓放到对的碗"(按颜色分类)、能识别"快掉下去的包"、甚至知道"累了要喝能量饮料"。

🎯 为什么重要:把"互联网级世界知识"灌进机器人控制器

RT-1 已经能让机器人听 700+ 指令、做 700+ 件事。但它有个致命缺陷:

RT-1 的天花板:它只知道机器人数据里出现过的概念。你说"把可乐罐挪到泰勒·斯威夫特那边"——它根本不知道谁是泰勒·斯威夫特。它也理解不了"把快掉下去的那个包捡起来"这种需要场景推理的指令。

互联网上早就训练好了 VLM(vision-language model)——PaLI-X、PaLM-E 这种 5B-55B 参数的大模型,看过几十亿图文对,知道名人、颜色、数字、空间关系、甚至基础因果。RT-2 的核心问法是:

核心叩问:能不能直接把这种 VLM 当作机器人的大脑,让它同时输出"文字答案"和"机器人动作"?这样互联网知识就原封不动地流向机器人控制

答案是「可以,而且效果好得惊人」。RT-2 是第一个真正意义上在真机闭环控制里跑通的 VLA(Vision-Language-Action)模型,开创了 VLA 这条主流路线。

💡 核心思想:动作 = 一种伪装的文字

RT-2 的"魔法"是一个极其简单的格式 trick:把动作 token 伪装成普通文字 token。VLM 不需要新结构、不需要新参数,只是"多学了一门方言"。

VLM 原始训练(互联网规模) 输入:图 + "图中发生了什么?" 输出:A grey donkey walks down... 看几十亿图文对 → 学会语义、推理、世界知识 机器人动作(RT-1 风格) 输入:图 + "机器人该做什么来 <task>?" 输出:1 128 124 136 121 158 111 255 7 维连续 × 256 bin + 1 终止指令 = 8 个 token RT-2 的 co-fine-tuning 同一套权重,同一个下一 token 预测目标 混合 batch:互联网 VQA 数据 + 机器人轨迹数据 部署:动作 token → de-tokenize → 真机器人 55B 模型在云端 TPU 跑 1-3 Hz 闭环
图 1:RT-2 的核心 trick。动作 = 一种"方言",和文字 token 共享同一套词表、同一套权重、同一个训练目标(next-token prediction)。

关键在于:模型并不知道"动作"和"文字"是两件事。对它来说,"1 128 124 136 121 158 111 255" 和 "a grey donkey" 一样都是 token 序列。所以 VLM 在互联网上学到的一切视觉/语言/推理能力,都自然可用于选择动作

🛠️ 让一个 55B 大模型真的能控制机器人的 4 个工程决定

设计心智模型为什么必要
① 动作 token 复用 VLM 词表PaLI-X:直接用整数 token(已有 0-999);PaLM-E:覆盖最不常用的 256 个 token 当动作 bin不引入新参数、不改架构。这就是"VLA = 给 VLM 加了一门方言"的实现细节
② Co-fine-tuning(混合微调)每个 batch 里同时有互联网 VQA 数据和机器人轨迹数据,按比例采样避免灾难性遗忘——只用机器人数据微调会把 VLM 学到的世界知识忘光。混合训练让模型"既不忘知识,又学会动作"
③ 输出词表约束推理时如果是动作任务,只允许采 256 个合法动作 token;普通 VQA 任务不限制避免模型吐出"1 128 苹果 241"这种非法动作序列。一步硬约束,零代价
④ 云端 TPU + 网络查询55B 模型放云端多 TPU 服务,机器人通过网络查询,1-3 Hz 控制;5B 版本能到 5 Hz55B 是当时最大上真机的模型,比此前大 10 倍以上。算力放云上是唯一可行方案
🔮 直觉:为什么"co-fine-tuning"是点睛之笔?
想象一个会 5 国语言的翻译员,现在你要她学第 6 门语言("机器人动作语")。如果你让她练新语言(naïve fine-tuning),她会迅速把旧的 5 门忘掉——这叫灾难性遗忘。但如果你让她每天 6 门语言混着练(co-fine-tuning),新语言学会了,旧的也没丢。论文 Fig.6b 实验清楚地显示:co-fine-tuning 的平均泛化优于 fine-tuning only,且 55B 远超 5B——容量要大、数据要杂

📊 结果:泛化 2-6 倍提升,涌现出 RT-1 完全不会的能力

6,000 次真机评估。训练任务和 RT-1 持平(说明没把 RT-1 的硬技能丢),但泛化和涌现能力全面提升:

评估维度RT-1MOOVC-1R3MRT-2(PaLI-X)
训练任务(200+)92%75%63%45%91%(持平)
泛化(未见物体/背景/环境)平均基线水平~2× 优于次佳,~6× 优于其他
Language Table 仿真74%仿真基线不同:LAVA 77% · BC-Zero 72%90%(PaLI-3B 版本)

更惊人的是涌现能力——这些任务在机器人数据里从未出现,完全靠 VLM 互联网知识迁移过来:

涌现能力类别举例指令vs RT-1
符号理解"move apple to 3"、"push coke can on top of heart"平均 3× 成功率
(RT-2-PaLI-X 最佳)
推理(视觉/数学/多语)"move apple to cup with same color"、"mueve la manzana al vaso verde"
人物识别"move the coke can to the person with glasses"
链式思维(CoT)"我渴了" → Plan: pick 7up can → Action: ...能用自然语言先规划再动作
关键洞察:RT-2 证明了一件事——机器人的"聪明"可以来自互联网,而不是来自机器人数据。这彻底改变了机器人学习的经济学:你不需要为每个新概念都去采机器人数据,只要 VLM 见过就行。

🌐 在领域中的位置

RT-1(35M,纯机器人数据,无世界知识) RT-2(VLA 范式确立,VLM = 机器人大脑)⭐ OpenX / RT-X(多机器人 + 开源数据集) OpenVLA(7B 开源,反超 RT-2-X 16.5%)

RT-2 是VLA 范式的奠基之作。"动作 = 文字 token"这个看似简单的 trick,让机器人直接接入了 LLM/VLM 生态,把机器人学习从"采数据"时代推入"借用互联网知识"时代。后续的 OpenVLA、π0、RDT-1B 全部继承这个范式。关联线索:T06 基础模型谱系

❓ 常见误区

RT-2 学会了"新动作"吗?比如 VLM 数据让它学会新的抓取姿势?

没有。这是论文明确指出的局限:模型的物理技能仍然局限于机器人数据里见过的那些。VLM 带来的是语义/推理能力(知道"哪个物体""放哪里""为什么"),不是新的运动技能。要学新动作还得采机器人数据。

55B 模型怎么在真机上实时跑?

放云端 TPU 服务,机器人通过网络查询。55B 版本 1-3 Hz,5B 版本约 5 Hz。这是当时上真机最大的模型,比此前大一个数量级。算力开销大是 RT-2 的主要代价——后续 OpenVLA 等工作很重要的目标就是"把 VLA 缩小、加速"。

"动作 token 覆盖最不常用的 256 个词"会破坏语言能力吗?

会有微小影响但可接受。覆盖的是 PaLM-E 词表里频率最低的 256 个 token(基本用不到的生僻 token),所以语言生成几乎不受影响。这是一种符号调校(symbol tuning)——已有研究证明对 VLM 有效。

CoT 版本的 RT-2 是怎么训练的?

在数据里加一个"Plan:"前缀(如"Plan: pick rxbar chocolate. Action: 1 128 124 ..."),只微调几百步就能让模型学会"先说计划再出动作"。这让 VLA 能做多步语义推理(如"我需要锤钉子,场景里哪个物体有用?"→"Rocks."→动作)。