RT-2:让机器人「看图说话」的大脑,顺便学会「看图做动作」
🎯 为什么重要:把"互联网级世界知识"灌进机器人控制器
RT-1 已经能让机器人听 700+ 指令、做 700+ 件事。但它有个致命缺陷:
互联网上早就训练好了 VLM(vision-language model)——PaLI-X、PaLM-E 这种 5B-55B 参数的大模型,看过几十亿图文对,知道名人、颜色、数字、空间关系、甚至基础因果。RT-2 的核心问法是:
答案是「可以,而且效果好得惊人」。RT-2 是第一个真正意义上在真机闭环控制里跑通的 VLA(Vision-Language-Action)模型,开创了 VLA 这条主流路线。
💡 核心思想:动作 = 一种伪装的文字
RT-2 的"魔法"是一个极其简单的格式 trick:把动作 token 伪装成普通文字 token。VLM 不需要新结构、不需要新参数,只是"多学了一门方言"。
关键在于:模型并不知道"动作"和"文字"是两件事。对它来说,"1 128 124 136 121 158 111 255" 和 "a grey donkey" 一样都是 token 序列。所以 VLM 在互联网上学到的一切视觉/语言/推理能力,都自然可用于选择动作。
🛠️ 让一个 55B 大模型真的能控制机器人的 4 个工程决定
| 设计 | 心智模型 | 为什么必要 |
|---|---|---|
| ① 动作 token 复用 VLM 词表 | PaLI-X:直接用整数 token(已有 0-999);PaLM-E:覆盖最不常用的 256 个 token 当动作 bin | 不引入新参数、不改架构。这就是"VLA = 给 VLM 加了一门方言"的实现细节 |
| ② Co-fine-tuning(混合微调) | 每个 batch 里同时有互联网 VQA 数据和机器人轨迹数据,按比例采样 | 避免灾难性遗忘——只用机器人数据微调会把 VLM 学到的世界知识忘光。混合训练让模型"既不忘知识,又学会动作" |
| ③ 输出词表约束 | 推理时如果是动作任务,只允许采 256 个合法动作 token;普通 VQA 任务不限制 | 避免模型吐出"1 128 苹果 241"这种非法动作序列。一步硬约束,零代价 |
| ④ 云端 TPU + 网络查询 | 55B 模型放云端多 TPU 服务,机器人通过网络查询,1-3 Hz 控制;5B 版本能到 5 Hz | 55B 是当时最大上真机的模型,比此前大 10 倍以上。算力放云上是唯一可行方案 |
想象一个会 5 国语言的翻译员,现在你要她学第 6 门语言("机器人动作语")。如果你只让她练新语言(naïve fine-tuning),她会迅速把旧的 5 门忘掉——这叫灾难性遗忘。但如果你让她每天 6 门语言混着练(co-fine-tuning),新语言学会了,旧的也没丢。论文 Fig.6b 实验清楚地显示:co-fine-tuning 的平均泛化优于 fine-tuning only,且 55B 远超 5B——容量要大、数据要杂。
📊 结果:泛化 2-6 倍提升,涌现出 RT-1 完全不会的能力
6,000 次真机评估。训练任务和 RT-1 持平(说明没把 RT-1 的硬技能丢),但泛化和涌现能力全面提升:
| 评估维度 | RT-1 | MOO | VC-1 | R3M | RT-2(PaLI-X) |
|---|---|---|---|---|---|
| 训练任务(200+) | 92% | 75% | 63% | 45% | 91%(持平) |
| 泛化(未见物体/背景/环境)平均 | 基线水平 | ~2× 优于次佳,~6× 优于其他 | |||
| Language Table 仿真 | 74% | 仿真基线不同:LAVA 77% · BC-Zero 72% | 90%(PaLI-3B 版本) | ||
更惊人的是涌现能力——这些任务在机器人数据里从未出现,完全靠 VLM 互联网知识迁移过来:
| 涌现能力类别 | 举例指令 | vs RT-1 |
|---|---|---|
| 符号理解 | "move apple to 3"、"push coke can on top of heart" | 平均 3× 成功率 (RT-2-PaLI-X 最佳) |
| 推理(视觉/数学/多语) | "move apple to cup with same color"、"mueve la manzana al vaso verde" | |
| 人物识别 | "move the coke can to the person with glasses" | |
| 链式思维(CoT) | "我渴了" → Plan: pick 7up can → Action: ... | 能用自然语言先规划再动作 |
🌐 在领域中的位置
RT-2 是VLA 范式的奠基之作。"动作 = 文字 token"这个看似简单的 trick,让机器人直接接入了 LLM/VLM 生态,把机器人学习从"采数据"时代推入"借用互联网知识"时代。后续的 OpenVLA、π0、RDT-1B 全部继承这个范式。关联线索:T06 基础模型谱系。
❓ 常见误区
RT-2 学会了"新动作"吗?比如 VLM 数据让它学会新的抓取姿势?
没有。这是论文明确指出的局限:模型的物理技能仍然局限于机器人数据里见过的那些。VLM 带来的是语义/推理能力(知道"哪个物体""放哪里""为什么"),不是新的运动技能。要学新动作还得采机器人数据。
55B 模型怎么在真机上实时跑?
放云端 TPU 服务,机器人通过网络查询。55B 版本 1-3 Hz,5B 版本约 5 Hz。这是当时上真机最大的模型,比此前大一个数量级。算力开销大是 RT-2 的主要代价——后续 OpenVLA 等工作很重要的目标就是"把 VLA 缩小、加速"。
"动作 token 覆盖最不常用的 256 个词"会破坏语言能力吗?
会有微小影响但可接受。覆盖的是 PaLM-E 词表里频率最低的 256 个 token(基本用不到的生僻 token),所以语言生成几乎不受影响。这是一种符号调校(symbol tuning)——已有研究证明对 VLM 有效。
CoT 版本的 RT-2 是怎么训练的?
在数据里加一个"Plan:"前缀(如"Plan: pick rxbar chocolate. Action: 1 128 124 ..."),只微调几百步就能让模型学会"先说计划再出动作"。这让 VLA 能做多步语义推理(如"我需要锤钉子,场景里哪个物体有用?"→"Rocks."→动作)。