Q1:RT-2 能在真机上闭环跑吗?
能,但慢。55B 部署在 multi-TPU 云,机器人联网查询,1–3 Hz。📎这是当时直接闭环控制的最大模型(按论文说法 by over an order of magnitude)。
论文:Brohan et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818. 🌐
让大模型直接吐机器人动作。秘诀是把动作当成"另一种外语"。VLA 之于机器人,就像 GPT 之于文本——一份大脑,多一种输出。难点恰恰在桥接:把看懂图、听懂话翻译成连续控制,不是简单多挂一个输出头。(RT-2 自己只在一种机械臂上验证;换本体要更难一层,那是 RT-2-X 的故事。)
要解决的问题:让懂网络图文的大模型,顺便也能开机器人。📎
老办法:要么小模型从零学动作(如 RT-1)。📎要么让大模型当指挥官、再调小模型执行。两条路都把"理解"和"出动作"切成两半。大模型的知识进不到动作里。
RT-2 的转身:在已训好的视觉语言模型上继续微调。📎让它直接输出动作 token。关键叫 co-fine-tune:机器人数据和网络数据混训。这样模型不会把网络知识忘光。
你会看到:模型能用训练里没出现过的概念。陌生图标、算术、西班牙语指令都能对付。📎网络知识真的迁移到了动作上。
一句话类比:RT-2 把动作当成 VLM 的另一种外语。就像给会聊天的人教手语。同一个大脑,换一种输出。
核心机制:选一个已训好的视觉语言模型(如 PaLI-X 55B)。📎把机器人动作离散成一串整数 token,像文字一样喂进词表。再让模型用 next-token prediction 学着输出这些"动作词"。📎
动作怎么变 token:一条动作 = 6-DoF 末端位姿(3 维位移 + 3 维旋转)+ 1 维夹爪开合 + 1 维完成信号。📎每个连续维度切成 256 个 bin。整条动作就是 8 个 token,像 "1 128 91 241 5 101 127 255" 这种串。
关键 trick · co-fine-tune:不只用机器人数据训。原始网络数据(图文问答、captioning)和机器人数据按比例混进每个 batch。📎具体做法是上调机器人数据的采样权重——否则网络数据量太大,机器人样本会被淹没。配比是走钢丝:机器人占比太低学不到动作,太高又把网络知识忘光。论文 Appendix 给了 PaLM-E 的配方:robotics 约占 mixture 的 66%。PaLI-X 的配比没披露。📎
输出约束:普通 VLM 可输出任意自然语言。RT-2 在机器人任务下必须输出合法动作 token。decoding 时把词表里的非法 token 全部 mask 掉。📎这样模型不会回答"对不起我不知道"。
常见误区(先抛一个):"RT-2 是从零训的吧?"——不是。📎论文 ablation 明确:去掉 VLM 预训练,5B from-scratch 性能极差,作者因此主动跳过 55B from-scratch 的评估(是"训了 5B 已经太差、不值得再投算力验 55B",不是"55B 跑不起来")。VLM 预训练是必须的起点,不是可选优化。
Token 化的精确分解(论文 Sec. 3.2):6-DoF 末端位移(Δxyz + Δroll/pitch/yaw)+ 1 维 gripper extension + 1 维离散 terminate = 8 个 token / action。📎注意常见误读:网上流传的"11 维 × 256 bin"是 RT-1 的设计(含 base 移动 3 维 + mode 1 维),不是 RT-2。RT-2 是 7 维连续 + 1 维离散。连续维度用 min-max 边界均匀切 256 bin(OpenVLA 后来改成 quantile 边界)。📎
词表映射(Sec. 3.2)——两种基础 VLM 用不同策略:
论文把这种 override 视为一种 symbol tuning(Wei et al. 2023),之前 VLM 工作已证有效。
Emergent 能力(最关键发现,Sec. 4.2):在机器人训练数据完全没出现过的任务上做 A/B testing(Fisher 1936),约 6000 条评估轨迹。📎三类涌现:
| 能力类别 | 测试例子 | 结果 |
|---|---|---|
| 符号理解 | "move apple to 3"、"push coke can on top of heart" | RT-2-PaLI-X 最佳,超次优 baseline 约 3× 平均成功率(RT-1 为其中之一) |
| 推理 | 视觉 "move the apple to cup with same color";数学 "move X near the sum of two plus one";西班牙语 | PaLM-E-12B 在数学类反超 PaLI-X-55B(预训练数学数据多) |
| 人类识别 | "move the coke can to the person with glasses" | 显著超 RT-1 / VC-1 baseline |
CoT 版本(Sec. 4.4):额外只 fine-tune 几百个 gradient step(不重训),augment 训练数据加 "Plan" 步骤:
"Instruction: I'm hungry. Plan: pick rxbar chocolate. Action: 1 128 124 136 121 158 111 255"
让模型先输出自然语言 plan,再吐 action token。定性观察:CoT 版本能处理更复杂的复合指令。这是首次把 LLM 的 CoT 范式带进机器人 policy——后续 GR00T / OpenVLA / Helix 都沿袭。📎
Scaling + co-fine-tune ablation(Sec. 4.3 图 6b):
实时推理(Sec. 3.3):55B 跑在 multi-TPU 云服务,机器人联网查询。
论文称这是当时直接闭环控制的最大模型("by over an order of magnitude")。📎
局限:
图谱定位:RT-2 是 T06 VLA 五段演进里第二段「VLA 范式确立」的里程碑。📎它把"用大模型做机器人"从 SayCan 式「LLM 当规划器 + 专门 policy」翻成「一个 VLM 直接出动作」。后续 OpenVLA、π0、GR00T N1 全是这条线。
继承 / 催生:
Open problems:
"RT-2 是从零训的" —— 错。论文 Sec. 4.3 ablation 明确:去掉 VLM 预训练,5B from-scratch 性能极差,作者因此主动跳过 55B from-scratch 的评估(是"5B 已经太差、不再值得验 55B",不是"55B 跑不起来")。📎
VLM 预训练是必须的起点,co-fine-tune 是保留网络知识的关键 trick。
"RT-2 的动作是 11 维 × 256 bin" —— 错。这是把 RT-1 的设计(含 base 移动 3 维 + mode 1 维)张冠李戴。📎
RT-2 是 7 维连续(6-DoF 末端 + gripper)+ 1 维离散 terminate = 8 token。
"RT-2 用 human feedback 训" —— 错。RT-2 的数据来自 RT-1 的 13 万条真机 teleop 轨迹(Brohan et al. 2022),是监督模仿,不是 RLHF。📎
监督 fine-tune,每条轨迹带自然语言指令。
"emergent ability 是营销话术" —— 错。论文 Sec. 4.2 做了约 6000 条 A/B testing 轨迹定量评估,三类涌现能力都有数字支撑。📎
是实证发现,不是口号。
"RT-2 跑在机器人机载 GPU 上" —— 错。55B 部署在 multi-TPU 云服务,机器人联网查询,1–3 Hz。📎
是云端推理、低频闭环,不是机载高频控制。
RT-1 也是 Transformer policy,也用动作 token 化。那 RT-2 比 RT-1 多做的那一件事是什么,让网络知识能进到动作里?(提示:想想"从零训"和"在已训好的模型上继续训"的差别。)
💡 参考答案
RT-2 把动作离散成 256 bin。这套设计为什么在灵巧操作(叠衣服、拧螺丝)上先天吃亏?请用"动作是连续、光滑、多模态的"角度解释。
💡 参考答案
co-fine-tune 时为什么要把机器人数据的采样权重调高?(提示:网络数据和机器人数据的量级差几个数量级。)
💡 参考答案
用"教手语"或自己举的类比,向没学过机器学习的人解释 RT-2 的核心 trick。好的类比通常会同时带出三件事:(a) VLM 已经预训练好、不是从零训;(b) 动作被当成一种新语言 token;(c) co-fine-tune 让模型不忘旧语言。
💡 参考答案
假如你只有 1 万条机器人数据和一个 7B 开源 VLM,照搬 RT-2 论文的 from-scratch 训练(不用 VLM 预训练权重)能成功吗?为什么?
💡 参考答案
能,但慢。55B 部署在 multi-TPU 云,机器人联网查询,1–3 Hz。📎这是当时直接闭环控制的最大模型(按论文说法 by over an order of magnitude)。
RT-2 用的是 7 维连续(6-DoF 末端 + gripper)+ 1 维 terminate = 8 token。📎RT-1 的 11 维含 base 移动和 mode,是为带移动底盘的本体设计的。RT-2 聚焦桌面操作,不需要 base 维。
看任务。PaLI-X-55B 总体最强(符号理解、人类识别);PaLM-E-12B 在数学推理反超(预训练数学数据多)。📎规模不是唯一因素,预训练数据分布也决定具体能力。
基本不能。55B 权重、13 万真机数据、PaLI-X 预训练都闭源。[未确认]换 OpenVLA(开源 7B 替代,Prismatic VLM 架构,970k OpenX 数据)更现实——但要分清:微调单卡可(LoRA),预训练仍需 64×A100×2 周 ≈ 21,500 A100-hours,普通学术组复现不起。
CoT 版让模型先输出自然语言 plan、再吐 action token。📎只额外 fine-tune 几百个 gradient step,不重训。定性观察:复合指令上表现更好。是首次把 LLM 的 CoT 范式带进机器人 policy。