GR-2:先看 3800 万段人类视频,再学机器人
🎯 为什么重要:机器人策略的「LLM 时刻」
大模型的成功有一个固定配方:海量无标注数据预训练 + 小规模下游有监督微调。但机器人领域一直卡在第一步——「机器人数据太贵」。GR-2 的赌注是:
这个赌注如果成立,意义是革命性的——它意味着机器人策略可以「蹭」互联网视频的红利,复刻 LLM 的 scaling law。GR-2 给出的证据非常硬:
💡 核心思想:让模型先「想象下一帧」,再「输出动作」
GR-2 把训练拆成两阶段。阶段一:在 3800 万段互联网视频上做下一帧预测(auto-regressive),目标是「给定文字 + 当前帧,预测未来帧」——本质是一个视频生成模型。阶段二:拿真机数据微调,让模型同时预测「下一帧图像」+「下一段动作轨迹」。两个目标共享同一个 transformer,让「想象未来」和「生成动作」共用同一套表征。
🛠️ 四个让视频先验真正能迁移的关键设计
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| ① 视频生成作为预训练目标 | 不是去学「机器人动作」,而是去学「下一帧长什么样」——auto-regressive 预测未来图像 token | 下一帧预测强迫模型理解「物体如何随时间变化」——这是动作预测的「世界先验」 |
| ② VQGAN 离散化图像 | 把图像编码成离散 token,让 GPT 风格 transformer 能统一处理「文/图/动」 | 离散 token 让视频预测 = 序列预测,可以直接复用 LLM 的训练管线 |
| ③ cVAE 生成动作轨迹(chunk) | 动作输出不是单步,而是用 conditional VAE 生成一段轨迹 $a_{t:t+k}$ | 轨迹平滑、可实时;避免逐步回归的多模态平均问题(Diffusion Policy 同款动机) |
| ④ Whole-Body Control(WBC)部署 | GR-2 输出笛卡尔轨迹 → WBC 做轨迹优化 + 200Hz 关节跟踪 | 策略不用关心关节动力学,专注「高层规划」,低层交给经典控制 |
你想教一个小孩用筷子。如果你只让他看你的手(机器人数据),他要试很多次才能摸索出规律。但如果你先让他看过 1000 部人吃饭的视频,他已经知道「筷子夹东西时东西会跟着动」「米饭会撒」——这些「世界常识」让真机学习效率高得多。GR-2 的视频预测任务,就是在逼模型把这些常识压缩进权重里。
📊 关键结果:多任务 97.7%,泛化翻倍,bin-picking 工业
| 真机多任务(100+ 任务) | 成功率 | 对比 GR-1 |
|---|---|---|
| Simple(同分布) | 97.7% | ↑(全线提升) |
| Unseen Backgrounds | 71.4%(w/ DA 后 74.7% 平均) | 翻倍 |
| Unseen Environments | 71.7% → 87.0%(w/ DA) | 翻倍 |
| Unseen Manipulation(最难) | 55.8% | GR-1 几乎为 0 |
| 仅 50 轨迹/任务(数据稀缺) | 73.9% | 仍超 GR-1 全量 |
| End-to-End Bin Picking(122 物体) | 平均成功率 |
|---|---|
| GR-1(前作) | 33.3% |
| GR-2(本文) | 79.0%(+45.7%) |
| CALVIN 长程任务 benchmark | 1 任务 | 5 任务连做 | 平均长度 |
|---|---|---|---|
| GR-1(前作) | 94.9% | 73.1% | 4.21 |
| GR-2(本文,SOTA) | 98.6% | 85.9% | 4.64 |
🌐 在领域中的位置
GR-2 在 VLA 谱系里属于「视频预训练派」的代表——和 OpenVLA、π0、Octo 等「LLM 派」并驾齐驱。它的独特定位是:用「视频生成」而不是「LLM 文本」作为先验载体。这背后的物理直觉是:机器人要预测的是视觉上的未来,那么先验也应该是「视觉上的未来」。和 GR-1 一脉相承,但把规模从概念验证推到了工业级(38M 视频 vs GR-1 的几万段)。
❓ 常见误区
GR-2 是 LLM 吗?
架构上是 GPT-style transformer,但不是建立在 LLaMA 这类 LLM 之上。它从零训练,预训练目标是视频生成(不是下一个文本 token)。所以它属于「VLA 派」中的「视频预训练派」,和 OpenVLA 这种「LLM 改造派」路线不同。
视频里没有机器人动作,模型怎么学到「动手」?
它确实学不到具体动作——它学到的是「世界动态先验」:物体怎么动、手和物体的关系怎么变化。这些先验在微调阶段被「翻译」成机器人动作。本质上视频预训练给了模型一个很好的「初始化」,让真机数据能高效地把它「对齐」到具体动作上。
97.7% 是不是太好了?有局限吗?
97.7% 是 Simple(同分布)设置——训练和测试场景相似。论文诚实地报告了:换没见过的背景/环境掉到 71%,没见过的操作掉到 55.8%。所以泛化能力虽然有提升,但远没解决。而且 100+ 任务都是桌面操作,移动操作没碰。
WBC 是什么?为什么需要它?
GR-2 输出的是笛卡尔空间(末端位姿)轨迹,不是关节角。WBC(Whole-Body Control)做的是「轨迹优化 + 关节跟踪」——把笛卡尔轨迹变成 200Hz 的关节指令,同时避碰撞、保可操作性。这是「策略输出高层规划 + 经典控制做底层执行」的经典分工。