枢纽
机器人Franka
数据集OpenX
上真机
实时
输入模态vision,language,proprioception

GR-2:先看 3800 万段人类视频,再学机器人

Chi-Lam Cheang, Tao Kong, Hang Li 等(ByteDance Research)。arXiv:2410.06158v1,2024-10-08。 项目页 · foundation_modelsVLAvideo pre-training

🧠 一句话心智模型:让机器人策略先像孩子一样「看视频」——看 3800 万段人类做事的视频,把「世界运转的规律」先吸收进去;再像学徒一样跟机器人数据学具体的动作。结果是:100+ 任务平均 97.7% 成功率,没见过的背景/环境/物体也能泛化。这就是把 LLM 的「pre-train then fine-tune」范式搬到机器人上。

🎯 为什么重要:机器人策略的「LLM 时刻」

大模型的成功有一个固定配方:海量无标注数据预训练 + 小规模下游有监督微调。但机器人领域一直卡在第一步——「机器人数据太贵」。GR-2 的赌注是:

核心赌注:人类做事的视频(Howto100M、Ego4D、SSV2…)虽然没有机器人动作标签,但它有「世界动态」——物体怎么动、手怎么抓、动作怎么因果相连。如果模型能预测视频的下一帧,它就在内部学会了一个「世界模型」;这个先验再迁移到机器人动作预测上,应该能极大降低对真机数据的需求。

这个赌注如果成立,意义是革命性的——它意味着机器人策略可以「蹭」互联网视频的红利,复刻 LLM 的 scaling law。GR-2 给出的证据非常硬:

(a)BC 老路 每个任务从零训 · 1 任务 = 1 个模型 · 100 段/任务起 · 没见过 = 不会 ❌ 不可扩展 (b)RT-2 等 VLA 蹭 LLM/VLM 先验 · 用语言/视觉大模型 · 但缺「动态」先验 · 不知道动作怎么演变 ⚠️ 静态先验不足 (c)GR-2 ✅ 视频生成式预训练 · 学「世界怎么运转」 · 3800 万段视频先验 · 真 机 +97.7% / 100+ 任务 scaling 成立
图 1:GR-2 与前两条路线的对比。它的核心创新是用「视频预测」做预训练目标,让先验里包含「时间动态」。

💡 核心思想:让模型先「想象下一帧」,再「输出动作」

GR-2 把训练拆成两阶段。阶段一:在 3800 万段互联网视频上做下一帧预测(auto-regressive),目标是「给定文字 + 当前帧,预测未来帧」——本质是一个视频生成模型。阶段二:拿真机数据微调,让模型同时预测「下一帧图像」+「下一段动作轨迹」。两个目标共享同一个 transformer,让「想象未来」和「生成动作」共用同一套表征

阶段 1:视频生成预训练 数据:38M 视频 / 50B+ tokens(Howto100M 36M + Ego4D 1.2M + Kinetics-700 121k + EPIC-KITCHENS 46k + SSV2 46k + RT-1 82k + Bridge 25k) 文本+当前帧 "切洋葱" GPT-style Transformer + VQGAN image tokenizer 下一帧图像 "未来怎么演变" 世界先验 物体动态/物理 阶段 2:VLA 微调(机器人数据) 数据:约 40000 轨迹多任务(100+ 任务,平均 400 轨迹/任务)+ 94000 段 bin-picking(55 物体) 指令+多视角图像 + 机器人状态 同一个 Transformer 初始化自阶段 1 未来帧+动作 cVAE 头生成轨迹 可部署策略 Kinova + WBC 200Hz 先验迁移 同一个 Transformer,先学「想象」 → 再学「动手」
图 2:GR-2 的两阶段训练。核心 trick 是「视频生成」和「动作预测」共享 backbone——预训练学到的「世界动态」表征,在微调时直接服务于动作预测。

🛠️ 四个让视频先验真正能迁移的关键设计

设计心智为什么必要
① 视频生成作为预训练目标不是去学「机器人动作」,而是去学「下一帧长什么样」——auto-regressive 预测未来图像 token下一帧预测强迫模型理解「物体如何随时间变化」——这是动作预测的「世界先验」
② VQGAN 离散化图像把图像编码成离散 token,让 GPT 风格 transformer 能统一处理「文/图/动」离散 token 让视频预测 = 序列预测,可以直接复用 LLM 的训练管线
③ cVAE 生成动作轨迹(chunk)动作输出不是单步,而是用 conditional VAE 生成一段轨迹 $a_{t:t+k}$轨迹平滑、可实时;避免逐步回归的多模态平均问题(Diffusion Policy 同款动机)
④ Whole-Body Control(WBC)部署GR-2 输出笛卡尔轨迹 → WBC 做轨迹优化 + 200Hz 关节跟踪策略不用关心关节动力学,专注「高层规划」,低层交给经典控制
🔮 直觉:为什么视频预测能帮机器人?
你想教一个小孩用筷子。如果你只让他看你的手(机器人数据),他要试很多次才能摸索出规律。但如果你先让他看过 1000 部人吃饭的视频,他已经知道「筷子夹东西时东西会跟着动」「米饭会撒」——这些「世界常识」让真机学习效率高得多。GR-2 的视频预测任务,就是在逼模型把这些常识压缩进权重里。

📊 关键结果:多任务 97.7%,泛化翻倍,bin-picking 工业

真机多任务(100+ 任务)成功率对比 GR-1
Simple(同分布)97.7%↑(全线提升)
Unseen Backgrounds71.4%(w/ DA 后 74.7% 平均)翻倍
Unseen Environments71.7% → 87.0%(w/ DA)翻倍
Unseen Manipulation(最难)55.8%GR-1 几乎为 0
仅 50 轨迹/任务(数据稀缺)73.9%仍超 GR-1 全量
End-to-End Bin Picking(122 物体)平均成功率
GR-1(前作)33.3%
GR-2(本文)79.0%(+45.7%)
CALVIN 长程任务 benchmark1 任务5 任务连做平均长度
GR-1(前作)94.9%73.1%4.21
GR-2(本文,SOTA)98.6%85.9%4.64
关键洞察:GR-2 不是「在单一指标上赢」,而是在三个互相独立的维度上一致地赢——真机多任务、工业 bin-picking、长程仿真 CALVIN。这种「全维度提升」说明视频预训练提供的是通用世界先验,不是某个任务上的 trick。模型默认 230M 参数(95M 可训练),论文还验证了scaling law:越大越准。

🌐 在领域中的位置

RT-1(2022,纯机器人数据) RT-2(2023,VLM 先验) GR-1(2023,视频预训练首试) GR-2(2024,38M 视频规模化)⭐ π0 / RDT-1B(diffusion/flow action head)

GR-2 在 VLA 谱系里属于「视频预训练派」的代表——和 OpenVLA、π0、Octo 等「LLM 派」并驾齐驱。它的独特定位是:用「视频生成」而不是「LLM 文本」作为先验载体。这背后的物理直觉是:机器人要预测的是视觉上的未来,那么先验也应该是「视觉上的未来」。和 GR-1 一脉相承,但把规模从概念验证推到了工业级(38M 视频 vs GR-1 的几万段)。

❓ 常见误区

GR-2 是 LLM 吗?

架构上是 GPT-style transformer,但不是建立在 LLaMA 这类 LLM 之上。它从零训练,预训练目标是视频生成(不是下一个文本 token)。所以它属于「VLA 派」中的「视频预训练派」,和 OpenVLA 这种「LLM 改造派」路线不同。

视频里没有机器人动作,模型怎么学到「动手」?

确实学不到具体动作——它学到的是「世界动态先验」:物体怎么动、手和物体的关系怎么变化。这些先验在微调阶段被「翻译」成机器人动作。本质上视频预训练给了模型一个很好的「初始化」,让真机数据能高效地把它「对齐」到具体动作上。

97.7% 是不是太好了?有局限吗?

97.7% 是 Simple(同分布)设置——训练和测试场景相似。论文诚实地报告了:换没见过的背景/环境掉到 71%,没见过的操作掉到 55.8%。所以泛化能力虽然有提升,但远没解决。而且 100+ 任务都是桌面操作,移动操作没碰。

WBC 是什么?为什么需要它?

GR-2 输出的是笛卡尔空间(末端位姿)轨迹,不是关节角。WBC(Whole-Body Control)做的是「轨迹优化 + 关节跟踪」——把笛卡尔轨迹变成 200Hz 的关节指令,同时避碰撞、保可操作性。这是「策略输出高层规划 + 经典控制做底层执行」的经典分工。