GR00T N1:NVIDIA 给人形机器人开的「开源大脑」
🎯 为什么重要:人形 VLA 的「开源里程碑」
到 2025 年初,VLA 已经成熟(RT-2、OpenVLA、π0)——但都是为桌面机械臂设计的。人形机器人(H1/G1/Figure/Tesla Bot)有完全不同的挑战:
① 全身控制:人形 30+ DoF,不只是末端夹爪;
② 频率矛盾:高层语义要 100 ms 思考、低层关节要 100 Hz+ 才稳,单 transformer 既大又快不了;
③ 数据稀缺:人形真机 teleop 一条轨迹的成本是桌面机械臂的 10–100×;
④ 跨本体需求:H1、G1、Figure 关节配置完全不同,同一个模型要能下放多种机型。
NVIDIA 给的答复就是 GR00T N1。它把人形 VLA 从「闭源黑盒」(Figure Helix、Physical Intelligence π0.5)拉到「开源 + 商用许可 + 可下载权重」的开放生态——后续 OpenVLA-OFT、π0 复现、Octo 系都拿它做对比基线。更重要的是:它的双系统架构(System-2 VLM + System-1 action expert)成了后续人形 VLA 的事实标准。
💡 核心思想:双系统 + Flow Matching + 数据金字塔
整篇论文的工程哲学一句话:承认单模型不可能既大又快,于是分层;承认真机数据不够,于是合成。
这套「System 2 慢跑 + System 1 快跑 + latent 接口」与 Kahneman 的「快思考 / 慢思考」对应,也和 Helix(Figure 7B+80M)、π0.5 的设计不约而同——印证了 T10 线索的判断:单模型不可能既大又快,分层是必然。
🔧 关键 trick 1:System 2 输出用的是「第 12 层 feature」而非最后一层
这反直觉:大模型的「最后一层」不是最好的特征。论文实测对 GR00T-N1-2B,取 LLM 第 12 层中间 embedding 作 $\varphi_t$,比取 final layer 推理更快 + 下游 policy 成功率更高(PDF Sec. 2.1)。原因:final layer 对齐了 LM head,适合「语义推理」;中间层保留更多 spatial/visual 细节,对 action prediction 更友好。
🔧 关键 trick 2:Flow Matching 让 diffusion 只要 4 步
System 1 不用 DDPM(几十到上千步太慢),改用 rectified flow matching——把噪声 $\epsilon$ 到真值 $A_t$ 用直线插值:
$$A_t^\tau = \tau A_t + (1-\tau)\,\epsilon, \qquad \tau\in[0,1] \tag{1a}$$
模型 $V_\theta$ 学去噪向量场 $\epsilon - A_t$,训练 loss(PDF Eq. 1):
$$\mathcal{L}_\text{fm}(\theta) = \mathbb{E}_{\tau, \epsilon}\!\left[\big\|\,V_\theta(\varphi_t, A^\tau_t, q_t) - (\epsilon - A_t)\,\big\|^2\right] \tag{1b}$$
$\tau$ 采样分布继承 π0:$p(\tau) = \mathrm{Beta}\!\left(\tfrac{s-\tau}{s};\,1.5,\,1\right)$,$s=0.999$——偏向小 $\tau$(更 noisy),让模型多学 hard denoising 步骤。推理用 K=4 步 forward Euler ODE,PDF 实测「K=4 works well across all embodiments」。这就是 N1 能跑 120 Hz 的关键——diffusion 要 50-1000 步,flow matching 只要 4 步。
🛠️ 数据金字塔:把 88 小时真机变 7,500+ 小时训练数据
论文最硬的工程贡献是数据 pipeline。PDF Fig. 1 把训练数据画成金字塔——越往上越「真」、越稀缺;越往下越「合成」、越海量:
| 层 | 规模(PDF 原文) | 用途 |
|---|---|---|
| 真人 teleop(GR-1 in-house) | 88.4 小时 · 6.4M 帧(Table 7 GR-1 Teleop) | 顶层:保证真机 grounding |
| 神经轨迹(视频生成模型扩 10×) | 827.3 小时 · 23.8M 帧(Table 7 GR-1 Neural Videos) | 中层:counterfactual 轨迹 + 新语言指令 |
| 仿真轨迹(RoboCasa + DexMimicGen) | 780,000 条 ≈ 6,500 小时(11 小时内生成) | 中层:覆盖更多任务场景 |
| 人类视频(Ego4D / Ego-Exo4D / EPIC-KITCHENS 等) | 数千小时(~2,517h,Table 7;仅图像,无 action label) | 底层:视觉/行为先验,靠 LAPA 提 latent action |
作者在 88 小时真机 teleop 上跑视频生成模型,生成「counterfactual」轨迹——同一个机器人,但换场景、换物体、换语言指令。生成速度 PDF 实测:1 秒视频 ≈ 2 分钟生成(Sec. 3.2)。这样把昂贵的 88h 真机数据扩成 827h 神经数据,10× 放大且保留机器人本体动力学(因为是「同一机器人」的生成)。这比单纯加 YouTube 人类视频更接近真机分布。
🔧 关键 trick 3:LAPA latent action——让无标签视频也能训
人类视频(YouTube / ego-centric)有图像没 action label,直接喂不进 VLA。论文用 LAPA(Latent Action Pretraining)解决:训一个 VQ-VAE 式的 latent action tokenizer,把帧对 $(x_t, x_{t+1})$ 编码成离散 latent action code $\hat a_t$,当伪 action label。System-1 DiT 在海量视频上 pretrain「从图像 + latent action 预测下一帧」的通用动力学,SFT 时把 latent action 换成真机 action——同一表示空间。latent action 是 embodiment-invariant 的:YouTube 里是人手,部署到 G1 是机械手,LAPA codebook 把两者统一到同一空间。
训练超参(PDF Table 6)
| 超参 | Pre-training | Post-training |
|---|---|---|
| Learning rate | $10^{-4}$ | 同 |
| Optimizer | AdamW($\beta_1=0.95$, $\beta_2=0.999$, $\epsilon=10^{-8}$) | |
| Weight decay | $10^{-5}$ | |
| LR scheduler | cosine,warmup ratio 0.05 | |
| Batch size | 16,384 | 128 或 1024 |
| Gradient steps | 200,000 | 20,000–60,000 |
| Backbone vision encoder | unfrozen | |
| LLM text backbone | frozen | |
📊 结果:10% 数据下还能持平 Diffusion Policy 全量数据
仿真三个 benchmark(Table 2,100 demos 训练):
| 方法 | 模拟 Benchmark A | B | C | 平均 |
|---|---|---|---|---|
| BC Transformer | 26.3% | 53.9% | 16.1% | 26.4% |
| Diffusion Policy | 25.6% | 56.1% | 32.7% | 33.4% |
| GR00T-N1-2B | 32.1% | 66.5% | 50.0% | 45.0% |
真机(Fourier GR-1 人形,4 大类共 13 个任务,PDF Sec. 4):
| 设定 | Diffusion Policy | GR00T-N1-2B | 差距 |
|---|---|---|---|
| 10% 数据 | 10.2% | 42.6% | +32.4% |
| 全量数据 | 46.4% | 76.8% | +30.4% |
🌐 在领域中的位置
GR00T N1 是人形 VLA 从闭源走向开源的分水岭。同期竞争:Helix(Figure,闭源 7B+80M)、Gemini Robotics(DeepMind)、π0.5(Physical Intelligence)、RDT-1B(清华开源,桌面双臂)。关联线索:T06 VLA 五段演进第五段、T10 VLA+WBC 整合开源代表、T02 数据集合成 pipeline。
❓ 常见误区
GR00T N1 是单个 transformer 吗?
不是。它是两个独立网络——System 2 Eagle-2 VLM(1.34B)+ System 1 DiT(~0.86B),通过 cross-attention 连接,联合训练但推理频率不同(10 Hz / 120 Hz)。这是它和 OpenVLA(单 transformer)的根本差异。
N1 用了 mixture-of-experts (MoE) 吗?
没有。N1 的 System 1 是普通 DiT(alternating cross-attn + self-attn)。MoE 自 N1.5+ 才引入——别把 N1.5 的设计写到 N1 笔记里。
120 Hz 真的能做到吗?
能。PDF 实测单 L40 GPU 上采样 16 步 action chunk 仅 63.9 ms。关键在于:(1) System 2 只在 10 Hz 跑,不算进 120 Hz 预算;(2) System 1 用 flow matching K=4 步(不是 diffusion 的 50-1000 步);(3) action chunking H=16 把 120 Hz 执行和 7.5 Hz 决策(120/16)分离。
System 2 → System 1 怎么通信?
通过 VLM 第 12 层 hidden state $\varphi_t$。System 2 慢跑出 $\varphi_t$,System 1 在每次去噪步通过 cross-attention 拿这个 $\varphi_t$ 作条件。这是「latent 接口」范式——和 Helix 的 latent 通信同类。但具体传第几层、什么 shape,跨论文不可比,是 T10 列的开放问题。
开源到什么程度?
权重 + 代码 + 评估 都开源。HuggingFace 直下 nvidia/GR00T-N1-2B;fine-tune 脚本在 github.com/NVIDIA/Isaac-GR00T;商用许可(不同于 OpenVLA 的研究专用)。后续 N1.5 / N1.6 / N1.7 持续迭代到 3B、跨本体。