P-GR00T-N1-2025:NVIDIA 开源人形 VLA foundation model
作者 / 机构:Johan Bjorck et al.(NVIDIA GEAR / Isaac Lab 团队,庞大团队)
发表:GTC 2025 / arXiv 2025.03(arXiv:2503.14734)
代码/权重:github.com/NVIDIA/Isaac-GR00T · HuggingFace:nvidia/GR00T-N1-2B(旧)、nvidia/GR00T-N1.5-3B / GR00T-N1.7-3B(最新)
在线索中的位置:T06 · VLA 五段演进 第五段「人形 VLA + 双系统」+ T10 · VLA+WBC 整合 的开源代表。
一句话定位:NVIDIA 的开源人形 VLA foundation model,双系统架构(System 2 Eagle-2 VLM @ 10 Hz + System 1 DiT action expert @ 120 Hz),基于 flow matching + action chunking + latent-action pretraining(LAPA),配合 Cosmos 合成数据 pipeline。
动机
到 2025 年初 VLA 已成熟(RT-2 / OpenVLA / π0),但都是为桌面机械臂设计。人形机器人(Unitree H1/G1、Figure、Tesla Bot)有完全不同的挑战:
- 全身控制:不只末端,要协调躯干/双腿/双臂/灵巧手;动作空间可达 30+ DoF。
- 频率矛盾:高层语义(看图、读指令、规划)需要 100 ms 级思考;低层动作(关节控制)要 100 Hz+ 才稳。单 transformer 不可能既大又快。
- 数据稀缺:人形真机 teleop 数据远少于机械臂;且单条轨迹成本 10×–100× 桌面机械臂。
- 跨本体需求:同一个基础模型要能下放到 H1/G1/Figure 多种机型,关节配置完全不同。
NVIDIA 的 question:能不能开一个开源、商用许可、可下载权重的人形 VLA foundation model,让整个社区基于它做研究?
方法核心
双系统架构(受 Kahneman「System 1 / System 2」启发;PDF Sec. 2.1)
图像 + 语言指令 + 本体 state
↓
┌────────────────────────────────────────┐
│ System-2(Eagle-2 VLM, 1.34B) │ ← 慢思考
│ = SmolLM2 (lang) + SigLIP-2 (vis) │
│ - 224×224 输入 → pixel shuffle → 64 token/frame │
│ - 取 LLM 第 12 层 hidden state 作 φ_t │
└─────────────┬──────────────────────────┘
↓ φ_t(中间层 feature,不是 final layer)
┌────────────────────────────────────────┐
│ System-1(DiT, ~0.86B) │ ← 快动作,120 Hz
│ - cross-attn 与 self-attn 交替 │
│ - 接 φ_t + proprio + noisy action │
│ - 输出连续 action chunk (H=16) │
│ - adaptive layer norm 注入 τ │
└────────────────────────────────────────┘
⚠️ 关键纠正:N1 的 System 1 是普通 DiT(alternating cross-attn + self-attn),不是 MoE。MoE 是 N1.5+ 才引入的特性,不要把 N1.5+ 的设计写到 N1 笔记里。
System-2 · Eagle-2 VLM(1.34B,PDF Sec. 2.1 Vision-Language Module):
- SmolLM2(Allal et al. 2025)LLM + SigLIP-2(Tschannen et al. 2025)image encoder。Eagle-2 是 NVIDIA 在 Internet-scale 数据上预训练、在大量 vision-language 任务上对齐。
- 图像编码:224×224 输入,pixel shuffle 后产生 64 image token/frame(不是常见的 196/256 patch)。
- 输入:text + image 以 chat format 喂入 VLM。
- 输出:抽 LLM 的 hidden embedding $\varphi_t$,shape = (batch, seq, hidden_dim)。
- 关键 trick(论文实测):用 LLM 第 12 层中间层 embedding(对 GR00T-N1-2B)而非 final layer——实测推理更快 + 下游 policy 成功率更高。final layer 对齐 LM head 对「语义推理」有用,但中间层保留更多 spatial/visual 细节,对 action prediction 更友好。
System-1 · DiT(约 0.86B,PDF Sec. 2.1 Diffusion Transformer Module):
- 变体 DiT(Peebles & Xie 2023),denoising step 通过 adaptive layer normalization 注入。
- 结构:alternating cross-attention 和 self-attention blocks,类 Flamingo(Alayrac 2022)/ VIMA(Jiang 2023)。
- Self-attention blocks:处理 noisy action token embedding $A_t^\tau$ + state embedding $q_t$。
- Cross-attention blocks:condition 在 VLM 输出 $\varphi_t$ 上。
- Embodiment-specific encoder/decoder:每个本体独立 MLP(State Encoder、Action Encoder、Action Decoder),把不同维 state/action 投影到共享 embedding space;末尾 Action Decoder 输出最终动作。Action Encoder MLP 还编码 diffusion timestep(与 noised action 一起)。
- 训练时LLM 语言部分冻结,vision encoder 和 DiT 都 unfrozen(PDF Sec. 2.3 Pre-training)。
System 2 与 System 1 解耦的设计:System 2 慢跑输出 $\varphi_t$,System 1 在 120 Hz 快跑,每次拿最新 $\varphi_t$ 作条件。这正是 T10 描述的「latent 接口」范式,与 Helix(7B+80M,latent 通信)同类。
Flow matching action head(PDF Eq. 1)
System 1 不用 diffusion(DDPM 多步去噪太慢),改用 rectified flow matching——把噪声 $\epsilon$ 到真值 $A$ 用直线插值。给定 action chunk $A_t = [a_t, a_{t+1}, \ldots, a_{t+H-1}]$($H=16$ 是 action chunk 长度,$d_a$ 是动作维 = 关节数,embodiment-specific)、flow-matching timestep $\tau\in[0,1]$、noise $\epsilon\sim\mathcal{N}(0, I)$,定义 noisy action:
$$A^\tau_t = \tau A_t + (1-\tau)\,\epsilon \tag{1a}$$
模型 $V_\theta(\varphi_t, A^\tau_t, q_t)$ 逼近去噪向量场 $\epsilon - A_t$,训练 loss(Eq. 1):
$$\mathcal{L}_\text{fm}(\theta) = \mathbb{E}_{\tau, \epsilon}\!\left[\big\|\,V_\theta(\varphi_t, A^\tau_t, q_t) - (\epsilon - A_t)\,\big\|^2\right] \tag{1b}$$
$\tau$ 采样分布(PDF Sec. 2.1,继承 Black et al. 2024 π0):$p(\tau) = \mathrm{Beta}\!\left(\tfrac{s-\tau}{s};\,1.5,\,1\right)$,$s=0.999$——偏向小 $\tau$(更 noisy),让模型多学 hard denoising 步骤。
推理($K$ 步 forward Euler ODE):从 $A_t^0\sim\mathcal{N}(0,I)$ 起步,迭代:
$$A_t^{\tau+1/K} = A_t^\tau + \tfrac{1}{K}\,V_\theta(\varphi_t, A^\tau_t, q_t) \tag{推理}$$
PDF 实测 $K=4$ 在所有 embodiment 上工作良好——4 步远小于传统 diffusion 的几十~上千步,靠 flow matching 直线路径实现。这就是 N1 能跑 120 Hz 的关键——diffusion 要 50-1000 步,flow matching 只要 4 步。
Action chunking $H=16$
每次输出 16 步动作而非 1 步,等效把 7.5 Hz 决策率(120/16)的 planning 与 120 Hz 的执行分离——和 Diffusion Policy 同样的 chunking 思想,减少高频决策噪声、平滑动作。
LAPA 预训练(Latent Action Pretraining)
GR00T N1 的关键工程贡献:用 latent action 预训练做大规模无标签视频利用(PDF Sec. 2.2 + Sec. 2.3 Pre-training)。
- 大量人类视频(YouTube/ego-centric)没有 action label,但有 $(x_t, x_{t+1})$ 帧对。
- LAPA(Latent Action Pretraining, [2407.15043])训一个 VQ-VAE 式 latent action tokenizer:把 $(x_t, x_{t+1})$ → 离散 latent action code $\hat a_t \in \mathbb{Z}^K$,作为伪 action label。
- 用这些 latent action 在海量视频上 pretrain System 1,让 DiT 学会「从图像 + latent action 预测下一帧」这一通用动力学。
- 三种 flow-matching target 混用(PDF Sec. 2.3 Pre-training):
- 人类视频:仅 latent action 作 target
- 机器人数据(GR-1 / OpenX-Embodiment):ground-truth robot action + learned latent action 都用
- 神经轨迹(视频生成):latent action + 由 inverse-dynamics model(在真机数据上训练)预测的 action 都用
- SFT 时把 latent action 替换成真机 action(同一表示空间),fine-tune 到具体机器人。
latent action 是 embodiment-invariant 的:YouTube 里是人类手,部署到 G1 是机械手——LAPA 的 latent action code 把两者统一到同一离散 codebook,迁移时只要 fine-tune 一个映射。
多样化训练数据(数据金字塔,PDF Sec. 2.2 + Sec. 3)
PDF 给出明确数据金字塔:
| 层 | 规模 | PDF 出处 |
|---|---|---|
| 真人 teleop(GR-1 in-house) | 88 小时 | Sec. 2.2 |
| 神经轨迹增广(GR00T Mimic + 视频生成模型,由 88h 真实轨迹扩展) | 827 小时(~10×) | Sec. 2.2、Sec. 3.2 |
| 仿真轨迹(Isaac Lab + DexMimicGen 自动生成) | 780K trajectories = 6500 小时(11 小时内生成) | Sec. 3.2 |
| 合成数据(Cosmos WM 生成) | 若干 | Sec. 3.2 |
| 人类视频(Ego4D / Ego-Exo4D / EPIC-KITCHENS / HOI4D / HoloAssist 等) | 数百小时 | Sec. 3.3、Table 7 |
合成数据生成速度:1 秒视频约 2 分钟生成(Sec. 3.2)。
训练超参(PDF Table 6)
| 超参 | Pre-training | Post-training |
|---|---|---|
| Learning rate | $10^{-4}$ | 同 |
| Optimizer | AdamW($\beta_1=0.95$, $\beta_2=0.999$, $\epsilon=10^{-8}$) | 同 |
| Weight decay | $10^{-5}$ | 同 |
| LR scheduler | cosine,warmup ratio 0.05 | 同 |
| Batch size | 16,384 | 128 或 1024 |
| Gradient steps | 200,000 | 20,000–60,000 |
| Backbone vision encoder | unfrozen | 同 |
| Backbone text tokenizer | frozen | 同 |
| DiT | unfrozen | 同 |
训练成本(PDF Sec. Training Infrastructure):GR00T-N1-2B 预训练约 50,000 H100 GPU 小时,峰值用 1024 GPU(H100 + Quantum-2 InfiniBand fat-tree),通过 NVIDIA OSMO + Ray 分布式训练。compute-constrained finetune 测试在单 A6000 GPU 上完成——只调 adapter(state/action encoder + decoder)+ DiT 时 batch 可到 200,调 vision encoder 时 batch 只能到 16。
实验
Benchmark:人形 VLA 暂无统一 benchmark,N1 论文主要报告:
- Long-horizon 任务:拼装、整理、厨房操作等长程任务,N1 完成 ~30 步长程 manipulation 任务的成功率显著高于 OpenVLA 微调基线(论文 Table 2 给具体数字,约 +30%)。
- 跨本体:N1.5/N1.7 在 H1、G1、Booster T1、Fourier GR1、Figure 上 demo 都通过——latent action 预训练让跨本体 fine-tune 只需少量真机数据。
- 真机 demo:H1 上完成接物、倒入、整理、开门等。
- System 2 ablation:去掉 VLM、直接 DiT + image embedding,长程任务成功率显著下降(具体数字待核 PDF Table 2;方向上"VLM 对长程任务关键"已有共识)。
复现资源:HuggingFace 直下 nvidia/GR00T-N1-2B 权重;NVIDIA GPU 推理(CUDA + TensorRT);微调用 LoRA 在单 H100 上 1-2 天可完成。
为什么重要
- 开源人形 VLA 的里程碑:第一个真正开源、商用许可、可下载权重的人形 VLA foundation model。后续 N1.5(MoE)/ N1.6 / N1.7(3B、跨本体)持续迭代,直接催生整个开源人形 VLA 生态(OpenVLA-OFT、π0 复现、Octo 系等对比基线)。
- 双系统架构成为人形 VLA 主流:System-2 VLM + System-1 fast action expert 这套架构,是后续 Helix(Figure 7B+80M)、Gemini Robotics-ER、π0.5 的事实标准。这印证了 T10 的判断:单模型不可能既大又快,分层是必然。
- Flow matching 替代 diffusion 做 action head:4 步推理让 VLA 跑到 120 Hz,是 action expert 走向工业部署的关键。π0、GR00T N1、RDT-1B 都用 flow matching 而非 DDPM。
- LAPA latent action 预训练:把视频数据纳入 VLA 训练,是 data scaling 的关键 infra 贡献。后续 LAPA 范式被 OpenVLA-OFT、Helix 部分借鉴。
- 合成数据 pipeline 工业化:Cosmos + GR00T Mimic + Isaac Lab 三件套,形成「合成数据 → 训练 VLA → 真机部署」完整 pipeline。
局限
- 双系统接口仍是开放问题:System-2 → System-1 传 latent(12 层 feature)还是子指令?跨论文不可比。详见 T10。
- 主要做上半身 manipulation:和 locomotion WBC 整合仍不成熟,全身 loco-manipulation 是下一步(N1.7 部分解决)。
- 依赖 NVIDIA 生态:Cosmos、Isaac Lab、Omniverse 都吃 NVIDIA 硬件,对非 NVIDIA 用户门槛高。
- 评估不充分:人形 VLA 暂无标准化 benchmark;HumanoidBench 是早期尝试但覆盖窄。N1 论文的成功率数字大多自家 demo、不可第三方复现。
- MoE 训练稳定性:N1.5+ 引入 MoE,但 router collapse、expert 不平衡是已知坑,论文未详细 ablation。
复现要点
- 复现门槛:⭐⭐⭐⭐(资源 + 工程门槛都高)
- 权重:
nvidia/GR00T-N1-2B(HuggingFace 直下,N1.5/N1.7 在 model index)。 - 推理:NVIDIA GPU + TensorRT 优化。System 2 用 Eagle-2-1B,System 1 用 DiT(注意 N1 是普通 DiT,不含 mixture-of-experts;MoE 自 N1.5+ 才引入)。
- 微调:官方 repo 提供 SFT 脚本;合成数据用 GR00T Mimic;视频预训练用 LAPA tokenizer。post-training 时 neural trajectory 与 real trajectory 1:1 共训(PDF Sec. 2.3)。
- 关键坑:① System 2 / System 1 latent 对齐(第 12 层 feature 对效果敏感,final layer 反而差);② action chunking H=16 的相位对齐(chunk 边界要和 proprio 对齐);③ flow matching 的 $p(\tau)=\mathrm{Beta}(\cdot;1.5,1)$ 采样别换成 uniform(实测 K=4 推理效果依赖于此);④ N1 是普通 DiT 不是 MoE——MoE 是 N1.5+ 才引入,router/load balancing 是 N1.5+ 的坑不是 N1 的。
版本演进
| 版本 | 时间 | 关键改动 |
|---|---|---|
| N1 | 2025.03 | 双系统开源首版,2.2B,flow matching + LAPA |
| N1.5 | 2025 中 | MoE System-1(generalist + specialist),数据扩 |
| N1.6 | 2026 初 | 训练集扩到更多本体,工程优化 |
| N1.7 | 2026 初 | 3B、商用许可、跨本体、当前主推 |
相关
- 建立在:RT-2(VLA 范式)→ P-RT2-2023.md、OpenVLA(开源 VLA 先驱)→ P-OpenVLA-2024.md、π0(flow matching action head)→ P-pi0-2024.md、LAPA(latent action pretraining)、Eagle-2(NVIDIA VLM)。
- 同期竞争:Helix(Figure,闭源 7B+80M)、Gemini Robotics(DeepMind)、π0.5(Physical Intelligence)、RDT-1B(清华开源)。
- 本仓库线索:T06 VLA 五段演进 第五段、T10 VLA+WBC 整合 开源代表、T02 数据集 合成数据 pipeline。
- 本仓库概念:C-action-representations.md(双系统接口辨析、latent action)。