⏱ ~36 min
里程碑
⭐ 为何重要

NVIDIA 发布的人形机器人开源 foundation model,结合真实、仿真(Isaac Lab)与合成数据训练。给人形机器人研究提供了公开可用的强基线,配合 Isaac 加速 sim-to-real,定义了 humanoid foundation model 的产业标准。标志着 humanoid 大模型时代的工业化起点。

催生
机器人Fourier GR-1(论文真机部署;仿真训练跨多 humanoid 本体,含 AgiBot-World 数据集)
数据集HumanPlus / OpenX / Isaac Lab 合成数据
上真机
物理感知
实时
输入模态vision,language,proprioception

P-GR00T-N1-2025:NVIDIA 开源人形 VLA foundation model

作者 / 机构:Johan Bjorck et al.(NVIDIA GEAR / Isaac Lab 团队,庞大团队)
发表:GTC 2025 / arXiv 2025.03(arXiv:2503.14734)
代码/权重:github.com/NVIDIA/Isaac-GR00T · HuggingFace:nvidia/GR00T-N1-2B(旧)、nvidia/GR00T-N1.5-3B / GR00T-N1.7-3B(最新)
在线索中的位置T06 · VLA 五段演进 第五段「人形 VLA + 双系统」+ T10 · VLA+WBC 整合开源代表
一句话定位:NVIDIA 的开源人形 VLA foundation model,双系统架构(System 2 Eagle-2 VLM @ 10 Hz + System 1 DiT action expert @ 120 Hz),基于 flow matching + action chunking + latent-action pretraining(LAPA),配合 Cosmos 合成数据 pipeline。

动机

到 2025 年初 VLA 已成熟(RT-2 / OpenVLA / π0),但都是为桌面机械臂设计。人形机器人(Unitree H1/G1、Figure、Tesla Bot)有完全不同的挑战:

  1. 全身控制:不只末端,要协调躯干/双腿/双臂/灵巧手;动作空间可达 30+ DoF
  2. 频率矛盾:高层语义(看图、读指令、规划)需要 100 ms 级思考;低层动作(关节控制)要 100 Hz+ 才稳。单 transformer 不可能既大又快。
  3. 数据稀缺:人形真机 teleop 数据远少于机械臂;且单条轨迹成本 10×–100× 桌面机械臂。
  4. 跨本体需求:同一个基础模型要能下放到 H1/G1/Figure 多种机型,关节配置完全不同。

NVIDIA 的 question:能不能开一个开源、商用许可、可下载权重的人形 VLA foundation model,让整个社区基于它做研究?

方法核心

双系统架构(受 Kahneman「System 1 / System 2」启发;PDF Sec. 2.1)


图像 + 语言指令 + 本体 state
     ↓
┌────────────────────────────────────────┐
│ System-2(Eagle-2 VLM, 1.34B)         │  ← 慢思考
│  = SmolLM2 (lang) + SigLIP-2 (vis)    │
│  - 224×224 输入 → pixel shuffle → 64 token/frame │
│  - 取 LLM 第 12 层 hidden state 作 φ_t │
└─────────────┬──────────────────────────┘
              ↓ φ_t(中间层 feature,不是 final layer)
┌────────────────────────────────────────┐
│ System-1(DiT, ~0.86B)                │  ← 快动作,120 Hz
│  - cross-attn 与 self-attn 交替        │
│  - 接 φ_t + proprio + noisy action     │
│  - 输出连续 action chunk (H=16)        │
│  - adaptive layer norm 注入 τ          │
└────────────────────────────────────────┘

⚠️ 关键纠正:N1 的 System 1 是普通 DiT(alternating cross-attn + self-attn)不是 MoE。MoE 是 N1.5+ 才引入的特性,不要把 N1.5+ 的设计写到 N1 笔记里。

System-2 · Eagle-2 VLM(1.34B,PDF Sec. 2.1 Vision-Language Module):

  • SmolLM2(Allal et al. 2025)LLM + SigLIP-2(Tschannen et al. 2025)image encoder。Eagle-2 是 NVIDIA 在 Internet-scale 数据上预训练、在大量 vision-language 任务上对齐。
  • 图像编码:224×224 输入,pixel shuffle 后产生 64 image token/frame(不是常见的 196/256 patch)。
  • 输入:text + image 以 chat format 喂入 VLM。
  • 输出:抽 LLM 的 hidden embedding $\varphi_t$,shape = (batch, seq, hidden_dim)。
  • 关键 trick(论文实测):用 LLM 第 12 层中间层 embedding(对 GR00T-N1-2B)而非 final layer——实测推理更快 + 下游 policy 成功率更高。final layer 对齐 LM head 对「语义推理」有用,但中间层保留更多 spatial/visual 细节,对 action prediction 更友好。

System-1 · DiT(约 0.86B,PDF Sec. 2.1 Diffusion Transformer Module):

  • 变体 DiT(Peebles & Xie 2023),denoising step 通过 adaptive layer normalization 注入。
  • 结构:alternating cross-attention 和 self-attention blocks,类 Flamingo(Alayrac 2022)/ VIMA(Jiang 2023)。
  • Self-attention blocks:处理 noisy action token embedding $A_t^\tau$ + state embedding $q_t$。
  • Cross-attention blocks:condition 在 VLM 输出 $\varphi_t$ 上。
  • Embodiment-specific encoder/decoder:每个本体独立 MLP(State Encoder、Action Encoder、Action Decoder),把不同维 state/action 投影到共享 embedding space;末尾 Action Decoder 输出最终动作。Action Encoder MLP 还编码 diffusion timestep(与 noised action 一起)。
  • 训练时LLM 语言部分冻结vision encoder 和 DiT 都 unfrozen(PDF Sec. 2.3 Pre-training)。

System 2 与 System 1 解耦的设计:System 2 慢跑输出 $\varphi_t$,System 1 在 120 Hz 快跑,每次拿最新 $\varphi_t$ 作条件。这正是 T10 描述的「latent 接口」范式,与 Helix(7B+80M,latent 通信)同类。

Flow matching action head(PDF Eq. 1)

System 1 不用 diffusion(DDPM 多步去噪太慢),改用 rectified flow matching——把噪声 $\epsilon$ 到真值 $A$ 用直线插值。给定 action chunk $A_t = [a_t, a_{t+1}, \ldots, a_{t+H-1}]$($H=16$ 是 action chunk 长度,$d_a$ 是动作维 = 关节数,embodiment-specific)、flow-matching timestep $\tau\in[0,1]$、noise $\epsilon\sim\mathcal{N}(0, I)$,定义 noisy action:

$$A^\tau_t = \tau A_t + (1-\tau)\,\epsilon \tag{1a}$$

模型 $V_\theta(\varphi_t, A^\tau_t, q_t)$ 逼近去噪向量场 $\epsilon - A_t$,训练 loss(Eq. 1):

$$\mathcal{L}_\text{fm}(\theta) = \mathbb{E}_{\tau, \epsilon}\!\left[\big\|\,V_\theta(\varphi_t, A^\tau_t, q_t) - (\epsilon - A_t)\,\big\|^2\right] \tag{1b}$$

$\tau$ 采样分布(PDF Sec. 2.1,继承 Black et al. 2024 π0):$p(\tau) = \mathrm{Beta}\!\left(\tfrac{s-\tau}{s};\,1.5,\,1\right)$,$s=0.999$——偏向小 $\tau$(更 noisy),让模型多学 hard denoising 步骤。

推理($K$ 步 forward Euler ODE):从 $A_t^0\sim\mathcal{N}(0,I)$ 起步,迭代:

$$A_t^{\tau+1/K} = A_t^\tau + \tfrac{1}{K}\,V_\theta(\varphi_t, A^\tau_t, q_t) \tag{推理}$$

PDF 实测 $K=4$ 在所有 embodiment 上工作良好——4 步远小于传统 diffusion 的几十~上千步,靠 flow matching 直线路径实现。这就是 N1 能跑 120 Hz 的关键——diffusion 要 50-1000 步,flow matching 只要 4 步。

Action chunking $H=16$

每次输出 16 步动作而非 1 步,等效把 7.5 Hz 决策率(120/16)的 planning 与 120 Hz 的执行分离——和 Diffusion Policy 同样的 chunking 思想,减少高频决策噪声、平滑动作。

LAPA 预训练(Latent Action Pretraining)

GR00T N1 的关键工程贡献:用 latent action 预训练做大规模无标签视频利用(PDF Sec. 2.2 + Sec. 2.3 Pre-training)。

  • 大量人类视频(YouTube/ego-centric)没有 action label,但有 $(x_t, x_{t+1})$ 帧对。
  • LAPA(Latent Action Pretraining, [2407.15043])训一个 VQ-VAE 式 latent action tokenizer:把 $(x_t, x_{t+1})$ → 离散 latent action code $\hat a_t \in \mathbb{Z}^K$,作为伪 action label。
  • 用这些 latent action 在海量视频上 pretrain System 1,让 DiT 学会「从图像 + latent action 预测下一帧」这一通用动力学
  • 三种 flow-matching target 混用(PDF Sec. 2.3 Pre-training):
  • 人类视频:仅 latent action 作 target
  • 机器人数据(GR-1 / OpenX-Embodiment):ground-truth robot action + learned latent action 都用
  • 神经轨迹(视频生成):latent action + 由 inverse-dynamics model(在真机数据上训练)预测的 action 都用
  • SFT 时把 latent action 替换成真机 action(同一表示空间),fine-tune 到具体机器人。

latent action 是 embodiment-invariant 的:YouTube 里是人类手,部署到 G1 是机械手——LAPA 的 latent action code 把两者统一到同一离散 codebook,迁移时只要 fine-tune 一个映射。

多样化训练数据(数据金字塔,PDF Sec. 2.2 + Sec. 3)

PDF 给出明确数据金字塔:

规模PDF 出处
真人 teleop(GR-1 in-house)88 小时Sec. 2.2
神经轨迹增广(GR00T Mimic + 视频生成模型,由 88h 真实轨迹扩展)827 小时(~10×)Sec. 2.2、Sec. 3.2
仿真轨迹(Isaac Lab + DexMimicGen 自动生成)780K trajectories = 6500 小时(11 小时内生成)Sec. 3.2
合成数据(Cosmos WM 生成)若干Sec. 3.2
人类视频(Ego4D / Ego-Exo4D / EPIC-KITCHENS / HOI4D / HoloAssist 等)数百小时Sec. 3.3、Table 7

合成数据生成速度:1 秒视频约 2 分钟生成(Sec. 3.2)。

训练超参(PDF Table 6)

超参Pre-trainingPost-training
Learning rate$10^{-4}$
OptimizerAdamW($\beta_1=0.95$, $\beta_2=0.999$, $\epsilon=10^{-8}$)
Weight decay$10^{-5}$
LR schedulercosine,warmup ratio 0.05
Batch size16,384128 或 1024
Gradient steps200,00020,000–60,000
Backbone vision encoderunfrozen
Backbone text tokenizerfrozen
DiTunfrozen

训练成本(PDF Sec. Training Infrastructure):GR00T-N1-2B 预训练约 50,000 H100 GPU 小时,峰值用 1024 GPU(H100 + Quantum-2 InfiniBand fat-tree),通过 NVIDIA OSMO + Ray 分布式训练。compute-constrained finetune 测试在单 A6000 GPU 上完成——只调 adapter(state/action encoder + decoder)+ DiT 时 batch 可到 200,调 vision encoder 时 batch 只能到 16。

实验

Benchmark:人形 VLA 暂无统一 benchmark,N1 论文主要报告:

  • Long-horizon 任务:拼装、整理、厨房操作等长程任务,N1 完成 ~30 步长程 manipulation 任务的成功率显著高于 OpenVLA 微调基线(论文 Table 2 给具体数字,约 +30%)。
  • 跨本体:N1.5/N1.7 在 H1、G1、Booster T1、Fourier GR1、Figure 上 demo 都通过——latent action 预训练让跨本体 fine-tune 只需少量真机数据。
  • 真机 demo:H1 上完成接物、倒入、整理、开门等。
  • System 2 ablation:去掉 VLM、直接 DiT + image embedding,长程任务成功率显著下降(具体数字待核 PDF Table 2;方向上"VLM 对长程任务关键"已有共识)。

复现资源:HuggingFace 直下 nvidia/GR00T-N1-2B 权重;NVIDIA GPU 推理(CUDA + TensorRT);微调用 LoRA 在单 H100 上 1-2 天可完成。

为什么重要

  1. 开源人形 VLA 的里程碑:第一个真正开源、商用许可、可下载权重的人形 VLA foundation model。后续 N1.5(MoE)/ N1.6 / N1.7(3B、跨本体)持续迭代,直接催生整个开源人形 VLA 生态(OpenVLA-OFT、π0 复现、Octo 系等对比基线)。
  2. 双系统架构成为人形 VLA 主流:System-2 VLM + System-1 fast action expert 这套架构,是后续 Helix(Figure 7B+80M)、Gemini Robotics-ER、π0.5 的事实标准。这印证了 T10 的判断:单模型不可能既大又快,分层是必然。
  3. Flow matching 替代 diffusion 做 action head:4 步推理让 VLA 跑到 120 Hz,是 action expert 走向工业部署的关键。π0、GR00T N1、RDT-1B 都用 flow matching 而非 DDPM。
  4. LAPA latent action 预训练:把视频数据纳入 VLA 训练,是 data scaling 的关键 infra 贡献。后续 LAPA 范式被 OpenVLA-OFT、Helix 部分借鉴。
  5. 合成数据 pipeline 工业化:Cosmos + GR00T Mimic + Isaac Lab 三件套,形成「合成数据 → 训练 VLA → 真机部署」完整 pipeline。

局限

  1. 双系统接口仍是开放问题:System-2 → System-1 传 latent(12 层 feature)还是子指令?跨论文不可比。详见 T10
  2. 主要做上半身 manipulation:和 locomotion WBC 整合仍不成熟,全身 loco-manipulation 是下一步(N1.7 部分解决)。
  3. 依赖 NVIDIA 生态:Cosmos、Isaac Lab、Omniverse 都吃 NVIDIA 硬件,对非 NVIDIA 用户门槛高。
  4. 评估不充分:人形 VLA 暂无标准化 benchmark;HumanoidBench 是早期尝试但覆盖窄。N1 论文的成功率数字大多自家 demo、不可第三方复现。
  5. MoE 训练稳定性:N1.5+ 引入 MoE,但 router collapse、expert 不平衡是已知坑,论文未详细 ablation。

复现要点

  • 复现门槛:⭐⭐⭐⭐(资源 + 工程门槛都高)
  • 权重:nvidia/GR00T-N1-2B(HuggingFace 直下,N1.5/N1.7 在 model index)。
  • 推理:NVIDIA GPU + TensorRT 优化。System 2 用 Eagle-2-1B,System 1 用 DiT(注意 N1 是普通 DiT,不含 mixture-of-experts;MoE 自 N1.5+ 才引入)。
  • 微调:官方 repo 提供 SFT 脚本;合成数据用 GR00T Mimic;视频预训练用 LAPA tokenizer。post-training 时 neural trajectory 与 real trajectory 1:1 共训(PDF Sec. 2.3)。
  • 关键坑:① System 2 / System 1 latent 对齐(第 12 层 feature 对效果敏感,final layer 反而差);② action chunking H=16 的相位对齐(chunk 边界要和 proprio 对齐);③ flow matching 的 $p(\tau)=\mathrm{Beta}(\cdot;1.5,1)$ 采样别换成 uniform(实测 K=4 推理效果依赖于此);④ N1 是普通 DiT 不是 MoE——MoE 是 N1.5+ 才引入,router/load balancing 是 N1.5+ 的坑不是 N1 的。

版本演进

版本时间关键改动
N12025.03双系统开源首版,2.2B,flow matching + LAPA
N1.52025 中MoE System-1(generalist + specialist),数据扩
N1.62026 初训练集扩到更多本体,工程优化
N1.72026 初3B、商用许可、跨本体、当前主推

相关