里程碑
机器人Fourier GR-1(论文真机部署;仿真训练跨多 humanoid 本体,含 AgiBot-World 数据集)
数据集HumanPlus / OpenX / Isaac Lab 合成数据
上真机
物理感知
实时
输入模态vision,language,proprioception

GR00T N1:NVIDIA 给人形机器人开的「开源大脑」

Johan Bjorck 等(NVIDIA GEAR / Isaac Lab 团队)。arXiv:2503.14734(2025-03,GTC 2025 同步发布)。 权重直下:nvidia/GR00T-N1-2B · 商用许可 · VLAhumanoidflow matching双系统 线索 T06/T10

🧠 一句话心智模型:把人形机器人拆成两个脑子——慢的「System 2 VLM」负责看图读指令做规划(10 Hz),快的「System 1 DiT」负责生成连续动作(120 Hz)。两个脑子通过一个隐藏层 feature 接口对话。再用 flow matching 4 步去噪 把推理压到实时,靠 合成数据金字塔 解决人形数据稀缺。这是第一个开源、商用许可、可下权重的人形 VLA foundation model。

🎯 为什么重要:人形 VLA 的「开源里程碑」

到 2025 年初,VLA 已经成熟(RT-2、OpenVLA、π0)——但都是为桌面机械臂设计的。人形机器人(H1/G1/Figure/Tesla Bot)有完全不同的挑战:

四个被卡住的硬伤
全身控制:人形 30+ DoF,不只是末端夹爪;
频率矛盾:高层语义要 100 ms 思考、低层关节要 100 Hz+ 才稳,单 transformer 既大又快不了;
数据稀缺:人形真机 teleop 一条轨迹的成本是桌面机械臂的 10–100×;
跨本体需求:H1、G1、Figure 关节配置完全不同,同一个模型要能下放多种机型。

NVIDIA 给的答复就是 GR00T N1。它把人形 VLA 从「闭源黑盒」(Figure Helix、Physical Intelligence π0.5)拉到「开源 + 商用许可 + 可下载权重」的开放生态——后续 OpenVLA-OFT、π0 复现、Octo 系都拿它做对比基线。更重要的是:它的双系统架构(System-2 VLM + System-1 action expert)成了后续人形 VLA 的事实标准。

💡 核心思想:双系统 + Flow Matching + 数据金字塔

整篇论文的工程哲学一句话:承认单模型不可能既大又快,于是分层;承认真机数据不够,于是合成。

输入 图像 + 语言 + 本体 state System 2 · Eagle-2 VLM(1.34B) SmolLM2(lang)+ SigLIP-2(vis) 224×224 → 64 image token/frame 取 LLM 第 12 层 hidden state φ_t 慢思考 · 10 Hz(L40 GPU) System 1 · DiT Action Expert(~0.86B) alternating cross-attn + self-attn 条件:φ_t + proprio + noisy action Flow Matching · K=4 步去噪 Action chunk H=16 · adaptive LayerNorm 快动作 · 120 Hz φ_t(latent 接口) 16 步动作 连续 action chunk → 关节指令 推理 63.9 ms 单 L40 · chunk=16
图 1:GR00T N1 双系统架构(基于 PDF Sec. 2.1)。System 2 VLM 慢跑出 $\varphi_t$(第 12 层 feature),System 1 DiT 在 120 Hz 快跑,每次拿最新 $\varphi_t$ 作条件,4 步 flow matching 去噪出 16 步动作 chunk。

这套「System 2 慢跑 + System 1 快跑 + latent 接口」与 Kahneman 的「快思考 / 慢思考」对应,也和 Helix(Figure 7B+80M)、π0.5 的设计不约而同——印证了 T10 线索的判断:单模型不可能既大又快,分层是必然

🔧 关键 trick 1:System 2 输出用的是「第 12 层 feature」而非最后一层

这反直觉:大模型的「最后一层」不是最好的特征。论文实测对 GR00T-N1-2B,取 LLM 第 12 层中间 embedding 作 $\varphi_t$,比取 final layer 推理更快 + 下游 policy 成功率更高(PDF Sec. 2.1)。原因:final layer 对齐了 LM head,适合「语义推理」;中间层保留更多 spatial/visual 细节,对 action prediction 更友好。

🔧 关键 trick 2:Flow Matching 让 diffusion 只要 4 步

System 1 不用 DDPM(几十到上千步太慢),改用 rectified flow matching——把噪声 $\epsilon$ 到真值 $A_t$ 用直线插值:

$$A_t^\tau = \tau A_t + (1-\tau)\,\epsilon, \qquad \tau\in[0,1] \tag{1a}$$

模型 $V_\theta$ 学去噪向量场 $\epsilon - A_t$,训练 loss(PDF Eq. 1):

$$\mathcal{L}_\text{fm}(\theta) = \mathbb{E}_{\tau, \epsilon}\!\left[\big\|\,V_\theta(\varphi_t, A^\tau_t, q_t) - (\epsilon - A_t)\,\big\|^2\right] \tag{1b}$$

$\tau$ 采样分布继承 π0:$p(\tau) = \mathrm{Beta}\!\left(\tfrac{s-\tau}{s};\,1.5,\,1\right)$,$s=0.999$——偏向小 $\tau$(更 noisy),让模型多学 hard denoising 步骤。推理用 K=4 步 forward Euler ODE,PDF 实测「K=4 works well across all embodiments」。这就是 N1 能跑 120 Hz 的关键——diffusion 要 50-1000 步,flow matching 只要 4 步。

🛠️ 数据金字塔:把 88 小时真机变 7,500+ 小时训练数据

论文最硬的工程贡献是数据 pipeline。PDF Fig. 1 把训练数据画成金字塔——越往上越「真」、越稀缺;越往下越「合成」、越海量:

规模(PDF 原文)用途
真人 teleop(GR-1 in-house)88.4 小时 · 6.4M 帧(Table 7 GR-1 Teleop)顶层:保证真机 grounding
神经轨迹(视频生成模型扩 10×)827.3 小时 · 23.8M 帧(Table 7 GR-1 Neural Videos)中层:counterfactual 轨迹 + 新语言指令
仿真轨迹(RoboCasa + DexMimicGen)780,000 条 ≈ 6,500 小时(11 小时内生成)中层:覆盖更多任务场景
人类视频(Ego4D / Ego-Exo4D / EPIC-KITCHENS 等)数千小时(~2,517h,Table 7;仅图像,无 action label)底层:视觉/行为先验,靠 LAPA 提 latent action
🔮 直觉:为什么「神经轨迹 10× 增广」能 work?
作者在 88 小时真机 teleop 上跑视频生成模型,生成「counterfactual」轨迹——同一个机器人,但换场景、换物体、换语言指令。生成速度 PDF 实测:1 秒视频 ≈ 2 分钟生成(Sec. 3.2)。这样把昂贵的 88h 真机数据扩成 827h 神经数据,10× 放大且保留机器人本体动力学(因为是「同一机器人」的生成)。这比单纯加 YouTube 人类视频更接近真机分布。

🔧 关键 trick 3:LAPA latent action——让无标签视频也能训

人类视频(YouTube / ego-centric)有图像没 action label,直接喂不进 VLA。论文用 LAPA(Latent Action Pretraining)解决:训一个 VQ-VAE 式的 latent action tokenizer,把帧对 $(x_t, x_{t+1})$ 编码成离散 latent action code $\hat a_t$,当伪 action label。System-1 DiT 在海量视频上 pretrain「从图像 + latent action 预测下一帧」的通用动力学,SFT 时把 latent action 换成真机 action——同一表示空间。latent action 是 embodiment-invariant 的:YouTube 里是人手,部署到 G1 是机械手,LAPA codebook 把两者统一到同一空间。

训练超参(PDF Table 6)

超参Pre-trainingPost-training
Learning rate$10^{-4}$
OptimizerAdamW($\beta_1=0.95$, $\beta_2=0.999$, $\epsilon=10^{-8}$)
Weight decay$10^{-5}$
LR schedulercosine,warmup ratio 0.05
Batch size16,384128 或 1024
Gradient steps200,00020,000–60,000
Backbone vision encoderunfrozen
LLM text backbonefrozen

📊 结果:10% 数据下还能持平 Diffusion Policy 全量数据

仿真三个 benchmark(Table 2,100 demos 训练):

方法模拟 Benchmark ABC平均
BC Transformer26.3%53.9%16.1%26.4%
Diffusion Policy25.6%56.1%32.7%33.4%
GR00T-N1-2B32.1%66.5%50.0%45.0%

真机(Fourier GR-1 人形,4 大类共 13 个任务,PDF Sec. 4):

设定Diffusion PolicyGR00T-N1-2B差距
10% 数据10.2%42.6%+32.4%
全量数据46.4%76.8%+30.4%
🔥 最狠的数字:GR00T-N1-2B 用 10% 的数据(42.6%)只比 Diffusion Policy 用 100% 数据(46.4%)低 3.8%。说明预训练(LAPA + 神经轨迹 + 仿真)给模型灌了大量先验,真机数据只需少量 fine-tune 就能 work——这对成本高昂的人形 teleop 是颠覆性的。

🌐 在领域中的位置

RT-2(VLA 范式确立) OpenVLA(开源 VLA 先驱) π0(flow matching action head) GR00T N1(人形 VLA 开源 ⭐) N1.5(MoE)/ N1.7(3B 跨本体)

GR00T N1 是人形 VLA 从闭源走向开源的分水岭。同期竞争:Helix(Figure,闭源 7B+80M)、Gemini Robotics(DeepMind)、π0.5(Physical Intelligence)、RDT-1B(清华开源,桌面双臂)。关联线索:T06 VLA 五段演进第五段、T10 VLA+WBC 整合开源代表、T02 数据集合成 pipeline。

❓ 常见误区

GR00T N1 是单个 transformer 吗?

不是。它是两个独立网络——System 2 Eagle-2 VLM(1.34B)+ System 1 DiT(~0.86B),通过 cross-attention 连接,联合训练但推理频率不同(10 Hz / 120 Hz)。这是它和 OpenVLA(单 transformer)的根本差异。

N1 用了 mixture-of-experts (MoE) 吗?

没有。N1 的 System 1 是普通 DiT(alternating cross-attn + self-attn)。MoE 自 N1.5+ 才引入——别把 N1.5 的设计写到 N1 笔记里。

120 Hz 真的能做到吗?

能。PDF 实测单 L40 GPU 上采样 16 步 action chunk 仅 63.9 ms。关键在于:(1) System 2 只在 10 Hz 跑,不算进 120 Hz 预算;(2) System 1 用 flow matching K=4 步(不是 diffusion 的 50-1000 步);(3) action chunking H=16 把 120 Hz 执行和 7.5 Hz 决策(120/16)分离。

System 2 → System 1 怎么通信?

通过 VLM 第 12 层 hidden state $\varphi_t$。System 2 慢跑出 $\varphi_t$,System 1 在每次去噪步通过 cross-attention 拿这个 $\varphi_t$ 作条件。这是「latent 接口」范式——和 Helix 的 latent 通信同类。但具体传第几层、什么 shape,跨论文不可比,是 T10 列的开放问题

开源到什么程度?

权重 + 代码 + 评估 都开源。HuggingFace 直下 nvidia/GR00T-N1-2B;fine-tune 脚本在 github.com/NVIDIA/Isaac-GR00T;商用许可(不同于 OpenVLA 的研究专用)。后续 N1.5 / N1.6 / N1.7 持续迭代到 3B、跨本体。