深度⏱ ~3 min
里程碑
⭐ 为何重要

用户指定的 SONIC:不是数据集,而是 NVIDIA 的人形全身运动跟踪基础模型(42M 参数,100M 帧训练,开源)。它是当前很多遥操作与全身 VLA 演示的底层控制器,地位类似于低层的 'RT-1 for humanoids',是理解 2026 年人形 loco-manipulation 研究无法绕开的基石。

数据集100M+ 帧 motion-tracking 数据(含合成 + 真实 motion)
上真机
物理感知
实时
输入模态vision,language

论文:Zhengyi Luo, Ye Yuan, Tingwu Wang, Chenran Li, Fernando Castañeda, ..., Umar Iqbal, Linxi "Jim" Fan, Yuke Zhu(NVIDIA GEAR,PHC/UHC/BFM 同团队)。SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control. arXiv:2511.07820(v3 2026-05-21)。🌐 · 代码/权重已开源(NVlabs/GR00T-WholeBodyControl,HuggingFace nvidia/GEAR-SONIC)。T04 谱系当前制高点,兼 T10 VLA 全身操作的 motor 底座。

一句话直觉

把人形控制放大到大模型级别。

秘诀是用一个 universal token 统一三种动作格式。

它之于人形控制,就像统一充电口之于电子产品。

机器人、人类、混合三种动作插头,转成同一种电。一个底层电机就能驱动。

是什么·为什么

要解决的问题:前作证明了大规模动捕能做出基础模型

但有几个关键限制。📎

一是规模不够。学术界人形控制器仍是"三层网络加几块 GPU"级别。

二是接口不通用。之前的跟踪器只吃"目标姿态"一种输入。

三是没和视觉语言大模型整合。motor 策略和高层的视觉语言模型是分开的。

SONIC 的转身:论文的核心论点是——动作跟踪就是可规模化的基础任务。

每一帧都给一个明确目标姿态。数据集越大信号越强,不需要手写奖励。📎

靠判别器或手写奖励的任务(如 AMP、ASE)随数据变大反而塌缩。

跟踪任务反其道:数据越多越强。这就是它能被放大的根本。

方法核心(大白话):SONIC 的核心是"放大和统一"。

放大:把跟踪模型从百万参数扩到四千万。

训练数据从几百万帧堆到一亿帧。

证明动作跟踪这件事数据越多越强,像大语言模型的规模定律。📎

统一:以前跟踪器只懂"机器人姿态"一种输入。

SONIC 造了一个 universal token 当中间语言。

三种编码器各管一种输入。机器人未来动作是一类。人类动捕的3D关节是一类。上半身关键点加下半身机器人动作是第三类。它们都翻译成同一种 token。📎

一个解码器吃 token 出电机指令。

人动捕进人类编码器,变 token,出机器人动作——等于自动把人重定向到机器人。

再把高层视觉语言模型接上 token 接口。

视觉模型说"去拿苹果",这套方法就指挥全身走过去伸手。📎

为什么 token 用有限标量量化(FSQ)而不用老牌的向量量化?

因为老牌的向量量化在大码本时会塌缩——大块码本不被用。

FSQ 没有这个病,还能让强化学习的梯度直接穿过,和策略一起训。📎

为什么重要:首次在人形上系统做了数据、模型、算力三轴的规模曲线。

证明分布外泛化随规模单调改善——规模主要改善泛化,不只是过拟合训练分布。📎

在完全不同流程的外部数据集上成功率百分之九十七,远超前作。

首次实现视觉语言模型驱动的全身操作。它还含手脚协调:单脚踩踏板开盖,同时保持平衡扔易拉罐。📎

完全开源:权重、代码、数据子集都公开。

一句话类比:SONIC 之于人形控制,就像 GPT 之于语言模型。

同一个"数据越多越强"的规模定律。

同一个"统一接口让上层能直接指挥"的结构。

怎么做

核心机制·encoder-decoder 加 universal token

SONIC 用编码器把三种动作格式映射到一个共享的量化 token,再用统一的控制解码器出动作。📎

三种动作格式 → 三种编码器

  • 机器人动作编码器:编码未来若干帧的机器人关节位置和速度。
  • 人类动作编码器:编码未来若干帧的 3D 人类关节位置(SMPL 格式)。
  • 混合动作编码器:编码当前帧的上半身稀疏关键点(头加双手)加未来若干帧的下半身机器人动作。

多帧输入是为了提前预判,提升鲁棒性。📎

量化器:FSQ 而非向量量化。encoded latent 经有限标量量化成 universal token。

论文明确选 FSQ 不选 VQ-VAE,给三条理由:一避免码本塌缩;二不需要辅助 commitment loss 和码本滑动平均;三提供干净的直通梯度估计,兼容 PPO 联合优化。配置是两个 token,每个若干维、每维若干层(精确值在补充材料 Table S1)。📎

两个解码器

  • 控制解码器:吃 universal token 加本体感受,出电机指令。训练和部署用相同输入。
  • 动作解码器:只吃 token,重建机器人动作指令。当输入是人类动作时,编码器-解码器就是重定向管线——人变机器人是自动的。📎

四个损失端到端联合优化:PPO 损失加重建损失加 token 对齐损失加循环一致损失。

重建项让三种输入都重建到同一个机器人动作目标;token 对齐项强迫三种编码器对同一动作输出相似 token;循环项保证人 token 重建机器人动作再编码后回到机器人 token。

论文明确指出:"没有观察到量化和强化学习耦合带来的训练不稳定"——所有模型规模都稳定。📎

不对称 actor-critic。critic 看特权仿真状态(基座线速度、全身连杆位姿、无噪观测);actor 只看部署能拿到的观测(带噪本体感受加动作指令)。📎

规模数据。一百多亿帧 @ 50fps?不——是一亿多帧 @ 50fps,来自 700 小时原始动捕,重定向到 G1 后过滤掉物理不可行的(爬楼梯、坐姿),剩 611 小时训练数据。三十一万七千训练片段,八千多子类,覆盖三十三大类。公开数据子集 BONES-SEED:十四万序列、288 小时、522 个演员。📎

三档模型与算力。参数 1.2M、16M、42M 三档。算力 128 GPU × 7 天 = 两万一千 GPU 小时。📎

常见误区(先抛一个,完整版见末尾):"SONIC 就是更大的 BFM。"——不只是。BFM 是生成式 CVAE 策略,SONIC 是跟踪加 universal token。两者形态不同:BFM 把多任务放训练时统一,SONIC 靠 token 接口让 VLA 在推理时指挥全身。SONIC 还证明了跟踪的规模定律,这是 BFM 没给的。[未确认]

深度

MDP 形式化与状态/动作(Sec.3.2)。状态分两部分:本体感受 $s^p_t$ 是 10 步历史(关节位/速、根角速度、root-frame 投影重力、上一步动作);动作指令 $s^g_t$ 三选一(机器人/人类/混合)。所有量在机器人局部坐标系表达(保旋转不变),用 6D 旋转表示(Zhou 2019)。策略输出目标关节位置,由 PD 跟踪;PD 增益沿用 BeyondMimic 已调好的配方。📎

奖励(Sec.3.2 + Table S3):$r_t=\mathcal{R}(s^p_t,s^g_t)+\mathcal{P}(s^p_t,a_t)$。跟踪项最小化根位置/朝向、身体连杆位置/朝向/线速度/角速度误差;额外加末端执行器位置奖励(头、双腕、双踝五个关键点);加防抖(头/腕角速度惩罚)加足部加速度惩罚鼓励平滑接触

域随机化(Table S4)摩擦恢复系数、首帧关节位置、基座质心;周期性给根加随机线/角速度扰动模拟外推;还对动作指令本身加扰动(论文独有,部署鲁棒性关键)。📎

完整训练损失(Eq.1–4)

$$\mathcal{L}=\mathcal{L}_\text{ppo}+\mathcal{L}_\text{recon}+\mathcal{L}_\text{token}+\mathcal{L}_\text{cycle}$$

  • $\mathcal{L}_\text{recon}=\|\mathcal{D}_r(z_r)-g_r\|^2+\|\mathcal{D}_r(z_h)-g_r\|^2+\|\mathcal{D}_r(z_m)-g_r\|^2$:三种输入都重建到同一机器人动作目标。人类输入时这项就是重定向损失。
  • $\mathcal{L}_\text{token}=\|z_r-z_h\|^2+\|z_r-z_m\|^2+\|z_m-z_h\|^2$:成对对齐,强迫三种编码器对同一动作输出相似 token。
  • $\mathcal{L}_\text{cycle}=\|\mathcal{E}_r(\mathcal{D}_r(z_h))-z_r\|^2$:循环一致。

PPO 损失更新编码器/量化器/控制解码器加 critic;其余三项更新编码器/量化器/动作解码器。梯度经 FSQ 直通估计反传,让 PPO 能直接塑造编码器表示。📎

规模曲线(Fig.2a–c,关键数据)📎

维度配置分布外测试集 成功率/误差
数据规模4M/10M/22M/100M98.0%/27.7mm → 99.6%/23.8mm
模型规模1.2M/16M/42M98.0%/27.7mm → 99.6%/23.8mm
算力16/32/128 GPU(约 2K/9K/21K GPU-h)更大 batch → 更稳优化

核心发现:分布外(全新子类)增益最显著——证明规模主要改善泛化。

对比其他跟踪器(Fig.2d–g,同协议)📎

跟踪器分布外重复集外部 PHUMA误差
Any2Track31.1%38.4%58.6%
BeyondMimic81.6%85.8%73.4%39.1mm
SONIC98.7%99.6%97.0%23.2mm(比 BeyondMimic 降 41%)

PHUMA 百分之九十七最关键——它是视频姿态估计聚合的、完全不同流程的数据,是真正的跨数据集分布外。

对比专门模型(Fig.2h–j)。OpenHomie 是专为运动加上半身加下半身速度跟踪调优的。零到五米每秒速度跟踪:SONIC 百分之九十八点五存活 vs OpenHomie 百分之四十三。OpenHomie 在大于 1.5 m/s 崩到不足两成,SONIC 到约 4 m/s 仍接近满分。论文指出:通用策略在多样全身动作加动作生成器上训练,反而超过专门调优的专门模型——规模胜过专门化。📎

仿真到真机(Fig.2k–l)。123 真机序列部署。真机成功率百分之九十九点二 vs 仿真百分之百。整体误差 25.7mm(仿真 22.3mm)。仿真-真机差距:上肢最小,足部最大(反映真实接触动力学下精确落脚难)。📎

实时运动规划器(Sec.3.3)。自回归的隐式"中间补全"生成模型(与跟踪策略同数据集训练)。每步生成 0.8–2.4 秒动作片段(时长由神经规划器自定),笔记本小于 5 毫秒推理、Jetson Orin 约 12 毫秒。重规划频率 100 毫秒或用户指令更新时立即触发。隐式 token 化加掩码 token 预测。临界阻尼弹簧模型生成根轨迹, safeguard 极端命令(如 6 到负 6 m/s 急停)。📎

VLA 驱动的全身操作(Sec.2.5,最重磅 demo)。把 GR00T N1.5 VLA 接 universal token 接口。论文 Table 1 的 loco-manipulation 任务(十到二十次严格二值成功率);其中物件拾取的胡萝卜与刷子共用同一策略,故五任务平均时合并算一项,平均成功率 75%📎

任务接口训练数据试验次数成功率
苹果放盘子3 点300 轨迹2090%
拿胡萝卜全身3900 轨迹(13 物件)2075%
拿刷子全身3900 轨迹(多物件)2095%
开垃圾桶(脚踩踏板)全身200 轨迹1070%
易拉罐扔垃圾桶(五步序列)全身1000 轨迹(多物件)1060%
电钻与盒子搬运(拾起→装箱→双手上架)全身300 轨迹1070%
五任务平均(胡萝卜+刷子合并算一项)75%

VLA 输出 78 维动作 = 64 维 universal token + 14 维手部关节(whole-body 接口;3 点接口则用头/双腕位姿加指令)。关键消融(Table 3,whole-body 接口三任务):FSQ token 平均 68% vs SMPL 姿态平均 27%(领先 42 个百分点);任务越复杂差距越大——易拉罐 FSQ 百分之六十 vs SMPL 百分之零。token 是紧凑结构化动作空间,落在 motor foundation 训好的物理可行流形上,远比高维连续 SMPL 姿态易学。📎

部署(Sec.3.5)。Unitree G1(29 驱动关节)。全机载 Jetson Orin GPU + TensorRT + CUDA Graph:策略前向 1–2 毫秒,动作生成约 12 毫秒。多速率架构四并发环:策略 50Hz / 指令流 500Hz / 操作员输入 100Hz / 运动规划 10Hz。编码器-解码器设计让接口切换(键盘/手柄/VR/网络)只换激活的编码器,无需重训。真机部署最大模型(42M)。📎

局限

  1. 论文为短文风格。许多细节在补充材料(PD 增益、奖励权重、编码器层数、token 维度需查 Tab. S1–S4)。📎
  2. 真机操作仅 G1 单平台。跨形态(H1、Booster、自研人形)泛化未证;XHugWBC(2026.02)才开始做跨形态。[未确认]
  3. 42M 是否够。相对 VLA(GR00T N1.5 数十亿级),SONIC 42M 仍是低层 motor policy;上限在哪论文未答。[未确认]
  4. 安全与能效未形式化。论文自承"对长期部署的安全和能效缺乏形式化处理"。极端动态动作下跟踪器仍可能失平衡。📎

研究者视角

图谱定位:SONIC 是 PHC→UHC→BFM→BeyondMimic→SONIC 谱系的当前制高点(T04 转折 7),兼 T10「VLA 加 WBC」分层的成熟 motor 底座。📎


DeepMimic (2018, 逐帧对齐)
  → AMP (2021, 判别器分布对齐) ⭐ 分水岭
    → ASE/CALM (2022-23, latent skill)
      → PHC (2023.05, AMASS universal tracker)
        → UHC/PULSE (2023.10, universal representation)
          → OmniH2O/HOVER (2024, 真机多模式)
            → BFM (2025.09, 生成式 motor foundation)
              → BeyondMimic (2025.08, 跟踪加扩散)
                → SONIC (2025.11, 42M universal token, VLA 驱动) ⭐ 当前

每次规模或能力上一个台阶。SONIC 把"判别器式 prior"的形态链推进到"token 化基础模型",并首次接上 VLA。[未确认]

三个范式贡献

  1. 量化证明跟踪的规模定律。首次在人形上系统做数据/模型/算力三轴曲线,证明分布外泛化随规模单调改善,universal tracker 胜过专门模型。这是把 motor policy 当"基础模型"来 scale 的硬证据。📎
  2. universal token 统一多模态动作接口。三种编码器把机器人/人类/混合动作映到同一 token,控制解码器统一出动作;人变机器人是 token 化的副产物。这让 VLA 能用紧凑 token 指挥全身(含脚)。📎
  3. VLA 驱动的全身操作成熟实现。VLA 出高层意图 → SONIC 执行全身协调(含手脚协调)。是 T10「VLA 加 WBC 分层」的成熟版本。📎

SONIC vs BFM vs BeyondMimic 的路线分歧。三者都把 motor policy 当可复用基座,机制不同:[未确认]

  • BFM:生成式 CVAE,训练时统一多任务。
  • BeyondMimic:跟踪加扩散,推理时组合任务。
  • SONIC:大规模跟踪加 universal token,靠 token 接口让 VLA 在推理时指挥全身。

SONIC 选了"跟踪 + 规模化"路线,并用 token 解决接口通用性——这条线目前最成功。

Open problems

  1. 跨形态零样本。SONIC 仍绑 G1。一个跨形态(H1、Booster、自研人形)的 universal token 空间,要等 XHugWBC 等后续工作。[未确认]
  2. 42M 的上限。相对 VLA 数十亿参数,低层 motor policy 的规模天花板在哪?SONIC 的规模曲线还没到饱和。[未确认]
  3. 安全与能效的形式化。长期部署下安全/能效未被形式化处理。极端动态动作仍可能摔。📎
  4. 3D 视觉接入。当前 SONIC token 是 motor-only。把 3D 视觉预训练模型接入这条链,是下一步(π0.7 的 BAGEL、Cortex 2.0 走在这条路上)。[未确认]

常见误区

"SONIC 就是更大的 BFM" —— 不准确。

BFM 是生成式 CVAE 策略;SONIC 是跟踪加 universal token。形态不同。

BFM 把多任务放训练时统一;SONIC 靠 token 接口让 VLA 在推理时指挥全身,还证明了跟踪的规模定律。[未确认]

"token 用 VQ-VAE 就行" —— 错。

VQ-VAE 在大码本时会塌缩(大块码本不被用),还要辅助 commitment loss 和码本滑动平均。

SONIC 明确选 FSQ——避免塌缩、不需辅助损失、直通梯度兼容 PPO 联合优化。📎

"规模只让训练分布更拟合" —— 错。

规模曲线显示分布外(全新子类、完全不同流程的 PHUMA)增益最显著。

规模主要改善泛化,不只是过拟合训练分布——这是 motor policy 规模定律的硬证据。📎

"数据越多 AMP/ASE 也越强" —— 错。

靠判别器或手写奖励的任务随数据变大遭遇塌缩(Luo 2023、Tessler 2024 已证)。

跟踪是"数据越多越强"的可规模化任务;判别器式任务相反。这是 SONIC 选跟踪的根本理由。📎

"SONIC 的 token 是 VLA 才用的" —— 部分错。

token 首先是统一三种动作格式的接口(让跟踪器吃人动捕、机器人动作、混合动作)。

VLA 接 token 是它的第二用途;token 的第一用途是统一动作接口加自动重定向。📎

检查点

Q1

SONIC 选动作跟踪作为基础任务。论文说靠判别器或手写奖励的任务(如 AMP/ASE)随数据变大会出什么问题?跟踪任务为什么没有这个问题?

💡 参考答案

  • 判别器/手写奖励任务的问题:随数据变大遭遇 mode collapse(塌缩),数据越多反而越糟。
  • 跟踪没有这个问题的原因:跟踪每一帧都给一个明确的目标姿态(密集逐帧监督),数据集越大信号越强,不靠判别器也不靠手写奖励。
  • 对照推论:跟踪是「数据越多越强」的可规模化任务,这正是 SONIC 能把它放大到大模型级别的根本理由。
Q2

SONIC 用一个 universal token 统一三种动作格式。三种编码器分别处理哪三种输入?为什么用同一个 token 而不是三套各自的处理?

💡 参考答案

  • 三种输入:机器人未来动作、人类动捕的 3D 关节、上半身关键点加下半身机器人动作。
  • 用同一个 token 的原因:让一个控制解码器统一出动作;三种格式映到同一空间后可互相替代/转换。
  • 关键红利:人动捕进人类编码器→变 token→出机器人动作,等于自动把人重定向到机器人(retargeting 是 token 化的副产物)。
Q3

token 量化用 FSQ,不用老牌的向量量化(VQ-VAE)。用"统一充电口"或你自己举的类比,用自己的话解释:为什么 FSQ 更合适?

💡 参考答案

  • VQ-VAE 的问题:大码本时会塌缩——大块码本不被用(codebook collapse)。
  • FSQ 的好处:避免码本塌缩;不需要额外辅助损失;梯度能直通,和强化学习一起训不冲突。
  • 类比锚:像统一充电口——老标准(VQ)有些插孔常年没人用、还老接触不良;FSQ 是每个孔都稳定可用、还和主板(强化学习)直接通电。
  • 关键:选 FSQ 不是因为它新,是因为它不塌缩且和 PPO 兼容。
Q4

SONIC 把高层视觉语言模型(VLA)接上 token 接口。VLA 说出"去拿苹果"这种高层意图后,这套方法是怎么把它变成机器人全身动作的?

💡 参考答案

  • 流程:VLA 输出 universal token(一个紧凑的结构化动作表示),token 喂给控制解码器,解码器配本体感受出电机指令,机器人执行全身动作。
  • 关键:token 是 VLA 和底层控制之间的「共同语言」,VLA 不必直接输出原始关节角。
  • 对照:因为 token 紧凑且结构化,VLA 学起来比直接输出原始姿态容易得多(这也是它能做复杂全身操作的原因)。
Q5

SONIC 的规模曲线显示:分布外测试集(全新子类)的增益比分布内更显著。这个发现说明"放大规模"主要改善的是什么?

💡 参考答案

  • 主要改善的是「泛化」,不只是把训练分布拟合得更好。
  • 证据:分布外(全新子类、完全不同流程的外部数据集)成功率提升最显著,说明规模让模型更能应付没见过的动作。
  • 关键区分:若规模只让训练分布更拟合,分布外不会涨这么多;分布外涨得最多 = 泛化在改善。

FAQ

Q1:SONIC 能直接用在真机上吗?

能。Unitree G1(29 驱动关节)真机部署 123 个序列,成功率百分之九十九点二。全机载 Jetson Orin,策略前向 1–2 毫秒。最大 42M 模型直接上真机。📎

Q2:为什么用 FSQ 而不是 VQ-VAE?

三个理由:FSQ 避免码本塌缩;不需辅助 commitment loss 和码本滑动平均;直通梯度估计兼容 PPO 联合优化。论文明确说"没观察到量化和强化学习耦合的不稳定"。📎

Q3:SONIC 和 BFM 谁更强?

路线不同。BFM 是生成式 CVAE 策略;SONIC 是大规模跟踪加 universal token。SONIC 把规模推到 42M 加一亿帧,并证明跟踪的规模定律,还接上 VLA 做全身操作。在 T04 谱系里 SONIC 是当前制高点,BFM 是先驱。[未确认]

Q4:universal token 是给 VLA 用的吗?

第一用途是统一三种动作格式(机器人/人类/混合),让人动捕自动重定向到机器人。第二用途才是给 VLA 当动作空间。消融显示 token 比 SMPL 姿态更适合当 VLA 动作空间(易拉罐任务 FSQ 百分之六十 vs SMPL 百分之零)。📎

Q5:复现门槛高吗?

权重、代码、数据子集都开源,下载即用。但完整训练 pipeline 需一亿帧动捕加 128 GPU × 7 天。小实验室可只做下游 VLA 微调(300–3900 轨迹级)。和 GR00T N1.5 配合是 NVIDIA 官方推荐的全栈方案。📎