Q1:SONIC 能直接用在真机上吗?
能。Unitree G1(29 驱动关节)真机部署 123 个序列,成功率百分之九十九点二。全机载 Jetson Orin,策略前向 1–2 毫秒。最大 42M 模型直接上真机。📎
论文:Zhengyi Luo, Ye Yuan, Tingwu Wang, Chenran Li, Fernando Castañeda, ..., Umar Iqbal, Linxi "Jim" Fan, Yuke Zhu(NVIDIA GEAR,PHC/UHC/BFM 同团队)。SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control. arXiv:2511.07820(v3 2026-05-21)。🌐 · 代码/权重已开源(NVlabs/GR00T-WholeBodyControl,HuggingFace nvidia/GEAR-SONIC)。T04 谱系当前制高点,兼 T10 VLA 全身操作的 motor 底座。
把人形控制放大到大模型级别。
秘诀是用一个 universal token 统一三种动作格式。
它之于人形控制,就像统一充电口之于电子产品。
机器人、人类、混合三种动作插头,转成同一种电。一个底层电机就能驱动。
要解决的问题:前作证明了大规模动捕能做出基础模型。
但有几个关键限制。📎
一是规模不够。学术界人形控制器仍是"三层网络加几块 GPU"级别。
二是接口不通用。之前的跟踪器只吃"目标姿态"一种输入。
三是没和视觉语言大模型整合。motor 策略和高层的视觉语言模型是分开的。
SONIC 的转身:论文的核心论点是——动作跟踪就是可规模化的基础任务。
每一帧都给一个明确目标姿态。数据集越大信号越强,不需要手写奖励。📎
靠判别器或手写奖励的任务(如 AMP、ASE)随数据变大反而塌缩。
跟踪任务反其道:数据越多越强。这就是它能被放大的根本。
方法核心(大白话):SONIC 的核心是"放大和统一"。
放大:把跟踪模型从百万参数扩到四千万。
训练数据从几百万帧堆到一亿帧。
证明动作跟踪这件事数据越多越强,像大语言模型的规模定律。📎
统一:以前跟踪器只懂"机器人姿态"一种输入。
SONIC 造了一个 universal token 当中间语言。
三种编码器各管一种输入。机器人未来动作是一类。人类动捕的3D关节是一类。上半身关键点加下半身机器人动作是第三类。它们都翻译成同一种 token。📎
一个解码器吃 token 出电机指令。
人动捕进人类编码器,变 token,出机器人动作——等于自动把人重定向到机器人。
再把高层视觉语言模型接上 token 接口。
视觉模型说"去拿苹果",这套方法就指挥全身走过去伸手。📎
为什么 token 用有限标量量化(FSQ)而不用老牌的向量量化?
因为老牌的向量量化在大码本时会塌缩——大块码本不被用。
FSQ 没有这个病,还能让强化学习的梯度直接穿过,和策略一起训。📎
为什么重要:首次在人形上系统做了数据、模型、算力三轴的规模曲线。
证明分布外泛化随规模单调改善——规模主要改善泛化,不只是过拟合训练分布。📎
在完全不同流程的外部数据集上成功率百分之九十七,远超前作。
首次实现视觉语言模型驱动的全身操作。它还含手脚协调:单脚踩踏板开盖,同时保持平衡扔易拉罐。📎
完全开源:权重、代码、数据子集都公开。
一句话类比:SONIC 之于人形控制,就像 GPT 之于语言模型。
同一个"数据越多越强"的规模定律。
同一个"统一接口让上层能直接指挥"的结构。
核心机制·encoder-decoder 加 universal token。
SONIC 用编码器把三种动作格式映射到一个共享的量化 token,再用统一的控制解码器出动作。📎
三种动作格式 → 三种编码器:
多帧输入是为了提前预判,提升鲁棒性。📎
量化器:FSQ 而非向量量化。encoded latent 经有限标量量化成 universal token。
论文明确选 FSQ 不选 VQ-VAE,给三条理由:一避免码本塌缩;二不需要辅助 commitment loss 和码本滑动平均;三提供干净的直通梯度估计,兼容 PPO 联合优化。配置是两个 token,每个若干维、每维若干层(精确值在补充材料 Table S1)。📎
两个解码器:
四个损失端到端联合优化:PPO 损失加重建损失加 token 对齐损失加循环一致损失。
重建项让三种输入都重建到同一个机器人动作目标;token 对齐项强迫三种编码器对同一动作输出相似 token;循环项保证人 token 重建机器人动作再编码后回到机器人 token。
论文明确指出:"没有观察到量化和强化学习耦合带来的训练不稳定"——所有模型规模都稳定。📎
不对称 actor-critic。critic 看特权仿真状态(基座线速度、全身连杆位姿、无噪观测);actor 只看部署能拿到的观测(带噪本体感受加动作指令)。📎
规模数据。一百多亿帧 @ 50fps?不——是一亿多帧 @ 50fps,来自 700 小时原始动捕,重定向到 G1 后过滤掉物理不可行的(爬楼梯、坐姿),剩 611 小时训练数据。三十一万七千训练片段,八千多子类,覆盖三十三大类。公开数据子集 BONES-SEED:十四万序列、288 小时、522 个演员。📎
三档模型与算力。参数 1.2M、16M、42M 三档。算力 128 GPU × 7 天 = 两万一千 GPU 小时。📎
常见误区(先抛一个,完整版见末尾):"SONIC 就是更大的 BFM。"——不只是。BFM 是生成式 CVAE 策略,SONIC 是跟踪加 universal token。两者形态不同:BFM 把多任务放训练时统一,SONIC 靠 token 接口让 VLA 在推理时指挥全身。SONIC 还证明了跟踪的规模定律,这是 BFM 没给的。[未确认]
MDP 形式化与状态/动作(Sec.3.2)。状态分两部分:本体感受 $s^p_t$ 是 10 步历史(关节位/速、根角速度、root-frame 投影重力、上一步动作);动作指令 $s^g_t$ 三选一(机器人/人类/混合)。所有量在机器人局部坐标系表达(保旋转不变),用 6D 旋转表示(Zhou 2019)。策略输出目标关节位置,由 PD 跟踪;PD 增益沿用 BeyondMimic 已调好的配方。📎
奖励(Sec.3.2 + Table S3):$r_t=\mathcal{R}(s^p_t,s^g_t)+\mathcal{P}(s^p_t,a_t)$。跟踪项最小化根位置/朝向、身体连杆位置/朝向/线速度/角速度误差;额外加末端执行器位置奖励(头、双腕、双踝五个关键点);加防抖(头/腕角速度惩罚)加足部加速度惩罚鼓励平滑接触。
域随机化(Table S4):摩擦、恢复系数、首帧关节位置、基座质心;周期性给根加随机线/角速度扰动模拟外推;还对动作指令本身加扰动(论文独有,部署鲁棒性关键)。📎
完整训练损失(Eq.1–4):
$$\mathcal{L}=\mathcal{L}_\text{ppo}+\mathcal{L}_\text{recon}+\mathcal{L}_\text{token}+\mathcal{L}_\text{cycle}$$
PPO 损失更新编码器/量化器/控制解码器加 critic;其余三项更新编码器/量化器/动作解码器。梯度经 FSQ 直通估计反传,让 PPO 能直接塑造编码器表示。📎
规模曲线(Fig.2a–c,关键数据):📎
| 维度 | 配置 | 分布外测试集 成功率/误差 |
|---|---|---|
| 数据规模 | 4M/10M/22M/100M 帧 | 98.0%/27.7mm → 99.6%/23.8mm |
| 模型规模 | 1.2M/16M/42M | 98.0%/27.7mm → 99.6%/23.8mm |
| 算力 | 16/32/128 GPU(约 2K/9K/21K GPU-h) | 更大 batch → 更稳优化 |
核心发现:分布外(全新子类)增益最显著——证明规模主要改善泛化。
对比其他跟踪器(Fig.2d–g,同协议):📎
| 跟踪器 | 分布外 | 重复集 | 外部 PHUMA | 误差 |
|---|---|---|---|---|
| Any2Track | 31.1% | 38.4% | 58.6% | — |
| BeyondMimic | 81.6% | 85.8% | 73.4% | 39.1mm |
| SONIC | 98.7% | 99.6% | 97.0% | 23.2mm(比 BeyondMimic 降 41%) |
PHUMA 百分之九十七最关键——它是视频姿态估计聚合的、完全不同流程的数据,是真正的跨数据集分布外。
对比专门模型(Fig.2h–j)。OpenHomie 是专为运动加上半身加下半身速度跟踪调优的。零到五米每秒速度跟踪:SONIC 百分之九十八点五存活 vs OpenHomie 百分之四十三。OpenHomie 在大于 1.5 m/s 崩到不足两成,SONIC 到约 4 m/s 仍接近满分。论文指出:通用策略在多样全身动作加动作生成器上训练,反而超过专门调优的专门模型——规模胜过专门化。📎
仿真到真机(Fig.2k–l)。123 真机序列部署。真机成功率百分之九十九点二 vs 仿真百分之百。整体误差 25.7mm(仿真 22.3mm)。仿真-真机差距:上肢最小,足部最大(反映真实接触动力学下精确落脚难)。📎
实时运动规划器(Sec.3.3)。自回归的隐式"中间补全"生成模型(与跟踪策略同数据集训练)。每步生成 0.8–2.4 秒动作片段(时长由神经规划器自定),笔记本小于 5 毫秒推理、Jetson Orin 约 12 毫秒。重规划频率 100 毫秒或用户指令更新时立即触发。隐式 token 化加掩码 token 预测。临界阻尼弹簧模型生成根轨迹, safeguard 极端命令(如 6 到负 6 m/s 急停)。📎
VLA 驱动的全身操作(Sec.2.5,最重磅 demo)。把 GR00T N1.5 VLA 接 universal token 接口。论文 Table 1 的 loco-manipulation 任务(十到二十次严格二值成功率);其中物件拾取的胡萝卜与刷子共用同一策略,故五任务平均时合并算一项,平均成功率 75%:📎
| 任务 | 接口 | 训练数据 | 试验次数 | 成功率 |
|---|---|---|---|---|
| 苹果放盘子 | 3 点 | 300 轨迹 | 20 | 90% |
| 拿胡萝卜 | 全身 | 3900 轨迹(13 物件) | 20 | 75% |
| 拿刷子 | 全身 | 3900 轨迹(多物件) | 20 | 95% |
| 开垃圾桶(脚踩踏板) | 全身 | 200 轨迹 | 10 | 70% |
| 易拉罐扔垃圾桶(五步序列) | 全身 | 1000 轨迹(多物件) | 10 | 60% |
| 电钻与盒子搬运(拾起→装箱→双手上架) | 全身 | 300 轨迹 | 10 | 70% |
| 五任务平均(胡萝卜+刷子合并算一项) | 75% |
VLA 输出 78 维动作 = 64 维 universal token + 14 维手部关节(whole-body 接口;3 点接口则用头/双腕位姿加指令)。关键消融(Table 3,whole-body 接口三任务):FSQ token 平均 68% vs SMPL 姿态平均 27%(领先 42 个百分点);任务越复杂差距越大——易拉罐 FSQ 百分之六十 vs SMPL 百分之零。token 是紧凑结构化动作空间,落在 motor foundation 训好的物理可行流形上,远比高维连续 SMPL 姿态易学。📎
部署(Sec.3.5)。Unitree G1(29 驱动关节)。全机载 Jetson Orin GPU + TensorRT + CUDA Graph:策略前向 1–2 毫秒,动作生成约 12 毫秒。多速率架构四并发环:策略 50Hz / 指令流 500Hz / 操作员输入 100Hz / 运动规划 10Hz。编码器-解码器设计让接口切换(键盘/手柄/VR/网络)只换激活的编码器,无需重训。真机部署最大模型(42M)。📎
局限:
图谱定位:SONIC 是 PHC→UHC→BFM→BeyondMimic→SONIC 谱系的当前制高点(T04 转折 7),兼 T10「VLA 加 WBC」分层的成熟 motor 底座。📎
DeepMimic (2018, 逐帧对齐)
→ AMP (2021, 判别器分布对齐) ⭐ 分水岭
→ ASE/CALM (2022-23, latent skill)
→ PHC (2023.05, AMASS universal tracker)
→ UHC/PULSE (2023.10, universal representation)
→ OmniH2O/HOVER (2024, 真机多模式)
→ BFM (2025.09, 生成式 motor foundation)
→ BeyondMimic (2025.08, 跟踪加扩散)
→ SONIC (2025.11, 42M universal token, VLA 驱动) ⭐ 当前
每次规模或能力上一个台阶。SONIC 把"判别器式 prior"的形态链推进到"token 化基础模型",并首次接上 VLA。[未确认]
三个范式贡献:
SONIC vs BFM vs BeyondMimic 的路线分歧。三者都把 motor policy 当可复用基座,机制不同:[未确认]
SONIC 选了"跟踪 + 规模化"路线,并用 token 解决接口通用性——这条线目前最成功。
Open problems:
"SONIC 就是更大的 BFM" —— 不准确。
BFM 是生成式 CVAE 策略;SONIC 是跟踪加 universal token。形态不同。
BFM 把多任务放训练时统一;SONIC 靠 token 接口让 VLA 在推理时指挥全身,还证明了跟踪的规模定律。[未确认]
"token 用 VQ-VAE 就行" —— 错。
VQ-VAE 在大码本时会塌缩(大块码本不被用),还要辅助 commitment loss 和码本滑动平均。
SONIC 明确选 FSQ——避免塌缩、不需辅助损失、直通梯度兼容 PPO 联合优化。📎
"规模只让训练分布更拟合" —— 错。
规模曲线显示分布外(全新子类、完全不同流程的 PHUMA)增益最显著。
规模主要改善泛化,不只是过拟合训练分布——这是 motor policy 规模定律的硬证据。📎
"数据越多 AMP/ASE 也越强" —— 错。
靠判别器或手写奖励的任务随数据变大遭遇塌缩(Luo 2023、Tessler 2024 已证)。
跟踪是"数据越多越强"的可规模化任务;判别器式任务相反。这是 SONIC 选跟踪的根本理由。📎
"SONIC 的 token 是 VLA 才用的" —— 部分错。
token 首先是统一三种动作格式的接口(让跟踪器吃人动捕、机器人动作、混合动作)。
VLA 接 token 是它的第二用途;token 的第一用途是统一动作接口加自动重定向。📎
SONIC 选动作跟踪作为基础任务。论文说靠判别器或手写奖励的任务(如 AMP/ASE)随数据变大会出什么问题?跟踪任务为什么没有这个问题?
💡 参考答案
SONIC 用一个 universal token 统一三种动作格式。三种编码器分别处理哪三种输入?为什么用同一个 token 而不是三套各自的处理?
💡 参考答案
token 量化用 FSQ,不用老牌的向量量化(VQ-VAE)。用"统一充电口"或你自己举的类比,用自己的话解释:为什么 FSQ 更合适?
💡 参考答案
SONIC 把高层视觉语言模型(VLA)接上 token 接口。VLA 说出"去拿苹果"这种高层意图后,这套方法是怎么把它变成机器人全身动作的?
💡 参考答案
SONIC 的规模曲线显示:分布外测试集(全新子类)的增益比分布内更显著。这个发现说明"放大规模"主要改善的是什么?
💡 参考答案
能。Unitree G1(29 驱动关节)真机部署 123 个序列,成功率百分之九十九点二。全机载 Jetson Orin,策略前向 1–2 毫秒。最大 42M 模型直接上真机。📎
三个理由:FSQ 避免码本塌缩;不需辅助 commitment loss 和码本滑动平均;直通梯度估计兼容 PPO 联合优化。论文明确说"没观察到量化和强化学习耦合的不稳定"。📎
路线不同。BFM 是生成式 CVAE 策略;SONIC 是大规模跟踪加 universal token。SONIC 把规模推到 42M 加一亿帧,并证明跟踪的规模定律,还接上 VLA 做全身操作。在 T04 谱系里 SONIC 是当前制高点,BFM 是先驱。[未确认]
第一用途是统一三种动作格式(机器人/人类/混合),让人动捕自动重定向到机器人。第二用途才是给 VLA 当动作空间。消融显示 token 比 SMPL 姿态更适合当 VLA 动作空间(易拉罐任务 FSQ 百分之六十 vs SMPL 百分之零)。📎
权重、代码、数据子集都开源,下载即用。但完整训练 pipeline 需一亿帧动捕加 128 GPU × 7 天。小实验室可只做下游 VLA 微调(300–3900 轨迹级)。和 GR00T N1.5 配合是 NVIDIA 官方推荐的全栈方案。📎