里程碑
数据集100M+ 帧 motion-tracking 数据(含合成 + 真实 motion)
上真机
物理感知
实时
输入模态vision,language

SONIC:让人形机器人「超级模仿」的 scalable motion tracking

NVIDIA(Zhengyi Luo, Ye Yuan 等)。arXiv:2511.07820v3, 2026。 项目页 · humanoid controlmotion_prior 线索 T04scaling laws

🧠 一句话心智模型:为什么 LLM 能 scale 到万亿参数,而人形机器人控制还在玩三层 MLP?因为后者找不到一个 scalable 的训练任务——走路不能教跳舞,奖励工程一任务一设计。SONIC 找到了那个任务:「motion tracking」(模仿人类动作捕捉数据)。它有逐帧稠密监督、不需要奖励工程、且数据规模可无限扩(已有 100M 帧)。把 tracking scale 到 128 GPU / 42M 参数,机器人就能自然地跑、跳、爬、打拳、跳舞。

🎯 为什么重要:humanoid 控制一直 scale 不起来

foundation model 时代,LLM 用 25,000+ GPU 训万亿 token,视频模型用上千 GPU 处理十亿图像。但 humanoid 控制还是「三层 MLP + 几张 GPU + 单任务」。SONIC 抓住的核心瓶颈是 task selection

humanoid 控制的 scalability 障碍 (a) 走路 + 手工奖励 走路 reward → 学不到跳舞 / 起身 / 拳击 每任务设计一次奖励 (b) AMP / ASE 对抗模仿 discriminator 区分真假动作 数据规模一大就 mode collapse (c) Motion Tracking ✓ 每一帧都有明确目标 pose 监督信号不随数据变稀 可无限 scale SONIC 选择 (c) 100M 帧 mocap + 42M 参数 + 21K GPU 小时 → 99.6% 成功率(23.8mm MPJPE)
图 1:为什么是 motion tracking?——它是唯一一个既不需要手工奖励、又不会随数据规模崩溃的 humanoid 训练目标。

💡 核心思想:Universal Token Space + 多输入编码器

SONIC 不只是个 tracker。它要做「一个 policy 解决所有 humanoid 应用」——包括 teleop / 导航 / VR 控制 / 视频驱动 / VLA 自主控制。核心 trick 是把所有可能的指令来源都映射到一个共享的离散 token 空间

SONIC 架构:异构输入 → 统一 token → 通用控制 Tasks ·游戏手柄导航 ·VR 3点 teleop ·VR 全身 teleop ·视频 / 文本 / 音乐 ·VLA loco-manipulation Motion Generators ·Kinematic Planner (导航 / 拳击 / 蹲爬) ·PICO VR Toolkit ·GEM 人类动作生成 (视频→动作) Specialized Encoders r Robot encoder (关节位置/速度) h Human encoder (SMPL 3D 关节) m Hybrid encoder (上身 keypoint + 下身机器人) FSQ Quantizer universal token z (2 tokens × 32 levels × 32 dim) Universal Control Policy Dc 控制解码 → 29 关节 motor 指令 (Unitree G1)
图 2:SONIC 多编码器架构——任何输入模态都被压成同一个 universal token,再由同一个控制策略解码成关节指令。这让「VLA 直接预测 token」成为可能。

关键设计:用 Finite Scalar Quantization (FSQ) 而不是 VQ-VAE——因为 FSQ 不会 codebook collapse,且支持 PPO 联合训练(梯度通过 straight-through estimator 直接回传到 encoder)。一致损失($\mathcal{L}_{token}$, $\mathcal{L}_{cycle}$)让三种编码器在 latent 空间对齐。

🛠️ 怎么做到的:三个 scaling 轴 + 一套训练 trick

维度心智关键数字(来自 PDF)
① 数据规模大规模 mocap 数据集(男女均衡;主要来自 Bones Studio 商业库,BONES-SEED 子集已公开),用 GMR + PyRoki retarget 到 G1 后过滤掉物理不可行源数据 ~700 小时;过滤后 611 小时训练100M+ 帧 @ 50 Hz);33 大类、8,447 子类
② 模型规模1.2M → 16M → 42M 参数 sweep1.2M: 98.0% 成功 / 27.7mm;42M: 99.6% / 23.8mm(test-content OOD)
③ 算力规模2K → 9K → 21K GPU 小时(16 / 32 / 128 GPU)21K GPU 小时 = 128 GPU × 7 天 × 50k iter;所有跑用同样超参
④ Asymmetric Actor-CriticCritic 看 privileged sim 状态;Actor 只看部署可得的 proprioception + 命令actor: noisy proprio + 10 步历史;critic: 全 body link pose + base velocity
⑤ Bin-based 自适应采样把数据按失败率分 bin,对难点加权采样(既覆盖又聚焦难点)capped failure rate weighting
⑥ Domain Randomization物理参数(摩擦、弹性、扰动)+ 命令扰动一起做对 command 加噪声 → tracker 对 planner 输出更鲁棒
🔮 直觉:为什么 motion tracking 能 scale,AMP 不能?
AMP / ASE 用 discriminator 区分真假动作——数据集越大越杂,discriminator 越难学,反馈越稀疏,最终 mode collapse。Motion tracking 的监督是逐帧的、显式的目标 pose——数据越多,监督信号越稠密、越稳定。所以它表现出类似 LLM 的「scale law」:数据 / 参数 / 算力三者翻倍,性能稳定上升(Fig.2abc)。

实时 kinematic planner:让 tracker 听话

光有 tracker 不够——它需要有人喂「未来动作参考」。SONIC 配了一个 autoregressive latent generative planner,用 masked token prediction 做 motion inbetweening(给定起点 + 终点关键帧,填补中间)。每段 0.8–2.4s,5ms 笔记本 / 12ms Jetson Orin就能推理一次,每 100ms 重规划。配合一个 critically damped spring 模型过滤不合理的命令(比如从 6m/s 突然变 -6m/s)。

📊 关键结果:scaling 全面起作用,吊打专家与 specialist

评估关键数字
vs BeyondMimic / Any2Track / GMTtest-content 成功率 98.7%(BeyondMimic 81.6%, Any2Track 31.1%);MPJPE-L 23.2mm(BeyondMimic 39.1mm,-41%
跨数据集(PHuMA)97.0% 成功(BeyondMimic 73.4%)——PHuMA 来自完全不同的 retargeting 管线,是强 OOD
vs OpenHomie(速度专家)速度跟踪整体存活率 98.5% vs 43.0%;OpenHomie 在 ~1.5 m/s 后崩盘,SONIC 维持近 100% 直到 4 m/s
真机 sim-to-real123 个动作序列,真机成功率 99.2%(sim 100%),MPJPE-L 25.7mm(sim 22.3mm);上身 gap 最小,脚部 gap 最大(53.7mm vs 29.0mm)
VLA loco-manipulation(5 任务)平均 75%(apple-to-plate 90% / 开垃圾桶 70% / 易拉罐进桶 60% / 钻和箱子 70%);FSQ token 比 SMPL pose 平均 +42%
开源代码 + BONES-SEED 数据集(142,220 序列 / 522 演员 / 288 小时)公开
关键洞察:SONIC 证明 humanoid 控制也能享受 scaling laws。一个反直觉发现:通用 tracker 击败专用 locomotion 专家(OpenHomie)——这暗示「用大规模 mocap 数据训出的通用 policy」可能比「为某个任务精细调过的专家」更鲁棒。这和 LLM 里「generalist 胜 specialist」的故事如出一辙。
token space 比 raw pose 更适合 VLA:消融(Tab.3)显示,预测 FSQ token 比 VLA 直接预测 SMPL pose 平均高 42 个百分点——尤其在「易拉罐进垃圾桶」这种长程多步任务上,SMPL 是 0%,token 是 60%。原因:离散低维 token 对小误差不敏感,而连续高维 SMPL pose 的微小预测误差会被 tracker 放大成大失败。

🌐 在领域中的位置

DeepMimic(单动作跟踪,2018) AMP / ASE(对抗模仿,但有 mode collapse) OmniH2O / HOVER / Exbody(人形全身控制) SONIC(motion tracking at scale + universal token)⭐

SONIC 把 humanoid 控制从「单任务专家」推向「通用 foundation controller」。它的 universal token 设计是连接低层 tracker 和高层 VLA 的关键桥梁——GR00T N1.5 VLA 直接预测这个 token 就能驱动全身。关联线索:T04 运动先验谱系

❓ 常见误区

SONIC 是 RL 还是模仿学习?

RL + 生成式模仿的混合。tracker 本身用 PPO 训,但奖励来自「与 mocap 参考的偏差」——逐帧 pose / orientation / velocity error,不是手工任务奖励。planner 部分用 masked token prediction(生成式)。整体可视为「以 mocap 为 dense supervision 的 RL」。

100M 帧的数据哪来的?

主要来自大规模商业 mocap 采集(Bones Studio),公开子集为 BONES-SEED(288 小时,142k 序列,522 演员)。原始 700 小时经过 retargeting 和物理可行性过滤后剩 611 小时训练。

它真的能做「VLA 直接控制」吗?

可以——这是它和 SONIC 之前 tracker 工作的最大区别。GR00T N1.5 VLA 被 fine-tune 去预测 78 维动作(64 维 universal token + 14 维手指)。因为 token 离散低维,VLA 学起来比连续 SMPL pose 容易得多(+42% 成功率)。

能直接跑到家里用吗?

部署友好(Jetson Orin 1-2ms 推理),但论文坦承局限:未处理安全性和能量效率;对极端动态动作仍可能失平衡;也没有处理长时间运行的电机发热问题。是个 research platform,不是产品。