T04 · Motion Prior:从 AMP 到 BFM
核心问题:怎么把人类动作捕捉数据(MoCap),沉淀成机器人可以复用的运动常识——从「一段参考动作配一个 policy」一路走到「大规模预训练的通用 motor foundation」。
状态:🟢 活跃(2025 年随 BFM / BeyondMimic 出现第二波高潮;2026 上半年走向 scaling-law + 多形态 + AMP 方法升级)
本线索是用户最关心的方向。配套单篇笔记:P-DeepMimic-2018.md、P-AMP-2021.md、P-ASE-2022.md、P-PHCUHC-2023.md、P-BFM-2025.md、P-BeyondMimic-2025.md、P-SONIC-2025.md。
🎯 你将学到什么
- 看懂 motion prior 如何从 DeepMimic 的「逐帧对齐」一路演进到 BFM 的「大规模预训练 motor foundation」
- 掌握 AMP 判别器(LSGAN + R1 单边梯度惩罚 + observation map)为何能替代手工 reward,并一次性松开 DeepMimic 的三个硬伤
- 分清 ASE/CALM 的 latent skill、PHC/UHC 的 universal tracker、BFM 的 CVAE 行为分布之间的层次差异
- 能解释 BeyondMimic / SONIC 为何是 motion prior 与 diffusion action generation 的合流点
- 学会根据任务需求选择合适的 motion prior 形态(reference tracking / style reward / latent skill / foundation)
本页内容
基础解释
一句话直觉
让机器人动作像真人。
秘诀是把人类动作数据,蒸馏成它能复用的运动常识。
好比把名家的演奏录下来,提炼成乐谱。
以后学新曲子,不用每个音都从零摸。
从基础理解
要解决的问题
给机器人一个目标(往前走、别摔),它学得出来。
但写不进目标里的东西太多了。
步态要自然、上半身要协调、动作要有风格。
这些审美和常识,恰好是人类动作捕捉数据里大量存在的。
怎么把数据里的人类运动常识蒸馏出来、让强化学习能用,就是这条线的事。
演进脉络(四次形态变化)
这条线把同一批人类动作数据,用了四种越来越省的方法。
- 当逐帧标尺。让策略每一步对齐到参考视频的某一帧。精确但脆,一段视频只训一个动作 📎。
- 当软打分。训一个裁判,只判这段像不像人。一段数据从此能跨任务复用,是分水岭 📎。
- 当技能库。把数据压成带标签的基础技能,策略选标签就能指挥 📎。
- 当通用基座。在整个动捕库上预训练一个通用运动大模型,下游零样本迁移、不用重训 📎。
方法核心(大白话)
第二次变化(软打分)是关键转折。
之前的逐帧标尺,要求机器人和参考视频同步。
节奏不能自由发挥,一偏离就被罚。
软打分换了问法。不再问这一帧像不像参考第几帧。
改问这一段的整体长相,像不像人类数据。
训一个会打分的网络当裁判。
它看很多人类片段,学会人类动作长什么样。
再给机器人的动作打分,越像人分越高,这个分当奖励驱动机器人改动作。
好处是机器人能自由探索任务解,只要风格像就行。
代价是裁判是对抗式训练的,会和机器人一起变。
偶尔让机器人钻空子,反复刷某个高分姿态。
后两次变化,都在这套裁判打分上做加法。
要么把打分结构化成可指挥的技能,要么把它放大成预训练大模型。
一句话类比
把动捕当软打分,之于机器人,就像印象派之于肖像画。
不求逐像素复刻参考照片。
只求整体神似。
一、这条线索在解决什么
物理角色控制(physics-based character control)的终极难题之一是「完成任务的同时,让动作看起来像人」。手工 reward 只能写出「别摔倒、往前走」这类粗目标,写不出「步态自然、上半身协调、有风格」这类审美/常识——后者恰好是 MoCap 数据里大量存在的信息。
Motion prior 这条线,就是把 MoCap 数据里的「人类运动常识」蒸馏成 RL 能用的东西。它经历了四次形态变化:
reference-state(DeepMimic,2018) —— 把 MoCap 当逐帧标尺
↓
style-reward(AMP,2021) —— 把 MoCap 蒸馏成一个判别器
↓
latent skill(ASE/CALM,2022-23) —— 把 MoCap 蒸馏成可复用技能库
↓
controller(PHC/UHC,2023) —— 在全 AMASS 上学一个通用 tracker
↓
motor foundation(BFM,2025) —— 把 MoCap 放大成预训练大模型
每一步都把「数据」利用得更充分、把「任务适配」做得更轻。它上接 imitation learning(imitation 是它的思想来源)、下接 action generation(diffusion 生成路线和它在 BeyondMimic 合流),是当前人形机器人控制研究的中轴之一。
二、时间线(关键转折点)
2018 年 DeepMimic 起步,留下三个硬伤。[Peng et al., 2018, arXiv:1804.02717] 提出 reference-state alignment:让策略在每一帧都和一段 MoCap 的对应状态对齐,跟踪误差当奖励(详见 P-DeepMimic-2018.md)。这是奠基,但留下三个结构性问题:(1)时间对齐——必须有一条和任务同节奏的参考片段,policy 不能自由探索;(2)鲁棒性差——一旦偏离参考轨迹就被惩罚,跌倒难以恢复;(3)单风格——一个 policy 只能学一段动作。
2021 年 AMP 是分水岭。[Peng et al., 2021, arXiv:2104.02180] 把「逐帧对齐」换成「分布对齐」:不再要求「和参考片段同步」,只要求「策略轨迹的分布像不像人类数据」。用一个 GAN 式判别器把 MoCap 蒸馏成一个标量 style-reward,和 task reward 加权相加即可。三个硬伤一次性松开:无需时间对齐、允许偏离、可复用跨风格。AMP 之后的所有工作,本质上都是在 AMP 框架上做加法。
💡 核心洞察:AMP 把模仿学习的目标从「帧对齐」变成「分布对齐」——这是一次范式跃迁,从此「学动作风格」无需「跟某段参考同步」,整套 motion prior 领域的后续工作都建立在这个解放之上。
2022 年工程化落地。AMP-Adroit [Escontrela et al., 2022, arXiv:2203.15103] 把 AMP 搬上 Isaac Gym,证明判别器 style-reward 能替代复杂手工 reward,给出四足/人形参考实现;社区 unitree_rl_gym(Allman et al., 2023)成为四足研究者接触 motion prior 的事实入口。
2022-23 年结构化 prior 出现。AMP 把 MoCap 蒸馏成「一个整体 reward」,没有可指挥的内部结构。ASE [Peng et al., 2022, arXiv:2205.01906] 拆成两层:低层用对抗模仿学一个 64 维 latent skill policy,高层只输出 latent code 即可指挥(详见 P-ASE-2022.md);CALM [Tessler et al., 2023, arXiv:2305.02195] 再加条件化,让 latent 带语义、可按 skill label 切换;Multi-AMP [Vollenweider et al., 2022, arXiv:2203.14912] 走多离散风格路线,单一 policy 内可切步态。
2023 年大规模 controller 雏形。PHC [Luo et al., 2023.05, arXiv:2305.06456] 在整个 AMASS 上训一个 universal tracker,单 policy 即可模仿几乎任意片段、跌倒可自恢复,在 AMASS-Train* 上达 98.9% 成功率;UHC [Luo et al., 2023.10, arXiv:2310.04582] 进一步把 universal motion representation 做出来,成为后续 retarget/teleop/BFM 的事实基座 motor policy(PHC/UHC 机制详见 P-PHCUHC-2023.md)。这其实是 BFM 的雏形——只是没这样命名。
2024 年推上真机。ExBody [Cheng et al., 2024, arXiv:2402.16796](UC Berkeley / Stanford)在真人形上做 expressive whole-body;OmniH2O [He et al., 2024, arXiv:2406.08858](CMU / SJTU)用 kinematic pose 当 universal control interface、集成 VR/RGB/GPT-4;HOVER [He et al., 2024.10, arXiv:2410.21229](NVIDIA / CMU / UCSD)用多模式 policy distillation(DAgger)把 joint-position / joint-angle / root-tracking 三种 command mode 蒸到一个统一 WBC,是当前 BFM 类工作的强基线。
2025 年 BFM 与合流同时到来。BFM [Zeng et al., 2025, arXiv:2509.13780] 把 motion prior 正式升级为大规模预训练 motor foundation;BeyondMimic [Liao et al., 2025.08, arXiv:2508.08241] 把 motion tracking controller 与 guided diffusion 结合,让 AMP 这条线和 action generation 这条线第一次真正合流。
三、关键转折的深度解析
转折 1:AMP(2021)—— 用判别器替代逐帧对齐
前作缺陷:DeepMimic 的 reward 每一步都是手工设计的指数项加权和
$$r_t = w^I \cdot r^I_t + w^G \cdot r^G_t,$$
其中 imitation reward $r^I_t = w^p r^p_t + w^v r^v_t + w^e r^e_t + w^c r^c_t$(pose/velocity/end-effector/CoM,每项形如 $\exp(-\|x - x^{\text{ref}}\|^2/\sigma^2)$)必须对照那一帧的参考状态 $x^{\text{ref}}_t$。这意味着必须有「时间对齐」的参考片段,policy 一旦偏离参考就被惩罚。
新方法核心(以下精确公式与超参全部来自 PDF Sec.5–6 + Table 4,详见 P-AMP-2021.md):AMP 不再问「这一帧像不像第 t 帧参考」,而是问「这一段轨迹像不像人类数据」。它训一个判别器 $D_\phi(\Phi(s_t), \Phi(s_{t+1}))$,输入是 observation-only 状态转移对(不需要动作,这对 MoCap 是致命优势,因为动捕只有姿态无 torque),输出一个实数 score。判别器不直接吃 raw state,而是先过一个 observation map $\Phi(s)$ 抽 4 类特征(论文 Sec.5.3):root 线/角速度(局部坐标系)+ 每 joint 局部旋转(6D normal-tangent 表示)+ 每 joint 局部速度 + 末端 3D 位置——刻意不含 task-specific 特征,因此一份 prior 可跨任务复用。窗口仅 1 步(一对 $(s,s')$)。
判别器训练目标用 Least-Squares GAN(LSGAN, Mao et al. 2017),而非常见的 sigmoid cross-entropy——论文 Sec.5.2 明确指出 sigmoid 在判别器变强后会梯度消失,故改用 LSGAN:
$$\min_D\; \mathbb{E}_{(s,s')\sim\mathcal{D}}\big[(D(\Phi(s),\Phi(s'))-1)^2\big] + \mathbb{E}_{(s,s')\sim\pi}\big[(D(\Phi(s),\Phi(s'))+1)^2\big]$$
正样本目标 $+1$、负样本 $-1$,LSGAN 等价于最小化两个分布间的 Pearson $\chi^2$ 散度。Gradient penalty(Sec.5.4, Eq.8)只在真实样本上施加(1-centered R1 风格,不是 WGAN-GP 的双边惩罚),且是对 $\Phi(s)$ 求梯度:
$$+\; w_{gp}\, \mathbb{E}_{(s,s')\sim\mathcal{D}}\big[\|\nabla_\phi D(\phi)\big|_{\phi=(\Phi(s),\Phi(s'))}\|^2\big], \quad w_{gp}=10$$
policy 拿到的 style-reward 精确公式(Eq.7,含 clamp):
$$r^S(s_t, s_{t+1}) = \max\!\Big(0,\; 1 - \tfrac{1}{4}\,(D(\Phi(s_t),\Phi(s_{t+1})) - 1)^2\Big) \in [0,1]$$
即 $1 - 0.25(D-1)^2$ 再 clip 到 $[0,1]$;clamp 保证 reward 非负、有界,便于 PPO 价值函数拟合。
💡 核心洞察:AMP 判别器输入是 $(\Phi(s), \Phi(s'))$ 而非 $(s,a)$ —— 这一「省掉动作」的设计看似细节,实为对动捕数据本质(只有姿态、无 torque)的精确妥协,让 GAN 式模仿学习首次能在真实 MoCap 上落地。
最终 reward = $0.5\, r^G + 0.5\, r^S$(所有任务固定权重 0.5/0.5,论文 Sec.8.2,不做权重搜索)。
训练超参关键数字(论文 Table 4):判别器/策略/值网络同构(2 层 FC,1024→512,ReLU);判别器 batch $K=256$、replay buffer $10^5$;policy stepsize $2\text{-}4\times 10^{-6}$、判别器 stepsize $10^{-5}$(与 policy 同量级、实际略大 2.5–5 倍);判别器每 iteration 更新次数 $\gg$ policy(典型 $n\approx 16$),稳住对抗靠「更新次数 ~16:1 + R1 梯度惩罚 $w_{gp}=10$ + replay buffer」三件套,而非更小的判别器 stepsize——这是稳定 GAN 的关键设计。物理仿真用 Bullet @ 1.2 kHz、policy @ 30 Hz;PPO clip 0.02(比常规 0.2 严得多)、GAE $\lambda=0.95$、$\gamma=0.95$(单片段)/ 0.99(带任务)。每个 policy 100–300M samples,16 CPU cores 训 30–140 小时(单机 CPU,没用 GPU)。仍需 RSI(reference state initialization)+ early termination,但去掉了 phase variable——这是 AMP 相对 DeepMimic 的关键简化。
为什么是突破:从 reference tracking(状态对齐)升级到 distribution matching(分布对齐)。policy 可以自由选状态、自由探索任务解,只要「风格像」即可;一条 MoCap 数据集能跨任务复用。这彻底松开了 DeepMimic 的三个硬伤。
新问题:判别器是 GAN,会 mode collapse 和 reward hacking——策略容易找到一两个高奖励姿态反复刷分,动作虽「像」但单调;论文用混合数据集 + gradient penalty + style reward 截断 + replay buffer 缓解,仍未根治。同时仍依赖高质量 MoCap,跨形态(人↔四足)不能直接迁移。
转折 2:AMP-Adroit(2022)—— Isaac Gym 工程化
AMP 原版用 bespoke simulator,社区难复现。AMP-Adroit [Escontrela et al., 2022, arXiv:2203.15103] 把判别器 + style-reward pipeline 搬到 Isaac Gym(GPU 并行 4096 环境),证明一个判别器就能替代数千行手工 reward。它给了 amp_isaac_gym 代码,被 legged_gym/unitree_rl_gym/IsaacGymEnvs 系列大量 fork。从此 AMP 成为四足/人形社区的事实标准 reward 替代器,论文标题一句话点破定位:"Adversarial Motion Priors Make Good Substitutes for Complex Reward Functions"。
转折 3:ASE/CALM(2022-23)—— 结构化 latent skill
AMP 把 MoCap 压成「一个整体 reward」,没有可指挥的内部结构。ASE [Peng et al., 2022, arXiv:2205.01906] 拆成两层:
- 低层 skill policy $\pi(a|s, z)$:用对抗模仿(同 AMP 的判别器)学一个条件于 latent $z$ 的 policy,$z \in \mathbb{R}^{64}$(论文 hyperparameter 表给定 dim(Z)=64,action variance $\Sigma_\pi = 0.0025$)。低层只在 MoCap 上预训练一次。
- 高层 task policy $\pi^H(z|s)$:每个固定间隔(如 ~10 Hz)输出一个 latent $z$,指挥低层完成任务。
这样 MoCap 被压缩成「64 维 skill vocabulary」,高层只需在低维空间探索,task reward 不必再关心动作细节。CALM [Tessler et al., 2023, arXiv:2305.02195] 进一步加条件化:用 transition code + skill label 训判别器,让 latent 带语义(可按 "walk"/"kick"/"dance" 切换)。Multi-AMP [Vollenweider et al., 2022, arXiv:2203.14912] 走另一条路:用单个判别器 + 多离散 prior,一个 policy 内可切步态风格,对四足 ANYmal 与人形都验证。三者思路不同(连续 latent vs 条件化 vs 多离散),但都在解同一个问题:「让 prior 可被指挥、可复用」。
转折 4:PHC/UHC(2023)—— 大规模 controller 雏形
ASE/CALM 的 latent 还停留在「技能库」概念,没有「一个 controller 通吃所有 MoCap」。PHC [Luo et al., 2023.05, arXiv:2305.06456] 在整个 AMASS(40h+、15 个 MoCap 集合并)上训一个 universal tracker:单 policy 高保真模仿任意片段。关键技术:
- fall recovery:显式训一个 recovery policy 处理 fall-state / far-state / fall+far-state,使角色跌倒后能自然爬起再追上参考——这是 PHC "perpetual" 之名的来源,也是后续所有 teleop 真机系统的基础能力。在 AMASS-Train* 上达 98.9% 成功率。
- fault-tolerant tracking:对带噪参考动作鲁棒,能处理 pose estimator 输出的抖动/穿地。
UHC [Luo et al., 2023.10, arXiv:2310.04582](ICLR 2024)进一步提出 universal motion representation,证明一个 imitator 能覆盖几乎所有 AMASS 技能。PHC/UHC 其实已是 motor foundation 的雏形,只是没被这样命名——后续 H2O/OmniH2O/ExBody/HOVER/BFM 全部以它们为基座。
💡 核心洞察:PHC/UHC 的真正贡献不在 98.9% 成功率,而在「单 policy 覆盖整个 AMASS + fall recovery」这一范式——它把 motor skill 从「一段动作一个策略」拔到「一个基座通吃所有动捕」,已经提前两年回答了 BFM 想问的问题。
转折 5:真机迁移(2024)—— PHC/UHC 推到真机
PHC/UHC 是仿真 avatar,离真机还有 retarget + sim-to-real 两道坎:
- ExBody [Cheng et al., 2024, arXiv:2402.16796](UC Berkeley / Stanford):强调 expressive + robust,把 motion prior 思想迁移到真人形,让机器人尽量自然地模仿人类动作。
- OmniH2O [He et al., 2024, arXiv:2406.08858](CMU LeCAR Lab / SJTU):用 kinematic pose 作 universal control interface,集成 VR/RGB 多模态输入和 GPT-4 自主策略,把「motor controller + teleop + autonomy」打包——明确把 PHC/UHC 当通用基座。
- HOVER [He et al., 2024.10, arXiv:2410.21229](NVIDIA / CMU / UCSD 等):multi-mode policy distillation。先训一组 Oracle teacher(分别在 kinematic position / local joint angle / root tracking 三种 command mode 下工作),再用 DAgger 把它们蒸馏成一个统一 student policy,部署时通过「command masking」切换模式——这一思想直接被 BFM 继承。
转折 6:BFM(2025)—— 大规模预训练 motor foundation
[详细机制见 P-BFM-2025.md。] BFM [Zeng et al., 2025, arXiv:2509.13780] 的核心是把「行为分布」本身建模成一个生成模型,而非 PHC/UHC 那样的 task-specific tracker。具体做法(精确公式来自 PDF Sec.III–V + Table I–IV):
- RL 形式化重构(Sec.III.A):把 behavior 显式定义为 proprioception-action 轨迹 $\tau = [s^{p,\text{real}}_1, a_1, s^{p,\text{real}}_2, \dots]$,排除 goal state $s^g$(视为外部动机)——这样一份 behavior 可对应任意 control mode(速度指令/VR/reference pose/文本),从根源避免「一个任务一个 policy」。
- CVAE backbone(Sec.IV.D,Eq.5–8):ELBO 用 CVAE 实现:
$$\mathcal{L}_{\text{ELBO}} = \mathbb{E}_{q_\epsilon(z|s^{p,\text{sim}},s^{g,\text{sim}})}\big[\log P(a_t|s^{p,\text{real}}, s^{g,\text{real}}, z)\big] - D_{\text{KL}}\big[q(z|s^{p,\text{sim}}, s^{g,\text{sim}})\,\|\,P(z|s^{p,\text{real}}, s^{g,\text{real}})\big]$$
关键架构细节(旧 T04 完全没有):
- prior $P_\rho(z|s^{p,\text{real}}, s^{g,\text{real}})$:高斯,输入真机 proprioception + goal(推断时只用这个)。
- encoder $q_\epsilon(z|s^{p,\text{sim}}, s^{g,\text{sim}}, m_t)$:高斯,输入仿真特权 proprioception + 特权 goal + 当前 mask;均值用 residual 设计 $\mu_\epsilon + \mu_\rho$(Eq.7),让推断时(无特权信息)仍能用 prior 描述分布。
- decoder $P_D(a_t|s^{p,\text{real}}, z)$:高斯、固定方差;⚠️ decoder 输入故意不含 $s^{g,\text{real}}$(论文原话 "remove $s^{g,\text{real}}_t$ from the input of decoder"),逼 latent $z$ 必须编码更多 behavioral knowledge。
- CVAE latent $z$ 维度、MLP 层数、$\lambda_{\text{KL}}$ 主训练值、AMASS 数据规模、训练时长——论文均未公开,是当前复现最大障碍。
- proxy agent + masked online distillation:先训一个 privileged「proxy agent」(PPO + RSI,看到 7 类 privileged proprioception + 7 维差分 privileged goal),reward 是 task + regularization + penalty 三类加权和(Table I,含 body position 1.0、feet position 2.1、keypoint 1.6、torque −5.0、termination −200 等)。再把它在线蒸馏成 deployable policy。
- Online Distillation 精确 loss(Sec.IV.E,Eq.9)——DAgger 框架,每步同步算特权 $(s^{p,\text{sim}}, s^{g,\text{sim}})$ 并 query proxy 得 $\hat{a}_t$:
$$\boxed{\;\mathcal{L} = \underbrace{\|\hat{a}_t - a_t\|_2^2}_{\mathcal{L}_{\text{DAgger}}} + \lambda_{\text{KL}}\,\underbrace{D_{\text{KL}}\big(q_\epsilon(z_t|s^{p,\text{sim}},s^{g,\text{sim}})\,\|\,P_\rho(z|s^{p,\text{real}},s^{g,\text{real}})\big)}_{\mathcal{L}_{\text{KL}}}\;}$$
⚠️ 注意 KL 是 $q_\epsilon(z|s^{p,\text{sim}}, s^{g,\text{sim}})$(特权 state,不含 $a$)vs prior $P_\rho(z|s^{p,\text{real}}, s^{g,\text{real}})$(真机 state)——这是 teacher-student 不对称的体现。
- Mask 采样(关键升级):HOVER 用两阶段 mask strategy,BFM 改为每个 mask 元素独立从 Bernoulli(0.5) 采样——支持任意 control mode 组合(含训练时没见过的)。Mask curriculum(cold-start):Bernoulli 概率从 1.0 衰减到 0.5。
- deployable proprioception $s^{p,\text{real}}$(Sec.IV.B):$[q_{t-25:t}, \dot{q}_{t-25:t}, w^{\text{root}}_{t-25:t}, g_{t-25:t}, a_{t-25:t-1}]$——堆叠 25 步历史(joint pos/vel + root ang vel + projected gravity + last action),没有 root 线速度(真机拿不到)。
- zero-shot 多任务:预训练后无需重训即可迁移到 locomotion / teleop / motion tracking 等多种 WBC 任务(只手动设 mask)。IsaacGym 8192 并行 envs,机器人 Unitree G1(1.3 m,29 DoF,实验时冻手腕→23 DoF)。已 accepted to ICRA 2026。
- Behavior Modulation(Eq.10,类 classifier-free guidance):$z = (1+\lambda)\mu_\rho(s^{p,\text{real}}, s^{g,\text{real}}) - \lambda\mu_\rho(s^{p,\text{real}}, \emptyset)$,$\lambda>0$;Butterfly Kick 用 $\lambda=0.5$ 才能落地保持平衡。论文扫 $\lambda \in \{0.5, 1.0, 1.5, 2.0\}$,$\lambda=1.0$ 在 AMASS Test 上最佳。
BFM vs PHC/UHC 的本质区别:PHC/UHC 是 task-specific tracker(每个下游任务可能要 fine-tune 或训专门 head),BFM 是 generative foundation,把行为分布本身学下来,下游是 inference + 少量适配而非重训。BFM vs ASE:层次不同,ASE 是 64 维 skill latent,BFM 是覆盖全 AMASS 的生成式行为分布。
💡 核心洞察:从 PHC/UHC 到 BFM 的跃迁,本质是「学一个 tracker」→「学一个行为分布」——下游从「重训一个 head」变成「设 mask 推断」,这正是 motor 领域的「specialist → foundation」拐点。
转折 7:BeyondMimic(2025)—— 合流点
BeyondMimic [Liao et al., 2025.08, arXiv:2508.08241](UC Berkeley Hybrid Robotics,第一作者 Qiayuan Liao,Sreenath + C. Karen Liu 组;机制详见 P-BeyondMimic-2025.md)做了两件事:(1)用大规模 MoCap + RL 训一个能在真机上跑高动态技能(jumping spins、sprinting、cartwheels)的 motion tracking controller;(2)在它之上加 guided diffusion——用 diffusion 在技能空间里编排,做 waypoint navigation / joystick teleop / obstacle avoidance 等下游任务。
为什么这是合流点:AMP 线(motion prior)解决「动作怎么物理可行」,diffusion 线(action generation,见 T08)解决「动作怎么多样/可指挥」。两条线方向相反——前者从物理 controller 出发用 MoCap 扩能力,后者从生成模型出发用物理约束保证可行。BeyondMimic 把它们焊在一起:diffusion 负责编排、motion-tracking controller 负责落地。这和 ReinDiffuse [arXiv:2410.07296](RL + diffusion 物理化)、PhysDiff [Yuan et al., 2022, arXiv:2212.02500](把 physics simulator 注入 diffusion 反向过程)属同一潮流,但 BeyondMimic 是第一个在真机人形上跑通这套合流的。
💡 核心洞察:motion prior(从物理出发扩能力)与 action generation(从生成出发保可行)是同一条隧道的两端——BeyondMimic/SONIC 让它们在中间相遇,预示 2026 起人形 motor 控制的两个范式将不再各自演进,而是共享同一个 tracking + diffusion 骨架。
转折 8:SONIC(2025.11)—— 当前制高点 + VLA 整合
SONIC [Luo et al., 2025.11, arXiv:2511.07820](NVIDIA GEAR,PHC/UHC 同一作者 Zhengyi Luo)是 PHC→UHC→BFM→BeyondMimic 谱系的当前制高点。三个关键突破:
- Universal Token Space:定义一个统一 token 空间,用 specialized encoder 编码三种 motion——robot motion(本体感受)、human motion(SMPL/关键点)、hybrid motion(人+物交互)。所有类型经 Finite Scalar Quantization (FSQ) 量化到同一 shared token space(2 个 token、每维 $L_z$ levels)。这让 SONIC 能同时处理「跟人类动作」「跟机器人轨迹」「跟人-物交互」。
- Scale Up(参数 1.2M → 42M、数据 4M → 100M 帧、算力 2K → 21K GPU 小时):BFM 的 CVAE 只有 ~1.2M 参数,SONIC 扫三档(1.2M / 16M / 42M);训练数据从 BFM 的小时级扩到 100M+ 帧 @ 50 fps,来自 700 小时 raw MoCap(retarget + 过滤后剩 611 小时训练数据、317K clips、33 大类);算力 128 GPU × 7 天 = 21,000 GPU 小时。论文 Fig.2 给出 data / model / compute 三轴 scaling 曲线——OOD(test-content)增益最显著,首次系统验证人形 motor control 也吃 scaling law。
- VLA-driven 全身 loco-manipulation:配合 VLA(如 GR00T N1.5),实现「VLA 出高层意图 → SONIC 执行全身协调(含手-脚协调)」。这是 T10「VLA+WBC 分层」的成熟实现。
详见 P-SONIC-2025.md。SONIC 已开源权重(HuggingFace nvidia/GEAR-SONIC)与代码(github.com/NVlabs/GR00T-WholeBodyControl),并发布 BONES-SEED 数据子集(142K 序列 / 288 小时 / 522 actors),ICLR 2026 录用。
2026 最新进展
2026 上半年 BFM 从 2025 的「proof of concept」走向「scaling-law + 多形态 + AMP 方法升级」:
- Scaling Law 来了(BFM 工程化的关键收口):Scaling BFM [Zeng et al., arxiv:2607.15163](CUHK + Shanghai AI Lab + SJTU,BFM 同一团队)是人形 BFM 首份系统性 scaling-law 研究——给出三项必须协同的结论:(1) 用 motion tracking 学习范式把全局坐标系下整体行为复现作为统一问题;(2) on-policy rollout 数量与参考动作多样性的战略协同;(3) Humanoid Transformer 架构让结构化行为表征自然涌现。在 MPKPE 上比已有 controller local 模式降 10%、global 模式降 82%——是 2026 人形基础模型方向最关键的方法学结果之一。
- 从 kinematic prior → dynamics prior(AMP 范式的方法学演进):ADP [Lee et al., arxiv:2607.03454](KAIST)把 AMP 的对抗判别器目标从运动学 style 特征替换为动力学特征(CoM、centroidal momentum、接触力、接触状态),用轨迹优化构造参考数据集;扰动后 policy rollout 仍贴近参考支撑集、无需显式 motion tracking。相对 AMP 把 80%-success impulse threshold 提升 16.7%、方向平均恢复时间降 47.9%——把 AMP 从 kinematic prior 升级为 dynamics prior,让人形在强扰动下保持物理 grounded 的步态。
- 多步态 AMP 的选择性应用:Selective AMP [Wu et al., arxiv:2604.19102](GDUT / SIAT)首次系统性回答「AMP 是否对所有步态都适用」的争议:对周期性、稳定性关键的步态(走、正步走、爬楼)施加 AMP 加速收敛并抑制毛刺,对高动态步态(跑、跳)刻意省略 AMP 避免过度约束;PPO + domain randomization,12-DoF 人形上零样本 sim-to-real 部署。为多步态统一 RL 训练提供了简单实用的方法学原则。
- AMP 推广到滚动接触(novel locomotion modality):Roller-Skating AMP [Cheng et al., arxiv:2607.10815](清华)把 AMP 用于人形轮滑两种步态(Pump Glide / Push Glide):mocap 采集后 retarget + 平滑重采样生成参考,两条独立 AMP pipeline(独立参考集、独立策略、独立 reward)分别训练——验证了 AMP 对非常规接触模式(滚动接触 + 速度依赖姿态调节)的可迁移性(CLAWAR 2026 oral)。
- 四足 BFM 登场(跨形态扩展):ABot-C0 [Zhao et al., arxiv:2607.07370](ABot Robotics / 小米)是四足机器人的通用运动控制系统:多源数据金字塔(条件视频生成 + 标注 mocap + 遥操 + 人工设计,共 16074 条物理可行动作片段)+ Flow-Matching 通用策略 + 统一部署栈;首次在四足上证明 motion tracking 性能随训练规模单调提升、具零样本跟踪未见动作能力。三阶段 privileged→perceptive 训练(含时序 LiDAR memory + 地形预测监督)做全地形通行——是 2026 四足行为基础模型方向标志性技术报告。
- NVIDIA 2026 运动生成集群(motor prior 与 motion generation 的工业级收口):NVIDIA SIL/GEAR(Rempe / Petrovich / Tingwu Wang / Peng 等,与 SONIC 同一团队)2026 上半年密集发布四篇运动工作,把「运动先验」与「运动生成」在物理控制 / 机器人数据 / 实时性三个维度上收口:
- GPC [Shi et al., arXiv:2606.29148](Generative Pretrained Controllers)把「下一 token 预测」引入物理运动控制:用端到端 RL + 有限标量量化(FSQ)联合学一个「运动词表」与控制策略,再训 GPT 式自回归 transformer 对词表结构建模,复现大规模动作语料达 99.98% 成功率,并涌现出对外力扰动的响应与跌倒恢复——是 AMP→PHC→CALM→BFM 谱系走向「generative pretraining」的标志性一步。
- KiMoDO [Rempe et al., arXiv:2603.15546] 在 700 小时光学动捕(远超公开 mocap 规模)上训练可控运动扩散模型(文本 + 全身关键帧 / 稀疏关节位置旋转 / 2D 航点 / 稠密 2D 路径约束,两阶段去噪器解耦根节点与身体),并在 Unitree G1 本体上直接生成机器人运动演示(开源
nv-tlabs/kimodo+nvidia/Kimodo-G1-RP-v1)——把生成式运动当作机器人数据源,桥接 T04 与 T02 数据基础设施。 - ARDY [Zhao et al., arXiv:2607.08741](SIGGRAPH 2026 / ACM TOG,NVIDIA + ETH)用自回归扩散 + 混合表示做流式实时运动生成、在线文本可控,面向动画 / 仿真 / 人形机器人——在实时设定下首次兼顾可控性与推理速度。
- MotionBricks [Wang et al., arXiv:2604.24833](SIGGRAPH 2026 / ACM TOG,NVIDIA GEAR)针对生成式运动「实时可扩展性 + 工业集成」两大瓶颈,用模块化隐空间生成模型 + smart primitives 做可组合、可实时调度的「运动即积木」系统,跨动画与机器人。
四者合起来代表 2026「运动生成 → 可迁移物理控制 / 机器人数据 / 实时工业栈」的 NVIDIA 路线:GPC 控制端、KiMoDO 数据端、ARDY/MotionBricks 实时端,与 SONIC(转折 8,同 GEAR 团队)同构互补。
📌 关键要点
- Motion prior 的本质是把 MoCap 蒸馏成 RL 可用的「人类运动常识」,经历了 reference-state → style-reward → latent skill → controller → foundation 五次形态变化
- AMP 是分水岭:用判别器把「逐帧对齐」换成「分布对齐」,一次性松开 DeepMimic 的时间对齐/鲁棒性差/单风格三个硬伤,且无需 expert action(对 MoCap 致命友好)
- PHC/UHC(在 AMASS 上 98.9% 成功率 + fall recovery)已是 motor foundation 的雏形,是后续 H2O/OmniH2O/ExBody/HOVER/BFM 的共同基座
- BFM 用 CVAE 把「行为分布」本身学成生成模型,靠 mask 实现零样本多任务,但官方代码未开源、CVAE 关键超参未公开是当前最大复现障碍
- BeyondMimic / SONIC 把 motion tracking controller 与 guided diffusion 焊在一起,是 motion prior 与 action generation 两条线的真正合流点
四、相似概念辨析
| 概念 | 输入 | reward 形式 | 关键区别 |
|---|---|---|---|
| DeepMimic (2018) | 逐帧参考状态 $x^{\text{ref}}_t$ | 手工指数加权和 $r^p + r^v + r^e + r^c$ | reference tracking,需时间对齐 |
| GAIL (2016) | (s,a) 状态-动作对 | $-\log(1-D(s,a))$(sigmoid cross-entropy) | 需要 expert 动作;二分类器 |
| DAC (2019) | (s,a) + absorbing state | GAIL 式 + absorbing reward | off-policy、处理终止状态,sample eff. ~10× |
| AMP (2021) | $(\Phi(s), \Phi(s'))$ 转移对(4 类特征) | $\max(0, 1 - \tfrac{1}{4}(D-1)^2)$ + R1 gradient penalty | state-only,不需 expert action;LSGAN 不是 sigmoid;style prior |
核心辨析:
- AMP vs GAIL vs DAC:三者都是对抗式 imitation learning,但 AMP 把判别器从 (s,a) 换成 $(\Phi(s), \Phi(s'))$,不要 expert action——这对 MoCap 是致命优势(动捕只有姿态没有 torque)。AMP 用 LSGAN(不是 GAIL 的 sigmoid cross-entropy)、1-centered R1 单边 gradient penalty(不是 WGAN-GP 双边),判别器输入是 $\Phi(s)$ 的 4 类特征(root 线/角速度、joint 6D 旋转、joint 速度、末端 3D 位置),不是 raw state——这些细节见 P-AMP-2021.md。
- reference tracking (DeepMimic) vs distribution matching (AMP):两种 imitation 哲学。前者精确但刚性,后者灵活但只学风格。
- latent skill (ASE) vs foundation model (BFM):都是「压缩 MoCap」,层次不同。ASE 是 64 维技能 vocabulary,BFM 是覆盖全 AMASS 的 CVAE 生成式行为分布(encoder 看特权、prior 看真机、decoder 故意不接收 goal)。
- motion prior(本章)vs motion generation(diffusion 生成,T08):方向相反但终点相同——前者从物理出发用 MoCap 扩能力,后者从生成出发用物理保证可行。BeyondMimic/ReinDiffuse 是合流点。
五、与其他线索的交叉点
- 与 T03(reward 设计):AMP = "用 motion prior 替代手工 reward",是 reward 自动化链(legged_gym → AMP → Eureka → DrEureka)的关键一环。AMP-Adroit 论文标题就是这层关系。
- 与 T02(locomotion):四足领域把 AMP 当 reward 替代器(AMP-Adroit、Multi-AMP on ANYmal),人形 locomotion 更依赖 PHC/UHC 式 universal tracker,AMP 多用作风格约束(Stylized Biped Control、Learning to Walk in Costume)。二者互补:BFM 给基础能力,AMP 给风格定制。
- 与 T07(teleop):H2O/OmniH2O 把 PHC/UHC 当 teleop 基座,BFM/HOVER 是 universal motor policy 的最新形态——teleop 提供上层指令接口,motion prior 提供低层 motor skill。
- 与 T08(action generation):BeyondMimic 是合流点(见转折 7)。ReinDiffuse/PhysDiff 是 diffusion 线的反向接入。
- 与 T06(VLA):BFM 给 VLA 提供可调度的低层 motor skill,是 GR00T N1/Helix 等「VLA + WBC 分层」架构的 WBC 那一半。
六、当前局限与开放问题
- BFM 工程复现门槛:截至 2026-07,BFM 论文已 accepted ICRA 2026 但官方代码未开源(
project/code字段空),proxy agent 训练细节、mask schedule 超参、CVAE latent 维度都需从论文 + 社区 notebook(如ImChong/Robotics_Notebooks)反推。社区已有 BFM-Zero [Li et al., 2025, arXiv:2511.04131] 走 FB-representations 路线复现「可 prompt 的 BFM」,但用的是不同技术栈。 - 跨形态 retarget 损耗:SMPL(AMASS 的表示)→ H1/G1/GR1(真机人形)的自由度、连杆长度、质量分布都不一致。General Motion Retargeting [Araújo et al., 2024, ICRA] 给了通用流程,但剧烈动作(跳跃、翻滚)下仍会丢失动量/接触信息,是 sim-to-real 的隐性瓶颈。
- 物理一致性 vs 「贴上去」:两条哲学仍在竞争。PhysDiff 把物理注入 diffusion 反向过程(post-hoc 修正),ReinDiffuse 用 RL finetune 让生成动作物理可信,BeyondMimic 用 tracking controller 把生成动作「执行」出来。哪个最终成为主流未定。
- AMP 的 mode collapse 是否被 BFM 真正解决:BFM 用 CVAE 显式建模多模态行为分布,理论上比 AMP 单判别器更抗 mode collapse——但论文未直接对比 AMP-style mode collapse 指标,社区仍缺统一 benchmark。BFM 的 structured latent 确实给了「可控多样性」的可能(mask 某些 skill label 看生成什么),这是 AMP 做不到的。
- 数据闭环:BFM 在 AMASS(SMPL,40h)上预训练,但 Motion-X/Motion-X++(19.5M 全身 SMPL-X 姿态,含手部+表情)尚未被 BFM 系列充分利用——下一代 BFM 大概率会迁移到全身 expressive 数据。
七、涉及里程碑论文
- [Peng et al. 2018, arXiv:1804.02717] DeepMimic —— 奠基:reference-state alignment + RL
- [Peng et al. 2021, arXiv:2104.02180] AMP —— 分水岭:判别器替代逐帧对齐(详见 P-AMP-2021.md)
- [Escontrela et al. 2022, arXiv:2203.15103] AMP-Adroit —— 工程化:Isaac Gym 落地,style-reward 替代手工 reward
- [Peng et al. 2022, arXiv:2205.01906] ASE —— 结构化:两层 latent skill(64 维)+ 高层指挥
- [Vollenweider et al. 2022, arXiv:2203.14912] Multi-AMP —— 多离散风格切换
- [Tessler et al. 2023, arXiv:2305.02195] CALM —— 条件化 latent,可语义指挥
- [Luo et al. 2023.05, arXiv:2305.06456] PHC —— AMASS universal tracker + fall recovery
- [Luo et al. 2023.10, arXiv:2310.04582] UHC —— universal motion representation,事实基座
- [Cheng et al. 2024, arXiv:2402.16796] ExBody —— 真人形 expressive whole-body
- [He et al. 2024, arXiv:2406.08858] OmniH2O —— kinematic pose 作 universal interface
- [He et al. 2024.10, arXiv:2410.21229] HOVER —— 多模式 policy distillation,强基线
- [Zeng et al. 2025, arXiv:2509.13780] BFM —— 大规模预训练 motor foundation(详见 P-BFM-2025.md)
- [Liao et al. 2025.08, arXiv:2508.08241] BeyondMimic —— motion tracking + guided diffusion 合流
八、参考文献与延伸阅读
- 本仓库内单篇笔记:P-DeepMimic-2018.md、P-AMP-2021.md、P-ASE-2022.md、P-PHCUHC-2023.md、P-BFM-2025.md、P-BeyondMimic-2025.md、P-SONIC-2025.md
- 关联线索:T03 Reward 设计演化(AMP 作为 reward 自动化一环)、T07 人形 Teleop 栈(PHC/UHC 作为 teleop 基座)、T08 动作生成(BeyondMimic 合流点)、T10 VLA+WBC 分层集成(SONIC 作 VLA 底层 motor)
- 外部:BFM 官方 arXiv
arxiv.org/abs/2509.13780;BFM 综述 [Yuan et al. 2025, arXiv:2506.20487];BFM-Zerolecar-lab.github.io/BFM-Zero/;SONICnvlabs.github.io/GEAR-SONIC/
可选复盘:常见误区
澄清:"有了裁判就不需要参考动作了" —— 错。裁判仍要喂人类动作数据,才能学"什么叫像人"。它扔掉的是逐帧对齐,不是参考数据本身 。
"有了裁判就不需要参考动作了" —— 错。裁判仍要喂人类动作数据,才能学"什么叫像人"。它扔掉的是逐帧对齐,不是参考数据本身 📎。
它不要"逐帧标尺",但离不开"参考数据集"。
澄清:"这条线就是让动作好看,和干活无关" —— 半错。风格是其一;更重要的是把人类动作沉淀成可跨任务复用、可指挥的技能库和通用基座,直接服务行走和操作 。
"这条线就是让动作好看,和干活无关" —— 半错。风格是其一;更重要的是把人类动作沉淀成可跨任务复用、可指挥的技能库和通用基座,直接服务行走和操作 📎。
审美是表层,可复用的运动常识才是核心。
澄清:"通用运动基座已经成熟" —— 还没有。复现门槛高、跨形态(人到四足)会丢动量和接触、裁判的钻空子毛病有没有真治好,都还没定论 。
"通用运动基座已经成熟" —— 还没有。复现门槛高、跨形态(人到四足)会丢动量和接触、裁判的钻空子毛病有没有真治好,都还没定论 📎。
方向成立,工程和评测都未收敛。
可选复盘:检查点
用"乐谱"或"印象派"类比,向没学过机器人的朋友解释:第二次变化(软打分)比第一次(逐帧标尺)松开了什么?
查看参考答案
- 第一次(逐帧标尺):要求机器人和参考视频逐帧同步,节奏不能自由发挥,一偏离就被罚。
- 第二次(软打分):不再要求逐帧对齐,只要求'这一段整体长相像不像人类数据'。
- 松开了什么:松开了'时间对齐'和'逐帧精确',机器人可以自由探索任务解,只要风格像就行。
- 类比锚(印象派):不求逐像素复刻参考照片,只求整体神似。
四种形态(逐帧标尺、软打分、技能库、通用基座),每一次比上一次"省"在哪?
查看参考答案
- 逐帧标尺 → 软打分:省掉了逐帧对齐,一段数据能跨任务复用。
- 软打分 → 技能库:把数据压成带标签的基础技能,策略只要选标签就能指挥,不必每次重学。
- 技能库 → 通用基座:在整个动捕库上预训练一次,下游任务零样本迁移、不用重训。
- 总趋势:把'数据'利用得越来越充分,把'任务适配'做得越来越轻。
"裁判"是怎么打分的?它从哪里学到"什么叫像人"?
查看参考答案
- 怎么打分:裁判是个会打分的网络,看机器人的一段动作就给个分,越像人分越高;这个分当奖励驱动机器人改动作。
- 从哪学:从大量人类动作片段里学会'人类动作长什么样'。
- 关键:裁判的'像人'标准完全来自参考数据——数据覆盖范围决定了它的审美上限。
假如人类动作数据里只有走路、没有跑步,这套办法能训出会跑的机器人吗?用类比解释为什么。
查看参考答案
- 结论:大概率不能训出'像人的跑'(也许瞎折腾出奇怪步态,但裁判不会给高分)。
- 理由:裁判的'像人'标准完全来自参考数据;数据里只有走,裁判眼里的高分 = 走得像真人;角色就算偶然做出跑步姿态,也会因偏离'走的分布'被压回去。
- 类比锚:印象派画家只临摹过肖像,画不出没见过的风景;或品酒师只尝过波尔多,尝不出'这杯像勃艮第'。
- 推论:裁判的审美上限 = 数据覆盖范围。
"通用基座"和"技能库"都在压缩同一批数据,它们的层次差在哪?
查看参考答案
- 技能库:把数据压成一组带标签的基础技能(离散/可指挥的小单元),策略选标签就能调用。
- 通用基座:在整个动捕库上预训练一个生成式大模型,把'行为分布'本身学下来,下游零样本迁移、不用重训。
- 层次差:技能库是'可索引的技能词汇表',通用基座是'覆盖全数据的生成式行为分布'——后者规模更大、适配更轻(推理+少量适配而非重训)。