FAST:给人形 WBC 一个「会微调的脑子」和「会保守的身子」
🎯 为什么重要:WBC 走到了「泛化 vs 部署」的两难
人形全身控制(WBC)最近两年进展很快——ExBody、OmniH2O、GMT、SONIC 一路把「能追踪的动作分布」越扩越大。但论文 §1 指出一个结构性矛盾:
要泛化,直觉是「把模型和数据堆大」——SONIC 就是这么做的。但人形部署有硬约束: onboard 算力有限、控制频率要高(>100Hz)、推理延迟直接吃掉稳定性。
→ 大模型在仿真里漂亮,真机推不动;小模型推得动,但一遇到训练分布外的动作(视频估计 / 文本生成 / 在线遥操)就崩。
FAST 走的是「不堆大,学快调」路线——预训练一个够强的通用 WBC(MoE + CoM-Aware),然后面对新动作分布时只微调一个轻量残差头,几步数据就能跟上。论文标题里的 FAST = Fast Adaptation + Stable Tracking,正好对应这两个部件。
💡 核心思想:保守追踪 + 正则化残差适配
FAST 是个三阶段框架(论文 Fig.2):① 整理动捕数据集并附加物理信号;② 训练通用 WBC(MoE + CoM-Aware);③ Parseval-KL 残差适配。
论文 §3.3 给了两个 proposition 把设计安在理论上:
$$\text{Prop 3.1:}\quad\mathrm{Lip}(\pi_r)\leq\prod_{l=1}^{L-1}\sqrt{s+\epsilon_l}\,\|W_L\|_2$$
$$\text{Prop 3.2:}\quad D_{KL}(\pi\|\pi_b)\leq\epsilon\;\Rightarrow\;\|\mu_r(s)\|_2\leq\sqrt{2\epsilon\,\lambda_{\max}(\Sigma)}$$
翻译:Parseval 约束残差对状态扰动不敏感(Lipschitz 有界);KL 约束残差对主策略偏离有限。两者一起保证「局部光滑 + 全局不漂」。
🛠️ 三个工程关键:MoE、CoM 权重、双正则
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| ① MoE 策略架构 | 多个 MLP 专家 + Gating,按状态加权融合 | 不同动作动态差异巨大(走路 vs 踢腿),单网络互相干扰;MoE 让不同专家专攻不同动态,gating 负责混合 |
| ② CoM-Aware 自适应追踪权重 | $w_{\text{track}} = \mathrm{clip}(\exp(-(d_{\text{ref}}-\tau)/\kappa),\;w_{\min},\;1)$ | 参考动作不安全时(如 CoM 离 CoP 太远),硬跟就摔——指数衰减让追踪权重平滑下降到 $w_{\min}$,留出平衡余量 |
| ③ 残差 + Parseval + KL | 主网络冻结,残差网络只学 $\Delta a$;Parseval 限表达力,KL 限偏离度 | 纯残差会漂移(论文 Fig.3:residual-only 在 AMASS 上明显退化);Parseval 防优化不稳,KL 防灾难性遗忘——双保险 |
真实部署里,参考动作本来就脏——文本生成的动作可能物理上不可达,视频估计的动作有噪声,在线遥操作有时延。如果策略硬跟,机器人就替参考「付代价」——摔。CoM-Aware 把这个抉择显式化:参考安全就跟,不安全就保平衡优先。这正是「稳定」的来源。
📊 结果:训练分布内/外都赢,残差适配不破坏旧本事
实验 1(基模型对比,Table 1):与 GMT、TWIST2(两个 SOTA 通用追踪器)对比,AMASS 训练分布内 + MotionX OOD:
| Method | AMASS Succ% ↑ | AMASS MPKPE ↓ | MotionX (OOD) Succ% ↑ | MotionX MPKPE ↓ |
|---|---|---|---|---|
| GMT | 77.55 | 0.319 | 38.91 | 0.232 |
| TWIST2 | 72.61 | 0.388 | 31.82 | 0.229 |
| FAST(本文) | 87.14 | 0.123 | 51.46 | 0.212 |
实验 2(CoM-Aware 消融,Table 2):在高动态动作子集上对比有无 CoM-Aware:
| Variant | In-dist Succ% ↑ | In-dist Slip ↓ | OOD Succ% ↑ | OOD Slip ↓ |
|---|---|---|---|---|
| FAST w/o CoM | 84.15 | 1.472 | 79.07 | 1.298 |
| FAST(完整) | 97.56 | 0.909 | 86.63 | 0.995 |
实验 3(残差适配消融,Table 3 + Fig.3):在 LaFan1 上适配、同时在 AMASS 上测保留。无正则的残差在 AMASS 上明显退化(succ 掉、误差升);FAST 在 LaFan1 上 90.60% 成功率最高,AMASS 上仍保持 96.92%。Parseval 和 KL 的贡献互补——只用一个就不如两个一起。
实验 4(真机部署):Unitree G1 上零样本跑高动态(侧踢、单腿蹲)、实时遥操作(走、跳、武术、抓物);并展示残差适配让文本生成 + 单目视频估计这种低质量参考也能稳定执行(单腿跳、360 跳跃、复杂舞蹈)。
🌐 在领域中的位置
FAST 与 ASAP(残差 sim2real)、ResMimic、UniTracker(frozen + 残差 decoder)同属「残差适配派」,但 FAST 的特点是双正则 + CoM 稳定——前者解决适配的「漂」,后者解决参考的「脏」。关联:ASAP、BeyondMimic、HOVER、SONIC。
❓ 常见误区
FAST 是个新 WBC 架构吗?
不全是。基模型用 MoE(前人已有),创新在两个附件——CoM-Aware 改 reward / observation;残差策略改适配流程。论文卖点不是「新架构」,而是「通用 WBC + 快适配这套组合的工程化」。
「残差策略」和「全参数 fine-tune」哪个更好?
论文 Fig.3 显示:在目标分布上 full-FT 和 FAST 都能学好;但 full-FT 在源分布(AMASS)上掉得更多。FAST 的核心收益是「新本事进得来,老本事不丢」——这是 KL 约束的直接作用。
Parseval 正则是不是只是个 Lipschitz 约束?
是。但论文的妙处在于:把 Lipschitz 用「近似正交」这一几何条件实现——既限了敏感度,又鼓励特征方向多样,不容易陷入局部最优。Prop 3.1 给了形式化保证。
CoM-Aware 会让策略「不跟参考」吗?
会,但故意的。激进参考时,硬跟会摔;CoM-Aware 选择「放松追踪、保平衡」——这是把人面对不可达动作时的直觉(「我大概模仿一下,但不能真照做」)显式编码进 reward。Table 2 证明这反而把成功率拉高了。
它能跑多久?真机延迟如何?
论文 §D.2 给了部署细节:高层策略推理 50 Hz、低层 PD 控制 500 Hz,且全部模块(神经策略 + 状态估计)都部署在机载计算机上。架构上 MoE 每步对所有专家加权求和(非 top-k 路由),残差头是 3 层 MLP——刻意避开大模型,正是为了满足真机高频率闭环的延迟约束。这也是它选「不堆大」路线的现实理由。