枢纽
上真机
物理感知
实时
输入模态proprioception

FAST:给人形 WBC 一个「会微调的脑子」和「会保守的身子」

Zepeng Wang, Jiangxing Wang, Shiqing Yao 等(武汉大学 + BeingBeyond + 北京大学)。arXiv:2602.11929,2026 年 2 月。 项目页 · humanoid WBCresidual policymotion tracking

🧠 一句话心智模型:人形全身控制器面对两件麻烦事——① 动作参考太激进时别硬跟(会摔)② 没见过的动作怎么快速适配(不能忘旧)。FAST 给了两个对应的部件:CoM-Aware 控制让策略在「激进参考」前自动放松追踪、优先保平衡;Parseval + KL 双正则的残差策略冻结主网络、只学一个小补丁,几步就能跟新风格,还不破坏老本事

🎯 为什么重要:WBC 走到了「泛化 vs 部署」的两难

人形全身控制(WBC)最近两年进展很快——ExBody、OmniH2O、GMT、SONIC 一路把「能追踪的动作分布」越扩越大。但论文 §1 指出一个结构性矛盾

泛化 vs 部署的两难
要泛化,直觉是「把模型和数据堆大」——SONIC 就是这么做的。但人形部署有硬约束: onboard 算力有限、控制频率要高(>100Hz)、推理延迟直接吃掉稳定性。
→ 大模型在仿真里漂亮,真机推不动;小模型推得动,但一遇到训练分布外的动作(视频估计 / 文本生成 / 在线遥操)就崩。

FAST 走的是「不堆大,学快调」路线——预训练一个够强的通用 WBC(MoE + CoM-Aware),然后面对新动作分布时只微调一个轻量残差头,几步数据就能跟上。论文标题里的 FAST = Fast Adaptation + Stable Tracking,正好对应这两个部件。

任务专属训练 每个技能训一个策略 · 无法跨任务 · 人工 reward 重 不可扩展 Scaling 派(SONIC) 数据/模型堆大 · 仿真里强 · onboard 推不动 真机延迟大 FAST:快适配 ✅ 小通用模型 + 残差微调 · 推理快(MoE+MLP) · 面对新动作快速适配 不破坏旧技能
图 1:FAST 在「泛化」和「部署」之间选了第三条路——不靠堆大,靠快调。

💡 核心思想:保守追踪 + 正则化残差适配

FAST 是个三阶段框架(论文 Fig.2):① 整理动捕数据集并附加物理信号;② 训练通用 WBC(MoE + CoM-Aware);③ Parseval-KL 残差适配。

① 动作数据整理 AMASS / OMOMO / LaFan1 + CoM / CoP / contact mask ② 通用 WBC(MoE + CoM-Aware) 多个 MLP 专家 + Gating 网络 → 不同动作用不同专家 CoM-CoP 距离超阈值 → 自动降低追踪权重 ③ 残差快适配 $a_t = a^b_t + a^r_t$ 主网络冻结 + Parseval 正则 + KL 约束 CoM-Aware 控制(保守追踪) 参考 CoM-CoP 距离 d_ref 若 d_ref > 阈值 τ: → w_track ↓(放松追踪) → r_stability ↑(奖励平衡) Parseval + KL 双正则 Parseval:W^T W ≈ sI → 特征方向近正交、Lipschitz 有界 KL:D_KL(π || π_b) ≤ ε → 新策略不偏离主策略分布
图 2:FAST 三阶段。CoM-Aware 解决「激进参考会摔」,Parseval+KL 解决「快适配会忘旧」。

论文 §3.3 给了两个 proposition 把设计安在理论上

$$\text{Prop 3.1:}\quad\mathrm{Lip}(\pi_r)\leq\prod_{l=1}^{L-1}\sqrt{s+\epsilon_l}\,\|W_L\|_2$$

$$\text{Prop 3.2:}\quad D_{KL}(\pi\|\pi_b)\leq\epsilon\;\Rightarrow\;\|\mu_r(s)\|_2\leq\sqrt{2\epsilon\,\lambda_{\max}(\Sigma)}$$

翻译:Parseval 约束残差对状态扰动不敏感(Lipschitz 有界);KL 约束残差对主策略偏离有限。两者一起保证「局部光滑 + 全局不漂」。

🛠️ 三个工程关键:MoE、CoM 权重、双正则

设计心智为什么必要
① MoE 策略架构多个 MLP 专家 + Gating,按状态加权融合不同动作动态差异巨大(走路 vs 踢腿),单网络互相干扰;MoE 让不同专家专攻不同动态,gating 负责混合
② CoM-Aware 自适应追踪权重$w_{\text{track}} = \mathrm{clip}(\exp(-(d_{\text{ref}}-\tau)/\kappa),\;w_{\min},\;1)$参考动作不安全时(如 CoM 离 CoP 太远),硬跟就摔——指数衰减让追踪权重平滑下降到 $w_{\min}$,留出平衡余量
③ 残差 + Parseval + KL主网络冻结,残差网络只学 $\Delta a$;Parseval 限表达力,KL 限偏离度纯残差会漂移(论文 Fig.3:residual-only 在 AMASS 上明显退化);Parseval 防优化不稳,KL 防灾难性遗忘——双保险
🔮 直觉:为什么是「保守追踪」而非「严格追踪」?
真实部署里,参考动作本来就脏——文本生成的动作可能物理上不可达,视频估计的动作有噪声,在线遥操作有时延。如果策略硬跟,机器人就替参考「付代价」——摔。CoM-Aware 把这个抉择显式化:参考安全就跟,不安全就保平衡优先。这正是「稳定」的来源。

📊 结果:训练分布内/外都赢,残差适配不破坏旧本事

实验 1(基模型对比,Table 1):与 GMT、TWIST2(两个 SOTA 通用追踪器)对比,AMASS 训练分布内 + MotionX OOD:

MethodAMASS Succ% ↑AMASS MPKPE ↓MotionX (OOD) Succ% ↑MotionX MPKPE ↓
GMT77.550.31938.910.232
TWIST272.610.38831.820.229
FAST(本文)87.140.12351.460.212
关键洞察:FAST 在分布内(+10pt)和 OOD(+12.5pt)成功率都最高。全局关键点误差 MPKPE 显著更低(0.123 vs 0.319)——论文指出这反映 FAST 牺牲一点局部精度换取全局稳定。基线在 OOD 上的局部误差低,是因为它们早早摔了,剩下的「成功片段」短,统计上偏向容易片段。

实验 2(CoM-Aware 消融,Table 2):在高动态动作子集上对比有无 CoM-Aware:

VariantIn-dist Succ% ↑In-dist Slip ↓OOD Succ% ↑OOD Slip ↓
FAST w/o CoM84.151.47279.071.298
FAST(完整)97.560.90986.630.995
关键数字:CoM-Aware 在高动态任务上把成功率从 84% 拉到 97.56%(分布内)、79% 拉到 86.63%(OOD);Slip(支撑脚滑动速度)也几乎减半。这是「保守追踪」最直观的收益。

实验 3(残差适配消融,Table 3 + Fig.3):在 LaFan1 上适配、同时在 AMASS 上测保留。无正则的残差在 AMASS 上明显退化(succ 掉、误差升);FAST 在 LaFan1 上 90.60% 成功率最高,AMASS 上仍保持 96.92%。Parseval 和 KL 的贡献互补——只用一个就不如两个一起。

实验 4(真机部署):Unitree G1 上零样本跑高动态(侧踢、单腿蹲)、实时遥操作(走、跳、武术、抓物);并展示残差适配让文本生成 + 单目视频估计这种低质量参考也能稳定执行(单腿跳、360 跳跃、复杂舞蹈)。

🌐 在领域中的位置

任务专属 WBC(DeepMimic 派) 通用 WBC(OmniH2O / ExBody / GMT) Scaling 通用 WBC(SONIC) FAST(通用 + 快适配残差)⭐

FAST 与 ASAP(残差 sim2real)、ResMimic、UniTracker(frozen + 残差 decoder)同属「残差适配派」,但 FAST 的特点是双正则 + CoM 稳定——前者解决适配的「漂」,后者解决参考的「脏」。关联:ASAPBeyondMimicHOVERSONIC

❓ 常见误区

FAST 是个新 WBC 架构吗?

不全是。基模型用 MoE(前人已有),创新在两个附件——CoM-Aware 改 reward / observation;残差策略改适配流程。论文卖点不是「新架构」,而是「通用 WBC + 快适配这套组合的工程化」。

「残差策略」和「全参数 fine-tune」哪个更好?

论文 Fig.3 显示:在目标分布上 full-FT 和 FAST 都能学好;但 full-FT 在源分布(AMASS)上掉得更多。FAST 的核心收益是「新本事进得来,老本事不丢」——这是 KL 约束的直接作用。

Parseval 正则是不是只是个 Lipschitz 约束?

是。但论文的妙处在于:把 Lipschitz 用「近似正交」这一几何条件实现——既限了敏感度,又鼓励特征方向多样,不容易陷入局部最优。Prop 3.1 给了形式化保证。

CoM-Aware 会让策略「不跟参考」吗?

会,但故意的。激进参考时,硬跟会摔;CoM-Aware 选择「放松追踪、保平衡」——这是把人面对不可达动作时的直觉(「我大概模仿一下,但不能真照做」)显式编码进 reward。Table 2 证明这反而把成功率拉高了。

它能跑多久?真机延迟如何?

论文 §D.2 给了部署细节:高层策略推理 50 Hz、低层 PD 控制 500 Hz,且全部模块(神经策略 + 状态估计)都部署在机载计算机上。架构上 MoE 每步对所有专家加权求和(非 top-k 路由),残差头是 3 层 MLP——刻意避开大模型,正是为了满足真机高频率闭环的延迟约束。这也是它选「不堆大」路线的现实理由。