枢纽
上真机
物理感知
实时
输入模态proprioception

FAST:给人形机器人一个「保命优先」的全身控制器

Zepeng Wang, Jiangxing Wang, Shiqing Yao 等(武汉大学 + BeingBeyond + 北京大学)。arXiv:2602.11929,2026 年 2 月。 项目页 · motion_priorhumanoid WBCresidual policyfast adaptation

🧠 一句话心智模型:人形机器人学动作的痛点是——预训练控制器见到"野路子"动作(YouTube 视频、文本生成的动作)就摔。FAST 不去重新训练一个大模型,而是冻结预训练底座只训一个 3 层 MLP 的小残差,再用两条数学绳(Parseval 正则 + KL 约束)把它拴在底座附近——既能快速适应新动作,又不会忘掉老能力。同时把质心(CoM)写进观测和奖励,让机器人在追乱动作时自动"保守一些",优先保命。

🎯 为什么重要:「分布漂移」是人形 WBC 的头号杀手

2024–2026 年,基于 motion tracking 的人形 WBC(OmniH2O、ExBody、GMT、TWIST2 等)已能跟踪 AMASS 等干净数据集里的动作。但真实部署遇到的是杂乱来源的动作:

核心矛盾:动作参考来源五花八门——离线动捕、实时遥操、文本生成(text-to-motion)、单目视频估计——质量、噪声、物理合理性都不同。在训练分布外的动作上,现有控制器频繁跟踪失败甚至摔倒。而机器人有低延迟、高频率的硬约束,又不能用超大模型去 brute-force 覆盖所有动作。
暴力扩大数据 / 模型 SONIC 等路线 ✓ zero-shot 泛化好 ✗ 模型大、推理慢 ✗ 低延迟控制不能忍 ✗ 算力 / 功耗受限 任务专用训练 每来一个动作就重训 ✓ 性能上限高 ✗ 不 scalable ✗ 需任务相关 reward ✗ 长尾覆盖不了 Fast Adaptation(FAST)✅ 预训练 + 小残差快速适应 ✓ 模型小,部署友好 ✓ 几步训练就适应 ✓ 不忘老能力 ✓ zero-shot 也强
图 1:三条应对分布漂移的路线对比(论文 §1)。FAST 选了第三条——「预训练 + 轻量残差」。

💡 核心思想:三段式管线——数据 → MoE 底座 → 残差适应

FAST 的整体设计是「先训一个保命的通才,再用小残差专精」。底座用 MoE 处理动作多样性,残差用 Parseval + KL 双绳拴住。

① 动作数据制备 AMASS / OMOMO / 自采 MoCap → SMPL 表示 → 人到机器人 retarget → PHC 过滤物理不可行动作 数据增强: · 全局速度调整 · 下肢关节扰动 附加:CoM / CoP / 接触 mask ② CoM-Aware MoE 底座 MoE:多个专家 MLP + 门控 不同动作由不同专家负责 PPO 训练 CoM-Aware: · 观测加 CoM / CoP · 奖励动态降权追踪  (CoM-CoP 距离 > 阈值时) · 显式 stability 奖励 →「保守追踪」+「保命优先」 ③ Parseval 残差适应 冻结底座 π_b 训小残差 π_r(3 层 MLP) a_t = a_b + a_r 两条数学绳: · Parseval:W^T W ≈ sI  (特征近似正交) · KL:π(·|s) 靠近 π_b(·|s)  (分布不漂移) → 既能学新动作又不忘老的
图 2:FAST 三段管线(论文 Figure 2 还原)。数据加 CoM 信号;底座 MoE 学动作多样性 + CoM-Aware 保命;遇到新分布只训小残差。

🛠️ 四个让残差适应「稳」的关键设计

设计怎么做为什么必要
① 残差参数化底座 π_b 完全冻结;只训 3 层 MLP 的 π_r;最终动作 $a_t = a^b_t + a^r_t$低数据场景下端到端微调贵且易塌;残差把要学的参数压到最小
② Parseval 正则对残差所有线性层(除输出层)加 $\|W^\top W - sI\|_F^2$,鼓励列向量近似正交约束谱范数 → Lipschitz 连续(论文 Prop.3.1 给证明);让残差对状态扰动不敏感,优化更稳
③ KL 约束软约束 $D_{KL}(\pi(\cdot|s_t) \| \pi_b(\cdot|s_t))$,加到总 loss 里残差只在新动作上训,没有老动作监督,必须显式拴住防止 drift(论文 Prop.3.2 给出残差动作幅值的界)
④ CoM-Aware 控制把参考动作的 CoM / CoP 加进观测;当 ref 的 CoM-CoP 距离 > 阈值时,动态降权 tracking 奖励,并加显式 stability 奖励(鼓励 actual CoM 靠近 CoP)野路子动作可能物理不可行;硬追会摔。"先看动作危险程度,决定追几分"——把追踪精度换稳定性
🔮 直觉:为什么 Parseval + KL 互补?
Parseval 限制残差在参数空间里"光滑"——输入稍微变一点,输出不会跳。这是局部光滑性
KL 限制残差在分布空间里"贴近底座"——输出的动作分布不能离底座太远。这是统计稳定性
两者合力 = 既光滑、又不漂。论文 Proposition 3.1 + 3.2 给出形式化保证。结果是:残差能学新动作,但底座的老能力不会被冲掉。

📊 关键结果:训练分布内稳、OOD 上强、保能力不忘

方法AMASS(训练集)Succ ↑MotionX(OOD 测试)Succ ↑备注
GMT77.55%38.91%此前 SOTA 通用 tracker
TWIST272.61%31.82%遥操派 SOTA
FAST(本文)87.14%51.46%底座 zero-shot 即优于两者
CoM-Aware 消融分布内 Empd ↓分布内 Slip ↓分布内 Succ ↑OOD Succ ↑
FAST w.o. CoM0.1711.47284.15%79.07%
FAST(完整)0.1560.90997.56%86.63%
关键观察(数据来自论文 Table 1 / Table 2 / Figure 3):
1. 底座 zero-shot:AMASS 上 +10%、MotionX 上 +13% 绝对提升,证明 CoM-Aware + MoE 本身就比 GMT/TWIST2 强。
2. CoM-Aware 把高动态动作的成功率从 84% 拉到 97.5%(分布内)、从 79% 拉到 86.6%(OOD);分布内 Slip 降近四成(1.472→0.909)。
3. 残差适应比"从头训"和"全微调"都更快收敛,且 AMASS 上能力不退化(残差-only 退化明显,加 Parseval + KL 后基本不退)。
4. 真机支持:zero-shot 高动态追踪、视频估计动作、text-to-motion、实时遥操四种来源都跑通。

🌐 在领域中的位置

AMP / ASE(技能专用) PHC / OmniH2O / ExBody(motion tracking 通才) GMT / TWIST2(通用 tracker) FAST(通才 + 残差快适应)⭐ SONIC(规模化派)

FAST 在「规模化」和「专精化」之间选了第三条路——通才底座 + 可拴住的残差。它和 SONIC 的「堆数据堆模型」是两条互补路线:规模化提 zero-shot 上限,FAST 提低成本的 OOD 适应。它的数学保证(Prop. 3.1 / 3.2)也在这类工作中少见——给了残差适应的理论稳定性。关联线索:motion_prior / 人形 WBC 谱系。

❓ 常见误区

FAST 是一个新模型架构吗?

不完全是。它的底座是 MoE + CoM-Aware(架构上和 GMT、PHC 系列接近);真正的新意在「底座 + 残差 + 双正则」的适应方案——即"如何用最小代价让通才学新动作"。核心贡献是适应方法而非底座本身。

CoM-Aware 为什么有效?

因为它动态权衡"追踪 vs 保命"。当参考动作的 CoM-CoP 距离过大(说明动作"危险"),自动降权 tracking 奖励——机器人就不去硬追,而是保守执行。同时显式 stability 奖励把 actual CoM 拉回 CoP 上方,主动维持平衡。等于给策略装了个"安全阀"。 Parseval 正则和 dropout、weight decay 不一样吗?

不一样。weight decay 鼓励权重小;Parseval 鼓励权重列向量正交($W^\top W \approx sI$)。直接效果是限制层的谱范数,从而 Lipschitz 连续。这是从泛化理论 / Lipschitz 正则化里借来的工具,论文 Prop. 3.1 形式化了它在残差上的作用。 它在真机上能跑哪些来源的动作?

论文 Figure 1 演示了四类:(i)zero-shot 遥操(高动态追踪);(ii)视频动作估计(YouTube 单目视频里的人转成机器人动作);(iii)text-to-motion(文本生成动作再执行);(iv)残差适应(低质量或 OOD 动作快速微调)。说明它面向的是"动作来源多样"的真实部署场景。