FAST:给人形机器人一个「保命优先」的全身控制器
🎯 为什么重要:「分布漂移」是人形 WBC 的头号杀手
2024–2026 年,基于 motion tracking 的人形 WBC(OmniH2O、ExBody、GMT、TWIST2 等)已能跟踪 AMASS 等干净数据集里的动作。但真实部署遇到的是杂乱来源的动作:
💡 核心思想:三段式管线——数据 → MoE 底座 → 残差适应
FAST 的整体设计是「先训一个保命的通才,再用小残差专精」。底座用 MoE 处理动作多样性,残差用 Parseval + KL 双绳拴住。
🛠️ 四个让残差适应「稳」的关键设计
| 设计 | 怎么做 | 为什么必要 |
|---|---|---|
| ① 残差参数化 | 底座 π_b 完全冻结;只训 3 层 MLP 的 π_r;最终动作 $a_t = a^b_t + a^r_t$ | 低数据场景下端到端微调贵且易塌;残差把要学的参数压到最小 |
| ② Parseval 正则 | 对残差所有线性层(除输出层)加 $\|W^\top W - sI\|_F^2$,鼓励列向量近似正交 | 约束谱范数 → Lipschitz 连续(论文 Prop.3.1 给证明);让残差对状态扰动不敏感,优化更稳 |
| ③ KL 约束 | 软约束 $D_{KL}(\pi(\cdot|s_t) \| \pi_b(\cdot|s_t))$,加到总 loss 里 | 残差只在新动作上训,没有老动作监督,必须显式拴住防止 drift(论文 Prop.3.2 给出残差动作幅值的界) |
| ④ CoM-Aware 控制 | 把参考动作的 CoM / CoP 加进观测;当 ref 的 CoM-CoP 距离 > 阈值时,动态降权 tracking 奖励,并加显式 stability 奖励(鼓励 actual CoM 靠近 CoP) | 野路子动作可能物理不可行;硬追会摔。"先看动作危险程度,决定追几分"——把追踪精度换稳定性 |
Parseval 限制残差在参数空间里"光滑"——输入稍微变一点,输出不会跳。这是局部光滑性。
KL 限制残差在分布空间里"贴近底座"——输出的动作分布不能离底座太远。这是统计稳定性。
两者合力 = 既光滑、又不漂。论文 Proposition 3.1 + 3.2 给出形式化保证。结果是:残差能学新动作,但底座的老能力不会被冲掉。
📊 关键结果:训练分布内稳、OOD 上强、保能力不忘
| 方法 | AMASS(训练集)Succ ↑ | MotionX(OOD 测试)Succ ↑ | 备注 |
|---|---|---|---|
| GMT | 77.55% | 38.91% | 此前 SOTA 通用 tracker |
| TWIST2 | 72.61% | 31.82% | 遥操派 SOTA |
| FAST(本文) | 87.14% | 51.46% | 底座 zero-shot 即优于两者 |
| CoM-Aware 消融 | 分布内 Empd ↓ | 分布内 Slip ↓ | 分布内 Succ ↑ | OOD Succ ↑ |
|---|---|---|---|---|
| FAST w.o. CoM | 0.171 | 1.472 | 84.15% | 79.07% |
| FAST(完整) | 0.156 | 0.909 | 97.56% | 86.63% |
1. 底座 zero-shot:AMASS 上 +10%、MotionX 上 +13% 绝对提升,证明 CoM-Aware + MoE 本身就比 GMT/TWIST2 强。
2. CoM-Aware 把高动态动作的成功率从 84% 拉到 97.5%(分布内)、从 79% 拉到 86.6%(OOD);分布内 Slip 降近四成(1.472→0.909)。
3. 残差适应比"从头训"和"全微调"都更快收敛,且 AMASS 上能力不退化(残差-only 退化明显,加 Parseval + KL 后基本不退)。
4. 真机支持:zero-shot 高动态追踪、视频估计动作、text-to-motion、实时遥操四种来源都跑通。
🌐 在领域中的位置
FAST 在「规模化」和「专精化」之间选了第三条路——通才底座 + 可拴住的残差。它和 SONIC 的「堆数据堆模型」是两条互补路线:规模化提 zero-shot 上限,FAST 提低成本的 OOD 适应。它的数学保证(Prop. 3.1 / 3.2)也在这类工作中少见——给了残差适应的理论稳定性。关联线索:motion_prior / 人形 WBC 谱系。
❓ 常见误区
FAST 是一个新模型架构吗?
不完全是。它的底座是 MoE + CoM-Aware(架构上和 GMT、PHC 系列接近);真正的新意在「底座 + 残差 + 双正则」的适应方案——即"如何用最小代价让通才学新动作"。核心贡献是适应方法而非底座本身。
CoM-Aware 为什么有效?
因为它动态权衡"追踪 vs 保命"。当参考动作的 CoM-CoP 距离过大(说明动作"危险"),自动降权 tracking 奖励——机器人就不去硬追,而是保守执行。同时显式 stability 奖励把 actual CoM 拉回 CoP 上方,主动维持平衡。等于给策略装了个"安全阀"。
Parseval 正则和 dropout、weight decay 不一样吗?
不一样。weight decay 鼓励权重小;Parseval 鼓励权重列向量正交($W^\top W \approx sI$)。直接效果是限制层的谱范数,从而 Lipschitz 连续。这是从泛化理论 / Lipschitz 正则化里借来的工具,论文 Prop. 3.1 形式化了它在残差上的作用。
它在真机上能跑哪些来源的动作?
论文 Figure 1 演示了四类:(i)zero-shot 遥操(高动态追踪);(ii)视频动作估计(YouTube 单目视频里的人转成机器人动作);(iii)text-to-motion(文本生成动作再执行);(iv)残差适应(低质量或 OOD 动作快速微调)。说明它面向的是"动作来源多样"的真实部署场景。