PHC / UHC:一个策略,模仿「几乎所有」人类动作
🧠 一句话心智模型:以前教仿真人形模仿动作,是「一段参考训一个策略」(DeepMimic 式)——千段动作要千个策略。PHC 说:一个策略通吃整个 AMASS 动捕库(上万段)。而且它摔了能自己爬起来(fall recovery)——给噪声输入(视频估的姿势、文字生成的动作)也不会崩。这是 motor foundation 的雏形(只是当时没这么叫)。
🎯 为什么重要:从「一个策略一个动作」到「一个策略通吃」
DeepMimic 每段动作训一个 policy,不可扩展。PHC 在整个 AMASS(上万片段)上训一个 universal tracker,单 policy 模仿几乎任意片段,在 AMASS-Train* 上达 98.9% 成功率。UHC 进一步提出 universal motion representation,成为后续 retarget/teleop/BFM 的事实基座 motor policy。
核心矛盾:高 DoF 人形在仿真里容易摔/绊/偏离参考;用噪声姿势(视频/语言生成的)驱动更会摔。需要「容错 + 自恢复」。
💡 核心思想:大规模跟踪 + 渐进式 primitives + 跌倒恢复
图:PHC 一个策略通吃 AMASS + 跌倒恢复;UHC 提炼出 universal motion representation,成后续 teleop/BFM 基座。
🛠️ 关键设计
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| 大规模单策略跟踪 | 整个 AMASS 上训一个 tracker,而非每段一个 | 从「专策略」走向「通才」——motor foundation 雏形 |
| 渐进式 multiplicative primitives(PMCP) | 新动作技能「乘法式」叠加进已有策略,防灾难性遗忘 | 持续加技能时老技能不忘 |
| 容错 reward + fall recovery | reward 容忍偏离;专门训「从摔倒状态恢复」 | 噪声输入(视频/语言姿势)会致摔;能恢复才能用 |
| UHC:universal motion representation | 把 PHC 的能力提炼成可复用的 motion 表征 | 下游(teleop/retarget/BFM)直接当基座 motor policy |
🔮 关键反直觉:PHC 的贡献不在 98.9% 成功率,而在「单 policy 覆盖整个 AMASS + fall recovery」这个范式——它把 motor skill 从「一段动作一个策略」拔到「一个基座通吃所有动捕」,提前两年回答了 BFM 想问的问题。
📊 结果
| 维度 | 结果 |
|---|---|
| 规模 | 整个 AMASS(上万片段),无需外部稳定力 |
| 成功率 | AMASS-Train* 上 98.9%(无 RFC) |
| 容错 | 噪声姿势(视频/语言生成)下不崩,能恢复 |
| 影响 | UHC 成 H2O/OmniH2O/ExBody/HOVER/BFM 的共同基座 |
🌐 在领域中的位置
DeepMimic(一段一策略)→
AMP(风格 reward)→
PHC/UHC(单策略通吃 + 恢复)⭐→
HOVER → BFM → SONIC(motor foundation)
PHC/UHC 是 motor foundation 的雏形(被 BFM 正式命名前)。关联 T04 运动先验。
❓ 常见误区
PHC 和 BFM 什么关系?
PHC 是「大规模 tracker」(task-specific,模仿给定参考);BFM 是「生成式行为分布」(下游设 mask 推断)。PHC 是 BFM 的前身/基座——BFM 站在 PHC/UHC 肩上。
「98.9%」是模仿得像不像?
是「能不能跟住参考而不摔倒/掉队」(平均偏差 <0.5m 算成功)。不是逐帧几何精度。