里程碑
数据集AMASS
物理感知
实时
输入模态proprioception

PHC / UHC:一个策略,模仿「几乎所有」人类动作

Zhengyi Luo 等(CMU + Meta)。PHC: arXiv:2305.06456 (ICCV 2023);UHC: arXiv:2310.04582 (ICLR 2024 Spotlight)。 motion_priorlocomotionT04 运动先验

🧠 一句话心智模型:以前教仿真人形模仿动作,是「一段参考训一个策略」(DeepMimic 式)——千段动作要千个策略。PHC 说:一个策略通吃整个 AMASS 动捕库(上万段)。而且它摔了能自己爬起来(fall recovery)——给噪声输入(视频估的姿势、文字生成的动作)也不会崩。这是 motor foundation 的雏形(只是当时没这么叫)。

🎯 为什么重要:从「一个策略一个动作」到「一个策略通吃」

DeepMimic 每段动作训一个 policy,不可扩展。PHC 在整个 AMASS(上万片段)上训一个 universal tracker,单 policy 模仿几乎任意片段,在 AMASS-Train* 上达 98.9% 成功率。UHC 进一步提出 universal motion representation,成为后续 retarget/teleop/BFM 的事实基座 motor policy

核心矛盾:高 DoF 人形在仿真里容易摔/绊/偏离参考;用噪声姿势(视频/语言生成的)驱动更会摔。需要「容错 + 自恢复」。

💡 核心思想:大规模跟踪 + 渐进式 primitives + 跌倒恢复

AMASS 上万动捕片段 (含噪声/跌倒) PHC universal tracker 渐进式 multiplicative primitives(防遗忘) + 容错 reward + fall recovery 单策略通吃 98.9% 成功率 摔了自恢复 UHC universal motion representation → teleop/BFM 基座
图:PHC 一个策略通吃 AMASS + 跌倒恢复;UHC 提炼出 universal motion representation,成后续 teleop/BFM 基座。

🛠️ 关键设计

设计心智为什么必要
大规模单策略跟踪整个 AMASS 上训一个 tracker,而非每段一个从「专策略」走向「通才」——motor foundation 雏形
渐进式 multiplicative primitives(PMCP)新动作技能「乘法式」叠加进已有策略,防灾难性遗忘持续加技能时老技能不忘
容错 reward + fall recoveryreward 容忍偏离;专门训「从摔倒状态恢复」噪声输入(视频/语言姿势)会致摔;能恢复才能用
UHC:universal motion representation把 PHC 的能力提炼成可复用的 motion 表征下游(teleop/retarget/BFM)直接当基座 motor policy
🔮 关键反直觉:PHC 的贡献不在 98.9% 成功率,而在「单 policy 覆盖整个 AMASS + fall recovery」这个范式——它把 motor skill 从「一段动作一个策略」拔到「一个基座通吃所有动捕」,提前两年回答了 BFM 想问的问题

📊 结果

维度结果
规模整个 AMASS(上万片段),无需外部稳定力
成功率AMASS-Train* 上 98.9%(无 RFC)
容错噪声姿势(视频/语言生成)下不崩,能恢复
影响UHC 成 H2O/OmniH2O/ExBody/HOVER/BFM 的共同基座

🌐 在领域中的位置

DeepMimic(一段一策略) AMP(风格 reward) PHC/UHC(单策略通吃 + 恢复)⭐ HOVER → BFM → SONIC(motor foundation)

PHC/UHC 是 motor foundation 的雏形(被 BFM 正式命名前)。关联 T04 运动先验

❓ 常见误区

PHC 和 BFM 什么关系?

PHC 是「大规模 tracker」(task-specific,模仿给定参考);BFM 是「生成式行为分布」(下游设 mask 推断)。PHC 是 BFM 的前身/基座——BFM 站在 PHC/UHC 肩上。

「98.9%」是模仿得像不像?

是「能不能跟住参考而不摔倒/掉队」(平均偏差 <0.5m 算成功)。不是逐帧几何精度。