枢纽
物理感知
输入模态proprioception

BFM 综述:人形机器人的「下一个底层操作系统」

Mingqi Yuan, Tao Yu, Wenqi Ge, Xiuyong Yao 等(港理工 + LimX Dynamics + 宁波数智院 + 港大 + EPFL + 南科大 + 浙大等)。IEEE TPAMI, arXiv:2506.20487v5, 2025/2026。 awesome-bfm-papers · surveyhumanoid WBCfoundation model

🧠 一句话心智模型:让人形机器人控制走「LLM 的老路」——先用海量交互数据预训练一个「通用底层控制器」(BFM, Behavior Foundation Model),它掌握一大堆原始技能;到了具体任务上,零样本极少量微调就能上手。本综述是第一篇系统盘点 BFM 的文章,把零散的 Motivo/HugWBC/HOVER/SONIC 等工作收拢成一张清晰的「预训练—适配」分类图。

🎯 为什么重要:人形机器人控制「重训一次」的代价太高

过去几年人形机器人火了,但每个新任务都要付出巨大代价

三类范式的痛点(论文 Fig.2 演化图):
  • 传统模型法(MPC / WBOSC, 2006-):物理建模 + QP 求解。问题:调参靠经验、实时性差、动态技能(后空翻)几乎做不了、轻微一推就倒。
  • RL/IL 任务专属法(2018-):DeepMimic、AMP 等。问题:RL 样本效率极低(百万次交互)、奖励设计脆弱、sim2real gap;IL 受限于演示数据收集和演示者偏差。每个新任务都要重训
  • 行为基础模型 BFM(2024-):大规模预训练 + 快速适配,把 LLM「训练一次,多任务复用」的范式搬过来。

综述的关键判断是:BFM 不是又一个新算法,而是一种工程范式的转折点——就像 NLP 从「每个任务训一个 BERT」转到「一个 GPT 走天下」。它把「机器人控制软件」从「一次性科研项目」变成「可迭代、可复用、可规模化的产品」。

💡 核心思想:BFM = 预训练 + 适配 两阶段

所有 BFM 工作都可以装进一个统一框架:先用大规模行为数据训练通用底层,再用轻量适配让它在具体任务上工作。综述把「预训练」和「适配」各分成三类:

预训练(学习通用行为先验) ① 目标条件学习 外部 reward / mocap 跟踪 代表:DeepMimic, ASE, CALM, HugWBC, HOVER, MaskedMimic, SONIC, BFM4Humanoid ② 内在奖励驱动 自监督 / 好奇心 / 技能发现 代表:ICM, DIAYN, RND, APS, ProtoRL, RE3, ODPP ③ 前后向表征学习(FB) reward-free 转移数据 代表:FB, FB-IL, Motivo, BFM-Zero(首个真机部署) Behavior Foundation Model 适配(具体任务上手) 微调 FFT / LoRA / ReLA / LoLA / TaskTokens 层级控制 LLM/Diffusion 规划 + BFM 执行(CLoSD, UniHSI, LangWBC)
图 1:BFM 的统一框架(论文 Fig.3 浓缩版)。预训练分三类,适配分两条路。所有 BFM 工作都能在这张图上找到位置。

🛠️ 三种预训练范式:外驱 / 内驱 / 无 reward

范式信号来源核心思路代表工作
① 目标条件学习外部 reward 或 mocap 跟踪目标给策略一个明确的「目标」(pose / 速度 / 关键帧),用 RL 学「达到目标的通用技能」DeepMimic(跟踪一段动作)、ASE/CALM(对抗 IL 学技能空间)、HugWBC(命令空间跟踪)、MaskedMimic(部分目标 inpainting)
② 内在奖励驱动自监督信号(好奇心 / 状态覆盖 / 互信息)不指定任务,让 agent 自由探索,奖励「新颖性」或「技能多样性」ICM(预测误差当奖励)、DIAYN(最大化技能-状态互信息)、RE3(状态覆盖)、ODPP(行列式点过程)
③ 前后向表征(FB)完全 reward-free 的转移数据学 successor measure 的低秩近似 $M^\pi(X|s,a) \approx F(s,a)^\top B(s')$;训练后用任意 reward 推断策略,无需再训练FB / FB-IL(首个提 BFM 概念)、Motivo(+CPR 正则)、BFM-Zero(首个真机部署 FB)
🔮 直觉:FB 为什么能「不用 reward 就能适配任意任务」?
关键在于 $Q^\pi_r(s,a) = F(s,a)^\top z$ 这个分解——动作价值函数被拆成「策略在环境中如何演化」($F$,前向)和「reward 投影」($z = \mathbb{E}[B(s)r(s)]$,后向)。$F$ 和 $\pi$ 是 reward-agnostic 的(只依赖环境动力学),训完之后,给任意新 reward $r$,只要算 $z$ 就能立刻推出最优策略。这就像「先把地图学好,再根据任意起点终点找路」。Motivo 在这个基础上做出来 83% 的运动跟踪成功率、61% 的 reward 优化性能。

适配阶段则有两种主流思路:

适配方式核心思路代表
微调用少量任务数据更新部分参数(FFT / LoRA),或调整 latent task vectorTaskTokens(长跳 99.75% 成功率)、ReLA/LoLA(零样本 +40%)、Belief-FB(2× 性能)
层级控制BFM 当底层执行器,高层用 LLM / diffusion 做规划下指令CLoSD(diffusion 规划 + tracking)、UniHSI(语言→接触链)、LangWBC、LeVERB

📊 关键 BFM 工作代表性指标

BFM 工作范式关键数字真机
MotivoFB + CPR动作跟踪 83%;reward 优化达 top-line 61%;运动多样性 4.70(±0.66);300 步 episode 12s仿真为主
BFM-ZeroFB + 双 critic首个真机零样本部署 FB;G1 / T1 上稳定 WBC✓ Unitree G1, Booster T1
HugWBC目标条件通用命令空间自动生成速度/步态/姿态目标;自监督命令跟踪(不依赖 mocap)
HOVER多模式蒸馏单一策略切换 loco/manip/nav 任务
SONIC目标条件(综述列入 SOTA 真机部署代表)
TaskTokens(适配)Goal-cond + token长跳任务 99.75% 成功率仿真
ReLA/LoLA(适配)FB + latent adapt零样本性能提升 up to +40%仿真
关键洞察:综述把一个看似散乱的领域(DeepMimic/AMP/HugWBC/Motivo/HOVER 等看似无关)统一进一个二维分类。从这张表可以看出:(1) 真机成功部署的工作(HugWBC、HOVER、BFM-Zero、SONIC 等)都集中在 2024-2025,说明 BFM 范式刚跨过 sim2real 临界点;(2) FB 路线虽然在理论上最优雅(reward-free),但真机部署只有 BFM-Zero 一例,仍是早期;(3) 目标条件 + 大规模 mocap 是当前最成熟路线。

🌐 在领域中的位置

模型法(MPC, 2006-) 任务专属 RL/IL(DeepMimic, AMP, 2018-) BFM(预训练 + 适配,2024-)⭐ VLA 大一统(语言 + 视觉 + 动作)

综述把 BFM 定位为「next-generation 人形机器人控制系统」——不是某个算法,而是一种工程范式。它和 VLA 的关系也讲清楚了:VLA 主要解决稳定平台(机械臂、轮式)的多模态理解,BFM 主要解决全身高动态控制(双足、跳跃、平衡)。未来很可能出现「VLA 高层规划 + BFM 底层执行」的融合架构。具体方法卡片可看 BFM 方法、HugWBC、Motivo。

❓ 常见误区

BFM 和 VLA 是同一个东西吗?

不是。综述明确区分:VLA 主要处理视觉 + 语言 + 动作的多模态对齐,适用稳定平台(机械臂、轮式人形)。BFM 主要处理全身高动态控制(双足行走、平衡、跳跃),核心是 locomotion + manipulation 协同。两者侧重点不同,但未来会融合——比如用 VLM 做高层规划、BFM 做底层执行。

「目标条件学习」不就是普通的任务 RL 吗?凭什么叫 BFM?

区别在数据规模和复用性。普通任务 RL 只训一个技能(如「走」),换任务就重训。BFM 风格的目标条件学习是用大规模 mocap / 多任务数据训练,得到一个能条件化输出多种技能的通用策略。比如 HugWBC 一个策略就能切多步态——它把 WBC 重构成自监督命令跟踪,靠通用命令空间(自动生成速度/步态/姿态目标)驱动,不依赖 mocap 数据。判断标准是「能否零样本或快速适配到训练分布外的新任务」。

FB 路线为什么这么「冷门」?

几个原因:(1) 理论复杂,要学 successor measure 的低秩近似;(2) 训练数据要求——虽然 reward-free,但需要 reward-free 的转移数据覆盖;(3) 早期在 DMC Humanoid 等数据集上效果一般,直到 Motivo 引入 CPR 正则才大幅提升;(4) 真机部署仍只有 BFM-Zero 一例。综述判断它是「最有理论潜力但工程最不成熟」的一条路。

读了综述,我该从哪个 BFM 工作上手?

看目标。工程落地优先:HugWBC + HOVER(真机成熟、命令空间丰富);理论研究:FB / Motivo(reward-free 优雅);跨 embodiment:参考 EAGLE(也是广义 BFM 跨体延伸)。综述 GitHub 仓库 awesome-bfm-papers 有持续更新。