BFM 综述:人形机器人的「下一个底层操作系统」
🎯 为什么重要:人形机器人控制「重训一次」的代价太高
过去几年人形机器人火了,但每个新任务都要付出巨大代价:
- 传统模型法(MPC / WBOSC, 2006-):物理建模 + QP 求解。问题:调参靠经验、实时性差、动态技能(后空翻)几乎做不了、轻微一推就倒。
- RL/IL 任务专属法(2018-):DeepMimic、AMP 等。问题:RL 样本效率极低(百万次交互)、奖励设计脆弱、sim2real gap;IL 受限于演示数据收集和演示者偏差。每个新任务都要重训。
- 行为基础模型 BFM(2024-):大规模预训练 + 快速适配,把 LLM「训练一次,多任务复用」的范式搬过来。
综述的关键判断是:BFM 不是又一个新算法,而是一种工程范式的转折点——就像 NLP 从「每个任务训一个 BERT」转到「一个 GPT 走天下」。它把「机器人控制软件」从「一次性科研项目」变成「可迭代、可复用、可规模化的产品」。
💡 核心思想:BFM = 预训练 + 适配 两阶段
所有 BFM 工作都可以装进一个统一框架:先用大规模行为数据训练通用底层,再用轻量适配让它在具体任务上工作。综述把「预训练」和「适配」各分成三类:
🛠️ 三种预训练范式:外驱 / 内驱 / 无 reward
| 范式 | 信号来源 | 核心思路 | 代表工作 |
|---|---|---|---|
| ① 目标条件学习 | 外部 reward 或 mocap 跟踪目标 | 给策略一个明确的「目标」(pose / 速度 / 关键帧),用 RL 学「达到目标的通用技能」 | DeepMimic(跟踪一段动作)、ASE/CALM(对抗 IL 学技能空间)、HugWBC(命令空间跟踪)、MaskedMimic(部分目标 inpainting) |
| ② 内在奖励驱动 | 自监督信号(好奇心 / 状态覆盖 / 互信息) | 不指定任务,让 agent 自由探索,奖励「新颖性」或「技能多样性」 | ICM(预测误差当奖励)、DIAYN(最大化技能-状态互信息)、RE3(状态覆盖)、ODPP(行列式点过程) |
| ③ 前后向表征(FB) | 完全 reward-free 的转移数据 | 学 successor measure 的低秩近似 $M^\pi(X|s,a) \approx F(s,a)^\top B(s')$;训练后用任意 reward 推断策略,无需再训练 | FB / FB-IL(首个提 BFM 概念)、Motivo(+CPR 正则)、BFM-Zero(首个真机部署 FB) |
关键在于 $Q^\pi_r(s,a) = F(s,a)^\top z$ 这个分解——动作价值函数被拆成「策略在环境中如何演化」($F$,前向)和「reward 投影」($z = \mathbb{E}[B(s)r(s)]$,后向)。$F$ 和 $\pi$ 是 reward-agnostic 的(只依赖环境动力学),训完之后,给任意新 reward $r$,只要算 $z$ 就能立刻推出最优策略。这就像「先把地图学好,再根据任意起点终点找路」。Motivo 在这个基础上做出来 83% 的运动跟踪成功率、61% 的 reward 优化性能。
适配阶段则有两种主流思路:
| 适配方式 | 核心思路 | 代表 |
|---|---|---|
| 微调 | 用少量任务数据更新部分参数(FFT / LoRA),或调整 latent task vector | TaskTokens(长跳 99.75% 成功率)、ReLA/LoLA(零样本 +40%)、Belief-FB(2× 性能) |
| 层级控制 | BFM 当底层执行器,高层用 LLM / diffusion 做规划下指令 | CLoSD(diffusion 规划 + tracking)、UniHSI(语言→接触链)、LangWBC、LeVERB |
📊 关键 BFM 工作代表性指标
| BFM 工作 | 范式 | 关键数字 | 真机 |
|---|---|---|---|
| Motivo | FB + CPR | 动作跟踪 83%;reward 优化达 top-line 61%;运动多样性 4.70(±0.66);300 步 episode 12s | 仿真为主 |
| BFM-Zero | FB + 双 critic | 首个真机零样本部署 FB;G1 / T1 上稳定 WBC | ✓ Unitree G1, Booster T1 |
| HugWBC | 目标条件 | 通用命令空间自动生成速度/步态/姿态目标;自监督命令跟踪(不依赖 mocap) | ✓ |
| HOVER | 多模式蒸馏 | 单一策略切换 loco/manip/nav 任务 | ✓ |
| SONIC | 目标条件 | (综述列入 SOTA 真机部署代表) | ✓ |
| TaskTokens(适配) | Goal-cond + token | 长跳任务 99.75% 成功率 | 仿真 |
| ReLA/LoLA(适配) | FB + latent adapt | 零样本性能提升 up to +40% | 仿真 |
🌐 在领域中的位置
综述把 BFM 定位为「next-generation 人形机器人控制系统」——不是某个算法,而是一种工程范式。它和 VLA 的关系也讲清楚了:VLA 主要解决稳定平台(机械臂、轮式)的多模态理解,BFM 主要解决全身高动态控制(双足、跳跃、平衡)。未来很可能出现「VLA 高层规划 + BFM 底层执行」的融合架构。具体方法卡片可看 BFM 方法、HugWBC、Motivo。
❓ 常见误区
BFM 和 VLA 是同一个东西吗?
不是。综述明确区分:VLA 主要处理视觉 + 语言 + 动作的多模态对齐,适用稳定平台(机械臂、轮式人形)。BFM 主要处理全身高动态控制(双足行走、平衡、跳跃),核心是 locomotion + manipulation 协同。两者侧重点不同,但未来会融合——比如用 VLM 做高层规划、BFM 做底层执行。
「目标条件学习」不就是普通的任务 RL 吗?凭什么叫 BFM?
区别在数据规模和复用性。普通任务 RL 只训一个技能(如「走」),换任务就重训。BFM 风格的目标条件学习是用大规模 mocap / 多任务数据训练,得到一个能条件化输出多种技能的通用策略。比如 HugWBC 一个策略就能切多步态——它把 WBC 重构成自监督命令跟踪,靠通用命令空间(自动生成速度/步态/姿态目标)驱动,不依赖 mocap 数据。判断标准是「能否零样本或快速适配到训练分布外的新任务」。
FB 路线为什么这么「冷门」?
几个原因:(1) 理论复杂,要学 successor measure 的低秩近似;(2) 训练数据要求——虽然 reward-free,但需要 reward-free 的转移数据覆盖;(3) 早期在 DMC Humanoid 等数据集上效果一般,直到 Motivo 引入 CPR 正则才大幅提升;(4) 真机部署仍只有 BFM-Zero 一例。综述判断它是「最有理论潜力但工程最不成熟」的一条路。
读了综述,我该从哪个 BFM 工作上手?
看目标。工程落地优先:HugWBC + HOVER(真机成熟、命令空间丰富);理论研究:FB / Motivo(reward-free 优雅);跨 embodiment:参考 EAGLE(也是广义 BFM 跨体延伸)。综述 GitHub 仓库 awesome-bfm-papers 有持续更新。