深度⏱ ~3 min
里程碑
⭐ 为何重要

用大规模 MoCap 预训练 proxy agent + online masked distillation,得到通用 humanoid motor foundation model,可零样本下游到 motion tracking 等多任务。它把 motion prior 升级为大规模预训练 BFM,与 ASE/CALM/PULSE/UHC 谱系衔接,标志着 humanoid motor foundation model 时代的起点。

数据集large-scale MoCap
上真机
物理感知
实时
输入模态proprioception

论文:Weishuai Zeng, Shunlin Lu, Kangning Yin, Xiaojie Niu, Minyue Dai, Jingbo Wang, Jiangmiao Pang. Behavior Foundation Model for Humanoid Robots. arXiv:2509.13780 (2025-09-17), accepted ICRA 2026. 机构:北大 / 港中文(深圳)/ 上交 / 复旦 / 上海 AI Lab 系。🌐 · T04 转折 6,motion prior 谱系的"生成式 motor foundation"制高点(在 SONIC 之前)。

一句话直觉

把机器人行为当一门语言大规模预训练

秘诀是把"目标"和"动作"分开,只学动作。

这套方法之于人形机器人,就像大语言模型之于写作。

预训练一次,换任务不重训,换个指令开关就能用。

是什么·为什么

要解决的问题:之前的人形全身控制仍是"一个任务一个策略"。📎

走路、远程操控、动捕跟踪,各要专门的打分工程和专门的指令接口。

跨任务泛化有限。每来一个新任务都要重训。

BFM 的转身:把所有任务共享的那个隐藏目标抽出来。

作者观察到:所有全身控制任务都在做同一件事——生成引导机器人趋向目标状态的行为。

把这个共同目标大规模预训练,就得到一个不挑任务的基础模型📎

方法核心(大白话):BFM 先重新定义"行为"。

行为只含机器人自己的传感器历史和动作序列,刻意把目标排除在外。

这样一份行为能对应任何指挥方式。速度指令、遥操信号、参考姿态都行。📎

训练分两步。第一步在仿真里训一个"全能助教"。

助教能看到特权信息:真实质量、摩擦、未来目标。

它学会把每段人类动捕跟得很好。📎

第二步训真正的"学生"模型。学生看不到特权信息。

它边跑边请助教打样。助教给出示范动作,学生模仿。

同时学生把助教的"思考"压成一个紧凑的隐向量。📎

学生用条件变分编码器这个结构。它天然能输出多种合理动作,而不是单一答案。

这是它比前作那种"定解跟踪器"强的地方。📎

部署时只要告诉学生"这次你能看到哪几类目标指令"。

用一串零一开关当掩码激活。走路、远程操控、动捕跟踪三类任务,设好掩码就直接用。📎

为什么重要:第一个明确把人形 motor policy 当"基础模型"来训。

生成式、多任务、零样本。已被 ICRA 2026 接收。📎

在动作跟踪、远程操控、运动三类任务上全面超过前作通用基线和专门模型。

关键动作跟踪误差比 HOVER 低约三成。

还能做行为组合:把两个隐向量线性插值,得到同时转身加抬腿的回旋踢。📎

一句话类比:BFM 之于人形机器人,就像大语言模型之于写作。

语言模型先学好一门语言的全部味道。

写作、翻译、摘要都只是换个指令,不用重学语言。

怎么做

核心机制·CVAE 加掩码在线蒸馏

BFM 是生成式策略(不是判别器、不是跟踪器),用条件变分编码器在大规模行为数据上预训练。📎

形式化的关键:行为与控制模式解耦(Sec.III.A)

行为定义为本体感受-动作轨迹,显式排除目标状态。目标被视为"外部动机",不进入行为本身。

这样一份行为可对应任意控制模式,从根源上避免"一个任务一个策略"。📎

记号上区分四种状态:仿真的特权本体感受与目标(助教看得到);真机的本体感受与目标(学生看得到)。

两阶段训练

  1. proxy agent(特权助教)。用目标条件 PPO 加动捕模仿训练,跟 PHC/UHC 同源。特权本体感受含七类:刚体位置、关节位置、朝向、线速度、关节速度、角速度、上一步动作。特权目标是与当前帧的差分(局部坐标)。📎
  2. CVAE 学生。先看架构三件套:📎
  • 先验网络:吃真机本体感受加目标,输出隐向量分布。
  • 编码器:吃仿真特权本体感受加特权目标加掩码,输出隐向量分布。均值用残差设计——学的是"相对先验的偏移"。这让推断时(无特权信息)仍能用先验。
  • 解码器:吃真机本体感受加隐向量,出动作。方差固定不学。解码器故意不吃目标——逼隐向量必须编码更多行为知识,否则解码器会偷懒直接从目标抄动作。

掩码策略(论文的关键升级)。控制接口是"根位姿 + 运动学位姿 + 关节角"三类的并集,用零一掩码激活。

前作 HOVER 用两阶段(先训一类再训另一类)。BFM 改成每个掩码元素独立按概率零点五采样,原生支持任意控制模式组合,包括训练时没见过的组合。📎

在线蒸馏(DAgger 式)。每个 episode 用当前学生 rollout 得到真机状态轨迹;每步同步算对应的特权状态并问助教要示范动作。学生损失是两部分之和:模仿助教动作的误差,加编码器分布与先验分布的 KL 散度📎

预训练规模与平台IsaacGym,8192 个并行环境。机器人 Unitree G1(1.3 米、29 自由度,实验时冻手腕只用 23)。同时报告仿真、仿真到仿真、真机三个层面。📎

三个 latent 操作技巧

  • 行为组合:两个隐向量线性插值,得到混合动作(如回旋踢)。📎
  • 行为调制:类似 classifier-free guidance,沿目标方向外推隐向量。蝶踢要外推系数零点五才能落地保持平衡。
  • 残差学习:冻 BFM 参数,新训一个残差解码器学新动作(如侧空翻),比从零强化学习快得多。

常见误区(先抛一个,完整版见末尾):"BFM 是个跟踪器。"——不是。BFM 是生成式策略。跟踪器给定参考输出单一动作;BFM 学的是整个行为分布,用隐向量显式表达多模态。这是它零样本跨任务的根本。[未确认]

深度

ELBO 与 CVAE 损失(Sec.IV.D,Eq.5–8)

$$\mathcal{L}_{\text{ELBO}}=\mathbb{E}_{q_\epsilon}\big[\log P(a_t|s^{p,\text{real}},s^{g,\text{real}},z)\big]-D_{\text{KL}}\big(q_\epsilon(z|s^{p,\text{sim}},s^{g,\text{sim}})\,\|\,P(z|s^{p,\text{real}},s^{g,\text{real}})\big)$$

关键不对称:编码器看仿真特权状态,先验看真机状态。这正是 teacher-student 的体现。编码器均值的残差设计:$\mu_\epsilon(\cdot)+\mu_\rho(\cdot)$,让推断时无特权信息仍可用先验。📎

在线蒸馏精确公式(Sec.IV.E,Eq.9)

$$\mathcal{L}=\underbrace{\|\hat a_t-a_t\|_2^2}_{\text{DAgger}}+\lambda_{\text{KL}}\,\underbrace{D_{\text{KL}}\big(q_\epsilon(z_t|s^{p,\text{sim}},s^{g,\text{sim}})\,\|\,P_\rho(z|s^{p,\text{real}},s^{g,\text{real}})\big)}_{\text{KL}}$$

注意 KL 的两边:编码器吃特权状态、先验吃真机状态。论文 Eq.9 明确不含动作。📎

真机本体感受(Sec.IV.B):堆叠 25 步历史——关节位置、关节速度、根角速度、投影重力、上一步动作。没有根线速度(真机拿不到)。

proxy agent 的奖励与域随机化(Table I/II)。奖励含任务项(身体位置、足位置、身体速度、关节位置、关键点位置、身体朝向等)加正则加惩罚(扭矩限位、关节位置、终止)。终止项权重达负二百。课程学习:前期只优化模仿,后期逐步加惩罚。域随机化:质心偏移、连杆质量、摩擦、PD 增益、扭矩 RFI;外部扰动每五到十秒推一次。📎

简化终止条件。不像 PHC/UHC 用多条件(重力、高度),BFM 终止条件简化为单一:机器人与参考姿态的平均连杆距离超阈即终止。这避免 RSI 后立即终止起床等动作。📎

RSI 加 hard negative mining。参考状态初始化(从动捕随机采起点)。当助教成功率不再提升时,对持续失败样本增加采样概率;同时过滤掉"不可信"样本。注意:BFM 预训练不再做二次过滤,直接用原始 AMASS📎

关键实验结果(Table III/IV,AMASS 测试集)📎

任务HOVERSpecialistBFMvs HOVER
动作跟踪关键点误差(mm)↓87.0773.6361.12-29.8%
远程操控关键点误差↓102.8480.5963.14-38.6%
运动线速度误差↓0.26630.21680.2116-20.5%
从零 RL(同架构无预训练)1.1689差 5 倍,证预训练必要

行为调制实验。扫外推系数 λ∈{0.5,1.0,1.5,2.0},λ=1.0 在 AMASS 测试集最佳(关键点误差 58.7 vs 不调制 61.1)。λ=2.0 反而恶化——过度外推。验证 CFG 式调制存在最优点。📎

100STYLE 泛化。在所有指标上大幅领先 HOVER,证明大规模预训练带来跨风格泛化。📎

与 PHC/UHC 的本质区别:PHC/UHC 是定解跟踪器,学一个能模仿一切的跟踪器;BFM 是生成式 CVAE 策略,学一个能生成一切行为的基础模型。BFM 显式建模多模态,下游靠掩码切任务。[未确认]

与 HOVER 的三个关键区别(论文 Sec.II.A)

  1. 掩码采样:HOVER 两阶段,BFM 每元素独立伯努利零点五。
  2. 目标平台:HOVER 主要在虚拟化身验证,BFM 直接对接真机 Unitree G1。
  3. 生成式隐空间:HOVER 是定解策略;BFM 用 CVAE 提供结构化隐流形,支持组合与调制。📎

局限

  1. 未开源(最大问题)。截至 2026-07 官方代码未公开。论文也刻意省略多项关键复现细节:隐向量维度、网络层数、KL 权重主训练值、AMASS 训练数据规模、训练时长、掩码课程的衰减因子。复现需从论文加 HOVER/MaskedMimic 代码反推。📎
  2. 跨形态 retarget 损耗。BFM 仍在 SMPL 到 G1 的 retarget 上预训练。剧烈动作(蝶踢、侧空翻落地)的动量与接触损失未充分量化——论文靠行为调制才让蝶踢不摔。[未确认]
  3. mode collapse 是否真解。CVAE 显式建模多模态理论上比 AMP 单判别器更抗塌缩。论文用 t-SNE 展示隐向量有方向性作间接证据,未直接对比 AMP 式塌缩指标[未确认]
  4. 被 SONIC 超越。BFM 之后 SONIC 把规模放大到四千万参数加一亿帧,并接上 VLA。BFM 是"生成式基础模型"的先驱,但不是制高点。🌐

研究者视角

图谱定位:BFM 把 motion prior 线索的演化封顶到"生成式基础模型"这一步(T04 转折 6)。📎


AMP 把动捕凝练成 style-reward
  → ASE/CALM 凝练成 latent skill
    → PHC/UHC 学成 controller
      → BFM 放大为大规模预训练 motor foundation(生成式)
        → SONIC 进一步放大并接 VLA(当前制高点)

每一步都把"数据"利用得更充分、把"任务适配"做得更轻。[未确认]

BFM 的两个范式贡献

  1. 形式化重构。把"行为"从"控制模式"解耦——行为只含本体感受加动作,目标是外部动机。这一刀切下去,一个预训练模型才能统一多种控制模式。📎
  2. 生成式策略替代跟踪器。CVAE 显式建模多模态行为分布,让行为组合(隐向量插值)和调制(CFG 外推)成为可能——这些定解跟踪器做不到。📎

与同期 BeyondMimic 的对照:两者同方向(可复用 motor 基座),机制互补。BFM 用 CVAE 在训练时统一多任务;BeyondMimic 用扩散在推理时组合任务。SONIC 后来把两者的规模化路线推到极致。[未确认]

社区 sibling:BFM-Zero(arXiv:2511.04131,LeCAR Lab)走另一条"无监督 RL 加 forward-backward 表示"的 promptable 路线(论文中提到的 Motivo);MaskedMimic(arXiv:2409.14393)是 BFM 的虚拟化身版前身。[未确认]

Open problems

  1. 开源与复现。论文省略隐向量维度、网络规模、KL 权重、数据规模等关键细节,社区复现门槛高。能否补全可复现配方,是 BFM 影响力扩散的前提。[未确认]
  2. 隐空间的可解释性。隐向量是黑箱,行为组合靠经验插值。能否赋予隐维度语义(动作类型、节奏),而非事后可视化?[未确认]
  3. 跨形态零样本。BFM 仍绑 Unitree G1。一个跨形态(H1、Booster、自研人形)的行为基础模型,要等 XHugWBC 等后续工作。[未确认]
  4. 生成 vs 跟踪的路线选择。BFM 选了生成式 CVAE;SONIC 选了大规模跟踪加 token。两条线哪个上限更高,仍是开放问题。[未确认]

常见误区

"BFM 是个跟踪器" —— 错。

BFM 是生成式策略。跟踪器给定参考输出单一动作;BFM 学的是整个行为分布,隐向量显式表达多模态。

生成式是它零样本跨任务加行为组合的根本,不是定解跟踪。📎

"BFM 解码器吃目标" —— 错。

论文明确把目标从解码器输入里删掉。

这是刻意设计——逼隐向量编码更多行为知识,否则解码器会偷懒直接从目标抄动作。目标只进先验和编码器。📎

"掩码就是 HOVER 那套" —— 不准确。

HOVER 用两阶段(先训一类再训另一类);BFM 每个掩码元素独立按伯努利零点五采样。

BFM 原生支持任意控制模式组合,包括训练时没见过的组合;这是它超越 HOVER 的关键之一。📎

"BFM 是 motion prior 谱系的终点" —— 错。

BFM 是生成式基础模型的先驱,但 SONIC(2025.11)随即把规模放大到四千万参数加一亿帧并接 VLA。

BFM 是转折 6,不是终点;制高点已移到 SONIC。🌐

"BFM 解决了 mode collapse" —— 未证实。

CVAE 显式多模态理论上更抗塌缩,但论文只给 t-SNE 间接证据,未直接对比 AMP 式塌缩指标。

抗塌缩是理论优势的推测,论文没给硬证据。[未确认]

检查点

Q1

BFM 重新定义了"行为"。它的"行为"包含什么、刻意排除了什么?这个排除为什么让它能一个模型统一多种任务?

💡 参考答案

  • 行为 = 只含机器人自己的传感器历史(本体感受)和动作序列。
  • 刻意排除的是「目标」(goal state,如往哪走、学哪段动捕);目标被视为外部动机,不进入行为本身。
  • 为什么能统一多任务:因为同一份「行为」可以对应任意指挥方式(速度指令、遥操信号、参考姿态),任务差异只体现在外部目标上,行为本身是共享的——所以一个预训练模型能覆盖多种控制模式。
Q2

BFM 训练分两步。第一步的"全能助教"能看到什么特权信息?第二步的"学生"看不到特权信息,它是怎么从助教那里学的?

💡 参考答案

  • 助教看到的特权信息:仿真里才能直读、真机拿不到的量(如真实质量、摩擦、未来目标)。
  • 学生怎么学:在线蒸馏——学生边跑边请助教打样,助教给出示范动作,学生模仿;同时学生把助教的「思考」压成一个紧凑的隐向量。
  • 对照:助教=特权老师(teacher),学生=部署用模型(student);学生靠模仿助教的动作和隐向量来补上自己看不到的特权信息。
Q3

BFM 的解码器故意不吃目标状态。用"大语言模型"或你自己举的类比,用自己的话解释:为什么不让解码器看目标?

💡 参考答案

  • 不让看目标的原因:若解码器能看目标,它会偷懒直接从目标抄动作,隐向量就学不到真正的行为知识。
  • 删掉目标的效果:逼隐向量必须承载更多行为信息(把目标该带来的信息全压进隐向量),隐向量才丰富、可组合。
  • 类比锚:像考场上把答案收走——不让学生直接抄答案,逼学生把知识真学进脑子(隐向量)里。
  • 注意:目标不是完全没用,它仍进先验和编码器;只是不进解码器。
Q4

BFM 部署时用一串零一开关(掩码)告诉学生"这次能看到哪几类目标指令"。用"大语言模型"或你自己的类比解释:为什么靠切换开关就能让同一个模型做走路、远程操控、动捕跟踪三种不同任务,而不用重训?

💡 参考答案

  • 根本:行为本身已被预训练成与控制模式解耦(见 Q1),三种任务共享同一套行为知识,只是激活的「目标通道」不同。
  • 掩码的作用:每类目标指令对应一个开关,开/关决定学生这次能看到哪几类目标;切开关=切任务接口,不切底层行为。
  • 类比锚:像大语言模型预训练好语言能力后,写作/翻译/摘要只是换个提示词(prompt),不用重学语言——掩码就是 BFM 的「提示词」。
  • 关键:不用重训是因为行为在预训练时已统一,掩码只在推理时选接口。
Q5

BFM 是"生成式策略",前作 PHC/UHC 是"定解跟踪器"。这个区别为什么让 BFM 能做行为组合(如回旋踢)而定解跟踪器做不到?

💡 参考答案

  • 生成式策略:显式建模多种合理动作(多模态),用隐向量表达;隐向量之间可在隐空间插值/外推,得到「混合」动作。
  • 定解跟踪器:给定输入只输出单一动作(单模态),没有可插值的隐空间,没法「混合」两个动作。
  • 回旋踢的机制:把「转身」的隐向量和「抬腿」的隐向量线性插值,就得到同时转身+抬腿的动作——这只有生成式隐空间能做到。
  • 对照:定解跟踪器只能忠实跟一段参考,不能在两段行为之间「造」中间态。

FAQ

Q1:BFM 能直接用在真机上吗?

能。Unitree G1(23 自由度,冻手腕)真机做了动作跟踪、VR 遥操、运动三类任务的零样本部署。预训练后只需手动设掩码,不重训。📎

Q2:为什么解码器不吃目标?

刻意设计。若解码器看目标,它会偷懒直接从目标抄动作,隐向量就学不到行为知识。删掉目标逼隐向量承载更多,这是 CVAE 能学到丰富行为分布的关键。📎

Q3:BFM 的隐向量维度是多少?

论文未明确。PDF 正文和表格都没给隐向量维度、网络层数、总参数量、KL 权重主训练值、AMASS 训练数据规模、训练时长。这是它最大的复现软肋。📎

Q4:BFM 和 HOVER 什么关系?

BFM 继承并扩展 HOVER 的在线掩码蒸馏思路。三个关键区别:掩码采样(每元素伯努利零点五 vs 两阶段)、目标平台(直接真机 G1 vs 虚拟化身)、生成式隐空间(CVAE vs 定解策略)。📎

Q5:BFM 是当前制高点吗?

不是。BFM 是生成式基础模型的先驱(2025.09)。SONIC(2025.11)随即把规模放大到四千万参数加一亿帧并接 VLA,是当前制高点。BFM 是 T04 转折 6,不是终点。🌐