Q1:BFM 能直接用在真机上吗?
能。Unitree G1(23 自由度,冻手腕)真机做了动作跟踪、VR 遥操、运动三类任务的零样本部署。预训练后只需手动设掩码,不重训。📎
论文:Weishuai Zeng, Shunlin Lu, Kangning Yin, Xiaojie Niu, Minyue Dai, Jingbo Wang, Jiangmiao Pang. Behavior Foundation Model for Humanoid Robots. arXiv:2509.13780 (2025-09-17), accepted ICRA 2026. 机构:北大 / 港中文(深圳)/ 上交 / 复旦 / 上海 AI Lab 系。🌐 · T04 转折 6,motion prior 谱系的"生成式 motor foundation"制高点(在 SONIC 之前)。
把机器人行为当一门语言大规模预训练。
秘诀是把"目标"和"动作"分开,只学动作。
这套方法之于人形机器人,就像大语言模型之于写作。
预训练一次,换任务不重训,换个指令开关就能用。
要解决的问题:之前的人形全身控制仍是"一个任务一个策略"。📎
走路、远程操控、动捕跟踪,各要专门的打分工程和专门的指令接口。
跨任务泛化有限。每来一个新任务都要重训。
BFM 的转身:把所有任务共享的那个隐藏目标抽出来。
作者观察到:所有全身控制任务都在做同一件事——生成引导机器人趋向目标状态的行为。
把这个共同目标大规模预训练,就得到一个不挑任务的基础模型。📎
方法核心(大白话):BFM 先重新定义"行为"。
行为只含机器人自己的传感器历史和动作序列,刻意把目标排除在外。
这样一份行为能对应任何指挥方式。速度指令、遥操信号、参考姿态都行。📎
训练分两步。第一步在仿真里训一个"全能助教"。
助教能看到特权信息:真实质量、摩擦、未来目标。
它学会把每段人类动捕跟得很好。📎
第二步训真正的"学生"模型。学生看不到特权信息。
它边跑边请助教打样。助教给出示范动作,学生模仿。
同时学生把助教的"思考"压成一个紧凑的隐向量。📎
学生用条件变分编码器这个结构。它天然能输出多种合理动作,而不是单一答案。
这是它比前作那种"定解跟踪器"强的地方。📎
部署时只要告诉学生"这次你能看到哪几类目标指令"。
用一串零一开关当掩码激活。走路、远程操控、动捕跟踪三类任务,设好掩码就直接用。📎
为什么重要:第一个明确把人形 motor policy 当"基础模型"来训。
生成式、多任务、零样本。已被 ICRA 2026 接收。📎
在动作跟踪、远程操控、运动三类任务上全面超过前作通用基线和专门模型。
关键动作跟踪误差比 HOVER 低约三成。
还能做行为组合:把两个隐向量线性插值,得到同时转身加抬腿的回旋踢。📎
一句话类比:BFM 之于人形机器人,就像大语言模型之于写作。
语言模型先学好一门语言的全部味道。
写作、翻译、摘要都只是换个指令,不用重学语言。
核心机制·CVAE 加掩码在线蒸馏。
BFM 是生成式策略(不是判别器、不是跟踪器),用条件变分编码器在大规模行为数据上预训练。📎
形式化的关键:行为与控制模式解耦(Sec.III.A)。
行为定义为本体感受-动作轨迹,显式排除目标状态。目标被视为"外部动机",不进入行为本身。
这样一份行为可对应任意控制模式,从根源上避免"一个任务一个策略"。📎
记号上区分四种状态:仿真的特权本体感受与目标(助教看得到);真机的本体感受与目标(学生看得到)。
两阶段训练:
掩码策略(论文的关键升级)。控制接口是"根位姿 + 运动学位姿 + 关节角"三类的并集,用零一掩码激活。
前作 HOVER 用两阶段(先训一类再训另一类)。BFM 改成每个掩码元素独立按概率零点五采样,原生支持任意控制模式组合,包括训练时没见过的组合。📎
在线蒸馏(DAgger 式)。每个 episode 用当前学生 rollout 得到真机状态轨迹;每步同步算对应的特权状态并问助教要示范动作。学生损失是两部分之和:模仿助教动作的误差,加编码器分布与先验分布的 KL 散度。📎
预训练规模与平台。IsaacGym,8192 个并行环境。机器人 Unitree G1(1.3 米、29 自由度,实验时冻手腕只用 23)。同时报告仿真、仿真到仿真、真机三个层面。📎
三个 latent 操作技巧:
常见误区(先抛一个,完整版见末尾):"BFM 是个跟踪器。"——不是。BFM 是生成式策略。跟踪器给定参考输出单一动作;BFM 学的是整个行为分布,用隐向量显式表达多模态。这是它零样本跨任务的根本。[未确认]
ELBO 与 CVAE 损失(Sec.IV.D,Eq.5–8):
$$\mathcal{L}_{\text{ELBO}}=\mathbb{E}_{q_\epsilon}\big[\log P(a_t|s^{p,\text{real}},s^{g,\text{real}},z)\big]-D_{\text{KL}}\big(q_\epsilon(z|s^{p,\text{sim}},s^{g,\text{sim}})\,\|\,P(z|s^{p,\text{real}},s^{g,\text{real}})\big)$$
关键不对称:编码器看仿真特权状态,先验看真机状态。这正是 teacher-student 的体现。编码器均值的残差设计:$\mu_\epsilon(\cdot)+\mu_\rho(\cdot)$,让推断时无特权信息仍可用先验。📎
在线蒸馏精确公式(Sec.IV.E,Eq.9):
$$\mathcal{L}=\underbrace{\|\hat a_t-a_t\|_2^2}_{\text{DAgger}}+\lambda_{\text{KL}}\,\underbrace{D_{\text{KL}}\big(q_\epsilon(z_t|s^{p,\text{sim}},s^{g,\text{sim}})\,\|\,P_\rho(z|s^{p,\text{real}},s^{g,\text{real}})\big)}_{\text{KL}}$$
注意 KL 的两边:编码器吃特权状态、先验吃真机状态。论文 Eq.9 明确不含动作。📎
真机本体感受(Sec.IV.B):堆叠 25 步历史——关节位置、关节速度、根角速度、投影重力、上一步动作。没有根线速度(真机拿不到)。
proxy agent 的奖励与域随机化(Table I/II)。奖励含任务项(身体位置、足位置、身体速度、关节位置、关键点位置、身体朝向等)加正则加惩罚(扭矩限位、关节位置、终止)。终止项权重达负二百。课程学习:前期只优化模仿,后期逐步加惩罚。域随机化:质心偏移、连杆质量、摩擦、PD 增益、扭矩 RFI;外部扰动每五到十秒推一次。📎
简化终止条件。不像 PHC/UHC 用多条件(重力、高度),BFM 终止条件简化为单一:机器人与参考姿态的平均连杆距离超阈即终止。这避免 RSI 后立即终止起床等动作。📎
RSI 加 hard negative mining。参考状态初始化(从动捕随机采起点)。当助教成功率不再提升时,对持续失败样本增加采样概率;同时过滤掉"不可信"样本。注意:BFM 预训练不再做二次过滤,直接用原始 AMASS。📎
关键实验结果(Table III/IV,AMASS 测试集):📎
| 任务 | HOVER | Specialist | BFM | vs HOVER |
|---|---|---|---|---|
| 动作跟踪关键点误差(mm)↓ | 87.07 | 73.63 | 61.12 | -29.8% |
| 远程操控关键点误差↓ | 102.84 | 80.59 | 63.14 | -38.6% |
| 运动线速度误差↓ | 0.2663 | 0.2168 | 0.2116 | -20.5% |
| 从零 RL(同架构无预训练) | — | — | 1.1689 | 差 5 倍,证预训练必要 |
行为调制实验。扫外推系数 λ∈{0.5,1.0,1.5,2.0},λ=1.0 在 AMASS 测试集最佳(关键点误差 58.7 vs 不调制 61.1)。λ=2.0 反而恶化——过度外推。验证 CFG 式调制存在最优点。📎
100STYLE 泛化。在所有指标上大幅领先 HOVER,证明大规模预训练带来跨风格泛化。📎
与 PHC/UHC 的本质区别:PHC/UHC 是定解跟踪器,学一个能模仿一切的跟踪器;BFM 是生成式 CVAE 策略,学一个能生成一切行为的基础模型。BFM 显式建模多模态,下游靠掩码切任务。[未确认]
与 HOVER 的三个关键区别(论文 Sec.II.A):
局限:
图谱定位:BFM 把 motion prior 线索的演化封顶到"生成式基础模型"这一步(T04 转折 6)。📎
AMP 把动捕凝练成 style-reward
→ ASE/CALM 凝练成 latent skill
→ PHC/UHC 学成 controller
→ BFM 放大为大规模预训练 motor foundation(生成式)
→ SONIC 进一步放大并接 VLA(当前制高点)
每一步都把"数据"利用得更充分、把"任务适配"做得更轻。[未确认]
BFM 的两个范式贡献:
与同期 BeyondMimic 的对照:两者同方向(可复用 motor 基座),机制互补。BFM 用 CVAE 在训练时统一多任务;BeyondMimic 用扩散在推理时组合任务。SONIC 后来把两者的规模化路线推到极致。[未确认]
社区 sibling:BFM-Zero(arXiv:2511.04131,LeCAR Lab)走另一条"无监督 RL 加 forward-backward 表示"的 promptable 路线(论文中提到的 Motivo);MaskedMimic(arXiv:2409.14393)是 BFM 的虚拟化身版前身。[未确认]
Open problems:
"BFM 是个跟踪器" —— 错。
BFM 是生成式策略。跟踪器给定参考输出单一动作;BFM 学的是整个行为分布,隐向量显式表达多模态。
生成式是它零样本跨任务加行为组合的根本,不是定解跟踪。📎
"BFM 解码器吃目标" —— 错。
论文明确把目标从解码器输入里删掉。
这是刻意设计——逼隐向量编码更多行为知识,否则解码器会偷懒直接从目标抄动作。目标只进先验和编码器。📎
"掩码就是 HOVER 那套" —— 不准确。
HOVER 用两阶段(先训一类再训另一类);BFM 每个掩码元素独立按伯努利零点五采样。
BFM 原生支持任意控制模式组合,包括训练时没见过的组合;这是它超越 HOVER 的关键之一。📎
"BFM 是 motion prior 谱系的终点" —— 错。
BFM 是生成式基础模型的先驱,但 SONIC(2025.11)随即把规模放大到四千万参数加一亿帧并接 VLA。
BFM 是转折 6,不是终点;制高点已移到 SONIC。🌐
"BFM 解决了 mode collapse" —— 未证实。
CVAE 显式多模态理论上更抗塌缩,但论文只给 t-SNE 间接证据,未直接对比 AMP 式塌缩指标。
抗塌缩是理论优势的推测,论文没给硬证据。[未确认]
BFM 重新定义了"行为"。它的"行为"包含什么、刻意排除了什么?这个排除为什么让它能一个模型统一多种任务?
💡 参考答案
BFM 训练分两步。第一步的"全能助教"能看到什么特权信息?第二步的"学生"看不到特权信息,它是怎么从助教那里学的?
💡 参考答案
BFM 的解码器故意不吃目标状态。用"大语言模型"或你自己举的类比,用自己的话解释:为什么不让解码器看目标?
💡 参考答案
BFM 部署时用一串零一开关(掩码)告诉学生"这次能看到哪几类目标指令"。用"大语言模型"或你自己的类比解释:为什么靠切换开关就能让同一个模型做走路、远程操控、动捕跟踪三种不同任务,而不用重训?
💡 参考答案
BFM 是"生成式策略",前作 PHC/UHC 是"定解跟踪器"。这个区别为什么让 BFM 能做行为组合(如回旋踢)而定解跟踪器做不到?
💡 参考答案
能。Unitree G1(23 自由度,冻手腕)真机做了动作跟踪、VR 遥操、运动三类任务的零样本部署。预训练后只需手动设掩码,不重训。📎
刻意设计。若解码器看目标,它会偷懒直接从目标抄动作,隐向量就学不到行为知识。删掉目标逼隐向量承载更多,这是 CVAE 能学到丰富行为分布的关键。📎
论文未明确。PDF 正文和表格都没给隐向量维度、网络层数、总参数量、KL 权重主训练值、AMASS 训练数据规模、训练时长。这是它最大的复现软肋。📎
BFM 继承并扩展 HOVER 的在线掩码蒸馏思路。三个关键区别:掩码采样(每元素伯努利零点五 vs 两阶段)、目标平台(直接真机 G1 vs 虚拟化身)、生成式隐空间(CVAE vs 定解策略)。📎
不是。BFM 是生成式基础模型的先驱(2025.09)。SONIC(2025.11)随即把规模放大到四千万参数加一亿帧并接 VLA,是当前制高点。BFM 是 T04 转折 6,不是终点。🌐