π0.5:让机器人「扫地做饭」的 VLA,靠读网课+多机器人混训走出实验室
🎯 为什么重要:机器人要离开实验室,必须「融会贯通」
让 VLA(Vision-Language-Action)模型在没见过的真实房子里执行 10 分钟以上的多阶段任务(清理厨房 / 整理卧室 / 铺床),是 open-world generalization 上的硬骨头。暴力解法是「去更多房子采集更多机器人数据」——但π0.5 的关键洞察是:这不够,也太贵。
π0.5 的答案是 co-training:把多种来源、多种抽象层级的数据,全部塞进同一个 VLA 序列建模框架里一起训。关键数据点来自论文 §IV:
💡 核心思想:层级化推理 + 异构数据 co-training
π0.5 把「做一个任务」拆成两个层次的预测,而且两个层次用同一个模型:
这个层级分解让模型可以同时从两个层级「吸」数据:低层 action 数据来自其他机器人和直接经验;高层语义来自网络图文、caption、VQA 和人类口头指令。这正是 co-training 之所以能起作用的形式化基础。
🛠️ 怎么做到的:五个工程关键
| 设计 | 心智 | 关键数字(来自 PDF) |
|---|---|---|
| ① 异构数据 co-training | 把 MM / ME / CE / HL / WD / VI 六类数据,统一成 token 序列喂同一个 VLA | MM ≈ 400 小时(约 100 个家庭);非 MM 占 97.6% |
| ② 双 action 表示 | 预训练用 FAST 离散 token(训练快);后训练加 flow-matching 连续 action expert(推理快+精度高) | α=10.0 平衡两项 loss;推理用 10 步去噪 |
| ③ 层级推理 | 同一模型先输出语义子任务,再生成动作;类似 chain-of-thought | H=49(50 Hz × ~1s);动作维度 18-19 |
| ④ Verbal instruction(VI) | 人类「用语言遥控」机器人,等于给高层策略做 demo | VI 仅占高层样本 11%,但消融显示「去 VI」掉得很明显 |
| ⑤ Action expert 与 VLM 解耦 | 用 attention mask 让信息单向流(VLM → action expert),两套权重不互相干扰 | action expert 300M,VLM 2B(PaliGemma backbone) |
把高层语义和低层动作塞进同一个序列建模框架,意味着模型在学「pick up the plate」这个 token 串时,同时在用网络图文 / caption 数据强化 plate 是什么、在哪,又在用机器人数据学到抓取动作。两边梯度都对同一个 backbone 起作用,知识就「渗透」过去了。层级推理只是把这种「渗透」在推理时显式地解码出来。
📊 关键结果:在没见过的真实房子里干 10–15 分钟家务
| 维度 | 结果 |
|---|---|
| 真实家庭部署 | 3 个训练时没见过的真实家庭,clean kitchen / bedroom 任务成功 |
| 任务时长 | 多阶段任务持续 10–15 分钟(如把所有盘子放进水槽、把所有衣服放进洗衣篮) |
| 跨场景规模实验 | 用 3 / 12 / 22 / 53 / 82 / 104 个家庭训练,性能随场景数稳定提升;104 个家庭的模型≈「见过测试家庭」的上限 |
| 消融:去 ME/CE(其他机器人) | 性能显著下降——跨具身迁移是 generalization 的最大功臣 |
| 消融:去 WD(网络数据) | 对 in-distribution 影响小,但对 OOD 物体显著下降(网络数据带来「物体是什么」的常识) |
| 对比 π0 / π0-FAST+Flow | π0.5 显著胜出,即便给 π0 训到 300k 步也追不上 |
| 高层推理消融 | 用 GPT-4 当高层策略效果最差;π0.5 自身既做高层又做低层最好;甚至超过 human oracle 高层 |
🌐 在领域中的位置
π0.5 是 VLA 从「会做事」走向「会泛化到陌生环境做事」的分水岭。它的 co-training 配方(特别是把网络数据 / 高层语义 / 跨具身数据融进同一个序列建模框架)成了后续通用人形 VLA 的标准操作。关联线索:T06 基础模型谱系。
❓ 常见误区
π0.5 是一个比 π0 大很多的模型吗?
不是。两者用几乎相同的 VLM 骨干(PaliGemma 2B + 300M action expert)。差异在训练数据配方——π0.5 加了 HL/WD/VI/ME/CE 等异构数据源,并引入层级推理。论文 §V.D 显示,把 π0 训更久也追不上 π0.5,证明增益来自数据 + 范式而非规模。
「去网络数据」消融为什么不显著?
在 in-distribution 物体上确实差异不大;但 OOD 物体(从未在机器人数据中出现的类别,如漏斗、点火器)掉得非常明显。网络数据的作用是扩展语义知识,而非提升已熟悉物体的操作能力。
为什么高层推理用同一个模型,而不是用 GPT-4 当大脑?
论文做了这个对照(§V.E):GPT-4 高层最差,π0.5 自身既做高层又做低层最好,甚至超过 human oracle。原因是高层推理必须接地到这台机器人能做什么——纯语言模型不知道「这台机械臂够不到那个架子」,就会给出做不到的子任务。
π0.5 已经能商用了?
还不能。论文坦承局限:对某些抽屉把手 / 难开的柜子仍频繁失败;部分可观察性(如擦桌子时手臂挡住 spills)处理不好;高层推理有时会被干扰(反复开关抽屉)。它是个范式证明,不是产品。