里程碑
机器人多种本体 + 家庭新场景
数据集heterogeneous web + robot data
上真机
实时
输入模态vision,language,proprioception

π0.5:让机器人「扫地做饭」的 VLA,靠读网课+多机器人混训走出实验室

Physical Intelligence(Kevin Black, Noah Brown, Danny Driess, Chelsea Finn, Sergey Levine, Karl Pertsch 等)。arXiv:2504.16054, 2025。 项目页 · VLAfoundation model 线索 T02open-world generalization

🧠 一句话心智模型:π0 是个「在实验室里能干的 VLA」,π0.5 是「能去陌生家庭干 10–15 分钟家务」的 VLA。秘密不是把模型再变大,而是把一堆「不是这台机器人、不是这个任务」的杂烩数据(其他机器人 / 网络图文 / 高层语义指令 / 网标注)混在一起 co-training——让模型像人一样,靠「书本知识 + 别处经验 + 一点亲身经历」融会贯通。

🎯 为什么重要:机器人要离开实验室,必须「融会贯通」

让 VLA(Vision-Language-Action)模型在没见过的真实房子里执行 10 分钟以上的多阶段任务(清理厨房 / 整理卧室 / 铺床),是 open-world generalization 上的硬骨头。暴力解法是「去更多房子采集更多机器人数据」——但π0.5 的关键洞察是:这不够,也太贵

核心矛盾:现实里人类面对新场景,靠的不全是「亲历」。你第一次去别人家整理厨房,靠的是一辈子见过几千个厨房的视觉常识 + 用过类似家电的经验 + 别人一句话的提示。如果只用「在这个厨房里采的机器人数据」训模型,等于让一个人只靠亲历、不听不看不问——永远做不出 generalist。

π0.5 的答案是 co-training:把多种来源、多种抽象层级的数据,全部塞进同一个 VLA 序列建模框架里一起训。关键数据点来自论文 §IV:

π0.5 预训练阶段的数据构成(按样本数) 97.6% 非「目标移动机械臂」数据 其他机器人(ME/CE) · 网络图文(WD) · 高层语义(HL) 2.4% 移动机械臂 ~400h, 100 homes ↓ 全部统一为「序列建模」token,喂给同一个 VLA ↓ π0.5 VLA PaliGemma VLM (2B) + action expert (300M) discrete FAST tokens (pre-train) + flow matching (post-train, 10 denoise steps)
图 1:π0.5 训练配方——只有 2.4% 是目标机器人的直接经验,剩下 97.6% 是「他山之石」。这个比例倒过来才是反直觉的关键。

💡 核心思想:层级化推理 + 异构数据 co-training

π0.5 把「做一个任务」拆成两个层次的预测,而且两个层次用同一个模型

用户高层指令 ℓ:「clean the kitchen」 高层推理 π(ℓ̂ | o, ℓ) — 类似 chain-of-thought → 输出语义子任务:「pick up the plate」 / 「put cup in sink」 / ... 低层推理 π(a | o, ℓ̂) — flow matching action expert → 输出连续动作 chunk at:t+H(H=49,50 Hz)
图 2:两阶段推理——同一个 VLA 既当「大脑」做语义规划,又当「小脑」生成连续动作。分解式:π(a, ℓ̂ | o, ℓ) = π(a | o, ℓ̂)·π(ℓ̂ | o, ℓ)。

这个层级分解让模型可以同时从两个层级「吸」数据:低层 action 数据来自其他机器人和直接经验;高层语义来自网络图文、caption、VQA 和人类口头指令。这正是 co-training 之所以能起作用的形式化基础。

🛠️ 怎么做到的:五个工程关键

设计心智关键数字(来自 PDF)
① 异构数据 co-training把 MM / ME / CE / HL / WD / VI 六类数据,统一成 token 序列喂同一个 VLAMM ≈ 400 小时(约 100 个家庭);非 MM 占 97.6%
② 双 action 表示预训练用 FAST 离散 token(训练快);后训练加 flow-matching 连续 action expert(推理快+精度高)α=10.0 平衡两项 loss;推理用 10 步去噪
③ 层级推理同一模型先输出语义子任务,再生成动作;类似 chain-of-thoughtH=49(50 Hz × ~1s);动作维度 18-19
④ Verbal instruction(VI)人类「用语言遥控」机器人,等于给高层策略做 demoVI 仅占高层样本 11%,但消融显示「去 VI」掉得很明显
⑤ Action expert 与 VLM 解耦用 attention mask 让信息单向流(VLM → action expert),两套权重不互相干扰action expert 300M,VLM 2B(PaliGemma backbone)
🔮 直觉:为什么「混合训练 + 层级推理」是关键?
把高层语义和低层动作塞进同一个序列建模框架,意味着模型在学「pick up the plate」这个 token 串时,同时在用网络图文 / caption 数据强化 plate 是什么、在哪,又在用机器人数据学到抓取动作。两边梯度都对同一个 backbone 起作用,知识就「渗透」过去了。层级推理只是把这种「渗透」在推理时显式地解码出来。

📊 关键结果:在没见过的真实房子里干 10–15 分钟家务

维度结果
真实家庭部署3 个训练时没见过的真实家庭,clean kitchen / bedroom 任务成功
任务时长多阶段任务持续 10–15 分钟(如把所有盘子放进水槽、把所有衣服放进洗衣篮)
跨场景规模实验3 / 12 / 22 / 53 / 82 / 104 个家庭训练,性能随场景数稳定提升;104 个家庭的模型≈「见过测试家庭」的上限
消融:去 ME/CE(其他机器人)性能显著下降——跨具身迁移是 generalization 的最大功臣
消融:去 WD(网络数据)对 in-distribution 影响小,但对 OOD 物体显著下降(网络数据带来「物体是什么」的常识)
对比 π0 / π0-FAST+Flowπ0.5 显著胜出,即便给 π0 训到 300k 步也追不上
高层推理消融用 GPT-4 当高层策略效果最差;π0.5 自身既做高层又做低层最好;甚至超过 human oracle 高层
关键洞察:π0.5 不是赢在「模型大」,而是赢在「训练数据的异构性 + 层级化分解」。一个反直觉的点是——用 GPT-4 当高层策略反而最差,因为没在机器人数据上 adapt 过;而把高层推理放进同一个 VLA 里一起训,效果比单独跑一个 VLM 当大脑还好。这说明「高层推理」不是单纯的语义问题,它需要接地(grounding)到这台机器人的能力

🌐 在领域中的位置

RT-1/RT-2(单任务 / 单具身 VLA) OpenVLA / Octo / π0(多任务 VLA,action expert) π0.5(异构 co-training + 层级推理 + open-world)⭐ GR00T / Gemini Robotics(通用人形 VLA)

π0.5 是 VLA 从「会做事」走向「会泛化到陌生环境做事」的分水岭。它的 co-training 配方(特别是把网络数据 / 高层语义 / 跨具身数据融进同一个序列建模框架)成了后续通用人形 VLA 的标准操作。关联线索:T06 基础模型谱系

❓ 常见误区

π0.5 是一个比 π0 大很多的模型吗?

不是。两者用几乎相同的 VLM 骨干(PaliGemma 2B + 300M action expert)。差异在训练数据配方——π0.5 加了 HL/WD/VI/ME/CE 等异构数据源,并引入层级推理。论文 §V.D 显示,把 π0 训更久也追不上 π0.5,证明增益来自数据 + 范式而非规模。

「去网络数据」消融为什么不显著?

在 in-distribution 物体上确实差异不大;但 OOD 物体(从未在机器人数据中出现的类别,如漏斗、点火器)掉得非常明显。网络数据的作用是扩展语义知识,而非提升已熟悉物体的操作能力。

为什么高层推理用同一个模型,而不是用 GPT-4 当大脑?

论文做了这个对照(§V.E):GPT-4 高层最差,π0.5 自身既做高层又做低层最好,甚至超过 human oracle。原因是高层推理必须接地到这台机器人能做什么——纯语言模型不知道「这台机械臂够不到那个架子」,就会给出做不到的子任务。

π0.5 已经能商用了?

还不能。论文坦承局限:对某些抽屉把手 / 难开的柜子仍频繁失败;部分可观察性(如擦桌子时手臂挡住 spills)处理不好;高层推理有时会被干扰(反复开关抽屉)。它是个范式证明,不是产品。