⏱ ~35 min
里程碑
⭐ 为何重要

Physical Intelligence 在 π0 之上的升级版,引入开放世界泛化能力,是『VLA + flow matching』走向通用化的代表作。承上 π0,启下『VLA 进家用/真实工业部署』方向,是工业级 VLA 的新基线。

建立在
催生
  • pi0-FAST
  • future household VLA
  • π0.5-KI
  • 家用 VLA
机器人多种本体 + 家庭新场景
数据集heterogeneous web + robot data
上真机
实时
输入模态vision,language,proprioception

P-pi05-2025 · π0.5:VLA 的开放世界泛化

一句话定位:把 π0 的 flow-matching VLA 升级成「异构数据 co-training + 两阶段分层推理」系统,第一次让端到端 VLA 在完全没见过的真实家庭里执行 10–15 分钟的多阶段清理任务(厨房/卧室),用「先预测语义子任务、再生成动作」的链式推理拿到 SOTA
完整引用:Kevin Black, Noah Brown, James Darpinian, Karan Dhabalia, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Manuel Y. Galliker, Dibya Ghosh, Lachy Groom, Karol Hausman, Brian Ichter, Szymon Jakubczak, Tim Jones, Liyiming Ke, Devin LeBlanc, Sergey Levine, Adrian Li-Bell, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Allen Z. Ren, Lucy Xiaoyang Shi, Laura Smith, Jost Tobias Springenberg, Kyle Stachowicz, James Tanner, Quan Vuong, Homer Walke, Anna Walling, Haohuan Wang, Lili Yu, Ury Zhilinsky (Physical Intelligence). π0.5: a Vision-Language-Action Model with Open-World Generalization. arXiv:2504.16054, 22 Apr 2025.
项目页pi.website/blog/pi05 · 基于:π0 [Black et al. 2024, arXiv:2410.24164](本仓库 P-pi0-2024.md
在线索中的位置:见 T06-vla-five-stages.md(VLA 第五阶段:open-world generalization)+ T05-diffusion-policy-lineage.mdflow matching 主线)+ T10-vla-wbc-integration.md(语言子指令分层)。


动机:VLA 出了实验室就垮

π0 [Black et al. 2024, arXiv:2410.24164] 已经证明 flow-matching VLA 在叠衣服、装购物袋这类实验室里的长程灵巧家务上能跑通。但论文最后一节也承认:换个厨房、换个卧室,成功率和语言跟随率都跳水。原因不是模型容量不够,而是数据组分太单一——所有训练 episode 都来自同一组机器人、同一组场景。如果你想让机器人去它从没见过的家庭清理厨房,靠"在更多家庭里 brute-force 采数据"是行不通的:场景组合数是组合爆炸。

π0.5 的洞察是:人类到新家做家务并不只靠"亲手做过",还靠 lifelong 异构知识——读过的书、听过的指令、在别处干过的活、看过的图片。VLA 的序列建模框架天然支持把所有这些异构信号塞进同一个 next-token-prediction 目标。于是 π0.5 的核心问题变成:怎么配这一锅异构数据,怎么让同一组权重同时学到低层动作控制和高层语义推理? 这就是论文标题里 "co-training recipe" 的来由。

方法核心

1. 架构:同一个 transformer 同时输出文本与连续动作

π0.5 沿用 π0 的「VLM backbone + 小 action expert」双专家结构,并扩展到能同时吐文本 token连续动作 chunk

  • VLM backbone:SigLIP 400M 视觉编码器 + Gemma 2B(部分实验 2.6B)语言模型。所有图像 patch、文本 token、离散化动作 token 都喂进这个主干。
  • Action expert:~300M 参数的"小脑袋",专门吃"前一步去噪的动作"并输出 flow-matching 向量场。只在 post-training 阶段引入,初始化为随机权重。
  • 混合 token + 块状 attention:tokens 分三类(文本 / 图像 patch / 动作),不同类型用不同 expert 权重;text 与 image patch 之间用bidirectional attention,跨文本-动作-图像的总体顺序仍是 causal。这样保证 FAST 离散动作 token 和 flow 连续动作 token 不会互相 attend(论文 Sec.IV-B 原话:"use the attention matrix to ensure that the different action representations do not attend to each other")。

模型输出的联合分布被因式分解成两层:

$$\pi_\theta(a_{t:t+H},\,\hat\ell\,|\,o_t,\ell)\;=\;\underbrace{\pi_\theta(a_{t:t+H}\,|\,o_t,\hat\ell)}_{\text{low-level}}\cdot\underbrace{\pi_\theta(\hat\ell\,|\,o_t,\ell)}_{\text{high-level}}$$

其中 $\ell$ 是用户给的总任务 prompt("clean the kitchen"),$\hat\ell$ 是模型自 predicting 的子任务("pick up the plate"),$a_{t:t+H}$ 是动作 chunk。两层用同一个 transformer,只是 high-level 用文本 logits、low-level 用 action expert。

2. 离散 + 连续动作的混合训练目标(Eq.1)

这是 π0.5 相对 π0 最关键的结构创新。同一个模型被同时训成「FAST token autoregressive」和「flow matching」两种动作表示:

$$\mathcal{L} \;=\; \underbrace{H\!\left(x_{1:M},\, f_{\theta_\ell}(o_t,\ell)\right)}_{\text{text + FAST token CE}} \;+\; \alpha\,\big\|\omega - a_{t:t+H} - f_{\theta_a}(a^{\tau,\omega}_{t:t+H}, o_t, \hat\ell)\big\|^2$$

其中 $H(\cdot)$ 是文本 token(含 FAST 编码后的离散动作 token)的交叉熵,第二项是 π0 风格的 flow matching loss($\tau\in[0,1]$ 是流时间,$\omega\sim\mathcal{N}(0,I)$ 是噪声样本),$\alpha\in\mathbb{R}$ 是权衡系数。关键技巧:训练时把 $\alpha$ 设为 0 就是纯 VLM/离散动作训练;把 $\alpha$ 拉到 10 就同时训 flow expert。

为什么这么做?因为 [Pertsch et al. 2024, FAST] 已经证明:离散 token 训练更快、更稳、更 scalable,但推理时 autoregressive decode 太慢做不到 50Hz 实时控制。Flow matching 反过来:训练慢、推理快(10 步去噪)。π0.5 的解法是 pre-training 用离散,post-training 加 flow expert,鱼和熊掌兼得。

3. 两阶段训练流程(Fig.3)

Stage 1 · Pre-training(280k 步):纯离散 token + next-token prediction,没有 action expert。数据组分:

代号内容占比(第一阶段)
MM多环境移动机械臂数据 ~400h × 100 个家庭仅 2.4%
ME多环境非移动(单臂/双臂固定)数据中等
CE实验室跨本体采集(bussing table / fold shirt 等)中等
HL高层子任务预测(自动标注 + 人写)中等
WD多模态网络数据(CapsFusion / COCO / Cambrian-7M / PixMo / VQAv2 + 自采 indoor bbox)大头

⚠️ 论文 Sec.I 原话:"The overwhelming majority of training examples provided to π0.5 (97.6% during the first training phase) do not come from mobile manipulators performing household tasks"。这是 π0.5 最反直觉的设计:真正部署的机器人数据只占 2.4%,剩下的全是"侧信道"知识。

Stage 2 · Post-training(80k 步,$\alpha=10$):保留 next-token loss + 新加 flow matching loss。新初始化 action expert,数据组分收敛到 MM + ME + HL + WD + VI(verbal instruction)。VI 是用已训好的低层 policy 实时跑、人在边上用自然语言"遥控"出子任务标签,相当于给高层 policy 做 demonstration。CE 在这一阶段被剔除——CE 的实验室场景与真实家庭偏差大,finetune 时拉低性能。

4. 推理:两遍 forward,子任务先于动作

每一步推理:

  1. High-level pass:把所有 4 个相机(前、后、双腕)+ 文本 prompt 喂进模型,autoregressive decode 出一个子任务 token 串 $\hat\ell$(如 "pull out the top right drawer");
  2. Low-level pass:用前相机 + 双腕相机 + 子任务 $\hat\ell$ 作为条件,跑 10 步 flow matching 去噪得到动作 chunk $a_{t:t+H}$;
  3. PD 控制器跟踪 chunk,50 Hz 循环。

没有 trajectory planner、没有碰撞检测、没有显式 navigation stack——所有控制都是端到端。

5. 机器人硬件(Sec.IV-E + Fig.5)

两种 mobile manipulator 平台:

  • 两个 6-DoF 机械臂 + parallel-jaw gripper
  • 全向 holonomic 移动底盘(2D 线速度 + 1D 角速度);
  • torso lift(1-2 DoF);
  • 4 个相机:前、后、双腕;
  • 18-19 DoF 状态/动作空间(两平台差 1 维);
  • 所有动作维度按 1%/99% 分位归一化到 $[-1, 1]$;低维本体用零填充到最大维度。

关键实验

Setup:所有评测都在没见过的家庭进行。定量用 mock kitchens/bedrooms(控制变量),定性在 3 个真实家庭。每个任务跑 10 次取平均,rubric 见 Appendix B(任务被拆成步骤,完成百分比)。

(A) 真实家庭长程任务(Sec.V-A + Fig.7):3 个真实家庭 × 厨房+卧室清理。模型只收 "put the dishes in the sink" 这类总指令,自己生成 "pick up plate → put plate in sink → pick up cup → ..." 序列,单 episode 2-5 分钟,最长 10-15 分钟(整厨房/卧室清理)。这是首次端到端学习系统在新家庭里跑通这种长度。

(B) 泛化 vs 训练环境数(Sec.V-B + Fig.8/9):固定单步样本量,把训练环境数从 3 → 12 → 22 → 53 → 82 → 104 拉一遍。结果:四个任务(dishes in sink / items in drawer / laundry basket / make bed)的平均完成度单调上升;104 环境的模型已经追平"用测试家庭数据训过的 control"——证明 co-training 配方真的填平了泛化 gap,不是靠塞测试家庭。语言跟随率(in-distribution vs OOD 物体)也随环境数增加而增加,OOD 涨得更慢但持续涨。

(C) Co-training 消融(Sec.V-C + Fig.10/11):

  • 去掉 ME 或 CE(任一)→ 性能大幅下降;两者都去 → 更差。跨本体 + 跨环境是泛化主因
  • 去掉 WD 在 mock home 任务上不显著,但在 OOD 物体语言跟随显著掉——猜测 web 数据提供了"什么是 pie、什么是 mitten"的语义先验。
  • 去掉 HL/VI 在 Sec.V-E 单独消融。

(D) vs π0 和 π0-FAST+Flow(Sec.V-D + Fig.12):π0.5 显著超过两个对照,且即使给 π0 多训到 300k 步也追不上 π0.5。说明差距来自 co-training 配方,不是训练 step 数。

(E) 高层推理消融(Sec.V-E + Fig.13)——这篇最有意思的实验:

高层策略结果
完整 π0.5(HL + LL)最好
implicit HL(训练含 HL,推理不显式预测子任务)第二好,离 full 很近
no VI(去掉 verbal instruction 数据)显著掉
no WD显著掉
no HL(训练也去掉 HL)大幅掉
GPT-4 zero-shot 当高层最差
human oracle 当高层居然比 full π0.5 还略差

解读:(1) 把 HL 数据放进训练本身就值回票价,显式 chain-of-thought 推理只是锦上添花;(2) 小份 VI 数据(仅占 post-training HL 部分的 11%)对最终效果至关重要;(3) 用 API GPT-4 当高层比小模型自己预测还差——VLM 必须用机器人数据适配过才能当好高层;(4) π0.5 自己当高层居然超过人类 oracle,作者猜测是模型对"哪些子任务实际可执行"有更准的先验。

为什么重要

  1. VLA 第一次走出实验室。在 π0.5 之前,所有 VLA(RT-2 / OpenVLA / Octo / π0)的"成功"都建立在测试环境与训练环境高度相似的前提上。π0.5 把评测协议本身改了——所有数字都在新家庭上测——这把 VLA 的目标从"复现训练分布"提到"open-world generalization"。
  2. 确立了"co-training recipe"作为 VLA 第一性问题。论文不是在比模型架构(架构基本就是 π0),而是在比数据配方。97.6% 训练样本不是目标机器人/任务这一事实,颠覆了 robotics "more demos is better" 的传统直觉——异构侧信道数据 > 同质实测数据
  3. 统一的 chain-of-thought 式分层。以前分层 VLA 是「两个模型」:高层 VLM 出子任务、底层小 policy 执行。π0.5 证明同一组权重就能同时做两层,且 implicit HL(不显式 decode 子任务)也基本够用。这呼应了 LLM 里 chain-of-thought 与 test-time compute 的最新趋势,但把它落到了真实机器人的长程任务上([T10-vla-wbc-integration.md] 称之为"language sub-instructions"路线的代表)。
  4. 离散 + 连续动作混合训练范式。FAST token + flow matching 的并集训练(Eq.1)解决了「离散好训、连续好推」的两难,已被后续 openpi 复用,成为开源 VLA 的事实起点之一。

局限

  1. 物理 / 部分可观察:论文 Sec.VI 自承三类典型失败——不熟悉的抽屉把手、机械臂遮挡抹水渍、高层陷入"反复开关抽屉"的 loops。这些都是 VLA 没有显式世界模型的固有短板,需要更大 context、更长记忆、或显式物理先验来补。
  2. Prompt 复杂度低:当前只能处理相对简单的清理类指令;复杂偏好、多步约束、跨房间导航还没验证。
  3. 依赖大规模私有数据:~400h mobile manipulator + 多环境 static + 跨本体 lab + 海量 web 数据,只有大厂能复现。openpi 开源了模型权重但不开数据,社区复现困难。
  4. 只在 mobile manipulator 验证:人形 / 单臂桌面 / 四足等本体的迁移效果未知。论文没给 cross-embodiment 的 zero-shot 数字。
  5. 高层推理的"惊喜结果"未必稳健:full π0.5 击败 human oracle 可能是这个特定 mock 测试 rubric 的产物(rubric 偏好系统已学到的子任务顺序);在不同任务分布下未必成立。

复现要点

以下要点基于论文 Sec.IV–V + Fig.3-5 + Appendix E,结合 π0 的 openpi 实现。可直接作为复现起点。

  • VLM backbone:SigLIP 400M + Gemma 2B/2.6B(gemma 2B 是 openpi 默认,2.6B 是论文实验版)。action expert ~300M,结构是 π0 的 MLP-based expert。
  • Pre-training:280k 步、纯 next-token、含 FAST 离散动作 token;actions 按 1%/99% 分位归一化到 $[-1,1]$,低维本体 zero-pad 到统一维度(论文用最大动作维度);prompt 里加 <control mode> joint/end effector <control mode> 区分控制模式。
  • Post-training:80k 步、$\alpha=10$;新初始化 action expert;数据组分剔除 CE、保留 MM + ME + WD + HL + 新加 VI。
  • 推理:4 相机(前/后/双腕)→ autoregressive 出子任务文本 → 用子任务作条件跑 10 步 flow matching → 50 Hz 控制频率 → PD 跟踪 chunk(无 planner、无碰撞检测)。
  • 机器人:18-19 DoF mobile manipulator;action chunk 长度沿用 π0 的 $H=50$。
  • 数据配比:MM ~400h 是关键底盘;HL 由 LLM 自动标注 + 人工校正;VI 由人用自然语言"遥操作"已训好的低层 policy 采集(典型量级是 post-training HL 部分的 ~11%)。
  • 代码起点github.com/Physical-Intelligence/openpi(openpi 仓库,含 π0.5 checkpoint 加载与 finetune API)。社区已知坑:(a) ViT 与 Gemma 之间的投影层需要专门初始化,不能纯 random;(b) flow matching 的 $\alpha=10$ 不是普适,迁移到新数据集时常需重调;(c) FAST tokenizer 需要在自己的数据上重新 fit,跨本体直接借用会损失精度。
  • 常见坑:(1) 高层推理陷入 loop(反复开抽屉)→ 论文无解,社区方案是后处理规则过滤连续相同子任务;(2) 部分可观察导致抹水渍失败 → 需要更多视角相机或显式记忆模块;(3) OOD 物体失败 → 加大 WD 比例或在 target domain 采少量 ME。

延伸

  • 建立在:π0 [Black et al. 2024, arXiv:2410.24164](本仓库 P-pi0-2024.md,flow-matching VLA 范式)、FAST [Pertsch et al. 2024, arXiv:2501.09747](动作 tokenizer)、OpenX-Embodiment [2023, arXiv:2310.08864](本仓库 P-OpenX-2023.md,CE 数据来源之一)。
  • 引出:Hi Robot [PI 2025](π0.5 配套的多轮纠错高层 VLM)、GR00T N1 [NVIDIA 2025, arXiv:2503.14734](本仓库 P-GR00T-N1-2025.md,flow matching + token 路线同类)、Helix [Figure AI 2025](同类人形 VLA,未公开 arXiv)。
  • 对比:RT-2 [arXiv:2307.15818](纯 token 动作,无 flow expert)、OpenVLA [arXiv:2406.09246](开源 VLA 基线,没做 co-training recipe)、Cosmos [arXiv:2501.03575](WFM 路线,与 VLA 互补)。
  • 本仓库笔记:T06-vla-five-stages.md(第五阶段:open-world generalization)、T05-diffusion-policy-lineage.md(flow matching 主线第 3 节)、T10-vla-wbc-integration.md(语言子指令分层代表)、P-pi0-2024.md(前作)。