枢纽
物理感知
输入模态vision,language

World Action Models 综述:把「想象未来」塞进机器人动作生成

Siyin Wang, Junhao Shi, Zhaoyang Fu 等(复旦大学 + 上海创研院 + NUS)。arXiv:2605.12090v1,2026 年 5 月。 项目主页 openmoss.github.io/Awesome-WAM · foundation_modelssurveyworld models

🧠 一句话心智模型:VLA(视觉-语言-动作)模型只会「看一眼 → 吐动作」,不想象未来,所以碰上需要预判的场景就崩。World Action Model(WAM)就是把「世界模型」(能预测未来)和「动作生成」缝在一起——让模型同时输出「未来会怎么样」+「该做什么」。这篇综述第一次把这堆名字相似的工作(VAM、Video Policy、Action-Conditioned WM…)理成一张干净的分类图:先分「串联 vs 并联」,再分「像素 vs 潜空间」「自回归 vs 扩散」。

🎯 为什么重要:VLA 的「无前瞻」是天花板

RT-2、OpenVLA、$\pi_0$ 等 VLA 模型把语义理解带进了机器人,但它们本质上学的还是「观察 → 动作」的反应式映射。论文开篇直接点出这个 limitation:

核心矛盾:标准 VLA 不显式建模「动作会怎么改变世界」。要倒水时,它不会想象「杯子倾斜 30° 后水会流出来」——它只对当前像素做反应。所以 VLA 在需要预判的任务(长程规划、接触密集、物理推理)上必然泛化差。「让策略有物理前瞻能力」就是把世界模型缝进动作生成的根本动机。

但这一缝,方法名字就爆炸了——有人叫 Video Policy,有人叫 Action-Conditioned World Model,有人叫 VAM,还有人就是「带视频头的 VLA」。这篇综述的第一贡献是把术语乱象理顺:WAM 是一个伞概念,下分 Cascaded 和 Joint 两大架构范式,再细分各类生成机制。

💡 核心思想:WAM 的核心是联合分布 $p(o', a \mid o, l)$

论文给 WAM 下的形式化定义非常干净——它要同时满足两条:

WAM 的两个充要条件:
① Forward Predictive Modeling——必须显式或隐式地预测未来状态 $o'$(可以是 RGB 视频、潜空间、光流、点云等);
② Coupled Action Generation——动作 $a$ 必须与预测的未来状态 $o'$ 耦合,要么联合输出,要么以 $o'$ 为条件生成。

写成概率目标:

$$\mathcal{L}_{\text{WAM}} = \mathbb{E}_{(o,l,o',a)\sim\mathcal{D}}\left[-\log p(o', a \mid o, l)\right]$$

把 $p(o', a | o, l)$ 这个联合分布怎么分解,就决定了架构范式。

VLA $(o, l) \to a$ 只预测动作 WAM ⭐ $(o, l) \to (o', a)$ 预测未来 + 动作 WM $(o, a) \to o'$ 只预测未来 WAM = VLA 的「动作生成」+ WM 的「状态预测」 Cascaded WAM(串联) 先预测未来,再从未来推动作 $p(o', a|o,l) = p(a|o',o,l)\, p(o'|o,l)$ Explicit(像素空间) 先合成 RGB/深度/3D 视频 → IDM / 几何提取 / 跟踪 推出动作 UniPi, VLP, AVDC, TesserAct, Gen2Act... Implicit(潜空间) 中间载体是 latent representation → 动作模型从 latent 解码 VPP, VILP, S-VAM, MWM, Video Policy... Joint WAM(并联) 单模型同时吐未来 + 动作 联合训练 $p(o', a|o,l)$ Autoregressive(自回归) token 化,next-token 预测 显式解耦 / 统一离散 / 预测 latent GR-1/2, CoT-VLA, WorldVLA, F1, VLA-JEPA... Diffusion-based(扩散) 用扩散/流匹配联合去噪 unified stream / multi-stream Cosmos Policy, UWM, PAD, DreamZero, FLARE...
图 1(据论文 Fig.1 + Fig.5 重绘):WAM 的核心分类树。Cascaded 是「先想象再执行」(两阶段),Joint 是「同时输出」(单模型)。

🛠️ WAM 的四大设计维度

维度选项关键权衡
① 架构耦合Cascaded(串联)/ Joint(并联)Cascaded 模块解耦、易诊断,但两阶段误差累积;Joint 端到端、信息无损,但训练和推理成本高,「显式像素预测是否必要」仍是开放问题(论文 §7 指出有些方法在推理时砍掉未来预测头也不掉点)
② 生成机制Autoregressive(token 化)/ Diffusion(去噪)AR 因果性强但误差传播严重(早期视觉幻觉级联到动作失败);Diffusion 可并行 refine 但延迟高,难满足实时控制
③ 中间表征像素 RGB / Latent / Flow / 3D / 多模态(触觉、力)RGB 最通用但计算贵;Latent 紧凑但可解释性差多模态是开放前沿(接触密集任务的关键信息不在 RGB 里)
④ 动作解码 IDM 学习 / 几何闭式 / 同模型共解码 / 流匹配头IDM 在 AR 路线里是独立模块;几何闭式(如点跟踪)适合刚性平移;Joint 路线倾向「同模型共解码」以共享表征
🔮 直觉:Cascaded 还是 Joint?
类比人类:「先想清楚要干什么(想象未来),再决定手怎么动(生成动作)」是 Cascaded;「边想边做、想和做在大脑里同时进行」是 Joint。前者模块清晰、可调试,适合早期探索;后者表征共享、信息无损,是 scaling 的方向。论文指出目前没有控制变量的对比实验证明哪种范式本质更好——「架构时尚 vs 原理设计」是领域要补的课。

📊 综述的核心产出:分类法 + 数据生态 + 评测体系 + 开放挑战

维度内容(来自原文)
覆盖文献横跨 2024-2026 三年,数百篇论文(图 1 时间轴 + 表 2/3 各路线汇总)
四大数据源(1) 机器人遥操(DROID, OXE, AgiBot World)(2) 便携式人类演示(UMI 系列)(3) 仿真(MimicGen, RoboCasa, RoboTwin 2.0)(4) 互联网第一人称视频(Ego4D, EPIC-KITCHENS, EgoVid-5M)
评测三轴Visual Fidelity(PSNR/SSIM/LPIPS/DreamSim/FVD)+ Physical Commonsense(VideoPhy, PhyGenBench, VBench-2.0, Physics-IQ)+ Action Plausibility(WorldSimBench IDM Turing Test)
动作评测MetaWorld / RLBench / LIBERO / CALVIN / SimplerEnv / RoboArena 等通用 + 双臂/humanoid/移动操作/接触变形四大专用
明确开放挑战7 大方向:架构耦合对比、多模态物理状态、数据混合原理、长程规划、推理延迟(DreamZero 才 7Hz,落后非生成 VLA 的 50Hz 一个数量级)、评测方法学、安全部署
关键洞察:综述最值得记的不是分类树本身,而是它点出的「评测危机」——当前 WAM 评测世界模型和动作模型各评各的,没有 joint metric 量化「想象和执行是否因果一致」。Wow-wo-val! 这篇论文做 IDM Turing Test:让 IDM 从生成的视频反推动作,再到真机执行,发现「很多视觉好看的视频反推出来的动作根本跑不通」。这暴露了 WAM 的核心问题——视觉 plausibility ≠ 动作 plausibility。论文呼吁社区建立「反事实一致性」「前瞻条件成功率」等联合评测指标。

🌐 在领域中的位置

经典 model-based RL(Dreamer 系列) VLA(RT-2, OpenVLA, $\pi_0$) Action-Conditioned World Model / Video Policy(命名混乱期) WAM 综述:统一命名 + 分类 ⭐ 多模态、长程、低延迟的通用 WAM

这篇综述的定位是「领域命名共识的奠基」。在它之前,Cosmos Policy、UWM、DreamZero 这些工作叫法各异,缺乏共同语言;它给出 WAM = $p(o', a | o, l)$ 这个干净的形式化定义,把所有相关工作纳入同一坐标。后续研究(包括本批 5 篇里的 Dream-Tac,它就是「触觉扩展的 Joint WAM」)都可以放在这张分类图里定位。

❓ 常见误区

WAM 和 Action-Conditioned World Model 是一个东西吗?

不完全。Action-Conditioned WM 是「给定动作预测未来」$p(o'|o,a)$,是 WAM 的一个组件。WAM 还要满足「动作必须与预测的未来耦合生成」——即不能只是「分别训个 WM 和 VLA」,而要让 $o'$ 真正参与 $a$ 的生成。论文用这两个条件把 WAM 和「带 WM 辅助的 VLA」区分开。

WAM 比纯 VLA 强多少?

综述引用了一些证据:例如 Ctrl-World 通过在「想象」中合成复杂任务的成功轨迹做监督微调,使 $\pi_{0.5}$-DROID 在下游任务成功率提升 44.7%(注:是 Ctrl-World 而非 RoboScape;RoboScape 在综述里是另一条证据,证明 VLA 在其合成数据上训练能达到接近真机 demo 的水平)。但要谨慎——综述也指出目前没有控制变量的大规模对比证明 WAM 必然优于 VLA。一些研究(论文 §7)发现推理时砍掉未来预测头性能不降,说明 WAM 的收益可能主要来自训练时的辅助梯度而非推理时的预测。

那为什么还要把未来预测留在推理时?

这是开放问题。留在推理时的好处:(1)可解释——能可视化模型在想什么;(2)支持规划——可以用未来预测做 MPC-like 滚动;(3)支持人类/外部干预——人看到模型想象的未来可以提前纠错。坏处:延迟税。所以论文指出未来方向是「任务自适应预测精度」——简单任务不预测、复杂任务才预测。