枢纽
上真机
物理感知
实时
输入模态vision,language,proprioception

DreamZero:让「会画视频的模型」直接当机器人策略

Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng 等(NVIDIA,30+ 作者)。arXiv:2602.15922(2026-02)。 项目页 · 模型权重 + 推理代码全开源 · foundation modelsworld action modelvideo diffusion 线索

🧠 一句话心智模型:与其让大模型「看到图像 → 直接回归动作」(VLA 的做法),不如让它先在脑子里「画出」未来几秒会发生的视频,再从这段视频中「反推」出每一步动作。
这个反转变天了——视频生成模型从互联网海量视频中已经学到了物理规律和动作多样性,所以它能在没见过的任务和环境里也做对,甚至能用人类/其他机器人的纯视频(无动作标注)迁移技能。

🎯 为什么重要:VLA 的「语义通」≠「动作通」

过去两年,VLA(视觉-语言-动作)模型把 RT-2、π0、GR00T 这类大模型推向了机器人,它们能听懂「把可乐递给 Taylor Swift」这种指令。但 NVIDIA 团队发现一个尴尬的事实:

核心痛点:VLA 学到了「该做什么」(语义),但没学到「怎么动」(精细的几何 + 动力学 + 运动控制)。
比如「解鞋带」「熨衣服」这种训练集里没出现过的动作,VLA 几乎 0 通过率——它只会把学过的「抓取-放置」套路硬套上去。

根本原因:VLA 从静态图文预训练而来,缺乏「时空物理先验」。DreamZero 的答案是把 backbone 换成视频扩散模型——视频天然编码了「世界怎么随时间变化」。

VLA(VLM → 动作) 静态图文预训练 · 语义泛化 ✓ · 新物体 ✓ · 新动作 ✗(崩) · 新环境 ✗ 缺时空先验 早期 WAM 视频扩散 + 动作头 · 时序先验 ✓ · 仍要重复演示 · 推理太慢(秒级) · 跨本体弱 不够工程化 DreamZero ✅ 14B 自回归视频扩散 · 异构数据可学 ✓ · 零样本新任务 ✓ · 7Hz 实时闭环 · 30min 适配新本体 把三件事一起做对
图 1:DreamZero 在 VLA → WAM 演进路径上的位置。它是第一个把「视频扩散当策略」做到 7Hz 实时 + 跨本体迁移的工作。

💡 核心思想:联合预测「未来视频 + 未来动作」,再分而治之

数学上,DreamZero 把策略 $\pi(o_{l:l+H}, a_{l:l+H} \mid o_{0:l}, c, q_l)$ 拆成了两个条件分布的乘积——视频预测 × 逆动力学模型(IDM)

$$ \pi(o_{l:l+H}, a_{l:l+H}) = \underbrace{\pi(o_{l:l+H} \mid o_{0:l}, c, q_l)}_{\text{视频预测(视觉规划)}} \cdot \underbrace{\pi(a_{l:l+H} \mid o_{0:l+H}, q_l)}_{\text{IDM(从视频反推动作)}} $$

关键决定:不分两个模型,而是端到端联训,让视频和动作共享 DiT 主干、共享 flow-matching 去噪目标——这就是「World Action Model(WAM)」名字的由来。

输入 图像+语言+本体状态 14B 自回归 DiT (Wan2.1-I2V backbone) 分块去噪 + KV cache teacher-forcing 训练 未来视频 chunk 未来动作 chunk 真机执行 真实观察回灌 KV
图 2:DreamZero 架构。单一 DiT 主干同时输出视频和动作;闭环执行时把真实观察回写到 KV cache,消除了自回归视频生成固有的误差累积。

🛠️ 把 14B 视频扩散跑到 7Hz:三层工程优化

14B 参数 + 16 步去噪 = 一次推理 5.7 秒——根本不能闭环。DreamZero 的工程贡献是把它压到 150ms(38× 加速)。三层叠加:

层级优化加速倍数(GB200 累积)
① 系统CFG 双卡并行(条件/无条件分两 GPU) + DiT 缓存(速度方向相似时复用)5.4×
② 实现torch.compile + CUDA Graphs + NVFP4 量化(敏感算子保 FP8) + cuDNN attention16.6×
③ 模型(Flash)解耦噪声调度:视频时间步偏向高噪 Beta(7,1),动作时间步保持均匀——专门训「视频还糊时就能出干净动作」38×(去噪步从 4→1)
🔮 直觉:为什么 Flash 的「解耦噪声」是点睛之笔?
4 步去噪时,去噪到第 1 步视频还是糊的,但动作必须已经干净——这和训练时(视频/动作同步噪声)分布不匹配。Flash 故意让训练时视频噪声大(Beta(7,1) 偏向高噪)、动作噪声保持均匀逼模型学会「看糊图也能出干净动作」。结果:1 步推理就能拿到 4 步 83% 中的 74%,仅掉 9 个点。

另外两个架构选择同样关键:

选择原因
自回归(AR)而非双向双向 diffusion 要求定长序列 → 必须对视频抽帧 → 破坏原始 FPS → 视频/动作错位。AR + KV cache 可以保留原生帧率,视频/动作严格对齐。
真实观察回灌 KV cache纯自回归视频生成本会有误差累积(snowball)。但闭环设置下,每个 chunk 执行完后用真实观察覆盖 KV 中的预测帧——误差不再累积。这是 WAM 相对纯视频生成的独特优势

📊 关键结果:对 SOTA VLA 的全面碾压

所有评估都是未见环境 + 未见物体(训练地与评测地地理上不同)。AgiBot G1 用约 500 小时自主收集数据;Franka 用公开 DROID。

评测维度DreamZero最强 VLA baseline(π0.5 / GR00T N1.6 预训练版)
AgiBot 已见任务(task progress)62.2%27.4%(最强 pretrained VLA 基线)
AgiBot 未见过任务(10 个,如解鞋带、熨衣)39.5%16.3%
DROID-Franka 未见过任务49% task progress / 22.5% success33% / 7.5%(π0.5);31% / 12.5%(GR00T N1.6)
Post-training 后环境泛化3 任务平均 79.8%53.3%(pretrained π0.5)
跨本体:人/机器人 → AgiBot(10–20 分钟纯视频)38.3% → 54.3% / 55.4%(+42% 相对)
少样本新本体适配(YAM,30 分钟 play data)可零样本,保语言跟随
推理延迟150ms / chunk(7Hz)
关键洞察:失败模式几乎都来自「视频预测错了」,而不是「动作解码错了」——一旦视频对,动作就对。这暗示了一个清晰的迭代方向:把视频 backbone 做得更好,WAM 的能力上限会跟着涨。论文还做了一个决定性消融:500 小时多样数据 vs 500 小时重复数据,前者把 PnP-Easy 从 33% → 50%。「多样 > 重复」这个反直觉结论,是 WAM 范式的招牌特征。

🌐 在领域中的位置

RT-2 / VLA(VLM 蒸馏出动作) π0 / GR00T(大规模机器人数据 + flow matching 动作头) DreamZero / WAM(视频扩散作策略)⭐ 视频 prior 主导的具身大模型时代

DreamZero 是 WAM 范式的标志性工作——它把「视频扩散 → 机器人策略」从论文级 demo 推到了真机实时闭环 + 跨本体迁移的可用门槛。它和 OSCAR(动作条件世界模型做策略评测)Cosmos(通用视频世界模型)一起,构成了 2026 年「视频即模拟器」浪潮的核心三件套。

❓ 常见误区

视频扩散模型不是用来生成视频的吗?怎么当策略?

DreamZero 训练时同时让模型输出「未来视频」和「未来动作」两个 chunk。推理时,动作 chunk 直接送给机器人执行——视频是「副产品」(也是隐式的视觉规划器)。所以它仍是一个端到端策略,不是「先生成视频再跑单独的策略」。

7Hz 听起来很慢,能做精细任务吗?

对双臂操作(AgiBot G1、YAM)够用。论文用一个 action chunk 48 步 @30Hz(≈1.6s)+ 异步推理,机器人执行上一个 chunk 时 GPU 并行算下一个。真正要求毫秒级响应的任务(高动态抛接等)暂不是它的目标场景。

「跨本体 30 分钟」是真的零样本吗?

是 post-training。先用 AgiBot G1 的 500 小时数据训出基础 WAM,再用 YAM 的 30 分钟 play 数据(55 条轨迹)继续训练。但评测时是零样本(未见物体 + 未见语言注释),证明 30 分钟足以让 IDM 学会新本体,而语言理解和物理先验都保住了。

和 OSCAR、Cosmos 这些视频世界模型有什么区别?

OSCAR 用视频 WM 做策略评测代理(替代真机评测);Cosmos 是通用视频 WM(不带动作)。DreamZero 是策略本身——它直接出动作控制真机。三者都用视频扩散 backbone,但角色不同:评测器 / 通用基座 / 策略。