DreamZero:让「会画视频的模型」直接当机器人策略
这个反转变天了——视频生成模型从互联网海量视频中已经学到了物理规律和动作多样性,所以它能在没见过的任务和环境里也做对,甚至能用人类/其他机器人的纯视频(无动作标注)迁移技能。
🎯 为什么重要:VLA 的「语义通」≠「动作通」
过去两年,VLA(视觉-语言-动作)模型把 RT-2、π0、GR00T 这类大模型推向了机器人,它们能听懂「把可乐递给 Taylor Swift」这种指令。但 NVIDIA 团队发现一个尴尬的事实:
比如「解鞋带」「熨衣服」这种训练集里没出现过的动作,VLA 几乎 0 通过率——它只会把学过的「抓取-放置」套路硬套上去。
根本原因:VLA 从静态图文预训练而来,缺乏「时空物理先验」。DreamZero 的答案是把 backbone 换成视频扩散模型——视频天然编码了「世界怎么随时间变化」。
💡 核心思想:联合预测「未来视频 + 未来动作」,再分而治之
数学上,DreamZero 把策略 $\pi(o_{l:l+H}, a_{l:l+H} \mid o_{0:l}, c, q_l)$ 拆成了两个条件分布的乘积——视频预测 × 逆动力学模型(IDM):
$$ \pi(o_{l:l+H}, a_{l:l+H}) = \underbrace{\pi(o_{l:l+H} \mid o_{0:l}, c, q_l)}_{\text{视频预测(视觉规划)}} \cdot \underbrace{\pi(a_{l:l+H} \mid o_{0:l+H}, q_l)}_{\text{IDM(从视频反推动作)}} $$关键决定:不分两个模型,而是端到端联训,让视频和动作共享 DiT 主干、共享 flow-matching 去噪目标——这就是「World Action Model(WAM)」名字的由来。
🛠️ 把 14B 视频扩散跑到 7Hz:三层工程优化
14B 参数 + 16 步去噪 = 一次推理 5.7 秒——根本不能闭环。DreamZero 的工程贡献是把它压到 150ms(38× 加速)。三层叠加:
| 层级 | 优化 | 加速倍数(GB200 累积) |
|---|---|---|
| ① 系统 | CFG 双卡并行(条件/无条件分两 GPU) + DiT 缓存(速度方向相似时复用) | 5.4× |
| ② 实现 | torch.compile + CUDA Graphs + NVFP4 量化(敏感算子保 FP8) + cuDNN attention | 16.6× |
| ③ 模型(Flash) | 解耦噪声调度:视频时间步偏向高噪 Beta(7,1),动作时间步保持均匀——专门训「视频还糊时就能出干净动作」 | 38×(去噪步从 4→1) |
4 步去噪时,去噪到第 1 步视频还是糊的,但动作必须已经干净——这和训练时(视频/动作同步噪声)分布不匹配。Flash 故意让训练时视频噪声大(Beta(7,1) 偏向高噪)、动作噪声保持均匀,逼模型学会「看糊图也能出干净动作」。结果:1 步推理就能拿到 4 步 83% 中的 74%,仅掉 9 个点。
另外两个架构选择同样关键:
| 选择 | 原因 |
|---|---|
| 自回归(AR)而非双向 | 双向 diffusion 要求定长序列 → 必须对视频抽帧 → 破坏原始 FPS → 视频/动作错位。AR + KV cache 可以保留原生帧率,视频/动作严格对齐。 |
| 真实观察回灌 KV cache | 纯自回归视频生成本会有误差累积(snowball)。但闭环设置下,每个 chunk 执行完后用真实观察覆盖 KV 中的预测帧——误差不再累积。这是 WAM 相对纯视频生成的独特优势。 |
📊 关键结果:对 SOTA VLA 的全面碾压
所有评估都是未见环境 + 未见物体(训练地与评测地地理上不同)。AgiBot G1 用约 500 小时自主收集数据;Franka 用公开 DROID。
| 评测维度 | DreamZero | 最强 VLA baseline(π0.5 / GR00T N1.6 预训练版) |
|---|---|---|
| AgiBot 已见任务(task progress) | 62.2% | 27.4%(最强 pretrained VLA 基线) |
| AgiBot 未见过任务(10 个,如解鞋带、熨衣) | 39.5% | 16.3% |
| DROID-Franka 未见过任务 | 49% task progress / 22.5% success | 33% / 7.5%(π0.5);31% / 12.5%(GR00T N1.6) |
| Post-training 后环境泛化 | 3 任务平均 79.8% | 53.3%(pretrained π0.5) |
| 跨本体:人/机器人 → AgiBot(10–20 分钟纯视频) | 38.3% → 54.3% / 55.4%(+42% 相对) | — |
| 少样本新本体适配(YAM,30 分钟 play data) | 可零样本,保语言跟随 | — |
| 推理延迟 | 150ms / chunk(7Hz) | — |
🌐 在领域中的位置
DreamZero 是 WAM 范式的标志性工作——它把「视频扩散 → 机器人策略」从论文级 demo 推到了真机实时闭环 + 跨本体迁移的可用门槛。它和 OSCAR(动作条件世界模型做策略评测)、Cosmos(通用视频世界模型)一起,构成了 2026 年「视频即模拟器」浪潮的核心三件套。
❓ 常见误区
视频扩散模型不是用来生成视频的吗?怎么当策略?
DreamZero 训练时同时让模型输出「未来视频」和「未来动作」两个 chunk。推理时,动作 chunk 直接送给机器人执行——视频是「副产品」(也是隐式的视觉规划器)。所以它仍是一个端到端策略,不是「先生成视频再跑单独的策略」。
7Hz 听起来很慢,能做精细任务吗?
对双臂操作(AgiBot G1、YAM)够用。论文用一个 action chunk 48 步 @30Hz(≈1.6s)+ 异步推理,机器人执行上一个 chunk 时 GPU 并行算下一个。真正要求毫秒级响应的任务(高动态抛接等)暂不是它的目标场景。
「跨本体 30 分钟」是真的零样本吗?
是 post-training。先用 AgiBot G1 的 500 小时数据训出基础 WAM,再用 YAM 的 30 分钟 play 数据(55 条轨迹)继续训练。但评测时是零样本(未见物体 + 未见语言注释),证明 30 分钟足以让 IDM 学会新本体,而语言理解和物理先验都保住了。
和 OSCAR、Cosmos 这些视频世界模型有什么区别?
OSCAR 用视频 WM 做策略评测代理(替代真机评测);Cosmos 是通用视频 WM(不带动作)。DreamZero 是策略本身——它直接出动作控制真机。三者都用视频扩散 backbone,但角色不同:评测器 / 通用基座 / 策略。