Cosmos 3:一个模型同时做「理解 + 生成 + 控制」—— Physical AI 的全能骨干
🎯 为什么重要:Physical AI 的范式割裂才是瓶颈
考虑一个「收拾餐桌」的家政机器人。传统做法必须串起一串模型:
NVIDIA 的核心论点(§1):理解需要推理未来,生成需要结构化世界表征——这两件事本来就该在一个模型里。把它们统一进一个可扩展框架,是 Physical AI 真正能 scale 的前提。
| 能力 | 过去的专门模型 | Cosmos 3 里被统一的实现 |
|---|---|---|
| 多模态理解 | VLM(GPT-4V, Qwen-VL) | 只跑 AR 子序列 |
| 图像生成 | Diffusion(SD3, Flux) | AR 给条件 + diffusion 子序列生成图 |
| 视频生成 | 视频 DiT(Sora, Veo, Wan) | diffusion 子序列生成多帧视频 token |
| 音视频联合生成 | 专门音视频模型 | 音频 token 追加在视频 token 后 |
| 视频迁移(控制 → RGB) | ControlNet 类 | 控制视频 token 作条件 + RGB 视频 token 噪声化 |
| 前向动力学(给动作预测下一帧) | World model(Dreamer, GAIA) | 干净动作 token + 噪声视频 token |
| 逆向动力学(给两帧推断动作) | inverse policy | 干净视频 token + 噪声动作 token |
| 机器人策略(联合视频 + 动作) | VLA(π0.5, OpenVLA) | 视频 token 和动作 token 一起去噪 |
💡 核心思想:AR 子序列做推理,Diffusion 子序列做生成;动作是一等模态
三个关键设计:
① 动作是一等模态——和图像、音频并列,有自己的 token、自己的编码器、自己的扩散去噪。动作 token $a_t$ 表示从状态 $v_{t-1}$ 到 $v_t$ 的转移。
② 统一动作表示——所有本体(AV、相机、第一人称、机器人、人形)映射到三种几何原语:ego pose(9D:3D 平移 + 6D 旋转)+ effector pose(9D)+ grasp state(手指/夹爪状态)。不同本体的差异由「域感知投影层」处理(每域独立 $W_\text{in}, W_\text{out}$),主干共享。
③ 多种生成模式 = 不同的 token 排布——文本到图、文本到视频、图到视频、视频到视频、视频迁移、前向动力学、逆向动力学、策略,全是同一个 token 序列框架的不同实例化。
🛠️ 怎么做:架构 + 数据 + 训练三件套
| 组件 | 设计 | 关键决定 |
|---|---|---|
| 视觉编码器(理解) | ViT,16×16 patch + 2×2 token merge;DeepStack 多层特征 | 与主干联合训练,文本视频时间戳交错插入 |
| 视觉编码器(生成) | Wan2.2 视频两阶段 VAE:时间 4× 压缩 + 空间 32×32 | 训练时冻结,避免与主干相互干扰 |
| 音频 VAE | 立体声 48 kHz,hop 1920 → 25 token/秒 | 训练时冻结 |
| 动作表示 | 相对位姿伪动作 $\Delta T_t = T_{t-1}^{-1} T_t$,6D 旋转(OpenCV 约定) | 避开 PID 等本体细节;grasp state 直接编码当前状态而非差分 |
| MoT 双塔 | AR / DM 两套参数,每层 dual-stream joint attention | AR 学推理,DM 学生成;参数不共享避免互相干扰,但每层注意力让信息融合 |
| 训练阶段 | Reasoner 预训练 → SFT;Generator 预训练 → mid-training → 后训练(T2I / I2V / Policy) | 策略后训练从 mid-trained 检查点恢复 |
| 策略后训练(DROID) | 76k 轨迹 / 350 小时 / 86 任务 / 564 场景;15 Hz 控制;joint video-action 预测 | 策略模式:视频和动作 token 一起去噪,模型同时生成「做什么动作」和「会发生什么」 |
| 变体 | 三个规模:Cosmos3-Edge(4B,密集 2B 主干,未发布)/ Cosmos3-Nano(16B,基于 Qwen3-VL 8B)/ Cosmos3-Super(64B,基于 Qwen3-VL 32B) | 论文发布 Nano + Super;Edge 后续发布;任务专用版(Text2Image / Image2Video / Nano-Policy-DROID) |
传统 VLA 只预测动作。Cosmos 3 的策略模式让模型同时预测「下一个动作」和「下一帧视频」——两者一起去噪。好处:模型不再只是「记忆反应」,而是必须用世界模型来约束动作(如果动作会让画面里的杯子穿模,视频 token 就会很难生成)。动作和视频互为正则。这种「世界一致性」是单独训 VLA 学不到的。
📊 结果:8 类任务全线 SOTA;RoboArena 真机榜 #1
主表(论文 Table 1,部分)
| 模型 | General | Robotics | Smart Infra | Driving | T2I | T2V | I2V | Audio | FD:Robot | Policy:Robot |
|---|---|---|---|---|---|---|---|---|---|---|
| Cosmos3-Super | 73.7 | 57.8 | 62.6 | 79.3 | 91.36* | 80.0 | 82.8 | 7.31 | 26.0* | — |
| Cosmos3-Nano | 69.6 | 55.1 | 61.0 | 76.0 | 84.61 | 79.4 | 82.7 | 7.34 | 25.5* | 39.7* |
| Qwen3-VL-32B | 72.8 | 52.6 | 56.1 | 40.7 | — | — | — | — | — | — |
| Veo-3.1† | — | — | — | — | — | 79.1 | 82.6 | 7.45 | — | — |
| π0.5 | — | — | — | — | — | — | — | — | — | 28.1 |
| Ctrl-World | — | — | — | — | — | — | — | — | 23.0 | — |
机器人策略(RoboLab 仿真,120 任务 × 10 rollouts)
| 方法 | 平均成功率 | 说明 |
|---|---|---|
| Cosmos3-Nano-Policy-DROID | 39.7% | 从 mid-trained 检查点恢复后训练 |
| Cosmos3-Nano(PT-init,从预训练恢复) | 21.8% | 消融:mid-training 比 PT 起点 +18 个点 |
| π0.5 | 28.1% | 公开 SOTA VLA |
| DreamZero | 25.2% | 另一个强 baseline |
| 维度 | 数字 | 解读 |
|---|---|---|
| RoboArena 真机榜 | #1(截至 2026-05-30) | 众包 pairwise 评测,任何人可在任何 DROID 平台对比两策略 |
| MolmoSpaces 榜 | #1(截至 2026-06-20) | 多个任务族(Pick & Place-v2 等) |
| Artificial Analysis 评测 | 开源 T2I 与 I2V 最佳开源模型 | 闭源 Gemini 3 Pro Image 90.85 / Cosmos3-Super 91.36(接近) |
| 策略相对 π0.5 提升 | +11.6 pp(39.7% vs 28.1%) | 同一 DROID 数据下显著领先 |
| Mid-training 增益 | 21.8% → 39.7%(+17.9 pp) | 证明 omnimodal 中间训练作为「物理 AI 起点」的价值 |
| 开源协议 | OpenMDW-1.1(Linux Foundation) | 代码、权重、合成数据、benchmark 全开 |
🌐 在领域中的位置
Cosmos 3 是Physical AI 骨干「大一统」的标志。它把过去分散的 VLM / 视频生成 / VLA / 世界模型全部塞进一个 MoT 架构,用「不同 token 排布」实现 8+ 种任务模式。这跟「Chameleon」「Janus」「Show-o」等 omnimodel 路线一脉相承,但首次把动作提升为一等模态、并在真机 benchmark 上拿到 #1。关联线索:与 Cosmos(前代)、LAP(动作语言化)、CogACT、Diffusion Policy、π0/π0.5 一同构成 VLA / World Model 谱系。
❓ 常见误区
「一个模型做所有事」听起来很美,但每件事都会做得不如专门模型吧?
论文实测的结果是——大多数任务上 Cosmos 3 反而比专门模型更好。原因:(1) 多任务监督互相迁移(视觉生成能力让策略学得更好,mid-training 实测 +17.9 pp);(2) 统一架构意味着工程师不用维护多个 stack;(3) 共享表征让长尾任务(比如 RoboArena 任意环境任意任务)从通用先验里受益。当然,单一任务上极限调优的专门模型可能仍能赢,但代价是失去了泛化。
AR 和 Diffusion 在同一个 transformer 里,参数不冲突吗?
这是 Mixture-of-Transformers(MoT)要解决的核心问题。它给 AR 和 DM 各自独立的参数塔(不共享),但在每一层做 joint attention 让两塔交互。这样 AR 学推理时不被 diffusion 损失干扰,反之亦然;但条件信息能跨流流动。类似思想在 π0.5、Chameleon、Show-o 里都有出现,MoT 把它做规范了。
「策略模式联合预测 video + action」是不是浪费算力?我只要动作啊。
确实多了视频生成的开销,但收益是 (1) 世界一致性正则——动作必须让视频「能生成出来」,逼模型学物理合理的动作;(2) 视频预测本身就是plan 的可视化,方便调试和人类验证;(3) 同一模型可一键切换 forward dynamics(预测后果)/ inverse dynamics(推断动作)/ policy(生成动作)。部署时如果只要动作,可以把视频生成长度裁到极短或关掉部分去噪步。
「Omnimodal」跟「Any-to-Any」模型(比如 Gemini)区别在哪?
最大区别:动作是一等模态。Gemini 这类通用模型支持文/图/视/音,但没有「动作」输入输出。Cosmos 3 把动作 token、动作编码器、动作扩散去噪全部内建——这意味着它直接产线机器人和 AV 的控制信号,不需要外挂 policy head。这是「为 Physical AI 量身定做」vs「通用模型顺手做物理任务」的差别。
NVIDIA 这种大体量团队的工作,对小团队有什么启发?
核心启发是架构选择带来的复利。小团队不可能复制 76k DROID 训练 + 5 模态 mid-training,但可以借鉴:(1) 用 Cosmos3-Nano 当 mid-trained 起点,在自己小数据上微调(论文证明 mid-training 起点 +17.9 pp);(2) 「AR 推理 + Diffusion 生成 + 动作 token」这个三件套可以作为小模型的架构参考;(3) 完整开源的权重 / 数据 / benchmark 是 Physical AI 下游研究的公共基建。