枢纽
数据集RoboArena
物理感知
输入模态vision,language,audio

Cosmos 3:一个模型同时做「理解 + 生成 + 控制」—— Physical AI 的全能骨干

NVIDIA(集体)。arXiv:2606.02800(2026-06)。 项目页 · 代码 · OpenMDW-1.1 协议开源 · foundation_modelsworld modelVLAomnimodal

🧠 一句话心智模型:Physical AI 需要的能力——看懂世界(VLM)、想象未来(视频生成)、决定动作(VLA)——以前是三个模型缝在一起,信息丢失、计算浪费。Cosmos 3 的破法:把语言、图像、视频、音频、动作五模态塞进同一个 Mixture-of-Transformers一个权重同时跑 VLM / 文生图 / 文生视频 / 视频迁移 / 音视频生成 / 前向动力学 / 逆向动力学 / 机器人策略。不是「通用模型做任务」,而是「任务本身在这一架构下退化为不同的输入输出配置」。

🎯 为什么重要:Physical AI 的范式割裂才是瓶颈

考虑一个「收拾餐桌」的家政机器人。传统做法必须串起一串模型:

核心矛盾:VLM 找餐具 → VLA 生成动作 → Forward Dynamics 模型预测后果。三个模型各自有各自的视觉编码器、各自的世界表征、各自的训练数据。表征不共享,错误会累积,而且每个模型都没法从另两个任务的监督信号里受益。这种割裂是 Physical AI 当前的结构性瓶颈。

NVIDIA 的核心论点(§1):理解需要推理未来,生成需要结构化世界表征——这两件事本来就该在一个模型里。把它们统一进一个可扩展框架,是 Physical AI 真正能 scale 的前提。

能力过去的专门模型Cosmos 3 里被统一的实现
多模态理解VLM(GPT-4V, Qwen-VL)只跑 AR 子序列
图像生成Diffusion(SD3, Flux)AR 给条件 + diffusion 子序列生成图
视频生成视频 DiT(Sora, Veo, Wan)diffusion 子序列生成多帧视频 token
音视频联合生成专门音视频模型音频 token 追加在视频 token 后
视频迁移(控制 → RGB)ControlNet 类控制视频 token 作条件 + RGB 视频 token 噪声化
前向动力学(给动作预测下一帧)World model(Dreamer, GAIA)干净动作 token + 噪声视频 token
逆向动力学(给两帧推断动作)inverse policy干净视频 token + 噪声动作 token
机器人策略(联合视频 + 动作)VLA(π0.5, OpenVLA)视频 token 和动作 token 一起去噪

💡 核心思想:AR 子序列做推理,Diffusion 子序列做生成;动作是一等模态

AR 子序列(autoregressive) 语言 token l₁ l₂ ... lₙ + ViT 编码的图/视频 → 自回归生成下一 token,做推理与条件 Diffusion 子序列(DM) VAE 视频流 + 音频流 + 动作流 ṽ₁ ṽ₂ ... ṽₙ s̃ ã → 迭代去噪,一次生成多模态输出 「干净条件」放在「噪声目标」前面 Mixture-of- Transformers dual-tower AR / DM 各自参数 joint attention 跨流交互 每层共享位置编码 语言 / 推理 视频 / 图像 音频 / 动作 同一组权重,通过改变「哪个模态是条件、哪个是噪声目标」切换 8+ 种任务模式
图 1:Cosmos 3 的 AR + Diffusion 双流 + Mixture-of-Transformers 架构。AR 做条件与推理,Diffusion 做生成;两者通过 joint attention 在每层交互。

三个关键设计:
① 动作是一等模态——和图像、音频并列,有自己的 token、自己的编码器、自己的扩散去噪。动作 token $a_t$ 表示从状态 $v_{t-1}$ 到 $v_t$ 的转移
② 统一动作表示——所有本体(AV、相机、第一人称、机器人、人形)映射到三种几何原语:ego pose(9D:3D 平移 + 6D 旋转)+ effector pose(9D)+ grasp state(手指/夹爪状态)。不同本体的差异由「域感知投影层」处理(每域独立 $W_\text{in}, W_\text{out}$),主干共享。
③ 多种生成模式 = 不同的 token 排布——文本到图、文本到视频、图到视频、视频到视频、视频迁移、前向动力学、逆向动力学、策略,全是同一个 token 序列框架的不同实例化

🛠️ 怎么做:架构 + 数据 + 训练三件套

组件设计关键决定
视觉编码器(理解)ViT,16×16 patch + 2×2 token merge;DeepStack 多层特征与主干联合训练,文本视频时间戳交错插入
视觉编码器(生成)Wan2.2 视频两阶段 VAE:时间 4× 压缩 + 空间 32×32训练时冻结,避免与主干相互干扰
音频 VAE立体声 48 kHz,hop 1920 → 25 token/秒训练时冻结
动作表示相对位姿伪动作 $\Delta T_t = T_{t-1}^{-1} T_t$,6D 旋转(OpenCV 约定)避开 PID 等本体细节;grasp state 直接编码当前状态而非差分
MoT 双塔AR / DM 两套参数,每层 dual-stream joint attentionAR 学推理,DM 学生成;参数不共享避免互相干扰,但每层注意力让信息融合
训练阶段Reasoner 预训练 → SFT;Generator 预训练 → mid-training → 后训练(T2I / I2V / Policy)策略后训练从 mid-trained 检查点恢复
策略后训练(DROID)76k 轨迹 / 350 小时 / 86 任务 / 564 场景;15 Hz 控制;joint video-action 预测策略模式:视频和动作 token 一起去噪,模型同时生成「做什么动作」和「会发生什么」
变体三个规模:Cosmos3-Edge(4B,密集 2B 主干,未发布)/ Cosmos3-Nano(16B,基于 Qwen3-VL 8B)/ Cosmos3-Super(64B,基于 Qwen3-VL 32B)论文发布 Nano + Super;Edge 后续发布;任务专用版(Text2Image / Image2Video / Nano-Policy-DROID)
🔮 直觉:为什么「策略模式」是联合 video-action 生成?
传统 VLA 只预测动作。Cosmos 3 的策略模式让模型同时预测「下一个动作」和「下一帧视频」——两者一起去噪。好处:模型不再只是「记忆反应」,而是必须用世界模型来约束动作(如果动作会让画面里的杯子穿模,视频 token 就会很难生成)。动作和视频互为正则。这种「世界一致性」是单独训 VLA 学不到的。

📊 结果:8 类任务全线 SOTA;RoboArena 真机榜 #1

主表(论文 Table 1,部分)

模型GeneralRoboticsSmart InfraDrivingT2IT2VI2VAudioFD:RobotPolicy:Robot
Cosmos3-Super73.757.862.679.391.36*80.082.87.3126.0*
Cosmos3-Nano69.655.161.076.084.6179.482.77.3425.5*39.7*
Qwen3-VL-32B72.852.656.140.7
Veo-3.1†79.182.67.45
π0.528.1
Ctrl-World23.0

机器人策略(RoboLab 仿真,120 任务 × 10 rollouts)

方法平均成功率说明
Cosmos3-Nano-Policy-DROID39.7%从 mid-trained 检查点恢复后训练
Cosmos3-Nano(PT-init,从预训练恢复)21.8%消融:mid-training 比 PT 起点 +18 个点
π0.528.1%公开 SOTA VLA
DreamZero25.2%另一个强 baseline
维度数字解读
RoboArena 真机榜#1(截至 2026-05-30)众包 pairwise 评测,任何人可在任何 DROID 平台对比两策略
MolmoSpaces 榜#1(截至 2026-06-20)多个任务族(Pick & Place-v2 等)
Artificial Analysis 评测开源 T2I 与 I2V 最佳开源模型闭源 Gemini 3 Pro Image 90.85 / Cosmos3-Super 91.36(接近)
策略相对 π0.5 提升+11.6 pp(39.7% vs 28.1%)同一 DROID 数据下显著领先
Mid-training 增益21.8% → 39.7%(+17.9 pp)证明 omnimodal 中间训练作为「物理 AI 起点」的价值
开源协议OpenMDW-1.1(Linux Foundation)代码、权重、合成数据、benchmark 全开
关键洞察:Cosmos 3 的胜利是「统一架构 + 共享表征」带来的系统性收益。Mid-trained 检查点(在多模态生成任务上预训练过的版本)作为策略训练的起点,比直接从预训练开始 +17.9 pp——视觉生成 / 世界模拟的能力,迁移到了机器人策略。这是 omnimodal 统一最直接的实证证据。

🌐 在领域中的位置

VLM(GPT-4V / Qwen-VL)+ 视频生成(Sora / Veo)+ VLA(π0.5 / RT-2) Cosmos 3(Omnimodal World Model)⭐

Cosmos 3 是Physical AI 骨干「大一统」的标志。它把过去分散的 VLM / 视频生成 / VLA / 世界模型全部塞进一个 MoT 架构,用「不同 token 排布」实现 8+ 种任务模式。这跟「Chameleon」「Janus」「Show-o」等 omnimodel 路线一脉相承,但首次把动作提升为一等模态、并在真机 benchmark 上拿到 #1。关联线索:与 Cosmos(前代)LAP(动作语言化)、CogACTDiffusion Policy、π0/π0.5 一同构成 VLA / World Model 谱系。

❓ 常见误区

「一个模型做所有事」听起来很美,但每件事都会做得不如专门模型吧?

论文实测的结果是——大多数任务上 Cosmos 3 反而比专门模型更好。原因:(1) 多任务监督互相迁移(视觉生成能力让策略学得更好,mid-training 实测 +17.9 pp);(2) 统一架构意味着工程师不用维护多个 stack;(3) 共享表征让长尾任务(比如 RoboArena 任意环境任意任务)从通用先验里受益。当然,单一任务上极限调优的专门模型可能仍能赢,但代价是失去了泛化

AR 和 Diffusion 在同一个 transformer 里,参数不冲突吗?

这是 Mixture-of-Transformers(MoT)要解决的核心问题。它给 AR 和 DM 各自独立的参数塔(不共享),但在每一层做 joint attention 让两塔交互。这样 AR 学推理时不被 diffusion 损失干扰,反之亦然;但条件信息能跨流流动。类似思想在 π0.5、Chameleon、Show-o 里都有出现,MoT 把它做规范了。

「策略模式联合预测 video + action」是不是浪费算力?我只要动作啊。

确实多了视频生成的开销,但收益是 (1) 世界一致性正则——动作必须让视频「能生成出来」,逼模型学物理合理的动作;(2) 视频预测本身就是plan 的可视化,方便调试和人类验证;(3) 同一模型可一键切换 forward dynamics(预测后果)/ inverse dynamics(推断动作)/ policy(生成动作)。部署时如果只要动作,可以把视频生成长度裁到极短或关掉部分去噪步。

「Omnimodal」跟「Any-to-Any」模型(比如 Gemini)区别在哪?

最大区别:动作是一等模态。Gemini 这类通用模型支持文/图/视/音,但没有「动作」输入输出。Cosmos 3 把动作 token、动作编码器、动作扩散去噪全部内建——这意味着它直接产线机器人和 AV 的控制信号,不需要外挂 policy head。这是「为 Physical AI 量身定做」vs「通用模型顺手做物理任务」的差别。

NVIDIA 这种大体量团队的工作,对小团队有什么启发?

核心启发是架构选择带来的复利。小团队不可能复制 76k DROID 训练 + 5 模态 mid-training,但可以借鉴:(1) 用 Cosmos3-Nano 当 mid-trained 起点,在自己小数据上微调(论文证明 mid-training 起点 +17.9 pp);(2) 「AR 推理 + Diffusion 生成 + 动作 token」这个三件套可以作为小模型的架构参考;(3) 完整开源的权重 / 数据 / benchmark 是 Physical AI 下游研究的公共基建。