Cosmos:给 Physical AI 的「世界模拟器平台」
🎯 为什么重要:Physical AI 的瓶颈不是算力,是「安全交互数据」
Physical AI(机器人、自驾车、人形)需要的是「观察-动作-观察-动作」的交替序列数据。但一个探索中的机器人是会「把世界搞坏」的——尤其是 AI 幼年期。所以 Physical AI 长期卡在「没法像 LLM 那样靠海量数据 Scaling」的死结里。
2024 年底 Sora 等视频生成模型虽然漂亮,但都不是 Physical AI 专用:
| Sora 等的痛点 | Physical AI 真正需要的 |
|---|---|
| 闭源黑盒,机器人团队拿不到、改不了 | 开放权重,能 post-train 到自家场景 |
| 只有「生成模型」,没有 tokenizer / guardrail / 数据 pipeline | 全套配套(光有模型无法落地) |
| 纯视频生成,不懂「action 条件」——未来取决于机器人做什么 | 能条件化于 camera pose / action vector / instruction |
💡 核心思想:预训练学「世界」,post-training 学「任务」
Cosmos 把 LLM 的 pre-train + SFT 范式搬到世界模型上:
关键 insight 是「generalist 预训练 → specialist 微调」:预训练阶段让模型「看遍世界动力学」,post-train 阶段用小数据(如 1X 的 200 小时人形视频)把它拉到具体场景。这跟 LLM 的「pre-train + SFT」同构。
🛠️ 怎么做:四件套逐个拆
| 组件 | 核心心智 | 关键数字 / 设计 |
|---|---|---|
| ① Video Curation Pipeline (数据决定天花板) |
从 20M 小时原始视频里筛出「物理 plausible + 视觉高质量 + 有运动」的片段。避开剪辑转场(不是真实物理状态变化) | → 100M clips(2–60s) 9 类标签:Driving 11% / Hand&Object 16% / Navigation 16% / Nature 20% / First-PoV 8% / ... 语义去重 −30% 训练数据(SemDeDup + InternVideo2 + RAPIDS k-means, k=10,000) |
| ② Cosmos Tokenizer (独立有价值的组件) |
视频版 VAE/VQ-VAE:encoder-decoder 把视频压成 latent/token 序列。Causal 时序设计(不看未来)天然适配 Physical AI | Continuous(CV/CI)供 diffusion;Discrete(DV/DI, FSQ 量化)供 AR 配置:CV 4×8×8 / 8×8×8 / 8×16×16 DAVIS/TokenBench 全档 SOTA · 快 2–12× · 最小 105M 参数 |
| ③ Diffusion WFM (Cosmos-Predict1-7B/14B) |
在连续 latent 空间做扩散,DiT 骨干 + EDM preconditioning。7B/14B 训 Text2World → fine-tune 出 Video2World | 7B:28 层 / dim 4096 / 32 heads / lr 2⁻¹⁵ / wd 0.1 14B:36 层 / dim 5120 / 40 heads / lr 2⁻¹⁶ / wd 0.2 AdaLN-LoRA:11B → 7B(−36%),性能持平 QK-RMSNorm + 3D-factorized FPS-aware RoPE + T5-XXL cross-attn |
| ③' Autoregressive WFM (Cosmos-Predict1-4B/12B) |
Llama3-style GPT(from scratch,不带语言理解),吃离散 token。两步:vanilla next-token → text-conditioned Video2World | T5 embedding 通过 cross-attention 注入 AR 大压缩比 token 失真 → 加 7B diffusion decoder 把 DV8×16×16 翻译回 CV8×8×8 |
| ④ Post-training (示范三类下游) |
小数据 fine-tune 到专用场景(类比 SFT)。Text2World → Video2World 加 video 条件 | 📷 Camera Control(条件于 camera pose) 🤖 Robotic Manipulation:1X EVE 200 小时 egocentric / 12,000 episodes(1–9s) + Bridge 公开集 🚗 Autonomous Driving |
| ⑤ Guardrail (Physical AI 安全护栏) |
WFM 输出可视化内容,安全风险比 LLM 更直观。双层 pre + post Guard + Red Team | pre-Guard:keyword blocklist + Aegis LLM defensive 版(覆盖 NVIDIA 13 类 critical safety taxonomy,命中其中 11 类拒绝:violence/sexual/weapons/CSAM/...) post-Guard:SigLIP + MLP 帧级分类器(任一帧不安全→整段不安全)+ RetinaFace 检测 >20×20 像素人脸 pixelation 打码 |
2024 年底业界对「video generation 该走 diffusion 还是 AR」没有定论。Diffusion 在连续空间表达力强,但推理要去噪多步;AR 在离散 token 上训练简单、易 scale,但需 tokenizer/decoder 补精度。NVIDIA 同时给两套(diffusion 7B/14B + AR 4B/12B),让后续工作能直接对比——这种「两条腿走路」是非常产业 lab 的做法。
📊 关键结果:规模与配套的全面性
| 维度 | 数字(均来自原文) |
|---|---|
| 预训练数据 | 20M 小时原始视频 → curation 出 100M clips(2–60 秒) |
| 语义去重 | 去除约 30% 训练数据(§3.5 原话) |
| 训练规模 | 10,000 H100 × 三个月(§5.1 原话:训完所有 WFM) |
| 模型规模 | Diffusion 7B/14B-Text2World/Video2World;AR 4B/12B(base)→ 5B/13B-Video2World |
| 14B 显存 | ~280 GB(params+grads+optimizer)+ ~310 GB activations;FSDP sharding 64 + Context Parallel CP=8 |
| AdaLN-LoRA | 7B 从 11B 压到 7B(−36% 参数),性能持平 |
| Tokenizer 速度 | 比 FLUX / CogVideoX / Omni / LlamaGen 快 2–12×,参数量最小(CV4×8×8 仅 105M) |
| Tokenizer 质量 | 在 DAVIS / TokenBench 所有压缩率下 SOTA(PSNR / SSIM / rFVD) |
| Post-training 数据规模(1X) | Cosmos-1X 数据集:200 小时 EVE 人形 egocentric / 12,000 episodes(1–9 秒)/ 30 FPS 512×512 |
| Guardrail | 13 类 critical safety taxonomy(defensive Aegis 命中 11 类即拒绝)+ SigLIP 帧级 + RetinaFace 人脸模糊(>20×20 像素) |
🌐 在领域中的位置:与 Sora / Genie / 1X WM 的对比
| 维度 | Cosmos (NVIDIA 2025) | Genie / Genie 2 (DeepMind) | 1X WM (1X 2025) | Sora (OpenAI 2024) |
|---|---|---|---|---|
| 目标 | Physical AI 通用平台 | 通用可交互环境(游戏/世界) | 人形机器人专属评估器 | 闭源 video generation |
| 数据 | 100M 网络视频 clips(多源) | 2D 游戏 + 真实视频 | 真实人形第一人称 | 未公开 |
| 架构 | diffusion + AR 两路 | latent diffusion + 动作条件 | diffusion | diffusion transformer |
| action 条件 | post-train 时加 | 内生(学自游戏输入) | 内生(人形 action) | 无 |
| Tokenizer | 自研开源 SOTA | 未发布 | 未发布 | 未发布 |
| Guardrail | 完整 pre + post + Red Team | 无 | 无 | 有限 |
| 开放度 | 模型权重 + 代码 + tokenizer 全开 | 闭源(仅 demo) | 部分开放 + benchmark | 闭源 |
Cosmos 在 T09「world model 作 simulator」线索里是产业级开放平台的标志(转折 2)。与 1X WM 互补:1X 是垂直(只为人形,目标是 policy 评估),Cosmos 是水平(给所有 Physical AI 用,1X 自己都是 Cosmos 的数据提供方——致谢里明确感谢 1X Technologies)。
❓ 常见误区
Cosmos 是不是就是「NVIDIA 版 Sora」?
不是。Sora 是闭源视频生成 demo,目标受众是创意工作者。Cosmos 是开放权重的 Physical AI 基础设施——多了 tokenizer、post-training 范式、guardrail、数据 curation pipeline,目标受众是机器人/自驾团队。前者是产品,后者是平台。
它能替代 MuJoCo / Isaac Sim 那样的物理仿真吗?
不能。论文 §1 自己承认「additional research is required」。Cosmos 生成的视频虽然「看起来物理 plausible」,但不是可解析的物理——接触力、刚体动力学不能像仿真器那样精确读取。它是「视觉上合理的世界模型」,不是「严格的物理引擎」。
action 条件是预训练自带的吗?
不是,这是关键局限。预训练 WFM 只学视频分布,不懂 action;action 条件是post-train 加上去的。这意味着 generalist 阶段学到的「世界动力学」与 action 是解耦的,可能限制 post-train 后的准确性。Genie / 1X WM 是「action 内生」的路线,在长程 control 上可能更优。
10,000 H100 × 3 个月,普通团队能复现吗?
预训练不能。但 NVIDIA 的卖点恰恰是不需要复现——直接用开放权重的 Cosmos-Predict1-7B/14B 在自家场景小数据 fine-tune 就行。Tokenizer 甚至可以单 A100 80GB 一口气 encode 1080p 8s / 720p 10s 视频,复用门槛低。
AR 路线为什么要再加一个 7B diffusion decoder?
DV8×16×16 这种大压缩比离散 token 失真严重,AR 模型直接生成会丢细节。所以用一个 fine-tune 过的 7B diffusion 模型把离散 token 翻译回连续 token 补细节。这导致 AR 路线架构复杂、推理链长——是 AR 路线的工程代价。