枢纽
机器人robotics / AV / general physical AI
数据集大规模物理/视频语料库
物理感知
输入模态vision

Cosmos:给 Physical AI 的「世界模拟器平台」

NVIDIA。arXiv:2501.03575(v3 2025-07)。开放权重 + 开源代码 + 全套配套。 模型族 Cosmos-Predict1(7B/14B-Diffusion + 4B/12B-AR)+ Cosmos-Tokenize1 + Guardrail。 world foundation modelT09 线索Physical AI

🧠 一句话心智模型:把「世界」做成一个像 LLM 那样的预训练-再微调的基础模型——先用 1 亿段网络视频「看遍世界」,得到一个通用世界模型(WFM),开发者再拿小数据 fine-tune 到自己的机器人/自驾/相机场景。NVIDIA 这次不仅给了模型,还把视频 tokenizer、数据 curation、安全 guardrail 一并打包开放,定位是「Physical AI 的基础设施」,不是单篇论文 demo。

🎯 为什么重要:Physical AI 的瓶颈不是算力,是「安全交互数据」

Physical AI(机器人、自驾车、人形)需要的是「观察-动作-观察-动作」的交替序列数据。但一个探索中的机器人是会「把世界搞坏」的——尤其是 AI 幼年期。所以 Physical AI 长期卡在「没法像 LLM 那样靠海量数据 Scaling」的死结里。

解药的世界观:一个「世界数字孪生」(World Foundation Model, WFM)——机器人可以在里面「虚拟地试错」而不会真把世界撞坏。这个 idea 不新(Dreamer、Genie、Sora 都在做),但 NVIDIA 的论点是:光给一个会生成视频的模型不够,要给一个「平台」

2024 年底 Sora 等视频生成模型虽然漂亮,但都不是 Physical AI 专用

Sora 等的痛点Physical AI 真正需要的
闭源黑盒,机器人团队拿不到、改不了开放权重,能 post-train 到自家场景
只有「生成模型」,没有 tokenizer / guardrail / 数据 pipeline全套配套(光有模型无法落地)
纯视频生成,不懂「action 条件」——未来取决于机器人做什么能条件化于 camera pose / action vector / instruction
Cosmos 的定位:第一个产业级、全开放、配套完整的 Physical AI WFM 平台。把「WFM」从学术概念推向工业基础设施——这就是它和 Sora / Genie 的本质区别。

💡 核心思想:预训练学「世界」,post-training 学「任务」

Cosmos 把 LLM 的 pre-train + SFT 范式搬到世界模型上:

20M 小时原始视频 → curation pipeline shot 检测 / 质量 / 运动 / 去重 (−30%) 100M clips 2–60 秒 · 9 类带百分比 VLM caption / 256 帧 Cosmos Tokenizer encoder-decoder · Continuous (CV/CI) · Discrete (DV/DI, FSQ) · causal 时序 SOTA · 快 2–12× · 105M Diffusion WFM Cosmos-Predict1-7B/14B DiT + EDM + AdaLN-LoRA continuous latent Autoregressive WFM Cosmos-Predict1-4B/12B Llama3-style GPT discrete token · from scratch 10,000 H100 × 3 个月 FSDP + Context Parallel BF16 + FP32 EMA Post-training (小数据 fine-tune) 📷 Camera Control 🤖 Robotic Manip. — 1X EVE 200h — Bridge 公开集 🚗 Autonomous Driving Text2World → Video2World 🛡 Guardrail pre-Aegis + post-SigLIP
图 1:Cosmos 平台的四件套——(1) 数据 curation pipeline(20M 小时 → 100M clips);(2) Cosmos Tokenizer(continuous / discrete 两路);(3) 预训练 WFM(diffusion 7B/14B + autoregressive 4B/12B);(4) Post-training 示范 + Guardrail。这张图对应论文 Fig. 2 / Fig. 4。

关键 insight 是「generalist 预训练 → specialist 微调」:预训练阶段让模型「看遍世界动力学」,post-train 阶段用小数据(如 1X 的 200 小时人形视频)把它拉到具体场景。这跟 LLM 的「pre-train + SFT」同构。

🛠️ 怎么做:四件套逐个拆

组件核心心智关键数字 / 设计
① Video Curation Pipeline
(数据决定天花板)
从 20M 小时原始视频里筛出「物理 plausible + 视觉高质量 + 有运动」的片段。避开剪辑转场(不是真实物理状态变化) → 100M clips(2–60s)
9 类标签:Driving 11% / Hand&Object 16% / Navigation 16% / Nature 20% / First-PoV 8% / ...
语义去重 −30% 训练数据(SemDeDup + InternVideo2 + RAPIDS k-means, k=10,000)
② Cosmos Tokenizer
(独立有价值的组件)
视频版 VAE/VQ-VAE:encoder-decoder 把视频压成 latent/token 序列。Causal 时序设计(不看未来)天然适配 Physical AI Continuous(CV/CI)供 diffusion;Discrete(DV/DI, FSQ 量化)供 AR
配置:CV 4×8×8 / 8×8×8 / 8×16×16
DAVIS/TokenBench 全档 SOTA · 快 2–12× · 最小 105M 参数
③ Diffusion WFM
(Cosmos-Predict1-7B/14B)
在连续 latent 空间做扩散,DiT 骨干 + EDM preconditioning。7B/14B 训 Text2World → fine-tune 出 Video2World 7B:28 层 / dim 4096 / 32 heads / lr 2⁻¹⁵ / wd 0.1
14B:36 层 / dim 5120 / 40 heads / lr 2⁻¹⁶ / wd 0.2
AdaLN-LoRA:11B → 7B(−36%),性能持平
QK-RMSNorm + 3D-factorized FPS-aware RoPE + T5-XXL cross-attn
③' Autoregressive WFM
(Cosmos-Predict1-4B/12B)
Llama3-style GPT(from scratch,不带语言理解),吃离散 token。两步:vanilla next-token → text-conditioned Video2World T5 embedding 通过 cross-attention 注入
AR 大压缩比 token 失真 → 加 7B diffusion decoder 把 DV8×16×16 翻译回 CV8×8×8
④ Post-training
(示范三类下游)
小数据 fine-tune 到专用场景(类比 SFT)。Text2World → Video2World 加 video 条件 📷 Camera Control(条件于 camera pose)
🤖 Robotic Manipulation:1X EVE 200 小时 egocentric / 12,000 episodes(1–9s) + Bridge 公开集
🚗 Autonomous Driving
⑤ Guardrail
(Physical AI 安全护栏)
WFM 输出可视化内容,安全风险比 LLM 更直观。双层 pre + post Guard + Red Team pre-Guard:keyword blocklist + Aegis LLM defensive 版(覆盖 NVIDIA 13 类 critical safety taxonomy,命中其中 11 类拒绝:violence/sexual/weapons/CSAM/...)
post-Guard:SigLIP + MLP 帧级分类器(任一帧不安全→整段不安全)+ RetinaFace 检测 >20×20 像素人脸 pixelation 打码
🔮 直觉:为什么 diffusion AR 都做?
2024 年底业界对「video generation 该走 diffusion 还是 AR」没有定论。Diffusion 在连续空间表达力强,但推理要去噪多步;AR 在离散 token 上训练简单、易 scale,但需 tokenizer/decoder 补精度。NVIDIA 同时给两套(diffusion 7B/14B + AR 4B/12B),让后续工作能直接对比——这种「两条腿走路」是非常产业 lab 的做法。
🔥「uncertainty weighting」是 diffusion 训练稳定的关键 trick:用 MLP 学每个噪声等级 $\sigma$ 的不确定性 $u(\sigma)$,loss 在不确定的 $\sigma$ 上权重自动降低。等价于多任务学习的自动权重平衡——这避免了「某些噪声等级的 loss spike 把训练打崩」。

📊 关键结果:规模与配套的全面性

维度数字(均来自原文)
预训练数据20M 小时原始视频 → curation 出 100M clips(2–60 秒)
语义去重去除约 30% 训练数据(§3.5 原话)
训练规模10,000 H100 × 三个月(§5.1 原话:训完所有 WFM)
模型规模Diffusion 7B/14B-Text2World/Video2World;AR 4B/12B(base)→ 5B/13B-Video2World
14B 显存~280 GB(params+grads+optimizer)+ ~310 GB activations;FSDP sharding 64 + Context Parallel CP=8
AdaLN-LoRA7B 从 11B 压到 7B(−36% 参数),性能持平
Tokenizer 速度比 FLUX / CogVideoX / Omni / LlamaGen 快 2–12×,参数量最小(CV4×8×8 仅 105M)
Tokenizer 质量在 DAVIS / TokenBench 所有压缩率下 SOTA(PSNR / SSIM / rFVD)
Post-training 数据规模(1X)Cosmos-1X 数据集:200 小时 EVE 人形 egocentric / 12,000 episodes(1–9 秒)/ 30 FPS 512×512
Guardrail13 类 critical safety taxonomy(defensive Aegis 命中 11 类即拒绝)+ SigLIP 帧级 + RetinaFace 人脸模糊(>20×20 像素)
关键洞察:Cosmos 的「胜」不是「某个 SOTA 数字赢了 Sora」,而是「配套完整性」——别人只给视频生成 demo,NVIDIA 给了 tokenizer + 数据 pipeline + 模型权重 + post-train 范式 + guardrail 的全套基础设施。它把 WFM 从「论文概念」推到「可立即部署的工业组件」。

🌐 在领域中的位置:与 Sora / Genie / 1X WM 的对比

维度Cosmos (NVIDIA 2025)Genie / Genie 2 (DeepMind)1X WM (1X 2025)Sora (OpenAI 2024)
目标Physical AI 通用平台通用可交互环境(游戏/世界)人形机器人专属评估器闭源 video generation
数据100M 网络视频 clips(多源)2D 游戏 + 真实视频真实人形第一人称未公开
架构diffusion + AR 两路latent diffusion + 动作条件diffusiondiffusion transformer
action 条件post-train 时加内生(学自游戏输入)内生(人形 action)
Tokenizer自研开源 SOTA未发布未发布未发布
Guardrail完整 pre + post + Red Team有限
开放度模型权重 + 代码 + tokenizer 全开闭源(仅 demo)部分开放 + benchmark闭源
DreamerV3(latent world model, RL 路线) Sora(闭源 video gen demo) Genie 2(可交互 demo) Cosmos(产业级开放平台)⭐ 3D-VLA / GR-2(WFM + policy 合流)

Cosmos 在 T09「world model 作 simulator」线索里是产业级开放平台的标志(转折 2)。与 1X WM 互补:1X 是垂直(只为人形,目标是 policy 评估),Cosmos 是水平(给所有 Physical AI 用,1X 自己都是 Cosmos 的数据提供方——致谢里明确感谢 1X Technologies)。

❓ 常见误区

Cosmos 是不是就是「NVIDIA 版 Sora」?

不是。Sora 是闭源视频生成 demo,目标受众是创意工作者。Cosmos 是开放权重的 Physical AI 基础设施——多了 tokenizer、post-training 范式、guardrail、数据 curation pipeline,目标受众是机器人/自驾团队。前者是产品,后者是平台。

它能替代 MuJoCo / Isaac Sim 那样的物理仿真吗?

不能。论文 §1 自己承认「additional research is required」。Cosmos 生成的视频虽然「看起来物理 plausible」,但不是可解析的物理——接触力、刚体动力学不能像仿真器那样精确读取。它是「视觉上合理的世界模型」,不是「严格的物理引擎」。

action 条件是预训练自带的吗?

不是,这是关键局限。预训练 WFM 只学视频分布,不懂 action;action 条件是post-train 加上去的。这意味着 generalist 阶段学到的「世界动力学」与 action 是解耦的,可能限制 post-train 后的准确性。Genie / 1X WM 是「action 内生」的路线,在长程 control 上可能更优。

10,000 H100 × 3 个月,普通团队能复现吗?

预训练不能。但 NVIDIA 的卖点恰恰是不需要复现——直接用开放权重的 Cosmos-Predict1-7B/14B 在自家场景小数据 fine-tune 就行。Tokenizer 甚至可以单 A100 80GB 一口气 encode 1080p 8s / 720p 10s 视频,复用门槛低。

AR 路线为什么要再加一个 7B diffusion decoder?

DV8×16×16 这种大压缩比离散 token 失真严重,AR 模型直接生成会丢细节。所以用一个 fine-tune 过的 7B diffusion 模型把离散 token 翻译回连续 token 补细节。这导致 AR 路线架构复杂、推理链长——是 AR 路线的工程代价。