深度⏱ ~4 min
枢纽
⭐ 为何重要

NVIDIA 推出的'世界基础模型平台',训练于海量物理视频,能生成可控的未来观测与世界模拟。为 physical AI(机器人、自动驾驶)提供 data scaling 与 world simulator 底座,是把世界模型产业化的代表作,定义了物理世界生成模型的基础设施层。

机器人robotics / AV / general physical AI
数据集大规模物理/视频语料库
物理感知
输入模态vision
📍 演进位置
建立在
  • video diffusion
  • DiT
催生
  • Cosmos-Predict2.5
  • Cosmos 3
  • GR00T data pipeline

论文:NVIDIA(项目架构师 Ming-Yu Liu 等). Cosmos World Foundation Model Platform for Physical AI. arXiv:2501.03575(2025.01 首发,2025.07 v3). 🌐 · 开放权重 + 开源代码(Cosmos Tokenizer + Cosmos-Predict)。

一句话直觉

给机器人和自驾一个"数字风洞"。

用一亿段视频训出能"想象未来"的视频生成大模型。

想试错就找它,不用真撞真试。

Cosmos 之于物理 AI,就像风洞之于飞机设计。

在数字世界看"这样做会怎样"。

是什么·为什么

要解决的问题:物理 AI 的训练被数据卡住。📎

物理 AI 指带传感和动作的 AI 系统:机器人、自驾车、人形。

它们需要"观察-动作"序列数据。

但探索性动作在物理世界可能伤人伤物。

尤其在 AI 还不聪明的早期。

世界基础模型(WFM)长期被视为解药。

它是一个能让 AI 安全交互的生成式世界模型

它「想象」未来,不「计算」未来。

所以它不是可解析的物理仿真器。

老办法:到 2024 年底,视频生成模型已能生成漂亮视频。

Sora、Stable Video Diffusion 是代表。

但都不是为物理 AI 设计。📎

它们闭源、不可 fine-tune。

它们不懂"未来取决于机器人采取的动作"。

也不是真正的世界模型。

光有模型也不够。

物理 AI 落地还要 tokenizer。

还要 guardrail。

还要数据 pipeline。

Cosmos 的转身:做一个产业级、开放权重、配套完整的 WFM 平台。

核心是用海量视频预训一个通用 WFM。

然后用小数据 fine-tune 到具体场景(机器人、自驾、相机控制)。

Cosmos 之于物理 AI,就像 LLM 之于语言任务。

先预训通用大模型,再 post-train 到具体应用。

方法核心(大白话):用一亿段视频训一个能"想象未来"的视频生成大模型。📎

预训阶段:从 2 千万小时原始视频里筛出一亿段短 clip

每段 2 到 60 秒。

每个 clip 配一段文字描述。

约 30% 数据因低质或重复被筛掉。

模型学的就是"给定文字和过去几帧视频,生成接下来几秒的视频"。

这一步学到的是"世界长什么样、物理怎么走"。

但纯视频生成还不够。

真正的世界模型要知道"如果我做了动作 X,世界会变成什么样"。

所以 Cosmos 在预训后做 post-training。

把机器人或自驾的"动作"作为额外条件加进来。

模型就学会"给定当前画面和想做的动作,预测执行后的画面"。

部署时机器人拿这个 WFM 当「数字风洞」用。

但跟真风洞有本质区别。

真风洞用方程算,可解析。

WFM 用学习「想象」,不可解析。

先在脑子里试一遍动作,看预测好不好。

再决定真做不做。

配套还有 Cosmos Tokenizer(把视频压成 token)。

还有双层 guardrail(防生成有害内容)。

关键工程贡献·配套完整:Cosmos 不是单篇论文 demo。

是全套。

tokenizer、predictor、post-train 都有。

guardrail 和数据 pipeline 也有。

开发者拿到就能 fine-tune 到自己的机器人/自驾/相机场景。

这是把 WFM 从"学术概念"推向"工业基础设施"的标志。

你会看到:4B–14B 参数的 WFM,开放权重、开源代码。

扩散和自回归两条技术路线都给。

预训用一万张 H100 跑三个月。

后续机器人/自驾团队可以直接拿来 fine-tune。

1X Technologies 等人形公司已用 Cosmos 做数据增强。

一句话类比:Cosmos 之于物理 AI,就像飞行模拟器之于飞行员训练。

模拟器让你在数字世界安全试错。

不用真撞真飞机,就能学会判断"如果我这样做会怎样"。

怎么做

核心机制·四组件平台:(1) video curation pipeline;(2) Cosmos Tokenizer;(3) 预训 WFM(diffusion + AR 两路);(4) post-training 示例 + guardrail。📎

一、Video Curation Pipeline(决定模型上限)

从 2 千万小时原始视频筛出约一亿段 2 到 60 秒 clip。

pipeline 用 Ray 编排。

含 shot change 检测(避开剪辑转场)。

视觉质量过滤(去模糊、去低分辨率)。

动态丰富度筛选(只保留有运动的片段)。

物理 plausibility(保留物理可能的状态转移)。

captioning(VLM 每 256 帧打一个 caption)。

9 类分类标签:驾驶 11%、手部操作 16%、人体运动 10%、空间导航 16%。

第一人称 8%、自然动力学 20%、动态相机 8%、合成 4%、其他 7%。

dedup 去掉约 30% 训练数据。

📎

二、Cosmos Tokenizer(核心组件之一)

encoder-decoder 架构,把视频压成紧凑 token 序列。

两种 token 类型:连续(供 diffusion WFM 用)和离散(供 AR WFM 用)。

连续像 Stable Diffusion 的 VAE,离散像 VQ-VAE。

causal temporal 设计:每个 stage 只看当前+过去帧。

天然适配物理 AI 的"实时因果"场景。

空间压缩 8×8 或 16×16,时间压缩 4 或 8 倍。

离散用 FSQ(Finite Scalar Quantization)不用 VQ,训练更稳。

性能:在 DAVIS 和 TokenBench 上所有压缩率 SOTA

比 FLUX、CogVideoX、Omni、LlamaGen 快 2–12 倍。

参数量最小(CV4×8×8 仅 105M)。

📎

三、两路预训 WFM(核心组件之二)

Cosmos 同时探索 diffusion 和 AR 两条 scalable 路线。

A. Diffusion WFM(Cosmos-Predict1-7B/14B)

latent diffusion,在连续 latent 空间做扩散。

用 Cosmos-Tokenize1-CV8×8×8。

formulation 跟 EDM(Karras 2022):denoiser 预测 clean sample。

uncertainty-based weighting $u(\sigma)$——MLP 学每个噪声等级的不确定性。

loss 在不确定的 σ 上权重自动降低。

架构基于 DiT(Peebles & Xie 2023)。

关键 trick:3D patchification(1,2,2 cube)。

3D-factorized RoPE + FPS-aware(支持任意分辨率/纵横比/帧率)。

QK-normalization(防训练初期 attention logit 爆炸)。

AdaLN-LoRA:把 DiT adaptive layer norm 用 LoRA 低秩分解。

7B 因此从 11B 压到 7B(参数减 36%),性能持平。

Text2World 训本(text→video)。

fine-tune 出 Video2World(加 past video→future video)。

后者才是真正的 world model。

📎

配置(Tab.11 精确值)

7B:28 层,model dim 4096,FFN hidden 16384。

AdaLN-LoRA dim 256,32 heads,32 KV heads。

14B:36 层,model dim 5120,FFN hidden 20480,40 heads。

40 KV heads。

base lr 约 3e-5(7B)/ 1.5e-5(14B),Text2World 与 Video2World 同;weight decay 0.1(7B)/ 0.2(14B)。

通用:GELU、AdamW(β1, β2=0.9, 0.99),linear warmup 2500 iters。

Text encoder:T5-XXL,sequence length 512。

显存:14B 需约 280 GB 参数+梯度+优化器。

加约 310 GB activations。

用 FSDP + Context Parallelism 切到 H100 80GB 上。

📎

B. Autoregressive WFM(Cosmos-Predict1-4B/12B)

Llama3-style GPT,from scratch 训(不用预训 LLM、不带语言理解)。

Cosmos-Tokenize1-DV8×16×16 离散 token 输入。

预训两步:vanilla next token,然后 text-conditioned Video2World。

T5 文本 embedding 通过 cross-attention 注入。

base 4B/12B,fine-tune 出 5B/13B-Video2World。

diffusion decoder:AR 模型用大压缩比离散 token 会失真。

需 diffusion decoder 把离散 token 翻译回连续 token 补细节。

📎

训练规模:10000 H100 GPU,三个月,训完所有 WFM。📎

四、Post-training(示范三类下游)

WFM 核心卖点是 generalist 预训 → 小数据 post-train 到专用场景。

  1. Camera Control:fine-tune diffusion WFM 条件于 camera pose。

(轨迹/角度)

  1. Robotic Manipulation:fine-tune 在 video-action 序列上。

WFM 接受机器人观测+动作,预测执行动作后的未来视频。

致谢明确感谢 1X Technologies 提供人形机器人数据。

  1. Autonomous Driving:fine-tune 到自驾场景。

📎

五、Guardrail(Physical AI 安全用)

双层 guardrail。

pre-Guard(输入端、文本域):keyword blocklist + Aegis LLM guardrail。

Aegis 基于 Llama-Guard,覆盖 NVIDIA 13 类 safety taxonomy。

命中以下 11 类任一就拒绝。

violence / sexual / criminal planning / weapons。

substance abuse / suicide / CSAM / hatred。

harassment / threat / profanity。

post-Guard(输出端、视觉域)。

Video Content Safety Classifier。

用 SigLIP 提每帧 embedding + MLP 分类。

任一帧不安全则整个视频判不安全。

Face Blur Filter。

RetinaFace 检测 >20×20 像素的脸部,pixelation 打码。

Red Team:10000+ prompt-video pair 测试。

📎

常见误区(先抛一个,完整版见末尾):"Cosmos 是个物理仿真器吧?"

不是。Cosmos 是 video generation 模型。

论文 §1 末自己承认生成的视频"看起来物理 plausible"。

但不是 MuJoCo/Isaac 那种可解析的物理仿真。

"additional research is required"。📎

深度

Cosmos Tokenizer 的精确设计

两种 token 类型:continuous(CV/CI)和 discrete(DV/DI)。

causal temporal:第一帧单独 token($g_0$),之后每 4 帧成组($x_{1:4}\to g_1$),实现时间下采样 4 倍。

wavelet 空间操作:2-level 3D wavelet 变换把输入视频在 x/y/t 各下采样 4 倍。

spatio-temporal factorized 3D conv:每 block 先 2D 空间卷积($1\times k\times k$)再 1D 时间卷积($k\times 1\times 1$),left padding 保持因果。

重建 loss:L1/L2 + optical flow(OF)一致性 + Gram matrix(GM)loss + adversarial loss(fine-tune 阶段)。

Diffusion WFM 的精确数学(Eq.5–6)

按 EDM formulation:denoiser $D_\theta$ 预测 clean sample。

loss 按噪声等级 σ 加权。

关键 trick:uncertainty-based weighting $u(\sigma)$——用 MLP 学每个 σ 的不确定性。

loss 在不确定的 σ 上权重自动降低,等价于多任务学习的自动权重平衡。

3D patchification & RoPE 细节

latent ($T, C, H, W$) 用非重叠 (1, 2, 2) cube patchify 成 1D 序列。

3D-factorized RoPE:频率分三段(T/H/W),按视频帧率 rescale 时间频率。

支持任意分辨率/纵横比/长度/帧率。

NTK-RoPE 让 progressive training(改分辨率/长度)5000 步内收敛。

额外 learnable 绝对位置编码 per block:降训练 loss、减 morphing artifact。

Cross-attention 注 T5-XXL 文本 embedding,每 block 是 self-attn → cross-attn → FFN。

QK-normalization(RMSNorm + 可学 scale):防训练初期 attention logit 爆炸、attention entropy 塌缩。

AdaLN-LoRA 的节省

DiT 的 adaptive layer norm 占了大量参数但 FLOPs 少。

用 LoRA 低秩分解。

Cosmos-Predict1-7B 因此从 11B 压到 7B(36% 参数减少),性能持平。

Mixed precision 训练

BF16 forward/backward + FP32 参数更新 + EMA。

denoising score matching loss 乘 10 稳定训练。

classifier-free guidance:训练时不随机 zero out text embedding,靠 negative prompt 推理时实现。

Prompt Upsampler(Cosmos-UpsamplePrompt1-12B-Text2World)

基于 Mistral-NeMo-12B-Instruct。

把人写的 prompt 转成 VLM caption 风格。

因为训练 caption 是 VLM 生成的,分布和人写的不一样。

与 Genie / 1X WM 的对比

三者都是"生成式 world model 作 simulator"(T09 转折 2)。

  • Cosmos:Physical AI 通用平台,100M 网络视频 clips,4B–14B,10k H100×3 月,diffusion + AR 两路,完整 guardrail,开放权重+代码。
  • Genie / Genie 2:通用可交互环境(游戏为主),闭源仅 demo 视频,物理粗糙。
  • 1X WM:人形机器人专属评估器,真真人形第一人称视频,部分开放。

1X 自己是 Cosmos 的数据提供方(见致谢)。

Cosmos 与 Genie 的本质区别

Genie 的"世界"主要来自游戏数据,物理真实性弱,目标是可玩。

Cosmos 的"世界"来自真实视频(含自驾、机器人),目标是物理 plausible + 可服务 real Physical AI。

Genie 偏 research demo,Cosmos 偏 production platform。

Cosmos 与 1X WM 的本质区别

1X WM 是"垂直"——只为人形,用自己的数据,目标是 policy 评估。

Cosmos 是"水平"——给所有 Physical AI 用,post-train 到任何场景。

局限(论文 §8 自己承认 "far from solved")

  1. 仍是 video generation,不是严格物理仿真:生成的视频虽然"看起来物理 plausible",但不是可解析物理。论文自承"additional research is required"。📎
  2. action-conditioning 是 post-train 加的,不是内生:预训 WFM 不懂 action(只学视频分布),action 条件靠 fine-tune 加。generalist 阶段学到的"世界动力学"和 action 解耦,可能限制 post-train 后的准确性。Genie 那种 action-内生学习路线在长程 control 上可能更优。
  3. 规模仍不够"基础模型"级:4B–14B 相对 LLM 千亿级仍小;NVIDIA 自己没声称 AGI 级能力。
  4. 闭源的 curation 细节:100M clips 具体来源、caption 模型细节、Aegis 训练数据等关键信息部分黑盒。
  5. 物理一致性短期 OK 长期漂移:所有 autoregressive/diffusion video model 都有的问题——长视频生成 drift,物理细节累积误差。
  6. Physical AI 真机闭环未充分验证:论文展示 post-train 后能生成机器人 manipulation 视频,但"用 WFM 训出的 policy 在真机上 work"的完整闭环 demo 仍少。
  7. AR 路线需 diffusion decoder 补:DV8×16×16 压缩太狠失真,需要额外 7B diffusion decoder 翻译——架构复杂度高、推理链长。

研究者视角

图谱定位:Cosmos 是 T09 World Model as Simulator 线索转折 2(生成式 world model 作 simulator)的产业级平台代表。📎

与 Genie、1X WM 同支线,定位为"产业级平台"——tokenizer + predictor + guardrails + 数据 pipeline 全套。

它是第一个真正产业级、全开放、配套完整的 Physical AI WFM 平台。

继承 / 催生

  • 建立在:DiT [Peebles & Xie 2023](diffusion 架构基础);EDM [Karras 2022](preconditioning + uncertainty weighting);Stable Diffusion / VideoLDM [Blattmann 2023](latent diffusion 范式);Llama3 [Meta 2024](AR 架构);LoRA [Hu 2022](AdaLN-LoRA);T5-XXL [Raffel 2020] + SigLIP [Zhai 2023];FSQ [Mentzer 2023](离散量化);RetinaFace [Deng 2020](face blur);Aegis / Llama-Guard(safety)。
  • 同期/对照:Sora [OpenAI 2024](闭源 video generation);Genie / Genie 2 [DeepMind 2024](T09 转折 2);1X WM [1X Technologies 2024](T09 转折 2);Stable Video Diffusion、CogVideoX;GR-2 [Cheang 2024](video-language-action);DreamerV3 [Hafner 2023](T09 转折 1,latent world model 路线对照)。
  • 引出:Physical AI WFM 后续工作(post-train 范式被广泛采纳);video tokenizer 作为独立研究方向;WFM + policy 闭环(1X WM 的"用 WM 评估 policy"思路被 Cosmos 接受并放大)。
  • 与 P-GR00T-N1-2025、P-iDP3-2024 在 Physical AI 数据/控制维度互补(WFM 提供数据/评估,policy 模型提供执行)。

Open problems

  1. 物理仿真的真实性:Cosmos 自承是 video generation 不是严格物理仿真。能否做到可解析的物理一致性(接触、形变、长程动力学),仍是 WFM 走向替代真仿真器的关键。[未确认]
  2. action 内生 vs post-train:Cosmos 的 action 是 post-train 加的,Genie 是内生的。哪种路线在长程 control 上更优,开放。[未确认]
  3. WFM + policy 闭环:用 WFM 训出的 policy 在真机上 work 的完整闭环 demo 仍少。如何把 WFM 接入 RL 训练 loop,是下一阶段重点。[未确认]

常见误区

"Cosmos 是个物理仿真器" —— 错。

Cosmos 是 video generation 模型。论文自承"看起来物理 plausible"但不等于可解析物理仿真。

Cosmos 是生成式 world model,不是 MuJoCo/Isaac 的替代品。"additional research is required"。📎

"Cosmos 只有一条 diffusion 路线" —— 错。

Cosmos 同时探索 diffusion(Cosmos-Predict1-7B/14B)和 AR(Cosmos-Predict1-4B/12B)两条路。

diffusion 用 continuous latent + DiT,AR 用 discrete token + Llama3-style GPT。

业界对"video generation 走 diffusion 还是 AR"没定论,Cosmos 同时给两套让后续工作对比。

"Cosmos WFM 自己懂 action" —— 错。

预训阶段 WFM 只学视频分布,不懂 action。

action-conditioning 是 post-train 时加的——这意味着 generalist 阶段学到的"世界动力学"和 action 解耦。

Genie 那种 action-内生学习的路线在长程 control 上可能更优。

"Cosmos 是闭源" —— 错。

模型开放权重(Cosmos-Predict1-7B/14B-Text2World/Video2World、4B/12B-AR)、代码开源(Cosmos-Predict 仓库)、tokenizer 开源。

Cosmos 与 Sora(闭源)的关键差别就是"全开放"——这是它对社区的卖点。

"Cosmos Tokenizer 只能配 Cosmos WFM 用" —— 错。

Cosmos Tokenizer 在 DAVIS 和 TokenBench 上所有压缩率 SOTA,比 FLUX/CogVideoX 快 2–12 倍、参数最小。

即使不用 Cosmos WFM,单拿 tokenizer 用都有价值——它是个独立有价值的工件。

检查点

Q1

Cosmos 用什么数据训出 WFM?为什么从 2 千万小时筛到一亿段 clip?筛掉的 30% 是因为什么?

💡 参考答案

  • 数据来源:2 千万小时原始网络视频(多源:YouTube 类、自驾、第一人称、鱼眼等)筛出一亿段 2–60 秒 clip。
  • 筛 clip 的 why:要做 shot change 检测、视觉质量过滤、动态丰富度筛选(只保留有运动的)、物理 plausibility 筛选——只要物理上有意义的片段。
  • 筛掉 30% 是 deduplication:用 InternVideo2 embedding 做 semantic dedup,去掉语义重复样本,避免模型在重复数据上过拟合
Q2

Cosmos 不是真正的"物理仿真器",那它是什么?用它来"想象未来"和用 MuJoCo 仿真有什么本质区别?

💡 参考答案

  • Cosmos 是 video generation 模型(生成式 world model),不是可解析的物理仿真。
  • 区别:MuJoCo/Isaac 是可解析物理(写下了运动方程、接触模型),输出严格守物理定律;Cosmos 学的是视频分布,输出'看起来 plausible'但不保证物理一致。
  • 论文自承'看起来物理 plausible'但'additional research is required'——Cosmos 适合做 data aug / policy eval 的'快但不精确'的世界模型,不替代精确仿真器。
Q3

Cosmos 的 action 是预训时就有的、还是 post-train 时才加的?这对它的"世界动力学"理解意味着什么?

💡 参考答案

  • action 是 post-train 时才加的——预训阶段 WFM 只学视频分布('给定文字和过去几帧,生成接下来几秒'),不懂 action。
  • 意味着:generalist 阶段学到的'世界动力学'和 action 解耦;只在 post-train 把 action 加进来时,WFM 才学会'给定当前画面+动作,预测执行后画面'。
  • 对照 Genie:Genie 的 action 是内生的(学自游戏输入),可能在长程 control 上更优——这是 Cosmos 的开放局限。
Q4

用"风洞"或"飞行模拟器"或自举的类比,说明 Cosmos 对物理 AI 训练解决了什么核心问题。三个落点:(a) 数字世界试错、不用真撞;(b) 模型学到的是"世界怎么走"而非可解析物理;(c) 可小数据 fine-tune 到机器人/自驾/相机场景。

💡 参考答案

  • 核心问题:物理 AI 训练需要'观察-动作'序列数据,但探索性动作在真实世界可能伤人伤物(尤其在 AI 还不聪明的早期)。
  • 类比:风洞/飞行模拟器让飞机/飞行员在数字世界安全试错,不用真撞真试;Cosmos 让机器人在数字世界预演动作,看预测结果再决定真做不做。
  • 重要补充:Cosmos 学的是视频分布不是可解析物理——它快但不精确,是'安全的练习场'不是'真实飞的替代'。
Q5

业界对"视频生成走 diffusion 还是自回归(AR)"没定论。Cosmos 在这件事上采取了什么策略?

💡 参考答案

  • 策略:两条路都做。Cosmos 同时给 diffusion WFM(Cosmos-Predict1-7B/14B)和 AR WFM(Cosmos-Predict1-4B/12B)。
  • 两条路机制不同:diffusion 在 continuous latent + DiT 上扩散;AR 是 Llama3-style GPT、在 discrete token 上 next-token 预测。
  • 意义:让后续工作可对比两条路;这是 Cosmos 作为'平台'而非单模型的价值。

FAQ

Q1:Cosmos 开源吗?我能拿来 fine-tune 吗?

能。模型开放权重(HuggingFace),代码开源于 Cosmos-Predict 仓库,tokenizer 也开源。🌐建议直接用开放权重的 Cosmos-Predict1-7B/14B-Text2World/Video2World 或 4B/12B-AR 做 fine-tune,不要 from scratch(预训要 10000 H100×3 月)。

Q2:Cosmos 是物理仿真器吗?能替代 MuJoCo/Isaac 吗?

不能。Cosmos 是 video generation 模型,不是可解析物理仿真。论文自承"看起来物理 plausible"但"additional research is required"。📎短期内 Cosmos 适合做 data aug / policy eval / MPC planning 的"快但不精确"的世界模型,不替代精确仿真器。

Q3:diffusion 和 AR 两条路线我该选哪个?

没定论。diffusion(continuous latent + DiT)在 latent 空间扩散,质量好但推理多步。AR(discrete token + Llama3 GPT)next-token 预测,推理一步出 token 但需 diffusion decoder 补细节。建议两个都试,看你下游任务对延迟 vs 质量的权衡。

Q4:Cosmos 怎么用在我自己的机器人上?

post-training。用你的 (prompt, video) 对 fine-tune Text2World;要 action 条件就 fine-tune Video2World。📎机器人场景数据可参考 1X 风格(第一人称 + action label)——1X 自己就是 Cosmos 的数据提供方。

Q5:Cosmos 的 guardrail 是装饰还是真有用?

真有用,且是产业级 deployment 的关键。pre-Guard 用 Aegis defensive + 自定义 blocklist(11 类 critical safety risk 任一命中就拒绝);post-Guard 用 SigLIP + MLP 帧级分类器 + RetinaFace 打码。📎Red Team 已测 10000+ prompt-video pair。这是后续开放 WFM 的工业级 deployment 范本。