Cosmos World Foundation Model Platform for Physical AI
动机
Physical AI(带 sensor + actuator 的 AI 系统:机器人、自驾车、人形)的最大瓶颈是数据:要训好它需要「observation-action 交替序列」,但探索性 action 可能在物理世界造成严重损害(尤其是在 AI 幼年期)。World Foundation Model(WFM)——一个 Physical AI 可以安全交互的物理世界数字孪生——长期被视为解药。
但到 2024 年底,video generation 模型(Sora、Stable Video Diffusion 等)虽然能生成漂亮视频,却都不是「为 Physical AI 设计」:
- 不开放、不可 post-train:Sora 等是闭源黑盒,机器人团队没法拿过来 fine-tune 到自己的环境。
- 缺 tokenizer/guardrail/数据 pipeline 全套:光有模型不够,Physical AI 要落地还需要 video tokenizer(压缩到可训规模)、guardrail(防生成有害内容)、数据 curation(从海量网络视频里筛出物理有意义片段)。
- 不理解 action-conditioning:纯视频生成模型不知道「未来取决于机器人采取的 action」,不是真正的 world model。
Cosmos 要回答:能否做一个 Physical AI 专用的、开放权重的、配套完整的 WFM 平台,让开发者拿到就能 fine-tune 到自己的机器人/自驾/相机控制场景?
方法核心:tokenizer + 两路 predictor + post-training + guardrail
Cosmos 是「平台」而非单模型,由四个组件构成(Fig. 2):(1) video curation pipeline;(2) Cosmos Tokenizer;(3) 预训练 WFM(diffusion + AR 两路);(4) post-training 示例 + guardrail。
一、Video Curation Pipeline(决定模型上限)
从 20M 小时原始视频(含 YouTube 类网络视频、自驾、第一人称、鱼眼等多源)里,curation 出约 100M 个 2–60 秒 clips。pipeline 用 Ray 编排,含:
- shot change 检测(§3.2.1):把长视频按镜头切分,避开剪辑 transition(剪辑转场不是物理 plausible 的状态变化)。在自建 ShotBench 上评测 PySceneDetect / Panda70M / TransNetV2 / AutoShot 四种算法,生产用 TransNetV2(神经网络方法在重编辑视频上显著优于 PySceneDetect 启发式)。
- 视觉质量过滤(§3.3.2):去模糊、去低分辨率、去 heavy-edited;用 DOVER 质量分去底部 15%,加图像美学阈值 3.5。
- 动态丰富度筛选(§3.3.1 Motion Filtering):只保留有运动/物理交互的片段(静态镜头对学物理没用);同时给 camera motion(pan/zoom/tilt)打标签。
- Text Overlay Filtering(§3.3.3):用 InternVideo2 embedding + MLP 分类器去除后加字幕/水印过多的视频(避免模型把 overlay 当场景内容学)。
- Video Type Filtering(§3.3.4):排除抽象视觉图案、游戏画面、动画等非真实物理类型;对 Physical AI 相关类别(human action、human-object interaction)上采样,对 nature/landscape 下采样。
- captioning:每个 clip 用 VLM(视觉语言模型)每 256 帧打一个 caption。
- 分类标签(§3.1,9 类带精确百分比):Driving 11% / Hand motion & object manipulation 16% / Human motion & activity 10% / Spatial awareness & navigation 16% / First-person PoV 8% / Nature dynamics 20% / Dynamic camera movements 8% / Synthetically rendered 4% / Others 7%。覆盖 Physical AI 主要场景。
- deduplication(§3.5):用 InternVideo2 embedding + RAPIDS k-means(k=10,000)做 semantic deduplication(SemDeDup 方法),去掉约 30% 训练数据(§3.5 原文 "We remove about 30% of training data during deduplication")。
- 硬件加速:用 GPU 的 H.264 编解码硬件做 transcoding。
数据决定天花板——这是 Cosmos 区别于纯学术 demo 的工程基础。
二、Cosmos Tokenizer(核心组件之一)
视频 tokenization 类似 video codec:把视频压成紧凑 token 序列,最大化保留信息。Cosmos Tokenizer 是 encoder-decoder 架构,关键设计:
1. 两种 token 类型(Fig. 7):
- Continuous(CV/CI):连续 latent embedding(像 Stable Diffusion 的 VAE),供 diffusion WFM 用。
- Discrete(DV/DI):量化整数 code(像 VQ-VAE),供 autoregressive WFM 用。
2. Causal temporal 设计:每个 stage 只处理当前 + 过去帧(不看未来),用 causal temporal conv + causal temporal attention。这让 tokenizer 天然适配 Physical AI 的「实时因果」场景。第一帧单独 token($g_0$),之后每 4 帧成组($x_{1:4} \to g_1$ 等),实现时间下采样 4×(Fig. 7 下半)。
3. Wavelet 空间操作:先用 2-level 3D wavelet 变换把输入视频在 x/y/t 各下采样 4×,后续 encoder stage 在 wavelet 域工作。wavelet 消除像素冗余,让网络专注语义压缩。
4. Spatio-temporal factorized 3D conv:每个 block 先 2D 空间卷积($1 \times k \times k$)再 1D 时间卷积($k \times 1 \times 1$),left padding 保持因果。
5. 压缩配置:
- 图像:CI/DI,8×8 和 16×16 两种空间压缩
- 视频:CV/DV,4×8×8 / 8×8×8 / 8×16×16 三种 (T×H×W) 压缩
- 离散用 FSQ (Finite Scalar Quantization),不用 VQ(FSQ 训练更稳)
重建 loss(两阶段 + fine-tune,§4.2):stage 1 = L1 + Perceptual(VGG-19 特征);stage 2 加 optical flow(OF)一致性(双向)+ Gram matrix(GM)loss 提升锐度;fine-tune 阶段加 adversarial loss(特别大压缩率时)。
性能(Tab. 5–9):在 DAVIS 和 TokenBench 上,Cosmos Tokenizer 在所有压缩率下 SOTA(PSNR/SSIM/rFVD),同时比 FLUX / CogVideoX / Omni / LlamaGen 快 2–12×,参数量最小(CV4×8×8 仅 105M)。
三、两路预训练 WFM(核心组件之二)
Cosmos 同时探索两条 scalable 路线(Tab. 10):
A. Diffusion WFM(Cosmos-Predict1-7B/14B-Text2World & Video2World)
- latent diffusion:在 Cosmos-Tokenize1-CV8×8×8-720p 的连续 latent 空间做扩散,不是像素空间。
- formulation 跟 EDM [Karras 2022]:denoiser $D_\theta$ 预测 clean sample,loss(Eq. 5–6)按噪声等级 $\sigma$ 加权。关键 trick:uncertainty-based weighting $u(\sigma)$——用 MLP 学每个噪声等级的不确定性,loss 在不确定的 $\sigma$ 上权重自动降低,等价于多任务学习的自动权重平衡。
- 架构基于 DiT [Peebles & Xie 2023](Fig. 11),改造点:
- 3D patchification:latent ($T,C,H,W$) 用非重叠 (1,2,2) cube patchify 成 1D 序列。
- 3D-factorized RoPE + FPS-aware:RoPE 频率分三段(T/H/W),按视频帧率 rescale 时间频率——支持任意分辨率/纵横比/长度/帧率。NTK-RoPE 让 progressive training(改分辨率/长度)5000 步内收敛。
- 额外 learnable 绝对位置编码 per block:降训练 loss、减 morphing artifact。
- Cross-attention 注 T5-XXL 文本 embedding:每个 block 是 self-attn → cross-attn → FFN。
- QK-normalization(RMSNorm + 可学 scale):防训练初期 attention logit 爆炸、attention entropy 塌缩。
- AdaLN-LoRA:DiT 的 adaptive layer norm 占了大量参数但 FLOPs 少,用 LoRA 低秩分解——Cosmos-Predict1-7B 因此从 11B 压到 7B(36% 参数减少),性能持平。
- 训练 7B/14B Text2World → fine-tune 出 Video2World(加视频输入当当前观测)。Text2World 训本:text → video;Video2World 训本:(text + past video) → future video,后者才是真正的 world model(未来取决于当前 + 扰动)。
- 配置(Tab. 11 精确值):
- 7B(Text2World/Video2World):28 层,model dim 4096,FFN hidden 16384,AdaLN-LoRA dim 256,32 attention heads,32 KV heads;base lr 2⁻¹⁵(约 3×10⁻⁵,两版本同),weight decay 0.1(两版本同)。
- 14B(Text2World/Video2World):36 层,model dim 5120,FFN hidden 20480,AdaLN-LoRA dim 256,40 heads,40 KV heads;base lr 2⁻¹⁶(约 1.5×10⁻⁵,两版本同),weight decay 0.2(两版本同)。
- 通用:GELU MLP activation,hybrid positional embedding,linear warmup 2500 iters,AdamW $\beta_1,\beta_2=0.9,0.99$,$\epsilon=10^{-10}$(lower betas/eps 减 loss spike);conditional info = Text + FPS(Text2World)/ Text + FPS + Frames(Video2World)。
- Text encoder:T5-XXL,zero-pad 到固定 seq_len=512;用 classifier-free guidance(但训练时不随机 zero out text embedding,靠 negative prompt 推理时实现)。
- Mixed precision:BF16 forward/backward + FP32 参数更新 + EMA;denoising score matching loss 乘 10 稳定训练。
- 显存:14B 模型需 ~280 GB(params+grads+optimizer)+ ~310 GB activations;用 FSDP(7B sharding factor 32 / 14B sharding factor 64)+ Context Parallelism(CP_SIZE=8)切到 H100 80GB 上。
B. Autoregressive WFM(Cosmos-Predict1-4B/12B)
- Llama3-style GPT,from scratch 训(不用预训练语言模型,不带语言理解)。
- Cosmos-Tokenize1-DV8×16×16-720p(离散 token)输入。
- 预训练两步:(1) vanilla next token;(2) text-conditioned Video2World。
- T5 文本 embedding 通过 cross-attention 注入 transformer block(因为模型本身无语言能力)。
- base 模型 4B/12B,再 fine-tune 出 5B/13B-Video2World。
- diffusion decoder(Cosmos-Predict1-7B-Decoder-DV8×16×16ToCV8×8×8-720p):AR 模型用大压缩比离散 token 会失真,用 diffusion decoder 把离散 token 空间翻译回连续 token 空间补细节。
配套 Prompt Upsampler(Cosmos-UpsamplePrompt1-12B-Text2World):基于 Mistral-NeMo-12B-Instruct,把人写的 prompt 转成 VLM caption 风格——因为训练 caption 是 VLM 生成的,分布和人写的不一样。
训练规模:10000 H100 GPU,三个月,训完所有 WFM(§5.1 原话 "using a cluster of 10,000 NVIDIA H100 GPUs in a time span of three months")。
四、Post-training(示范三类下游)
WFM 的核心卖点是 generalist 预训练 → 小数据 post-train 到专用场景(Fig. 2)。论文示范三类:
- Camera Control(§6.1):fine-tune diffusion WFM 让它条件于 camera pose(轨迹/角度),生成从指定视角看到的视频。这是「相机绕场」应用。
- Robotic Manipulation(§6.2):分两个任务——(a) instruction-based video prediction(输入当前帧 + 文本指令 → 预测机器人执行指令后的未来视频),用 Cosmos-1X 数据集(约 200 小时 EVE 人形 egocentric 视频,12000 段 1–9 秒 episodes,致谢明确感谢 1X Technologies);(b) action-based next-frame generation(输入当前帧 + action vector → 预测下一帧),用公开 Bridge 数据集(机械臂)。
- Autonomous Driving(§6.3):fine-tune 到自驾场景。
post-training 数据集相对预训练小得多——这是「foundation model」范式的关键优势。
五、Guardrail(核心组件之四,Physical AI 安全用)
Physical AI 场景下,WFM 可能被滥用于生成有害内容(暴力、武器、CSAM 等)。Cosmos 设计双层 guardrail(Fig. 30):
pre-Guard(输入端,文本域):
- Keyword blocklist:第一道防线。输入做 WordNet lemmatization(变体归一)后查硬编码敏感词表,命中就拒绝。
- Aegis LLM guardrail:第二道。用 NVIDIA 的 Aegis-AI-Content-Safety-LlamaGuard-LLM-Defensive-1.0(基于 Llama-Guard fine-tune,覆盖 NVIDIA 的 13 类 critical safety risk taxonomy,选 defensive 版本——边界比 permissive 版紧)。命中以下 11 类任一就拒绝:violence / sexual / criminal planning / weapons / substance abuse / suicide / CSAM(child sexual abuse material)/ hatred / harassment / threat / profanity。
post-Guard(输出端,视觉域):
- Video Content Safety Classifier:帧级多类分类器。SigLIP 提每帧 embedding + MLP 分类。任一帧不安全则整个视频判不安全。训练数据三源:真实视频(VLM 自动打标)+ WFM 合成(覆盖 corner case)+ 人工金标(gold standard validation)。
- Face Blur Filter:RetinaFace 检测 >20×20 像素的脸部区域,pixelation 打码(保留场景构图)。
Red Team:专门团队用标准 + 对抗样本攻击,截至发表已测 10000+ prompt-video pair,按 1–5 分多类危害打分标注起止帧,持续改进。
与 Genie / 1X WM 的对比(T09 转折 2 同支线)
这是 T09 线索里 Cosmos 的精确定位。三者都是「生成式 world model 作 simulator」,但目标和形态不同:
| 维度 | Cosmos (NVIDIA 2025) | Genie / Genie 2 (DeepMind 2024) | 1X WM (1X Technologies 2025) |
|---|---|---|---|
| 目标 | Physical AI 通用平台 | 通用可交互环境(游戏/世界) | 人形机器人专属评估器 |
| 数据 | 100M 网络视频 clips(多源) | 大量 2D 游戏视频 + 真实视频 | 真实人形第一人称视频 |
| 规模 | 4B–14B,10k H100×3 月 | 未公开(推测中大规模) | 中等 |
| 架构 | diffusion (DiT-based) + AR (Llama3-style) 两路 | latent diffusion + 动作条件 | diffusion(细节未公开) |
| action 条件 | post-train 时加(camera/robot/auto) | 内生(学自游戏输入) | 内生(人形 action) |
| Tokenizer | 自研 Cosmos Tokenizer(CV/DV,SOTA) | 未单独发布 | 未单独发布 |
| Guardrail | 完整 pre+post Guard + Red Team | 无(研究 demo) | 无 |
| 开放 | 模型开放权重 + 代码开源 + tokenizer 开源 | 闭源(仅 demo 视频) | 部分开放 + 公开 benchmark |
| 物理精度 | 强调「3D consistent + accurate physics」 | 可玩但物理粗糙 | 真实人形动力学 |
| 下游用法 | data aug / policy eval / MPC planning / sim2real | 主要玩游戏、研究 | 直接给 policy 打分,无需真机部署 |
Cosmos 的独特定位:(1) 是三者中唯一完整开放 + 产业级的平台;(2) 配套 tokenizer + guardrail + curation pipeline 是 Genie/1X 都没给出的;(3) 同时探索 diffusion + AR 两条路(其他两家基本是 diffusion 单路);(4) post-training 范式明确——foundation model → 小数据 fine-tune 到 camera/robot/drive,直接服务 Physical AI builder。
与 Genie 的本质区别:Genie 的「世界」主要来自游戏数据,物理真实性弱、目标是「可玩」;Cosmos 的「世界」来自真实视频(含自驾、机器人),目标是「物理 plausible + 可服务 real Physical AI」。Genie 偏 research demo,Cosmos 偏 production platform。
与 1X WM 的本质区别:1X WM 是「垂直」——只为人形,用自己的人形数据,目标是 policy 评估;Cosmos 是「水平」——给所有 Physical AI 用,post-train 到任何场景,1X 自己都是 Cosmos 的数据提供方(见致谢)。
为什么重要
- 第一个产业级、全开放、配套完整的 Physical AI world foundation model 平台:不是单篇论文 demo,而是「tokenizer + predictor + post-train + guardrail + 数据 pipeline」全套。Physical AI builder 拿到就能用,是把 WFM 从「学术概念」推向「工业基础设施」的标志。
- Cosmos Tokenizer 独立有价值:在图像/视频 tokenizer 的 compression-quality trade-off 上 SOTA,且比 FLUX/CogVideoX 快 2–12×、参数最小。即使不用 Cosmos WFM,单拿 tokenizer 用都有价值。
- diffusion + AR 两路并行:业界对「video generation 应走 diffusion 还是 AR」没定论,Cosmos 同时给两套(diffusion 走 continuous latent + DiT,AR 走 discrete token + Llama3 GPT),让后续工作可对比。
- post-training 范式可复用:预训练 WFM 是 generalist,post-train 用小数据 fine-tune 到 camera/robot/drive。这套范式(类比 LLM 的 pre-train + SFT)会成为 Physical AI 的默认。
- guardrail 标杆:Physical AI 的 WFM 因为输出可视化内容,安全风险比 LLM 更直观。Cosmos 的 pre/post Guard + Red Team 是工业级 deployment 的范本,后续开放 WFM 都会参考。
局限(论文 §1 承认「far from being solved」、§8 列举具体短板)
- 仍是 video generation,不是严格物理仿真:生成的视频虽然「看起来物理 plausible」,但不是 MuJoCo/Isaac 那种可解析的物理。Cosmos 自己承认「additional research is required」(§1 末)。
- action-conditioning 是 post-train 加的,不是内生:预训练 WFM 不懂 action(只学视频分布),action 条件靠 fine-tune 加——这意味着 generalist 阶段学到的「世界动力学」和 action 解耦,可能限制 post-train 后的准确性。Genie 那种 action-内生学习的路线在长程 control 上可能更优。
- 规模仍不够「基础模型」级:4B–14B 相对 LLM 的千亿级仍小;NVIDIA 自己没声称 AGI 级能力。
- 闭源的 curation 细节:100M clips 的具体来源、caption 模型细节、Aegis 训练数据等关键信息部分黑盒,难精确复现。
- 物理一致性短期 OK 长期漂移:所有 autoregressive/diffusion video model 都有的问题——长视频生成会 drift,物理细节(接触、形变)累积误差。
- Physical AI 真机闭环未充分验证:论文展示 post-train 后能生成机器人 manipulation 视频,但「用 WFM 训出的 policy 在真机上 work」的完整闭环 demo 仍少;这块 1X WM 走得更前。
- AR 路线需 diffusion decoder 补:DV8×16×16 压缩太狠失真,需要额外 7B diffusion decoder 翻译——架构复杂度高、推理链长。
复现要点
- Tokenizer:开源于 Cosmos-Predict 仓库。配置选择:图像用 CI8×8(PSNR 28.66)/ CI16×16(更高压缩);视频用 CV4×8×8(最高质量)/ CV8×8×8 / CV8×16×16(最高压缩)。单 A100 80GB 一次可 encode 720p 8s 或 1080p 10s。
- 预训练 WFM:规模大(10k H100×3 月),个人/小团队基本无法 from scratch。建议直接用开放权重的 Cosmos-Predict1-7B/14B-Text2World/Video2World 或 4B/12B-AR。
- 关键架构 trick(diagnosis 用):3D patchify (1,2,2);3D-factorized FPS-aware RoPE + 每 block learnable PE;QK-RMSNorm;AdaLN-LoRA(参数减 36%);EDM preconditioning + uncertainty weighting。
- Prompt:人写的 prompt 建议先用 Cosmos-UpsamplePrompt1-12B 转成 VLM caption 风格,否则分布不匹配。
- post-train:用自己场景的 (prompt, video) 对 fine-tune Text2World;要 action 条件就 fine-tune Video2World。机器人场景数据可参考 1X 风格(第一人称 + action label)。
- guardrail:pre-Guard 用 Aegis defensive + 自定义 blocklist;post-Guard 训 SigLIP + MLP 帧级分类器 + RetinaFace 打码。
- 预期难度:高(预训练);中(post-train,开放权重基础上 fine-tune);低(仅用 tokenizer)。
相关
- 建立在:DiT [Peebles & Xie 2023](diffusion 架构基础);EDM [Karras et al. 2022](preconditioning + uncertainty weighting);Stable Diffusion / VideoLDM [Blattmann 2023](latent diffusion 范式);Llama3 [Meta 2024](AR 架构);LoRA [Hu et al. 2022](AdaLN-LoRA);T5-XXL [Raffel 2020] + SigLIP [Zhai 2023](文本/视觉 embedding);FSQ [Mentzer 2023](离散量化);RetinaFace [Deng 2020](face blur);Aegis / Llama-Guard [Ghosh 2024, Inan 2023](safety);Wavelet transform(tokenizer 域变换)。
- 同期/对照:Sora [OpenAI 2024](闭源 video generation world simulator);Genie / Genie 2 [DeepMind 2024](T09 转折 2,可交互环境研究 demo);1X WM [1X Technologies 2025, arxiv:2510.07092](T09 转折 2,人形垂直、policy 评估用);Stable Video Diffusion [Blattmann 2023];CogVideoX [Yang 2024];GR-2 [Cheang 2024](video-language-action);3D-VLA(VLA + 3D + generative WM 合流);DreamerV3 [Hafner 2023](T09 转折 1,latent world model 路线对照)。
- 引出:Physical AI WFM 后续工作(post-train 范式被广泛采纳);video tokenizer 作为独立研究方向(Cosmos Tokenizer 被后续工作直接用);WFM + policy 闭环(1X WM 的「用 WM 评估 policy」思路被 Cosmos 接受并放大);BeyondMimic 等 motion diffusion + physics 合流也间接受益(WFM 提供生成、物理 controller 提供执行)。
- 本仓库笔记交叉引用:T09-world-model-as-simulator.md(转折 2,产业级平台);与 P-DreamerV3-2023.md(latent world model 路线对照);与 T05 Diffusion Policy / T08 Action Generation 在「diffusion 生成」维度交叉,但 Cosmos 的目标是 world simulation 不是 action generation;与 P-iDP3-2024.md、P-GR00T-N1-2025.md 在 Physical AI 数据/控制维度互补(WFM 提供数据/评估,policy 模型提供执行)。