Q1:Cosmos 开源吗?我能拿来 fine-tune 吗?
能。模型开放权重(HuggingFace),代码开源于 Cosmos-Predict 仓库,tokenizer 也开源。🌐建议直接用开放权重的 Cosmos-Predict1-7B/14B-Text2World/Video2World 或 4B/12B-AR 做 fine-tune,不要 from scratch(预训要 10000 H100×3 月)。
论文:NVIDIA(项目架构师 Ming-Yu Liu 等). Cosmos World Foundation Model Platform for Physical AI. arXiv:2501.03575(2025.01 首发,2025.07 v3). 🌐 · 开放权重 + 开源代码(Cosmos Tokenizer + Cosmos-Predict)。
给机器人和自驾一个"数字风洞"。
用一亿段视频训出能"想象未来"的视频生成大模型。
想试错就找它,不用真撞真试。
Cosmos 之于物理 AI,就像风洞之于飞机设计。
在数字世界看"这样做会怎样"。
要解决的问题:物理 AI 的训练被数据卡住。📎
物理 AI 指带传感和动作的 AI 系统:机器人、自驾车、人形。
它们需要"观察-动作"序列数据。
但探索性动作在物理世界可能伤人伤物。
尤其在 AI 还不聪明的早期。
世界基础模型(WFM)长期被视为解药。
它是一个能让 AI 安全交互的生成式世界模型。
它「想象」未来,不「计算」未来。
所以它不是可解析的物理仿真器。
老办法:到 2024 年底,视频生成模型已能生成漂亮视频。
Sora、Stable Video Diffusion 是代表。
但都不是为物理 AI 设计。📎
它们闭源、不可 fine-tune。
它们不懂"未来取决于机器人采取的动作"。
也不是真正的世界模型。
光有模型也不够。
物理 AI 落地还要 tokenizer。
还要 guardrail。
还要数据 pipeline。
Cosmos 的转身:做一个产业级、开放权重、配套完整的 WFM 平台。
核心是用海量视频预训一个通用 WFM。
然后用小数据 fine-tune 到具体场景(机器人、自驾、相机控制)。
Cosmos 之于物理 AI,就像 LLM 之于语言任务。
先预训通用大模型,再 post-train 到具体应用。
方法核心(大白话):用一亿段视频训一个能"想象未来"的视频生成大模型。📎
预训阶段:从 2 千万小时原始视频里筛出一亿段短 clip。
每段 2 到 60 秒。
每个 clip 配一段文字描述。
约 30% 数据因低质或重复被筛掉。
模型学的就是"给定文字和过去几帧视频,生成接下来几秒的视频"。
这一步学到的是"世界长什么样、物理怎么走"。
但纯视频生成还不够。
真正的世界模型要知道"如果我做了动作 X,世界会变成什么样"。
所以 Cosmos 在预训后做 post-training。
把机器人或自驾的"动作"作为额外条件加进来。
模型就学会"给定当前画面和想做的动作,预测执行后的画面"。
部署时机器人拿这个 WFM 当「数字风洞」用。
但跟真风洞有本质区别。
真风洞用方程算,可解析。
WFM 用学习「想象」,不可解析。
先在脑子里试一遍动作,看预测好不好。
再决定真做不做。
配套还有 Cosmos Tokenizer(把视频压成 token)。
还有双层 guardrail(防生成有害内容)。
关键工程贡献·配套完整:Cosmos 不是单篇论文 demo。
是全套。
tokenizer、predictor、post-train 都有。
guardrail 和数据 pipeline 也有。
开发者拿到就能 fine-tune 到自己的机器人/自驾/相机场景。
这是把 WFM 从"学术概念"推向"工业基础设施"的标志。
你会看到:4B–14B 参数的 WFM,开放权重、开源代码。
扩散和自回归两条技术路线都给。
预训用一万张 H100 跑三个月。
后续机器人/自驾团队可以直接拿来 fine-tune。
1X Technologies 等人形公司已用 Cosmos 做数据增强。
一句话类比:Cosmos 之于物理 AI,就像飞行模拟器之于飞行员训练。
模拟器让你在数字世界安全试错。
不用真撞真飞机,就能学会判断"如果我这样做会怎样"。
核心机制·四组件平台:(1) video curation pipeline;(2) Cosmos Tokenizer;(3) 预训 WFM(diffusion + AR 两路);(4) post-training 示例 + guardrail。📎
一、Video Curation Pipeline(决定模型上限):
从 2 千万小时原始视频筛出约一亿段 2 到 60 秒 clip。
pipeline 用 Ray 编排。
含 shot change 检测(避开剪辑转场)。
视觉质量过滤(去模糊、去低分辨率)。
动态丰富度筛选(只保留有运动的片段)。
物理 plausibility(保留物理可能的状态转移)。
captioning(VLM 每 256 帧打一个 caption)。
9 类分类标签:驾驶 11%、手部操作 16%、人体运动 10%、空间导航 16%。
第一人称 8%、自然动力学 20%、动态相机 8%、合成 4%、其他 7%。
dedup 去掉约 30% 训练数据。
二、Cosmos Tokenizer(核心组件之一):
encoder-decoder 架构,把视频压成紧凑 token 序列。
两种 token 类型:连续(供 diffusion WFM 用)和离散(供 AR WFM 用)。
连续像 Stable Diffusion 的 VAE,离散像 VQ-VAE。
causal temporal 设计:每个 stage 只看当前+过去帧。
天然适配物理 AI 的"实时因果"场景。
空间压缩 8×8 或 16×16,时间压缩 4 或 8 倍。
离散用 FSQ(Finite Scalar Quantization)不用 VQ,训练更稳。
性能:在 DAVIS 和 TokenBench 上所有压缩率 SOTA。
比 FLUX、CogVideoX、Omni、LlamaGen 快 2–12 倍。
参数量最小(CV4×8×8 仅 105M)。
三、两路预训 WFM(核心组件之二):
Cosmos 同时探索 diffusion 和 AR 两条 scalable 路线。
A. Diffusion WFM(Cosmos-Predict1-7B/14B):
latent diffusion,在连续 latent 空间做扩散。
用 Cosmos-Tokenize1-CV8×8×8。
formulation 跟 EDM(Karras 2022):denoiser 预测 clean sample。
uncertainty-based weighting $u(\sigma)$——MLP 学每个噪声等级的不确定性。
loss 在不确定的 σ 上权重自动降低。
架构基于 DiT(Peebles & Xie 2023)。
关键 trick:3D patchification(1,2,2 cube)。
3D-factorized RoPE + FPS-aware(支持任意分辨率/纵横比/帧率)。
QK-normalization(防训练初期 attention logit 爆炸)。
AdaLN-LoRA:把 DiT adaptive layer norm 用 LoRA 低秩分解。
7B 因此从 11B 压到 7B(参数减 36%),性能持平。
Text2World 训本(text→video)。
fine-tune 出 Video2World(加 past video→future video)。
后者才是真正的 world model。
配置(Tab.11 精确值):
7B:28 层,model dim 4096,FFN hidden 16384。
AdaLN-LoRA dim 256,32 heads,32 KV heads。
14B:36 层,model dim 5120,FFN hidden 20480,40 heads。
40 KV heads。
base lr 约 3e-5(7B)/ 1.5e-5(14B),Text2World 与 Video2World 同;weight decay 0.1(7B)/ 0.2(14B)。
通用:GELU、AdamW(β1, β2=0.9, 0.99),linear warmup 2500 iters。
Text encoder:T5-XXL,sequence length 512。
显存:14B 需约 280 GB 参数+梯度+优化器。
加约 310 GB activations。
用 FSDP + Context Parallelism 切到 H100 80GB 上。
B. Autoregressive WFM(Cosmos-Predict1-4B/12B):
Llama3-style GPT,from scratch 训(不用预训 LLM、不带语言理解)。
Cosmos-Tokenize1-DV8×16×16 离散 token 输入。
预训两步:vanilla next token,然后 text-conditioned Video2World。
T5 文本 embedding 通过 cross-attention 注入。
base 4B/12B,fine-tune 出 5B/13B-Video2World。
diffusion decoder:AR 模型用大压缩比离散 token 会失真。
需 diffusion decoder 把离散 token 翻译回连续 token 补细节。
训练规模:10000 H100 GPU,三个月,训完所有 WFM。📎
四、Post-training(示范三类下游):
WFM 核心卖点是 generalist 预训 → 小数据 post-train 到专用场景。
(轨迹/角度)
WFM 接受机器人观测+动作,预测执行动作后的未来视频。
致谢明确感谢 1X Technologies 提供人形机器人数据。
五、Guardrail(Physical AI 安全用):
双层 guardrail。
pre-Guard(输入端、文本域):keyword blocklist + Aegis LLM guardrail。
Aegis 基于 Llama-Guard,覆盖 NVIDIA 13 类 safety taxonomy。
命中以下 11 类任一就拒绝。
violence / sexual / criminal planning / weapons。
substance abuse / suicide / CSAM / hatred。
harassment / threat / profanity。
post-Guard(输出端、视觉域)。
Video Content Safety Classifier。
用 SigLIP 提每帧 embedding + MLP 分类。
任一帧不安全则整个视频判不安全。
Face Blur Filter。
RetinaFace 检测 >20×20 像素的脸部,pixelation 打码。
Red Team:10000+ prompt-video pair 测试。
常见误区(先抛一个,完整版见末尾):"Cosmos 是个物理仿真器吧?"
不是。Cosmos 是 video generation 模型。
论文 §1 末自己承认生成的视频"看起来物理 plausible"。
但不是 MuJoCo/Isaac 那种可解析的物理仿真。
"additional research is required"。📎
Cosmos Tokenizer 的精确设计:
两种 token 类型:continuous(CV/CI)和 discrete(DV/DI)。
causal temporal:第一帧单独 token($g_0$),之后每 4 帧成组($x_{1:4}\to g_1$),实现时间下采样 4 倍。
wavelet 空间操作:2-level 3D wavelet 变换把输入视频在 x/y/t 各下采样 4 倍。
spatio-temporal factorized 3D conv:每 block 先 2D 空间卷积($1\times k\times k$)再 1D 时间卷积($k\times 1\times 1$),left padding 保持因果。
重建 loss:L1/L2 + optical flow(OF)一致性 + Gram matrix(GM)loss + adversarial loss(fine-tune 阶段)。
Diffusion WFM 的精确数学(Eq.5–6):
按 EDM formulation:denoiser $D_\theta$ 预测 clean sample。
loss 按噪声等级 σ 加权。
关键 trick:uncertainty-based weighting $u(\sigma)$——用 MLP 学每个 σ 的不确定性。
loss 在不确定的 σ 上权重自动降低,等价于多任务学习的自动权重平衡。
3D patchification & RoPE 细节:
latent ($T, C, H, W$) 用非重叠 (1, 2, 2) cube patchify 成 1D 序列。
3D-factorized RoPE:频率分三段(T/H/W),按视频帧率 rescale 时间频率。
支持任意分辨率/纵横比/长度/帧率。
NTK-RoPE 让 progressive training(改分辨率/长度)5000 步内收敛。
额外 learnable 绝对位置编码 per block:降训练 loss、减 morphing artifact。
Cross-attention 注 T5-XXL 文本 embedding,每 block 是 self-attn → cross-attn → FFN。
QK-normalization(RMSNorm + 可学 scale):防训练初期 attention logit 爆炸、attention entropy 塌缩。
AdaLN-LoRA 的节省:
DiT 的 adaptive layer norm 占了大量参数但 FLOPs 少。
用 LoRA 低秩分解。
Cosmos-Predict1-7B 因此从 11B 压到 7B(36% 参数减少),性能持平。
Mixed precision 训练:
BF16 forward/backward + FP32 参数更新 + EMA。
denoising score matching loss 乘 10 稳定训练。
classifier-free guidance:训练时不随机 zero out text embedding,靠 negative prompt 推理时实现。
Prompt Upsampler(Cosmos-UpsamplePrompt1-12B-Text2World):
基于 Mistral-NeMo-12B-Instruct。
把人写的 prompt 转成 VLM caption 风格。
因为训练 caption 是 VLM 生成的,分布和人写的不一样。
与 Genie / 1X WM 的对比:
三者都是"生成式 world model 作 simulator"(T09 转折 2)。
1X 自己是 Cosmos 的数据提供方(见致谢)。
Cosmos 与 Genie 的本质区别:
Genie 的"世界"主要来自游戏数据,物理真实性弱,目标是可玩。
Cosmos 的"世界"来自真实视频(含自驾、机器人),目标是物理 plausible + 可服务 real Physical AI。
Genie 偏 research demo,Cosmos 偏 production platform。
Cosmos 与 1X WM 的本质区别:
1X WM 是"垂直"——只为人形,用自己的数据,目标是 policy 评估。
Cosmos 是"水平"——给所有 Physical AI 用,post-train 到任何场景。
局限(论文 §8 自己承认 "far from solved"):
图谱定位:Cosmos 是 T09 World Model as Simulator 线索转折 2(生成式 world model 作 simulator)的产业级平台代表。📎
与 Genie、1X WM 同支线,定位为"产业级平台"——tokenizer + predictor + guardrails + 数据 pipeline 全套。
它是第一个真正产业级、全开放、配套完整的 Physical AI WFM 平台。
继承 / 催生:
Open problems:
"Cosmos 是个物理仿真器" —— 错。
Cosmos 是 video generation 模型。论文自承"看起来物理 plausible"但不等于可解析物理仿真。
Cosmos 是生成式 world model,不是 MuJoCo/Isaac 的替代品。"additional research is required"。📎
"Cosmos 只有一条 diffusion 路线" —— 错。
Cosmos 同时探索 diffusion(Cosmos-Predict1-7B/14B)和 AR(Cosmos-Predict1-4B/12B)两条路。
diffusion 用 continuous latent + DiT,AR 用 discrete token + Llama3-style GPT。
业界对"video generation 走 diffusion 还是 AR"没定论,Cosmos 同时给两套让后续工作对比。
"Cosmos WFM 自己懂 action" —— 错。
预训阶段 WFM 只学视频分布,不懂 action。
action-conditioning 是 post-train 时加的——这意味着 generalist 阶段学到的"世界动力学"和 action 解耦。
Genie 那种 action-内生学习的路线在长程 control 上可能更优。
"Cosmos 是闭源" —— 错。
模型开放权重(Cosmos-Predict1-7B/14B-Text2World/Video2World、4B/12B-AR)、代码开源(Cosmos-Predict 仓库)、tokenizer 开源。
Cosmos 与 Sora(闭源)的关键差别就是"全开放"——这是它对社区的卖点。
"Cosmos Tokenizer 只能配 Cosmos WFM 用" —— 错。
Cosmos Tokenizer 在 DAVIS 和 TokenBench 上所有压缩率 SOTA,比 FLUX/CogVideoX 快 2–12 倍、参数最小。
即使不用 Cosmos WFM,单拿 tokenizer 用都有价值——它是个独立有价值的工件。
Cosmos 用什么数据训出 WFM?为什么从 2 千万小时筛到一亿段 clip?筛掉的 30% 是因为什么?
💡 参考答案
Cosmos 不是真正的"物理仿真器",那它是什么?用它来"想象未来"和用 MuJoCo 仿真有什么本质区别?
💡 参考答案
Cosmos 的 action 是预训时就有的、还是 post-train 时才加的?这对它的"世界动力学"理解意味着什么?
💡 参考答案
用"风洞"或"飞行模拟器"或自举的类比,说明 Cosmos 对物理 AI 训练解决了什么核心问题。三个落点:(a) 数字世界试错、不用真撞;(b) 模型学到的是"世界怎么走"而非可解析物理;(c) 可小数据 fine-tune 到机器人/自驾/相机场景。
💡 参考答案
业界对"视频生成走 diffusion 还是自回归(AR)"没定论。Cosmos 在这件事上采取了什么策略?
💡 参考答案
能。模型开放权重(HuggingFace),代码开源于 Cosmos-Predict 仓库,tokenizer 也开源。🌐建议直接用开放权重的 Cosmos-Predict1-7B/14B-Text2World/Video2World 或 4B/12B-AR 做 fine-tune,不要 from scratch(预训要 10000 H100×3 月)。
不能。Cosmos 是 video generation 模型,不是可解析物理仿真。论文自承"看起来物理 plausible"但"additional research is required"。📎短期内 Cosmos 适合做 data aug / policy eval / MPC planning 的"快但不精确"的世界模型,不替代精确仿真器。
没定论。diffusion(continuous latent + DiT)在 latent 空间扩散,质量好但推理多步。AR(discrete token + Llama3 GPT)next-token 预测,推理一步出 token 但需 diffusion decoder 补细节。建议两个都试,看你下游任务对延迟 vs 质量的权衡。
post-training。用你的 (prompt, video) 对 fine-tune Text2World;要 action 条件就 fine-tune Video2World。📎机器人场景数据可参考 1X 风格(第一人称 + action label)——1X 自己就是 Cosmos 的数据提供方。
真有用,且是产业级 deployment 的关键。pre-Guard 用 Aegis defensive + 自定义 blocklist(11 类 critical safety risk 任一命中就拒绝);post-Guard 用 SigLIP + MLP 帧级分类器 + RetinaFace 打码。📎Red Team 已测 10000+ prompt-video pair。这是后续开放 WFM 的工业级 deployment 范本。