T09 · World Model 作为 Simulator —— 从 model-based RL 复兴到生成式世界模型
核心问题:怎么让机器人不用真机、不用物理仿真,就有一个"可交互、可推演、可评估"的环境?World model 想做的是学习一个环境模型替代真实物理世界,在它里面训练、规划、评估 policy。
状态:🟢 活跃(2024-2025 与 VLA 合流;2026 上半年「World Action Models」作为子领域被命名,3D 表示 / 跨本体评估 / 视频扩散 WAM 代表作并行爆发)
🎯 你将学到什么
1. 区分 world model 在控制里的三种用法:数据源(生成训练数据)、评估器(给 policy 打分)、规划器(imagination rollout)
2. 掌握 DreamerV3 的 RSSM(确定性 GRU + 随机 categorical latent)+ symlog/twohot/return-norm/free-bits 归一化套件为何能让单一固定超参通 150+ 任务
3. 看懂 Genie / Cosmos / 1X WM 这条像素级生成式 world model 线如何从概念变成 demo 与公开 benchmark
4. 理解 WPE 揭示的「world model 作评估器会幻觉成功」警示,及其对排序 vs 绝对值的不同可靠性
5. 能解释 3D-VLA / WAM 为何代表 latent WM 与像素 WM 两条主线的合流,以及 world model 如何成为 VLA 的「内部模拟器」
本页内容
基础解释
一句话直觉
用神经网络学一个"环境替身",在里面训、评估、规划机器人策略。
不用真机,也不用物理仿真。
好比飞行模拟器之于飞行员。
不用真飞,也能练出本事。
从基础理解
要解决的问题
机器人学习一直被"环境"卡脖子。
真机采集又贵又慢。
物理仿真要精确参数,仿真到真机有差距。
家里的场景根本没法仿真。
能不能用神经网络学一个"环境替身"?
给它当前画面和动作,预测下一帧。
然后用这个学来的模型,替代真实环境。
演进脉络(三个台阶)
它又能当数据源、当评估器、当规划器 📎。
方法核心(大白话)
教一个神经网络学会一件事:
"如果机器人做这个动作,下一秒画面会变成啥。"
学会后,这个网络就是个"假环境"。
可以无限滚轨迹训策略,不用碰真机。
可以给一个策略打分,看它最后成不成,省去昂贵的真机部署。
还可以在脑子里推演,挑出最优动作。
实现上有两条路。
一条在抽象数字空间里推,快但看不见。
一条直接生成视频,能看见但慢。
两种各有硬伤,正在合流。
三种用法(必须分清)
世界模型在控制里有三种完全不同的用法:
当数据源:生成合成场景,扩充训练数据。
当评估器:给策略动作,它滚一遍并打分。
当规划器:在它里面推演,选最优动作。
特别注意:当评估器会"幻觉成功"。
策略其实没做成,但生成的视频看起来像成功了。
所以目前只可信于排序,不可信于绝对分数 📎。
一句话类比
世界模型之于机器人,就像飞行模拟器之于飞行员。
不用真飞也能练,还能先在模拟器里考一把再上天。
一、这条线索在解决什么
机器人学习一直被"环境"卡脖子:真机采集贵且慢、物理仿真(MuJoCo/Isaac)需要精确物理参数且 sim-to-real 有 gap、人形在家的场景根本没法仿真。World model 的野心是:用神经网络学一个"环境模型"——给它当前观测和动作,预测下一帧观测(或 latent 下一状态)——然后用这个学来的模型替代真实环境,在其中训练 policy(数据源)、评估 policy 成功率(评估器)、或做模型预测控制(规划器)。
这条线在 2023-2025 演化出两条平行主线,并在 2024-2025 开始合流:
- Model-based RL 复兴线(DreamerV3 系):学一个 latent world model(不生成像素,只推 latent state),在 latent 空间里 imagine rollout,训 actor-critic。目标是 sample-efficient RL。
- 生成式 world model 作 simulator 线(Genie/Cosmos/1X WM):学一个 像素级生成模型(直接生成视频/图像),当可交互的 simulator 用。目标是替代物理仿真、做数据增广、评估 policy。
两条线的根本区别:前者在 latent 空间推演(快、抽象、不可视),后者在像素空间生成(慢、具体、可视、可直接喂 policy)。2024-2025 它们开始合流(3D-VLA 等),都指向"model-based 数据闭环"。
二、时间线(关键转折点)
2023 年初 DreamerV3 证明 latent world model + imagination 训 actor-critic,单一固定超参通 150+ 任务(含 Minecraft 钻石),让 model-based RL 第一次"通用"。同期 IRIS/TWM 证明 Transformer 也能做 sample-efficient world model。
真正引爆是 2024-2025:DeepMind 的 Genie(2D)/ Genie 2(3D)从单图生成可交互可玩环境,把"world model as simulator"从概念变成 demo;NVIDIA 的 Cosmos 做成产业级平台(tokenizer + predictor + guardrails + 数据 pipeline 全套);1X 的 World Model 更具体——用真实人形第一人称视频训扩散 WM,配套公开 benchmark,提出"用 WM 给 policy 打分而无需真机部署"。3D-VLA 把 VLA + 3D + generative WM 整合,是两条线合流的早期代表。
三、关键转折的深度解析
转折 1 · DreamerV3(2023):RSSM latent world model,固定超参通 150+ 任务
- 前作的缺陷:model-based RL 老问题——学的世界模型不准,在错的模型上训 policy 会"模型作弊"(exploit model error),泛化到真环境就崩。DreamerV2 在 Atari/Crafter 上能用,但每个 domain 都要调超参,不通用。
- 新方法的核心 idea:DreamerV3 [Hafner 2023, arxiv:2301.04104](Nature 2025)的核心是 RSSM(Recurrent State-Space Model)——把 latent state 拆成确定性 + 随机两部分 $s_t = (h_t, z_t)$:
- 确定性部分 $h_t = f_\theta(h_{t-1}, z_{t-1}, a_{t-1})$ 由 block-diagonal GRU(8 blocks)递推,提供稳定的长程记忆梯度(imagination horizon 可以很长不发散)。
- 随机部分有两套分布:prior $\hat{z}_t \sim p_\theta(\hat{z}_t | h_t)$(只靠历史,用于 imagination rollout)和 posterior $z_t \sim q_\theta(z_t | h_t, o_t)$(额外看当前观测,训练时用),随机变量是 $d/16$ 个 32 类 categorical。
- 训练 world model 的 loss 包括:image/reward/continue reconstruction、dynamic loss + representational loss(两条 stop-gradient 方向不同的 KL,加 1 nat free bits 防止 posterior 坍缩到 prior)。
- 学会 world model 后,完全在 latent 空间 imagine rollout($H=15$,用 prior 不用观测),在想象的 latent 轨迹上训 actor-critic,梯度通过确定性 $h_t$ 解析地反传回 policy——不需要真环境交互。
- 为什么固定超参能通 150+ 任务:DreamerV3 做了一系列"归一化"工程——critic 用 symexp + twohot 255-bin 分类分布(把连续 return 化为分类目标,让梯度量级与 return 量级解耦)、actor 用 percentile return normalization(5%–95% 百分位差 + EMA 平滑 + $\max(1, S)$ 下限保护)、KL 用 free bits(1 nat 下限)、所有 categorical 分布注入 1% unimix 防模式坍缩、optimizer 用 LaProp + AGC(0.3)而非 Adam。这套归一化让同一套超参($\eta=3\times10^{-4}$、$\gamma\approx 0.997$、$H=15$ 等)跨 domain(Atari、DM Control、Crafter、Minecraft)都稳。结果:第一次在 Minecraft 上学会收集钻石(长程、稀疏奖励、此前 model-free 方法搞不定)。
- 为什么是突破:model-based RL 第一次"通用"——不再每个任务调超参。这把 latent world model 从学术玩具变成可 scale 的范式。
- 留下的新问题:latent world model 不生成像素,没法直接当"可视化 simulator"给 VLA 用;只适合 RL,不适合 imitation。这就是第二条线的动机。
💡 核心洞察:DreamerV3 让 model-based RL 第一次「通用」的关键不在新算法,而在 RSSM(确定性 + 随机双 latent)+ 一整套归一化工程(symlog / two-hot / free bits)——这把跨 domain 调参这道隐性门槛拆掉,是 latent WM 从学术玩具升级为可 scale 范式的真正功臣。
转折 2 · 生成式 world model 作 simulator(2024-2025):Genie / Cosmos / 1X WM
这条线和 DreamerV3 的关键区别:直接在像素空间生成未来帧,模型输出是图像/视频,可以直接喂给任何图像-based policy。这个范式 2024-2025 爆发。
Genie / Genie 2(DeepMind,2024-02 / 2024-12)
- Genie [Bruce et al., arxiv:2402.15391, ICML 2024] 从单张图片生成可交互、可探索的 2D 平台可玩环境(latency 1s/帧,8 帧/秒交互),证明生成模型能从无标注游戏视频里隐式学出"可控角色 + 物理规则"。
- Genie 2 [DeepMind 2024-12 blog] 把能力升级到 3D:从单张图片生成可交互探索、支持物体持久性、键盘输入的 3D 世界,玩家可以"走进"图里的世界操控角色长达约一分钟。
- 意义:这是"world model as simulator"的标杆 demo——证明了生成模型能学到足够强的物理/因果结构,做出可控、一致的虚拟环境。后续被认为可用来给机器人生成训练场景。
Cosmos(NVIDIA,2025-01)[Cosmos Team 2025, arxiv:2501.03575]
- NVIDIA 的产业级 physical AI world foundation model 平台:不只是模型,是全套——tokenizer(把视频 tokenize,连续 CV/CI + 离散 DV/DI 两路、空间 8×8/16×16 + 时间 4/8 压缩)、predictor(diffusion DiT-based 7B/14B + AR Llama3-style 4B/12B 两路)、pre-Guard + post-Guard 双层 guardrails(关键词 blocklist + Aegis LLM + SigLIP 帧级安全分类 + RetinaFace 打码)、数据 pipeline(20M 小时原始视频 curation 出 ~100M 个 2–60 秒 clips、9 类物理场景分类、semantic dedup 去掉约 30%)。
- 定位:给机器人和自动驾驶做"learned simulator",加速训练。后续 Cosmos-Predict2.x、Cosmos 3(全模态)持续演进;与 Isaac Lab 整合(GR00T Mimic 数据 pipeline 集成待核)。是 NVIDIA 整个机器人栈的"数据发动机"。
1X World Model(1X Technologies,2025-10)[Mereu et al., arxiv:2510.07092]
这是目前最具体的"world model 作 humanoid simulator + 评估器"的工作,值得详细讲。
- 训练:用真实 EVE 人形第一人称视频训练扩散式 world model——给定初始帧 + 动作序列,生成接下来的人形第一人称视频。模型可作为可交互的 learned simulator。
- 配套 benchmark(1X World Model Challenge,公开三轨):
- Sampling track:测 WM 能不能生成 plausible 的未来视频(PSNR 等指标)。
- Compression track:测 WM 压缩视频的效率。
- Evaluation track("holy grail"):用 WM 给 policy 打分,无需真机部署。给 WM 一个 policy 的动作序列,它生成未来视频并据此预测任务是否成功。1X 声称 WM 预测的成功率和真机实际成功率高度相关,可作为离线评估信号,省去昂贵的真机 rollout(是否带显式 value head 监督:待核)。
- 为什么重要:这把"world model 当评估器"从概念变成有 benchmark 的公开问题。机器人学一直缺廉价可复现的评估方法,1X WM 给了一个具体方案。
💡 核心洞察:1X WM 把"world model 当评估器"从概念变成有公开 benchmark 的问题——但 WPE 同时揭示一个反直觉事实:分布内 policy 被低估、分布外 policy 被高估(即「幻觉成功」),WM 评估器目前「可信于排序、不可信于绝对值」,这是后续所有 WM 评估工作必须直面的可靠性边界。
转折 3 · 两条线合流:3D-VLA 与 world-model-augmented VLA
- 3D-VLA [Zhen et al. 2024, arxiv:2403.09631](ICML 2024)把 VLA + 3D 表示 + generative world model 整合成一个统一模型。核心是引入一组 interaction tokens——模型可以通过这些 token 同时做:感知(理解 3D 场景)、推理(链式思考)、目标生成(生成未来目标状态)、动作输出。world model 部分负责"想象"动作执行后的场景变化,让 VLA 不只是反应式出动作,而是有"内部模拟"能力。
- 合流的意义:world model 从"环境替代品"进化成"VLA 的一部分"。world model 既当数据源(生成训练场景)、又当评估器(打分 policy)、又当规划器(在脑中模拟动作后果选最优)。这正是 [T06] VLA 线和 [T09] world model 线的交叉点,也为 2026 DreamZero / GR00T N2 这类"VLA × WM 焊接成一个模型"的工业落地埋下伏笔。
💡 核心洞察:3D-VLA 让 world model 从「外部环境替代品」内化为「VLA 的内部模拟器」——同一个模型既当数据源、又当评估器、又当规划器,这是 VLA 线与世界模型线真正汇流的标志,也是后续 WAM(World Action Models)子领域被命名的伏笔。
2026 最新进展
2026 上半年的核心变化是「World Model × Action」从零散工作聚合成一个被命名的子领域——World Action Models(WAMs)——并出现 3D 表示与跨本体评估的代表作:
- WAM 作为子领域被命名(奠基性综述):复旦综述 WAM Survey [Wang et al., arxiv:2605.12090] 首次系统综述 World Action Models,把预测状态建模与动作生成统一为联合分布,建立 Cascaded vs Joint WAMs 分类法,按生成模态、条件机制、动作解码细分;并系统分析数据生态与评估协议(视觉保真度、物理常识、动作合理性)。WAM 这类「VLA × 世界模型融合」的新范式有了首个统一概念框架与文献分类,是 2026 该方向的奠基性综述。
- 跨本体 action-conditioned video WM(× T06,评估器方向的突破):OSCAR [Wu & Gao, arxiv:2606.04463](Alberta / NVIDIA)用 2D kinematic skeleton 渲染作跨本体统一条件表示(机械臂与人手用同一 skeleton),在单张 GH200 上微调 Cosmos-Predict2.5-2B 构建 action-conditioned video WM,并部署到 RoboArena 做机器人策略评估——首次展示虚拟世界策略评估与真机评估强相关,是迈向「机器人策略纯虚拟世界评估」愿景的关键一步(直接回应第四节「WM 作评估器」开放问题)。
- 3D 点云流作跨本体统一表示:PointWorld [Huang et al., arxiv:2601.03782](NVIDIA + Stanford)用 3D 点云流(point flow)统一状态与动作,给定一张或几张 RGB-D 图像与一段低层动作序列,预测逐像素的 3D 位移响应;约 2M 轨迹、500 小时 Franka 单臂与双臂人形数据训练。首次把 3D 点云流作跨本体统一动作/状态表示用于世界模型,规避关节空间本体差异;单一预训练 checkpoint 即可零样本驱动 Franka 真机做刚体推动、可变形/铰接物体操作与工具使用。
- Event-aware 视频扩散 WM(纠正动作信号被当辅助监督的缺陷):EA-WM [Yang et al., arxiv:2605.06192](Shanghai AI Lab)把动作与运动学状态直接投影到目标相机视角,作为 Structured Kinematic-to-Visual Action Fields,引入 event-aware 双向融合 block 调制跨分支注意力,建模物体状态变化与交互动力学;基于预训练视频扩散先验,在 WorldArena benchmark 上 SOTA。纠正了已有 world-action model 把视频生成当辅助监督、未充分利用动作信号指导视频合成的缺陷。
- DreamZero(WAM 工业化、合流 VLA 与 world model):DreamZero [Ye et al., arxiv:2602.15922](NVIDIA GEAR, GTC 2026)提出 World Action Model(WAM) 范式——14B 视频扩散骨干联合预测未来视频 + 动作(不是先生成视频再拟合 policy,而是同一个骨干同时出两路),借此学习物理动力学而非纯 perception→action 映射,主打未见任务 zero-shot 泛化(声称 zero-shot 强于主流 VLA,绝对优势待核)。是后续 GR00T N2(T06)的研究基石——把 2024-25 的「VLA 线」(T06)和「生成式 world model 线」(T09)焊接成一个统一架构,是 2026 上半年的工业旗舰与合流标志。
- NVIDIA Cosmos 3(全模态世界基础模型,工业旗舰):Cosmos 3 [NVIDIA Cosmos Team, arXiv:2606.02800](作者数待核)是 omnimodal(文本/图像/视频/音频/动作)世界基础模型,单一架构同时做物理推理 + 世界生成 + 动作生成,登顶多个 Physical AI 开源榜。是 2026 上半年世界模型「走向 omnimodal 物理基础模型」的工业旗舰,标志着世界模型从「视频预测」收口到「物理 AI 基座」。
- 触觉 / 记忆世界模型(模态与长时序扩展):Dream-Tac [Lou et al., arXiv:2606.08737](PKU)是首个统一 tactile world action model,联合预测未来视觉+触觉,把世界模型扩到触觉模态;Mem-World [Zheng et al., arXiv:2606.18960](复旦/腾讯)加显式记忆模块解决 action-conditioned 世界模型的长时序漂移/遗忘。两者分别在「模态(触觉)」与「时序(长程持久)」两个维度推进世界模型。同期有开源世界模型推进 [Gao et al., arXiv:2601.20540](Robbyant/上海AI Lab,视频生成器→交互仿真器三阶段)与两篇奠基综述——视频生成模型×机器人 [arXiv:2601.07823]、操作世界模型 [arXiv:2606.00113]——把 WAM 从零散工作正式立为子领域。
📌 关键要点
1. World model 的野心是用学习来的环境模型替代真机/仿真,用于训练(数据源)、评估(评估器)、规划(imagination)三种用途
2. 两条平行主线:DreamerV3 系 latent WM(快、抽象、不可视)vs Genie/Cosmos/1X WM 系像素 WM(慢、可视、可直接喂 policy),2024-25 开始合流
3. DreamerV3 的 RSSM(确定性 GRU + 随机 categorical)+ symlog / two-hot / free bits 归一化让 model-based RL 第一次「通用」,单一固定超参通 150+ 任务(含 Minecraft 钻石)
4. 1X WM 把「world model 作评估器」从概念变成有公开 benchmark 的问题,但 WPE 警示:分布内 policy 被低估、分布外 policy 被高估(「幻觉成功」),目前「可信于排序、不可信于绝对值」
5. 3D-VLA / WAM 是 VLA + 3D + generative world model 合流的代表,world model 从「环境替代品」进化成「VLA 的一部分」(既当数据源、又当评估器、又当规划器)
四、World model 的三种用法(必须辨析)
这是本线索最容易混淆的点,world model 在控制里有三种完全不同的用法:
| 用法 | 机制 | 代表 | 优势 | 风险 |
|---|---|---|---|---|
| 数据源(data source) | WM 生成合成轨迹/场景,扩充训练数据 | Cosmos、Genie、GR00T Mimic | 绕开真机数据稀缺 | 生成数据分布若偏离真实,policy 学偏 |
| 评估器(evaluator) | 给 policy 动作,WM 滚 rollout + value head 打分 | 1X WM evaluation track | 离线、廉价、可复现,省真机 | 会幻觉成功(见下) |
| 规划器(planner) | 在 WM 里 MPC / imagination 选动作 | DreamerV3 actor-critic、3D-VLA 内部模拟 | 长程规划能力 | latent WM 抽象不可视;像素 WM 慢 |
💡 核心洞察:同一个 world model 在「数据源 / 评估器 / 规划器」三种用法下,可靠性边界完全不同——做数据源最容易、做规划器最复杂、做评估器最反直觉(会幻觉成功);不区分这三类用法就直接讨论「WM 是否可信」,是这条线索最常见的概念错配。
world model 作评估器是否可靠——这是当前最热的开放问题。1X 声称 WM 预测成功率高度相关真机,但独立研究 WPE(World-model-based Policy Evaluation) [arxiv:2506.00613,编号待核] 给出警示:
- WPE 对在分布内的 policy 会低估成功率;
- 对分布外 policy 会高估——即 world model 会"幻觉成功",policy 其实做不成,但 WM 生成的视频看起来像成功了。
- 不过 WPE 也报告,平均成功率误差约 ~3.3%,接近真机评测的标准误,rank ordering 基本保留。
- 判断:WM 评估器目前可信于排序、不可信于绝对值,对分布外 policy 尤其要警惕幻觉。这是 1X benchmark 把 evaluation track 列为"holy grail"但还没完全解决的原因。
五、与其他线索的交叉点
- 与 [T06 VLA 五段演进]:3D-VLA 是 VLA + world model 合流点;GR00T N1 的数据 pipeline 整合 Cosmos,是人形 VLA 用生成式 world model 当数据源的实例。
- 与 [T03 reward-design-evolution]:world model 可作 reward 来源(如果 WM 能预测任务成功,就能当 reward signal),和 Eureka 式自动 reward design 是互补路线。
- 与 [T02 online-adaptation]:DreamerV3 系的 model-based RL 是 sample-efficient 适应的基础,和 system ID、teacher-student 等 sim-to-real 方法互补。
六、当前局限与开放问题
- WM 评估器的可靠性:如上,幻觉成功问题未解。需要更好的 value head、对抗式评估、分布外检测。1X benchmark 是当前唯一公开测试床。
- 像素 WM 太慢:扩散/自回归视频生成每帧几十~几百 ms,做实时 MPC 不可行;只能做离线数据生成或离线评估。DreamerV3 latent WM 快但不可视、不直接喂图像 policy。两者各有硬伤。
- 长程一致性:生成式 WM 滚几十步后画面会漂移、物体凭空消失(Genie 2 用物体持久性机制部分缓解,但未根治)。做长程任务规划不可靠。
- 物理精确性:学到的是"看起来像",不是"真物理"。精细操作(接触、摩擦、形变)的物理在像素 WM 里基本学不准。这也是为什么 Cosmos 强调 guardrails + 物理先验注入。
- VLA + locomotion WBC 接口(与 [T10] 共享):WM 若要覆盖 locomotion,需要建模全身动力学,比第一人称操作视频难得多。
七、涉及里程碑论文
- [Hafner 2023, arxiv:2301.04104] DreamerV3 —— RSSM latent world model + imagination actor-critic,固定超参通 150+ 任务(Nature 2025)
- [Micheli 2022, arxiv:2209.00588] IRIS —— Transformer world model(discrete autoencoder tokenize + GPT 自回归),Atari 100k SOTA,ICLR 2023
- [Robine 2023, arxiv:2303.07109] TWM —— Transformer world model,NeurIPS 2023
- [Bruce et al. 2024, arxiv:2402.15391] Genie —— 单图生成可交互 2D 可玩环境,ICML 2024
- [DeepMind 2024-12, blog] Genie 2 —— 单图生成可交互 3D 世界,物体持久性
- [Cosmos Team 2025, arxiv:2501.03575] Cosmos —— NVIDIA 产业级 physical AI world foundation model 平台
- [Mereu et al. 2025, arxiv:2510.07092] 1X World Model —— 人形第一人称视频扩散 WM + 三轨公开 benchmark
- [Zhen et al. 2024, arxiv:2403.09631] 3D-VLA —— VLA + 3D + generative world model 整合,合流代表,ICML 2024
- [Ye et al. 2026, arxiv:2602.15922] DreamZero —— 14B 视频扩散 WAM,联合预测视频+动作,zero-shot policy,GR00T N2 研究基石
- [anon 2025, arxiv:2506.00613(编号待核)] WPE(World-model Policy Evaluation) —— 警示 WM 评估器会幻觉成功
八、参考文献与延伸阅读
- 本仓库内的相关线索:T06 VLA 五段演进(VLA 线,合流点)、T03 Reward 设计演化(reward 来源)
- 外部:DreamerV3 论文 + Danijar Hafner 项目页;1X World Model 官方页 1x.tech/discover/1x-world-model 及技术报告 1x.tech/1x-world-model.pdf;Cosmos 项目页;Genie 2 blog;WPE 论文 world-model-eval.github.io(arxiv 编号待核)
九、关联论文笔记
本线索涉及的核心论文在本仓库已有深度笔记:
- P-DreamerV3-2023.md [Hafner et al., Nature 2025, arxiv:2301.04104]——本线索主线 A 的当前制高点。包含 RSSM 完整方程(Eq. 1a-c:GRU 确定性 $h_t$ + 离散 categorical 随机 $z_t$ = 32×32)、world model loss Eq. 2-3(dyn/rep/pred KL 拆分 + free bits 1 nat)、actor Eq. 6(return normalization)、critic Eq. 5(symexp + twohot 255-bin)、symlog/symexp/twohot Eq. 8-11。完整固定超参表($\eta=3\times10^{-4}$、$\lambda=0.95$、batch 16×64、replay $5\times10^6$、unimix 1%、imagination H=15)+ 模型 size sweep(8M–400M,默认 200M)。150+ 任务结果含 Minecraft 钻石。详细 ablation 见该笔记。
- P-Cosmos-2025.md [Cosmos Team, arxiv:2501.03575]——NVIDIA 产业级 WM 平台,包含 tokenizer(CI/DV 两路、压缩配置)、diffusion + AR 双 predictor、双层 guardrail、post-training 三类下游、20M 小时视频 curation pipeline 的完整工程细节。
papers/P-1X-WM-2025.md(待补全)——人形第一人称 WM + evaluation benchmark。papers/P-3D-VLA-2024.md(待补全)——两条主线合流的代表。papers/P-DreamZero-2026.md(待补全)——WAM 工业化、VLA × world model 合流、GR00T N2 研究基石。
可选复盘:常见误区
澄清:"世界模型 = 一个生成视频的模型" —— 不全对。它只是生成式世界模型这一支。还有另一支是在抽象数字空间推演的"潜在世界模型",不生成像素,只在压缩表示里想象未来 。前者能看见但慢,后者快但不可视。
"世界模型 = 一个生成视频的模型" —— 不全对。它只是生成式世界模型这一支。还有另一支是在抽象数字空间推演的"潜在世界模型",不生成像素,只在压缩表示里想象未来 📎。前者能看见但慢,后者快但不可视。
世界模型有"像素生成"和"潜在推演"两条平行主线,机制和用途都不同。
澄清:"世界模型当评估器,打多少分就是多少分" —— 危险。研究发现它会"幻觉成功":对没见过的策略,会高估成功率——策略其实没做成,生成的视频却看起来像成了 。所以目前只能信它的"排名",不能信"绝对分数"。
"世界模型当评估器,打多少分就是多少分" —— 危险。研究发现它会"幻觉成功":对没见过的策略,会高估成功率——策略其实没做成,生成的视频却看起来像成了 📎。所以目前只能信它的"排名",不能信"绝对分数"。
世界模型评估器可信于排序、不可信于绝对值,对分布外的策略尤其要警惕。
澄清:"有了世界模型就不用物理仿真了" —— 还早。学到的是"看起来像",不是"真物理"。精细操作里的接触、摩擦、形变,在像素世界模型里基本学不准 。另外生成几十步后画面会漂移、物体凭空消失,长程一致性没解决。
"有了世界模型就不用物理仿真了" —— 还早。学到的是"看起来像",不是"真物理"。精细操作里的接触、摩擦、形变,在像素世界模型里基本学不准 🌐。另外生成几十步后画面会漂移、物体凭空消失,长程一致性没解决。
世界模型目前是物理仿真的补充(做数据增广、离线评估),还替代不了它。
可选复盘:检查点
用"飞行模拟器"类比,向没学过机器人的朋友解释:世界模型解决的是什么瓶颈?
查看参考答案
- 解决的瓶颈:机器人学习被'环境'卡死——真机采集又贵又慢,物理仿真需要精确参数且有仿真到真机差距,家里等真实场景根本没法仿真。
- 类比锚:飞行模拟器让飞行员不用真飞也能练、也能考核;世界模型让机器人不用真机和物理仿真,也有一个'假环境'可以训策略、评估、规划。
- 机制:世界模型是个学出来的'环境替身'——给它当前画面和动作,它预测下一帧,于是可以无限滚轨迹训练。
世界模型有"潜在推演"和"像素生成"两条主线。各说一个优点、一个缺点。
查看参考答案
- 潜在推演(在压缩的数字空间里想象未来):优点是快、抽象、适合训强化学习策略(样本高效);缺点是不可视、不能直接喂给看图的策略。
- 像素生成(直接生成视频):优点是具体、可视、能直接喂给任何看图策略、可当能看见的仿真器;缺点是慢(每帧几十到几百毫秒)。
- 共同点:两条线都在 2024-2025 开始合流。
前文说世界模型在控制里有三种用法。请列出这三种,并各举一句它解决了什么问题。
查看参考答案
- 当数据源:生成合成场景/轨迹,扩充训练数据——解决真机数据稀缺。
- 当评估器:给策略动作,它滚一遍并打分——解决真机评估昂贵不可复现。
- 当规划器:在它里面推演、挑最优动作——解决长程规划/模型预测控制。
- (辨析点)三者机制完全不同,是这条线索最易混淆的地方。
为什么说世界模型当评估器会"幻觉成功"?这个缺陷目前让我们只能怎么用它?
查看参考答案
- 幻觉成功的原因:对没见过的(分布外)策略,世界模型会高估成功率——策略其实没做成任务,但它生成的视频看起来像成功了。
- 只能怎么用:目前只能信它的'排名(排序)',不能信'绝对分数'。
- 警惕对象:尤其对分布外的策略,绝对值不可靠。
有人宣称"有了世界模型,物理仿真可以扔了"。请用 刚学到的两条理由反驳他。
查看参考答案
- 理由一:世界模型学到的是'看起来像',不是真物理。精细操作里的接触、摩擦、形变在像素世界模型里基本学不准。
- 理由二:长程一致性差。生成几十步后面面会漂移、物体凭空消失,做长程任务规划不可靠。
- 结论:世界模型目前是物理仿真的补充(做数据增广、离线评估),还替代不了它。