枢纽
数据集DM Control Suite/ManiSkill2/MetaWorld
物理感知
输入模态vision,proprioception

TD-MPC2:让世界模型「越大越强」的连续控制

Nicklas Hansen, Hao Su, Xiaolong Wang(UC San Diego)。ICLR 2024 · arXiv:2310.16828。 项目页 · 300+ 检查点全开源 · model-based RLworld modelscaling

🧠 一句话心智模型:把「视觉/状态 → 未来」的生成问题,偷换成「状态 → 预测奖励和回报」的实用问题——只学对决策有用的东西。再把这套「不还原图像的世界模型」放大到 317M 参数、80 个任务共用,结果越放大越强。这是 RL 领域罕见的「真·scaling law」。

🎯 为什么重要:RL 长期没有「scaling law」

大模型时代,NLP 和 CV 都验证了一条铁律:模型越大、数据越多,能力就越强。但 RL 不是这样——长期以来,把网络做大往往不涨点甚至变差(RL 圈把这个现象当成「玄学」)。同时,机器人领域另一拨人在做 Gato / RT-1 那种通用智能体,但它们都依赖近乎专家级的人类演示数据,量小、成本高。

核心矛盾:RL 不依赖专家演示,能用低质量、混合质量的海量数据,理论上才是真正的「可扩展」路径。但传统 RL(SAC、TD-MPC 等)对超参数极度敏感,每个任务都要单独调,根本没法在「同一套超参 + 100+ 任务」上稳定训练,更别提 scaling 了。

TD-MPC2 的目标就是把这条路打通。论文标题里的 "Scalable, Robust" 两个词正是两个核心贡献——Robust(同一套超参跑 104 个任务都 SOTA)是 Scalable(317M 单模型做 80 任务)的前提。

💡 核心思想:implicit world model + MPC 规划

TD-MPC2 的世界模型不解码图像。它的逻辑是:我关心的是「这条动作序列能拿多少分」,那就直接学这个,不必先把未来每一帧都画出来。具体来说,世界模型由 5 个 MLP 组成,在潜在空间里滚动预测奖励和回报。

世界模型(5 个 MLP,全在 latent space) s₁ observation Encoder z = h(s,e) z₁ latent Reward r̂₁ R(z,a,e) Value q̂₁ Q(z,a,e) · TD-learning Policy prior â₁ p(z,e) · 引导规划 Dynamics z′ = d(z,a,e) 下一步 z₂(latent 滚动) ✗ 不解码图像 no pixel reconstruction 用 JEP / reward / Q 三项监督
图 1:TD-MPC2 架构(对应论文 Fig.3)。观察 s 经 Encoder 映射为 latent z,再由三个 head 分别预测奖励、Q 值、动作;Dynamics 在 latent 中前滚。全程 不还原图像,所以叫 implicit (decoder-free) world model

训练目标(论文 Eq.3)由三项组成:① 联合嵌入预测(JEP)让 z 预测下一帧的 z;② 奖励预测;③ TD-learning 的 Q 值预测。三项加在一起,就形成了「以控制为中心」的世界模型——它知道「在这个状态做这个动作,下一步会怎样、能拿多少分」。

🛠️ 5 项关键工程改进(让模型「越大越强」的真正功臣)

论文 Appendix A 给出了一份「TD-MPC → TD-MPC2」的完整改动清单。下面是最关键、对 scaling 影响最大的几条:

设计做法为什么必要
① SimNorm 潜在归一化把 latent z 投影到 L 个单纯形(softmax 分组),偏向稀疏表示原版 TD-MPC 不约束 latent → 梯度爆炸(论文 Fig.21 实证);SimNorm 让 317M 模型也能稳定训练
② 离散化回归奖励/价值reward 和 Q 都用「log 空间 + 多类分类(soft cross-entropy)」预测不同任务奖励量级差几个数量级(sparse vs dense)。连续回归会让 loss 被大量级任务主导,分类化让 同一套超参跨任务通用
③ Q-ensemble + Dropout5 个 Q 函数 + 1% Dropout,TD-target 取两个 EMA-Q 的最小缓解 Q 高估,提升 TD-learning 稳定性
④ 可学习任务嵌入 e每个任务学一个 ℓ2≤1 的向量 e,5 个组件全都条件于 e;零填充+动作掩码支持多动作空间多任务、多本体(Dog/Humanoid/机械臂)共用一个模型的关键。t-SNE 显示语义相近的任务自动聚到一起(如 Door Open ≈ Door Close)
⑤ 最大熵策略先验用 SAC 式最大熵训练 policy prior p,替代原版的高斯噪声探索对超参更鲁棒,可任务无关地调好
🔮 直觉:为什么「不解码图像」是 scaling 的关键?
解码图像(如 DreamerV3)需要把大量容量花在「画准像素」上,模型越大反而越容易过拟合到无关纹理。TD-MPC2 把这部分容量全部留给「对决策有用的表征」——所以 5M 参数就能跟 20M 的 DreamerV3 比拼,317M 模型还能持续涨点。这正是论文反复强调的 "a maximally useful model"

📊 结果:104 任务 SOTA + 317M 多任务模型

维度数字(溯源论文)
单任务覆盖4 个 benchmark、104 个连续控制任务:DMControl(39) + Meta-World(50) + ManiSkill2(5) + MyoSuite(10)。动作维度最高 $A\in\mathbb{R}^{39}$(MyoSuite 灵巧手;Dog 为 $\mathbb{R}^{38}$、Humanoid 为 $\mathbb{R}^{21}$)
跨任务统一性同一套超参数通吃 104 任务,而 SAC 和原版 TD-MPC 都需要按任务调参
vs DreamerV3在 Dog 高维运动、ManiSkill2 多物体操作上显著领先;DreamerV3 在 Dog 上还会数值不稳定
vs 原版 TD-MPCTD-MPC 经常因梯度爆炸发散,TD-MPC2 全程稳定(Fig.21 梯度范数对比)
多任务 scaling在 80 任务(DMControl+MetaWorld)上训练 1M→317M 参数模型,归一化分数 16.0 → 49.5 → 57.1 → 68.0 → 70.6未饱和、近似 log-linear
317M 训练成本33 GPU·天(单卡 RTX 3090),相对友好
任务嵌入语义t-SNE 显示 Door Open / Door Close 等动力学相似任务在嵌入空间中聚集(Fig.7 右)
少样本微调70 任务预训练 19M 模型 → 10 个未见任务微调 20k 步,分数 47.0 vs 24.0(from scratch),约 2× 提升
关键洞察:论文 Fig.1 左图是最有力的证据——TD-MPC 把模型从 1M 加大到 100M 反而掉点,TD-MPC2 则一路上升。这不是某个 trick 的功劳,而是 5 个改进合起来把 RL 的「不能 scaling」诅咒解开了。

🌐 在领域中的位置

PlaNet(在线规划,无策略) Dreamer(latent imagination + actor-critic) TD-MPC(implicit model + MPC 规划) TD-MPC2(多任务可 scaling)⭐ generalist world model(通用人形/机器人基础模型)

TD-MPC2 是 RL 「scaling law 路线」的里程碑:证明了 model-based RL 在不加专家数据、不调任务专属超参的前提下,也能像 LLM 那样「越大越强」。它与 DreamerV3(同期)形成对照——后者靠重建图像做世界模型、在 Atari/Minecraft 等 discrete 任务强,而 TD-MPC2 在连续控制上更强。两者都指向同一个未来:用世界模型做机器人基础模型

❓ 常见误区

TD-MPC2 是「世界模型」吗?它都预测什么?

是,但它是 implicit(decoder-free)世界模型。它预测:①下一帧 latent(用 JEP),②即时奖励,③Q 值。不预测像素。论文反复强调:「我们学的是 maximally useful model,而不是 maximally accurate reconstruction」。

「implicit」和 Dreamer 的「reconstruction-based」世界模型到底差在哪?

Dreamer 重建像素,监督信号丰富但容量被浪费在纹理细节上,且对视觉变化大的任务不稳;TD-MPC2 跳过解码,监督全部来自控制相关的量(reward、Q、latent 一致性),所以小模型就能打过 4 倍大的 DreamerV3。论文 §5 提到:「implicit world model may be better suited than reconstruction-based approaches for tasks with large visual variation」。

317M 参数很大吗?跟 VLA 比呢?

在 RL 圈算大,但跟 VLA(OpenVLA 7B、π0 3B)相比只是零头。TD-MPC2 的意义不在绝对大小,而在它打通了「RL 模型越大越强」的路径——后续沿这条路放大到 1B+、接上视觉语言模型,是论文 §5 Opportunities 明确指出的方向。

它能用在离散动作空间(如 Atari)吗?

不能,论文 §5 明确指出:「extending TD-MPC2 to discrete action spaces remains an open problem」。它的连续控制强项 + DreamerV3 的离散强项正好互补。

MPC 规划在线推理会不会很慢?

有成本,但被两项设计缓解:① policy prior p 提供好的初值采样,让 MPPI 迭代少几轮就收敛;② 论文做了 ~2× 的代码级优化。整体 wall-time 与原版 TD-MPC(1M 参数)相当。