TD-MPC2:让世界模型「越大越强」的连续控制
🎯 为什么重要:RL 长期没有「scaling law」
大模型时代,NLP 和 CV 都验证了一条铁律:模型越大、数据越多,能力就越强。但 RL 不是这样——长期以来,把网络做大往往不涨点甚至变差(RL 圈把这个现象当成「玄学」)。同时,机器人领域另一拨人在做 Gato / RT-1 那种通用智能体,但它们都依赖近乎专家级的人类演示数据,量小、成本高。
TD-MPC2 的目标就是把这条路打通。论文标题里的 "Scalable, Robust" 两个词正是两个核心贡献——Robust(同一套超参跑 104 个任务都 SOTA)是 Scalable(317M 单模型做 80 任务)的前提。
💡 核心思想:implicit world model + MPC 规划
TD-MPC2 的世界模型不解码图像。它的逻辑是:我关心的是「这条动作序列能拿多少分」,那就直接学这个,不必先把未来每一帧都画出来。具体来说,世界模型由 5 个 MLP 组成,在潜在空间里滚动预测奖励和回报。
训练目标(论文 Eq.3)由三项组成:① 联合嵌入预测(JEP)让 z 预测下一帧的 z;② 奖励预测;③ TD-learning 的 Q 值预测。三项加在一起,就形成了「以控制为中心」的世界模型——它知道「在这个状态做这个动作,下一步会怎样、能拿多少分」。
🛠️ 5 项关键工程改进(让模型「越大越强」的真正功臣)
论文 Appendix A 给出了一份「TD-MPC → TD-MPC2」的完整改动清单。下面是最关键、对 scaling 影响最大的几条:
| 设计 | 做法 | 为什么必要 |
|---|---|---|
| ① SimNorm 潜在归一化 | 把 latent z 投影到 L 个单纯形(softmax 分组),偏向稀疏表示 | 原版 TD-MPC 不约束 latent → 梯度爆炸(论文 Fig.21 实证);SimNorm 让 317M 模型也能稳定训练 |
| ② 离散化回归奖励/价值 | reward 和 Q 都用「log 空间 + 多类分类(soft cross-entropy)」预测 | 不同任务奖励量级差几个数量级(sparse vs dense)。连续回归会让 loss 被大量级任务主导,分类化让 同一套超参跨任务通用 |
| ③ Q-ensemble + Dropout | 5 个 Q 函数 + 1% Dropout,TD-target 取两个 EMA-Q 的最小 | 缓解 Q 高估,提升 TD-learning 稳定性 |
| ④ 可学习任务嵌入 e | 每个任务学一个 ℓ2≤1 的向量 e,5 个组件全都条件于 e;零填充+动作掩码支持多动作空间 | 多任务、多本体(Dog/Humanoid/机械臂)共用一个模型的关键。t-SNE 显示语义相近的任务自动聚到一起(如 Door Open ≈ Door Close) |
| ⑤ 最大熵策略先验 | 用 SAC 式最大熵训练 policy prior p,替代原版的高斯噪声 | 探索对超参更鲁棒,可任务无关地调好 |
解码图像(如 DreamerV3)需要把大量容量花在「画准像素」上,模型越大反而越容易过拟合到无关纹理。TD-MPC2 把这部分容量全部留给「对决策有用的表征」——所以 5M 参数就能跟 20M 的 DreamerV3 比拼,317M 模型还能持续涨点。这正是论文反复强调的 "a maximally useful model"。
📊 结果:104 任务 SOTA + 317M 多任务模型
| 维度 | 数字(溯源论文) |
|---|---|
| 单任务覆盖 | 4 个 benchmark、104 个连续控制任务:DMControl(39) + Meta-World(50) + ManiSkill2(5) + MyoSuite(10)。动作维度最高 $A\in\mathbb{R}^{39}$(MyoSuite 灵巧手;Dog 为 $\mathbb{R}^{38}$、Humanoid 为 $\mathbb{R}^{21}$) |
| 跨任务统一性 | 同一套超参数通吃 104 任务,而 SAC 和原版 TD-MPC 都需要按任务调参 |
| vs DreamerV3 | 在 Dog 高维运动、ManiSkill2 多物体操作上显著领先;DreamerV3 在 Dog 上还会数值不稳定 |
| vs 原版 TD-MPC | TD-MPC 经常因梯度爆炸发散,TD-MPC2 全程稳定(Fig.21 梯度范数对比) |
| 多任务 scaling | 在 80 任务(DMControl+MetaWorld)上训练 1M→317M 参数模型,归一化分数 16.0 → 49.5 → 57.1 → 68.0 → 70.6,未饱和、近似 log-linear |
| 317M 训练成本 | 33 GPU·天(单卡 RTX 3090),相对友好 |
| 任务嵌入语义 | t-SNE 显示 Door Open / Door Close 等动力学相似任务在嵌入空间中聚集(Fig.7 右) |
| 少样本微调 | 70 任务预训练 19M 模型 → 10 个未见任务微调 20k 步,分数 47.0 vs 24.0(from scratch),约 2× 提升 |
🌐 在领域中的位置
TD-MPC2 是 RL 「scaling law 路线」的里程碑:证明了 model-based RL 在不加专家数据、不调任务专属超参的前提下,也能像 LLM 那样「越大越强」。它与 DreamerV3(同期)形成对照——后者靠重建图像做世界模型、在 Atari/Minecraft 等 discrete 任务强,而 TD-MPC2 在连续控制上更强。两者都指向同一个未来:用世界模型做机器人基础模型。
❓ 常见误区
TD-MPC2 是「世界模型」吗?它都预测什么?
是,但它是 implicit(decoder-free)世界模型。它预测:①下一帧 latent(用 JEP),②即时奖励,③Q 值。不预测像素。论文反复强调:「我们学的是 maximally useful model,而不是 maximally accurate reconstruction」。
「implicit」和 Dreamer 的「reconstruction-based」世界模型到底差在哪?
Dreamer 重建像素,监督信号丰富但容量被浪费在纹理细节上,且对视觉变化大的任务不稳;TD-MPC2 跳过解码,监督全部来自控制相关的量(reward、Q、latent 一致性),所以小模型就能打过 4 倍大的 DreamerV3。论文 §5 提到:「implicit world model may be better suited than reconstruction-based approaches for tasks with large visual variation」。
317M 参数很大吗?跟 VLA 比呢?
在 RL 圈算大,但跟 VLA(OpenVLA 7B、π0 3B)相比只是零头。TD-MPC2 的意义不在绝对大小,而在它打通了「RL 模型越大越强」的路径——后续沿这条路放大到 1B+、接上视觉语言模型,是论文 §5 Opportunities 明确指出的方向。
它能用在离散动作空间(如 Atari)吗?
不能,论文 §5 明确指出:「extending TD-MPC2 to discrete action spaces remains an open problem」。它的连续控制强项 + DreamerV3 的离散强项正好互补。
MPC 规划在线推理会不会很慢?
有成本,但被两项设计缓解:① policy prior p 提供好的初值采样,让 MPPI 迭代少几轮就收敛;② 论文做了 ~2× 的代码级优化。整体 wall-time 与原版 TD-MPC(1M 参数)相当。