枢纽
机器人Atari 100k
数据集Atari 100k
物理感知
输入模态vision

TWM:把世界模型换成 Transformer,10 万步玩转 Atari

Jan Robine, Marc Höftmann, Tobias Uelwer, Stefan Harmeling(多特蒙德工业大学)。ICLR 2023。 arXiv:2303.07109。 代码 · world modeltransformeratari 100k

🧠 一句话心智模型:DreamerV2 用 RNN 当世界模型的「记忆体」,每步把过去压成一个隐状态——压久了细节就丢。TWM 干脆把过去的潜变量、动作、奖励全摊开,让 Transformer-XL 直接看,想看哪步就 attend 哪步。结果:10 万步交互(≈2 小时游戏)就把 Atari 打到了人类分数的中位数 0.505。

🎯 为什么重要:把「记忆」从「压缩」改成「直查」

Atari 100k 是个「穷日子」benchmark:每款游戏只能玩 10 万次交互(≈2 小时真人游戏时长,比标准 200M 帧训练少 500 倍)。怎么用这点数据学到能打的策略?

核心矛盾:DreamerV2 派的世界模型用 RNN(循环隐状态)记历史——RNN 把所有过去压缩成一个向量 $h_t$。压缩是省内存,但代价是信息丢失:50 步前发生的关键事件,可能已经被覆盖掉了。
Transformer 的逻辑完全不同——不压缩,直接查。每一步都能 attend 到任意过去时刻的潜变量、动作、奖励。

论文 Fig.1 那张架构图就是整篇文章的核心:三个模态(latent $z$ / action $a$ / reward $r$)的序列,全摊开喂进 Transformer-XL,输出一个 hidden $h_t$,再用 MLP 预测奖励、终止、下一个潜变量。

DreamerV2:RNN 压缩 过去 → 一个压缩向量 $h_t$ $h_{t-2}$ $h_{t-1}$ $h_t$ · 只看上一步 · 细节被覆盖 训练 & 推理都要 RNN TWM:Transformer 直接查 ✅ 过去全部 token → attention 查任意时刻 $z$ $a$ $r$ $z$ $a$ $r$ $z$ $a$ $r$ Transformer-XL(causal mask) · 任意时刻直查 推理时 Transformer 可丢弃
图 1:核心范式对比。DreamerV2 把历史压进 $h$;TWM 把历史摊成 token 序列喂给 Transformer-XL。

💡 核心思想:三模态全摊开 + Transformer-XL 做骨架

世界模型的形式化定义很简洁(论文 §2.1):

$$h_t = f_\psi(z_{t-\ell:t},\; a_{t-\ell:t},\; r_{t-\ell:t-1})$$

$$\hat r_t,\;\hat\gamma_t,\;\hat z_{t+1} = \text{MLP}(h_t)$$

三件东西一起进 Transformer:潜变量 $z$(32 个 32 类的分类分布,照搬 DreamerV2)动作 $a$奖励 $r$。三个模态各走各的线性 embedding,论文照搬 Decision Transformer 的做法。然后用 Transformer-XL 跑因果自注意,输出对应「动作位置」的 token 当 $h_t$(其他两个模态的输出丢弃)。

CNN 编码器 图像 $o_t$ → 离散 latent $z_t$ Transformer-XL(causal) $z_{t-\ell:t}$ $a_{t-\ell:t}$ $r_{t-\ell:t-1}$ 自注意 + 相对位置编码 reward head discount head next latent $\hat z_{t+1}$ Policy π actor + critic 只吃 $z_t$(不用 Transformer) ★ 关键:Transformer 只在「想象训练」时用,真机推理时丢弃(policy 只见 $z_t$)
图 2:TWM 完整架构(论文 Fig.1 还原)。三模态 token → Transformer-XL → 三个预测头。Policy 在 latent 空间里训,与 Transformer 解耦。

🛠️ 五个工程关键:让 Transformer 真的在 100k 数据上赢

光换 RNN 为 Transformer 还赢不了——论文 §2 给了五个配套设计,每个都对应一个具体的「坑」:

设计解决什么做法
① Transformer-XL 骨架vanilla Transformer 推理慢(每步重算 KV)XL 的相对位置编码+片段递归——训练并行、推理缓存。还去掉了对「绝对时刻」的依赖
② 反馈奖励进 transformer模型不知道「之前发的奖励」是什么把预测的 $\hat r$ 作为下一步的输入 token——模型能对自己的奖励做出反应(论文消融确认增益显著)
③ 解耦的 balanced cross-entropyDreamerV2 的 balanced KL 把 entropy / cross-entropy 绑死显式拆成 $\alpha_1 H + \alpha_2 H_{ce}$ 两项,分别调权——一致性 + 熵正则可控
④ 阈值化熵损失每款游戏最优熵不同,调参累归一化到 $[0,1]$,只在熵低于阈值 $\Gamma$ 时惩罚(hinge loss)——跨游戏用同一超参
⑤ Balanced dataset sampling数据集慢慢长大,均匀采样偏向旧数据 → 过拟合早期用访问计数 $v_i$ 算 softmax $\propto \exp(-v_i/\tau)$,新数据被过采——τ 控制强度
🔮 直觉:为什么「推理丢弃 Transformer」是关键?
世界模型派的痛点是「推理时还要跑世界模型」——Dreamer 系列、IRIS 都得在部署时跑 RNN/Transformer,慢且贵。TWM 把 policy 训练成只吃 latent $z_t$(再加 frame stack 提供短时记忆),部署时完全不需要 Transformer。模型规模再大也不影响推理速度。这是论文卖点之一。

📊 结果:Atari 100k 上四个聚合指标全 SOTA

论文用 Agarwal et al. 2021 的统计方法(median / IQM / mean / optimality gap + 95% 置信区间),跑 5 runs/game,对比 5 个强基线:

方法Normalized Mean ↑Normalized Median ↑类别
SimPLe0.3320.134model-based(视频预测)
DER0.3500.189model-free(Rainbow 变体)
CURL0.2610.092model-free + 对比学习
DrQ(ε)0.4650.313model-free + 数据增广
SPR0.6160.396model-free + 自监督一致
TWM(本文)0.9560.505model-based(transformer 世界模型)
关键数字:Normalized Mean 0.956(接近人类=1.0 的水平),把 SPR(0.616)几乎拉开 0.34 个绝对百分点。论文 Fig.3 的四个聚合指标(median / IQM / mean / optimality gap)全部显著超越 SOTA,optimality gap 接近 0。

消融研究(论文 §3.3)确认了设计 ②(奖励反馈)和 ⑤(balanced sampling)各自带来的提升——尤其 balanced sampling,把训练时间从「一半花在前 19K 数据」纠正到「大致均衡」,对低数据 regime 至关重要。

🌐 在领域中的位置

World Models(Ha & Schmidhuber 2018) Dreamer / DreamerV2(RNN 世界模型) TWM(Transformer 世界模型)⭐ IRIS(Transformer 全栈)/ DreamerV3(RSSM-RNN + 离散 token 规模化)

TWM 是「把 Transformer 引入想象式世界模型」的早期典范,与 IRIS(Micheli et al. 2022)同期。它确立了「训练时用重型 Transformer,推理时丢弃」的范式,被后续机器人/视频世界模型广泛继承。详见 DreamerV3IRIS

❓ 常见误区

TWM 是 model-based RL 吗?

是,但很特别:它学一个世界模型,但 policy 在latent 想象空间里用 model-free 的 actor-critic(A2C + GAE)训练。所以是「model-based 学习,model-free 推理」。

100k 交互很多吗?

反直觉地少。100k 交互 = 400k 帧(4 帧跳帧)≈ 2 小时游戏时间。主流 DQN/PPO 通常用 200M 帧(500 倍),所以这玩意儿测的是「数据效率」而非绝对性能。

它为什么不在 Atari 50M(满血版)上比?

论文没做。TWM 的核心卖点是「低数据 regime」——10 万步下大幅领先。在 5000 万步下,能否超过 DreamerV2/MuZero 是另一个问题(后续 IRIS 主要仍聚焦 100k;Transformer 路线在长训练 regime 的验证待核)。

「Transformer」是真不可或缺,还是其他 trick 才是关键?

论文消融没有单独拆 Transformer 本身,但拆了奖励反馈 + balanced sampling——两者各自都带来显著提升。可以理解为「Transformer 让历史信息到位,sampling 让训练数据到位,两个一起才把 100k 喂饱」。