IRIS:让 Transformer 在「想象的世界」里玩 Atari,2 小时就超人类
🎯 为什么重要:深度 RL 的最大软肋是「样本效率」
深度 RL 的样本效率低得令人发指:
- DreamerV2 在 Atari:训练数据相当于「几个月」游戏时间
- OpenAI Five 在 Dota2:训练数据相当于「几千年」游戏时间
论文的判断是:model-based + 学习在「想象」里训练是出路。问题是:以前的「世界模型」(DreamerV2 用 RSSM 循环网络)精度不够,长程 rollout 误差累积、策略学歪。论文用 Transformer 替换循环结构——Transformer 在 NLP/CV 的「长序列建模」上已经碾压 RNN,把它用在「帧序列建模」上是自然选择。
💡 核心思想:图像 → token → GPT 预测下一帧 token
IRIS = Imagination with auto-Regression over an Inner Speech。三个组件咬合:一个离散 autoencoder(把帧变成 token 串)、一个GPT 风格 Transformer(在 token 串上做自回归预测)、一个策略(在 token 解码出来的「想象帧」上做决策)。
论文最优雅的论断是:把「学环境动力学」化为「序列建模问题」。autoencoder 构造一种「图像的语言」,Transformer 学习「这种语言的时序规则」——和 LLM 学语言没本质区别。这是把「Transformer 在 NLP 的成功」迁移到 RL 的关键一步。
🛠️ 三个组件的具体设计(论文 §2)
| 组件 | 结构 | 训练目标 |
|---|---|---|
| ① 离散 autoencoder (E, D) | CNN encoder + Vector Quantization(VQGAN 风格)+ CNN decoder。每帧压成 K 个 token,词表大小 N | L1 重建 + commitment loss + perceptual loss;straight-through estimator 反传 |
| ② GPT-like Transformer G | 标准 causal Transformer;输入是 (z_0, a_0, z_1, a_1, ..., z_t, a_t) 的交错序列;autoregressive 预测下一帧的 K 个 token(token 级别自回归,不是帧级别) | transition:cross-entropy;reward:MSE 或 CE;termination:CE |
| ③ Policy π + Value V | 在想象帧 x̂ 上 actor-critic;直接用 DreamerV2 的 RL 损失和超参 | 想象 rollout 长度 H;用 V bootstrap;预测的 r̂/d̂ 也参与 |
两个原因:(1) Transformer 在离散 token 上表现最好——LLM 的成功全建立在 BPE 离散 token 上;(2) 连续像素直接做 Transformer 输入是不可行的——序列长度二次方爆炸。VQ 把 96×96 像素图压成几十个 token,让 Transformer 「玩得起」。这种「离散化 → Transformer 自回归」的范式继承自 VQGAN / DALL-E,IRIS 把它从「生成图片」迁移到「模拟世界」。
📊 Atari 100k:SOTA for no-lookahead methods(PDF Table 1)
| 维度 | 数字 |
|---|---|
| benchmark | Atari 100k(26 个游戏,每游戏 10 万次交互 ≈ 2 小时人类游戏时间) |
| 对比 baselines | SimPLe、CURL、DrQ、SPR(无 search);MuZero、EfficientZero(有 search,但 IRIS 仍胜 MuZero) |
| 平均 human-normalized score | 1.046(>1 = 超人类;比 SPR 高 +70%) |
| IQM (interquartile mean) | 0.501(比 SPR 高 +49%) |
| Optimality gap | 0.512(比 SPR 改进 +11%) |
| 超人类游戏数 | 10 / 26(+67% vs SPR 的 6 个) |
| 训练规模 | 5 runs / 游戏;100 episode 评测 |
| 主要失败场景 | Frostbite 等「需要罕见事件解锁新关卡」的游戏——双探索问题:先发现新机制才能在想象里学 |
🌐 在领域中的位置
IRIS 是「Transformer 世界模型」的奠基性工作。它把「离散 token + 自回归 Transformer」从图像生成迁移到 RL 环境建模,证明 Transformer 在长程序列建模上的优势可以转化为 RL 的样本效率。它直接影响了:(1) DreamerV3(Hafner 后续的跨 benchmark 通用 agent);(2) 一系列「视频预测作为世界模型」的工作(Genie、Cosmos、Sora-for-RL);(3) 当前 VLA 领域的「world model 作为 latent simulator」思路。关联线索:T09 世界模型作为模拟器。具体后续可看 DreamerV3、Cosmos。
❓ 常见误区
IRIS 是 RL 算法吗?
既是又不是。它是一个完整的 RL agent(有策略、有价值、能决策),但论文的核心贡献不是新的 RL 损失——它直接借用 DreamerV2 的 RL 损失和超参。真正贡献是「用 Transformer + 离散 autoencoder 重做世界模型」。所以更准确说:它是「世界模型架构」,而 RL 算法是它的「客户」。
为什么不在「想象」里学就是「样本效率高」?
因为想象无成本。每次「真实」交互要烧一次模拟器(或真实机器人,更贵)。而「想象」 rollout 只是 Transformer forward——一次 GPU pass 就能跑几十步。所以 IRIS 在「100k 次真实交互」内,能在想象中产生数百万步训练数据。这就是 model-based RL 的核心收益:「把昂贵的真实交互替换成便宜的想象交互」。
为什么有时还不如 search 方法(EfficientZero)?
论文没有击败 EfficientZero(带 MCTS search 的方法)。但 IRIS 不需要 search——search 在决策时多次 rollout 假设轨迹,计算成本和代码复杂度都高得多。作者明确把方法分类:「有 lookahead search」vs「无 lookahead search」——IRIS 是后者中的 SOTA。论文 §5 也指出「把想象 + MCTS 结合」是未来方向,两者可能互补。
「双探索问题」是什么?
IRIS 在 Frostbite(要按特定长序列解锁下一关)这种游戏上失败。论文给了清晰解释:policy 要在真实环境里偶然触发某个低概率事件(比如建好雪屋),世界模型才能第一次学到这个机制,然后 policy 才能在想象里反复利用它。这是「两次探索」——真实探索 + 想象探索——叠加的难题。这是 model-based RL 的固有局限:世界模型只能学到训练数据里出现过的东西。