枢纽
机器人Atari 100k
数据集Atari 100k
物理感知
输入模态vision

IRIS:让 Transformer 在「想象的世界」里玩 Atari,2 小时就超人类

Vincent Micheli, Éloi Alonso, François Fleuret(University of Geneva)。ICLR 2023 / arXiv:2209.00588v2。 代码开源 (iris) · foundation_modelsworld modeltransformerdiscrete token

🧠 一句话心智模型:让 RL agent 在「想象」里学习——先用一个 discrete autoencoder 把每一帧游戏画面压缩成一串 token(像把画面翻译成一种「内心独白」),再让一个 GPT 风格的 Transformer 学习「给定当前帧 token 和动作,下一帧 token 会是什么」。这两者组成「世界模型」——agent 在它想象出来的轨迹里学策略,只在收集经验时碰真实环境。结果:2 小时真实游戏时间,10/26 个 Atari 游戏超过人类。

🎯 为什么重要:深度 RL 的最大软肋是「样本效率」

深度 RL 的样本效率低得令人发指:

几个真实数字(论文 §1)
  • DreamerV2 在 Atari:训练数据相当于「几个月」游戏时间
  • OpenAI Five 在 Dota2:训练数据相当于「几千年」游戏时间
真实世界没法这样烧样本——机械臂不能撞几百万次,自动驾驶不能撞几次。这是 RL 走出游戏进入真实世界的最大障碍

论文的判断是:model-based + 学习在「想象」里训练是出路。问题是:以前的「世界模型」(DreamerV2 用 RSSM 循环网络)精度不够,长程 rollout 误差累积、策略学歪。论文用 Transformer 替换循环结构——Transformer 在 NLP/CV 的「长序列建模」上已经碾压 RNN,把它用在「帧序列建模」上是自然选择。

💡 核心思想:图像 → token → GPT 预测下一帧 token

IRIS = Imagination with auto-Regression over an Inner Speech。三个组件咬合:一个离散 autoencoder(把帧变成 token 串)、一个GPT 风格 Transformer(在 token 串上做自回归预测)、一个策略(在 token 解码出来的「想象帧」上做决策)。

真实 Atari x_0 (像素帧) Encoder E CNN + VQ K 个 token z_0 token 序列 (z_1, ..., z_K) GPT-Transformer G 输入: (z_0, a_0, z_1, ...) 输出: r̂, d̂, ẑ_{t+1} ẑ_1 下一帧 tokens 🎬 在「想象」里 rollout H 步(不碰真实环境) Decoder D x̂_0 (想象帧) policy π G 预测 x̂_1 → ... → x̂_H 在想象轨迹上训练 π 和 V(actor-critic) 借用 DreamerV2 的 RL 损失;bootstrap 用 V(x̂_H);rollout 长度 H 是超参 rewards r̂ 和 episode-termination d̂ 也都由 G 预测 只用真实经验改进世界模型(E, D, G);策略永远只在想象中训练
图 1:IRIS 训练循环。真实帧 → Encoder 离散化 → GPT Transformer 预测下一帧 tokens → Decoder 还原想象帧 → policy 在想象帧上学。整个策略训练零真实环境交互,只在世界模型内部。

论文最优雅的论断是:把「学环境动力学」化为「序列建模问题」。autoencoder 构造一种「图像的语言」,Transformer 学习「这种语言的时序规则」——和 LLM 学语言没本质区别。这是把「Transformer 在 NLP 的成功」迁移到 RL 的关键一步。

🛠️ 三个组件的具体设计(论文 §2)

组件结构训练目标
① 离散 autoencoder (E, D)CNN encoder + Vector Quantization(VQGAN 风格)+ CNN decoder。每帧压成 K 个 token,词表大小 NL1 重建 + commitment loss + perceptual loss;straight-through estimator 反传
② GPT-like Transformer G标准 causal Transformer;输入是 (z_0, a_0, z_1, a_1, ..., z_t, a_t) 的交错序列;autoregressive 预测下一帧的 K 个 token(token 级别自回归,不是帧级别)transition:cross-entropy;reward:MSE 或 CE;termination:CE
③ Policy π + Value V在想象帧 x̂ 上 actor-critic;直接用 DreamerV2 的 RL 损失和超参想象 rollout 长度 H;用 V bootstrap;预测的 r̂/d̂ 也参与
🔮 直觉:为什么要把图像「离散化」为 token?
两个原因:(1) Transformer 在离散 token 上表现最好——LLM 的成功全建立在 BPE 离散 token 上;(2) 连续像素直接做 Transformer 输入是不可行的——序列长度二次方爆炸。VQ 把 96×96 像素图压成几十个 token,让 Transformer 「玩得起」。这种「离散化 → Transformer 自回归」的范式继承自 VQGAN / DALL-E,IRIS 把它从「生成图片」迁移到「模拟世界」。

📊 Atari 100k:SOTA for no-lookahead methods(PDF Table 1)

维度数字
benchmarkAtari 100k(26 个游戏,每游戏 10 万次交互 ≈ 2 小时人类游戏时间
对比 baselinesSimPLe、CURL、DrQ、SPR(无 search);MuZero、EfficientZero(有 search,但 IRIS 仍胜 MuZero)
平均 human-normalized score1.046(>1 = 超人类;比 SPR 高 +70%)
IQM (interquartile mean)0.501(比 SPR 高 +49%)
Optimality gap0.512(比 SPR 改进 +11%)
超人类游戏数10 / 26(+67% vs SPR 的 6 个)
训练规模5 runs / 游戏;100 episode 评测
主要失败场景Frostbite 等「需要罕见事件解锁新关卡」的游戏——双探索问题:先发现新机制才能在想象里学
关键洞察:IRIS 是「无 lookahead search 的方法」中新的 SOTA,还超过了 MuZero(MuZero 是有 MCTS search 的方法,原本不是为 sample-efficient 设计的)。论文的论断:「用 Transformer 替换循环结构」让世界模型在 Atari 这种「视觉复杂 + 部分可观测」环境里真正可用。质量上,作者展示了 Pong 上「pixel-perfect 预测」——世界模型想象出来的帧和真实帧逐像素对得上(Fig.3)。这是循环世界模型做不到的精度。

🌐 在领域中的位置

World Models (Ha & Schmidhuber 2018) Dreamer / DreamerV2 (Hafner 2020-2021, RSSM 循环) IRIS (Micheli 2022, Transformer + 离散 token) ⭐ DreamerV3 (2023, 跨域通用) Genie / Cosmos / genie 2 (2024-,可扩展到通用视频预测世界模型)

IRIS 是「Transformer 世界模型」的奠基性工作。它把「离散 token + 自回归 Transformer」从图像生成迁移到 RL 环境建模,证明 Transformer 在长程序列建模上的优势可以转化为 RL 的样本效率。它直接影响了:(1) DreamerV3(Hafner 后续的跨 benchmark 通用 agent);(2) 一系列「视频预测作为世界模型」的工作(Genie、Cosmos、Sora-for-RL);(3) 当前 VLA 领域的「world model 作为 latent simulator」思路。关联线索:T09 世界模型作为模拟器。具体后续可看 DreamerV3Cosmos

❓ 常见误区

IRIS 是 RL 算法吗?

既是又不是。它是一个完整的 RL agent(有策略、有价值、能决策),但论文的核心贡献不是新的 RL 损失——它直接借用 DreamerV2 的 RL 损失和超参。真正贡献是「用 Transformer + 离散 autoencoder 重做世界模型」。所以更准确说:它是「世界模型架构」,而 RL 算法是它的「客户」。

为什么不在「想象」里学就是「样本效率高」?

因为想象无成本。每次「真实」交互要烧一次模拟器(或真实机器人,更贵)。而「想象」 rollout 只是 Transformer forward——一次 GPU pass 就能跑几十步。所以 IRIS 在「100k 次真实交互」内,能在想象中产生数百万步训练数据。这就是 model-based RL 的核心收益:「把昂贵的真实交互替换成便宜的想象交互」。

为什么有时还不如 search 方法(EfficientZero)?

论文没有击败 EfficientZero(带 MCTS search 的方法)。但 IRIS 不需要 search——search 在决策时多次 rollout 假设轨迹,计算成本和代码复杂度都高得多。作者明确把方法分类:「有 lookahead search」vs「无 lookahead search」——IRIS 是后者中的 SOTA。论文 §5 也指出「把想象 + MCTS 结合」是未来方向,两者可能互补。

「双探索问题」是什么?

IRIS 在 Frostbite(要按特定长序列解锁下一关)这种游戏上失败。论文给了清晰解释:policy 要在真实环境偶然触发某个低概率事件(比如建好雪屋),世界模型才能第一次学到这个机制,然后 policy 才能在想象里反复利用它。这是「两次探索」——真实探索 + 想象探索——叠加的难题。这是 model-based RL 的固有局限:世界模型只能学到训练数据里出现过的东西。