枢纽
上真机
物理感知
实时
输入模态vision,language,proprioception

RISE:让 VLA 在「想象世界」里自我改进

Jiazhi Yang, Kunyang Lin, Jinwei Li, Wencong Zhang 等(CUHK + Kinetix AI + HKU + 清华 + Horizon Robotics)。arXiv:2602.11075v2,2026 年 4 月。 代码 · VLAworld modelRL via imagination

🧠 一句话心智模型:在真机上跑 RL 太贵(串行执行 + 手动复位),在仿真里跑又搬不到真实。RISE 在 VLA 脑子里训练一个世界模型当「想象仿真器」——给定一个动作,它能「梦见」未来多视角画面和该动作有多好(advantage)。然后 policy 就在这些想象的轨迹上做 on-policy RL,绕开物理成本。

🎯 为什么重要:把 RL 从「物理瓶颈」搬到「算力瓶颈」

VLA(Vision-Language-Action)模型靠模仿学习(IL)在海量演示上预训练,但 IL 有死穴:exposure bias——一旦机器人偏离演示流形,就找不到回头路。RL 是对症的药,但真机 RL 走不通:

真机 RL 的三大物理瓶颈(论文 §1 + Fig.1a)
串行执行:一台机器人,一条轨迹一条轨迹地跑,无法并行
手动复位:每个 episode 之后要人把东西摆回去;
安全风险:探索动作可能损坏硬件或环境。
→ 结果:on-policy 数据流喂不饱 policy,policy 改进被卡住。

仿真里能并行、能自动复位,但仿真到真实有 gap。RISE 走第三条路:在 VLA 自己学的世界模型里做 RL——既无 sim2real gap(世界模型直接从真机数据学),又能海量并行想象。

真机 RL · 串行执行 · 手动复位 · 安全风险 policy 卡住 仿真 RL · 可并行 · 自动复位 · sim2real gap 真机不掉性能 RISE:想象 RL ✅ · 海量并行想象 · 世界模型从真机学 · 推理时丢弃 真机不掉性能
图 1:RL 路线对比。RISE 把「物理成本」换成「算力成本」——世界模型生成想象轨迹,policy 在想象里自我改进。

💡 核心思想:组合式世界模型 = 动力学 + 价值

核心问题:要能在想象里训 RL,世界模型得做两件事——① 给定动作,生成未来状态(dynamics);② 给状态打分(reward/value)。RISE 把这两件事解耦,让各自用最适合的架构和目标(论文 §III-A):

当前观察 $o_t$ 多视角图像 Policy π VLA (π0.5) 动作块 $a_{t:t+H}$ chunk 动力学模型 D Genie Envisioner (LTX-Video) + 动作编码器 + Task-Centric Batching 价值模型 V π0.5 VLA 初始化 + Progress Loss + TD Learning 想象未来 $\hat o_{t+1},\ldots,\hat o_{t+H}$ 多视角视频帧 Advantage A $A = \frac{1}{H}\sum_k$ $(V(\hat o_{t+k}) - V(o_t))$ policy 用 (a, A) 自我改进
图 2:RISE 的组合式世界模型(论文 Fig.4 还原)。动力学模型生成未来帧,价值模型打分,二者合作得到 advantage。

「组合式」的精髓:动力学要视觉真实 + 动作可控,用视频扩散(Genie Envisioner)最合适;价值要稠密信号 + 对失败敏感,用 VLA(π0.5)+ TD 学习最合适。一个模型两件事都干会两头不讨好,分开反而都好

🛠️ 四个让想象 RL 真的能跑的设计

设计心智为什么必要
① Task-Centric Batching每个 batch 只采少量任务、多动作,而非多任务混合视频扩散模型在「多任务 + 多动作」一起训时学不会动作控制——同场景下动作多样性优先,模型才能学到「动作→变化」的对应
② Progress + TD 价值价值模型先 warm-start 用进度回归(粗),再加 TD 学习(细)纯进度信号太滑(对失败不敏感),纯 TD 又稀疏——前者给稠密监督,后者给失败敏感性
③ Advantage-conditioned policypolicy 不是直接学 RL 损失,而是把 advantage 当条件输入(参考 π0.6 / RECAP)把 RL 转成「条件生成」:高 advantage → 生成好动作;低 advantage → 生成失败动作。两者都成训练样本,稳定
④ 想象-离线混合训练每个 batch 混入一定比例(约 0.6)的真实离线数据纯想象数据会导致灾难性遗忘(论文 Table II:比例 0.1 时成功率跌到 5%)——0.6 是 sweet spot
🔮 直觉:为什么生成速度是命门?
RL 训练每一步都要让世界模型生成一批想象轨迹——慢一倍,整个训练慢一倍。论文对比:Cosmos 生成 25 个多视角观察要 10+ 分钟,而 Genie Envisioner 只要 < 2 秒300× 加速。这是 RISE 能跑通的前提:用轻量视频扩散模型(LTX-Video 系),而非重型生成器。Table V 显示 RISE 的 PSNR/SSIM/EPE 都优于 Cosmos 和原版 GE。

📊 结果:三个真机任务上 +35% ~ +45% 绝对提升

硬件:双臂 7-DoF AgileX 机器人。三个任务:① 动态砖块分拣(传送带上抓砖)② 背包打包(含拉链)③ 盒子封口(双手协调)。每个任务都对比 IL/RL 强基线(论文 Table I):

方法Dynamic Brick Sorting Succ%Backpack Packing Succ%Box Closing Succ%
π0.5(baseline VLA)35.0030.0035.00
π0.5 + DAgger15.0050.0040.00
π0.5 + PPO(真机 RL)10.0035.0010.00
π0.5 + DSRL10.0010.0010.00
RECAP(adv-conditioned 离线 RL)50.0040.0060.00
RISE(本文)85.0085.0095.00
关键数字:三个任务上 RISE 相对 RECAP(最强基线)绝对 +35% / +45% / +35%,相对 π0.5(baseline)绝对 +50 / +55 / +60 个百分点。π0.5+PPO 在真机上反而掉性能(35→10%),凸显真机 RL 的不可行性。

消融(Table IV)确认每个模块都有用:w/o 视觉预训练分拣准确率掉 32%;w/o Task-Centric Batching完成率掉 30%;w/o Progress Loss成功率掉 20%;w/o TD Learning成功率掉 35%。

🌐 在领域中的位置

真机 RL(PPO on real) 仿真 RL for VLA(LIBERO) Advantage-conditioned 离线 RL(RECAP) RISE(想象空间 on-policy RL)⭐

RISE 是「用世界模型当 RL 训练环境」路线在真实机器人接触富任务上的第一个有力验证。与 DiWA、World4RL、Dream-to-Manipulate 同方向,但 RISE 把「组合式(dynamics + value 解耦)」+「视频扩散速度优化」做到能上真机。关联:π0π0.5

❓ 常见误区

世界模型推理这么慢,能做实时控制吗?

不能,也不需要。世界模型只在训练时用——用来生成想象轨迹做 RL。部署时只有 policy(一个 VLA),世界模型完全丢弃。论文反复强调「zero inference overhead」。

为什么用 Genie Envisioner 而不是 Cosmos?

纯速度考量。Cosmos 生成 25 帧多视角要 10+ 分钟,RL 训练根本跑不动。Genie Envisioner(基于 LTX-Video)只要 <2 秒,300× 加速。论文 Table V 还证明 RISE 的微调版在 PSNR/SSIM/EPE 上还更好。

为什么不直接在仿真里训,再 sim2real?

三个任务都涉及可变形物体(衣服、拉链、纸板)和动态接触(传送带)——仿真精度根本跟不上。世界模型直接从真机视频学,绕开物理建模。

「想象」出来的失败案例真的有用吗?

正是 RISE 的卖点。论文 §III-C 明确说:policy 既从「高 advantage 想象成功」学,也从「低 advantage 想象失败」学——后者是离线 IL 拿不到的负样本,价值模型 + TD 学习专门负责把失败案例标出来。