RISE:让 VLA 在「想象世界」里自我改进
🎯 为什么重要:把 RL 从「物理瓶颈」搬到「算力瓶颈」
VLA(Vision-Language-Action)模型靠模仿学习(IL)在海量演示上预训练,但 IL 有死穴:exposure bias——一旦机器人偏离演示流形,就找不到回头路。RL 是对症的药,但真机 RL 走不通:
① 串行执行:一台机器人,一条轨迹一条轨迹地跑,无法并行;
② 手动复位:每个 episode 之后要人把东西摆回去;
③ 安全风险:探索动作可能损坏硬件或环境。
→ 结果:on-policy 数据流喂不饱 policy,policy 改进被卡住。
仿真里能并行、能自动复位,但仿真到真实有 gap。RISE 走第三条路:在 VLA 自己学的世界模型里做 RL——既无 sim2real gap(世界模型直接从真机数据学),又能海量并行想象。
💡 核心思想:组合式世界模型 = 动力学 + 价值
核心问题:要能在想象里训 RL,世界模型得做两件事——① 给定动作,生成未来状态(dynamics);② 给状态打分(reward/value)。RISE 把这两件事解耦,让各自用最适合的架构和目标(论文 §III-A):
「组合式」的精髓:动力学要视觉真实 + 动作可控,用视频扩散(Genie Envisioner)最合适;价值要稠密信号 + 对失败敏感,用 VLA(π0.5)+ TD 学习最合适。一个模型两件事都干会两头不讨好,分开反而都好。
🛠️ 四个让想象 RL 真的能跑的设计
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| ① Task-Centric Batching | 每个 batch 只采少量任务、多动作,而非多任务混合 | 视频扩散模型在「多任务 + 多动作」一起训时学不会动作控制——同场景下动作多样性优先,模型才能学到「动作→变化」的对应 |
| ② Progress + TD 价值 | 价值模型先 warm-start 用进度回归(粗),再加 TD 学习(细) | 纯进度信号太滑(对失败不敏感),纯 TD 又稀疏——前者给稠密监督,后者给失败敏感性 |
| ③ Advantage-conditioned policy | policy 不是直接学 RL 损失,而是把 advantage 当条件输入(参考 π0.6 / RECAP) | 把 RL 转成「条件生成」:高 advantage → 生成好动作;低 advantage → 生成失败动作。两者都成训练样本,稳定 |
| ④ 想象-离线混合训练 | 每个 batch 混入一定比例(约 0.6)的真实离线数据 | 纯想象数据会导致灾难性遗忘(论文 Table II:比例 0.1 时成功率跌到 5%)——0.6 是 sweet spot |
RL 训练每一步都要让世界模型生成一批想象轨迹——慢一倍,整个训练慢一倍。论文对比:Cosmos 生成 25 个多视角观察要 10+ 分钟,而 Genie Envisioner 只要 < 2 秒,300× 加速。这是 RISE 能跑通的前提:用轻量视频扩散模型(LTX-Video 系),而非重型生成器。Table V 显示 RISE 的 PSNR/SSIM/EPE 都优于 Cosmos 和原版 GE。
📊 结果:三个真机任务上 +35% ~ +45% 绝对提升
硬件:双臂 7-DoF AgileX 机器人。三个任务:① 动态砖块分拣(传送带上抓砖)② 背包打包(含拉链)③ 盒子封口(双手协调)。每个任务都对比 IL/RL 强基线(论文 Table I):
| 方法 | Dynamic Brick Sorting Succ% | Backpack Packing Succ% | Box Closing Succ% |
|---|---|---|---|
| π0.5(baseline VLA) | 35.00 | 30.00 | 35.00 |
| π0.5 + DAgger | 15.00 | 50.00 | 40.00 |
| π0.5 + PPO(真机 RL) | 10.00 | 35.00 | 10.00 |
| π0.5 + DSRL | 10.00 | 10.00 | 10.00 |
| RECAP(adv-conditioned 离线 RL) | 50.00 | 40.00 | 60.00 |
| RISE(本文) | 85.00 | 85.00 | 95.00 |
消融(Table IV)确认每个模块都有用:w/o 视觉预训练分拣准确率掉 32%;w/o Task-Centric Batching完成率掉 30%;w/o Progress Loss成功率掉 20%;w/o TD Learning成功率掉 35%。
🌐 在领域中的位置
RISE 是「用世界模型当 RL 训练环境」路线在真实机器人接触富任务上的第一个有力验证。与 DiWA、World4RL、Dream-to-Manipulate 同方向,但 RISE 把「组合式(dynamics + value 解耦)」+「视频扩散速度优化」做到能上真机。关联:π0、π0.5。
❓ 常见误区
世界模型推理这么慢,能做实时控制吗?
不能,也不需要。世界模型只在训练时用——用来生成想象轨迹做 RL。部署时只有 policy(一个 VLA),世界模型完全丢弃。论文反复强调「zero inference overhead」。
为什么用 Genie Envisioner 而不是 Cosmos?
纯速度考量。Cosmos 生成 25 帧多视角要 10+ 分钟,RL 训练根本跑不动。Genie Envisioner(基于 LTX-Video)只要 <2 秒,300× 加速。论文 Table V 还证明 RISE 的微调版在 PSNR/SSIM/EPE 上还更好。
为什么不直接在仿真里训,再 sim2real?
三个任务都涉及可变形物体(衣服、拉链、纸板)和动态接触(传送带)——仿真精度根本跟不上。世界模型直接从真机视频学,绕开物理建模。
「想象」出来的失败案例真的有用吗?
正是 RISE 的卖点。论文 §III-C 明确说:policy 既从「高 advantage 想象成功」学,也从「低 advantage 想象失败」学——后者是离线 IL 拿不到的负样本,价值模型 + TD 学习专门负责把失败案例标出来。