OSCAR:用「线骨架当动作条件」造一个能评策略的视频世界模型
OSCAR 的想法是:训一个「给动作、出视频」的世界模型,让它假装是真实世界,把你策略的动作序列喂进去,看它生成的视频里任务有没有完成。关键 trick:用「2D 骨架线渲染」当动作的统一表达——机器人臂和人手都变成线条画,一套表征跨所有本体。
🎯 为什么重要:策略评测的「真机税」
机器人基础模型时代,瓶颈不是「训不出策略」,而是「怎么知道这个策略好不好」。RoboArena 这类真机排行榜要靠分布式真机跑成百上千次——一个新策略从训出来到上榜要几周。OSCAR 想把这件事搬进视频世界模型里:
💡 核心思想:骨架渲染 = 通用动作接口
给定本体 URDF 模型 $M$(关节树 $V(M), E(M)$)和关节配置 $q_t$,前向运动学给出每个 link 的 SE(3) 位姿;再投影到像素平面,最后光栅化成一张黑底白线图:
$$ S_t = \text{Rasterise}\left(\left\{(u_{k,t}, v_{k,t})\right\}_{k=1}^{K}, E(M)\right) $$这张 $S_t$ 就是「动作的图像」——和原始 RGB 视频帧帧对齐地送进同一个 WAN 2.1 VAE,编码成 latent 后和目标视频 latent 在 patch embed 层相加,再喂给 DiT 去噪。换本体时只需换 kinematic triple $(M, q_t, o_k)$——对人手用 MANO 模型,流程完全不变。
🛠️ 关键工程:四阶段数据管线
OSCAR 的另一核心贡献是数据——把 2.16M 集原始视频清洗到 180k 集,跨 4 种机器人本体 + 2 种人手数据源。
| 阶段 | 操作 | 为什么必要 |
|---|---|---|
| ① Curation(采集) | 5 个机器人数据集(DROID、RH20T-cfg5/cfg7、AgiBot、InternData、AIROA)+ 2 个人手数据集(EgoDex、EPIC-Kitchens) | 单数据集场景/任务/动作分布太窄(如 AgiBot 100 万集中场景同质);多源混合才够多样 |
| ② Filtering(过滤) | 四类过滤:≥70 帧 / 静止相机 / 有意义的动作 / 骨架可见 | 原始机器人数据有大量静止/相机乱晃/部分出镜片段,会让模型学到「不动 = 高分」的退化解 |
| ③ Semantic Dedup(去重) | SigLIP 图像相似度 >0.95 → 再用 64 步重采样动作轨迹的 RMS 距离验证 | 机器人数据有大量「同场景同动作」重复,虚增数量但无新信息;两阶段保证「同背景不同动作」不被误删 |
| ④ Captioning(注释) | Qwen3-VL-30B 自动写 caption,DROID 降采样到 1-2fps 省算力 | Cosmos-Predict 文本条件需要 prompt |
结果:2.16M → 180,657 集(机器人 94.8k + 人 85.8k),约 10.9k 小时机器人 + 929 小时人。在单卡 GH200 上两阶段微调 Cosmos-Predict2.5-2B:先 15k 迭代机器人 only,再继续训机器人+人混合(warm-start)。
先把「机器人骨架 → 视频」学透,模型已建立稳定的 kinematic-视觉对应关系;再加人类视频微调,等于在一个已经工作的基础上做迁移。从头混合训会让模型一开始就被「机器人 vs 人手」的形态差异搞晕。论文实测:warm-start 在 7 个指标中 6 个胜过 from-beginning 混合训。
📊 关键结果:2B 模型赢 14B,且预测真机排名
| 评测维度 | OSCAR | 对比基线 |
|---|---|---|
| 视频质量 PSNR↑ | 24.24 | Genie Envisioner 23.29;Kinema4D 17.68(14B 模型) |
| FVD↓(分布保真度) | 7.08 | Genie Envisioner 15.37;Kinema4D 17.07 |
| FID↓ | 15.07 | Genie Envisioner 22.92;Kinema4D 37.16 |
| LPIPS↓ | 0.094 | Genie Envisioner 0.140;Kinema4D 0.198 |
| 推理 FPS↑ | 2.214 | Kinema4D 0.089(慢 25×) |
| 模型规模 | 2B | Kinema4D 14B(OSCAR 用 1/7 参数赢) |
| 训练资源 | 1× GH200 | Genie Envisioner 需多 GPU |
| 策略评测:与 RoboArena 真机排行榜的 Spearman ρ↑ | +0.750(骨架条件) | Latent action +0.643;Mesh +0.679 |
| 策略评测:MMRV↓(排名错位率) | 0.571 | Latent 1.429;Mesh 0.714 |
| 策略评测:SISRΔ↓(成功率差) | 1.73 pp | Latent 1.98;Mesh 3.04 |
评测协议:RoboArena 排行榜上 7 个 DROID 通用策略(π0-flow/FAST、PG-flow/FSQ/FAST+/Bin),每策略 65 个 session。OSCAR 给定第一帧 + 策略动作 → 自回归 rollout → GPT-5 判单 episode 成功率或两两排名,与真机对比。
🌐 在领域中的位置
OSCAR 属于「视频世界模型做策略评测」浪潮的核心工作,承接 SIMPLER(sim 代理)、IRASim(轨迹条件视频 WM)的传统。它和 DreamZero(视频 WM 当策略)、Cosmos(通用视频 WM 基座)形成三角:基座 / 策略 / 评测,三者都用视频扩散但角色不同。
❓ 常见误区
OSCAR 是策略吗?能直接控制机器人吗?
不能。OSCAR 是世界模型,输入「动作序列」输出「视频」,不是策略(策略是输入观察输出动作)。它的用途是给一个已训好的策略打分:把策略的动作喂给 OSCAR,看生成的视频里任务有没有完成。
2D 骨架会不会太简陋?
这正是 OSCAR 的核心 bet——表 3 显示 mesh 和 skeleton 在所有 7 个指标上统计上无差别,但 mesh 依赖每机器人 URDF 资产、且会过拟合外观,而 skeleton 只需 kinematic tree。「简单」是特性,不是 bug。
GPT-5 判分可靠吗?
论文用 GPT-5 做两件事:单 episode 成功率打分 + 两两视频偏好排名。后者遵循 RoboArena 和 WorldEval 的协议,得到 1365 个成对偏好,再算 Bradley-Terry 分。和真机 Spearman ρ 0.75 说明协议整体可靠,但作者承认局限在相机标定质量。
训练只用了单张 GH200?
对。这是论文的另一个亮点——2B 模型 + 高质量数据清洗让 OSCAR 在单卡上训出来,对比基线 Genie Envisioner 要多 GPU、Kinema4D 是 14B。数据比规模重要的又一证据。