枢纽
数据集RoboArena
物理感知
输入模态vision

OSCAR:用「线骨架当动作条件」造一个能评策略的视频世界模型

Zhuoyuan Wu, Jun Gao(北大 + 密歇根大学 + NVIDIA)。arXiv:2606.04463(2026-06)。 foundation modelsworld modelpolicy evaluationcross-embodiment

🧠 一句话心智模型:每训出一个机器人策略,都要到真机上跑几百次才知道好不好——太慢、太贵。
OSCAR 的想法是:训一个「给动作、出视频」的世界模型,让它假装是真实世界,把你策略的动作序列喂进去,看它生成的视频里任务有没有完成。关键 trick:用「2D 骨架线渲染」当动作的统一表达——机器人臂和人手都变成线条画,一套表征跨所有本体。

🎯 为什么重要:策略评测的「真机税」

机器人基础模型时代,瓶颈不是「训不出策略」,而是「怎么知道这个策略好不好」。RoboArena 这类真机排行榜要靠分布式真机跑成百上千次——一个新策略从训出来到上榜要几周。OSCAR 想把这件事搬进视频世界模型里:

动作条件的三种范式 Latent action(隐式) 把动作压成 embedding · 跨本体 ✓ · 动作跟随精度 ✗ · 时空信号被压没 IRASim / Ctrl-World Mesh / Pointmap(显式几何) 渲染机器人 mesh / 3D 点 · 精度 ✓ · 跨本体 ✗(绑外观) · 出域就糊 Kinema4D(14B)/ Genie Envisioner 2D Skeleton ✅(OSCAR) 渲染关节链线段 · 跨本体 ✓(人手也能渲染) · 精度 ✓(无外观绑死) · 单一表征吃所有本体 2B 模型胜 14B baseline
图 1:动作条件范式的核心权衡。Latent 太抽象(动作不准),Mesh/Pointmap 太具体(绑外观);OSCAR 选了中间的「线骨架」——只要 kinematic tree 就能渲染,去掉纹理。
核心洞察:策略评测的本质要求「frame 级 + pixel 级」的动作跟随——视频里说「这一帧抓起来了」就必须真的抓起来,否则评测无效。Latent action 做不到(信号被压成向量),Mesh 太依赖 URDF 资产且会过拟合机器人外观。骨架线既有显式时空位置,又不绑纹理,是这问题的「Goldilocks 解」。

💡 核心思想:骨架渲染 = 通用动作接口

给定本体 URDF 模型 $M$(关节树 $V(M), E(M)$)和关节配置 $q_t$,前向运动学给出每个 link 的 SE(3) 位姿;再投影到像素平面,最后光栅化成一张黑底白线图:

$$ S_t = \text{Rasterise}\left(\left\{(u_{k,t}, v_{k,t})\right\}_{k=1}^{K}, E(M)\right) $$

这张 $S_t$ 就是「动作的图像」——和原始 RGB 视频帧帧对齐地送进同一个 WAN 2.1 VAE,编码成 latent 后和目标视频 latent 在 patch embed 层相加,再喂给 DiT 去噪。换本体时只需换 kinematic triple $(M, q_t, o_k)$——对人手用 MANO 模型,流程完全不变

第一帧 I₀ 真实 RGB 骨架序列 S₁:T URDF→投影→线 WAN VAE → latent + Cosmos-Predict2.5 2B DiT 去噪 (rectified flow) 噪声 z_t 生成视频 未来帧 GPT-5 判成功率 / 排名
图 2:OSCAR 推理 + 评测管线。骨架渲染序列和第一帧 RGB 都过 VAE 编码、相加后送 Cosmos DiT 去噪;生成的视频再交给 GPT-5 判分或两两排名,对照真机排行榜。

🛠️ 关键工程:四阶段数据管线

OSCAR 的另一核心贡献是数据——把 2.16M 集原始视频清洗到 180k 集,跨 4 种机器人本体 + 2 种人手数据源。

阶段操作为什么必要
① Curation(采集)5 个机器人数据集(DROID、RH20T-cfg5/cfg7、AgiBot、InternData、AIROA)+ 2 个人手数据集(EgoDex、EPIC-Kitchens)单数据集场景/任务/动作分布太窄(如 AgiBot 100 万集中场景同质);多源混合才够多样
② Filtering(过滤)四类过滤:≥70 帧 / 静止相机 / 有意义的动作 / 骨架可见原始机器人数据有大量静止/相机乱晃/部分出镜片段,会让模型学到「不动 = 高分」的退化解
③ Semantic Dedup(去重)SigLIP 图像相似度 >0.95 → 再用 64 步重采样动作轨迹的 RMS 距离验证机器人数据有大量「同场景同动作」重复,虚增数量但无新信息;两阶段保证「同背景不同动作」不被误删
④ Captioning(注释)Qwen3-VL-30B 自动写 caption,DROID 降采样到 1-2fps 省算力Cosmos-Predict 文本条件需要 prompt

结果:2.16M → 180,657 集(机器人 94.8k + 人 85.8k),约 10.9k 小时机器人 + 929 小时人。在单卡 GH200 上两阶段微调 Cosmos-Predict2.5-2B:先 15k 迭代机器人 only,再继续训机器人+人混合(warm-start)。

🔮 直觉:为什么「warm-start + 人类数据」比从头混合训练更好?
先把「机器人骨架 → 视频」学透,模型已建立稳定的 kinematic-视觉对应关系;再加人类视频微调,等于在一个已经工作的基础上做迁移。从头混合训会让模型一开始就被「机器人 vs 人手」的形态差异搞晕。论文实测:warm-start 在 7 个指标中 6 个胜过 from-beginning 混合训。

📊 关键结果:2B 模型赢 14B,且预测真机排名

评测维度OSCAR对比基线
视频质量 PSNR↑24.24Genie Envisioner 23.29;Kinema4D 17.68(14B 模型)
FVD↓(分布保真度)7.08Genie Envisioner 15.37;Kinema4D 17.07
FID↓15.07Genie Envisioner 22.92;Kinema4D 37.16
LPIPS↓0.094Genie Envisioner 0.140;Kinema4D 0.198
推理 FPS↑2.214Kinema4D 0.089(慢 25×)
模型规模2BKinema4D 14B(OSCAR 用 1/7 参数赢)
训练资源1× GH200Genie Envisioner 需多 GPU
策略评测:与 RoboArena 真机排行榜的 Spearman ρ↑+0.750(骨架条件)Latent action +0.643;Mesh +0.679
策略评测:MMRV↓(排名错位率)0.571Latent 1.429;Mesh 0.714
策略评测:SISRΔ↓(成功率差)1.73 ppLatent 1.98;Mesh 3.04

评测协议:RoboArena 排行榜上 7 个 DROID 通用策略(π0-flow/FAST、PG-flow/FSQ/FAST+/Bin),每策略 65 个 session。OSCAR 给定第一帧 + 策略动作 → 自回归 rollout → GPT-5 判单 episode 成功率或两两排名,与真机对比。

关键洞察:表 4 是 OSCAR 最大的卖点——用视频世界模型评测策略,能近似替代真机评测。骨架条件的 Spearman ρ 0.75 是三类条件里最高,证明「线骨架」是连接「动作精度」和「跨本体」的最优解。Limitations 也诚实:依赖每数据集的相机标定质量,2B backbone 还能继续 scale。

🌐 在领域中的位置

SIMPLER(手搭 sim 当代理) IRASim / UniSim(视频 WM,无动作或 latent action) OSCAR(骨架条件 + 跨本体评测)⭐ 完全在生成的世界里训/评策略

OSCAR 属于「视频世界模型做策略评测」浪潮的核心工作,承接 SIMPLER(sim 代理)、IRASim(轨迹条件视频 WM)的传统。它和 DreamZero(视频 WM 当策略)、Cosmos(通用视频 WM 基座)形成三角:基座 / 策略 / 评测,三者都用视频扩散但角色不同。

❓ 常见误区

OSCAR 是策略吗?能直接控制机器人吗?

不能。OSCAR 是世界模型,输入「动作序列」输出「视频」,不是策略(策略是输入观察输出动作)。它的用途是给一个已训好的策略打分:把策略的动作喂给 OSCAR,看生成的视频里任务有没有完成。

2D 骨架会不会太简陋?

这正是 OSCAR 的核心 bet——表 3 显示 mesh 和 skeleton 在所有 7 个指标上统计上无差别,但 mesh 依赖每机器人 URDF 资产、且会过拟合外观,而 skeleton 只需 kinematic tree。「简单」是特性,不是 bug

GPT-5 判分可靠吗?

论文用 GPT-5 做两件事:单 episode 成功率打分 + 两两视频偏好排名。后者遵循 RoboArena 和 WorldEval 的协议,得到 1365 个成对偏好,再算 Bradley-Terry 分。和真机 Spearman ρ 0.75 说明协议整体可靠,但作者承认局限在相机标定质量。

训练只用了单张 GH200?

对。这是论文的另一个亮点——2B 模型 + 高质量数据清洗让 OSCAR 在单卡上训出来,对比基线 Genie Envisioner 要多 GPU、Kinema4D 是 14B。数据比规模重要的又一证据。