RoboCasa:用生成式 AI「装修」一个十万级厨房仿真
🎯 为什么重要:机器人的「数据问题」暂时只能靠仿真解
机器人和 CV/NLP 的根本差距是数据。互联网有几十亿张图、几万亿 token,但没有几十亿条机器人轨迹——真机采集又贵又慢。论文 §I 给了三个理由支持「认真做仿真」:
① 边际成本极低:建好仿真器后,生成数据近似免费;MimicGen 这类工具能在仿真里自动批量生成轨迹。
② 生成式 AI 时代的加持:text-to-3D、text-to-image、LLM 写任务——以前手工做不了的资产规模,现在能批量造。
③ 可复现 + 加速研究:仿真器比真机实验室更易共享,新想法能快速验证。
但一个好仿真器必须同时满足三件事:物理真实、内容多样、数据规模。论文 Table I 把所有主流仿真器横向对比,结论是没一个三件事都做到——RoboCasa 想补的就是这个空缺。
💡 核心思想:让生成式 AI 把「仿真器多样性」拉满
论文的核心方法论:把生成式 AI 当成「资产生产线」,让仿真器内容的多样性从「手工几位数」跳到「自动几位数」。
🛠️ 四个支柱:场景、物体、任务、数据
| 支柱 | 规模 | 怎么做(关键技巧) |
|---|---|---|
| ① 厨房场景 | 120 个(10 户型 × 12 风格) | 户型从家装杂志归纳(L/U/G 型等),风格从建筑杂志归纳(Scandinavian/Mediterranean 等);再用 400 张 AI 纹理做 domain randomization |
| ② 物体资产 | 2509 个,153 类 | 1592 个来自 Luma.ai(text-to-3D),其余来自 Objaverse;筛选 + 转 MuJoCo MJCF 格式 |
| ③ 任务设计 | 100 个(25 原子 + 75 复合) | 原子任务覆盖 8 个传感运动技能(pick-and-place / 开关门 / 扭旋钮 …);复合任务由 GPT-4 + Gemini 1.5 设计——先列 20 个活动(煮咖啡/洗碗/备餐),再让它具体化任务 |
| ④ 数据集 | 100K+ 轨迹 | 人类遥操 1250 条种子 → MimicGen 把每条种子分解为「对象中心片段」→ 在新场景按对象位姿重变换 → 拼接 → 自动跑成功才保留(rejection sampling) |
人类遥操 1250 条远远不够(论文实验显示这个量训出来的 BC 只能到 28.8% 成功率)。但每个原子任务的结构都类似(pick-and-place 总是「抓-移-放」),所以一条人类示教可以「对象中心式地重定向」到任意新对象位姿上——MimicGen 就是干这个的。50 条种子 → 3000 条自动轨迹,关键是不需要再有人遥操。
📊 结果:机器生成的数据「能学」且「能迁移到真机」
实验 1(原子任务,Fig.7):在 24 个原子任务上对比 4 种数据集训练 BC-Transformer:
| 训练数据 | 每任务演示数 | 总轨迹 | Overall Succ% ↑ |
|---|---|---|---|
| Human-50(纯人) | 50 | 1,250 | 28.8% |
| Generated-100 | 100 | 2,400 | (介于中间) |
| Generated-300 | 300 | 7,200 | (介于中间) |
| Generated-3000(MimicGen 满血) | 3000 | 72,000 | 47.6% |
实验 2(复合任务,Fig.8):5 个长程任务(ArrangeVegetables / MicrowaveThawing / RestockPantry / PreSoakPan / PrepareCoffee),用「50 人类演示 from scratch」对比「atomic 预训练 + 50 演示微调」。Scratch 在 4/5 任务上成功率 0%;微调在 4/5 任务上非零(最高 12%)。复合任务还远没解决,但预训练明显有用。
实验 3(真机迁移,Fig.10):在真实厨房用 Franka Panda + DROID 硬件,3 个 pick-and-place 任务,对比「纯真机演示」vs「真机 + RoboCasa 仿真数据共训」:
| 设置 | Seen Obj 任务平均 Succ% | Unseen Obj 任务平均 Succ% |
|---|---|---|
| Real only | 13.6 | 2.6 |
| Real + Sim(共训) | 24.4 | 9.3 |
| 相对提升 | +79% 相对 | +258% 相对 |
🌐 在领域中的位置
定位是「家庭厨房场景的规模化仿真 + 数据基础设施」——介于 LIBERO(小规模 tabletop)和 Open-X(真机数据汇聚)之间,证明「仿真 + GenAI + MimicGen」能产出真机可用的数据。同线索:ManiSkill3、Open-X、LeRobot、GR00T-N1。
❓ 常见误区
RoboCasa 是为了「赢 benchmark」吗?
不是。它是基础设施论文——目的不是某个方法刷到 SOTA,而是提供场景/物体/任务/数据让社区能在其上做研究。论文 §V 的实验主要是验证「这套基础设施真的能学到东西」。
100K 轨迹听起来不如 Open-X 多,凭什么是大?
Open-X 是多源真机混合,RoboCasa 是单一仿真器、跨任务、自动生成的 10 万级——后者增量成本几乎为 0。论文实验证明机器生成的 3000 条/任务已经显著优于 50 条人类示教。
仿真训练出来的策略真迁移得了真机吗?
能,但只对相对简单的 pick-and-place 类任务。复合长程任务(煮咖啡、备菜)真机性能仍然很低。论文诚实地把 limitation 写在 §V:复合任务 fine-tuning 性能「relatively low」,留作未来工作。
用 LLM 设计任务靠谱吗?
半自动。LLM 偶尔会出逻辑漏洞(论文 §IV-B 明确说),需要人过滤或修改。所以 75 个复合任务是「LLM 起草 + 人审核」的产物——不是全自动,但比纯人工快得多。