枢纽
数据集RoboCasa
输入模态vision,language

RoboCasa:用生成式 AI「装修」一个十万级厨房仿真

Soroush Nasiriany, Abhiram Maddukuri, Lance Zhang 等(UT Austin + NVIDIA Research)。arXiv:2406.02523,2024 年 6 月。 项目页 · simulationdata generationgenAI assets

🧠 一句话心智模型:CV/NLP 靠互联网数据「堆」出基础模型,机器人没这个福。RoboCasa 的思路是——让生成式 AI 当装修工:text-to-3D 生成 2500+ 厨具,text-to-image 生成纹理,GPT-4 出任务点子,MimicGen 自动产 10 万条轨迹。一个多样化厨房 + 大规模数据的仿真器,BC 直接吃出来就能迁移到真机。

🎯 为什么重要:机器人的「数据问题」暂时只能靠仿真解

机器人和 CV/NLP 的根本差距是数据。互联网有几十亿张图、几万亿 token,但没有几十亿条机器人轨迹——真机采集又贵又慢。论文 §I 给了三个理由支持「认真做仿真」:

为什么仿真值得投入
边际成本极低:建好仿真器后,生成数据近似免费;MimicGen 这类工具能在仿真里自动批量生成轨迹。
生成式 AI 时代的加持:text-to-3D、text-to-image、LLM 写任务——以前手工做不了的资产规模,现在能批量造。
可复现 + 加速研究:仿真器比真机实验室更易共享,新想法能快速验证。

但一个好仿真器必须同时满足三件事:物理真实、内容多样、数据规模。论文 Table I 把所有主流仿真器横向对比,结论是没一个三件事都做到——RoboCasa 想补的就是这个空缺。

物理真实 MuJoCo + Omniverse 内容多样 120 厨房 + 2500 物体 数据规模 100K+ 轨迹 RoboCasa 三者兼顾 GenAI 工具 MimicGen RoboSuite 继承
图 1:RoboCasa 的三足支撑。物理真实继承自 RoboSuite(MuJoCo),多样性靠 GenAI 工具补,数据规模靠 MimicGen。

💡 核心思想:让生成式 AI 把「仿真器多样性」拉满

论文的核心方法论:把生成式 AI 当成「资产生产线」,让仿真器内容的多样性从「手工几位数」跳到「自动几位数」。

text-to-3D Luma.ai → 1592 物体 text-to-image MidJourney → 纹理 LLM 任务设计 GPT-4 → 75 复合任务 + Objaverse 物体库 RoboCasa 120 厨房场景 2509 物体 / 153 类 100 任务(25 原子 + 75 复合) 移动操作 + 跨本体 人类遥操示教 1250 条(25 任务 × 50) MimicGen 自动扩增 → 100K+ 轨迹 BC 策略训练 → 真机可迁移
图 2:RoboCasa 的「资产生产线」。生成式 AI 负责造内容,MimicGen 负责造数据。

🛠️ 四个支柱:场景、物体、任务、数据

支柱规模怎么做(关键技巧)
① 厨房场景120 个(10 户型 × 12 风格)户型从家装杂志归纳(L/U/G 型等),风格从建筑杂志归纳(Scandinavian/Mediterranean 等);再用 400 张 AI 纹理做 domain randomization
② 物体资产2509 个153 类1592 个来自 Luma.ai(text-to-3D),其余来自 Objaverse;筛选 + 转 MuJoCo MJCF 格式
③ 任务设计100 个(25 原子 + 75 复合)原子任务覆盖 8 个传感运动技能(pick-and-place / 开关门 / 扭旋钮 …);复合任务由 GPT-4 + Gemini 1.5 设计——先列 20 个活动(煮咖啡/洗碗/备餐),再让它具体化任务
④ 数据集100K+ 轨迹人类遥操 1250 条种子 → MimicGen 把每条种子分解为「对象中心片段」→ 在新场景按对象位姿重变换 → 拼接 → 自动跑成功才保留(rejection sampling)
🔮 直觉:为什么 MimicGen 是数据规模的关键?
人类遥操 1250 条远远不够(论文实验显示这个量训出来的 BC 只能到 28.8% 成功率)。但每个原子任务的结构都类似(pick-and-place 总是「抓-移-放」),所以一条人类示教可以「对象中心式地重定向」到任意新对象位姿上——MimicGen 就是干这个的。50 条种子 → 3000 条自动轨迹,关键是不需要再有人遥操。

📊 结果:机器生成的数据「能学」且「能迁移到真机」

实验 1(原子任务,Fig.7):在 24 个原子任务上对比 4 种数据集训练 BC-Transformer:

训练数据每任务演示数总轨迹Overall Succ% ↑
Human-50(纯人)501,25028.8%
Generated-1001002,400(介于中间)
Generated-3003007,200(介于中间)
Generated-3000(MimicGen 满血)300072,00047.6%
关键洞察清晰的 scaling trend——MimicGen 数据从 100 → 3000 条/任务,BC 性能单调上升。50 条人类示教打不过 3000 条机器示教——这是「规模 > 单条质量」的强证据(在仿真里)。

实验 2(复合任务,Fig.8):5 个长程任务(ArrangeVegetables / MicrowaveThawing / RestockPantry / PreSoakPan / PrepareCoffee),用「50 人类演示 from scratch」对比「atomic 预训练 + 50 演示微调」。Scratch 在 4/5 任务上成功率 0%;微调在 4/5 任务上非零(最高 12%)。复合任务还远没解决,但预训练明显有用。

实验 3(真机迁移,Fig.10):在真实厨房用 Franka Panda + DROID 硬件,3 个 pick-and-place 任务,对比「纯真机演示」vs「真机 + RoboCasa 仿真数据共训」:

设置Seen Obj 任务平均 Succ%Unseen Obj 任务平均 Succ%
Real only13.62.6
Real + Sim(共训)24.49.3
相对提升+79% 相对+258% 相对
关键洞察:仿真数据共训对 Seen 物体提升 79%、对 Unseen 物体提升更达 258%——仿真多样性帮助泛化。这正是 RoboCasa 设计哲学(多场景 + 多物体 + GenAI 资产)的直接验证。

🌐 在领域中的位置

RoboSuite( tabletop 物理) LIBERO / ManiSkill(任务库) RoboCasa(房间级 + GenAI 资产 + 10 万轨迹)⭐ 人形/移动操作基础数据(GR00T 等)

定位是「家庭厨房场景的规模化仿真 + 数据基础设施」——介于 LIBERO(小规模 tabletop)和 Open-X(真机数据汇聚)之间,证明「仿真 + GenAI + MimicGen」能产出真机可用的数据。同线索:ManiSkill3Open-XLeRobotGR00T-N1

❓ 常见误区

RoboCasa 是为了「赢 benchmark」吗?

不是。它是基础设施论文——目的不是某个方法刷到 SOTA,而是提供场景/物体/任务/数据让社区能在其上做研究。论文 §V 的实验主要是验证「这套基础设施真的能学到东西」。

100K 轨迹听起来不如 Open-X 多,凭什么是大?

Open-X 是多源真机混合,RoboCasa 是单一仿真器、跨任务、自动生成的 10 万级——后者增量成本几乎为 0。论文实验证明机器生成的 3000 条/任务已经显著优于 50 条人类示教。

仿真训练出来的策略真迁移得了真机吗?

能,但只对相对简单的 pick-and-place 类任务。复合长程任务(煮咖啡、备菜)真机性能仍然很低。论文诚实地把 limitation 写在 §V:复合任务 fine-tuning 性能「relatively low」,留作未来工作。

用 LLM 设计任务靠谱吗?

半自动。LLM 偶尔会出逻辑漏洞(论文 §IV-B 明确说),需要人过滤或修改。所以 75 个复合任务是「LLM 起草 + 人审核」的产物——不是全自动,但比纯人工快得多。