Genie Sim 3.0:让 LLM 当「仿真导演」的机器人训练 / 评测平台
🎯 为什么重要:VLA 训练-评测闭环的三个卡脖子
VLA(Vision-Language-Action)模型已经是机器人操作的主流路线,但要训出一个能上真机的通用模型,三件事卡得很死:
① 数据贵——真机遥测数据 1 段就要数分钟人工,无法 scale;
② 仿真糙——自动生成的场景要么多样性不够、要么精细控制不了,无法做受控消融;
③ 评测烂——靠「成功率」+「人盯」,主观、不可复现、不能 scale。
Genie Sim 3.0 同时回答这三件事,是一体化平台而非单点改进。论文把自己定位成「第一个把 LLM 用于自动化评测」的机器人仿真平台。
💡 核心思想:LLM 驱动「生场景 + 生任务 + 打分」全流程
除了 LLM 驱动场景生成,论文另一个关键设计是环境重建:用 MetaCam 手持 3D 激光扫描真实场景,结合 SuperPoint + LightGlue 优化相机位姿,再用 Difix3D+ 补足缺失视角、PGSR 做表面重建得到高精度 mesh,3DGS 训练出真实场景的仿真孪生。这是 sim-to-real 一致性 $R^2=0.924$ 的基础。
🛠️ 三个让 LLM-仿真闭环真正 work 的关键设计
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| ① 资产检索 RAG 化(Assets Index) | 5140 个 USD 资产用 QWEN text-embedding-v4 编码成 2048 维向量,存进 ChromaDB;运行时按 cosine 相似度 top-k 检索 | 纯 LLM 生场景会「幻觉」出实际不存在的资产。RAG 把生成约束在预验证资产库里,确保下游代码引用的 USD 路径都真存在;检索 < 200ms |
| ② DSL + 多轮对话精修 | 用类似 Scene Language 的 DSL 描述场景,LLM 在 chat context 内可迭代修改 | 第一轮生成的场景往往需要微调(光照、布局、姿态)。支持多轮对话让用户自然语言调整,避免每改一处就重新生成整个场景 |
| ③ ADER + VLM 自动评测 | LLM 生任务指令 + 评测规则(ADER),VLM 看执行过程的视觉序列判定是否达成 | 手工注 success criterion 是不可 scale 的瓶颈。LLM 一次能生 10w+ 评测场景的指令和规则,VLM 自动判分让评测批量化、可复现 |
直接生成代码的 LLM 会幻觉——把不存在的资产路径塞进 USD,Isaac Sim 一加载就崩。Genie Sim 把这个不可靠环节拆成三步:(1)LLM 输出语义需求 JSON,(2)RAG 把需求映射到真实存在的资产 USD 路径,(3)DSL 模板把这些路径组装成代码。每一步都有外部约束兜底,整个流程才能在分钟级生成「能跑」的场景。
📊 结果:合成数据 1500 段训练,零样本真机超过真人演示 500 段
| 训练数据 | Select Color | Recognize Size | Grasp Targets | Organize Objects |
|---|---|---|---|---|
| 200 ep 真实 | 0.53 | 0.56 | 0.39 | 0.30 |
| 500 ep 真实 | 0.73 | 0.75 | 0.58 | 0.40 |
| 500 ep 合成 | 0.60 | 0.63 | 0.33 | 0.35 |
| 1500 ep 合成 | 0.85 | 0.94 | 0.71 | 0.60 |
表:真机评测分数(来自论文 Tab.I)。同等规模(500 ep)真实优于合成;但合成扩到 1500 ep,四个任务全部反超。
| 维度 | 数字(来自原文) |
|---|---|
| 开源规模 | 5140 个资产(353 类)、10,000+ 小时合成数据(200 任务)、100,000+ 评测场景 |
| 跨 8 任务 sim-to-real | 合成数据训练:sim-to-real 平均 0.83;真实数据训练:real-to-real 平均 0.75(合成反而高 8 个点) |
| sim-real 一致性 | 16 个模型配置散点回归:$R^2 = 0.924$,斜率 $\approx 1.045$(即仿真分数几乎 1:1 预测真机分数) |
| 评测套件 | 5 个互补套件:Sim2Real / Instruction(语言理解)/ Robust(5 类扰动)/ Manipulation(10 任务)/ Spatial(空间推理) |
| 跨模型比较 | 4 个 SOTA 比较:$\pi_{0.5}$、ACoT-VLA、GR00T-N1.7、$\pi_0$。Manipulation 平均 $\pi_{0.5}$ 最强(0.58),Spatial 平均 ACoT-VLA 最强(0.36) |
🌐 在领域中的位置
Genie Sim 3.0 的位置是「把仿真平台从手工资产库升级为 LLM 驱动的可生成平台」。它和 RoboVerse、PolaRiS 等「real-to-sim 评测」工作、以及 ctrl-world 等「生成式世界模型」工作属于同代。它的独特卖点是「全链路 LLM 化」——从生场景、生任务、到自动评分都让 LLM/VLM 参与。关联线索:仿真平台谱系、T01 sim-to-real。
❓ 常见误区
1500 ep 合成 > 500 ep 真实,是不是说以后不用采真实数据了?
不是。仔细看表:在同等规模 500 ep,真实数据在 4 个任务里都赢合成数据(0.73 vs 0.60 等)。合成数据要 scale 到 3 倍才反超。所以结论是「合成可以靠量取胜,桥接域间隙」,不是「合成天然优于真实」。真实数据仍是稀缺资源,Genie Sim 提供的是「当真实数据采不动时,合成是个可 scale 的替代」。
LLM 生场景是不是不可控、不可复现?
论文专门强调可复现性:DSL 代码可保存、可分享、可手动调整。LLM 的随机性由温度参数和随机种子控制。同时 RAG 把资产约束在预验证库里,确保生成的场景在物理上可加载、可交互。
VLM 自动评分真的可靠吗?
论文没给 VLM 评分和人类评分的吻合度数字(这是局限)。但从结果看,模型间分数差异(如 $\pi_0$ 在 pick_common_sense 只有 0.06,远低于 $\pi_{0.5}$ 的 0.38)方向正确——这跟独立观察一致。同时 sim-real 一致性 $R^2=0.924$ 是间接证据:如果 VLM 评分完全不靠谱,不会有这么高的相关性。