枢纽
物理感知
输入模态language

Genie Sim 3.0:让 LLM 当「仿真导演」的机器人训练 / 评测平台

Chenghao Yin, Da Huang, Di Yang 等(智元 Agibot)。arXiv:2601.02078v3,2026 年 6 月。 开源于 github.com/AgibotTech/genie_sim · foundation_modelssimulationsim-to-real

🧠 一句话心智模型:训练通用 VLA 模型卡在「数据」——真机数据贵、仿真数据糙、评测靠人盯。Genie Sim 3.0 把 LLM 拉来当「仿真导演」:你说一句话它就搭场景(5140 个资产任你挑)、生任务、自动评分;再用 3DGS 重建把真实环境搬进仿真。结论很硬:合成数据训练的 $\pi_{0.5}$(扩到 1500 段),零样本真机分数反而比 500 段真人演示高(8 任务 sim-to-real 均值 0.83 vs 0.75)。

🎯 为什么重要:VLA 训练-评测闭环的三个卡脖子

VLA(Vision-Language-Action)模型已经是机器人操作的主流路线,但要训出一个能上真机的通用模型,三件事卡得很死:

核心矛盾
① 数据贵——真机遥测数据 1 段就要数分钟人工,无法 scale;
② 仿真糙——自动生成的场景要么多样性不够、要么精细控制不了,无法做受控消融;
③ 评测烂——靠「成功率」+「人盯」,主观、不可复现、不能 scale。

Genie Sim 3.0 同时回答这三件事,是一体化平台而非单点改进。论文把自己定位成「第一个把 LLM 用于自动化评测」的机器人仿真平台。

💡 核心思想:LLM 驱动「生场景 + 生任务 + 打分」全流程

自然语言指令 "在厨房桌面上摆五个不同颜色的方块" ① Intention Interpreter CoT-LLM 拆解 → JSON schema 语义类 + 空间关系 ② Assets Index RAG + QWEN 嵌入 从 5140 个 USD 资产检索 ③ DSL Code Generator LLM 生成场景描述代码 支持多轮对话精修 ④ USD 场景图 → Isaac Sim 闭环评测模块 HTTP 解耦:仿真↔模型推理 支持 π0.5/GO-1/GR00T/RDT 等 LLM 生任务 + 评测规则 ADER 系统:自动生指令 + 评判 10w+ 评测场景 VLM 自动评分 看视觉观察序列 → 是否达成 生成 evidence-based 评分 合成数据来源 遥操作(VR PICO) + 自动化(cuRobo 路径规划) 3DGS + Difix3D+ 高保真重建
图 1(据论文 Fig.2 + Fig.3 重绘):四阶段生成仿真场景 + 自动评测 + 双范式数据采集,构成闭环。

除了 LLM 驱动场景生成,论文另一个关键设计是环境重建:用 MetaCam 手持 3D 激光扫描真实场景,结合 SuperPoint + LightGlue 优化相机位姿,再用 Difix3D+ 补足缺失视角、PGSR 做表面重建得到高精度 mesh,3DGS 训练出真实场景的仿真孪生。这是 sim-to-real 一致性 $R^2=0.924$ 的基础。

🛠️ 三个让 LLM-仿真闭环真正 work 的关键设计

设计心智为什么必要
① 资产检索 RAG 化(Assets Index)5140 个 USD 资产用 QWEN text-embedding-v4 编码成 2048 维向量,存进 ChromaDB;运行时按 cosine 相似度 top-k 检索纯 LLM 生场景会「幻觉」出实际不存在的资产。RAG 把生成约束在预验证资产库里,确保下游代码引用的 USD 路径都真存在;检索 < 200ms
② DSL + 多轮对话精修用类似 Scene Language 的 DSL 描述场景,LLM 在 chat context 内可迭代修改第一轮生成的场景往往需要微调(光照、布局、姿态)。支持多轮对话让用户自然语言调整,避免每改一处就重新生成整个场景
③ ADER + VLM 自动评测LLM 生任务指令 + 评测规则(ADER),VLM 看执行过程的视觉序列判定是否达成手工注 success criterion 是不可 scale 的瓶颈。LLM 一次能生 10w+ 评测场景的指令和规则,VLM 自动判分让评测批量化、可复现
🔮 直觉:为什么 RAG + DSL 比「让 LLM 直接吐 USD 代码」好?
直接生成代码的 LLM 会幻觉——把不存在的资产路径塞进 USD,Isaac Sim 一加载就崩。Genie Sim 把这个不可靠环节拆成三步:(1)LLM 输出语义需求 JSON,(2)RAG 把需求映射到真实存在的资产 USD 路径,(3)DSL 模板把这些路径组装成代码。每一步都有外部约束兜底,整个流程才能在分钟级生成「能跑」的场景。

📊 结果:合成数据 1500 段训练,零样本真机超过真人演示 500 段

训练数据Select ColorRecognize SizeGrasp TargetsOrganize Objects
200 ep 真实0.530.560.390.30
500 ep 真实0.730.750.580.40
500 ep 合成0.600.630.330.35
1500 ep 合成0.850.940.710.60

表:真机评测分数(来自论文 Tab.I)。同等规模(500 ep)真实优于合成;但合成扩到 1500 ep,四个任务全部反超

维度数字(来自原文)
开源规模5140 个资产(353 类)、10,000+ 小时合成数据(200 任务)、100,000+ 评测场景
跨 8 任务 sim-to-real合成数据训练:sim-to-real 平均 0.83;真实数据训练:real-to-real 平均 0.75(合成反而高 8 个点)
sim-real 一致性16 个模型配置散点回归:$R^2 = 0.924$,斜率 $\approx 1.045$(即仿真分数几乎 1:1 预测真机分数)
评测套件5 个互补套件:Sim2Real / Instruction(语言理解)/ Robust(5 类扰动)/ Manipulation(10 任务)/ Spatial(空间推理)
跨模型比较4 个 SOTA 比较:$\pi_{0.5}$、ACoT-VLA、GR00T-N1.7、$\pi_0$。Manipulation 平均 $\pi_{0.5}$ 最强(0.58),Spatial 平均 ACoT-VLA 最强(0.36)
关键洞察:本文最硬的结论是「1500 ep 合成 > 500 ep 真实」。这意味着 Genie Sim 的系统化域随机化(物体纹理、光照、物理参数、任务变体)确实在规模上桥接了域间隙。但要注意前提:合成数据要 scale 到 3× 真实数据量才反超——这不是「合成白嫖真实」,而是「合成可以靠量取胜」。同时,sim 与 real 的 $R^2=0.924$ 是整个平台最有价值的数字,它让仿真评测变得可信。

🌐 在领域中的位置

Meta-World / RLBench(手工固定任务集) RoboCasa / RoboTwin 2.0(更大规模,但场景固定) DROID / Open X-Embodiment(真实数据集,不可控) Genie Sim 3.0(LLM 驱动可生 + 评测可信)⭐

Genie Sim 3.0 的位置是「把仿真平台从手工资产库升级为 LLM 驱动的可生成平台」。它和 RoboVerse、PolaRiS 等「real-to-sim 评测」工作、以及 ctrl-world 等「生成式世界模型」工作属于同代。它的独特卖点是「全链路 LLM 化」——从生场景、生任务、到自动评分都让 LLM/VLM 参与。关联线索:仿真平台谱系、T01 sim-to-real

❓ 常见误区

1500 ep 合成 > 500 ep 真实,是不是说以后不用采真实数据了?

不是。仔细看表:在同等规模 500 ep,真实数据在 4 个任务里都赢合成数据(0.73 vs 0.60 等)。合成数据要 scale 到 3 倍才反超。所以结论是「合成可以靠量取胜,桥接域间隙」,不是「合成天然优于真实」。真实数据仍是稀缺资源,Genie Sim 提供的是「当真实数据采不动时,合成是个可 scale 的替代」。

LLM 生场景是不是不可控、不可复现?

论文专门强调可复现性:DSL 代码可保存、可分享、可手动调整。LLM 的随机性由温度参数和随机种子控制。同时 RAG 把资产约束在预验证库里,确保生成的场景在物理上可加载、可交互。

VLM 自动评分真的可靠吗?

论文没给 VLM 评分和人类评分的吻合度数字(这是局限)。但从结果看,模型间分数差异(如 $\pi_0$ 在 pick_common_sense 只有 0.06,远低于 $\pi_{0.5}$ 的 0.38)方向正确——这跟独立观察一致。同时 sim-real 一致性 $R^2=0.924$ 是间接证据:如果 VLM 评分完全不靠谱,不会有这么高的相关性。