⏱ ~78 min

T02 · 数据集与仿真基础设施的演化

核心问题:机器人研究是怎么从「每个实验室各做各的、模型不可复现」,一步步被 OpenX / DROID / AMASS / Isaac Lab 这些「基础设施」推到「大数据预训练 + 统一评测」范式的?基础设施层如何反向塑造了研究问题本身?
状态:🟢 活跃(2025 主战场:合成数据 pipeline + 跨本体 scaling law + 仿真评测对齐真机)
配套单篇笔记P-OpenX-2023.md(Open X-Embodiment 工程统一机制 + scaling 证据)


🎯 你将学到什么

  1. 看懂机器人学习如何从「每个实验室各做各的、模型不可复现」,被 AMASS / OpenX / DROID / Isaac Lab 等基础设施一步步推到「大数据预训练 + 统一评测」范式
  2. 掌握 OpenX 三层工程机制(RLDS 数据格式 + 7-DoF EE 动作统一 + 256-bin action tokenization)如何让 22 个本体、百万轨迹真正可组合训练,并给出跨本体正向迁移的定量证据
  3. 分清数据集(OpenX/DROID)、benchmark(CALVIN/LIBERO)、仿真器MuJoCo/Isaac Lab/Genesis)三层基础设施的角色与边界
  4. 理解合成数据 pipeline 从程序化(Replicator/MimicGen)到生成式(GR00T-Dreams/Cosmos)的范式跃迁,及其能否补上 4-5 个数量级数据缺口的争论
  5. 学会据任务选仿真器(locomotion 选 Isaac Lab、精确接触选 MuJoCo、极致速度选 Genesis),并理解 SimplerEnv 让仿真评测与真机强相关的方法

T02 数据集与仿真基础设施演化

本页内容

基础解释

一句话直觉

机器人学习长期缺公共数据。

各家格式不通,模型没法共享。

好比一座城没有公共图书馆。

家家自己家教、各教各的,谁也借不到别家的书。

从基础理解

要解决的问题

机器人学习有个别的领域没有的结构性瓶颈:数据。

语言模型有几十万亿字的互联网文本。

视觉有上亿张标注图。

机器人到 2022 年还是这样。

每个组用自己的机器、自己拍几千条演示、写成自己的格式。

A 组的策略 B 组加载不了(格式不通)。

A 组的本体 B 组没有(本体不通)。

连 A 组自己的实验,半年后都复现不了。

所谓大数据预训练,长期进不来这门。

演进脉络(六个台阶)

  • 统一动捕。把十几个光学动捕集,拟合成同一具参数化人体,动作研究有了公共底座。
  • 低成本标准采集。固定一种桌面机械臂、一个相机视角、一套动作维度,把采集成本压到爱好者级 📎
  • 跨本体大联合。二十多家机构把二十多种机器人、上百万条轨迹,统一成同一种数据格式 📎
  • 仿真器换代。从精确接触引擎,到一张显卡上并行几千个环境,训练从几周压到几十分钟 📎
  • 合成数据。从手写脚本批量造场景,升级到用世界模型想象出新场景和新轨迹。
  • 仿真评测对齐。把仿真的背景和参数调到贴近真机,让"谁更好"的排名和真机对得上 📎

方法核心(大白话)

最关键的是那次跨本体大联合,做法分三层。

第一层给个通用容器。不强制大家的动作维度都一样。

只规定一段轨迹是一串步,每步含观测、动作、奖励、语言。

每种机器人在自己的元数据里声明自己的维度。

第二层把动作粗略对齐。所有动作都塞进一个七维表示:

手在空间哪、朝向哪、夹爪开不开。各自先归一化

注意这只是粗对齐。

同一个动作向量,在不同机器人身上,会诱发完全不同的运动。

第三层把动作切碎成离散的小标签,方便大模型像读句子一样读动作。

三件事合起来,第一次让机器人也能在大杂烩数据上预训练。

一句话类比

跨本体大联合之于机器人,就像统一轨距之于铁路。

以前各修各的宽窄轨,火车开不过界。

轨距一统,一张网就能跑。

一、这条线索在解决什么

机器人学习长期有一个 NLP/CV 不存在的结构性瓶颈:数据LLM 有几十 T 的互联网文本、CV 有 ImageNet/LAION 上亿张标注图,而机器人直到 2022 年还是「每个组用自己的机器人、在自己实验室拍几千条 demo、写成自己的 pickle/hdf5 格式」。结果是:A 组训练的策略 B 组加载不了(格式不通),A 组的本体 B 组没有(本体不通),A 组的实验 A 组自己半年后都复现不了(环境不通)。模型无法跨本体复用、结论无法横向比较、scaling law 无从谈起——这三件事合起来,就是机器人学习「大数据预训练范式长期进不来」的根本原因。

这条线索讲的是这条瓶颈是怎么被基础设施而非算法突破打开的:AMASS(2019)把 15 个光学动捕集统一成 SMPL,让 motion prior / BFM 路线有了公共数据底座(见 [T04]);BridgeData V2(2023)证明「低成本单臂 + 标准化采集」可以堆出 6 万条可外用轨迹;Open X-Embodiment / RT-X(2023.10)是真正的转折点——21 家机构(institutions)把 22 种本体(embodiments)、百万级轨迹统一成 RLDS 格式,并用 RT-2-X 给出跨本体正向迁移的定量证据,把「大数据预训练」范式正式移植进机器人;DROID(2024)补上了「单本体、高质量、in-the-wild」的另一极;同期仿真器从 MuJoCo 到 Isaac Gym/Lab 到 Genesis,把「数据采集速度」推快了几个数量级;GR00T Mimic / Cosmos / Isaac Replicator 把合成数据 pipeline 从「手工建场景」推到「LLM/world model 生成场景」;SimplerEnv 则证明「调校得当的仿真评测能与真机评测强相关」,部分缓解了真机评测不可复现的痼疾。

和相邻线索的边界:本线索关心的是数据 / 仿真 / 评测这三层基础设施怎么塑造研究范式;[T06 VLA] 关心算法侧怎么吃这些数据;[T04 motion prior] 把 AMASS 当数据基石用;[T09 world model] 把学到的世界模型当数据源/仿真器用——这三条是 T02 的「下游消费者」。T02 的核心论点是:过去三年机器人研究的范式跃迁,一半功劳属于基础设施层,而非算法层


二、时间线(关键转折点)

2019 年之前:碎片化时代。 Habitat(Meta,室内导航)、RoboSuite(UCSD/MIT,MuJoCo 操作)、Gym-Robotics(OpenAI 继任者)各做各的仿真,每篇论文一个自定义任务集。真机数据更碎:RT-1 之前,最大的真机操作数据集是 RoboNet [Dasari 2019, arxiv:1910.11215]——1500 万帧、7 种本体,但格式私有、动作空间不统一,只能做 video prediction,做不了 policy 训练。根本问题不是「数据少」,而是「数据不可组合」:A 组的 Franka 数据和B 组的 Sawyer 数据在动作维度、坐标系、图像分辨率上全不一样,混在一起训练没人做过、也没人敢做。

2019 年 AMASS 统一动捕。 [Mahmood 2019, ICCV] 把 CMU、KIT、BML 等 15 个光学动捕数据集统一拟合到 SMPL 参数化人体模型,得到 40+ 小时、344 名受试者、11265 段动作的一致表示。这是 motion prior 路线([T04])的数据基石:没有 AMASS 就没有 PHC/UHC 的 universal tracker、没有 BFM 的 motor foundation。AMASS 的关键不是「大」,而是「统一表示」——所有动捕都用同一组 SMPL 系数描述,下游 retarget 到任何机器人本体都走同一套 pipeline。

💡 核心洞察:AMASS 的真正贡献不是「40 小时数据」而是「统一参数空间」——把异构 marker 投影到同一组 SMPL 系数,让「在全部 AMASS 上训 universal tracker」从不可能变成默认做法,这是机器人学首次以「统一表示」撬动下游 scale。

2023 年 BridgeData V2:低成本标准化的第一击。 [Walke 2023, arxiv:2308.12952] 在低成本 WidowX-250 平台上采集 60094 条轨迹、24 个环境,全部 CC-BY 开源、HuggingFace 直下。意义不在规模(远小于 OpenX),而在证明了「affordable data collection」可以规模化——一个桌面机械臂 + 标准相机 + 标准动作空间,就能堆出训练 RT-1/X、Octo、RoboCat 的基础集。它是 RT-1 的训练数据,也是 OpenX 最大的单一贡献子集之一。

2023.10 OpenX-Embodiment / RT-X:范式转折点。 21 家机构(Google DeepMind 牵头)把 22 种本体(单臂/双臂/四足)、1M+ 轨迹、527 个技能统一成 RLDS 格式。三件事同时成立:(1) 工程上把异构动作空间统一成 7+1 维 EE 表示 + 标准化归一化;(2) RT-1-X 和 RT-2-X 在 5/5 个评测本体上超越单本体原版,RT-2-X 的 emergent skill 比 RT-2 提升 3 倍——首次定量证明跨本体正向迁移成立;(3) 后续所有开源 VLA(Octo、OpenVLA、π0)直接在 OpenX 上预训练。这是机器人学的「ImageNet 时刻」。详见 P-OpenX-2023.md

2024 年 DROID:质量与多样性的另一极。 [Khazatsky 2024, arxiv:2403.12945] 50 名采集者在 13 家机构、564 个场景下用统一的 Franka Panda 标定 rig 采集 76k 轨迹(350h)。它走的是和 OpenX 相反的路:OpenX 追本体广度(22 种),DROID 追单本体的场景深度(场景多样性比此前任何数据集高一个数量级)。两者当前是 VLA 训练的两大主力,往往 co-train。

2024 年仿真器换代。 Isaac Gym(2021,NVIDIA)开了 GPU 并行 RL 的先河,但被官方 deprecated;继任者 Isaac Lab(原 Orbit)成为四足/人形 locomotion 的事实标准栈,配 RSL-RL、unitree_rl_lab。MuJoCo(DeepMind 2022 开源)靠接触动力学精确继续统治学术 manipulation,MJX/Warp 后端把并行推到 GPU 级。Genesis(CMU, 2024 末) 纯 Python 但单 RTX4090 跑 Franka 可达 43M FPS(独立 benchmark [Stone Tao 2024] 实测:简单场景达标,复杂场景比宣称慢 3-10 倍),主打「生成式 data engine」愿景。仿真器选型直接决定研究节奏:跑 locomotion 选 Isaac Lab(GPU 并行 + Unitree H1/G1 官方支持),跑精确接触选 MuJoCo,要极致速度做大规模合成数据选 Genesis。

2024-25 合成数据 pipeline 范式化。 NVIDIA 把合成数据从「手工写 Replicator 脚本」推到「LLM/world model 自动生成」:GR00T Mimic(Omniverse + 3D 生成基础模型)从少量人手 demo 外推出海量变体;GR00T-Dreams(基于 Cosmos world foundation model)从单张图 + 语言生成完整轨迹;Isaac Replicator 已程序化生成 270 万张标注图。这条 pipeline 是 NVIDIA 整个 GR00T N1/N1.5 的核心加速器(N1.5 据称 36 小时训完)。

2024 评测层统一化。 ManiSkill3(GPU 并行操作)、CALVIN(长时序连 5 任务)、LIBERO(终身/多任务)、HumanoidBench(27 全身任务)各自占领一个评测维度。SimplerEnv [Li 2024, arxiv:2405.05941] 是关键:它用「visual matching + system identification」让仿真评测与真机评测强相关(Spearman 排序相关),让 RT-1-X / Octo / OpenVLA 这类策略第一次有了可复现、可横向比较的评测——这是 OpenX 之后评测层的必然补完。

2025-26 开源端到端框架 + 可增长数据 engine。 与 NVIDIA 闭源合成栈并行的另一条开源前沿:Hugging Face 的 LeRobot [Cadene 2026, arxiv:2602.22818] 把 RLDS 兼容数据加载、训练、评测打包成端到端框架,是社区复现 OpenX/DROID 系 VLA 的事实基础设施;Caltech LeCAR Lab 的 WANDA [Guo 2026, arxiv:2607.13154] 从单条 RGBD demo 重建 Gaussian splat 场景,再通过整体运动规划扩出整片开放世界轨迹——把「单 demo 合成」做到了 mobile manipulation 上,并原生支持跨本体迁移。新近的 AXIS [Zhao et al., arxiv:2607.21588] 则把浏览器遥操、自动任务生成与验证、质量过滤/增强、训练和留出评测接成同一条数据飞轮:当前 207 个任务、5 万+轨迹,报告持续预训练能提升 π0.5。另一条不可开源复现、但必须计入尺度判断的产业线是 Xiaomi-Robotics-1 [Xiaomi Robotics, arxiv:2607.15330]:其预训练使用 10 万+小时真实世界轨迹,意味着 2026 的数据竞争已同时沿「数据飞轮效率」与「工业真机数据规模」两轴展开。它说明 2026 的问题已不只是「怎样拿到一批数据」,而是「怎样让数据管线自己可持续地增长和校准」。


三、关键转折的深度解析

转折 1 · AMASS(2019):把动捕统一成「一个身体」

  • 前作缺陷:CMU MoCap、KIT、BML 等十几个光学动捕集各自为政,marker 设置不同、骨架拓扑不同、坐标系不同,混用几乎不可能。做人形模仿的组每次都要重新处理一遍原始 marker 数据。
  • 核心机制:AMASS 把所有动捕数据拟合到 SMPL 参数化人体模型——无论原始 marker 怎么布,最终都用同一组 (pose, shape, translation) 参数描述。这本质上是把「异构的原始测量」投影到一个统一的低维参数空间(SMPL:72 维 pose + 10 维 shape + 全局位姿)。
  • 为什么是数据基石:之后所有 motion prior 工作(AMP、ASE、PHC/UHC、BFM,见 [T04])都站在 AMASS 上——没有统一表示,PHC 的「在全部 AMASS 上训 universal tracker」就无从谈起。BABEL 给它补了英文动作标签,催生了 text-to-motion 整条线(HumanML3D、MDM)。AMASS 之于人形运动,等于 ImageNet 之于视觉
  • 局限:只有身体姿态(无面部/手指),Motion-X(2023,SMPL-X 全身)后来补上;纯人体,retarget 到异构人形仍需工程。

转折 2 · BridgeData V2(2023):证明「低成本 + 标准化」可堆量

  • 前作缺陷:RT-1 之前,真机操作数据采集要么用工业机械臂(贵、不可复制),要么各组的 WidowX 配置不统一(图像/动作都不同),无法跨组复用。
  • 核心机制:固定 WidowX-250 + 固定相机视角 + 固定 7 维 EE 动作空间 + 标准 hdf5 格式。60k 轨迹、24 环境全开源。它把「单臂桌面操作」这件事的数据采集成本压到了 hobbyist 级别
  • 为什么重要:它是 RT-1/X、Octo、RoboCat 的主力训练集,也是 OpenX 最大的单子集之一。更重要的是它示范了一种范式——「一个标准化 rig + 大量采集者」,这个范式被 DROID 放大到 13 家机构。
  • 留下的新问题:单本体(WidowX)、场景偏玩具厨房——跨本体和真工业场景的覆盖要靠 OpenX 和 DROID。

转折 3 · Open X-Embodiment / RT-X(2023.10):范式转折点(详见 P-OpenX-2023.md

工程上,OpenX 用三层机制把 22 种异构本体统一(以下精确机制来自 PDF Sec.III–IV,详见 P-OpenX-2023.md):

  • (1) RLDS 数据格式(Sec.III.A 原话):用 RLDS(Reinforcement Learning Datasets)数据格式 [Srinivas et al.] —— 数据保存为序列化的 tfrecord 文件,schema 是 steps: [observation, action, reward, language]。RLDS 的关键设计是 "accommodates the various action spaces and input modalities of different robot setups, such as differing numbers of RGB cameras, depth cameras and point clouds"——即不强制动作/观测维度一致,只规定 episode→steps→(obs, action, ...) 这个嵌套结构,每个数据集在元数据里声明自己的维度。支持所有主流深度学习框架的高效并行数据加载(通过 tf.data.Dataset 管道)。这是「跨本体统一」的关键:不是把 22 本体压成一个 schema,而是给一个抽象容器让异构数据共存。
  • (2) 7-DoF EE 动作空间统一(Sec.IV.A):所有数据集coarsely aligned7 维 EE 动作 = (x, y, z, roll, pitch, yaw, gripper)(或这些量的 rates)。具体做法:每个数据集选 1 个 canonical 相机视角、resize 到统一分辨率;原始动作集转成 7-DoF EE;每个数据集在 discretization 前各自归一化,下游推理时根据本体 de-normalize 解读同一输出。注意坐标系不对齐——允许绝对/相对位置或速度,同一 action 向量在不同本体上诱发完全不同的运动。论文称这是「loosely aligned」——粗糙但够用。
  • (3) Action token 化(Sec.IV.B):RT-1-X 和 RT-2-X 都把 7 维 EE + 1 维 terminate 共 8 维 各自均匀离散化成 256 bins,于是每个动作 = 8 个 token(256×8 配置,与 RT-2 一致)。

数据集规模(Sec.III.A)60 个独立数据集(来自 34 个机器人研究实验室)合并成 OpenX Dataset = 1M+ 真机轨迹 / 22 种本体 / 21 家机构 / 527 skills(160266 tasks)。Franka 本体贡献最多 dataset 数,xArm 和 Google Robot 贡献最多轨迹数;skill 长尾含 wiping、assembling 等(用 PaLM 提取 skill/object 标签做统计,PDF Sec.III.B Fig.2)。实验时实际用了 9 种本体子集(RT-1/QT-Opt/Bridge/Robot Play/Jaco Play/Cable Routing/RoboTurk/NYU VINN/Austin VIOLA/Berkeley UR5/TOTO/Language Table)。

RT-1-X 架构(Sec.IV.B):35M 参数;输入 15 幅图像 history + 自然语言 → EfficientNet(ImageNet pretrained)+ USE 嵌入 → FiLM 交织产生 81 个 vision-language token → decoder-only Transformer 输出 8 个 action token。

RT-2-X 架构(Sec.IV.B):基于 PaLI-X(ViT + UL2),在 WebLI 上预训练后 co-fine-tune(web 数据 : 机器人数据 ≈ 1:1)。动作 token 与 RT-2 一致。

跨本体正向迁移的实验证据(Sec.V):在 3600 evaluation trials / 6 不同本体 上:RT-1-X 在小数据集本体上平均 +50% 成功率(Fig.4);RT-2-X 在 Google Robot 上的 emergent skill 比 RT-2 提升 ~3×(Table II row 1 vs 2,27.3% → 75.8%);移除 Bridge 数据集(row 3)后 emergent skill 掉到 42.8%——证明跨本体迁移真实存在。关键设计决策(Table II ablations):(a) web 预训练关键(row 4 vs row 6:with web 44.4% vs from-scratch 0%);(b) 模型容量关键(55B vs 5B:row 2 vs row 4,75.8% vs 44.4%);(c) 2 步图像 history 显著提升泛化(row 4 vs row 5:44.4% vs 14.5%)。

意义:OpenX 成为后续所有开源 VLA(Octo、OpenVLA、π0、RDT)的预训练底座。没有 OpenX,就没有今天开源 VLA 的繁荣。这是机器人学的 ImageNet 时刻——在这之前每个组用自己的数据,之后大家有了公共基准。

💡 核心洞察:OpenX 的工程精髓不是「统一动作维度」而是「统一容器+各维度声明」——RLDS 给出抽象嵌套 schema 让 22 种异构本体共存,再用 7-DoF EE + 各自归一化做"loosely aligned",这是「跨本体统一」在工程上能落地的真正妥协。

转折 4 · DROID(2024):质量与场景多样性的另一极

  • 核心机制:13 家机构、50 名采集者、564 个 in-the-wild 场景,全部用同一套 Franka Panda 标定 rig(相机/动作/标定完全统一),76k 轨迹、350h、86 任务。
  • 与 OpenX 的根本差异:OpenX 追本体广度(22 种),DROID 追单本体的场景深度(场景数比此前任何数据集高一个数量级)。论文明确宣称 scene diversity 比 prior dataset 高一个数量级。
  • 为什么是当前 VLA 主力之一:因为动作空间完全统一(单 Franka),训练时无需处理跨本体归一化;又因为场景多样,泛化好。OpenVLA、π0、3D Diffuser Actor 都在 DROID 上训练/评测。当前主流是 OpenX + DROID co-train——广度 + 深度都要。
  • 范式意义:DROID 和 OpenX 合起来定义了「真机数据」的两条收集哲学——广度靠联合(OpenX)vs 深度靠标定(DROID)

💡 核心洞察:OpenX 与 DROID 是「广度 vs 深度」的正交投资——前者 22 本体换广度但单本体稀疏,后者单 Franka 564 场景换深度但无本体泛化,当前主流 co-train 暗示:机器人数据缺的不只是「量」,更是「正交覆盖度」。

转折 5 · 仿真器演化:MuJoCo → Isaac Gym → Isaac Lab → Genesis

仿真器的演化直接决定「能跑多大数据、能跑多快」,因此直接反向塑造研究问题:

  • MuJoCo [Todorov, DeepMind 2022 开源]:C 引擎,接触动力学最精确,API 优雅,是学术 manipulation 的事实标准(Gymnasium-Robotics、RoboSuite、LIBERO、ALOHA Sim 全在它上面)。MJX/Warp 后端把并行推到 GPU 级(官方称 RTX 4090 上 locomotion 比 MuJoCo CPU 快 152 倍)。缺点:渲染简陋,GPU 并行起步晚。
  • Isaac Gym [Makoviychuk 2021, arxiv:2108.10470]:第一个大规模 GPU 并行机器人 RL 仿真器,催生了 ANYmal/Go1 一代 sim-to-real 工作。但已被官方 deprecated——文献里仍大量引用,代码归档。
  • Isaac Lab [Mittal 2025, arxiv:2511.04831](原 Orbit):Isaac Gym 官方继任者,GPU 原生并行 RL 框架,配 RSL-RL、unitree_rl_lab,是当前四足/人形 locomotion 事实标准。生态最完整:USD 资产、Unitree H1/G1 官方支持、与 GR00T、Isaac Replicator 整合。缺点:依赖 NVIDIA 硬件、上手较重。
  • Genesis [CMU 2024 末]:纯 Python(Taichi 编译到 CUDA),主打「生成式通用物理引擎」——多物理统一(刚体/软体/MPM/流体)+ 生成式数据管线。官方宣称单 RTX4090 跑 Franka 达 43M FPS、比 Isaac/MJX 快 10-80 倍。独立 benchmark [Stone Tao 2024] 实测:简单场景(仅机械臂自碰撞)确实达 43M FPS,但加随机动作降到 27M FPS,复杂接触场景比宣称慢 3-10 倍;且官方「10-80 倍」是对比 Isaac Sim 而非 MuJoCo MJX(一个常见误读)。生态和稳定性仍在追赶前两者。

为什么仿真器选型 = 研究节奏:做四足/人形 locomotion,Isaac Lab 是默认(GPU 并行 + Unitree 官方支持),一夜跑完几千 env;做精确接触 manipulation,MuJoCo 不可替代;要极致速度做大规模合成数据,Genesis 是新选项。选错仿真器可能让一个 idea 多花半年。

转折 6 · 合成数据 pipeline:从手工建场景到 LLM/world model 生成

  • NVIDIA Isaac Replicator(2022):Isaac Sim 内置的程序化合成数据生成框架,支持域随机化、物理精确渲染,已生成 270 万张标注图。属于「写脚本批量生成场景」阶段。
  • MimicGen [Mandlekar 2023, arxiv:2310.17596] / DexMimicGen [2024]:从少量人手 demo 自动合成不同位姿/场景的海量轨迹(DexMimicGen 用 60 个源 demo 生成 20k+ 双臂灵巧手轨迹)。是「程序化轨迹扩增」路线。
  • GR00T Mimic / GR00T-Dreams(2025):范式升级——用 3D 生成基础模型 扩展场景、用 Cosmos world foundation model 从单张图 + 语言生成完整轨迹。NVIDIA 称 GR00T N1.5 用这条 pipeline 36 小时训完。这是「生成式数据」阶段:不再需要人手建场景或采 demo,world model 直接「想象」出新场景和新轨迹。
  • 范式意义:合成数据 pipeline 是 NVIDIA 把整个「物理 AI」栈绑死的核心——Cosmos 出场景,Isaac Sim/Lab 跑物理,GR00T Mimic/Dreams 出轨迹,GR00T N1/N1.5 吃数据。这是当前「合成数据能否补上数据瓶颈」争论的主战场。

转折 7 · SimplerEnv:仿真评测对齐真机

  • 前作缺陷:真机评测昂贵、不可复现、不可横向比较。同一策略在不同实验室的真机上分数差几个数量级是常态。OpenX 之后有了公共数据,但没有公共评测——策略好坏没法比。
  • 核心机制:SimplerEnv [Li 2024, arxiv:2405.05941] 用两层技巧让仿真评测逼近真机评测:(1) Visual matching——把仿真的背景/光照/物体纹理对齐到真实数据集(如 RT-1 的 Google Robot 场景);(2) System identification——标定仿真机器人的动力学参数(摩擦、控制增益)匹配真机。这两层合起来叫 MMRV(Manipulation policy evaluation in matched sim)
  • sim-real 相关性证据:论文报告 Spearman 排序相关——不同 VLA(RT-1、RT-1-X、Octo、OpenVLA)在 SimplerEnv 里的相对排名与在真机评测里的相对排名强相关。也就是说,虽然绝对分数仍有 gap,但「哪个模型更好」的排序被仿真保住了。一个有趣的额外发现:RT-1-X 对仿真机械臂纹理变化比其他 OXE 训练的模型更鲁棒——这反过来揭示了不同 VLA 的泛化特性。
  • 意义与边界:这是 OpenX 之后评测层的必然补完——有了公共数据,就要有公共评测。但 SimplerEnv 只覆盖 Google Robot / WidowX / Franka 几个本体,长尾任务和高动力学任务(locomotion、灵巧)的 sim-real 相关性仍弱。它解决的是「排序」问题,不是「绝对分数」问题

💡 核心洞察:SimplerEnv 用 visual matching + system identification 让仿真评测保住「相对排序」而非「绝对分数」——这把「不可复现的真机评测」降级为「可信排序的仿真评测」,本质是承认 sim-real gap 不可消除、但可绕过。


四、相似概念辨析

概念 A概念 B区别何时用哪个
数据集(dataset)benchmark数据集是训练/评测的原料(OpenX、DROID);benchmark 是标准化的评测协议+任务集(CALVIN、LIBERO),往往含小量 demo 但重在 eval 协议训练 → 数据集;横向比较策略 → benchmark。两者常耦合(LIBERO 自带 demo + eval)
benchmark仿真器(simulator)benchmark 跑在仿真器上(LIBERO on MuJoCo/RoboSuite,HumanoidBench on MuJoCo,Isaac Lab 自带任务);仿真器是底层物理引擎选仿真器看动力学/速度需求;选 benchmark 看要评测什么能力
真实数据仿真数据真实数据分布无 gap、可信度高,但采集成本极高(单 demo ~$100-400)且场景受限;仿真数据可无限生成、可自动标注、支持域随机化,但有 sim-to-real gap当前主流:仿真预训练/扩增 + 真实数据微调,或真实遥操作 + MimicGen 式扩增
跨本体(架构跨本体)跨本体(数据格式跨本体)OpenX 解决的是数据格式跨本体(RLDS 统一 + 7+1 维 EE 归一化);模型架构是否跨本体是另一回事(RT-2-X 架构本身不区分本体,但 Octo 用 per-embodiment action head)「跨本体」三个字必须分清指哪层——格式统一是基础,架构统一是目标
程序化合成(Replicator/MimicGen)生成式合成(GR00T-Dreams/Cosmos)程序化 = 写脚本批量变体;生成式 = world model/3D 基础模型从极少输入「想象」新场景/轨迹程序化成熟可控但覆盖窄;生成式覆盖广但质量/物理一致性待验证

五、与其他线索的交叉点

  • 与 [T04 motion prior]:AMASS 是 motion prior / BFM 路线的数据基石。T02 提供「统一动捕数据」,T04 解决「怎么把它蒸馏成 motor foundation」。BFM 之所以可能,是因为 AMASS 把 15 个动捕集统一了。
  • 与 [T06 VLA 五段]:OpenX 是 RT-X 的训练数据,也是 Octo/OpenVLA/π0 的预训练底座。T06 是「算法侧怎么吃 OpenX」,T02 是「OpenX 这层基础设施怎么来的」。两者在 OpenX 这个节点强耦合——T02 讲工程统一,T06 讲算法范式。
  • 与 [T09 world model]:world model 当数据源(1X WM、Cosmos)和当仿真器是 T02 合成数据 pipeline 的下一代——GR00T-Dreams 本质就是「用 Cosmos world model 当数据源」。合成数据能否补上瓶颈,很大程度取决于 world model 路线(T09)成熟度。
  • 与 [T11 灵巧操作]:DexMimicGen 是灵巧手数据规模化的关键工具(60 源 demo → 20k 轨迹),直接决定灵巧 VLA 能否训起来。ACE/外骨骼遥操作则是灵巧手真机数据的采集侧。
  • 与 [T07 人形 teleop]:遥操作系统(Open-TeleVision、ACE、ALOHA)是真机数据的采集基础设施;RoboMIND 是国内首个统一平台多本体遥操作集。T02 的真机数据层一半来自 T07 的遥操作栈。

六、当前局限与开放问题

  1. 数据规模差 4-5 个数量级(最尖锐)。OpenX 1M 轨迹 vs LLM 几十 T token,差 4-5 个数量级。合成数据能补多少?GR00T Mimic/Dreams + Cosmos 给了「从单图生成轨迹」的能力,但合成数据的物理一致性(world model 会不会「幻觉」出不合法轨迹)、分布覆盖(能否覆盖真实长尾)都未充分验证。判断:合成数据能补「量」但不能完全补「质」——它最适合做预训练的广度覆盖(让 VLA 见过更多场景),但精细技能仍需真机遥操作数据。最可能胜出的是「合成预训练 + 真实微调」的混合,而非纯合成。这也呼应了 T09 里 world model 当数据源的局限(1X WM 会「幻觉成功」)。
  2. 数据质量 vs 数量。DROID 的小而精(76k 高质量统一 Franka)vs OpenX 的大而杂(1M 异构)。当前实证是两者都要(co-train),但「杂」数据是否在稀释「精」数据仍无定论。OpenX 内部各子集质量差异巨大,不少子集实际只在特定 VLA 上有正向贡献。这个问题等价于 LLM 时代的「数据配比/课程」问题,机器人版还没人系统研究。
  3. sim-to-real 评测能走多远。SimplerEnv 证明了「排序相关」,但只在低动力学 manipulation 上。locomotion、灵巧、长程任务的 sim-real 相关性仍弱。The Colosseum [Jiang 2024, arxiv:2402.08191] 的结论更悲观:在 14 轴扰动下,SOTA 模型成功率下降 30-50%——说明泛化评测还远没饱和(待核:Colosseum 具体数字未在 KB 中录入)。判断:SimplerEnv 思路在 manipulation 上能走很远(已成为 OXE 系 VLA 标准复现),但要推广到 locomotion/灵巧,需要新的 visual matching + dynamics identification 技术。
  4. 跨本体的真正上限。OpenX 证明跨本体正向迁移成立,但跨本体 + 跨任务 + 新本体 zero-shot 仍弱于专门微调。7+1 维 EE 表示是「loosely aligned」,高 DoF 本体(人形全身、灵巧手)塞进去信息损失大。判断:EE 空间统一是务实折衷,长期可能要走向「统一 latent action 空间」(如 π0 的 action expert 输出)而非统一 EE 维度。
  5. 长尾任务的数据获取。高频接触、可变形物体、工具使用这类长尾,遥操作采不动、仿真做不准、合成数据生成不出。这是「大数据预训练」范式最脆弱的地方——它擅长分布中央,不擅长尾。
  6. 格式统一 vs 物理统一的不对等。OpenX 解决了格式统一,但 22 本体的物理参数(质量、摩擦、控制频率)仍各异,「格式通了不等于物理通了」。下一代基础设施可能要把物理参数也标准化进数据集 schema。

📌 关键要点

  1. 过去三年机器人范式跃迁,一半功劳属于基础设施层(数据 + 仿真 + 评测)而非算法层——AMASS / OpenX / Isaac Lab 是与算法突破同等重要的转折点
  2. OpenX / RT-X 是机器人学的「ImageNet 时刻」:22 本体 RLDS 统一 + RT-2-X 在 Google Robot 上 emergent skill 提升 3 倍,首次定量证明跨本体正向迁移成立
  3. AMASS 之于人形运动等于 ImageNet 之于视觉——统一 SMPL 表示让 PHC / UHC / BFM 等 motor foundation 成为可能
  4. DROID 与 OpenX 代表真机数据的两条哲学:广度靠联合(OpenX 22 本体)vs 深度靠标定(DROID 单 Franka 564 场景),当前主流是 co-train
  5. 合成数据 pipeline(GR00T Mimic / GR00T-Dreams / Cosmos)是「数据瓶颈能否被补上」的主战场,但只能补量不能完全补质——最可能胜出的是「合成预训练 + 真实遥操作微调」
  6. 数据集正在演化为 data engine:AXIS 把浏览器采集、自动扩任务、质量控制和留出评测闭成一条可增长流水线;下一轮竞争不仅是数据量,也是谁能更快、可控地补齐缺口

七、涉及里程碑论文与基础设施

  • [Dasari 2019, arxiv:1910.11215] RoboNet —— 早期跨本体视频数据库,OpenX 的精神先驱
  • [Mahmood 2019, ICCV] AMASS —— 15 个动捕集统一为 SMPL,motion prior 路线的数据基石
  • [Makoviychuk 2021, arxiv:2108.10470] Isaac Gym —— 首个大规模 GPU 并行机器人 RL 仿真器(已 deprecated,继任 Isaac Lab)
  • [Walke 2023, arxiv:2308.12952] BridgeData V2 —— 低成本标准化真机采集范式,60k WidowX 轨迹
  • [OpenX Collaboration 2023, arxiv:2310.08864] Open X-Embodiment / RT-X —— 22 本体 RLDS 统一,跨本体正向迁移证据,机器人 ImageNet 时刻(详见 P-OpenX-2023.md
  • [Mandlekar 2023, arxiv:2310.17596] MimicGen —— 自动化操作数据生成框架
  • [Li 2024, arxiv:2405.05941] SimplerEnv —— 仿真评测与真机强相关(visual matching + system ID)
  • [Khazatsky 2024, arxiv:2403.12945] DROID —— 76k in-the-wild Franka 轨迹,单本体高质量极
  • [Mittal 2025, arxiv:2511.04831] Isaac Lab —— Isaac Gym 官方继任者,locomotion 事实标准栈
  • [Genesis 2024, arXiv:Genesis] Genesis —— 纯 Python 生成式物理引擎,主打 data engine 愿景(独立 benchmark 见 [Stone Tao 2024])
  • [Jiang 2024, arxiv:2402.08191] The Colosseum —— 14 轴泛化扰动评测,揭示 SOTA 泛化崩塌
  • [NVIDIA 2025] GR00T Mimic / GR00T-Dreams / Cosmos —— 从程序化合成到生成式合成的范式升级
  • [Bjorck 2025, arxiv:2503.14734] GR00T N1 —— 开源人形 VLA,配套大规模合成数据 pipeline
  • [Cadene 2026, arxiv:2602.22818] LeRobot —— Hugging Face 开源端到端机器人学习库,社区复现 OpenX/DROID 系 VLA 的基础设施
  • [Guo 2026, arxiv:2607.13154] WANDA —— Caltech LeCAR Lab 单 RGBD demo 驱动的合成数据 engine,面向开放世界移动操作
  • [Zhao et al. 2026, arxiv:2607.21588] AXIS —— 浏览器遥操 + 自动任务生成/质检/增强 + 留出评测的可增长操作数据 engine,207 任务、50K+ 轨迹

八、参考文献与延伸阅读

  • 本仓库内的相关论文笔记:P-OpenX-2023.md(OpenX 工程统一机制 + scaling 证据)
  • 本仓库内的相关线索:T04 Motion Prior(AMASS 的下游消费者)、T06 VLA 五段演进(OpenX 是 VLA 数据基石)、T09 World Model 作模拟器(world model 当数据源/合成数据下一代)、T11 灵巧操作(DexMimicGen 灵巧数据)
  • 外部:OpenX 项目页 robotics-transformer-x.github.io;DROID 项目页 droid-dataset.github.io;AMASS 项目页 amass.is.tue.mpg.de;SimplerEnv 项目页 simpler-env.github.io;Isaac Lab 文档 isaac-sim.github.io/IsaacLab;Genesis 仓库 github.com/Genesis-Embodied-AI/genesis-world;Stone Tao Genesis 独立 benchmark stoneztao.substack.com;NVIDIA GR00T Mimic 博客 developer.nvidia.com/blog/building-a-synthetic-motion-generation-pipeline-for-humanoid-robot-learning

可选复盘:常见误区

澄清:"数据多就够了" —— 错。早期最大的数据集格式私有、动作空间不统一,混在一起没人敢训。"不可组合"比"少"更致命。

"数据多就够了" —— 错。早期最大的数据集格式私有、动作空间不统一,混在一起没人敢训。"不可组合"比"少"更致命。

统一格式比单纯堆量更关键,它是scaling 的前提。

澄清:"跨本体就是模型架构跨本体" —— 混淆了两层。那次大联合解决的是数据格式跨本体(通用容器 + 七维动作);模型架构是否跨本体是另一回事。

"跨本体就是模型架构跨本体" —— 混淆了两层。那次大联合解决的是数据格式跨本体(通用容器 + 七维动作);模型架构是否跨本体是另一回事。

"跨本体"三个字必须分清指数据层还是模型层。

澄清:"仿真评测能完全替代真机评测" —— 过头。仿真评测对齐那套只保住"谁更好的排名",绝对分数仍有缝;而且只覆盖低动力学操作 。

"仿真评测能完全替代真机评测" —— 过头。仿真评测对齐那套只保住"谁更好的排名",绝对分数仍有缝;而且只覆盖低动力学操作 📎

它解决的是"排序"问题,不是"绝对分数"问题。

可选复盘:检查点

Q1

用"公共图书馆"类比,向没学过机器人的朋友解释:为什么机器人研究在 2022 年前很难做"大数据预训练"?

查看参考答案
  • 核心:2022 年前机器人数据是'每个组用自己的机器、自己拍、写成自己的格式',格式不通、本体不通、连自己都复现不了。
  • 类比锚:没有公共图书馆,家家自己家教、各教各的,谁也借不到别家的书——数据不可组合。
  • 结论:所以模型没法跨本体复用、结论没法横向比较,'大数据预训练'这门进不来。瓶颈在'不可组合'而非单纯'少'。
Q2

跨本体大联合的"通用容器",为什么不直接强制所有机器人的动作维度都一样?

查看参考答案
  • 原因:22 种本体的动作空间、相机数、观测维度差异巨大,硬统一会强行丢信息、且有些本体根本塞不进同一个维度。
  • 通用容器的做法:不强制维度一致,只规定'一段轨迹 = 一串步,每步含观测、动作、奖励、语言'这个嵌套结构;每种机器人在元数据里声明自己的维度。
  • 意义:给一个抽象容器让异构数据共存,而不是把所有本体压成一个模子。
Q3

"粗对齐"是什么意思?同一个动作向量,在不同机器人身上会发生什么?

查看参考答案
  • 粗对齐:所有动作都塞进一个七维表示(手在空间哪、朝向哪、夹爪开不开),各自先归一化。
  • 同一个动作向量在不同机器人身上诱发完全不同的运动——只是'松散对齐',不是精确对齐。
  • 为什么仍要这么做:粗糙但够用,让大杂烩数据能一起训;精确对齐在 22 种本体上不现实。
Q4

合成数据从"手写脚本"升级到"世界模型生成",分别解决了什么?后者又可能带来什么新风险?

查看参考答案
  • 手写脚本批量造场景:解决了'要人工一个个建场景'的成本,能程序化批量变体。
  • 世界模型生成:进一步解决了'要人采演示、人建场景'——从单图加语言就能想象出新场景和新轨迹,覆盖更广。
  • 新风险:世界模型可能'幻觉'出物理上不合法的轨迹(看着像、实际不遵守物理),分布覆盖的真伪未充分验证。
Q5

仿真评测对齐真机(把背景和参数调到贴近真机)保住的是什么、保不住什么?

查看参考答案
  • 保住的是'谁更好的排名':不同策略在仿真里的相对名次,和真机评测里的相对名次强相关(排序相关)。
  • 保不住的是'绝对分数':仿真和真机之间仍有 gap,绝对成功率对不上。
  • 边界:目前只在低动力学桌面操作上成立,locomotion、灵巧、长程任务的仿真-真机相关性仍弱。

可选复盘:FAQ

Q1:机器人数据集比语言模型数据小多少?能补上吗?

差四到五个数量级。合成数据能补"量",但物理一致性(世界模型会不会"幻觉"出不合法轨迹)还没充分验证。最可能胜出的是"合成预训练 + 真实微调"的混合 📎

Q2:跨本体数据混在一起训,会不会"杂数据"稀释"精数据"?

当前实证是两者都要(联合训练),但"杂是否稀释精"仍无定论。这等价于语言模型的"数据配比"问题,机器人版还没人系统研究 📎

Q3:仿真评测和真机评测,到底能有多相关?

在低动力学桌面操作上,排序强相关(谁更好对得上)。但locomotion、灵巧、长程任务的仿真-真机相关性仍弱 📎