Open X-Embodiment:让机器人学界的「ImageNet 时刻」真的发生
🎯 为什么重要:机器人学习的"数据壁垒"被打破
RT-1 和 RT-2 已经证明「大模型 + 大数据」可行。但所有数据都来自同一个机构、同一种机器人(Google Robot)。整个领域面临一个碎片化困境:
对比:NLP 有 1.5B-4.5B token 的语料库,CV 有 5-18M 图像的数据集——机器人最大的努力也只有这规模的零头。
Open X-Embodiment(OXE)就是要解决这个孤岛问题。它做了三件事:
① 统一数据集:把全球 21 家机构的 60 个数据集汇总成 1 个,统一格式(RLDS);
② 跨机器人训练实证:用 RT-1 / RT-2 在 9 种机器人数据上混合训练,证明正迁移真的会发生;
③ 开源基础设施:数据 + 模型 + 工具链全部开放,让社区能继续做大。
💡 核心思想:统一格式 + 混合训练 = 正迁移
跨机器人训练的核心挑战是异构性——不同机器人观测空间、动作空间、相机视角都不同。OXE 用了一个"粗对齐"的方案:
🛠️ 让"跨机器人训练"真正起效的 3 个关键设计
| 设计 | 心智模型 | 为什么必要 |
|---|---|---|
| ① RLDS 统一数据格式 | 所有数据序列化为 tfrecord,统一 schema(observation / action / language) | 支持异构的相机数(RGB / 深度 / 点云)、动作空间,让 60 个数据集能合并训练。是整个工作的基础设施 |
| ② 粗对齐动作/观测空间 | 每数据集选 1 个第三人称相机,归一化到统一分辨率;动作转成 7-DoF 末端执行器(x,y,z,roll,pitch,yaw,gripper) | 不同机器人动作维度、坐标系、绝对/相对都不同——只做"粗对齐"(不强行对齐坐标帧),让模型自己学会去归一化到各机器人 |
| ③ 数据混合权重 | 9 种机器人数据按比例混合;RT-2-X 还要再混互联网 VLM 数据(约 1:1) | 避免某个大数据集(如 Bridge)压垮小数据集;让小实验室的数据也能贡献 |
不同机器人的相机位姿、坐标系完全不同——同一个 (Δx, Δy, Δz) 在 WidowX 和 Franka 上物理含义差很多。OXE 的洞察是:不用硬对齐,让模型看到「在机器人 A 上,这个 token 序列产生这个观察变化;在机器人 B 上,类似的 token 序列产生类似但不同的变化」——它会自己学到每机器人的去归一化映射。代价是需要足够大的模型容量(见下面 RT-1-X vs RT-2-X 的对比)。
📊 结果:跨机器人训练确实带来正迁移,但模型得够大
3600 次真机评估,跨 6 种机器人。两个最关键的发现:
| 实验 | 关键发现 | 含义 |
|---|---|---|
| 小数据集场景(Fig.4) | RT-1-X 在 5 个数据稀缺领域里 4 个超过 Original Method,平均提升 50% | 数据稀缺的实验室受益最大——这正是 OXE 最大的价值主张 |
| 大数据集场景(Table I) | RT-1-X(35M)欠拟合,不如单数据集 RT-1;但 RT-2-X(55B)不再欠拟合——Bridge 上反超 RT-1(50% vs 40%),Google Robot 上追平 RT-1(91% vs 92%) | 跨机器人训练需要足够大的模型容量才能吸收多样性。RT-1 太小 |
| 涌现技能(Table II) | RT-2-X 在 Google Robot 上做 Bridge 才有的任务(如某些操纵),3× 优于 RT-2 | 跨机器人知识真的迁移了——Google Robot 学会了 WidowX 数据里的技能 |
Table II 的关键消融——什么决定了跨机器人训练的效果?
| Row | 模型配置 | 涌现技能 | 泛化 |
|---|---|---|---|
| (1) RT-2 55B(单数据集) | 只 Google Robot | 27.3% | 62% |
| (2) RT-2-X 55B(全数据集) | 9 种机器人混合 | 75.8%(~3×) | 61% |
| (3) RT-2-X 55B(去掉 Bridge) | 迁移效果消失 | 42.8% | 54% |
| (4) RT-2-X 5B + history | 容量缩小 11× | 44.4% | 52% |
| (6) RT-2-X 5B 无 web 预训练 | from scratch | 0% | 1% |
🌐 在领域中的位置
Open X-Embodiment 是机器人学习的"ImageNet 时刻"。它不只是数据集——它是整个社区开始协作的拐点。之后几乎所有公开 VLA(OpenVLA、Octo、π0、RDT-1B)都建立在 OXE 之上。关联线索:T06 基础模型谱系。
❓ 常见误区
为什么 RT-1-X 在大数据集上反而不如单数据集 RT-1?
因为 RT-1 只有 35M 参数,容量不足以同时拟合 9 种机器人的异构数据——出现"欠拟合"。论文明确指出:跨机器人训练需要"足够大的模型容量"。这也是为什么 RT-2-X (55B) 在相同数据上能赢。结论是:数据多样性必须配模型容量。
"粗对齐"动作空间会不会损失信息?
会损失一些——比如某些机器人是关节空间控制而非末端控制,强行转末端会丢精度。但 OXE 选择"粗对齐"是为了让 60 个数据集能放在一起训,这是务实取舍。更细的对齐(如按 embodiment 分头)是后续工作的方向。
OXE 数据集够大吗?跟 LAION 比呢?
OXE 是 1M+ 轨迹,远小于 LAION 的数十亿图文。论文也明确承认:当前规模不足以达到 LLM 那种"涌现"水平。但 OXE 的意义是建立协作机制——后续 DROID、π0 数据集等都持续在扩大规模。
OpenX 的数据现在还能用吗?
能。OXE Repository 仍在持续更新(论文发表时 22 种机器人,现在更多),社区可以自由下载、贡献。这是它最大的遗产——一个活的、开放的数据生态。