枢纽
机器人22 种本体(Franka/X-arm/Everyday Robots/KUKA 等)
数据集Open X-Embodiment dataset (>1M traj)
上真机
实时
输入模态vision,language,proprioception

Open X-Embodiment:让机器人学界的「ImageNet 时刻」真的发生

Open X-Embodiment Collaboration(21 家机构,北上伯克利斯坦福东京等全球实验室联合,超 200 位作者)。arXiv:2310.08864,2023 年 10 月。 项目页 · datasetfoundation_models线索 T02

🧠 一句话心智模型:NLP 有 Common Crawl、CV 有 ImageNet/LAION,机器人一直缺一个统一的大数据集——各家数据格式不兼容、机器人形态各异、技能定义五花八门。这篇论文就是机器人版的「大家把数据都拿出来,统一格式,一起训一个能跨机器人用的模型」。结果发现:把多种机器人的数据混在一起训,每个机器人都变得更强了(正迁移)——这正是 CV/NLP 早就在发生、而机器人一直没发生的事。

🎯 为什么重要:机器人学习的"数据壁垒"被打破

RT-1 和 RT-2 已经证明「大模型 + 大数据」可行。但所有数据都来自同一个机构、同一种机器人(Google Robot)。整个领域面临一个碎片化困境:

机器人学习的孤岛困境:全球 30+ 顶级实验室,每个都自己采了几十到几千条数据,用各自的格式、各自的机器人(Franka / WidowX / xArm / Kuka / Sawyer / Stretch ...)、各自的动作空间。无法合并、无法复用。每个新任务都从零开始训练。
对比:NLP 有 1.5B-4.5B token 的语料库,CV 有 5-18M 图像的数据集——机器人最大的努力也只有这规模的零头。

Open X-Embodiment(OXE)就是要解决这个孤岛问题。它做了三件事:

三大贡献
统一数据集:把全球 21 家机构的 60 个数据集汇总成 1 个,统一格式(RLDS)
跨机器人训练实证:用 RT-1 / RT-2 在 9 种机器人数据上混合训练,证明正迁移真的会发生
开源基础设施:数据 + 模型 + 工具链全部开放,让社区能继续做大。

💡 核心思想:统一格式 + 混合训练 = 正迁移

跨机器人训练的核心挑战是异构性——不同机器人观测空间、动作空间、相机视角都不同。OXE 用了一个"粗对齐"的方案:

Google Robot 130k 轨迹 Bridge WidowX QT-Opt Kuka Jaco Play + 5 个 其他数据集 Open X-Embodiment Repository 统一 RLDS 数据格式 22 种机器人 1M+ 真机轨迹 527 skills 160,266 任务 粗对齐:选 1 相机 + 7-DoF 末端动作 RT-1-X 35M 参数 纯机器人数据 co-training RT-2-X (55B) PaLI-X 骨干 机器人 + 互联网 co-fine-tuning 单模型 控制 9 种机器人 Franka WidowX Google Robot UR5 / Kuka ... 每家都变强
图 1:Open X-Embodiment 的整个工作流。把 60 个独立数据集统一成一个,然后在上面训 RT-1-X / RT-2-X,最后用同一个权重控制多种机器人。

🛠️ 让"跨机器人训练"真正起效的 3 个关键设计

设计心智模型为什么必要
① RLDS 统一数据格式所有数据序列化为 tfrecord,统一 schema(observation / action / language)支持异构的相机数(RGB / 深度 / 点云)、动作空间,让 60 个数据集能合并训练。是整个工作的基础设施
② 粗对齐动作/观测空间每数据集选 1 个第三人称相机,归一化到统一分辨率;动作转成 7-DoF 末端执行器(x,y,z,roll,pitch,yaw,gripper)不同机器人动作维度、坐标系、绝对/相对都不同——只做"粗对齐"(不强行对齐坐标帧),让模型自己学会去归一化到各机器人
③ 数据混合权重9 种机器人数据按比例混合;RT-2-X 还要再混互联网 VLM 数据(约 1:1)避免某个大数据集(如 Bridge)压垮小数据集;让小实验室的数据也能贡献
🔮 直觉:为什么"粗对齐"就够了?
不同机器人的相机位姿、坐标系完全不同——同一个 (Δx, Δy, Δz) 在 WidowX 和 Franka 上物理含义差很多。OXE 的洞察是:不用硬对齐,让模型看到「在机器人 A 上,这个 token 序列产生这个观察变化;在机器人 B 上,类似的 token 序列产生类似但不同的变化」——它会自己学到每机器人的去归一化映射。代价是需要足够大的模型容量(见下面 RT-1-X vs RT-2-X 的对比)。

📊 结果:跨机器人训练确实带来正迁移,但模型得够大

3600 次真机评估,跨 6 种机器人。两个最关键的发现:

实验关键发现含义
小数据集场景(Fig.4)RT-1-X 在 5 个数据稀缺领域里 4 个超过 Original Method,平均提升 50%数据稀缺的实验室受益最大——这正是 OXE 最大的价值主张
大数据集场景(Table I)RT-1-X(35M)欠拟合,不如单数据集 RT-1;但 RT-2-X(55B)不再欠拟合——Bridge 上反超 RT-1(50% vs 40%),Google Robot 上追平 RT-1(91% vs 92%)跨机器人训练需要足够大的模型容量才能吸收多样性。RT-1 太小
涌现技能(Table II)RT-2-X 在 Google Robot 上做 Bridge 才有的任务(如某些操纵),3× 优于 RT-2跨机器人知识真的迁移了——Google Robot 学会了 WidowX 数据里的技能

Table II 的关键消融——什么决定了跨机器人训练的效果?

Row模型配置涌现技能泛化
(1) RT-2 55B(单数据集)只 Google Robot27.3%62%
(2) RT-2-X 55B(全数据集)9 种机器人混合75.8%(~3×)61%
(3) RT-2-X 55B(去掉 Bridge)迁移效果消失42.8%54%
(4) RT-2-X 5B + history容量缩小 11×44.4%52%
(6) RT-2-X 5B 无 web 预训练from scratch0%1%
关键洞察:跨机器人训练有三个必要条件——① 模型容量要够大(5B << 55B);② 互联网预训练不可省(无 web 预训练 → 0%);③ 包含目标领域的数据(去掉 Bridge,Bridge 技能就消失)。三者缺一不可。

🌐 在领域中的位置

RT-1(单机器人大数据,证明范式) RT-2(VLM + 单机器人数据,引入世界知识) Open X-Embodiment(多机器人 + 开源数据集)⭐ OpenVLA / Octo(基于 OXE 训的开源 VLA) π0 / RDT-1B(更大规模 OXE 训练)

Open X-Embodiment 是机器人学习的"ImageNet 时刻"。它不只是数据集——它是整个社区开始协作的拐点。之后几乎所有公开 VLA(OpenVLA、Octo、π0、RDT-1B)都建立在 OXE 之上。关联线索:T06 基础模型谱系

❓ 常见误区

为什么 RT-1-X 在大数据集上反而不如单数据集 RT-1?

因为 RT-1 只有 35M 参数,容量不足以同时拟合 9 种机器人的异构数据——出现"欠拟合"。论文明确指出:跨机器人训练需要"足够大的模型容量"。这也是为什么 RT-2-X (55B) 在相同数据上能赢。结论是:数据多样性必须配模型容量

"粗对齐"动作空间会不会损失信息?

会损失一些——比如某些机器人是关节空间控制而非末端控制,强行转末端会丢精度。但 OXE 选择"粗对齐"是为了让 60 个数据集能放在一起训,这是务实取舍。更细的对齐(如按 embodiment 分头)是后续工作的方向。

OXE 数据集够大吗?跟 LAION 比呢?

OXE 是 1M+ 轨迹,远小于 LAION 的数十亿图文。论文也明确承认:当前规模不足以达到 LLM 那种"涌现"水平。但 OXE 的意义是建立协作机制——后续 DROID、π0 数据集等都持续在扩大规模。

OpenX 的数据现在还能用吗?

能。OXE Repository 仍在持续更新(论文发表时 22 种机器人,现在更多),社区可以自由下载、贡献。这是它最大的遗产——一个活的、开放的数据生态