深度⏱ ~2 min
枢纽
⭐ 为何重要

由 21 家机构联合、汇聚 22 种机器人形态的跨本体大规模机器人操作数据集(>1M 轨迹)及配套 RT-X 模型。是 VLA 时代事实上的'ImageNet',定义了数据规模与本体多样性的标准,显著提升了跨形态与跨场景的泛化能力。它的开放让 VLA 训练从单实验室垄断走向社区共建。

机器人22 种本体(Franka/X-arm/Everyday Robots/KUKA 等)
数据集Open X-Embodiment dataset (>1M traj)
上真机
实时
输入模态vision,language,proprioception
📍 演进位置
建立在

论文:Open X-Embodiment Collaboration(Google DeepMind 牵头,21 家机构联合,含 Stanford、Berkeley、MIT、TRI、ETH 等)。Open X-Embodiment: Robotic Learning Datasets and RT-X Models. ICRA 2024 Best Paper,arXiv:2310.08864, 2023。🌐

一句话直觉

把全社区机器人数据汇成一个公共数据库。一份格式接所有机器人。📎好比 ImageNet 之于图像识别。但比 ImageNet 异构得多:60+ 数据集,动作/标签都不统一。一座公共训练场,谁都能来练。

是什么·为什么

要解决的问题:让跨实验室、跨机器人的数据能共享和复用。📎

老办法的痛点:2023 年中之前每个实验室各搞一套。📎用自己的机器人、自己的数据格式、自己的动作维度。A 组训练的策略 B 组加载不了。跨本体复用几乎不可能。RT-1、RT-2 虽然强,但都是 Google 自己的机器人,数据不开放。

这篇的转身:21 家机构联合整理数据。22 种机器人、六十多个原始数据集、上百万条真机轨迹,统一成同一种格式。📎更关键的是给出了跨本体训练有正向迁移的定量证据。RT-1-X 平均成功率比 RT-1 高 50%。RT-2-X 在新技能上比 RT-2 强 3 倍。📎

一句话类比:OpenX 之于机器人数据,像 ImageNet 之于图像识别。但比 ImageNet 异构得多。它是 60+ 数据集的 loose federation。动作/标签/质量都不统一。一座公共训练场,谁都能来练。

怎么做

核心机制:工程意义大于算法意义。算法上 RT-1-X / RT-2-X 就是把原 RT-1 / RT-2 拿来在更大的 OpenX 数据上重训。真正难的是把 22 个本体的异构数据统一成可训练的一个数据集。📎

RLDS episode 格式统一(§III.A):把 60 个已有机器人数据集汇聚成统一的 RLDS 格式。这些数据集来自 34 个 robotic research labs。📎RLDS 把数据存成 serialized tfrecord。结构是 episode 套 step。配套的 oxe_dataset_configs 为每个子集定义字段映射和归一化统计。下游训练只需写一份 dataloader。不再为每个数据集单独写适配代码——这是工程上的核心贡献。

动作空间统一·coarsely aligned(§IV.A):所有动作映射到一个 7 维末端执行器(end-effector)action vector。三个位置 + 三个姿态 + 1 个夹爪开合。可以表示绝对位姿或速率/增量。📎每个维度(共 8 维 = 7 EE + 1 终止)独立均匀切 256 个 bin 离散化。模型输出 token 就像输出 8 个 vocab=256 的 word。📎推理时按本体 de-normalize 回各自物理量——这是同一模型跨本体的核心机制。注意:论文明确不对齐各 dataset 的 EE 坐标系,允许绝对/相对位置/速度并存。原话:同一 action vector 在不同机器人上可能诱导非常不同的运动。

RT-1-X / RT-2-X

  • RT-1:35M 参数 transformer-based。输入 15 帧 image history + 自然语言 instruction。每张图过 ImageNet-pretrained EfficientNet。instruction 过 USE embedding。FiLM 融合成 81 个 vision-language token。喂 decoder-only Transformer 输出离散 action。原架构无修改,只是在 OpenX 数据上重训成 RT-1-X。📎
  • RT-2-X:基于 RT-2-PaLI-X 变体(ViT 视觉 + UL2 语言,WebLI 预训练)。action token 当作"另一种语言文本"co-fine-tune。模型架构本身不区分本体。视觉/语言表征跨本体共享,只有 action head 最后一层在推理时按本体 de-normalize。📎

评测协议(§V):3600 个真机 evaluation trials,跨 6 个不同机器人。对比"OpenX 混合训练"vs"只在本体自己数据上训练的原版"。实验实际用的是 9 个 manipulator 的子集。比 OpenX 全集 22 个少,因为实验时数据集仍在扩展。📎

常见误区(先抛一个):觉得"跨本体混合训练会互相干扰"。OpenX 在聚合指标上证明了跨本体共训的正向迁移(未在子集级排除局部干扰)。RT-1-X 平均成功率比原方法高 50%。📎机制:VLM 的视觉/语言表征("杯子""红色""抓"这些概念)跨本体完全共享。单一 action head 也共享。本体差异只在推理时按本体逐维 de-normalize(标量重缩放),并无专门的本体 action 层。混数据训练时,本体 A 的数据实际上在帮本体 B 学视觉和语义。

深度

统计数字(PDF 原文,§III.A + Abstract):

  • 22 个 robot embodiments(单臂 / 双臂 / 四足都有)
  • 来自 21 个 institutions(不是 22 家机构——常被误引)
  • 60 个原始 robot datasets(来自 34 个 labs)
  • 1M+ real robot trajectories
  • 527 个 skills / 160,266 个 tasks(skill 和 task 粒度不同,skill 数是用 PaLM 从 language instruction 抽出来的行为类别)
  • Franka 是子数据集数最多的 embodiment(Fig. 2(a)),场景多样性也最高(Fig. 2(b) 原话 "the Franka robot has the largest diversity in visually distinct scenes");但轨迹数最多的是 xArm 和 Google Robot(Fig. 2(c) 原话 "xArm and Google Robot contribute the most number of trajectories due to a few large datasets")——Franka 在轨迹数上并不 dominate

📎

RLDS 标准 schema(论文未列字段,参考 RLDS spec [119] + 社区事实标准):


# 每个 dataset 是一个 tfrecord-backed tf.data.Dataset,由 episode 组成
Episode = {
    'steps': Step[()],          # 每步一个 transition
    'language_instruction': ...  # 可选的 episode 级 instruction
}
Step = {
    'observation': {
        'image':           uint8[H, W, C],   # RGB(可多视角)
        'state/end_effector': ...,           # 本体相关 low-dim 状态
    },
    'action': ...,                          # 原生动作(joints / EE pose / velocity)
    'reward':       float32,                # 大多 demo 数据为 0/稀疏
    'is_terminal':  bool,
    'is_first':     bool,
    'is_last':      bool,
    'language_instruction': string,
}

动作空间统一的数学(§IV.A):所有动作映射到 7-dim EE action vector $\Delta=(x, y, z, \text{roll}, \text{pitch}, \text{yaw}, \text{gripper})$,可表示绝对位姿或速率/增量。论文 §IV.A 原话:"predicts a 7-dimensional action vector controlling the end-effector (x, y, z, roll, pitch, yaw, and gripper opening or the rates of these quantities)"。每个维度(共 8 维 = 7 EE + 1 终止)独立均匀切 256 个 bin 离散化(§IV.B 原话 "256 bins uniformly distributed along each of eight dimensions; one dimension for terminating the episode and seven dimensions for end-effector movement")。per-dataset 转换 + 归一化:模型输出同一组 256-bin 离散值,但推理时按本体 de-normalize 回各自物理量——"an output of the model can be interpreted (de-normalized) differently depending on the embodiment"。不强行对齐坐标系:论文明确对齐各 dataset 的 EE 坐标系,允许绝对/相对位置/速度并存——"the same action vector may induce very different motions for different robots"。对齐是 coarsely 的,不是数学上精确的——论文坦承这一点,但实验证明够用。

跨本体正向迁移的定量证据(最关键):

  • RT-1-X 平均成功率比 Original Method 和 RT-1 高 50%(§V.A,Fig. 4 caption 原话 "RT-1-X mean success rate is 50% higher than that of either the Original Method or RT-1")——⚠️ 但这个 50% 专门指 5 个小数据 domain(Kitchen Manipulation / Cable Routing / NYU Door Opening / AUTOLab UR5 / Robot Play,RT-1-X 在其中 4/5 上超越 Original Method)。📎Bridge 不是小数据 domain——它是大规模 domain(Table I),RT-1-X 在 Bridge 上实际欠拟合:WidowX 上 RT-1-X 仅 27%(Stanford IRIS)/ 27%(UCB RAIL),低于只训 Bridge 的 RT-1 的 40% / 30%;而 Original Method(LCBC)13%→RT-1 40% 这条提升是 RT-1 自己,不是 RT-1-X。要让大规模 domain 也获益必须升到 RT-2-X 55B(Bridge Stanford 50% / UCB 30% / Google Robot 6 项 skill 91%,见 Table I)。📎RT-1-X 和 RT-1 网络架构完全相同,小数据 domain 的性能提升全部归因于 co-training with OpenX。
  • RT-2-X 在 emergent skill 评测上比 RT-2 提升 ~3×(§V.B,Table II 行 (1)(2),"RT-2-X outperforms RT-2 by ~3×":RT-2 27.3% → RT-2-X 75.8%)——而且这些 skill 是原 RT-2 训练数据里根本没有的(来自 Bridge 数据集的 WidowX 任务,但用 Google Robot 评测)。📎注意别把迁移因果独绑到 Bridge 一源:Table II 行 (3) 显示 RT-2-X 训练时去掉 Bridge 仍有 42.8% emergent,远超 RT-2 的 27.3%。Bridge 贡献一部分(75.8 vs 42.8),但去掉它照样有强迁移——跨本体迁移是群体效应,不止 Bridge 一源。

OpenX 在聚合指标上证明了「不同本体动作空间混合训练有正向迁移」(未在子集级排除局部干扰)。机制解释:VLM 的视觉/语言表征(「杯子」「红色」「抓」这些概念)跨本体完全共享,单一 action head 也共享——本体差异只在推理时按本体逐维 de-normalize(标量重缩放),并无专门的本体 action 层。混数据训练时,本体 A 的数据实际上在帮本体 B 学视觉和语义。这是跨本体 scaling law 成立的理论基础。

实验设置细节(§V):

  • 3600 trials × 6 robots 真机评测,分两类场景:
  • 小规模数据 domain(Fig. 4):期望从大数据库 transfer 显著提升。
  • 大规模数据 domain(如 Bridge、Google Robot 原 RT-1 数据):原方法已强,看 OpenX 能否再加成(Table I)。
  • Robotics mixture(§IV.C):实验实际用的是 9 个 manipulator 的子集(列出 12 个数据集:RT-1, QT-Opt, Bridge, Task Agnostic Robot Play, Jaco Play, Cable Routing, RoboTurk, NYU VINN, Austin VIOLA, Berkeley Autolab UR5, TOTO, Language Table——多个数据集共享同一机型,故 12 数据集落在 9 个 manipulator 平台上)——比 OpenX 全集 22 个少,因为实验时数据集仍在扩展。

RT-1 架构细节(以下数字转述自 RT-1 原文 [Brohan 2022, arxiv:2212.06817],OpenX 论文 Sec.IV.B 复用):35M 参数 transformer-based。输入 15 帧 image history + 自然语言 instruction。每张图过 ImageNet-pretrained EfficientNet,instruction 过 USE (Universal Sentence Encoder) embedding,FiLM 融合成 81 个 vision-language token,喂给 decoder-only Transformer 输出离散 action。控制频率 3 Hz(Google Robot)。📎🌐

RT-2-X 训练细节:基于 RT-2-PaLI-X 变体(ViT 视觉 + UL2 语言,WebLI 预训练),action token 当作"另一种语言文本"co-fine-tune(如 "1 128 91 241 5 101 127")。训练用 ~1:1 的 VLM web 数据 + robotics 数据 mixture co-fine-tune。控制频率 10 Hz(WidowX)/ 5 Hz(其他)。📎

局限

  1. 跨本体是「loosely aligned」,不是精确统一。7+1 维 EE 表示对高 DoF 本体(人形全身、灵巧手)信息损失大;双臂投影、四足近似映射都是折衷。这限制了 OpenX 在灵巧/全身任务上的效用。
  2. 数据质量异构。60+ 子集质量差异巨大,不少子集实际只在特定 VLA 上有正向贡献,「杂」数据是否在稀释「精」数据未充分研究。
  3. 规模仍比 LLM 少 4-5 个数量级。1M 轨迹 vs 几十 T token。OpenX 证明了跨本体 scaling 成立,但没给出 scaling law 的形状(数据翻倍收益多少)——这部分后来由 RT-X 的 follow-up 和 OpenVLA 的消融补了一点。
  4. 格式统一 ≠ 物理统一。22 本体的物理参数(质量、摩擦、控制频率)仍各异。格式通了不等于物理通了。
  5. 机构数表述的歧义。⚠️ PDF 明确写「22 robot embodiments from 21 institutions」(Abstract + §III),不是「22 家机构」。常被外部引用误写为「22 家机构 22 本体」——引用时建议以 arXiv 论文原文为准。

研究者视角

图谱定位:OpenX 是 T02 数据集基础设施演化的范式转折点,与 T06 VLA 第四段交叉。📎它把机器人学从"每个组用自己的数据"推进到"社区有公共数据基准"——是机器人学的「公共数据池」时刻(但比 ImageNet 异构得多:60+ 数据集、动作/标签/质量都不统一,且未统一真机评测,SimplerEnv 是后补的)。后续所有开源 VLA(Octo、OpenVLA、π0、RDT-1B)都在 OpenX 上预训练——没有 OpenX,开源 VLA 不可能在两年内做到今天的水平。它把 NLP/CV 的「大数据预训练」范式正式移植进机器人。

建立在:RT-1 [Brohan 2022]、RT-2 [Brohan 2023](架构)、BridgeData V2 [Walke 2023]、RoboNet [Dasari 2019](数据精神先驱)。📎

引出(全部以 OpenX 为预训练底座):

  • Octo [2024]:开源通用 VLA。
  • OpenVLA [Kim 2024]:开源 VLA,基于 OpenX 预训练。
  • π0 [Black 2024]:Physical Intelligence 的 VLA。
  • RDT-1B [Liu 2024]:1B 参数开源 VLA。
  • SimplerEnv:OpenX 系 VLA 的标准仿真评测,避免真机评测不可复现。
  • DROID [Khazatsky 2024]:单本体高质量的互补极(与 OpenX 跨本体多源互补)。

[未确认]

副产品·RLDS + per-dataset config 工程范式:成为后续数据集的默认规范。DROID、RoboMIND、ShareRobot 都提供 OpenX/RLDS 兼容接口。这降低了跨组复用的边际成本到接近零。[未确认]

Open problems

  1. scaling law 的形状:OpenX 证明跨本体 scaling 成立,但没给"数据翻倍收益多少"。这部分由 RT-X follow-up 和 OpenVLA 的消融补了一点,仍未完整刻画。[未确认]
  2. 数据质量加权:「杂」数据稀释「精」数据的影响未充分研究。如何为不同子集自动分配权重?[未确认]
  3. 物理统一:格式统一 ≠ 物理统一。22 本体的物理参数(质量、摩擦、控制频率)仍各异——如何把物理参数也纳入统一接口?[未确认]
  4. 高 DoF 本体的扩展:7+1 维 EE 对人形全身、灵巧手信息损失大。OpenX 的接口如何扩展到高 DoF?后续工作如 COIN、π0 的 chunking action 是部分回应。[未确认]

常见误区

"22 家机构 + 22 本体" —— 常见误引。PDF 明确写「22 robot embodiments from 21 institutions」(Abstract + §III)。📎

22 个机器人本体来自 21 家机构(不是 22 家)。

"实验用了全部 22 个本体" —— 错。实验实际用的是 9 个 manipulator 的子集(§IV.C),因为实验时数据集仍在扩展。📎

22 是 OpenX 数据集覆盖的本体数,9 是 RT-1-X / RT-2-X 训练实际用的本体数。

"跨本体训练会互相干扰" —— OpenX 在聚合指标上证明了跨本体共训的正向迁移(未在子集级排除局部干扰)。RT-1-X 平均成功率比 RT-1 高 50%,RT-2-X 在 emergent skill 上比 RT-2 强 3 倍。📎

VLM 的视觉/语言表征跨本体共享,单一 action head 也共享——本体差异只在推理时按本体逐维 de-normalize(标量重缩放),并无专门的本体 action 层;混训在聚合指标上有正向迁移。

"7+1 维 EE 是精确的统一动作空间" —— 不准确。论文原话「coarsely aligned」——不对齐坐标系,允许绝对/相对位置/速度并存。📎

是"粗对齐",不是数学上精确的统一;同一 action vector 在不同本体上可能诱导非常不同的运动。

"OpenX 是 Google 一家搞的" —— 错。是 Google DeepMind 牵头、21 家机构(含 Stanford、Berkeley、MIT、TRI、ETH 等)联合的协作产物。📎

多机构联合,开源数据是核心交付物。

检查点

Q1

RT-1-X 和 RT-1 网络架构完全相同。凭什么 RT-1-X 平均成功率比 RT-1 高 50%?(提示:架构没变,那变的是什么?)

💡 参考答案

  • 变的是数据,不是架构。RT-1 只在 Google 自己那一种机器人数据上训;RT-1-X 在 OpenX 统一的跨本体大数据集(22 种机器人、上百万轨迹)上训。
  • 全篇主旨就是统一数据集带来的增益,所以答案=更多更杂的跨本体数据。
Q2

RT-2-X 在 emergent skill 上比 RT-2 强 3 倍。Table II 行 (3) 还显示:训练时去掉 Bridge 数据,RT-2-X 仍有 42.8%,远超 RT-2 的 27.3%。这个消融说明了什么?(提示:跨本体迁移是单源还是群体效应?)

💡 参考答案

  • 去掉 Bridge 仍远超 RT-2(42.8% vs 27.3%),说明跨本体迁移是群体效应——不止 Bridge 一源,其它本体数据也贡献了 emergent skill。
  • Bridge 确实贡献一部分(row2 全量 75.8% vs row3 去 Bridge 42.8%),但单源因果('知识只从 WidowX 流到 Google Robot')被这张表打脸。
  • 结论:跨本体共训的增益来自共享 representation 下多本体的集体贡献,不是任一单数据集的功劳。
Q3

7+1 维 EE action vector 是「coarsely aligned」不是精确统一。论文为什么强行对齐坐标系?如果强行对齐会损失什么?(提示:想想各数据集原本的控制方案。)

💡 参考答案

  • 各家数据集原本的控制方案五花八门:有的记末端位姿、有的记关节角、有的 delta 有的绝对。硬塞进一个坐标系需要不可逆的变换,会丢信息甚至引入错位。
  • Coarse alignment 只把'大致是同一类动作'对上、不动原始控制语义,保住数据可用性。
  • 论文原话:同一 action vector 在不同机器人上可能诱导非常不同的运动——这是'够用就行'的工程妥协。
Q4

OpenX 在聚合指标上证明了跨本体共训有正向迁移。请用 ImageNet 类比解释:为什么"混不同本体的数据训练"反而比"只在本体自己数据上训练"强?

💡 参考答案

  • 类比锚:ImageNet 之于图像识别——公共训练场,谁都能来练。
Q5

OpenX 被叫做机器人学的「公共数据池时刻」,但规模仍比 LLM 少 4-5 个数量级(1M 轨迹 vs 几十 T token)。为什么不能直接把 LLM 那套 scaling law 搬过来?机器人数据 scaling 的特殊难处是什么?

💡 参考答案

  • 文本 token 可以从全网近乎免费地爬,几十万亿 token 摆在那里;机器人轨迹必须真机+真人一条一条采,慢、贵、受硬件束缚,没法靠爬虫放大。
  • 各本体异构、数据不如 token 可互换(同一 action vector 在不同机器人上诱导不同运动),scaling 天然受物理瓶颈卡住。
  • OpenX 证明跨本体 scaling 成立,但没给出 scaling law 的形状(数据翻倍收益多少)。

FAQ

Q1:为什么用 RLDS 不用 HDF5?

RLDS(Reinforcement Learning Datasets)专门为 RL/sequential decision 设计——以 episode → step 嵌套结构存,支持并行化 streaming data loading,所有主流 DL 框架都能直接读。HDF5 是通用数组存储,没有 episode/step 语义,需要额外约定。📎

Q2:我能把自己机器人的数据加进 OpenX 吗?

能。OpenX 是社区共建:按 RLDS schema 整理你的 episode/step,配一个 oxe_dataset_configs 条目说明字段映射 + 归一化统计,提 PR 到 github.com/google-deepmind/open_x_embodiment。🌐

Q3:527 skills 和 160266 tasks 是怎么数的?

skill 数是用 PaLM 从 language instruction 里抽出来的行为类别("pick up cup" / "open drawer" / "push button" 等)。task 数是更细粒度的(instruction + 初始场景的组合)。粒度不同,两个数不能直接比。📎

Q4:为什么 Franka 在 OpenX 数据集里最突出?

因为 Franka 是机器人学界最常用的研究平台之一,多家实验室都用它采集数据——Fig. 2(a) 显示 Franka 子数据集数最多,Fig. 2(b) 显示它的场景多样性最高。但要注意:轨迹数最多的是 xArm 和 Google Robot(Fig. 2(c) 原话 "xArm and Google Robot contribute the most number of trajectories due to a few large datasets"),Franka 在轨迹数上并不 dominate。📎

Q5:RT-1-X 和 RT-2-X 哪个更强?

架构不同不能直接比。RT-1-X 是 35M 参数的 transformer,控制频率 3 Hz;RT-2-X 基于 RT-2-PaLI-X(ViT+UL2),co-fine-tune VLM web 数据 + robotics 数据,控制频率 10 Hz(WidowX)/ 5 Hz(其他)。RT-2-X 在 emergent skill 上更强,因为它继承了 VLM 的语义先验。📎