Q1:为什么用 RLDS 不用 HDF5?
RLDS(Reinforcement Learning Datasets)专门为 RL/sequential decision 设计——以 episode → step 嵌套结构存,支持并行化 streaming data loading,所有主流 DL 框架都能直接读。HDF5 是通用数组存储,没有 episode/step 语义,需要额外约定。📎
论文:Open X-Embodiment Collaboration(Google DeepMind 牵头,21 家机构联合,含 Stanford、Berkeley、MIT、TRI、ETH 等)。Open X-Embodiment: Robotic Learning Datasets and RT-X Models. ICRA 2024 Best Paper,arXiv:2310.08864, 2023。🌐
把全社区机器人数据汇成一个公共数据库。一份格式接所有机器人。📎好比 ImageNet 之于图像识别。但比 ImageNet 异构得多:60+ 数据集,动作/标签都不统一。一座公共训练场,谁都能来练。
要解决的问题:让跨实验室、跨机器人的数据能共享和复用。📎
老办法的痛点:2023 年中之前每个实验室各搞一套。📎用自己的机器人、自己的数据格式、自己的动作维度。A 组训练的策略 B 组加载不了。跨本体复用几乎不可能。RT-1、RT-2 虽然强,但都是 Google 自己的机器人,数据不开放。
这篇的转身:21 家机构联合整理数据。22 种机器人、六十多个原始数据集、上百万条真机轨迹,统一成同一种格式。📎更关键的是给出了跨本体训练有正向迁移的定量证据。RT-1-X 平均成功率比 RT-1 高 50%。RT-2-X 在新技能上比 RT-2 强 3 倍。📎
一句话类比:OpenX 之于机器人数据,像 ImageNet 之于图像识别。但比 ImageNet 异构得多。它是 60+ 数据集的 loose federation。动作/标签/质量都不统一。一座公共训练场,谁都能来练。
核心机制:工程意义大于算法意义。算法上 RT-1-X / RT-2-X 就是把原 RT-1 / RT-2 拿来在更大的 OpenX 数据上重训。真正难的是把 22 个本体的异构数据统一成可训练的一个数据集。📎
RLDS episode 格式统一(§III.A):把 60 个已有机器人数据集汇聚成统一的 RLDS 格式。这些数据集来自 34 个 robotic research labs。📎RLDS 把数据存成 serialized tfrecord。结构是 episode 套 step。配套的 oxe_dataset_configs 为每个子集定义字段映射和归一化统计。下游训练只需写一份 dataloader。不再为每个数据集单独写适配代码——这是工程上的核心贡献。
动作空间统一·coarsely aligned(§IV.A):所有动作映射到一个 7 维末端执行器(end-effector)action vector。三个位置 + 三个姿态 + 1 个夹爪开合。可以表示绝对位姿或速率/增量。📎每个维度(共 8 维 = 7 EE + 1 终止)独立均匀切 256 个 bin 离散化。模型输出 token 就像输出 8 个 vocab=256 的 word。📎推理时按本体 de-normalize 回各自物理量——这是同一模型跨本体的核心机制。注意:论文明确不对齐各 dataset 的 EE 坐标系,允许绝对/相对位置/速度并存。原话:同一 action vector 在不同机器人上可能诱导非常不同的运动。
RT-1-X / RT-2-X:
评测协议(§V):3600 个真机 evaluation trials,跨 6 个不同机器人。对比"OpenX 混合训练"vs"只在本体自己数据上训练的原版"。实验实际用的是 9 个 manipulator 的子集。比 OpenX 全集 22 个少,因为实验时数据集仍在扩展。📎
常见误区(先抛一个):觉得"跨本体混合训练会互相干扰"。OpenX 在聚合指标上证明了跨本体共训的正向迁移(未在子集级排除局部干扰)。RT-1-X 平均成功率比原方法高 50%。📎机制:VLM 的视觉/语言表征("杯子""红色""抓"这些概念)跨本体完全共享。单一 action head 也共享。本体差异只在推理时按本体逐维 de-normalize(标量重缩放),并无专门的本体 action 层。混数据训练时,本体 A 的数据实际上在帮本体 B 学视觉和语义。
统计数字(PDF 原文,§III.A + Abstract):
RLDS 标准 schema(论文未列字段,参考 RLDS spec [119] + 社区事实标准):
# 每个 dataset 是一个 tfrecord-backed tf.data.Dataset,由 episode 组成
Episode = {
'steps': Step[()], # 每步一个 transition
'language_instruction': ... # 可选的 episode 级 instruction
}
Step = {
'observation': {
'image': uint8[H, W, C], # RGB(可多视角)
'state/end_effector': ..., # 本体相关 low-dim 状态
},
'action': ..., # 原生动作(joints / EE pose / velocity)
'reward': float32, # 大多 demo 数据为 0/稀疏
'is_terminal': bool,
'is_first': bool,
'is_last': bool,
'language_instruction': string,
}
动作空间统一的数学(§IV.A):所有动作映射到 7-dim EE action vector $\Delta=(x, y, z, \text{roll}, \text{pitch}, \text{yaw}, \text{gripper})$,可表示绝对位姿或速率/增量。论文 §IV.A 原话:"predicts a 7-dimensional action vector controlling the end-effector (x, y, z, roll, pitch, yaw, and gripper opening or the rates of these quantities)"。每个维度(共 8 维 = 7 EE + 1 终止)独立均匀切 256 个 bin 离散化(§IV.B 原话 "256 bins uniformly distributed along each of eight dimensions; one dimension for terminating the episode and seven dimensions for end-effector movement")。per-dataset 转换 + 归一化:模型输出同一组 256-bin 离散值,但推理时按本体 de-normalize 回各自物理量——"an output of the model can be interpreted (de-normalized) differently depending on the embodiment"。不强行对齐坐标系:论文明确不对齐各 dataset 的 EE 坐标系,允许绝对/相对位置/速度并存——"the same action vector may induce very different motions for different robots"。对齐是 coarsely 的,不是数学上精确的——论文坦承这一点,但实验证明够用。
跨本体正向迁移的定量证据(最关键):
OpenX 在聚合指标上证明了「不同本体动作空间混合训练有正向迁移」(未在子集级排除局部干扰)。机制解释:VLM 的视觉/语言表征(「杯子」「红色」「抓」这些概念)跨本体完全共享,单一 action head 也共享——本体差异只在推理时按本体逐维 de-normalize(标量重缩放),并无专门的本体 action 层。混数据训练时,本体 A 的数据实际上在帮本体 B 学视觉和语义。这是跨本体 scaling law 成立的理论基础。
实验设置细节(§V):
RT-1 架构细节(以下数字转述自 RT-1 原文 [Brohan 2022, arxiv:2212.06817],OpenX 论文 Sec.IV.B 复用):35M 参数 transformer-based。输入 15 帧 image history + 自然语言 instruction。每张图过 ImageNet-pretrained EfficientNet,instruction 过 USE (Universal Sentence Encoder) embedding,FiLM 融合成 81 个 vision-language token,喂给 decoder-only Transformer 输出离散 action。控制频率 3 Hz(Google Robot)。📎🌐
RT-2-X 训练细节:基于 RT-2-PaLI-X 变体(ViT 视觉 + UL2 语言,WebLI 预训练),action token 当作"另一种语言文本"co-fine-tune(如 "1 128 91 241 5 101 127")。训练用 ~1:1 的 VLM web 数据 + robotics 数据 mixture co-fine-tune。控制频率 10 Hz(WidowX)/ 5 Hz(其他)。📎
局限:
图谱定位:OpenX 是 T02 数据集基础设施演化的范式转折点,与 T06 VLA 第四段交叉。📎它把机器人学从"每个组用自己的数据"推进到"社区有公共数据基准"——是机器人学的「公共数据池」时刻(但比 ImageNet 异构得多:60+ 数据集、动作/标签/质量都不统一,且未统一真机评测,SimplerEnv 是后补的)。后续所有开源 VLA(Octo、OpenVLA、π0、RDT-1B)都在 OpenX 上预训练——没有 OpenX,开源 VLA 不可能在两年内做到今天的水平。它把 NLP/CV 的「大数据预训练」范式正式移植进机器人。
建立在:RT-1 [Brohan 2022]、RT-2 [Brohan 2023](架构)、BridgeData V2 [Walke 2023]、RoboNet [Dasari 2019](数据精神先驱)。📎
引出(全部以 OpenX 为预训练底座):
[未确认]
副产品·RLDS + per-dataset config 工程范式:成为后续数据集的默认规范。DROID、RoboMIND、ShareRobot 都提供 OpenX/RLDS 兼容接口。这降低了跨组复用的边际成本到接近零。[未确认]
Open problems:
"22 家机构 + 22 本体" —— 常见误引。PDF 明确写「22 robot embodiments from 21 institutions」(Abstract + §III)。📎
22 个机器人本体来自 21 家机构(不是 22 家)。
"实验用了全部 22 个本体" —— 错。实验实际用的是 9 个 manipulator 的子集(§IV.C),因为实验时数据集仍在扩展。📎
22 是 OpenX 数据集覆盖的本体数,9 是 RT-1-X / RT-2-X 训练实际用的本体数。
"跨本体训练会互相干扰" —— OpenX 在聚合指标上证明了跨本体共训的正向迁移(未在子集级排除局部干扰)。RT-1-X 平均成功率比 RT-1 高 50%,RT-2-X 在 emergent skill 上比 RT-2 强 3 倍。📎
VLM 的视觉/语言表征跨本体共享,单一 action head 也共享——本体差异只在推理时按本体逐维 de-normalize(标量重缩放),并无专门的本体 action 层;混训在聚合指标上有正向迁移。
"7+1 维 EE 是精确的统一动作空间" —— 不准确。论文原话「coarsely aligned」——不对齐坐标系,允许绝对/相对位置/速度并存。📎
是"粗对齐",不是数学上精确的统一;同一 action vector 在不同本体上可能诱导非常不同的运动。
"OpenX 是 Google 一家搞的" —— 错。是 Google DeepMind 牵头、21 家机构(含 Stanford、Berkeley、MIT、TRI、ETH 等)联合的协作产物。📎
多机构联合,开源数据是核心交付物。
RT-1-X 和 RT-1 网络架构完全相同。凭什么 RT-1-X 平均成功率比 RT-1 高 50%?(提示:架构没变,那变的是什么?)
💡 参考答案
RT-2-X 在 emergent skill 上比 RT-2 强 3 倍。Table II 行 (3) 还显示:训练时去掉 Bridge 数据,RT-2-X 仍有 42.8%,远超 RT-2 的 27.3%。这个消融说明了什么?(提示:跨本体迁移是单源还是群体效应?)
💡 参考答案
7+1 维 EE action vector 是「coarsely aligned」不是精确统一。论文为什么不强行对齐坐标系?如果强行对齐会损失什么?(提示:想想各数据集原本的控制方案。)
💡 参考答案
OpenX 在聚合指标上证明了跨本体共训有正向迁移。请用 ImageNet 类比解释:为什么"混不同本体的数据训练"反而比"只在本体自己数据上训练"强?
💡 参考答案
OpenX 被叫做机器人学的「公共数据池时刻」,但规模仍比 LLM 少 4-5 个数量级(1M 轨迹 vs 几十 T token)。为什么不能直接把 LLM 那套 scaling law 搬过来?机器人数据 scaling 的特殊难处是什么?
💡 参考答案
RLDS(Reinforcement Learning Datasets)专门为 RL/sequential decision 设计——以 episode → step 嵌套结构存,支持并行化 streaming data loading,所有主流 DL 框架都能直接读。HDF5 是通用数组存储,没有 episode/step 语义,需要额外约定。📎
能。OpenX 是社区共建:按 RLDS schema 整理你的 episode/step,配一个 oxe_dataset_configs 条目说明字段映射 + 归一化统计,提 PR 到 github.com/google-deepmind/open_x_embodiment。🌐
skill 数是用 PaLM 从 language instruction 里抽出来的行为类别("pick up cup" / "open drawer" / "push button" 等)。task 数是更细粒度的(instruction + 初始场景的组合)。粒度不同,两个数不能直接比。📎
因为 Franka 是机器人学界最常用的研究平台之一,多家实验室都用它采集数据——Fig. 2(a) 显示 Franka 子数据集数最多,Fig. 2(b) 显示它的场景多样性最高。但要注意:轨迹数最多的是 xArm 和 Google Robot(Fig. 2(c) 原话 "xArm and Google Robot contribute the most number of trajectories due to a few large datasets"),Franka 在轨迹数上并不 dominate。📎
架构不同不能直接比。RT-1-X 是 35M 参数的 transformer,控制频率 3 Hz;RT-2-X 基于 RT-2-PaLI-X(ViT+UL2),co-fine-tune VLM web 数据 + robotics 数据,控制频率 10 Hz(WidowX)/ 5 Hz(其他)。RT-2-X 在 emergent skill 上更强,因为它继承了 VLM 的语义先验。📎