Xiaomi-Robotics-1:把「人手抓握数据」当 LLM 互联网语料来用
🎯 为什么重要:机器人一直缺一个「互联网规模」的数据源
RT-2、OpenVLA、π0、π0.5 这些 VLA 都证明了一件事——只要数据够多够杂,VLA 就能 scale。但数据从哪来?业界的主流答案是「真机遥操」,而遥操有三个硬伤:
· 慢:一条演示就是几分钟的人时;
· 贵:硬件绑定,一套机器人配一群操作员;
· 同质:操作员倾向于重复同一类任务,覆盖窄。
结果是数据多样性远小于规模。小米的洞察:UMI(Universal Manipulation Interface,手持夹爪 + 第一人称相机)能让人不带机器人也能采集机器人视角的轨迹——把采集成本从「机器人 + 工程师」降到「一个手持设备 + 任意人」。10 万小时因此变得可行。
但 UMI 数据有两个新问题:(i)它没有语言标签;(ii)它是 UMI 夹爪的本体,不是部署机器人。论文的两个核心贡献就是解这两个问题:可扩展的自动语言标注管线,和两阶段 pre-training + post-training 把 UMI 能力对齐到机器人本体。
💡 核心思想:VLM 大脑 + DiT 动作头 + 两阶段训练
Xiaomi-Robotics-1 是一个 Mixture-of-Transformers:VLM 那一半(Qwen3-VL)处理图像和语言,DiT 那一半(小 hidden size、同层数)从 VLM 的 KV cache 取条件,用 flow matching 生成动作块。VLM 还兼任一个轻量的 Choice Policy——直接在 token 序列里预测 K 个候选动作 + 打分,作为辅助监督加速收敛。
训练目标简洁地合在一起(式 1):
$$\mathcal{L} = \mathcal{L}_{\text{Flow}} + \mathcal{L}_{\text{Regression}} + \lambda\,\mathcal{L}_{\text{NTP}}, \quad \lambda = 0.1$$
$\mathcal{L}_{\text{Flow}}$ 让 DiT 学向量场;$\mathcal{L}_{\text{Regression}}$ 是 Choice Policy 的 winner-takes-all L1 损失;$\mathcal{L}_{\text{NTP}}$ 是为保留 VLM 原有能力而混入的图文 next-token prediction。预训练阶段图文 : UMI = 1 : 9 采样;后训练阶段四个源(图文 / 开源机器人 / 带 instruction 的 UMI / 自采机器人)按 0.5 : 0.5 : 0.5 : 8.5 采样。
🛠️ 三个让它「真 scale 起来」的关键设计
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| ① UMI 当数据源 + 自动状态转移标注 | 手持夹爪让采集员满世界跑(家、商、厂、办、户外);固定长度切片后用 Qwen3.5-27B 给每段打「场景状态转移描述」(不是任务指令) | 把遥操的「机器人 + 工程师」成本降到「手持设备 + 普通人」。状态转移描述("gripper moves from bowl to plate, plate is now next to basket")比任务指令更密集可自动产,2 周标完 10 万小时 |
| ② Pre-training → Post-training 两阶段 | 预训练只学「从当前状态到语言描述目标状态的动作生成」;后训练才把指令风格从「状态转移描述」对齐到「人向机器人下命令的祈使句」 | 类似 LLM「预训练吃通用语料 → SFT 对齐指令格式」。两阶段把「能泛化的动作 prior」和「跟随人指令的接口」解耦,避免一锅炖导致两边都不好 |
| ③ 跨本体统一动作空间 | 动作表示为「以当前 EE 位姿为参考的相对 Δ 位姿」;统一所有本体的 EE 朝向;缺失维度用 mask 屏蔽 | UMI 夹爪、单臂、双臂、移动机械臂维度都不同。统一到「相对 EE 增量」让同样动作语义在不同硬件下数值一致(向前伸就是向前伸),让 cross-embodiment 真正可学 |
论文发现:如果让 DiT 也注意 VLM 里 Choice Policy 输出的 action token,DiT 会走捷径直接抄 VLM 那个粗略预测,而不是真的去 grounding 视觉和语言。屏蔽之后 DiT 只能从视觉/语言 token 学,逼它独立学好动作生成——这是教科书式的「避免表征捷径」工程坑。
📊 结果:在四个 benchmark 上都刷 SOTA,scaling 真的成立
| 维度 | 数字(来自 PDF) |
|---|---|
| 预训练数据规模 | 100,000+ 小时 UMI 真机轨迹(家、商、厂、办、户外)+ 自动状态转移标注(2 周完成) |
| 后训练数据规模 | ~10,000 小时跨本体:7200h 自采机器人 + 1000h instruction-labeled UMI + 开源(Bridge V2 / RT-1 / DROID) |
| 模型规模 | 2B / 5B / 10B 三档(VLM 2.1B/4.4B/8.8B + DiT 470M/604M/1.5B) |
| 数据 scaling(预训练 12.5%→100%) | OOD 整体成功率 53% → 75%;baseline 无 action 预训练仅 26% |
| 模型 scaling(2B→5B→10B) | OOD 整体成功率 61% → 75% → 79%(鞋类整理 58% → 75% → 92%) |
| 下游高效微调(4 个挑战任务,平均 <10h/任务) | Xiaomi-Robotics-1 75% 成功率(90% progress) vs π0.5 40%(66% progress) |
| RoboCasa365 | 57.6%(前 SOTA 46.6%) |
| RoboDojo | 平均分 20.07(前 SOTA 13.07) |
| 长 horizon 真机 | 10 分钟级别的房间级移动操作(行李箱打包) |
| 关键洞察 | 数据 scale 的收益 > 模型 scale 的收益——「 billions 参数级已能拟合当前分布,数据仍是主瓶颈」 |
🌐 在领域中的位置
Xiaomi-Robotics-1 是「VLA 规模化的新顶峰」:第一次把数据规模真正推到「10 万小时」级别(远超 π0 的 1 万小时),并明确给出数据 scale > 模型 scale 的实证结论。它和 π0.5、NVIDIA GR00T 等一同标志着 VLA 进入「数据资本竞赛」阶段。关联线索:T06 VLA 谱系。
❓ 常见误区
UMI 数据是机器人数据吗?
不是严格意义上的。UMI 是手持夹爪 + 第一人称相机,采集员的动作本身是人的,但第一人称视角 + 夹爪构型和机器人足够接近,能学到「视觉→动作」的通用映射。论文的后训练阶段就是把这些能力对齐到真机器人本体——类似 LLM 的「先学通用文本,再 SFT 到对话格式」。
状态转移描述和普通任务指令有啥区别?
状态转移描述是「描述性」的("gripper 之前在碗边,之后在盘子边,盘子被推到篮子旁"),任务指令是「祈使性」的("把碗放到篮子里")。前者能从原始视频自动产(VLM 看图说话即可),后者必须人标。预训练用前者是因为它便宜又密集;后训练切到后者是为了对齐「人怎么让机器人干活」。
10B 模型还不够大吗?为什么说模型 scaling 接近饱和?「饱和」是相对于当前数据分布说的——在 20k 小时预训练数据上,10B 已经能拟合,再放大模型收益小。但论文也强调:这不意味着模型 scaling 没用,而是说当下更紧迫的瓶颈是数据。如果数据再扩 10×,模型 scaling 的曲线很可能重新抬头。
它和 π0/π0.5 比赢在哪?主要赢在预训练数据规模和多样性(100k 小时 UMI vs π0 的 10k 小时真机)。架构上同属「VLM + flow matching 动作头」家族,思路相近。在 4 个挑战任务的低数据微调中 Xiaomi-Robotics-1 以 75% vs 40% 大幅领先 π0.5——这是「预训练数据量」的直接体现。