枢纽
数据集RoboCasa365,RoboDojo
上真机
实时
输入模态vision,language,proprioception

Xiaomi-Robotics-1:把「人手抓握数据」当 LLM 互联网语料来用

Xiaomi Robotics。arXiv:2607.15330 (2026-07-16)。 项目页 · 2B / 5B / 10B 开源 · foundation_modelsVLAcross-embodiment

🧠 一句话心智模型:LLM 之所以强是因为吃了整个互联网。机器人圈一直没这种「随便 scale」的语料——遥操太慢太贵。小米的招数:拿 UMI 手持夹爪让采集员满世界跑,攒 10 万小时真实抓握轨迹,用 VLM 自动给每段轨迹打「场景状态变化描述」当语言条件,预训练一个 VLA,再做跨本体后训练对齐到机器人。结果:scaling law 在机器人上终于真的成立了。

🎯 为什么重要:机器人一直缺一个「互联网规模」的数据源

RT-2、OpenVLA、π0、π0.5 这些 VLA 都证明了一件事——只要数据够多够杂,VLA 就能 scale。但数据从哪来?业界的主流答案是「真机遥操」,而遥操有三个硬伤:

核心矛盾(数据瓶颈)
· :一条演示就是几分钟的人时;
· :硬件绑定,一套机器人配一群操作员;
· 同质:操作员倾向于重复同一类任务,覆盖窄。
结果是数据多样性远小于规模。小米的洞察:UMI(Universal Manipulation Interface,手持夹爪 + 第一人称相机)能让人不带机器人也能采集机器人视角的轨迹——把采集成本从「机器人 + 工程师」降到「一个手持设备 + 任意人」。10 万小时因此变得可行。

但 UMI 数据有两个新问题:(i)它没有语言标签(ii)它是 UMI 夹爪的本体,不是部署机器人。论文的两个核心贡献就是解这两个问题:可扩展的自动语言标注管线,和两阶段 pre-training + post-training 把 UMI 能力对齐到机器人本体。

💡 核心思想:VLM 大脑 + DiT 动作头 + 两阶段训练

Xiaomi-Robotics-1 是一个 Mixture-of-Transformers:VLM 那一半(Qwen3-VL)处理图像和语言,DiT 那一半(小 hidden size、同层数)从 VLM 的 KV cache 取条件,用 flow matching 生成动作块。VLM 还兼任一个轻量的 Choice Policy——直接在 token 序列里预测 K 个候选动作 + 打分,作为辅助监督加速收敛。

输入:当前观察 o_t + 语言指令 l + 机器人本体状态 s_t 🧠 VLM 主干(Qwen3-VL) 图像 token + 语言 token → KV cache 视觉/语言 token 传给 DiT 当条件 Choice Policy 辅助头 K 个候选动作 + 打分 加速收敛;但相关 token 在 DiT 注意力中被屏蔽 (避免 DiT 走捷径直接抄 VLM 输出) ⚡ DiT 动作头(小 hidden) 条件 = VLM 的 KV cache + s_t + 噪声动作 ã_τ adaLN 注入 flow-matching 步数 τ ~ Beta(1.5,1) 5 步 Euler 积分 → 干净动作块 a_{t:t+H} 动作块 a_{t:t+H}(统一 EE 相对位姿增量) 2B / 5B / 10B 三个规模
图 1:Xiaomi-Robotics-1 架构。VLM 处理图像+语言,DiT 用 flow matching 从噪声生成动作块。Choice Policy 是 VLM 内的辅助头,只用于训练时加速,推理时不参与动作输出。

训练目标简洁地合在一起(式 1):

$$\mathcal{L} = \mathcal{L}_{\text{Flow}} + \mathcal{L}_{\text{Regression}} + \lambda\,\mathcal{L}_{\text{NTP}}, \quad \lambda = 0.1$$

$\mathcal{L}_{\text{Flow}}$ 让 DiT 学向量场;$\mathcal{L}_{\text{Regression}}$ 是 Choice Policy 的 winner-takes-all L1 损失;$\mathcal{L}_{\text{NTP}}$ 是为保留 VLM 原有能力而混入的图文 next-token prediction。预训练阶段图文 : UMI = 1 : 9 采样;后训练阶段四个源(图文 / 开源机器人 / 带 instruction 的 UMI / 自采机器人)按 0.5 : 0.5 : 0.5 : 8.5 采样。

🛠️ 三个让它「真 scale 起来」的关键设计

设计心智为什么必要
① UMI 当数据源 + 自动状态转移标注手持夹爪让采集员满世界跑(家、商、厂、办、户外);固定长度切片后用 Qwen3.5-27B 给每段打「场景状态转移描述」(不是任务指令)把遥操的「机器人 + 工程师」成本降到「手持设备 + 普通人」。状态转移描述("gripper moves from bowl to plate, plate is now next to basket")比任务指令更密集可自动产,2 周标完 10 万小时
② Pre-training → Post-training 两阶段预训练只学「从当前状态到语言描述目标状态的动作生成」;后训练才把指令风格从「状态转移描述」对齐到「人向机器人下命令的祈使句类似 LLM「预训练吃通用语料 → SFT 对齐指令格式」。两阶段把「能泛化的动作 prior」和「跟随人指令的接口」解耦,避免一锅炖导致两边都不好
③ 跨本体统一动作空间动作表示为「以当前 EE 位姿为参考的相对 Δ 位姿」;统一所有本体的 EE 朝向;缺失维度用 mask 屏蔽UMI 夹爪、单臂、双臂、移动机械臂维度都不同。统一到「相对 EE 增量」让同样动作语义在不同硬件下数值一致(向前伸就是向前伸),让 cross-embodiment 真正可学
🔮 直觉:为什么 DiT 注意力要屏蔽 VLM 的 action token?
论文发现:如果让 DiT 也注意 VLM 里 Choice Policy 输出的 action token,DiT 会走捷径直接抄 VLM 那个粗略预测,而不是真的去 grounding 视觉和语言。屏蔽之后 DiT 只能从视觉/语言 token 学,逼它独立学好动作生成——这是教科书式的「避免表征捷径」工程坑。

📊 结果:在四个 benchmark 上都刷 SOTA,scaling 真的成立

维度数字(来自 PDF)
预训练数据规模100,000+ 小时 UMI 真机轨迹(家、商、厂、办、户外)+ 自动状态转移标注(2 周完成)
后训练数据规模~10,000 小时跨本体:7200h 自采机器人 + 1000h instruction-labeled UMI + 开源(Bridge V2 / RT-1 / DROID)
模型规模2B / 5B / 10B 三档(VLM 2.1B/4.4B/8.8B + DiT 470M/604M/1.5B)
数据 scaling(预训练 12.5%→100%)OOD 整体成功率 53% → 75%;baseline 无 action 预训练仅 26%
模型 scaling(2B→5B→10B)OOD 整体成功率 61% → 75% → 79%(鞋类整理 58% → 75% → 92%)
下游高效微调(4 个挑战任务,平均 <10h/任务)Xiaomi-Robotics-1 75% 成功率(90% progress) vs π0.5 40%(66% progress)
RoboCasa36557.6%(前 SOTA 46.6%)
RoboDojo平均分 20.07(前 SOTA 13.07)
长 horizon 真机10 分钟级别的房间级移动操作(行李箱打包)
关键洞察数据 scale 的收益 > 模型 scale 的收益——「 billions 参数级已能拟合当前分布,数据仍是主瓶颈
关键洞察:这篇不是某个 trick 的胜利,而是「LLM scaling recipe 完整复刻到机器人」的胜利——把 UMI 当互联网语料、把状态转移标注当 next-token、把 cross-embodiment 当多语言 SFT。论文甚至直接说:模型 scaling 已经接近饱和,继续往下走必须靠数据

🌐 在领域中的位置

RT-1 / RT-2(离散动作 token,规模有限) Octo / OpenVLA(开源 VLA,数据规模远小于此) π0 / π0.5(VLM + flow matching 动作头) Xiaomi-Robotics-1(10 万小时 UMI + 跨本体)⭐

Xiaomi-Robotics-1 是「VLA 规模化的新顶峰」:第一次把数据规模真正推到「10 万小时」级别(远超 π0 的 1 万小时),并明确给出数据 scale > 模型 scale 的实证结论。它和 π0.5、NVIDIA GR00T 等一同标志着 VLA 进入「数据资本竞赛」阶段。关联线索:T06 VLA 谱系

❓ 常见误区

UMI 数据是机器人数据吗?

不是严格意义上的。UMI 是手持夹爪 + 第一人称相机,采集员的动作本身是人的,但第一人称视角 + 夹爪构型和机器人足够接近,能学到「视觉→动作」的通用映射。论文的后训练阶段就是把这些能力对齐到真机器人本体——类似 LLM 的「先学通用文本,再 SFT 到对话格式」。

状态转移描述和普通任务指令有啥区别?

状态转移描述是「描述性」的("gripper 之前在碗边,之后在盘子边,盘子被推到篮子旁"),任务指令是「祈使性」的("把碗放到篮子里")。前者能从原始视频自动产(VLM 看图说话即可),后者必须人标。预训练用前者是因为它便宜又密集;后训练切到后者是为了对齐「人怎么让机器人干活」。

10B 模型还不够大吗?为什么说模型 scaling 接近饱和?

「饱和」是相对于当前数据分布说的——在 20k 小时预训练数据上,10B 已经能拟合,再放大模型收益小。但论文也强调:这意味着模型 scaling 没用,而是说当下更紧迫的瓶颈是数据。如果数据再扩 10×,模型 scaling 的曲线很可能重新抬头。

它和 π0/π0.5 比赢在哪?

主要赢在预训练数据规模和多样性(100k 小时 UMI vs π0 的 10k 小时真机)。架构上同属「VLM + flow matching 动作头」家族,思路相近。在 4 个挑战任务的低数据微调中 Xiaomi-Robotics-1 以 75% vs 40% 大幅领先 π0.5——这是「预训练数据量」的直接体现。