ULTRA:让人形机器人从「跟着动作回放」走向「看懂任务自己动」
🎯 为什么重要:人形 loco-manip 的「精度-灵活性」死锁
让人形机器人做「走路 + 抓东西 + 搬东西」这类任务,现有方法要么走纯跟踪路线(HDMI、OmniRetarget),要么走纯目标路线。论文开篇就指出这是一个被碎片化的光谱:
作者还点出第二个工程暗礁:现有的运动重定向(retargeting)方法大多是纯运动学的——能很快把人 MoCap 映射到机器人骨骼,但产物在「接触丰富」场景下物理上不可行(脚打滑、手穿透物体)。数据不够 + 跟踪架构死板,这两件事一起把人形 loco-manip 卡住了。
💡 核心思想:物理驱动重定向 + 多模态统一 token + 技能瓶颈
ULTRA 的解法是四阶段流水线(论文 Fig.2),每一步都解决上一步遗留的瓶颈:
最妙的设计是「可用性 mask」+「变分瓶颈」。训练时 mask 随机抹掉部分模态(有时没物体状态、有时没点云、有时没参考),强迫 student 学会「缺什么用什么」。变分瓶颈 $z = z^{prior} + z^{res}$ 让 prior 从「部分观察」推断技能 latent,residual 用特权信息做残差修正——部署时只用 prior,residual 丢弃。
🛠️ 让一个策略同时吃下「密集参考」和「稀疏目标」的三个关键
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| ① 物理驱动神经重定向 | 把 retarget 写成 RL 任务:奖励 = tracking,转移 = 仿真器(自动满足运动学+动力学+接触约束) | 纯运动学 retarget(PHC、GMR、OmniRetarget)会产出脚打滑、手穿透的轨迹;物理约束 retarget 才能产出「接触一致」的训练数据 |
| ② 统一 token + 可用性 mask | 每种模态(proprio / 目标 / 物体 / 点云 / 参考)都 tokenize;mask 标记当前哪些可用,缺失的置零 | 让同一个策略在「MoCap 全开」和「只有深度相机」之间无缝切换;mask 在训练时随机采样 → 部署时按实际传感器配置填 |
| ③ DAgger 蒸馏 + RL 微调 | 先蒸馏(match teacher action + KL 对齐 prior/posterior);再开 RL env 跟踪随机目标偏移,扩大 OOD 覆盖 | 蒸馏 alone 受限于 teacher rollout 的状态覆盖;RL 微调把交互状态空间撑开,尤其提升 OOD 鲁棒性(OOD 目标成功率近乎翻倍) |
接触丰富的 loco-manip 用纯 RL 从部分观察学,早期几乎全部 fail(机器人还没学会站就先摔了),训练直接崩。先蒸馏得到一个「能稳定跟踪」的 student 当起点,再用 RL 微调去撑开 OOD——这本质上是把探索预算花在「已经能跑」的策略附近,而不是从零摸黑。论文 Table I 显示纯 RL student 远低于蒸馏版。
奖励设计也值得提:tracking 部分是乘性的 $r_{\text{track}} = r_p \cdot r_r \cdot r_{\text{obj}} \cdot r_{\text{int}} \cdot r_{\text{ct}} \cdot r_{\text{eng}}$——任何一项接近 0 整个奖励就崩。这迫使策略必须同时抓好末端执行器跟踪、物体跟踪、手掌-物体接触、接触事件对齐,杜绝「抓了不接触」或「接触了不抓」的取巧解。
📊 关键结果:四阶段都有效,G1 真机搬运跑通
| 评估维度 | 数字(原文溯源) |
|---|---|
| 重定向质量(Largebox,Tab.II) | 脚打滑时长 0.061 s(OmniRetarget 0.205 s,PHC 0.303 s);接触浮空 0.015(OmniRetarget 0.231) |
| 密集跟踪(Tab.I) | ULTRA(统一控制器)ID 成功率 67.30%(人形)/ +物体 57.44%;Teacher 上限 97.57%(人形);OOD 52.00%(人形) |
| 对比基线(Tab.I) | HDMI 仅 13.07%(人形),常不收敛;OmniRetarget 51.34%(人形)但物体跟踪掉到 20.91% |
| RL 微调对 OOD 目标提升(Tab.III) | Points 感知:OOD 5/20 → 9/20(+80%);Position 感知:4/20 → 12/20(+200%) |
| 数据增强扩规模 | 通过零样本 anisotropic scaling 把训练数据扩约 6×(Fig.4) |
| G1 真机成功率(Tab.IV) | 密集参考跟踪 73% (19/26);MoCap 目标跟随:垂直 80%(8/10) / 侧向 90%(9/10);机载 egocentric:50%/60% |
| 部署频率 | student 60 Hz;底层 PD 控制器 1 kHz |
| 动作维度 | 29 维(G1 关节目标位置) |
🌐 在领域中的位置
ULTRA 在 T04 运动 prior 谱系 和 T10 VLA+WBC 整合 都有位置——它继承了 InterMimic / InterPrior 的物理人-物交互脉络,又把「特权老师 → 多模态学生」这套蒸馏范式推到了真机 loco-manipulation。和它同期的工作(HOMIE、Exbody2、HOVER、SONIC)大多仍是「跟踪」范式,ULTRA 是少数把「不用 test-time 参考」作为一等目标的代表。
❓ 常见误区
ULTRA 和 π0 / VLA 类方法有什么不同?
π0 等 VLA 输入是视觉 + 语言,输出动作;ULTRA 不接语言,目标是「3D 物体/人形位姿变换」这种几何稀疏指令。它解决的是「让 WBC(whole-body controller)摆脱 MoCap 依赖」的问题,而不是「让机器人听懂人话」。两者是互补层级。
「物理驱动 retarget」为什么比运动学好?
运动学 retarget 只解 IK,不模拟接触和动力学——产物在「搬箱子」这种任务里会出现脚打滑(foot skating)、手穿透物体、接触浮空等问题,下游策略学出来也是这些坏习惯。ULTRA 把 retarget 写成 RL:仿真器自动 enforce 物理约束,奖励再把跟踪精度拉回来,产物天生就是「物理可行的 rollout」,Tab.II 的接触质量指标全面碾压基线。
student 用 mask 抹模态,不会信息损失吗?
会,但有补救:(1) 训练时 mask 是随机采样的,等价于「在各种传感器缺失组合下都训练过」;(2) 变分 prior $p(z|o^{student})$ 专门从「部分观察」推 latent,把缺失信息内插出来;(3) 蒸馏时 $z^{res}$ 用特权 teacher 信息补偿,让 prior 学得对。部署时丢 $z^{res}$ 用 $z^{prior}$,相当于「训练时有拐杖,部署时独立走」。
真机成功率为啥 egocentric 比 MoCap 差那么多?
主要是点云提取噪声:egocentric 模式下要从头部深度相机反投影、裁剪、去地面、聚类出物体——深度噪声和遮挡会让点云碎掉。作者在 failure analysis 里直说「深度噪声/遮挡破坏点云提取」是主要失败原因之一,未来要加触觉来兜底。