枢纽
机器人Unitree G1
上真机
物理感知
实时
输入模态vision,proprioception

ULTRA:让人形机器人从「跟着动作回放」走向「看懂任务自己动」

Xialin He, Sirui Xu 等(UIUC,指导:Yu-Xiong Wang & Liang-Yan Gui)。arXiv:2603.03279, 2026-03。 项目页 · 真机 Unitree G1 · foundation_modelshumanoid loco-manip

🧠 一句话心智模型:一个人形控制器不该只能「跟着 MoCap 动作回放」——它得在「有密集参考时精确跟踪」「只有稀疏目标时自己规划」之间无缝切换。ULTRA 用一个「先重定向 → 训特权老师 → 蒸馏到多模态学生 → RL 微调」的四阶段流水线,把这两件事压进同一个策略,在 Unitree G1 上靠机载深度相机就能完成搬箱子、运手提箱这类 loco-manipulation 任务。

🎯 为什么重要:人形 loco-manip 的「精度-灵活性」死锁

让人形机器人做「走路 + 抓东西 + 搬东西」这类任务,现有方法要么走纯跟踪路线(HDMI、OmniRetarget),要么走纯目标路线。论文开篇就指出这是一个被碎片化的光谱:

核心矛盾密集跟踪策略(要 MoCap 参考)精度高但泛化差——参考一旦缺失或不可行就崩;纯目标条件策略灵活但缺精细协调——做不了接触丰富的任务。而真实部署时,机器人需要在「有时有参考、有时没参考;有时有 MoCap、有时只有深度相机」之间无缝切换。

作者还点出第二个工程暗礁:现有的运动重定向(retargeting)方法大多是纯运动学的——能很快把人 MoCap 映射到机器人骨骼,但产物在「接触丰富」场景下物理上不可行(脚打滑、手穿透物体)。数据不够 + 跟踪架构死板,这两件事一起把人形 loco-manip 卡住了。

💡 核心思想:物理驱动重定向 + 多模态统一 token + 技能瓶颈

ULTRA 的解法是四阶段流水线(论文 Fig.2),每一步都解决上一步遗留的瓶颈:

阶段 1 · Neural Retargeting OMOMO 人-物 MoCap (SMPL-X + 物体位姿) ↓ RL 形式化 仿真约束优化 物理可行 G1 rollout 接触/动力学一致 零样本增强 各向异性缩放 + 物体 → 数据集扩 6× 解决:数据稀缺 + 不物理 阶段 2 · 特权 Teacher 全状态 + 密集参考 o = [o_sim, o_ref, o_Δ] 3 层 MLP 1024-1024-512 29 维动作输出 乘性奖励 r = r_p · r_r · r_obj · r_int · r_ct · r_eng ID Succ 97.6%(人形) 解决:稳定的高质量监督 阶段 3 · 多模态 Student DAgger 蒸馏 + 可用性 mask o = [proprio, goal, object, pcd, mask] 变分技能瓶颈 z = z_prior + z_res prior 看部分观察推 latent KL + RL 联合训练 Transformer encoder 按 mask 抹掉缺失模态 解决:部分观察 + 稀疏目标 阶段 4 · G1 真机部署 student @ 60 Hz PD controller @ 1 kHz 三种模式 mask 切换 ① 密集跟踪(有 ref) ② 目标跟随(MoCap) ③ 自主操控(深度) 真机:搬箱/手提箱 73% 密集跟踪成功 解决:不用 test-time ref
图 1:ULTRA 四阶段流水线(依论文 Fig.2 重绘)。每阶段都解决前阶段的瓶颈:retarget 解决数据物理性,teacher 解决稳定监督,student 解决部分观察,deploy 验证机载感知。

最妙的设计是「可用性 mask」+「变分瓶颈」。训练时 mask 随机抹掉部分模态(有时没物体状态、有时没点云、有时没参考),强迫 student 学会「缺什么用什么」。变分瓶颈 $z = z^{prior} + z^{res}$ 让 prior 从「部分观察」推断技能 latent,residual 用特权信息做残差修正——部署时只用 prior,residual 丢弃。

🛠️ 让一个策略同时吃下「密集参考」和「稀疏目标」的三个关键

设计心智为什么必要
① 物理驱动神经重定向把 retarget 写成 RL 任务:奖励 = tracking,转移 = 仿真器(自动满足运动学+动力学+接触约束)纯运动学 retarget(PHC、GMR、OmniRetarget)会产出脚打滑、手穿透的轨迹;物理约束 retarget 才能产出「接触一致」的训练数据
② 统一 token + 可用性 mask每种模态(proprio / 目标 / 物体 / 点云 / 参考)都 tokenize;mask 标记当前哪些可用,缺失的置零同一个策略在「MoCap 全开」和「只有深度相机」之间无缝切换;mask 在训练时随机采样 → 部署时按实际传感器配置填
③ DAgger 蒸馏 + RL 微调先蒸馏(match teacher action + KL 对齐 prior/posterior);再开 RL env 跟踪随机目标偏移,扩大 OOD 覆盖蒸馏 alone 受限于 teacher rollout 的状态覆盖;RL 微调把交互状态空间撑开,尤其提升 OOD 鲁棒性(OOD 目标成功率近乎翻倍)
🔮 直觉:为什么「蒸馏 + RL 微调」比纯 RL 强?
接触丰富的 loco-manip 用纯 RL 从部分观察学,早期几乎全部 fail(机器人还没学会站就先摔了),训练直接崩。先蒸馏得到一个「能稳定跟踪」的 student 当起点,再用 RL 微调去撑开 OOD——这本质上是把探索预算花在「已经能跑」的策略附近,而不是从零摸黑。论文 Table I 显示纯 RL student 远低于蒸馏版。

奖励设计也值得提:tracking 部分是乘性的 $r_{\text{track}} = r_p \cdot r_r \cdot r_{\text{obj}} \cdot r_{\text{int}} \cdot r_{\text{ct}} \cdot r_{\text{eng}}$——任何一项接近 0 整个奖励就崩。这迫使策略必须同时抓好末端执行器跟踪、物体跟踪、手掌-物体接触、接触事件对齐,杜绝「抓了不接触」或「接触了不抓」的取巧解。

📊 关键结果:四阶段都有效,G1 真机搬运跑通

评估维度数字(原文溯源)
重定向质量(Largebox,Tab.II)脚打滑时长 0.061 s(OmniRetarget 0.205 s,PHC 0.303 s);接触浮空 0.015(OmniRetarget 0.231)
密集跟踪(Tab.I)ULTRA(统一控制器)ID 成功率 67.30%(人形)/ +物体 57.44%;Teacher 上限 97.57%(人形);OOD 52.00%(人形)
对比基线(Tab.I)HDMI 仅 13.07%(人形),常不收敛;OmniRetarget 51.34%(人形)但物体跟踪掉到 20.91%
RL 微调对 OOD 目标提升(Tab.III)Points 感知:OOD 5/20 → 9/20(+80%);Position 感知:4/20 → 12/20(+200%
数据增强扩规模通过零样本 anisotropic scaling 把训练数据扩约 (Fig.4)
G1 真机成功率(Tab.IV)密集参考跟踪 73% (19/26);MoCap 目标跟随:垂直 80%(8/10) / 侧向 90%(9/10);机载 egocentric:50%/60%
部署频率student 60 Hz;底层 PD 控制器 1 kHz
动作维度29 维(G1 关节目标位置)
关键洞察:作者用 t-SNE 可视化 latent(Fig.5),发现技能空间按模态分离但流形共享——跟踪/目标跟随分布在相邻区域。更让人惊喜的是,用 MiniLM 把动作的文本描述聚成 5 类(C0–C4)后,latent 分布与这些语义簇对齐。说明 student 不仅学到「怎么动」,还把「动作意图」结构化地编码进了 latent——这是「sparse goal 也能泛化」的根本原因。

🌐 在领域中的位置

DeepMimic / OmniH2O(单轨迹跟踪) HDMI / OmniRetarget(人-物 MoCap 跟踪) ULTRA(统一:跟踪 + 目标 + 感知)⭐ BFM / BeyondMimic:大规模人形基础模型

ULTRA 在 T04 运动 prior 谱系T10 VLA+WBC 整合 都有位置——它继承了 InterMimic / InterPrior 的物理人-物交互脉络,又把「特权老师 → 多模态学生」这套蒸馏范式推到了真机 loco-manipulation。和它同期的工作(HOMIE、Exbody2、HOVER、SONIC)大多仍是「跟踪」范式,ULTRA 是少数把「不用 test-time 参考」作为一等目标的代表。

❓ 常见误区

ULTRA 和 π0 / VLA 类方法有什么不同?

π0 等 VLA 输入是视觉 + 语言,输出动作;ULTRA 不接语言,目标是「3D 物体/人形位姿变换」这种几何稀疏指令。它解决的是「让 WBC(whole-body controller)摆脱 MoCap 依赖」的问题,而不是「让机器人听懂人话」。两者是互补层级。

「物理驱动 retarget」为什么比运动学好?

运动学 retarget 只解 IK,不模拟接触和动力学——产物在「搬箱子」这种任务里会出现脚打滑(foot skating)、手穿透物体、接触浮空等问题,下游策略学出来也是这些坏习惯。ULTRA 把 retarget 写成 RL:仿真器自动 enforce 物理约束,奖励再把跟踪精度拉回来,产物天生就是「物理可行的 rollout」,Tab.II 的接触质量指标全面碾压基线。

student 用 mask 抹模态,不会信息损失吗?

会,但有补救:(1) 训练时 mask 是随机采样的,等价于「在各种传感器缺失组合下都训练过」;(2) 变分 prior $p(z|o^{student})$ 专门从「部分观察」推 latent,把缺失信息内插出来;(3) 蒸馏时 $z^{res}$ 用特权 teacher 信息补偿,让 prior 学得对。部署时丢 $z^{res}$ 用 $z^{prior}$,相当于「训练时有拐杖,部署时独立走」。

真机成功率为啥 egocentric 比 MoCap 差那么多?

主要是点云提取噪声:egocentric 模式下要从头部深度相机反投影、裁剪、去地面、聚类出物体——深度噪声和遮挡会让点云碎掉。作者在 failure analysis 里直说「深度噪声/遮挡破坏点云提取」是主要失败原因之一,未来要加触觉来兜底。