枢纽
机器人humanoid
上真机
物理感知
实时
输入模态vision

HumanoidMimicGen:1 段人类演示 → 1000 段人形机器人数据

Kevin Lin, Ajay Mandlekar, Caelan Reed Garrett 等(NVIDIA + UT Austin)。arXiv:2605.27724v1,2026-05-26。 项目页 · imitation数据生成humanoid

🧠 一句话心智模型:人形机器人之所以学得慢,是因为「数据」太贵——遥操作让人走一段路去抓东西,几百段就要耗费数月。HumanoidMimicGen 的做法是:你只要给它一段人类演示,它就能用「全身规划」把这段演示「重放到 1000 个新场景」里,自动产出一份大规模数据集喂给 VLA。1 → 1000,1000 倍放大。

🎯 为什么重要:VLA 时代的人形机器人,卡在「没数据」

VLA 模型(RT-1/2、π0、GR00T)让桌面机械臂已经能听懂人话做活,但放到人形机器人上就卡死在数据采集这一步:

核心痛点:人形机器人不是「固定底座 + 手臂」,它得边走边操作(loco-manipulation)。这意味着:
① 自由度高(腿 + 躯干 + 双臂 + 双手),遥操作要求操作员同步控制全身;
② 平衡本身就是一个 RL 级别难问题,操作员稍不留神机器人就摔倒;
③ 既有数据生成工具(MimicGen、DexMimicGen)都假设「每条腿独立稳定地控制末端执行器」——这条假设对人形直接失效

所以领域里出现了一个尴尬的鸿沟:VLA 模型越做越大,但人形机器人的训练数据增长跟不上。HumanoidMimicGen 就是来填这条鸿沟的。

VLA 时代的人形数据瓶颈 模型规模 ↑↑↑ GR00T / π0 / RT-2 ⚡ 鸿沟 数据采集成本 >> 模型训练成本 人形数据 ↏ 遥操作:月级 / 几百段
图 1:模型越大,「没数据」越痛。HumanoidMimicGen 把人形数据采集成本压到「1 段人类演示」级别。

💡 核心思想:把人形机器人拆成「会走的部分」+「能抓的部分」

既有 MimicGen 系列对人形失效的根因,是腿不能像手臂那样独立做任务空间控制——腿得随时维持平衡。HumanoidMimicGen 给出的关键 insight 是:分而治之。把人形的动作空间拆成「下半身(RL 控)」+「上半身(规划控)」,再把任务拆成「走过去(locomotion)」+「站着抓(manipulation)」两个阶段。

1 段人类演示 VR 遥操作 · 含技能标注 HumanoidMimicGen 全身规划:分而治之 下半身:RL 控制器(Homie) 输入:骨盆速度指令 [ẋ, ẏ, θ̇, z] 输出:腿部关节位置 · 动态稳定(走路 / 转身 / 蹲) · 接触与平衡交给 RL · 跟踪不完美 → 触发「切换点」 上半身:关节空间规划 输入:技能目标位姿 T[e] 输出:臂/手/腰关节位置 · 静态稳定(站着抓) · 逆运动学 + 技能适配 · 复用原演示的相对轨迹 1000 段新演示(1000× 放大) 随机物体位姿 · 随机初始位姿 · 加运动噪声
图 2:HumanoidMimicGen 的关键架构选择——混合动作空间 + 解耦规划。腿交给 RL 保平衡,臂交给规划做技能,两阶段串行执行。

具体怎么把 1 段演示「重放到新场景」?靠一个漂亮的几何不变式:把原演示的末端轨迹表示成「相对于物体坐标系」的位姿。新场景中只要物体摆在新位置 $s'[f]$,就把整段轨迹按 $s'[f] \cdot s_0[f]^{-1}$ 这个体变换「平移过去」。这就是 MimicGen 系列的核心 trick,HumanoidMimicGen 在它上面加了「全身协调」这一层。

🛠️ 四个关键设计,让它真的能在人形上跑

设计心智为什么必要
① 混合动作空间下半身用 RL locomotion controller(Homie),输入骨盆速度;上半身用关节位置控制腿不能像手臂那样做任务空间控制——必须随时保平衡。RL 学一个 locomotion policy 比手写控制稳得多
② 解耦规划(两阶段)每个技能拆成「走过去(locomotion)」+「站着抓(manipulation)」,中间设一个「切换配置」$q'$动态稳定(走)和静态稳定(抓)的物理特性完全不同,分开规划才不会互相打架
③ 技能 DAG + 在线拓扑排序把双臂技能表示成有向无环图:定义「先后」$\mathcal{P}$ 和「同时」$\mathcal{C}$ 约束,贪婪地选当前可执行技能双臂任务(如双手抬箱)要求两只手同步或顺序;用 DAG 自动求解执行顺序
④ 运动噪声 + 初始位姿随机化rollout 时给动作加 $\epsilon \sim \mathcal{N}(0, \sigma^2 I)$,但 label 存原动作;同时随机初始基座位姿让策略见到 off-nominal 状态但监督信号仍是「专家动作」——缩小 train/test gap
🔮 直觉:为什么必须「解耦」走和抓?
你抓杯子时,脚是不能乱动的——否则手就够不准。但你走过去时,手也不能不动——否则平衡差。所以「走路时下半身忙、抓东西时上半身忙」是物理事实。HumanoidMimicGen 不是在玩工程 trick,而是在建模这个物理事实:用「切换点」$q'$ 做两阶段的交接。这一点和经典控制里的 hybrid zero dynamics 是同一种思路。

📊 关键结果:平均成功率 0.89,真机 +20%

数据来源(每个任务 1000 段)平均成功率(9 任务)说明
1 段人类演示0.26严重欠拟合
100 段人类演示0.48仍不足
DexMimicGen+(基线)0.33既有方法对人形失效
HumanoidMimicGen(本文)0.89从 1 段 → 1000 段,提升 +0.56
策略架构(同样数据)平均成功率
Diffusion Policy0.51
Flow Matching(AdaFlow)0.86
VLA(GR00T N1.6 微调)0.89
真机任务(sim+real co-training)仅真机混合训练提升
ThrowBottle0.600.75+0.15
BoxToCart0.350.60+0.25
PickCanister0.500.75+0.25
PickCanisterWithObstruction0.600.75+0.15
平均0.510.71+0.20 (+20%)
关键洞察:HumanoidMimicGen 不是「在某个任务上赢了」,而是把数据生成的范式从「机械臂时代」推进到「人形时代」。两个对比尤其锋利:
· vs 100 段人类演示(0.89 vs 0.48):1 段人类 + 自动扩增,吊打 100 段纯人工;
· vs DexMimicGen+(0.89 vs 0.33):把 MimicGen 系列原封不动搬来是不够的,必须做「全身规划」这一层。

🌐 在领域中的位置

MimicGen(固定机械臂,2023) DexMimicGen(双手灵巧,2024) MoMaGen / WBCMimicGen(移动机械臂,2025) HumanoidMimicGen(人形 loco-manip)⭐

谱系很清晰:MimicGen 这条线一直在解决「怎么把少量演示变成大量数据」,每一代都在拓展可处理的机器人形态。HumanoidMimicGen 是这条线进入「人形时代」的里程碑——它把 RL locomotion policy 接进了数据生成管线,这意味着未来的人形 VLA 可能根本不需要大规模真机遥操作。同时它和 GR00T N1.6、π0 这一代 VLA 形成正反馈:VLA 越强 → 越需要数据 → HumanoidMimicGen 越有价值。

❓ 常见误区

HumanoidMimicGen 是一种新策略(policy)吗?

不是。它是一种数据生成方法——产出演示数据集,再拿去训练任意策略(论文里测了 VLA、Flow Matching、Diffusion Policy 三种)。策略架构是可插拔的。

那「1 段演示」真的就能跑通所有任务吗?

有前置条件:这 1 段演示要带技能标注(哪段是抓、哪段是放、用哪只手)和约束(先后/同时)。这是它的主要局限(论文 §7 自己也提了)——未来可能用 foundation model 自动标注。

为什么不直接在仿真里用 RL 训练 humanoid,而要走模仿学习?

论文明确说:「我们用模仿学习,以避免 reward 调参」。人形 loco-manipulation 的 reward 极难设计——既要走稳又要抓准,RL 奖励工程成本可能比采数据还高。模仿学习绕过了这个坑。

「1000× 放大」是不是有点夸张?

字面上确实是 1 → 1000,但要理解两点:① 这 1000 段不是「全新任务」,而是「同一任务的 1000 种物体位姿/初始位姿变体」;② 这是「数据扩增」而非「信息创造」——它把人脑里的「不变性」(相对物体的轨迹)显式化并批量应用。