里程碑
机器人Unitree H1
数据集AMASS, HumanPlus dataset
上真机
实时
输入模态vision,proprioception

HumanPlus:一台 RGB 相机,让机器人实时「影子跟随」人类

Zipeng Fu, Qingqing Zhao, Qi Wu, Gordon Wetzstein, Chelsea Finn(Stanford)。arXiv:2406.10454, 2024。 33-DoF 180cm 人形,基于 Unitree H1。action_genhumanoidshadowing + IL

🧠 一句话心智模型:做人形机器人最贵的资源不是硬件,是「人怎么动」的数据。HumanPlus 把整套数据闭环压成两条腿:① 训练一个「姿势跟随低层 policy」(吃 AMASS 40 小时人类动捕,仿真训好后零样本迁移);② 操作员用一台 RGB 相机实时估姿势喂给 policy,机器人就跟你同步动——这套「影子系统」采到的数据,再喂给模仿学习训练自主策略。

🎯 为什么重要:人形机器人卡在「数据管线」上

「为什么要造人形机器人?」最常用的答案是:我们的环境、工具、任务都是按人类体型设计的。理论上,人形机器人可以吃海量人类数据(视频、动捕)来训练。但 2024 年前这条路一直没跑通,论文点出三个具体障碍:

三大瓶颈:
感知与控制复杂——人形 DoF 高、状态空间大,传统的「感知-规划-跟踪」解耦方法难以 scale;
物理鸿沟——人和人形在 DoF 数、连杆长度、身高、actuation 上都有差异,直接抄姿势会失稳;
缺数据采集管线——之前要么靠 MoCap(贵、场地受限),要么靠 VR / FPV(只控部分身体)。人形能做全身遥操的开源系统几乎为零。

HumanPlus 把这三个问题打包解决,而且整套硬件只用一台 RGB 相机——这是「人形机器人能在普通实验室用得起」的关键。

💡 核心思想:Shadowing Transformer + Imitation Transformer 两段式

阶段 ① 离线仿真训练「低层 policy」(Humanoid Shadowing Transformer) AMASS 40h 人类动捕 SMPL-X 重定向到 19-DoF 仿真 RL 大规模训练 domain randomization + sim2real 低层 policy 零样本迁移 阶段 ② 在线「影子跟随」(只一台 RGB 相机) 单 RGB 相机 身体+手姿势估计(25Hz) 重定向到人形 低层 policy(50Hz) 阶段 ③ 数据飞轮 → 自主策略(Humanoid Imitation Transformer) shadowing 采到的数据(egocentric 双目 RGB + 姿势)→ ≤40 次演示 训出能自主完成「穿鞋+走路 / 叠衣服 / 打字 / 仓库理货」的视觉运动策略
图 1:HumanPlus 三阶段管线。低层 policy 离线训好不变;在线用一台 RGB 相机估人姿 → 影子跟随;数据回灌训自主策略。

低层 policy 设计的妙处在于「任务无关 (task-agnostic)」——它只学「给目标姿势,把机器人驱动到那个姿势」。这意味着同一个低层 policy 可以接影子跟随、也可以接自主策略输出,不需要为每个任务重训。论文用强化学习在仿真里大规模随机化(reward 见 Table 1,randomization 见 Table 2),才让零样本迁移成为可能。

🛠️ 两个 Transformer 的关键设计

组件输入核心设计
Humanoid Shadowing Transformer
(低层 policy)
目标姿势 + 本体感觉decoder-only Transformer;在 AMASS 重定向后的人形姿势上训;输出每个关节的目标位置,交由 PD 控制器执行
Humanoid Imitation Transformer
(HIT,自主策略)
egocentric 双目 RGB + 本体感觉decoder-only Transformer;关键 trick:同时预测动作 + 预测下一帧图像特征(forward dynamics)——后者作为辅助任务,防止策略忽略视觉、过拟合到本体感觉
姿势估计 + 重定向1 RGB 相机 60HzSOTA 人体 + 手部姿势估计(25Hz)→ SMPL-X → 复制对应 Euler 角到 19-DoF 人形
domain randomizationsim 训练时base payload、摩擦、电机强度、控制延迟等(Table 2),保证低层 policy 迁移稳
🔮 直觉:为什么 HIT 要「同时预测图像特征」?
纯动作回归的最大陷阱:机器人本体感觉里已经包含了「我在干什么」的大部分信息,策略很容易偷懒——只看本体感觉就输出动作,完全忽略图像。一旦视觉输入稍变(光照、物体位置),策略立刻失效。HIT 加上「预测下一帧图像特征」这条辅助任务,等于强制策略必须把图像信息编码进隐变量——动作头才有「看图」的意愿。这条 trick 直接把 Wear-a-Shoe-and-Walk 任务从 0% 拉到 60%。

📊 结果:40 次演示,60-100% 成功率

任务演示数HIT (Ours)ACTMonocularOpen-loop
Wear a Shoe and Walk4060%000
Fold Clothes(whole)40100%100400
Rearrange Objects(whole)3090%50700
Type "AI"(whole)3080%04060
Warehouse(whole)2590%90800
Two-Robot Greeting(whole)3090%90800
维度数字
机器人本体33-DoF 180cm(Unitree H1 + 两个 6-DoF RH56DFX 灵巧手 + 1-DoF 腕)
感知2 个头戴 RGB 摄像头(瞳距 160mm,50° 向下),60Hz;手指力可达 10N,臂可持 7.5kg
低层 policy 鲁棒性恢复时间 1.2 秒(H1 默认控制器要 15 秒,论文 §8.2 文字描述最坏可达 20 秒);最大承受外力显著更高
遥操对比对比 Kinesthetic Teaching / ALOHA / Meta Quest——H1 shadowing 是唯一支持全身遥操的方案
训练数据AMASS 40 小时(11,000+ 序列);自主策略每任务 ≤40 次演示
关键洞察:HIT 是唯一解决 Wear-a-Shoe-and-Walk 的方法(60% vs 其他全部 0%)。这个任务把所有瓶颈叠在一起——需要双目视觉(看鞋在哪)、需要全身协调(弯腰+穿鞋+站立+走路)、需要闭环纠错(鞋没穿好要重试)。能搞定它,基本就证明「视觉 + 全身 + 闭环」这条链路打通了。论文也坦诚了局限:1-DoF 踝关节限制了单腿平衡,5-DoF 臂无法做 6-DoF 末端操作,头戴相机视角固定容易丢目标。

🌐 在领域中的位置

传统 MoCap / 解耦控制(昂贵、特定任务) Purvushottam / iCub3(外骨骼 / MoCap 全身遥操) HumanPlus(单 RGB 相机 + AMASS 低层 + IL)⭐ OmniH2O / HOMIE / ExBody2(更精细化全身遥操)

HumanPlus 是「单相机全身遥操 + 模仿学习」这条主线的奠基性工作。它和 OmniH2O(同期)一起把人形数据采集成本从「MoCap + 多操作员」压到「一个相机一个人」。后续 HOMIE(2025)指出纯视觉路线精度不足,改用同构外骨骼——但 HumanPlus 的「低层 + 高层」两段式架构被广泛继承。关联:HOMIE(后续,硬件精度路线)。

❓ 常见误区

「影子跟随」和「模仿学习」是一回事吗?

不是。影子跟随(shadowing)是实时遥操作——人动,机器人跟着动,数据同时被记录。模仿学习(imitation)是离线训练——把 shadowing 采到的数据集拿来训一个能脱离人自主决策的策略。前者是「采数据」、后者是「学策略」,HumanPlus 把两条串成飞轮。

低层 policy 既然任务无关,它是怎么学出来的?

仿真 RL,奖励包括「跟踪目标 xy 速度 / yaw 速度 / 关节位置 / roll-pitch / 能耗 / 足部接触 / 防滑 / 存活」等(Table 1),训练时大量随机化(payload、摩擦、电机强度、延迟等,Table 2)。训练好零样本迁移到真机。它学的不是「做某个任务」,而是「把任意目标姿势追踪到

为什么 ACT 在 Wear-a-Shoe 上完全失败?

ACT 是纯动作序列回归,容易过拟合到本体感觉(没看图也输出动作)。Wear-a-Shoe 这种任务里,鞋的精确位置必须看才知道——ACT 看不见,反复卡在「Pick up Shoe」子任务上。HIT 的 forward dynamics 辅助头正是为了治这个病。