HumanPlus:一台 RGB 相机,让机器人实时「影子跟随」人类
🎯 为什么重要:人形机器人卡在「数据管线」上
「为什么要造人形机器人?」最常用的答案是:我们的环境、工具、任务都是按人类体型设计的。理论上,人形机器人可以吃海量人类数据(视频、动捕)来训练。但 2024 年前这条路一直没跑通,论文点出三个具体障碍:
① 感知与控制复杂——人形 DoF 高、状态空间大,传统的「感知-规划-跟踪」解耦方法难以 scale;
② 物理鸿沟——人和人形在 DoF 数、连杆长度、身高、actuation 上都有差异,直接抄姿势会失稳;
③ 缺数据采集管线——之前要么靠 MoCap(贵、场地受限),要么靠 VR / FPV(只控部分身体)。人形能做全身遥操的开源系统几乎为零。
HumanPlus 把这三个问题打包解决,而且整套硬件只用一台 RGB 相机——这是「人形机器人能在普通实验室用得起」的关键。
💡 核心思想:Shadowing Transformer + Imitation Transformer 两段式
低层 policy 设计的妙处在于「任务无关 (task-agnostic)」——它只学「给目标姿势,把机器人驱动到那个姿势」。这意味着同一个低层 policy 可以接影子跟随、也可以接自主策略输出,不需要为每个任务重训。论文用强化学习在仿真里大规模随机化(reward 见 Table 1,randomization 见 Table 2),才让零样本迁移成为可能。
🛠️ 两个 Transformer 的关键设计
| 组件 | 输入 | 核心设计 |
|---|---|---|
| Humanoid Shadowing Transformer (低层 policy) | 目标姿势 + 本体感觉 | decoder-only Transformer;在 AMASS 重定向后的人形姿势上训;输出每个关节的目标位置,交由 PD 控制器执行 |
| Humanoid Imitation Transformer (HIT,自主策略) | egocentric 双目 RGB + 本体感觉 | decoder-only Transformer;关键 trick:同时预测动作 + 预测下一帧图像特征(forward dynamics)——后者作为辅助任务,防止策略忽略视觉、过拟合到本体感觉 |
| 姿势估计 + 重定向 | 1 RGB 相机 60Hz | SOTA 人体 + 手部姿势估计(25Hz)→ SMPL-X → 复制对应 Euler 角到 19-DoF 人形 |
| domain randomization | sim 训练时 | base payload、摩擦、电机强度、控制延迟等(Table 2),保证低层 policy 迁移稳 |
纯动作回归的最大陷阱:机器人本体感觉里已经包含了「我在干什么」的大部分信息,策略很容易偷懒——只看本体感觉就输出动作,完全忽略图像。一旦视觉输入稍变(光照、物体位置),策略立刻失效。HIT 加上「预测下一帧图像特征」这条辅助任务,等于强制策略必须把图像信息编码进隐变量——动作头才有「看图」的意愿。这条 trick 直接把 Wear-a-Shoe-and-Walk 任务从 0% 拉到 60%。
📊 结果:40 次演示,60-100% 成功率
| 任务 | 演示数 | HIT (Ours) | ACT | Monocular | Open-loop |
|---|---|---|---|---|---|
| Wear a Shoe and Walk | 40 | 60% ✅ | 0 | 0 | 0 |
| Fold Clothes(whole) | 40 | 100% | 100 | 40 | 0 |
| Rearrange Objects(whole) | 30 | 90% | 50 | 70 | 0 |
| Type "AI"(whole) | 30 | 80% | 0 | 40 | 60 |
| Warehouse(whole) | 25 | 90% | 90 | 80 | 0 |
| Two-Robot Greeting(whole) | 30 | 90% | 90 | 80 | 0 |
| 维度 | 数字 |
|---|---|
| 机器人本体 | 33-DoF 180cm(Unitree H1 + 两个 6-DoF RH56DFX 灵巧手 + 1-DoF 腕) |
| 感知 | 2 个头戴 RGB 摄像头(瞳距 160mm,50° 向下),60Hz;手指力可达 10N,臂可持 7.5kg |
| 低层 policy 鲁棒性 | 恢复时间 1.2 秒(H1 默认控制器要 15 秒,论文 §8.2 文字描述最坏可达 20 秒);最大承受外力显著更高 |
| 遥操对比 | 对比 Kinesthetic Teaching / ALOHA / Meta Quest——H1 shadowing 是唯一支持全身遥操的方案 |
| 训练数据 | AMASS 40 小时(11,000+ 序列);自主策略每任务 ≤40 次演示 |
🌐 在领域中的位置
HumanPlus 是「单相机全身遥操 + 模仿学习」这条主线的奠基性工作。它和 OmniH2O(同期)一起把人形数据采集成本从「MoCap + 多操作员」压到「一个相机一个人」。后续 HOMIE(2025)指出纯视觉路线精度不足,改用同构外骨骼——但 HumanPlus 的「低层 + 高层」两段式架构被广泛继承。关联:HOMIE(后续,硬件精度路线)。
❓ 常见误区
「影子跟随」和「模仿学习」是一回事吗?
不是。影子跟随(shadowing)是实时遥操作——人动,机器人跟着动,数据同时被记录。模仿学习(imitation)是离线训练——把 shadowing 采到的数据集拿来训一个能脱离人自主决策的策略。前者是「采数据」、后者是「学策略」,HumanPlus 把两条串成飞轮。
低层 policy 既然任务无关,它是怎么学出来的?
仿真 RL,奖励包括「跟踪目标 xy 速度 / yaw 速度 / 关节位置 / roll-pitch / 能耗 / 足部接触 / 防滑 / 存活」等(Table 1),训练时大量随机化(payload、摩擦、电机强度、延迟等,Table 2)。训练好零样本迁移到真机。它学的不是「做某个任务」,而是「把任意目标姿势追踪到」。
为什么 ACT 在 Wear-a-Shoe 上完全失败?
ACT 是纯动作序列回归,容易过拟合到本体感觉(没看图也输出动作)。Wear-a-Shoe 这种任务里,鞋的精确位置必须看才知道——ACT 看不见,反复卡在「Pick up Shoe」子任务上。HIT 的 forward dynamics 辅助头正是为了治这个病。