⏱ ~33 min
里程碑
⭐ 为何重要

full-stack humanoid 系统:单 RGB 相机抓人体动作→retarget→RL 策略→真机 Unitree H1 执行,同时支持 shadowing(实时模仿)与 imitation learning(自主任务)。它与 OmniH2O 并列为 2024 人形 teleop/imitation 的旗舰工作,验证了「消费级相机 + sim-to-real」即可把生成/捕获的人体动作送上真机的可复制范式。

机器人Unitree H1
数据集AMASS, HumanPlus dataset
上真机
实时
输入模态vision,proprioception

P-HumanPlus-2024 · Humanoid Shadowing and Imitation from Humans

作者 / 机构:Zipeng Fu†, Qingqing Zhao†, Qi Wu†, Gordon Wetzstein, Chelsea Finn(†项目共一)· Stanford University
发表:arXiv v1 2024-06-15;正式收录 ICML 2025(PMLR v270 fu25a
arxiv:2406.10454 · 代码github.com/MarkFzp/humanplus(已开源) · 项目页humanoid-ai.github.io
在线索中的位置:T07 (humanoid teleop) + T11 (dexterous) + T10 (VLA+WBC) 的综合系统;OmniH2O 的同期工作。
一句话定位:把"先在仿真里用 AMASS 训一个 pose-conditioned 低层 transformer(HST),再用单 RGB 相机实时 retarget 人体姿态做 shadowing 遥操,最后把 shadowing 数据用 decoder-only transformer(HIT)做行为克隆"的全栈 pipeline 在自研 33-DoF 人形(基于 Unitree H1)上跑通——40 demo 学会穿鞋走路、叠衣服等复杂全身任务。


动机

人形机器人想要"做有用的事",需要两样东西同时解决:

  1. 数据采集:怎么让人高效地把技能"教"给 33-DoF 的全身人形?传统 MoCap suit/exoskeleton/ALOHA 都贵且只能控制部分自由度,没人在 2024 年解决"单人单相机全身遥操"。
  2. 学习算法:从遥操数据学到能自主执行的 policy,难点在 (a) 高 DoF 全身控制(站、蹲、走 + 双手),(b) 视觉感知必需(叠衣服、抓鞋都靠深度/RGB)但容易过拟合proprioception

HumanPlus 用两个 transformer 把这两件事都做了:HST(Humanoid Shadowing Transformer)做低层全身控制HIT(Humanoid Imitation Transformer)做高层技能学习。前者在仿真用 40 小时 AMASS 训练、zero-shot 部署;后者从 shadowing 采的真机数据做 BC。

方法核心

以下数字来自 PDF 正文 Sec.3–8 + Table 1/2/3/5。transformer 层数 / hidden dim / attention head 论文未明确(仅给 decoder-only + context length),复现时需查代码。

1. 硬件(Sec.3)

自研 humanoid:33 DoF = 19 body + 2×6 hand + 2×1 wrist

  • body:2×4-DoF arm + 2×5-DoF leg + 1 torso = 19;
  • hand:每只 6 DoF(index/middle/ring/little 各 1,thumb 2);
  • wrist:每侧 1 DoF。
  • 感知:双目 RGB(egocentric)、IMU、关节编码器、 onboard GPU(部署用)。

2. Retargeting pipeline(Sec.4 + Sec.5)—— 把人变成机器人目标

  • 离线(训练):AMASS(40 小时、11000+ 段人类动捕)→ 过滤 → SMPL-X 参数 → body 直接拷贝 Euler 角到 19 个人形关节(hip/knee/ankle/torso/shoulder/elbow 的对应 joint),因为人形 body DoF 是 SMPL-X 的子集。
  • 在线(shadowing)
  • body:用 WHAM(World-Grounded Humans with Accurate Motion)从单 RGB 相机实时估 SMPL-X,再 retarget。25 fps on RTX 4090
  • hand:用 HaMeR(transformer hand estimator)+ MANO 模型,每根手指取 middle joint 旋转,wrist 取 forearm-hand 相对旋转。10 fps on RTX 4090

关键:hand 比 body 慢(10 vs 25 Hz),所以实际 shadowing 时手部目标会插值/降频。论文未给详细同步策略。

3. HST:Humanoid Shadowing Transformer(低层,Sec.5)

架构:decoder-only transformer。

  • 输入(每步):
  • proprioception:root state(roll/pitch/base angular velocity)、joint position、joint velocity、last action;
  • humanoid target pose:target forward/lateral velocity、target roll/pitch、target yaw velocity、target joint angles(retarget 来的)。
  • 输出19 维 body joint position setpoints(hand joint targets 直接 passthrough 到 PD 控制器,不经 policy)。
  • PD 控制器 1000 Hz 把 setpoint 转 torque
  • policy 频率 50 Hz
  • context length 8(仅看最近 8 步 = 0.16 s 历史)。

训练PPO 仿真里训,reward(Table 1 精确表达式):

$$r = \exp(-|[v_x,v_y]-[v_x^{tg},v_y^{tg}]|) + \exp(-|v_{yaw}-v_{yaw}^{tg}|) - |q - q^{tg}|_2^2 - |[r,p]-[r^{tg},p^{tg}]|_2^2 - |\tau\dot q|_2^2 + \mathbb{1}[c = c^{tg}] - |v_{feet}\cdot \mathbb{1}[F_{feet}>1]|_2^2 + 1$$

各项:target xy velocity(exp)、target yaw velocity(exp)、target joint position(L2)、target roll&pitch(L2)、energy(torque × velocity,L2)、feet contact(match)、feet slipping(stance 时足速度惩罚)、alive bonus(常数 1)。

Domain randomization(Table 2):base payload [-3,3] kg、end-effector payload [0,0.5] kg、center of base mass offset [-0.1,0.1]³ m、motor strength [0.8,1.1]、friction [0.3,0.9]、control delay [0.02,0.04] s。

部署:zero-shot sim-to-real。坐着时直接发 target pose 到 PD(不走 policy,因为坐姿接触仿真难)。

4. HIT:Humanoid Imitation Transformer(高层 skill,Sec.6)

架构:基于 ACT(Action Chunking Transformer)改成 decoder-only

  • 输入:双目 RGB(pretrained ResNet 抽 image feature)+ proprioception + fixed positional embeddings
  • 输出chunk of 50 target poses(一次预测未来 50 步目标姿态,action chunking)。
  • 运行 25 Hz,把预测 target poses 异步发给 HST(50 Hz)。

关键创新:forward-dynamics L2 feature loss。在训练时让 transformer 不仅预测 50 步 target poses,还要在对应 input position 预测未来 image feature tokens,用 ground-truth 未来 image feature 做 L2 监督。这个 auxiliary loss 强制 transformer "理解"图像——否则 BC 容易让 policy 忽略 image feature、只过拟合 proprioception(论文实测 ACT 在 Wear-a-Shoe 任务上就栽在这里,反复抓空)。

部署时只用 predicted target poses,丢弃 predicted image feature tokens

5. Shadowing 数据采集与任务(Sec.7)

5 个 shadowing 任务(实时遥操演示)+ 6 个 imitation 任务(BC 学自主):

imitation 任务及 demo 数 / 长度

  • Wear a Shoe and Walk(40 demos,每 50 s / 1250 步):10 步序列(flip → pick up → put on → press → tangle → grasp right/left → tie → stand up → walk forward)。最难,需双手机械+敏捷 locomotion
  • Warehouse(每 demo 20 s / 500 步):approach spray → grasp → retract → squat → release on quadruped cart → stand up。
  • Fold Clothes(每 demo 20 s / 500 步):fold left/right sleeve + bottom,要保平衡。
  • Type "AI"(每 demo 8 s / 200 步):敲 A、release、敲 I、release。
  • Rearrange Objects(每 demo 10 s / 250 步)+ variant Rearrange Lower Objects(桌高 0.55 m,要蹲下)。
  • Two-Robot Greeting(每 demo 5 s / 125 步):识别对方伸哪只手 → 握手 → 松开。

6. 关键实验(Sec.8)

Teleop 用户研究(Table 3,6 个被试):对比 Kinesthetic Teaching / ALOHA / Meta Quest。HumanPlus 是唯一支持全身遥操的,cost 仅 $50(vs ALOHA $7050),单人即可操作(其他至少 2 人),完成时间最短,站稳率最高(100%)。能完成 Rearrange Lower Objects(要蹲)—— 其他都不能。

Imitation 对比(Table 5):HIT vs Monocular HIT vs ACT vs Open-loop。

  • Wear a Shoe and Walk:HIT 60%(40 demo),Monocular/ACT/Open-loop 全部 0%。HIT 唯一能完成。
  • 其他子任务 HIT 普遍 75–100%,ACT/Monocular 在需要视觉反馈的步骤掉到 0–20%。
  • 关键失败模式:ACT "overfits to proprioception"(在 Pick up Shoe 之后反复抓空),Monocular 缺深度(Fold Clothes 时撞桌)。

鲁棒性(Table 4 + Fig.7):HST vs H1 manufacturer default controller。

  • 最大耐受推力:forward 32 N(H1: 24 N)、backward 44 N(36)、leftward 70 N(40)、rightward 100 N(40)。
  • recovery time:1.2 s(H1: 15 s)。
  • squat:0.44 m(H1: 0.85 m;metric 为下沉后基座高度,越低蹲得越深——Ours 蹲得更深)、jump:0.35 m(H1: 0)、stand up:✓(H1: ✗)。

为什么重要

  1. 第一个"单 RGB 相机 + 全身遥操 + imitation"完整闭环。把 ALOHA 的双臂 teleop 思路扩展到人形全身,且成本极低($50 vs $7050)。
  2. HST 把 AMASS 用作低层 policy 训练数据——这成为后续 humanoid RL 的标准做法(ExBody、HOVER、BeyondMimic 全部这么做)。
  3. HIT 的 image-feature auxiliary loss 是个看似简单但关键的 trick:解决了 BC 过拟合 proprioception 的通病。这个 idea 后续被多种 VLA 借鉴。
  4. zero-shot sim-to-real 全身控制:H1 上能抗 100 N 推力、深蹲、跳、起身,远超 manufacturer 默认控制器。证明 AMASS 训的 transformer 低层 policy 路线可行。
  5. 40 demo 学会穿鞋走路:复杂长程任务(10 步、50 s)只用 40 demo 就到 60% 成功率,是 2024 年 humanoid imitation 的标杆数字。

局限

  1. 手部 shadowing 仅 10 Hz:HaMeR 慢于 body(25 Hz),高频手指任务(弹琴、快抓)受限。
  2. HST 只控 body 19 DoF,hand 直接 passthrough:hand 没有 learned policy,碰到手的复杂接触(如捏小物体)无稳健性保障。
  3. 每个 skill 单独训一个 HIT:40 demo 一个 policy,6 个任务 6 个 policy,无统一架构(这正是 GR00T N1 / π0 / BFM 之后要解决的"one model many skills"问题)。
  4. 依赖双目 RGB:单目(Monocular HIT)成功率高掉,说明深度感知是硬需求。
  5. Wear-a-Shoe 仅 60%:长程多阶段任务仍脆弱,单步失败整个 episode 失败。
  6. 论文未明示:transformer 层数 / hidden dim / attention head、SLERP 重定向细节、hand-body 异步同步策略、训练硬件(GPU 数 / 时长)、AMASS 过滤阈值。

复现要点

基于 PDF + 开源代码 github.com/MarkFzp/humanplus

  • 仿真器:Isaac Gym(论文未明说但开源代码用 IsaacGym)。
  • AMASS retargeting:直接 SMPL-X Euler 角拷贝到 19 DoF,不需 IK;hand 取 middle joint 旋转。
  • HST 训练:PPO,context length 8,输入 proprioception + target pose,输出 19 DoF setpoint;hand targets 直接进 PD 不经 policy。reward 必须包含 feet contact match + feet slipping penalty,否则步态漂浮。
  • Domain randomization:必须加 control delay [20,40] ms 和 motor strength [0.8,1.1],否则真机不稳。
  • HST 部署:50 Hz,proprioception 仅 onboard(IMU + 编码器),不需要相机。
  • shadowing:单 RGB → WHAM(body 25 Hz)+ HaMeR(hand 10 Hz)→ retarget → HST。需要 RTX 4090 级 GPU 才能实时。
  • HIT 训练:基于 ACT 改 decoder-only,输入双目 ResNet feature + proprioception + positional embedding,输出 50 步 target pose chunk。必须加 image feature L2 auxiliary loss(预测对应位置的未来 image feature tokens),否则会过拟合 proprioception。
  • HIT 部署:25 Hz,预测的 image feature tokens 丢弃,只发 target poses 给 HST(异步)。
  • 常见坑:(1) 坐姿不走 policy(直接发 target 到 PD),否则接触仿真爆炸;(2) 单目视觉在需要深度的任务上失败;(3) ACT baseline 会在子任务后陷入"反复抓空"——这是 overfit proprioception 的典型表现,是 HIT 想避免的。

相关

  • 建立在:ACT/ALOHA [Zhao et al. 2023](action chunking + transformer BC)、AMASS [Mahmood et al. 2019](人类动捕数据集)、WHAM [Shin et al. 2024]、HaMeR [Pavlakos et al. 2024]、PPO。
  • 同期:OmniH2O [He et al. 2024, arXiv:2406.08858](teleop 路线对照)、ExBody [Cheng et al. 2024](AMASS 训 humanoid 低层)、H2O [He et al. 2024, arXiv:2403.04436](论文正文 [31] 直接引用的全身 teleop 前作)。
  • 直接引出HOVER [He et al. 2024, arXiv:2410.21229](多模式统一)、BeyondMimic [Liao et al. 2025](可扩展 tracking + diffusion)、HumanoidVLAGR00T N1(一个模型多技能)。
  • 本仓库笔记交叉引用
  • T07-humanoid-teleop-stack.md(shadowing 是 teleop 新范式)
  • T10-vla-wbc-integration.md(HST+HIT 是分层 VLA+WBC 早期实例)
  • T11-dexterous-manipulation.md(hand 部分)
  • P-OmniH2O-2024.md(同期 teleop 对照)
  • P-HOVER-2024.md(后续多模式统一架构,不同作者团队 He et al.)