⏱ ~21 min
里程碑
⭐ 为何重要

针对 humanoid sim-to-real 的 dynamics gap,提出两阶段方法:用真实数据学一个 residual delta dynamics model 来修正仿真物理,再在修正后的仿真里 fine-tune 策略。让 Unitree G1 学会踢、跳、转等纯仿真学不到的敏捷全身技能,是人形机器人上弥合 sim-real 物理鸿沟的代表性 recipe,延续了 OmniH2O/HOVER 的敏捷化路线。

建立在
机器人Unitree G1
数据集AMASS
上真机
物理感知
实时
输入模态proprioception

ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills

作者 / 机构:Tairan He†, Jiawei Gao†, Wenli Xiao†, Yuanhang Zhang† 等 17 人(†共一)(CMU LeCAR Lab / NVIDIA)
发表:RSS 2025(arXiv 2025.02,v3 2025.04.26)
arxiv:2502.01143 · 代码:github.com/LeCAR-Lab/ASAP · 项目页:agile.human2humanoid.com
在线索中的位置:T01 sim-to-real 第四次转向 + T12 敏捷 locomotion 转折 6
一句话定位:sim-to-real 的第四次哲学转向——不适应 gap(DR)、不缩小 gap(SysID),而是学一个 delta action model 来补偿 gap。让 Unitree G1 学会踢球/跳跃/转体等剧烈动作。

动机

DR 和 SysID 在剧烈动作上都不够:DR 太保守(牺牲敏捷性换鲁棒),SysID 测不准(剧烈运动的接触/惯量/电机响应高度非线性,且常依赖真机扭矩测量,很多硬件平台没有)。剧烈动作的 sim-real gap 本质上是时变、非线性、不可解析的——不能靠参数随机化覆盖,也不能靠有限维 SysID 拟合。

ASAP 的核心思想:不试图消除 gap,而是学一个 delta action model 来补偿 gap。gap 从「要克服的障碍」变成「可学习的残差」。论文 Fig.4 明确区分两种残差建模:(c) delta dynamics(在 state 上加 Δs)与 (d) delta action(在 action 上加 Δa)——ASAP 选 delta action,因为它直接复用 RL策略学习机制,且不破坏仿真器的微分性。

方法核心(基于 PDF Sec.II–III, Fig.2)

论文 abstract 把框架表述为 "two-stage"(pre-training + post-training),Fig.2 把训练阶段展开为三个子阶段;本笔记按 Fig.2 三阶段描述。

Stage 1:仿真预训练 + 真机数据收集(PDF Fig.2 (a), Sec.II–III.A)


人类视频 → TRAM 重建 SMPL → MaskedMimic 物理清洗 → retarget 到 G1
→ 仿真 motion tracking 预训练(asymmetric actor-critic + RSI + termination curriculum)
→ 部署到真机 Unitree G1 → 收集真机轨迹 D_r = {(s_r^0, a_r^0), ..., (s_r^T, a_r^T)}

真机数据采集(PDF Sec.III.A 原文):用动捕设备 + 机器人 onboard 传感器记录每步状态 $s_t = [p_t^{base}, v_t^{base}, \alpha_t^{base}, \omega_t^{base}, q_t, \dot{q}_t]$(base 3D 位置、线速度、姿态四元数、角速度,加 23 维关节位置/速度)。用多个 tracking policy 在真机上 rollout,收集多样化的真实数据。真机数据含 sim-real gap 的「指纹」。

Stage 2:Delta Action Model 训练(PDF Fig.2 (b), Sec.III.B,核心创新)

训一个 delta action model $\pi_\theta^\Delta$,输出补偿动作 $\Delta a_t = \pi_\theta^\Delta(s_t, a_t)$ 加到真机记录动作上:

$$s_{t+1} = f_{sim}(s_t, a_t^r + \Delta a_t)$$

目标是让「修正后的仿真器」下一步接近真机下一步真值 $s_{t+1}^r$。

关键:训练用 RL(PPO),不是监督 MSE。PDF Sec.III.B 原话 "PPO is used to train the delta action policy $\pi_\theta^\Delta$, learning corrected $\Delta a_t$ to match simulation and the real world"。每个 RL step:(1) 机器人初始化在真机状态 $s_t^r$;(2) reward 衡量仿真 $s_{t+1}$ 与真机 $s_{t+1}^r$ 的差异 + 动作幅度正则 $\exp(-\|a_t\|)-1$(reward 细项见 PDF Table II:body position / position-feet / angular velocity / velocity / DoF position / DoF velocity / VR 3-point 等 task reward + action rate/norm 正则 + DoF/torque 极限惩罚 + termination 惩罚);(3) PPO 更新 $\pi_\theta^\Delta$。

真机部署时 delta model 降阶为 4 DoF ankle 模型(PDF Sec.IV.C 原话)。两点原因:(1) 真机数据有限,训全 23 DoF delta 不可行(仿真实验需 >400 episode 才能训出 23 DoF delta);(2) G1 踝关节是机械连杆设计,sim-real gap 最大且最难用传统建模桥接。sim-to-sim 实验(IsaacGym→IsaacSim/Genesis)仍用 23 DoF delta。

delta model 网络架构(transformer / MLPPDF 未明确说明,待核

Stage 3:Policy 微调(PDF Fig.2 (c), Sec.III.C)

冻 $\pi^\Delta$,把它集成进仿真器(每次仿真 step 先过 $\pi^\Delta$ 加 delta),在对齐后的仿真器里用原 reward(PDF Table I)fine-tune motion tracking policy:

$$a_t = \pi_\theta(s_t), \quad s_{t+1} = f^{ASAP}(s_t, a_t) = f_{sim}(s_t, a_t + \pi^\Delta(s_t, a_t))$$

部署时(PDF Fig.2 (d), Sec.III.D)不需要 $\Delta$ model——policy 已经在对齐仿真里学会了应对真机 gap。

为什么这是第四次转向

范式哲学代表对 gap 的态度
DR平均鲁棒OpenAI Hand, ANYmal覆盖 gap
SysID精确标定ETH RaiSim缩小 gap
RMA在线适应RMA, DreamWaQ适应 gap
ASAP学习补偿ASAP学一个 delta action 补偿 gap

ASAP 的关键区别:gap 不是参数级的(DR/SysID 假设),也不是可推断的时变量(RMA),而是函数级的可学习残差——直接学一个网络拟合 gap 函数。PDF Fig.4 明确把 delta action 与 delta dynamics(state 残差)作为两种不同 baseline 区分,DeltaDynamics baseline(Fig.4 (c))用 MSE 监督学 $\Delta s_{t+1} = f_\theta^\Delta(s_t, a_t)$;ASAP 走 Fig.4 (d) 的 delta action 路线。

实验(PDF Sec.IV)

三个迁移场景(PDF Sec.IV 开头):

  1. IsaacGym → IsaacSim(仿真间迁移,验证 delta model 跨仿真器泛化
  2. IsaacGym → Genesis(跨仿真器)
  3. IsaacGym → 真机 Unitree G1(终极验证)

baseline(PDF Sec.IV):Vanilla(直接迁移)、Oracle(同仿真器上下界)、SysID(base CoM shift + link mass offset + PD gain ratios 等参数辨识)、DeltaDynamics(学 state 残差,PDF Fig.4 (c))、ASAP。指标:global MPJPE、root MPJPE、加速度误差 $E_{acc}$、速度误差 $E_{vel}$、成功率(偏离 > 0.5m 判失败)。

真机动作(PDF Fig.1):Ronaldo 庆祝(腾空 180° 转体)、LeBron "Silencer"(单腿平衡)、Kobe 后仰跳投(单腿起跳/落地)、1.5m 前跳、Leg stretching、1.3m 侧跳;Fig.5 还示出 soccer-shooting。ASAP 显著超过 Vanilla / SysID / DeltaDynamics。

为什么重要

  1. 剧烈动作 sim-to-real 的突破:之前 DR 做不了剧烈动作(太保守),ASAP 让 G1 学会跳/转/踢
  2. delta action model 范式:开了一个新方向——gap 是可学习的残差,不依赖精确物理建模
  3. 跨仿真器验证:IsaacGym→IsaacSim→Genesis 的跨仿真器实验,证明 delta model 不是过拟合特定仿真器
  4. 基础设施贡献:开源 multi-simulator training/eval codebase(IsaacGym/IsaacSim/Genesis 统一接口)

局限(部分 PDF Sec.VIII 讨论)

  1. 需要真机数据 + MoCap:Stage 1 要在真机上 rollout,且必须 MoCap 设备记录 base pose——剧烈动作有安全风险。PDF Sec.VIII 明确 "Our pipeline requires MoCap setup to record real-world trajectories... introduces practical deployment barriers in unstructured environments"。论文 future work 提 "MoCap-free alignment"
  2. delta model 数据饥渴:PDF Sec.VIII 坦承训全 23 DoF delta 需 >400 episode;真机实验只训出 4 DoF ankle delta。论文 future work 提 "sample-efficient few-shot alignment"
  3. delta model 泛化:$\Delta$ 是在特定 tracking policy 数据上训的,对新动作/新环境的泛化未充分验证
  4. 随机性 gap:对沙地/碎石等随机性接触,delta model 只能学到均值,方差部分仍迁不过去(T12 讨论过)
  5. 部署 gap 漂移:部署时不用 $\Delta$,若 gap 在部署中变化(电机磨损),需要重新收集数据训 delta

相关

  • 建立在:motion tracking policy(PHC/UHC 谱系)、OmniH2O / HOVER / HumanoidVerse(CMU LeCAR 谱系)、MaskedMimic(数据清洗)、TRAM(视频→SMPL)、phase-conditioned tracking [Peng et al. 2018]
  • 引出:BeyondMimic(diffusion + tracking,延续人形全身敏捷化)。后续工作是否能与 motor foundation(如 SONIC)合流尚属推测,未证实
  • 本仓库线索:T01 sim-to-real 第四次转向、T12 敏捷 locomotion 转折 6
  • 本仓库概念:C-sim2real-methods.md(ASAP 是第四种方法)
  • 本仓库笔记:P-RMA-2021.md(RMA vs ASAP 对比)