⏱ ~90 min

T12 · 敏捷 Locomotion(Parkour 链 + 剧烈动作)

演进图

核心问题:机器人怎么学会跳跃、攀爬、钻越、翻滚、踢打这类接近极限运动的高动态动作?为什么这些动作和「平稳走路」是完全不同的两个世界?剧烈动作的 sim-real gap 是不是本质上无解?
状态:🟢 活跃(四足 parkour 已成熟,人形 parkour 刚起步,剧烈动作 sim-real 仍是开放前沿)

🎯 你将学到什么
1. 看懂敏捷 locomotion(跳跃 / 攀爬 / 翻滚 / 踢打)为什么和「平稳走路」是结构上完全不同的两类控制问题——接触瞬间短、运动学放大系数极高
2. 掌握四足 parkour 的三种范式对极:Extreme Parkour「感知越简 policy 越统一」 vs ANYmal Parkour「感知越准 skill 越专」 vs Parkour-in-the-Wild「训练分专家部署单 policy」
3. 能解释 asymmetric imitation + dual distillationDAgger + BC + MTS)+ ROA 如何让单相机单 policy 涌现跳 / 爬 / 钻 / 倒立多极限 skill
4. 理解剧烈动作 sim-real 的四次转向(DR → system ID → RMA → ASAP residual delta),以及为何 DR 在剧烈动作上明显不够
5. 学会辨析稳定 walking vs 敏捷 parkour 在接触特征 / reward 形态 / 感知需求 / sim-real 难度 / 失败模式 / recovery 需求六个维度的本质差异

本页内容

基础解释

一句话直觉

走路和跑酷不是同一件事的两个难度档。

稳走时脚轻轻落地,偏差被腿吸收。

跳起来时只有零点零一秒的足底接触,角度差一点就飞过头。

敏捷之于稳走,就像跑酷之于散步。

散步容错高,跑酷一次失误就是自由落体。

从基础理解

要解决的问题

让机器人学跳、爬、钻、翻滚这类接近极限的动作 📎

这些动作和平稳走路不是同一个问题的两个难度档。

它们在结构上就是两类控制问题。

为什么是两个世界

稳走靠连续、准静态、低放大的接触。

一只脚轻轻落地,偏差被腿的柔顺吸收。

敏捷动作的接触瞬间极短,运动学放大系数极高。

零点零一秒的足底角度偏差,会让整个腾空轨迹完全不同 📎

所以稳走的奖励拿到跳跃上立刻崩溃。

"保持直立"项会惩罚腾空。

"能耗最小"项会惩罚爆发力。

演进脉络

  • 思想起源是单策略多步态。一份工作证明单一控制器能在运行时切换走、跑、蹦。
  • 分水岭是极限跑酷。一颗前向深度相机加单一策略,让廉价机器学会跳两倍身高、跨两倍体长、倒立 📎
  • 对偶路线是把感知做强、把技能做专。另一条线用多相机加激光雷达融合出精确地形。技能显式拆成跳、爬、蹲几个,由感知触发切换 📎
  • 折中是多专家蒸馏加强化学习微调。训练时分专家,部署时单策略 📎
  • 人形跑酷才刚起步。重心高、双脚窄,失误没有四条腿保命。
  • 剧烈动作迁真机要新招。域随机化覆盖不了这么细的接触,残差方法登场 📎

方法核心(大白话)

核心招数叫非对称模仿。

老师看全景——特权地形、接触、姿态真值——做示范。

学生只看本体感受加一张深度图,照着学。

两者看到的完全不同,但对齐到同一组动作。

多技能塞进一个策略,靠奖励和蒸馏编排。

剧烈动作仿真对不上真机时,让仿真器自己学一个"修正项"补 gap 📎

一句话类比

敏捷之于稳走,就像跑酷之于散步。

前者容错为零,一次失误就是自由落体。

一、这条线索在解决什么

四足 locomotion 在 2022 年前后已经把「稳走」做到了工业级——ETH 三件套(system ID + teacher-student + DR + curriculum)让 ANYmal 在野外森林、雪地、工地上长时间部署。看起来问题「解决了」。但只要把任务从「稳走」推到「跳起来」,整条技术栈立刻显得苍白:稳走依赖的是连续、准静态、低运动学放大的接触——一只脚轻轻落地,接触偏差被腿的柔顺吸收;而跳跃、攀爬、翻滚这类敏捷动作(agile locomotion / parkour)的共同特征是「接触瞬间短、运动学放大系数极高」——0.01 秒的足底接触角度偏差,会让整个腾空轨迹完全不同,落地不是过头就是不到位。

这是为什么本线索必须独立于 T01(sim-to-real)和 T03(reward)单独存在:敏捷动作和平稳走路不是同一个问题的两个难度档,而是两类结构上完全不同的控制问题。它们在 reward 形态、感知需求、policy 容量、sim-real 难度上都有质变。把 parkour 当成「在平地 walking 上加大障碍」是常见误解——Extreme Parkour、ANYmal Parkour 这一系列工作之所以重要,正是因为它们发现 agile 与 stable 在训练范式上需要彻底分家。

本线索聚焦三个维度:(a) 敏捷性——多极限 skill 怎么从单一 policy 涌现、怎么用 motion prior / 蒸馏编排;(b) 感知-动作耦合——高速运动下感知延迟与执行频率的矛盾;(c) 剧烈动作的 sim-real 物理——DR 够不够、ASAP 的 residual delta 路线是否是新范式。与 T01 的边界:T01 讲 sim-to-real 的迁移机制本身(DR/system-ID/RMA/ASAP);本线索只在涉及敏捷动作时引用 sim-real 手段,重点在敏捷性的运动学结构与多技能编排。与 T04(motion prior)的边界:T04 讲 reference motion 怎么进入 policy;本线索讲 reference 被用来支撑的敏捷技能本身

二、时间线(关键转折点)

四足 parkour 这条线从 2022 年开始爆发。最早的伏笔是 MIT 的 Walk These Ways [Margolis et al. 2022, CoRL]——它没有跳,但提出了 MoB(Multiplicity of Behavior):单一 controller 在运行时通过 command vector 调出多种步态(走、跑、蹦、跳高)。这是「单 policy 多技能」思想第一次成形,为后来的 unified parkour policy 铺路。

真正的转折是 2023 年的 CMU Extreme Parkour [Cheng et al. 2023, arXiv:2309.14341](详见 P-ExtremeParkour-2023.md)。它用一颗前向深度相机 + 单一 unified policy,让廉价 A1 学会跳 2 倍身高、跨 2 倍体长、跑倾斜坡、倒立。核心机制是 asymmetric imitation + dual distillation:teacher 在仿真里看特权信息(scandots、接触、base 真值),student 只看本体感受 + 单张深度图;二者观测空间彻底错配,却要对齐同一组动作。蒸馏走两条路:动作走 DAgger、朝向走 BC + multi-step supervision(MTS)。配合 unified inner-product reward + ROA(Regularized Online Adaptation,RMA 路线) 两阶段训练,单一 policy 涌现出跳/爬/钻/倒立。这是 parkour 从「多 specialist」走向「unified generalist」的分水岭。

⚠️ 关于 ROA / 蒸馏 / reward 的常见误读:ROA 在论文里是 Regularized Online Adaptation(Kumar et al. RMA 路线的延续,PDF 引用 [9][10]),不是网络上偶尔流传的 "Reach-on-Access"。Phase 2 蒸馏只走 DAgger(action)+ BC(heading),没有「特权重建 head」「vision encoder 预测 teacher heightmap」这类组件;多 skill 也不是靠「Implicit Alert 隐式开关」切换,而是靠 unified inner-product reward + 显式 walking flag $W$ 涌现。详见 P-ExtremeParkour-2023.md

几乎同期的 ETH ANYmal Parkour [Hoeller et al. 2023, arXiv:2306.14874] 走了另一条路——把感知做强而非做简:6 个 RealSense + Velodyne LiDAR 点云喂给 3D voxel encoder-decoder neural scene representation(coarse 12.5 cm 自回归 + high-res 6.25 cm 双分辨率),输出再派生出 2.5D elevation map 喂给 locomotion。locomotion policy 单阶段训练(直接吃 elevation map + ≤7.5 cm 扰动),不走 teacher-student 蒸馏——teacher-student 是前作 ANYmal-C [7] 的路线。policy 显式拆成 walk / jump / climb up / climb down / crouch 五个 specialist skill,由 navigation policy 的 categorical output 学出切换(不做 perception pipeline 硬规则触发)。它的 philosophy 是「感知越准、skill 越专」,与 CMU 的「感知越简、policy 越统一」形成鲜明对照。ANYmal Parkour 发表在 Science Robotics 2024,是把 parkour 推到「工程化可重复」的代表(详见 P-ANYmalParkour-2023.md)。

但 unified 和 specialist 都面临同一个问题:技能一旦变多(>4 个),reward 互相干扰、policy 容量撑不住。2025 年的 Parkour in the Wild [Rudin et al. 2025, arXiv:2505.11164] 给出第三种范式:多专家蒸馏 + RL fine-tune。Stage 1 用 DAgger 把多个 specialist(jump、climb、crawl、leap……)蒸馏进一个 generalist student;Stage 2 用 RL fine-tune 在野外数据上恢复 specialist 各自的极限性能 + 学会泛化。它把 CMU 的「unified reward」和 ETH 的「specialist」折中——训练时分专家、部署时单 policy,并且 outdoor 验证。

人形 parkour 是 2025 才真正启动的新战线。难点是人形的重心高、双脚支撑相窄、一旦失误没有「四条腿保命」。早期工作如 Humanoid Parkour Learning(Ziwen Zhuang 团队)用 single vision-based end-to-end WBC policy 实现了跳上 0.42 m 平台、跨栏、0.8 m/s 跑,是首个人形 parkour 真机 demo。2026 年 Hiking in the Wild [Zhu, Zhuang et al. 2026, arXiv:2601.07718] 把它推到「scalable perceptive parkour for humanoid hiking」;同期 Perceptive Humanoid Parkour (PHP) 用 motion matching 把多个动态 skill 串联成长程 parkour。但整体上人形 parkour 仍处在「单 skill 能 demo、连续 chaining 还摔」的阶段。

剧烈动作的 sim-real 是另一道独立难题。DR 在敏捷动作上明显不够——接触瞬间的偏差太细,DR 范围再宽也覆盖不到。2025.02 的 ASAP [He et al. RSS 2025, arXiv:2502.01143] 提出 residual delta dynamics:先在仿真训 motion tracking policy,部署真机收集 $(s_t, a_t, s_{t+1}^{\text{real}})$,训一个 transformer 学一个 delta action $\Delta a$,使修正后的仿真 $\hat{s}_{t+1} = f_{\text{sim}}(s_t, a_t + \Delta a)$ 对齐真机,再用「修正过的仿真器」fine-tune policy(详见 P-ASAP-2025.md)。这是 sim-to-real 哲学的第四次转向(详见 T01 转折 6),对剧烈动作是当前最强答案。

最后两条支线:Fall recovery(摔倒起身)和多技能统一。前者由 PHC [Luo et al. ICCV 2023, arXiv:2305.06456] 在仿真里率先做出 perpetual control + 自然起身(详见 P-PHCUHC-2023.md),真机端的 Learning Getting-Up Policies [He et al. 2025, arXiv:2502.12152] 在 Unitree G1 上首次实现 human-sized 人形真机起身——两阶段 RL(先无约束学滚翻/起身、再 refine 到真机可部署)。后者由 Walk-These-Ways MoB 思想延伸到 BeyondMimic [Liao et al. CoRL 2025, arXiv:2508.08241]:可扩展 RL motion tracking + guided diffusion,从人类动捕学到通用、自然、高动态 whole-body 控制,是当前人形多技能统一的最远端(详见 P-BeyondMimic-2025.md)。

三、关键转折的深度解析

转折 1:从「稳走」到「敏捷」——为什么是两个世界(2022, Walk These Ways)

前作的缺陷:ETH 三件套的 walking policy 在 reward 设计上以「追踪参考速度 + 保持 upright + 能耗最小」为核心。这种 reward 在低速、连续接触下工作,但一旦要求机器人跳起来,reward 信号立刻崩溃——「upright」项会惩罚腾空相、「能耗」项会惩罚爆发力。本质问题是稳走 reward 假设了「任何时候都贴地」,而敏捷动作必然有腾空。

新方法的核心 ideaWalk These Ways [Margolis et al. 2022] 不做 parkour,但提出一个关键思想——单一 policy 可以通过 command vector 在运行时切换步态(MoB,Multiplicity of Behavior)。command 包括步频、duty factor、足摆幅等 gait 参数,policy 学会按 command 输出对应步态。这意味着 policy 容量足够容纳多种行为,只差如何「触发」。

为什么是突破:它打破了「一个 policy 一种步态」的旧观念,证明了 generalist controller 在四足上的可行性。后续 Extreme Parkour 的 unified policy、Parkour-in-the-Wild 的蒸馏式 generalist 都建立在「单 policy 多行为」的前提上——这个前提是 MoB 第一次证实的。

💡 核心洞察:MoB(Multiplicity of Behavior)是 parkour 范式分离的真正起点——它打破「一个 policy 一种步态」的旧观念、证明 generalist controller 可行,后续 Extreme Parkour 的 unified policy 与 Parkour-in-the-Wild 的多专家蒸馏都建立在这个前提之上。

留下的新问题:MoB 的 command 是连续步态参数,无法处理离散 skill(跳 vs 爬)。从「连续步态调参」到「离散极限 skill」的跨越,留给 Extreme Parkour。

转折 2:Extreme Parkour——asymmetric imitation 的分水岭(2023)

前作的缺陷:要学极限 parkour,要么走多 specialist(ETH 路线,感知昂贵、skill 切换生硬),要么走纯本体感受(盲走,跳不起来)。两条路都卡在「单深度相机 + 单 policy 学不会多极限 skill」。

新方法的核心 idea:见 P-ExtremeParkour-2023.md。要点是 asymmetric imitation + dual distillation——privileged teacher(看 scandots、接触、base 真值)→ student(仅本体感受 + 单张深度图),二者观测空间彻底错配但动作对齐。动作蒸馏走 DAgger、朝向蒸馏走 BC + MTS。配合 unified inner-product reward、ROA(Regularized Online Adaptation,RMA 路线)两阶段训练,单一 policy 涌现出跳/爬/钻/倒立。

为什么是突破:(1) 首次证明单相机 + 单 policy 能达多极限 skill;(2) <20 小时单 GPU 训完,全开源,parkour 民主化;(3) asymmetric imitation 范式被后续几乎所有 parkour 工作继承。

💡 核心洞察:Extreme Parkour 的 asymmetric imitation 是 parkour 范式分水岭——teacher 看特权信息(scandots/接触/base 真值)、student 只看本体感受+单张深度图,二者观测彻底错配却要对齐同一组动作;这一「特权-非特权」蒸馏骨架让单相机单 policy 学会跳 2 倍身高,被后续几乎所有 parkour 工作继承。

留下的新问题:unified reward 多 skill 互相干扰、单深度相机在反光/暗光下失效、剧烈接触 sim-real gap 未解决、失误即摔无 recovery。

转折 3:ANYmal Parkour——感知做强、skill 做专的对偶路线(2023)

前作的缺陷:Extreme Parkour 的单深度相机 + unified policy 在感知精度和 skill 数量上都有上限——相机一瞎就摔、skill 一多 reward 就打架。

新方法的核心 ideaANYmal Parkour [Hoeller et al. 2023, arXiv:2306.14874] 反向操作——感知越准、skill 越专。perception module 是基于前作 [3] 的 3D voxel encoder-decoder neural scene representation,关键改造为多分辨率:coarse 网络(voxel 12.5 cm、map 4 m³、带自回归反馈——能跨帧累积证据,钻进桌下后仍记得头顶有桌子)+ high-res 网络(voxel 6.25 cm、map 2 m³、不做自回归,输入已含 coarse 末层特征);elevation map 只是从 3D 重建派生出的 2.5D 中间格式喂给 locomotion,不是感知主路径。locomotion policy 单阶段训练(直接吃 2.5D elevation map + 单点噪声 + ≤7.5 cm 三轴位移扰动),不走 teacher-student 蒸馏——teacher-student 是前作 ANYmal-C [7] 的路线,本论文没用。policy 显式拆成 walk / jump / climb up / climb down / crouch 五个 specialist skill(climb 拆 up/down 是因为 reward、termination、训练场景都不同——climb down 必须加高冲击力 termination 防学到「直接跳下」,climb up 允许 knee/base 接触),每个 skill 单独训练、reward 不互相干扰。关键改造:symmetry augmentation——基于 [44] 的对称 duplication 但解决了 off-policy 收敛问题(作者把原动作概率直接赋给所有对称变体,等价 warm bootstrap),让 position-based 训练不致于只学前向、遇后向就绕掉。skill 切换由 navigation policy 的 categorical output 学出——作者修改 PPO actor 最后一层 split 成 Gaussian(连续 command)+ Categorical(5 skill 选择概率)两支,部署时取 Gaussian 均值 + categorical argmax;perception module 只提供 latent belief state,不做硬规则触发。

为什么是突破:它把 parkour 推到「工程化可重复」水平(Science Robotics 2024),证明精确感知 + specialist 切换在真实户外可靠工作。与 Extreme Parkour 形成 philosophy 对照:做感知还是做 policy 统一,是 parkour 设计的两个对极。

💡 核心洞察:Extreme Parkour 与 ANYmal Parkour 构成 parkour 设计的两个对极——「感知越简、policy 越统一」 vs 「感知越准、skill 越专」,这一对照首次显式化「感知投入与 policy 统一性」的权衡,至今仍是新 parkour 工作选型的底层坐标系。

留下的新问题:specialist 切换生硬(不能 chaining);LiDAR + 多相机昂贵、不利于小人形;skill 数量继续增长时 specialist 训练成本线性涨;整套 pipeline 含 8 个神经网络 + 串行依赖,迭代成本高(作者明确写「未来需要 simultaneous training」)。

转折 4:Parkour in the Wild——多专家蒸馏 + RL fine-tune 的折中(2025)

前作的缺陷:unified policy(CMU)skill 多了打架;specialist(ETH)skill 多了切换生硬、不能 chaining。两者都卡在「想要单 policy 又想保极限性能」。

新方法的核心 ideaParkour in the Wild [Rudin et al. 2025, arXiv:2505.11164] 分两阶段。Stage 1 多专家蒸馏:先训一组 specialist(jump、climb、crawl、leap……每个用 Extreme Parkour 式 asymmetric imitation 训),再用 DAgger 把它们蒸馏进一个 generalist student——student 学到的是「在什么地形下做什么 skill」的统一映射。Stage 2 RL fine-tune:用 RL 在 specialist 数据 + 野外地形上继续优化 generalist,恢复蒸馏损失的极限性能 + 学会分布外泛化。

为什么是突破:它把 unified 和 specialist 的优点合并——训练时分专家(reward 不打架)、部署时单 policy(无切换)、且通过 RL fine-tune 在户外验证。作者强调「general and extensible」:新 skill 加进来只需训一个新 specialist 再蒸馏,不必重训整个 policy。

留下的新问题:specialist 训练成本仍是 N 倍;蒸馏有信息损失,RL fine-tune 阶段需要谨慎 curriculum;chain 长了仍会累积误差。

转折 5:人形 Perceptive Parkour——重心高、双脚窄的新战场(2025-2026)

前作的缺陷:四足 parkour 的所有 trick(unified policy、specialist、多专家蒸馏)都建立在「四条腿保命」的前提上——失误时四足总能用三条腿撑住。人形没有这个 safety net:重心高(CoM 在腰部以上)、双脚支撑相窄、单脚支撑相是动态不稳定平衡,一旦失误就是自由落体。

新方法的核心 idea:早期 Humanoid Parkour Learning(Zhuang 团队)用 single vision-based end-to-end WBC policy,让人形跳上 0.42 m 平台、跨栏、0.8 m/s 跑。2026 年 Hiking in the Wild [Zhu, Zhuang et al. 2026, arXiv:2601.07718] 推到 scalable perceptive parkour for humanoid hiking,强调从「reactive proprioception」转向「proactive Perception」。同期 Perceptive Humanoid Parkour (PHP) [Wu et al. 2026, arXiv:2602.15827, RSS 2026] 用 motion matching 把多个动态 skill 串成长程 parkour——这是把四足的「多专家蒸馏」思想在人形上换了个实现(motion matching 取代 DAgger)。

为什么是突破:人形 parkour 从「单 skill demo」迈向「多 skill chaining」,且首次在户外 hiking 这种长程任务上验证。

留下的新问题:人形 parkour 仍处在「单 skill 能 demo、连续 chaining 还摔」的阶段;安全约束(不能摔机器人)让数据收集极困难;与四足相比缺乏成熟 sim-real 基础设施。

转折 6:剧烈动作的 sim-real——DR 不够,ASAP 残差登场(2025)

前作的缺陷:剧烈动作(跳、翻滚、踢打)的接触瞬间短、运动学放大系数高,0.01 秒的接触角度偏差会让整个翻滚轨迹完全不同。DR 覆盖不了这么细的接触分布——DR 范围再宽也只是分布,分布之外的真机一接触就发散。Extreme Parkour 之类的工作本质上是「策略学得很保守」硬扛 gap,并不是真正解决了剧烈动作的 sim-real。

新方法的核心 ideaASAP [He et al. RSS 2025, arXiv:2502.01143] 走「让仿真器学 gap」而非「让策略适应 gap」。三阶段(详见 P-ASAP-2025.md):Stage 1 在标准仿真(MuJoCo/Isaac)训 motion tracking policy(用人类动捕 reference),部署到真机收集 $(s_t, a_t, s_{t+1}^{\text{real}})$ 三元组;Stage 2 训一个 transformer delta action model 预测 $\Delta a$,使修正后的仿真 $\hat{s}_{t+1} = f_{\text{sim}}(s_t, a_t + \Delta a)$ 对齐真机 $s_{t+1}^{\text{real}}$;Stage 3 把 delta 模型集成进仿真器,在「修正过的仿真器」里 fine-tune policy,迭代若干轮(最终部署时不需要 delta 模型)。结果:人形实现踢球、跳跃、转体等此前迁不过去的动作。

为什么是突破:这是 sim-to-real 哲学的第四次转向(DR→system-ID→RMA→ASAP,详见 T01)。它把 gap 当成可学习的残差动力学,用 learned delta 替代人工逐项 system ID——既保留精确性又避免人工调参。对剧烈动作是当前最强答案。

💡 核心洞察:ASAP 的范式跃迁是把 sim-real gap 从「分布(DR)→ 时变量(RMA)」推到「可学习的残差动力学」——让仿真器学 gap 而非让策略适应 gap,这才让踢球/跳跃/转体这类高运动学放大的剧烈动作首次迁得过真机;但随机性接触(沙地)仍是开放前沿。

留下的新问题:delta model 是 transformer,推理成本高;只学确定性 delta,对随机性接触(沙地、碎石)仍困难;迭代轮数和数据量门槛高。

转折 7:Fall Recovery——剧烈动作的「失败兜底」(2023-2025)

前作的缺陷:所有 parkour policy 一旦失误就摔,没有起身能力。剧烈动作的失误率本身就高,没有 recovery 就没法在真机上反复试错收集数据。

新方法的核心 idea:分两支。仿真侧PHC [Luo et al. ICCV 2023, arXiv:2305.06456] 提出 Perpetual Humanoid Control——一个 motion imitator 能从 10k+ 动捕片段学习,并自然恢复 fail-state(摔倒、远离参考)。机制上 PHC 把「fall recovery」当成 motion tracking 的副产品:当 humanoid 偏离参考进入 fail-state,policy 仍能滚动起身并走回参考附近继续追踪(详见 P-PHCUHC-2023.md)。真机侧Learning Getting-Up Policies [He et al. 2025, arXiv:2502.12152] 在 Unitree G1 上首次实现 human-sized 人形真机起身——两阶段 RL:(1) Stage 1 不考虑部署约束,让 policy 自由学滚动/俯卧撑/起身;(2) Stage 2 加入真机约束(关节限位、自碰撞、电机扭矩)refine。

为什么是突破:它补上了剧烈动作的「最后一公里」——即便失误也能恢复,让真机反复试错成为可能。PHC 在仿真里证明了 recovery 可以从 motion tracking 自然涌现;Getting-Up 在真机上证明了人形起身可工程化。

留下的新问题:起身动作仍偏慢(秒级),高速失误(摔下楼梯)来不及;起身 policy 与主 locomotion policy 的平滑切换还没解决。

转折 8:多技能统一——从 MoB 到 BeyondMimic(2022-2025)

前作的缺陷:每多一个 skill 就多训一个 specialist 或多加一项 reward,policy 容量和 reward 调参都线性恶化。能否有一个「motion prior 驱动」的统一框架,让 skill 从数据里涌现?

新方法的核心 ideaBeyondMimic [Liao et al. CoRL 2025, arXiv:2508.08241] 把 motion tracking 和 guided diffusion 结合——可扩展 RL motion tracking 学会追踪大规模人类动捕,guided diffusion 在 motion 空间生成新 skill(详见 P-BeyondMimic-2025.md)。结果是单一框架从人类动作学到通用、自然、高动态 whole-body 控制。关键真机数据:Unitree G1 完成 aerial cartwheel(airborne phase 峰值加速度 31 m/s²、pelvic angular velocity 峰值 20 rad/s、mean 7.01 rad/s——对比 skilled human aerial cartwheel 平均 7.75 rad/s,已达到人类水平),并能连续两次 cartwheel、连续 5 次 Ronaldo celebration jump-turn;GRF(ground reaction force) walking 呈现 heel-strike + push-off 双峰、running 呈现单峰,shape 与人类 force-sensing treadmill 数据对齐。这是 MoB 思想的远端延伸:MoB 用 command vector 调步态,BeyondMimic 用 motion prior + diffusion 生成 skill。

为什么是突破:它把「多技能」从「手工 reward + specialist」推到「motion prior 驱动的生成」,是当前人形 whole-body 多技能的最远端。

留下的新问题:diffusion 推理延迟高,实时控制困难;motion prior 质量决定上限;与 VLA 的接口还在磨合。

2026 最新进展

2026 上半年敏捷 locomotion 沿「步态连续生长 / 多技能无缝切换 / 受限落脚点 hybrid 控制鲁棒 / parkour 长时序编排」四条轴线深化——把「每种步态/技能训一个 specialist」的老路推到收口:

  • GaitSpan:从 walking「生长」出 running(不重训):GaitSpan [Lin et al., arxiv:2607.12114](Stanford + Google LeCAR Lab)是技能成长框架——不重新训练,而是在已训好的 walking policy 基础上「生长」出慢跑/跑;支持连续速度命令、多地形、多形态的灵活扩展。跳出「每种步态训一个策略」或「用步态调度器拼接」的老路,首次把「技能连续生长」做成人形 locomotion 的可扩展范式——直接回应第二节「四足 Walk-These-Ways MoB 思想」的人形版本落地。
  • Switch:图驱动多技能无缝切换:Switch [Lau et al., arxiv:2604.14834](HKUST Tan 组)是层级多技能系统——Skill Graph 基于多技能数据的运动学相似性建立潜在跨技能转移边,全身跟踪策略基于 skill graph 用 RL 训练,online skill scheduler 通过图搜索实时驱动策略执行与平滑切换。解决了现有 whole-body control 难以在任意时刻无缝切换技能的安全性问题;图搜索调度器在跟踪偏离时找最优可行路径——为多技能人形 RL 提供了实用框架。
  • Walk-PLANC:把控制 Lyapunov 结构注入 RL(× T01 hybrid control):Walk-PLANC [Dai et al., arxiv:2601.06286](Caltech Ames 组)用 LIP(Linear Inverted Pendulum,含角动量状态)简化阶次模型在线生成动力学一致的步态目标(落脚点、重心轨迹、step timing、摆动足),通过 Control Lyapunov Function (CLF) reward 把这些结构化目标注入 RL 训练,实现人形在 stepping stones / beams / planks 等受限落脚点上的精确敏捷行走并在硬件验证。把基于物理的控制 Lyapunov 结构以 reward 形式注入 model-free RL,是 hybrid control 与 RL 融合方向的代表性工作——为受限落脚点行走这种长尾场景提供可验证的新范式。
  • Stubborn:跟踪 + fall recovery 合一(解决多阶段割裂):Stubborn [Ren et al., arxiv:2606.12814](SYSU + Shanghai AI Lab)是统一的人形 RL 框架,用非对称 actor-critic 把 motion tracking 与 fall recovery 合一训练。三项关键设计:yaw-aligned 跟踪表示、Bernoulli 概率终止机制鼓励失稳状态探索、概率终止 + 跟踪误差驱动的自适应采样。打破现有方法把跟踪与恢复割裂、多阶段训练且一旦失败立即终止的局限,单策略即可在扰动下保持跟踪并恢复——是 2026 人形 RL 鲁棒性方向的重要方法学进展。同期的 Unified Walking, Running, and Recovery [Lu et al., arxiv:2605.18611] 用 state-dependent AMP 把行走/奔跑/跌落恢复统一进单 policy,是 AMP 状态自适应变体的工程化代表。
  • Perceptive Humanoid Parkour(PHP):长时序技能编排(× T07/T04):PHP [Wu et al., arxiv:2602.15827](UC Berkeley Abbeel + Sferrazzza)是模块化框架:用 motion matching 把多个动态人类技能(跳跃、翻越、爬升)按需串接,配合 RL 蒸馏得到高动态长时序 parkour 策略。在 Unitree G1 上仅靠本体感受 + 单/多相机即可自主穿越多障碍长序列。继 Humanoid Parkour Learning / Hiking-in-the-Wild 之后最有影响力的感知 parkour 工作——把「单技能 policy」推进到「长时序技能编排」,是迈向通用 parkour agent 的关键一步。同期的 OmniXtreme [arxiv:2602.23843] 用「解耦通用运动技能学习 + sim-to-real 物理技能精修」两阶段框架覆盖 parkour、体操等极端动态行为,是 BeyondMimic 之后在「generality vs fidelity」上的关键突破。
  • 人形 parkour 的 2026 突破(多接触 + 长时序 + 主动感知):Locomotion Beyond Feet [Yang et al., arXiv:2601.03607](Stanford,Shuran Song / C. Karen Liu)让人形用脚之外(手、膝、肘)的全身接触穿越低净空墙与陡梯,跳出「只用脚」范式——把 parkour 从「双脚敏捷」扩到「全身多接触穿越」;ParkourFormer [Mai et al., arXiv:2605.25782](HKUST-GZ)用 Transformer + 预测监督做人形 parkour(93.85% 成功率);TAGA [arXiv:2606.05880](SUSTech)学地形感知主动注视(active gaze),真机 1.2m 跨隙。
  • 四足极限敏捷:SSM / MoE 架构进入(× T01):REAL [Liu et al., arXiv:2603.17653](清华)用 FiLM 调制的 Mamba 主干 + 贝叶斯刚体状态估计,在 1m 视觉盲区穿越极限障碍、推理仅 13.1ms,把 state-space 模型引入敏捷运动的长时序记忆;Quadruped Parkour MoE [Ziegltrum et al., arXiv:2604.19344](UCL)用稀疏门控 MoE 在 Go2 上把成功率提到 MLP 的两倍——揭示「不同地形/技能用不同专家」的稀疏路由对 parkour 的增益。

📌 关键要点
1. 敏捷动作 vs 平稳走路不是同一问题的两个难度档,而是结构上完全不同的两类控制问题——前者瞬时高运动学放大、后者连续准静态低放大,reward / 感知 / sim-real 都需分家
2. Extreme Parkour 是分水岭:asymmetric imitation + dual distillation 让单深度相机 + 单 policy 学会跳 2 倍身高 / 跨 2 倍体长 / 倒立,<20 小时单 GPU 训完全开源让 parkour 民主化
3. ANYmal Parkour 走对偶路线:3D voxel encoder-decoder + 5 specialist skill + navigation policy categorical 切换,把 parkour 推到「工程化可重复」(Science Robotics 2024)
4. ASAP 的 residual delta dynamics 是剧烈动作 sim-real 的第四次转向——让仿真器学 gap(delta action model)而非让策略适应 gap,对踢 / 跳 / 转体是当前最强答案;但随机性接触(沙地)仍开放
5. 人形 parkour 是 2025 才启动的新战线——重心高、双脚支撑窄、失误没「四条腿保命」;当前处在「单 skill 能 demo、连续 chaining 还摔」阶段,PHP / Hiking-in-the-Wild 是最新代表

四、相似概念辨析

维度Extreme Parkour(CMU)ANYmal Parkour(ETH)Parkour-in-the-Wild(ETH 2025)
感知单前向深度相机多相机 + LiDAR → 3D voxel encoder-decoder(coarse 12.5 cm + high-res 6.25 cm,派生 2.5D map)继承 ANYmal 感知 pipeline
Policy单一 unified policy5 个 specialist + 高层 categorical 切换多专家蒸馏 → 单 generalist + RL fine-tune
Rewardunified inner-product reward每 skill 独立 rewardspecialist 阶段独立、fine-tune 阶段统一
Philosophy感知越简、policy 越统一感知越准、skill 越专训练分专家、部署单 policy
局限多 skill reward 干扰specialist 切换生硬、8 网络串行specialist 训练 N 倍成本
维度Domain Randomization(DR)RMA(在线适应)ASAP(残差 delta)
对 gap 的假设gap 是分布gap 是可推断的时变量gap 是可学习的残差动力学
剧烈动作效果不够(接触太细)不够(秒级适应太慢)当前最强(学确定性 delta)
随机性接触(沙地)部分有效部分有效仍困难(只学确定性)
部署时开销temporal conv 推理transformer delta 推理
维度稳定 walking敏捷 parkour
接触特征连续、准静态、低放大瞬时、动态、高运动学放大
Reward 形态速度追踪 + upright + 能耗unified 多 term / specialist 独立
感知需求本体感受可「盲走」必须看见障碍(深度/heightmap)
Sim-real 难度ETH 三件套已解决DR 不够,需 ASAP
失败模式慢慢偏 → 摔瞬间偏 → 自由落体
是否需要 recovery一般不需要必须有(Getting-Up)

五、与其他线索的交叉点

  • 与 T01 sim-to-real:转折 6(ASAP)在机制上完全属于 T01 转折 6,本线索只在「剧烈动作为什么需要 ASAP」处引用。两者重叠但视角不同——T01 讲 sim-real 哲学演进,本线索讲敏捷动作的物理结构为什么需要这种演进。
  • 与 T04 motion prior:转折 5(人形 parkour 的 motion matching)、转折 8(BeyondMimic 的 guided diffusion)都依赖 motion prior 作为 skill 来源。motion prior 是敏捷动作的「目标供给方」。
  • 与 T10 VLA-WBC:人形 parkour policy 本质是一种 WBC,是 VLA 的底层执行器。VLA 给「跳过那个台阶」的指令、parkour policy 落地到真机,接口稳定性是开放问题。
  • 与 T07 humanoid teleop:Getting-Up、ASAP、人形 parkour 的真机数据收集依赖遥操作(OmniH2O/HOVER)采集 reference motion。遥操作是敏捷动作的「数据入口」。

六、当前局限与开放问题

  1. 剧烈动作 sim-real 是否本质无解? 当前答案是「部分可解、随机性接触仍开放」。ASAP 用 learned residual delta 解决了确定性剧烈动作(踢、跳、转体),证明了 sim-real gap 不是不可学,而是需要在线学习真实物理。但对沙地、碎石、软泥这类随机性接触,delta model 只能学到均值,方差部分仍迁不过去。判断:不是本质无解,但需要 stochastic residual + 可微分接触模型才可能彻底解决,目前还没有工作做到。
  2. 人形 parkour 的安全约束。真机失误就摔机器人,数据收集极昂贵;sim 里训出来的 policy 在真机上的「失败率-性能」曲线还没摸清。可能方向:低成本人形(Berkeley Humanoid)+ 安全吊架 + 大规模 sim 预演。
  3. 感知-动作延迟下的高速运动。敏捷动作的接触瞬间常 <50ms,而 onboard 感知 pipeline(深度相机 + 推理)延迟常在 30-80ms。这意味着 policy 看到的是「过去的障碍」,跳到的是「未来的位置」。当前工作用 history encoder 隐式补偿,但没显式建模延迟。可能方向:predictive perception(用 world model 预测障碍未来位置)。
  4. 单 skill → 连续多 skill chaining。四足 parkour 已能 chaining(Parkour-in-the-Wild),人形还卡在单 skill demo。核心难点是 skill 之间的「过渡态」没有 motion prior 覆盖。可能方向:motion matching + diffusion 在过渡态生成填补动作。
  5. unified policy 的容量极限。skill 数量继续增长(>10),单 policy 是否还能保持极限性能?Parkour-in-the-Wild 的「蒸馏 + fine-tune」是否是终局,还是会被 motion-prior 驱动的生成式(BeyondMimic)取代?开放。

七、涉及里程碑论文

  • [Margolis et al. 2022] Walk These Ways: Tuning Robot Control with Multiplicity of Behavior (CoRL 2022 · 仅 PMLR proceedings,无 arXiv) —— 单 policy 多步态运行时调参,generalist policy 思想起源。
  • [Cheng et al. 2023, arXiv:2309.14341] Extreme Parkour with Legged Robots (ICLR 2024) —— asymmetric imitation 分水岭,单相机单 policy 多极限 skill。详见 P-ExtremeParkour-2023.md
  • [Hoeller et al. 2023, arXiv:2306.14874] ANYmal Parkour (Science Robotics 2024) —— 3D voxel encoder-decoder + 5 specialist skill + 高层 categorical 切换的对偶路线。详见 P-ANYmalParkour-2023.md
  • [Rudin et al. 2025, arXiv:2505.11164] Parkour in the Wild —— 多专家蒸馏 + RL fine-tune,general+extensible。
  • [Luo et al. 2023, arXiv:2305.06456] Perpetual Humanoid Control (PHC) (ICCV 2023) —— 仿真侧自然 fall recovery,perpetual control。详见 P-PHCUHC-2023.md
  • [He et al. 2025, arXiv:2502.01143] ASAP: Aligning Simulation and Real-World Physics (RSS 2025) —— residual delta dynamics,剧烈动作 sim-real 突破。详见 P-ASAP-2025.md
  • [He et al. 2025, arXiv:2502.12152] Learning Getting-Up Policies for Real-World Humanoid Robots (CMU LeCAR Lab) —— 首个 human-sized 人形真机起身。
  • [Zhu, Zhuang et al. 2026, arXiv:2601.07718] Hiking in the Wild: A Scalable Perceptive Parkour Framework for Humanoids —— 人形 scalable perceptive parkour。
  • [Liao et al. 2025, arXiv:2508.08241] BeyondMimic (CoRL 2025) —— motion tracking + guided diffusion,多技能统一的远端。详见 P-BeyondMimic-2025.md

八、常见误读与边界说明

  1. ANYmal Parkour 不是 teacher-student 蒸馏。原文 Sec.IV.B.2 明确「locomotion 单阶段训练,直接吃 perception 输出的 2.5D elevation map + ≤7.5 cm 扰动」;teacher-student 是前作 ANYmal-C [7] 的路线,本论文未用。
  2. ANYmal Parkour 感知主路径是 3D voxel encoder-decoder,不是 heightmap。原文 Sec.IV.B.1 明确「multi-resolution encoder-decoder inspired by [3]」,coarse 12.5 cm + high-res 6.25 cm 双分辨率,coarse 带自回归反馈;elevation map 只是从 3D 重建派生出的 2.5D 中间格式喂给 locomotion(出于 50 Hz 高频推理成本)。
  3. ANYmal Parkour 有 5 个 specialist skill(非 4 个)。原文 Sec.II.A / Sec.IV.B.2 明确列出「walk / jump / climb up / climb down / crouch」;climb 拆 up/down 是因为 reward、termination、训练场景都不同。
  4. Extreme Parkour 的 ROA 是 Regularized Online Adaptation(Kumar et al. RMA 路线,PDF 引用 [9][10]),不是网络上流传的 "Reach-on-Access";Phase 2 蒸馏只走 DAgger(action)+ BC(heading),无任何重建 head;多 skill 由 unified inner-product reward + 显式 walking flag $W$ 涌现,无「Implicit Alert」开关。
  5. 与 T01 的边界:转折 6(ASAP)在 T01 转折 6 也出现,两文档各自侧重不同维度——T01 讲 sim-real 哲学演进,T12 讲敏捷动作的物理结构为什么需要这种演进。

可选复盘:常见误区

澄清:"跑酷就是平稳走路加难一点的地形" —— 错。稳走是连续、准静态、低放大接触;跑酷是瞬时、高放大接触 。两者在奖励形态、感知需求、失败模式上都质变。

"跑酷就是平稳走路加难一点的地形" —— 错。稳走是连续、准静态、低放大接触;跑酷是瞬时、高放大接触 📎。两者在奖励形态、感知需求、失败模式上都质变。

它们是两类结构不同的控制问题,不是同一问题的两个难度档。

澄清:"域随机化能解决跑酷的迁真机 gap" —— 不够。剧烈动作的接触瞬间太细,域随机化范围再宽也只是分布,分布之外的真机一接触就发散 。

"域随机化能解决跑酷的迁真机 gap" —— 不够。剧烈动作的接触瞬间太细,域随机化范围再宽也只是分布,分布之外的真机一接触就发散 📎

剧烈动作需要让仿真器学真实物理,不只是把策略练鲁棒。

澄清:"单策略多技能就是把多个专家拼起来" —— 不一定。一条线是单一策略靠统一奖励涌现多种技能(极限跑酷)。另一条是多个专家显式切换(感知做强路线) 。

"单策略多技能就是把多个专家拼起来" —— 不一定。一条线是单一策略靠统一奖励涌现多种技能(极限跑酷)。另一条是多个专家显式切换(感知做强路线)📎

"统一派"和"专家派"是两种哲学,不是一回事。

可选复盘:检查点

Q1

为什么"稳走"和"跑酷"是两类控制问题,而不是同一问题的两个难度档?请从接触的角度说。

查看参考答案
  • 稳走的接触:连续、准静态、低运动学放大。一只脚轻轻落地,偏差被腿的柔顺吸收。
  • 跑酷的接触:瞬时、动态、高运动学放大。零点零一秒的足底角度偏差,会让整个腾空轨迹完全不同。
  • 结论:两者在奖励形态、感知需求、失败模式上都质变,不是同一条曲线上的两个点——所以'加大障碍'的思路做不出跑酷。
Q2

用"跑酷之于散步"的类比,向没学过机器人的朋友解释:敏捷动作为什么一次失误就是自由落体?

查看参考答案
  • 类比锚:散步=稳走(脚始终贴地,容错高,歪一点也能稳住);跑酷=敏捷(大量腾空相,靠瞬间接触发力)。
  • 为什么一次失误就是自由落体:腾空相里没有支撑,一旦起跳角度或力度差一点,落地位置完全不可挽回——不像散步可以随时停或调整。
  • 映射回机器人:高运动学放大 + 接触瞬间短 = 误差被急剧放大,没有'慢慢纠正'的余地。
Q3

非对称模仿里,老师和学生看到的有什么不一样?为什么这样设计?

查看参考答案
  • 老师看全景/特权信息:特权地形几何、接触状态、姿态真值(仿真里才有)。
  • 学生只看本体感受加一张深度图(真机上拿得到的信息)。
  • 为什么这样设计:让老师在仿真里用'上帝视角'学出高质量示范,再蒸馏给只能看真实传感的学生;学生对齐到同一组动作,部署时不依赖特权信息。
Q4

域随机化在跳跃这种动作上为什么不够用?

查看参考答案
  • 原因:剧烈动作的接触瞬间太细(毫秒级、高放大),域随机化范围再宽也只是覆盖一个'分布'。
  • 失败模式:分布之外的真机物理,一接触就发散——策略没见过那种确切的接触细节。
  • 对照:稳走靠域随机化能扛(接触模式简单),跳跃不行——所以需要让仿真器自己学真实物理(残差方法)。
Q5

"统一派"和"专家派"是跑酷设计的两个对极,各举一个核心主张。

查看参考答案
  • 统一派(如极限跑酷):感知越简、策略越统一——单相机+单策略+统一奖励,让多技能涌现。
  • 专家派(如感知做强路线):感知越准、技能越专——多相机+激光雷达融合精确地形,技能显式拆成跳/爬/蹲,由感知触发切换。
  • 对照:前者靠策略容量、后者靠感知精度;近年还有'训练分专家、部署单策略'的折中。

可选复盘:FAQ

Q1:人形跑酷为什么比四足跑酷难得多?

四足失误时三条腿还能撑住。人形重心高、双脚支撑窄,单脚支撑是动态不稳定平衡,一旦失误就是自由落体,没有保命网 📎

Q2:剧烈动作摔了怎么办?

得有起身策略兜底。仿真侧证明起身能从动作追踪里自然涌现;真机侧的起身策略首次做到成人形真机起身 📎。起身是剧烈动作的"最后一公里"。

Q3:敏捷动作能像走路一样迁真机吗?

部分能。确定性剧烈动作(踢、跳、转体)用残差方法已经迁过去了 📎。但沙地、碎石这种随机接触,残差模型只能学到均值,方差部分仍迁不过去。本质不是无解,但还没人做到。