⏱ ~49 min

机器人 RL 运动控制 · 研究脉络地图(Roadmap)

截止日期:2026-07-18 · 覆盖范围:2018-2026(近三年为主,奠基工作回溯)
文献规模:923 篇论文 + 748 PDF + 3240 引用边(builds_on/leads_to 标签总数)
配套:HTML 知识网站在 site/,原始数据在 research/data/
本文是一张「视觉知识地图」:一张页面看懂整个领域的分层结构。先看第一节全景图和第二节一句话版,再按第三节九大分区卡片进入感兴趣的方向。


一、领域全景图(一张图看懂)

领域全景:基础设施 → 五大范式 → Foundation Model → 真机部署

三层结构:① 基础设施层(数据 + 仿真,底)→ ② 五大范式层(Locomotion / IL / Motion Prior ⭐ / Action Gen / Teleop,中)→ ③ Foundation ModelVLA + World Model,顶)→ 真机部署。
⭐ 标记用户重点线索 Motion Prior(AMPBFM→SONIC);★ 标记 2026 SOTA


二、一句话版(核心脉络)

数据 + 仿真 → 五大范式 → Foundation Model → 真机部署

机器人 RL 运动控制领域可以压缩成一条单向链:(1) AMASS / OpenX / DROID + Isaac Gym/Lab/Genesis 把数据与训练底座统一化 → (2) Locomotion / IL / Motion Prior / Action Gen / Teleop 五大范式在底座上各立门户,解决「怎么动」「怎么学」「怎么像人」「怎么生成」「怎么采数据」 → (3) VLA + World Model 把所有范式重新组织成「大模型当 policy」形态 → (4) Sim-to-Real + WBC 把模型压到真机上。本文接下来用九张卡片拆解这条链。


三、知识地图(九大分区卡片)

阅读提示:每张卡片 = 图标 + 线索名 + 一句话定位(callout)+ 代表论文 + 演进 SVG/线索入口。从任意感兴趣的卡片切入即可。

🔧 1. 基础设施层 · 数据集 + 仿真

T02 · 数据集基础设施:AMASS → OpenX → DROID + Isaac Gym/Lab/Genesis,把机器人从「每个实验室各做各的」推到「大数据预训练 + GPU 并行训练」范式。基础设施反向塑造研究问题本身——一半范式跃迁功劳属于这一层。

🦿 2. Locomotion · Sim-to-Real + 步态/地形

T01 · Sim-to-Real 与在线适应 + T12 · 敏捷 Locomotion:四足/人形走跑跳怎么学、怎么从仿真迁真机、怎么处理剧烈动作。从 OpenAI Hand 的 DR → ETH ANYmal 的 SysIDRMA 在线适应 → Extreme Parkour 极限动作 → ASAP delta-model 弥合 sim-real gap。

🧠 3. Imitation Learning · BC → DP → ACT → flow

T05 · Diffusion Policy 谱系:从行为克隆(BC)的均值回归死结,到 diffusion / flow matching 多模态动作分布建模。BC → DAggerDiffusion Policy → ACT → π0 flow matching,一路解决「动作多峰分布」与「长程一致性」。

⭐ 4. Motion Prior · AMP → BFM → SONIC(用户重点)

T04 · Motion Prior:AMP → BFM:怎么把动捕数据(MoCap蒸馏成机器人可复用的「人类运动常识」。DeepMimic(2018)逐帧对齐 → AMP(2021)判别器分布对齐(分水岭)→ ASE/CALM latent skill → PHC/UHC universal tracker → BFM(2025)大规模 motor foundation → SONIC(2025.11)42M token VLA-driven 全身控制(当前 SOTA)。这条线是当前人形控制研究的中轴之一。

🎬 5. Action Generation · Diffusion/Flow Physics-Aware

T08 · 动作生成 physics-aware:怎么生成物理可信的人体/机器人动作。从纯 kinematic 的 MDM → PhysDiff(把 physics simulator 注入 diffusion 反向过程)→ ReinDiffuse(RL finetune)→ BeyondMimic(生成 + tracking 合流)。与 Motion Prior 方向相反但终点相同——前者从物理 controller 出发用 MoCap 扩能力,后者从生成模型出发用物理保证可行。

🎮 6. Teleop · 数据采集管道

T07 · 人形 teleop 技术栈:实时遥控 + 数据采集管道。ALOHA 双臂 → H2O 首个单目全身 teleop → OmniH2O 多模态统一 → HOVER 多模式蒸馏 → Helix-02 System 0 @ 1kHz 自主。teleop 既是数据来源,也是 motion prior / VLA 的指挥接口。

🧬 7. Foundation Model · VLA + World Model

T06 · VLA 五段演进 + T09 · World Model 作 simulator:把大模型当控制策略。RT-1 → RT-2(VLA 范式确立)→ OpenX 数据转折点 → OpenVLA(开源 7B)→ π0(flow matching 灵巧化)→ GR00T N1→N2(人形 VLA + world action)。同期 World Model 路线 DreamerV3 → Genie 2 → Cosmos → 1X WM → DreamZero,把「学一个世界当 simulator」做成 VLA 的下一步想象。

🤲 8. 灵巧操作 + 抓取

T11 · 灵巧手操作 + T14 · 抓取:多指精细操作(抓/转/捏/工具)与稳定抓取。DoF 高、触觉缺失、sim-real gap 大是核心难点。OpenAI Hand → DexPilot → RotateIt → DexImit;抓取侧 Dex-Net → QT-Opt → GraspNet → AnyGrasp。当前研究焦点之一。

🔴 9. VLA + WBC 整合(当前最热)

T10 · VLA + WBC 分层整合:人形控制栈的当前最热开放问题。GR00T N1 × SONIC → Helix-02 → WholebodyVLA,研究范式是「VLA 出高层意图 → WBC/motor foundation 执行全身协调(含手-脚协调)」。这是 2026 上半年整个领域的研究焦点。

横切线索T03 Reward 自动化(手工 → motion prior → LLM 自动)· T13 综述视角(鸟瞰整合)


四、四条贯穿主线

主线 1 · AMP → BFM → SONIC(motion prior 谱系)


DeepMimic (2018, 逐帧对齐)
  → AMP (2021, 判别器分布对齐) ← 分水岭
    → ASE/CALM (2022-23, latent skill)
      → PHC/UHC (2023, AMASS universal tracker)
        → BeyondMimic (2025.08, diffusion+tracking 合流)
          → BFM (2025.09, 大规模 motor foundation)
            → SONIC (2025.11, 42M universal token, VLA-driven) ← 当前 SOTA
              → AnyBody/XHugWBC (2026, free-form/跨形态)

主线 2 · VLA 五段 → WAM


RT-1 (2022, 动作 token 化)
  → RT-2 (2023, VLA 范式确立, emergent ability)
    → OpenX (2023, 跨本体数据转折点)
      → OpenVLA (2024, 开源 7B)
        → π0 (2024, flow matching 灵巧化)
          → GR00T N1→N2 (2025-26, 人形 VLA + world action)
            → π0.7/DreamZero (2026, WAM+VLA 混合)

主线 3 · Sim-to-Real 四次转向


DR (2017, OpenAI Hand)
  → SysID (2019, ETH ANYmal, RaiSim 精细标定)
    → RMA (2021, 在线适应, temporal conv)
      → ASAP (2025, delta action model 补偿 gap)
        → Actuator Reality Shaping (2026, 电机级建模)

主线 4 · 人形全身控制栈


H2O (2024.03, 首个单目全身 teleop)
  → OmniH2O (2024.06, 多模态统一)
    → HOVER (2024.10, 多模式蒸馏)
      → ASAP (2025.02, sim-real 弥合)
        → SONIC (2025.11, VLA-driven 全身 loco-manip)
          → Helix-02 (2026, System 0 @ 1kHz 自主)

五、2026 上半年五大趋势

  1. WAM + VLA 混合:从纯 VLA → 能想象未来再行动(DreamZero、π0.7 BAGEL)
  2. Motor foundation 竞赛:SONIC / Ψ0 / GR00T N2 / Helix-02 多方角逐
  3. 跨形态零样本:XHugWBC 解决 H1 → G1 迁移
  4. 人形极限运动:HUSKY(滑板)、OmniXtreme
  5. Sim2Real 下沉到 actuator:Actuator Reality Shaping + 可微仿真 + 主动探索

六、关键里程碑时间线(2018-2026)

时间里程碑线索
2018.07DeepMimic(motion imitation 奠基)T04
2018.08OpenAI Hand(DR 标志性应用)T01/T11
2019ETH ANYmal(SysID + sim2real 工程化)T01
2021.04AMP(motion prior 分水岭)T04
2021.07RMA(在线适应)T01
2021.08Isaac Gym(训练民主化)T02
2022.12RT-1(大规模 Transformer policy)T06
2023.03Diffusion Policy(IL 转折点)T05
2023.04ACT/ALOHA(低成本双臂 IL)T05/T07
2023.05PHC(BFM 雏形)T04
2023.07RT-2(VLA 范式确立)T06
2023.09Extreme Parkour(极限动作)T12
2023.10OpenX-Embodiment(数据转折点)T02/T06
2023.10Eureka(LLM 自动 reward)T03
2023.10PhysDiff(physics-aware 生成奠基)T08
2024.03H2O(首个全身人形 teleop)T07
2024.06HumanPlus + OmniH2O(全栈 / 多模态)T07
2024.06OpenVLA(开源 VLA 里程碑)T06
2024.06DrEureka(LLM reward + DR sim2real)T03
2024.10π0 + RDT-1B(flow matching VLA)T06
2024.10HOVER(多模式 WBC 统一)T01/T07
2024.12Genie 2(生成式 3D 世界)T09
2025.01Cosmos(产业级 world FM)T09
2025.02Helix / ASAP(Figure 全身 / delta model)T06/T01
2025.03GR00T N1(开源人形 VLA 双系统)T06/T10
2025.08BeyondMimic(生成 + tracking 合流 SOTA)T04/T08
2025.09BFM(大规模 motor foundation)T04
2025.101X World Model(video-WM-as-simulator)T09
2025.11SONIC(42M universal token, VLA-driven 全身)T04/T10
2025.12WholebodyVLA(ICLR 2026 全身 VLA)T10
2026.02XHugWBC(跨形态零样本)T01
2026.03GR00T N2(DreamZero world action)T06
2026.05π0.7(steerable generalist + WAM)T06
2026.06AnyBody(free-form keypoint)T04
2026.07Actuator Reality Shaping(sim2real 新突破)T01

七、怎么学(学习路径引导)

不确定从哪里开始?建议按「基础理论 → 单条技术线索 → 方法论」三层推进,6-12 个月可从「懂简单 RL」走到「中高级具身智能运控算法专家」。

快速选路:想做四足/人形走路 → T01 + T12;想做机械臂操作 → T05 + T11;想做 VLA/Foundation Model → T06 + T10;想做人形全身控制 → T04 + T07 + T10


八、全部线索索引(T01–T14)

编号线索核心问题所属分区
T01Sim-to-Real 与在线适应仿真策略怎么迁移真机、怎么实时适应未知环境🦿 Locomotion
T02数据集基础设施演化 ⭐OpenX/DROID/AMASS/Isaac Lab 怎么把机器人推到大数据预训练范式🔧 基础设施层
T03Reward 设计的演化手工 → motion prior → LLM 自动横切
T04Motion Prior: AMP → BFM ⭐把动捕数据沉淀成机器人运动常识(用户重点)⭐ Motion Prior
T05Diffusion Policy 谱系从 BC 到多模态动作分布建模🧠 IL
T06VLA 五段演进用大模型当控制策略🧬 Foundation
T07人形 teleop 技术栈实时遥控 + 数据采集管道🎮 Teleop
T08动作生成 physics-aware从纯 kinematic 到真机可执行🎬 Action Gen
T09World Model 作 simulator学一个世界模型当数据源/评估器/规划器🧬 Foundation
T10VLA + WBC 分层整合 🔴人形控制栈的当前最热开放问题🔴 VLA+WBC 整合
T11灵巧手操作 ⭐多指精细操作,DoF 高 + 触觉缺失 + sim-real gap🤲 灵巧+抓取
T12敏捷 Locomotion(parkour + 剧烈动作)跳/爬/翻滚等高动态动作怎么学、剧烈动作 sim-real 是否本质无解🦿 Locomotion
T13综述视角(鸟瞰整合)基于 8 篇综述 + 12 线索的全景俯瞰、5 领域共识、5 未来方向横切
T14抓取(Grasping)从几何规划到学习到生成,抓取 vs 灵巧操作的边界🤲 灵巧+抓取

图例:🟢 活跃 / 🟡 趋稳 / 🔴 最热 · ⭐ 用户重点线索


维护说明:本页面是 research/ 的视觉入口,对应原始索引在 总索引 INDEX。新线索/论文加入后请同步本页第三节的对应分区卡片与第八节索引表。