机器人 RL 运动控制 · 研究脉络地图(Roadmap)
截止日期:2026-07-18 · 覆盖范围:2018-2026(近三年为主,奠基工作回溯)
文献规模:923 篇论文 + 748 PDF + 3240 引用边(builds_on/leads_to 标签总数)
配套:HTML 知识网站在 site/,原始数据在 research/data/
本文是一张「视觉知识地图」:一张页面看懂整个领域的分层结构。先看第一节全景图和第二节一句话版,再按第三节九大分区卡片进入感兴趣的方向。
一、领域全景图(一张图看懂)
三层结构:① 基础设施层(数据 + 仿真,底)→ ② 五大范式层(Locomotion / IL / Motion Prior ⭐ / Action Gen / Teleop,中)→ ③ Foundation Model 层(VLA + World Model,顶)→ 真机部署。
⭐ 标记用户重点线索 Motion Prior(AMP→BFM→SONIC);★ 标记 2026 SOTA。
二、一句话版(核心脉络)
数据 + 仿真 → 五大范式 → Foundation Model → 真机部署
机器人 RL 运动控制领域可以压缩成一条单向链:(1) AMASS / OpenX / DROID + Isaac Gym/Lab/Genesis 把数据与训练底座统一化 → (2) Locomotion / IL / Motion Prior / Action Gen / Teleop 五大范式在底座上各立门户,解决「怎么动」「怎么学」「怎么像人」「怎么生成」「怎么采数据」 → (3) VLA + World Model 把所有范式重新组织成「大模型当 policy」形态 → (4) Sim-to-Real + WBC 把模型压到真机上。本文接下来用九张卡片拆解这条链。
三、知识地图(九大分区卡片)
阅读提示:每张卡片 = 图标 + 线索名 + 一句话定位(callout)+ 代表论文 + 演进 SVG/线索入口。从任意感兴趣的卡片切入即可。
🔧 1. 基础设施层 · 数据集 + 仿真
T02 · 数据集基础设施:AMASS → OpenX → DROID + Isaac Gym/Lab/Genesis,把机器人从「每个实验室各做各的」推到「大数据预训练 + GPU 并行训练」范式。基础设施反向塑造研究问题本身——一半范式跃迁功劳属于这一层。
- 📄 代表论文:OpenX-Embodiment (2023)、Isaac Gym (2021)
- 🗺️ 线索入口:T02 · 数据集基础设施
🦿 2. Locomotion · Sim-to-Real + 步态/地形
T01 · Sim-to-Real 与在线适应 + T12 · 敏捷 Locomotion:四足/人形走跑跳怎么学、怎么从仿真迁真机、怎么处理剧烈动作。从 OpenAI Hand 的 DR → ETH ANYmal 的 SysID → RMA 在线适应 → Extreme Parkour 极限动作 → ASAP delta-model 弥合 sim-real gap。
- 📄 代表论文:RMA (2021)、Extreme Parkour (2023)、ANYmal-C (2022)
- 🖼️ 演进图:T01-lineage.svg · T12-lineage.svg
- 🗺️ 线索入口:T01 Sim-to-Real · T12 敏捷 Locomotion
🧠 3. Imitation Learning · BC → DP → ACT → flow
T05 · Diffusion Policy 谱系:从行为克隆(BC)的均值回归死结,到 diffusion / flow matching 多模态动作分布建模。BC → DAgger → Diffusion Policy → ACT → π0 flow matching,一路解决「动作多峰分布」与「长程一致性」。
- 📄 代表论文:Diffusion Policy (2023)、ACT / ALOHA (2023)
- 🖼️ 演进图:T05-lineage.svg
- 🗺️ 线索入口:T05 Diffusion Policy 谱系
⭐ 4. Motion Prior · AMP → BFM → SONIC(用户重点)
T04 · Motion Prior:AMP → BFM:怎么把动捕数据(MoCap)蒸馏成机器人可复用的「人类运动常识」。DeepMimic(2018)逐帧对齐 → AMP(2021)判别器分布对齐(分水岭)→ ASE/CALM latent skill → PHC/UHC universal tracker → BFM(2025)大规模 motor foundation → SONIC(2025.11)42M token VLA-driven 全身控制(当前 SOTA)。这条线是当前人形控制研究的中轴之一。
- 📄 代表论文:AMP (2021)、BFM (2025)、SONIC (2025)
- 🖼️ 演进图:T04-lineage.svg
- 🗺️ 线索入口:T04 · Motion Prior:AMP → BFM
🎬 5. Action Generation · Diffusion/Flow Physics-Aware
T08 · 动作生成 physics-aware:怎么生成物理可信的人体/机器人动作。从纯 kinematic 的 MDM → PhysDiff(把 physics simulator 注入 diffusion 反向过程)→ ReinDiffuse(RL finetune)→ BeyondMimic(生成 + tracking 合流)。与 Motion Prior 方向相反但终点相同——前者从物理 controller 出发用 MoCap 扩能力,后者从生成模型出发用物理保证可行。
- 📄 代表论文:MDM (2023)、BeyondMimic (2025)
- 🗺️ 线索入口:T08 · 动作生成 physics-aware
🎮 6. Teleop · 数据采集管道
T07 · 人形 teleop 技术栈:实时遥控 + 数据采集管道。ALOHA 双臂 → H2O 首个单目全身 teleop → OmniH2O 多模态统一 → HOVER 多模式蒸馏 → Helix-02 System 0 @ 1kHz 自主。teleop 既是数据来源,也是 motion prior / VLA 的指挥接口。
- 📄 代表论文:OmniH2O (2024)、HOVER (2024)、H2O (2024)
- 🖼️ 演进图:T07-lineage.svg
- 🗺️ 线索入口:T07 人形 teleop 技术栈
🧬 7. Foundation Model · VLA + World Model
T06 · VLA 五段演进 + T09 · World Model 作 simulator:把大模型当控制策略。RT-1 → RT-2(VLA 范式确立)→ OpenX 数据转折点 → OpenVLA(开源 7B)→ π0(flow matching 灵巧化)→ GR00T N1→N2(人形 VLA + world action)。同期 World Model 路线 DreamerV3 → Genie 2 → Cosmos → 1X WM → DreamZero,把「学一个世界当 simulator」做成 VLA 的下一步想象。
- 📄 代表论文:RT-2 (2023)、OpenVLA (2024)、π0 (2024)、Cosmos (2025)
- 🖼️ 演进图:T06-lineage.svg · T09-lineage.svg
- 🗺️ 线索入口:T06 VLA 五段演进 · T09 World Model 作 simulator
🤲 8. 灵巧操作 + 抓取
T11 · 灵巧手操作 + T14 · 抓取:多指精细操作(抓/转/捏/工具)与稳定抓取。DoF 高、触觉缺失、sim-real gap 大是核心难点。OpenAI Hand → DexPilot → RotateIt → DexImit;抓取侧 Dex-Net → QT-Opt → GraspNet → AnyGrasp。当前研究焦点之一。
- 📄 代表论文:DexPilot (2019)、Visual Dexterity (2023)、AnyGrasp (2023)、GraspNet (2020)
- 🖼️ 演进图:T11-lineage.svg · T14-lineage.svg
- 🗺️ 线索入口:T11 灵巧手操作 · T14 抓取 Grasping
🔴 9. VLA + WBC 整合(当前最热)
T10 · VLA + WBC 分层整合:人形控制栈的当前最热开放问题。GR00T N1 × SONIC → Helix-02 → WholebodyVLA,研究范式是「VLA 出高层意图 → WBC/motor foundation 执行全身协调(含手-脚协调)」。这是 2026 上半年整个领域的研究焦点。
- 📄 代表论文:GR00T N1 (2025)、SONIC (2025)、HOVER (2024)
- 🖼️ 演进图:T10-lineage.svg
- 🗺️ 线索入口:T10 VLA+WBC 分层整合
横切线索:T03 Reward 自动化(手工 → motion prior → LLM 自动)· T13 综述视角(鸟瞰整合)
四、四条贯穿主线
主线 1 · AMP → BFM → SONIC(motion prior 谱系)
DeepMimic (2018, 逐帧对齐)
→ AMP (2021, 判别器分布对齐) ← 分水岭
→ ASE/CALM (2022-23, latent skill)
→ PHC/UHC (2023, AMASS universal tracker)
→ BeyondMimic (2025.08, diffusion+tracking 合流)
→ BFM (2025.09, 大规模 motor foundation)
→ SONIC (2025.11, 42M universal token, VLA-driven) ← 当前 SOTA
→ AnyBody/XHugWBC (2026, free-form/跨形态)
主线 2 · VLA 五段 → WAM
RT-1 (2022, 动作 token 化)
→ RT-2 (2023, VLA 范式确立, emergent ability)
→ OpenX (2023, 跨本体数据转折点)
→ OpenVLA (2024, 开源 7B)
→ π0 (2024, flow matching 灵巧化)
→ GR00T N1→N2 (2025-26, 人形 VLA + world action)
→ π0.7/DreamZero (2026, WAM+VLA 混合)
主线 3 · Sim-to-Real 四次转向
DR (2017, OpenAI Hand)
→ SysID (2019, ETH ANYmal, RaiSim 精细标定)
→ RMA (2021, 在线适应, temporal conv)
→ ASAP (2025, delta action model 补偿 gap)
→ Actuator Reality Shaping (2026, 电机级建模)
主线 4 · 人形全身控制栈
H2O (2024.03, 首个单目全身 teleop)
→ OmniH2O (2024.06, 多模态统一)
→ HOVER (2024.10, 多模式蒸馏)
→ ASAP (2025.02, sim-real 弥合)
→ SONIC (2025.11, VLA-driven 全身 loco-manip)
→ Helix-02 (2026, System 0 @ 1kHz 自主)
五、2026 上半年五大趋势
- WAM + VLA 混合:从纯 VLA → 能想象未来再行动(DreamZero、π0.7 BAGEL)
- Motor foundation 竞赛:SONIC / Ψ0 / GR00T N2 / Helix-02 多方角逐
- 跨形态零样本:XHugWBC 解决 H1 → G1 迁移
- 人形极限运动:HUSKY(滑板)、OmniXtreme
- Sim2Real 下沉到 actuator 级:Actuator Reality Shaping + 可微仿真 + 主动探索
六、关键里程碑时间线(2018-2026)
| 时间 | 里程碑 | 线索 |
|---|---|---|
| 2018.07 | DeepMimic(motion imitation 奠基) | T04 |
| 2018.08 | OpenAI Hand(DR 标志性应用) | T01/T11 |
| 2019 | ETH ANYmal(SysID + sim2real 工程化) | T01 |
| 2021.04 | AMP(motion prior 分水岭) | T04 |
| 2021.07 | RMA(在线适应) | T01 |
| 2021.08 | Isaac Gym(训练民主化) | T02 |
| 2022.12 | RT-1(大规模 Transformer policy) | T06 |
| 2023.03 | Diffusion Policy(IL 转折点) | T05 |
| 2023.04 | ACT/ALOHA(低成本双臂 IL) | T05/T07 |
| 2023.05 | PHC(BFM 雏形) | T04 |
| 2023.07 | RT-2(VLA 范式确立) | T06 |
| 2023.09 | Extreme Parkour(极限动作) | T12 |
| 2023.10 | OpenX-Embodiment(数据转折点) | T02/T06 |
| 2023.10 | Eureka(LLM 自动 reward) | T03 |
| 2023.10 | PhysDiff(physics-aware 生成奠基) | T08 |
| 2024.03 | H2O(首个全身人形 teleop) | T07 |
| 2024.06 | HumanPlus + OmniH2O(全栈 / 多模态) | T07 |
| 2024.06 | OpenVLA(开源 VLA 里程碑) | T06 |
| 2024.06 | DrEureka(LLM reward + DR sim2real) | T03 |
| 2024.10 | π0 + RDT-1B(flow matching VLA) | T06 |
| 2024.10 | HOVER(多模式 WBC 统一) | T01/T07 |
| 2024.12 | Genie 2(生成式 3D 世界) | T09 |
| 2025.01 | Cosmos(产业级 world FM) | T09 |
| 2025.02 | Helix / ASAP(Figure 全身 / delta model) | T06/T01 |
| 2025.03 | GR00T N1(开源人形 VLA 双系统) | T06/T10 |
| 2025.08 | BeyondMimic(生成 + tracking 合流 SOTA) | T04/T08 |
| 2025.09 | BFM(大规模 motor foundation) | T04 |
| 2025.10 | 1X World Model(video-WM-as-simulator) | T09 |
| 2025.11 | SONIC(42M universal token, VLA-driven 全身) | T04/T10 |
| 2025.12 | WholebodyVLA(ICLR 2026 全身 VLA) | T10 |
| 2026.02 | XHugWBC(跨形态零样本) | T01 |
| 2026.03 | GR00T N2(DreamZero world action) | T06 |
| 2026.05 | π0.7(steerable generalist + WAM) | T06 |
| 2026.06 | AnyBody(free-form keypoint) | T04 |
| 2026.07 | Actuator Reality Shaping(sim2real 新突破) | T01 |
七、怎么学(学习路径引导)
不确定从哪里开始?建议按「基础理论 → 单条技术线索 → 方法论」三层推进,6-12 个月可从「懂简单 RL」走到「中高级具身智能运控算法专家」。
- 🎓 学习指南:贯穿全站的阅读顺序(深度分层 + 主线 + 概念 + 前沿)
- 📚 总索引 INDEX:所有线索 / 论文笔记 / 概念辨析的入口表
- 🗺️ 领域演进总图:按方向(locomotion / IL / VLA / …)分块的演进地图
- 📊 知识库分析:影响力 hub、引用图健康、查漏补缺
快速选路:想做四足/人形走路 → T01 + T12;想做机械臂操作 → T05 + T11;想做 VLA/Foundation Model → T06 + T10;想做人形全身控制 → T04 + T07 + T10。
八、全部线索索引(T01–T14)
| 编号 | 线索 | 核心问题 | 所属分区 |
|---|---|---|---|
| T01 | Sim-to-Real 与在线适应 | 仿真策略怎么迁移真机、怎么实时适应未知环境 | 🦿 Locomotion |
| T02 | 数据集基础设施演化 ⭐ | OpenX/DROID/AMASS/Isaac Lab 怎么把机器人推到大数据预训练范式 | 🔧 基础设施层 |
| T03 | Reward 设计的演化 | 手工 → motion prior → LLM 自动 | 横切 |
| T04 | Motion Prior: AMP → BFM ⭐ | 把动捕数据沉淀成机器人运动常识(用户重点) | ⭐ Motion Prior |
| T05 | Diffusion Policy 谱系 | 从 BC 到多模态动作分布建模 | 🧠 IL |
| T06 | VLA 五段演进 | 用大模型当控制策略 | 🧬 Foundation |
| T07 | 人形 teleop 技术栈 | 实时遥控 + 数据采集管道 | 🎮 Teleop |
| T08 | 动作生成 physics-aware | 从纯 kinematic 到真机可执行 | 🎬 Action Gen |
| T09 | World Model 作 simulator | 学一个世界模型当数据源/评估器/规划器 | 🧬 Foundation |
| T10 | VLA + WBC 分层整合 🔴 | 人形控制栈的当前最热开放问题 | 🔴 VLA+WBC 整合 |
| T11 | 灵巧手操作 ⭐ | 多指精细操作,DoF 高 + 触觉缺失 + sim-real gap | 🤲 灵巧+抓取 |
| T12 | 敏捷 Locomotion(parkour + 剧烈动作) | 跳/爬/翻滚等高动态动作怎么学、剧烈动作 sim-real 是否本质无解 | 🦿 Locomotion |
| T13 | 综述视角(鸟瞰整合) | 基于 8 篇综述 + 12 线索的全景俯瞰、5 领域共识、5 未来方向 | 横切 |
| T14 | 抓取(Grasping) | 从几何规划到学习到生成,抓取 vs 灵巧操作的边界 | 🤲 灵巧+抓取 |
图例:🟢 活跃 / 🟡 趋稳 / 🔴 最热 · ⭐ 用户重点线索
维护说明:本页面是 research/ 的视觉入口,对应原始索引在 总索引 INDEX。新线索/论文加入后请同步本页第三节的对应分区卡片与第八节索引表。