这是一份贯穿全站的阅读顺序:先建立领域地图,再沿主线读代表作,需要时回到概念补数学,最后看前沿。每一步都说明「读什么」和「为什么」。
教学页怎么读
每篇教学页都按「先直觉,再细节」的顺序排:开头一句话讲清在解决什么,接着铺开概念、机制、输入输出;需要复现或深挖时,沿页面往下会逐步进入方法设计、公式细节与开放问题。读到哪一层吃力就停,先把当前层吃透再往下。
所有教学页都会直接展示完整正文;沿页面向下即可依次读到方法设计、公式细节、参考答案与开放问题。
第 0 步 · 建立领域地图
读 🗺️ 全景 roadmap 与 领域演进总图,配合首页的 领域全景图。
为什么先读:本站覆盖 971 篇论文、14 条技术线索,直接进任意一篇容易失去坐标。这三张图把 locomotion / 模仿学习 / 动作生成 / teleop / motion prior / VLA / 灵巧手 / 抓取 / world model 九大方向摆进同一张地图。
第 1 步 · 线索入口建地图(4 条核心线索)
每条线索的入口页 3-5 分钟,先读这四条:
- T01 Sim-to-Real — 仿真训好的策略搬到真机会摔,怎么弥合这条缝。
- T04 AMP → BFM ⭐ — 把人类动捕数据沉淀成可复用的运动常识。
- T06 VLA 五段演进 — 让懂互联网图文的大模型直接出关节指令。
- T11 灵巧手操作 — 多指手在掌心转、捏、换手,触觉是最大瓶颈。
为什么是这四条:T01 是所有真机工作的底座;T04 是「风格 vs 内容」这组分野的关键;T06 是 2023–2026 最显著的范式转移;T11 是当前 DoF 最高、感知最缺的开放问题。读完能在脑里立起四根支柱,其余线索在 自学教材目录 按需展开。
第 2 步 · 里程碑论文下钻(37 篇逐层教学)
挑四篇「绕不开」的代表作,用教学页逐层下钻:
- AMP 教学页 — 「风格裁判」如何替代手写 reward,同时演示一篇教学页由浅入深的完整结构。
- π0 教学页 — VLA 的当前 SOTA,flow matching 出动作。
- RT-2 教学页 — 第一次把大模型知识搬到机器人控制。
- Diffusion Policy 教学页 — 多模态动作分布的标准解法。
为什么是这四篇:AMP 是 motion prior 与模仿学习的交汇点,后续 ASE/PHC/BFM 都站在它肩上;RT-2 验证 VLA 可行、π0 把可用性推到产业级,两者代表 VLA 的两个阶段;Diffusion Policy 回答了「为什么不能直接用 BC 平均」。读完能识别领域里大部分术语引用的出处。
第 3 步 · 概念补数学(3 篇)
读论文时撞到「似懂非懂」的术语,回这三篇概念辨析补:
- C-MDP/POMDP 形式化 — 一切 RL/IL 的数学起点;不懂 POMDP,就看不懂为什么 sim2real 是本质问题。
- C-RL 算法家族 — PPO/SAC/TD3/DDPG/DreamerV3 的推导与适用场景。
- C-Sim2Real 方法全集 — DR / SysID / Teacher-Student / RMA / ASAP,含 6 步 SysID 实操。
为什么是这三篇:MDP 是所有形式化的根;RL 算法家族是读训练章节的前置;Sim2Real 是 T01 的数学化版本。其余概念(优化与损失 / 表征学习 / IL 理论 / Diffusion 数学 / 蒸馏方法 / 多模态消歧 / 硬件平台 / 真机安全 / RL vs 控制 / 动作表示)按遇到的盲点再查。
第 4 步 · 前沿与结构
基础打通后,三个方向任选:
- 研究者视角:回到第 2 步的论文页继续向下阅读研究者视角——它讲开放问题、为什么某条路可能走不通、下一个突破口在哪。
- 引用结构:引用图 把 971 篇按 PageRank 排出 top 80 影响力节点,📊 知识库分析 给出跨方向耦合矩阵(哪两个方向是交叉富矿)。想找「下一个该读谁」,从这里切入。
- 2026 SOTA:SOTA 与开放问题 汇总近期工作;深度叙事见 T10 VLA+WBC 分层整合 与 T11 灵巧手。
路线一览
roadmap 建图 → 线索入口听讲解 → 4 篇里程碑论文下钻 → 概念补数学 → 研究者视角看前沿。任何一步吃力就退回上一步,游刃有余就跳下一阶段;全站页面互相交叉引用,顺着兴趣走也不会断。
📍 下一步:开启第 0 步 · 全景 roadmap →