🌱 自学教材(由浅入深)
从一句话直觉到研究者视角,每篇都由浅入深:先讲清在解决什么,再铺开概念与方法,需要深挖时沿页面往下读,逐步进入设计细节、公式推导与开放问题。
📚 321 篇已发布
🧵 14 条线索
🧠 13 个概念
⭐ 43 篇深度笔记
📖 283 篇入门教学
怎么读
先扫推荐起点 8 篇建立全局味觉,再看线索入口(14 篇)建立线索地图。要深挖某条线索,继续阅读下方按主线分组:先读 ⭐ 代表作,再按兴趣查看 🔥 2026 新作。每篇教学页都由浅入深排列,正文与参考答案默认完整展示。
⭐ 推荐起点(8 篇)
跨线索最重要的 8 篇 · 由浅入深逐层展开 · 大卡片 · 视觉突出。
AMP 样板 · 风格裁判深度
让虚拟人的动作像真人。秘诀是请一个"风格裁判"打分,不逐帧抄参考视频。它是为「教你读这种页」写的样板,四个深度层都完整。
π0.7 · 可引导通用机器人基础模型入门
一个模型同时听懂语言、看图、看视频、学示范。把 π0.5 分层操控简化成统一的上下文条件化,涌现组合与纠错。🔥 2026 VLA SOTA。
SONIC · 一个 token 统一三种动作深度
把人形控制放大到大模型级别。用一个 universal token 统一机器人、人类、混合三种动作格式。motion prior 谱系的当前 SOTA。
Diffusion Policy · 像画家作画深度
让机器人动作像画家作画:先模糊打底,再一层层修到精准。从一团噪点开始,把动作细节逐层修出。扩散谱系的奠基作。
RMA · 边跑边适应陌生环境深度
让机器人不靠预先校准就能边跑边适应。挂一个"环境侦探",只看自身传感器历史就反推地形与负载。Sim-to-Real 谱线的代表作。
DreamerV3 · 在脑里彩排学本事深度
让智能体在脑里彩排学本事,不必真去试。一套固定参数跑通一百五十多种游戏。World Model 谱系教科书。
OpenVLA · 开源重做反超闭源深度
让学术界也能用上视觉语言动作模型。另起炉灶、开源重做,反超闭源 RT-2-X 55B。VLA 谱系的开源里程碑。
HOVER · 一把瑞士军刀控全身深度
让一个网络替代一摞全身控制器。用 mask 决定哪些指令维度生效。一把刀替代一堆专用刀,还能边走边换刀片。
🧵 线索 入门 入口(14 篇)
每条线索一句话起点 · 凭 入门 即可独立读懂 · 深度叙事见各 thread 页。
🦿 T01 Sim-to-Real
仿真里练好的本事搬到真机常当场摔。问题在仿真和真机之间永远有一道缝。
📚 T02 数据集基础设施
各家格式不通,模型没法共享。像一座城没有公共图书馆。
🎯 T03 Reward 演化
教机器人最难的是打分。分设错了它专钻空子。像考核指标定偏了。
🎭 T04 AMP → BFM
把人类动作数据蒸馏成可复用的运动常识。像把演奏录下来提炼成乐谱。
🧠 T05 Diffusion Policy
从人类演示学动作,不设计打分。难点是同情境有多种都对的动作。
🧬 T06 VLA 五段
让懂图文的大模型直接吐关节指令。大模型想得慢,机器人要动得快。
🎮 T07 人形 Teleop
人远程操控几十个关节的人形干精细活,顺手录每个动作当训练数据。
💃 T08 动作生成
生成的动作好看但不守物理。脚滑、穿地、悬浮都常见。要改成可施工图。
🔮 T09 World Model
用神经网络学一个"环境替身",在里面训评估规划策略。不用真机。
🧩 T10 VLA + WBC
让懂语义的大脑和快出动作的小脑分工合作。中间必须有翻译层。
👐 T11 灵巧手
不是"抓住不放",而是多指手在掌心里转、捏、换手。像在指间耍杂技。
🏃 T12 敏捷 Locomotion
走路和跑酷不是同件事的两个难度档。跑酷一次失误就是自由落体。
🗂️ T13 综述视角
单篇论文看路标,综述看地图。读完几篇好综述能看清领域在往哪融合。
✊ T14 抓取 Grasping
让机器人稳定抓起任意物体。像人拿马克杯先看准把手再下手。
🧠 概念 入门 入口(13 篇)
每个概念一句话起点 · 凭 入门 即可独立读懂 · 深度辨析见对应概念页。
C-action 表示
机器人"怎么出招"的几种约定格式。像乐谱可用简谱或五线谱。
C-diffusion / flow
先把动作搅成雪花噪点,再慢慢收回成动作。像浑水静置成清水。
C-人形硬件
给研究人形的人挑"试验用车"。像选赛车:场地赛还是拉力赛。
C-IL 理论
让机器人照着师傅的动作学。像徒弟跟师傅炒菜,一招一式照做。
C-MDP / POMDP
把"边做决定边看反馈"写成规则图。像下棋:看局面、走子、得分。
C-优化与损失
给机器人打分的"扣分细则"。像学生对着标准答案改错题。
C-表征学习
把图像压成几个有意义的数。像把菜尝成咸淡酸甜几个指标。
C-RL 算法家族
机器人靠试错学动作的一类方法。像父母教娃骑自行车。
C-RL vs 控制
让试错学和按公式算两套办法搭伙干活。像老牌大厨配新派厨师。
C-真机安全
让机器人别摔、别砸人、别烧自己。像给新车装保险杠和急停。
C-sim2real 方法
让电脑里练好的动作搬到真机还能用。像飞行员先模拟器再真机。
C-多模态消歧
"多模态"在论文里有三种完全不同的含义。像"打"字有多种意思。
C-蒸馏方法
"蒸馏"在机器人圈有四种完全不同的意思。像"传"字有多种含义。
📂 按主线分组
每条主线依次展示演进 SVG(若有)、深度笔记(⭐ 代表作)和浅入口(🔥 2026 新作);组内按年份由旧到新。
⭐ 深度笔记 深度
⭐ RMA:边跑边适应陌生环境
挂一个"环境侦探",只看自身传感器历史就反推地形与负载。像老司机换车。
ANYmal-C:靠眼睛和触觉走野外
雪地、瓦砾、楼梯、草地都接近人步速通过。像老手走夜路。
ASAP:学一个差值补丁上真机
让仿真人形学真机剧烈动作。像老枪手用偏靶旧枪,只记偏差反向瞄准。
浅入口 入门
PPO: Proximal Policy Optimization
Learning agile dynamic motor skills for legged robots
DreamWaQ: Implicit Terrain Imagination
SILO: Simulation-in-the-Loop Sim-to-Real
BF for Quadruped: ABot-C0 Technical Report
Biomechanical Gait on Extreme Sloped Terrains
NeuralActuator: Neural Actuation Modeling
MoE-based Robot Sim-to-Real Predictability
⭐ 深度笔记 深度
⭐ Isaac Gym:训练全搬上显卡
把整个机器人训练流水线全搬上显卡。训练从天级压到分钟级。
Open X-Embodiment:一个格式接所有机器人
把全社区机器人数据汇成公共数据库。像 ImageNet 之于图像识别。
浅入口 入门
GAIL: Generative Adversarial IL
Habitat: Platform for Embodied AI
AMASS: Motion Capture as Surface Shapes
RLBench: Robot Learning Benchmark
SAPIEN: Part-based Interactive ENvironment
BABEL: Bodies, Action, Behavior with English Labels
CALVIN: Language-Conditioned Long-Horizon Benchmark
HMR 2.0 / 4DHumans: Reconstructing Tracking
DROID: Large-Scale In-The-Wild Robot Dataset
ManiSkill3: GPU Parallelized Robotics Sim
LeRobot: Open-Source Library for End-to-End RL
HumanoidMimicGen: Whole-Body Planning
SIMPLE: Sim-Based Policy Learning for Humanoid
RoboVista: Evaluating VLMs for Robot Apps
HELP: Human-Efficient Large-Scale Post-Training
WANDA: Synthetic Data for Open-World Manip
Zero2Skill: Autonomous Data Collect-Train-Deploy
⭐ 深度笔记 深度
DeepMimic:对着字帖学动作
每一步都对照参考里的某一帧。像对着字帖学毛笔字。
ASE:给动作编门牌号的技能库
给虚拟人一个能点菜的技能库。像自助餐之于点菜。
PHC / UHC:跌倒还能爬起来
学会模仿几乎所有人类动作,跌倒还能爬起来。分阶段加码训练。
⭐ BFM:把行为当语言预训练
把机器人行为当一门语言大规模预训练。目标和动作分开,只学动作。
BeyondMimic:跟跳 + 临时改主意
把"跟跳"和"临时改主意"拆成两步。像导航软件先有底盘再叠重规划。
⭐ SONIC:一个 token 统一三种动作
用 universal token 统一机器人/人类/混合三种动作格式。像统一充电口。
浅入口 入门
Variational Discriminator Bottleneck
Neural Probabilistic Motor Primitives
DReCon: Data-Driven Responsive Control
CARL: Controllable Quadruped Locomotion
SimPoE: Simulated Character Control 3D Pose
Character Controllers Using Motion VAEs
Imitate and Repurpose: Reusable Robot Skills
ControlVAE: Model-based Generative Controllers
CALM: Conditional Adversarial Latent Models
InterMimic: Universal Human-Object Interaction
General Humanoid WBC via Pretraining
Multi-Gait Humanoid RL with Selective AMP
ADP: Adversarial Dynamics Priors for Humanoid
Scaling Behavior Foundation Model for Humanoid
Meta Motivo: Zero-Shot Humanoid BFM
QuestSim: Sparse-Sensor Avatar Tracking
Tennis Skills from Broadcast Video
Perceptive Behavior Foundation Model Human Motion
PULSE: Universal Humanoid Motion Representation
⭐ 深度笔记 深度
ACT:一口气记下一长串动作
让机器人一次记下一长串动作。动作分块之于机器人,像速记员之于演讲。
⭐ Diffusion Policy:像画家作画
先模糊打底,再一层层修到精准。从一团噪点开始,逐层修出动作细节。
DP3:把眼睛换成立体点云
只用十个示范就学会精细动作。像立体眼镜之于看立体电影。
iDP3:换成机器人自己的视角
把 3D policy 改成机器人自己的视角。第一人称之于第三人称。
浅入口 入门
HG-DAgger: Interactive IL with Human Experts
CLIPort: What and Where Pathways
LIBERO: Lifelong Robot Learning Benchmark
RDT-1B: Diffusion Foundation Bimanual Manip
ALOHA Unleashed: Recipe for Robot Dexterity
EgoMimic: Scaling IL via Egocentric Video
FlowPolicy: 3D Flow via Consistency Matching
Ambient Diffusion Policy: Suboptimal Data IL
Source-Lifted Flow Matching: Intervenable Multimodal
D-SafeMPC: Diffusion-Driven Safe MPC
SegDiff: Segmented Trajectory Diffusion
NavCMPO: MeanFlow Policy for Adaptive Navigation
Trajectory Transformer: Offline RL as Seq
RoboMimic: What Matters in Offline Demos
MVP: Masked Visual Pre-training Motor
PerAct: Multi-Task Transformer Manip
⭐ 深度笔记 深度
RT-2:把动作当成另一种外语
让大模型直接吐机器人动作。把动作当成"另一种外语"。VLA 的奠基作。
⭐ OpenVLA:开源重做反超闭源
另起炉灶开源重做,反超闭源 RT-2-X 55B 整体 16.5%。像 LLaMA 之于 GPT-3。
π0:动作当成连续水流
一次吐出整段连贯动作。把动作当连续"水流"拟合。像流畅口语之于拼读。
GR00T-N1:大脑 + 脊髓分工
大脑慢思考、看图听话;脊髓快反射、高频出动作。像皮层+脊髓之于人。
浅入口 入门(56 篇 · 含 🔥 2026 新作)
BC-Z: Zero-Shot Robotic IL
VPT: Video PreTraining
Inner Monologue: Embodied Reasoning LLM
Code as Policies
ProgPrompt: LLM Task Plans
VIP: Value-Implicit Pre-Training
R3M: Universal Visual Representation
PaLM-E: Embodied Multimodal LM
VC-1: Artificial Visual Cortex
Q-Transformer: Scalable Offline RL
RoboFlamingo: VLM as Robot Imitators
GR-1: Video Generative Pre-training Manip
Octo: Open-Source Generalist Robot Policy
TinyVLA: Fast Data-Efficient VLA
HPT: Heterogeneous Pre-trained Transformers
GR-2: Web-Scale VLA
CogACT: Synergizing Cognition and Action
FAST: Efficient Action Tokenization
SmolVLA: Affordable Efficient Robotics
X-VLA: Cross-Embodiment VLA
LifeLong-RFT: Continual VLA via RL Fine-Tune
LAP: Language-Action Pre-Training Cross-Embod
Self-Correcting VLA: Sparse World Imagination
⭐ π0.7: Steerable Generalist Robotic Foundation
Dexora: Open-source VLA Bimanual Dexterity
Action Priors for Cross-Embodiment Manip
E-TTS: Embodied Test-Time Scaling
ZR-0: Dense Embodied Chain-of-Thought VLA
UniTacVLA: Tactile Understanding in VLA
CLEAR: Closed-Loop RL Autonomous Driving
WSA₁: 3D-Centric World-Spatial-Action Model
Harness VLA: Steering Frozen VLAs
VIA: Visual Interface Agent for Robot Control
See Like a Robot: Robot-Centric Pointmaps
VistaVLA: 3D Gaussian-Grounded VLA
TrustVLA: Inference-Time Defense Backdoors
Jetson-PI: Onboard Real-Time Robot Control
ExToken: Structured Exploration VLA RL
Anchor-Align: Representation Anchoring VLA
Vision-Driven Embodied Open-World Manip
LIFT: Reactive Force Injection VLA
Action QFormer: Structured Repr Shaping VLA
Reflex: Real-Time VLA Streaming Inference
FoMoVLA: Visual Foresight + Motion Guidance
LifelongVLA: Lifelong Vision-Language-Action
RoboTTT: Context Scaling for Robot Policies
Xiaomi-Robotics-1: 100K Hours Real-World
AC-VLA: Compositional Learning OOD Action
JoyNexus: Multi-Tenant Post-Training VLA
VoxPoser: 3D Value Maps for LLM Manip
RoboCat: Self-Improving Generalist Robot
UniVLA: Unified Vision-Language-Action Model
XR-1: Versatile VLA via Leveled Learning
World Action Models: Next Frontier Survey
FLARE: Illumination Robustness Hurts VLA
VLA-RFT: RL Fine-tuning with Verified Rewards
⭐ 深度笔记 深度
BunnyVisionPro:Vision Pro 双臂遥操
戴 Apple Vision Pro,双手实时遥控两机械臂加灵巧手。像 USB-C 之于外设。
H2O:单摄像头提线木偶
一个 RGB 摄像头让你走、跳、踢、推、打拳。摄像头提取 8 个关键点当"线"。
⭐ HOVER:一把瑞士军刀控全身
用一个网络替代一摞全身控制器。mask 决定哪些指令维度生效。
HumanPlus:先遥操后自学
一台相机遥控全身机器人,再让它从演示学会自己干。两层 transformer。
OmniH2O:USB-C 式姿态接口
规定一套"姿态接口",无论什么输入都先翻译成它。像 USB-C 的接口分层。
浅入口 入门
Visually Guided Latent Actions Assistive Teleop
AirExo: Low-Cost Exoskeletons Wild Manip
ILSA: Incremental Shared Autonomy
CLONE: Closed-Loop Whole-Body Teleop
OASIS: Sim Data → Real Humanoid LocoManip
Humanoid Robots in Surgery: In Vivo Study
TeleDexter: Human-level Dexterous Teleop
TeleMoMa: Modular Versatile Teleop
⭐ 深度笔记 深度
浅入口 入门
MotionCLIP: Human Motion in CLIP Space
Bailando: 3D Dance Actor-Critic GPT
TEMOS: Diverse Human Motion from Text
PI-QT-Opt: Predictive Information Multi-Task
EDGE: Editable Dance from Music
PhysDiff: Physics-Guided Motion Diffusion
T2M-GPT: Text → Motion with Discrete Repr
GMD: Guided Motion Diffusion
MotionGPT: Human Motion as Foreign Language
MoMask: Masked Modeling 3D Motion
PhysHOI: Dynamic Human-Object Interaction
ExBody: Expressive Whole-Body Humanoid
StableMoFusion: Robust Diffusion Motion Gen
MaskedMimic: Masked Motion Inpainting
Action-to-Action Flow Matching
RoboSnap: One-Shot Real-to-Sim Scene
PriorMDM: Motion Diffusion as Prior
Whole-Body Humanoid Locomotion via Motion Generation
ReActor: RL Physics-Aware Motion Retargeting
⭐ 深度笔记 深度
⭐ DreamerV3:在脑里彩排学本事
让智能体在脑里彩排,不必真去试。一套固定参数跑通一百五十多种游戏。
Cosmos:物理 AI 的数字风洞
用一亿段视频训出能"想象未来"的视频生成大模型。像风洞之于飞机设计。
浅入口 入门
TWM: Transformer World Models 100k
DreMa: Compositional World Models Manip
PointWorld: 3D World Models Manip
RISE: Self-Improving Compositional World
OSCAR: Omni-Embodiment Action World Model
WorldSample: Closed-loop Real-robot RL
Image2Sim: Generative Neural Simulator
RynnWorld-Teleop: Action-Conditioned WM
Predictive Aligned Scalable Robot Learning
WAM → Embodied Brains Roadmap
AeroAct: World-Action Models Quadrotor
TD-MPC2: Scalable World Models Control
浅入口 入门
OmniRetarget: Interaction-Preserving Data Gen
WholeBodyVLA: Unified Latent Loco-Manip
EAGLE: Embodiment-Aware Generalist Specialist
Unified Walking Running Recovery Humanoids
WOLF-VLA: Whole-Body Humanoid Optimal Loco
DASL: Dual-Process Atomic Skill Learning
X-Loco: Generalist Humanoid Locomotion via SDI
LangWBC: Language-directed Humanoid WBC
⭐ 深度笔记 深度
⭐ OpenAIHand:仿真乱练再上真机
让机器手在仿真里乱练,零样本搬到真机。大规模随机化像疫苗之于免疫系统。
DexPilot:裸手遥控机械手
不戴手套不穿外骨骼。四台相机看你的裸手,机械手跟着动。操作员"徒手教"。
Visual Dexterity:蒙眼转笔高手
一台深度相机让一只手转陌生物体到任意朝向,还能朝下抗重力。
浅入口 入门
Dex Manip from Experience and Imitation
TACTO: Vision-based Tactile Simulator
Hora: In-Hand Object Rotation Adaptation
UniDexGrasp: Universal Dexterous Grasping
DexArt: Generalizable Dex Articulated Objects
RotateIt: In-Hand Rotation Vision Touch
DexCap: Portable Mocap Data Collection
DexImit: Bimanual Dex from Monocular Video
Humanoid Dexterous Manipulation Made Easy
HandITL: Hand-Arm Intervention VLA Dex
Dexterous Point Policy from Human Demo
FTP-1: Foundation Tactile Policy
DexCompose: Reusing Dex Policies Single Hand
Grasps to Dexterity: Large-Scale Pretraining
Labimus: Dex Manip Chemistry Lab Benchmark
Contact Wrench Guidance from Human Demo
One Demonstration Enough Real-World RL
Current as Touch: Proprioceptive Contact
OmniTacTune: Tactile Residual Adaptation
LAMP: Latent Motion Prior Real-World Dex
T-Rex: Tactile-Reactive Dexterous Manipulation
TouchWorld: Predictive Reactive Tactile FM
AnyDexRT: Calibration-Free Dex Retargeting
DexVerse: Modular Multi-Task Dex Benchmark
GraspGraphNet: Multi-Embodiment Dex Grasp
Pix2Act: Image-Space Equivariant Policies
REGRIND: Minimalist Retargeting RL Recipe
MIDAS Hand: Low-Impedance Anthropomorphic
Handroid: Bridging Dexterous Hand Humanoid
DRL + Demonstrations (DAPG, ADROIT Hand)
OpenAI Rubik's Cube: Automatic Domain Randomization
⭐ 深度笔记 深度
浅入口 入门
Dynamic Bipedal Maneuvers Sim-to-Real RL
ANYmal Parkour: Agile Navigation Quadruped
Parkour in the Wild: Multi-Expert Distill
Walk the PLANC: Physics-Guided Agile RL
PHP: Perceptive Humanoid Parkour Matching
OmniXtreme: High-Dynamic Humanoid Control
Switch: Agile Skills Switching Humanoid
Stubborn: Motion Tracking Fall Recovery
MPC-Injection: Off-Policy Locomotion RL
TAC-LOCO: Tactile-Informed Loco-Manip
GaitSpan: Walking to Running Humanoid