🌱 自学教材(由浅入深)

从一句话直觉到研究者视角,每篇都由浅入深:先讲清在解决什么,再铺开概念与方法,需要深挖时沿页面往下读,逐步进入设计细节、公式推导与开放问题。

📚 321 篇已发布 🧵 14 条线索 🧠 13 个概念 ⭐ 43 篇深度笔记 📖 283 篇入门教学
已读 0 / 971 篇(0%)
怎么读 先扫推荐起点 8 篇建立全局味觉,再看线索入口(14 篇)建立线索地图。要深挖某条线索,继续阅读下方按主线分组:先读 ⭐ 代表作,再按兴趣查看 🔥 2026 新作。每篇教学页都由浅入深排列,正文与参考答案默认完整展示。

⭐ 推荐起点(8 篇)

跨线索最重要的 8 篇 · 由浅入深逐层展开 · 大卡片 · 视觉突出。

🧵 线索 入门 入口(14 篇)

每条线索一句话起点 · 凭 入门 即可独立读懂 · 深度叙事见各 thread 页。

🦿 T01 Sim-to-Real
仿真里练好的本事搬到真机常当场摔。问题在仿真和真机之间永远有一道缝。
📚 T02 数据集基础设施
各家格式不通,模型没法共享。像一座城没有公共图书馆。
🎯 T03 Reward 演化
教机器人最难的是打分。分设错了它专钻空子。像考核指标定偏了。
🎭 T04 AMP → BFM
把人类动作数据蒸馏成可复用的运动常识。像把演奏录下来提炼成乐谱。
🧠 T05 Diffusion Policy
从人类演示学动作,不设计打分。难点是同情境有多种都对的动作。
🧬 T06 VLA 五段
让懂图文的大模型直接吐关节指令。大模型想得慢,机器人要动得快。
🎮 T07 人形 Teleop
人远程操控几十个关节的人形干精细活,顺手录每个动作当训练数据。
💃 T08 动作生成
生成的动作好看但不守物理。脚滑、穿地、悬浮都常见。要改成可施工图。
🔮 T09 World Model
用神经网络学一个"环境替身",在里面训评估规划策略。不用真机。
🧩 T10 VLA + WBC
让懂语义的大脑和快出动作的小脑分工合作。中间必须有翻译层。
👐 T11 灵巧手
不是"抓住不放",而是多指手在掌心里转、捏、换手。像在指间耍杂技。
🏃 T12 敏捷 Locomotion
走路和跑酷不是同件事的两个难度档。跑酷一次失误就是自由落体。
🗂️ T13 综述视角
单篇论文看路标,综述看地图。读完几篇好综述能看清领域在往哪融合。
✊ T14 抓取 Grasping
让机器人稳定抓起任意物体。像人拿马克杯先看准把手再下手。

🧠 概念 入门 入口(13 篇)

每个概念一句话起点 · 凭 入门 即可独立读懂 · 深度辨析见对应概念页。

13 核心概念交叉关系图:基础理论 → 方法与表征 → 应用
📌 13 核心概念交叉关系图 · 三层(基础理论 → 方法与表征 → 应用)· 颜色与各概念页 SVG 一致
C-action 表示
机器人"怎么出招"的几种约定格式。像乐谱可用简谱或五线谱。
C-diffusion / flow
先把动作搅成雪花噪点,再慢慢收回成动作。像浑水静置成清水。
C-人形硬件
给研究人形的人挑"试验用车"。像选赛车:场地赛还是拉力赛。
C-IL 理论
让机器人照着师傅的动作学。像徒弟跟师傅炒菜,一招一式照做。
C-MDP / POMDP
把"边做决定边看反馈"写成规则图。像下棋:看局面、走子、得分。
C-优化与损失
给机器人打分的"扣分细则"。像学生对着标准答案改错题。
C-表征学习
把图像压成几个有意义的数。像把菜尝成咸淡酸甜几个指标。
C-RL 算法家族
机器人靠试错学动作的一类方法。像父母教娃骑自行车。
C-RL vs 控制
让试错学和按公式算两套办法搭伙干活。像老牌大厨配新派厨师。
C-真机安全
让机器人别摔、别砸人、别烧自己。像给新车装保险杠和急停。
C-sim2real 方法
让电脑里练好的动作搬到真机还能用。像飞行员先模拟器再真机。
C-多模态消歧
"多模态"在论文里有三种完全不同的含义。像"打"字有多种意思。
C-蒸馏方法
"蒸馏"在机器人圈有四种完全不同的意思。像"传"字有多种含义。

📂 按主线分组

每条主线依次展示演进 SVG(若有)、深度笔记(⭐ 代表作)和浅入口(🔥 2026 新作);组内按年份由旧到新。

🦿T01 Sim-to-Real · 感知移动3 深度 + 8 浅入口线索 入门 →
📚T02 数据集基础设施2 深度 + 19 浅入口线索 入门 →
🎯T03 Reward / 奖励设计演化2 深度 + 2 浅入口线索 入门 →
🎭T04 动作先验(AMP → BFM)6 深度 + 20 浅入口线索 入门 →
T04 Motion Prior 演进主线
⭐ 深度笔记 深度
浅入口 入门
🧠T05 Diffusion Policy 谱系4 深度 + 16 浅入口线索 入门 →
🧬T06 VLA 五段演进4 深度 + 56 浅入口线索 入门 →
T06 VLA 五段演进
⭐ 深度笔记 深度
浅入口 入门(56 篇 · 含 🔥 2026 新作)
BC-Z: Zero-Shot Robotic IL2022 VPT: Video PreTraining2022 Inner Monologue: Embodied Reasoning LLM2022 Code as Policies2022 ProgPrompt: LLM Task Plans2022 VIP: Value-Implicit Pre-Training2022 R3M: Universal Visual Representation2022 PaLM-E: Embodied Multimodal LM2023 VC-1: Artificial Visual Cortex2023 Q-Transformer: Scalable Offline RL2023 RoboFlamingo: VLM as Robot Imitators2023 GR-1: Video Generative Pre-training Manip2023 Octo: Open-Source Generalist Robot Policy2024 TinyVLA: Fast Data-Efficient VLA2024 HPT: Heterogeneous Pre-trained Transformers2024 GR-2: Web-Scale VLA2024 CogACT: Synergizing Cognition and Action2024 FAST: Efficient Action Tokenization2025 SmolVLA: Affordable Efficient Robotics2025 X-VLA: Cross-Embodiment VLA2025 LifeLong-RFT: Continual VLA via RL Fine-Tune2026 🔥 LAP: Language-Action Pre-Training Cross-Embod2026 🔥 Self-Correcting VLA: Sparse World Imagination2026 🔥 ⭐ π0.7: Steerable Generalist Robotic Foundation2026 🔥 Dexora: Open-source VLA Bimanual Dexterity2026 🔥 Action Priors for Cross-Embodiment Manip2026 🔥 E-TTS: Embodied Test-Time Scaling2026 🔥 ZR-0: Dense Embodied Chain-of-Thought VLA2026 🔥 UniTacVLA: Tactile Understanding in VLA2026 🔥 CLEAR: Closed-Loop RL Autonomous Driving2026 🔥 WSA₁: 3D-Centric World-Spatial-Action Model2026 🔥 Harness VLA: Steering Frozen VLAs2026 🔥 VIA: Visual Interface Agent for Robot Control2026 🔥 See Like a Robot: Robot-Centric Pointmaps2026 🔥 VistaVLA: 3D Gaussian-Grounded VLA2026 🔥 TrustVLA: Inference-Time Defense Backdoors2026 🔥 Jetson-PI: Onboard Real-Time Robot Control2026 🔥 ExToken: Structured Exploration VLA RL2026 🔥 Anchor-Align: Representation Anchoring VLA2026 🔥 Vision-Driven Embodied Open-World Manip2026 🔥 LIFT: Reactive Force Injection VLA2026 🔥 Action QFormer: Structured Repr Shaping VLA2026 🔥 Reflex: Real-Time VLA Streaming Inference2026 🔥 FoMoVLA: Visual Foresight + Motion Guidance2026 🔥 LifelongVLA: Lifelong Vision-Language-Action2026 🔥 RoboTTT: Context Scaling for Robot Policies2026 🔥 Xiaomi-Robotics-1: 100K Hours Real-World2026 🔥 AC-VLA: Compositional Learning OOD Action2026 🔥 JoyNexus: Multi-Tenant Post-Training VLA2026 🔥 VoxPoser: 3D Value Maps for LLM Manip2023 RoboCat: Self-Improving Generalist Robot2023 UniVLA: Unified Vision-Language-Action Model2025 XR-1: Versatile VLA via Leveled Learning2025 World Action Models: Next Frontier Survey2026 🔥 FLARE: Illumination Robustness Hurts VLA2026 🔥 VLA-RFT: RL Fine-tuning with Verified Rewards2025
🎮T07 人形 Teleop5 深度 + 8 浅入口线索 入门 →
💃T08 动作生成1 深度 + 19 浅入口线索 入门 →
🔮T09 World Model 作为 Simulator2 深度 + 12 浅入口线索 入门 →
🧩T10 VLA + WBC 整合0 深度 + 8 浅入口线索 入门 →
👐T11 灵巧手操作3 深度 + 31 浅入口线索 入门 →
T11 灵巧手操作演进主线
⭐ 深度笔记 深度
浅入口 入门
Dex Manip from Experience and Imitation2016 TACTO: Vision-based Tactile Simulator2020 Hora: In-Hand Object Rotation Adaptation2022 UniDexGrasp: Universal Dexterous Grasping2023 DexArt: Generalizable Dex Articulated Objects2023 RotateIt: In-Hand Rotation Vision Touch2023 DexCap: Portable Mocap Data Collection2024 DexImit: Bimanual Dex from Monocular Video2026 🔥 Humanoid Dexterous Manipulation Made Easy2026 🔥 HandITL: Hand-Arm Intervention VLA Dex2026 🔥 Dexterous Point Policy from Human Demo2026 🔥 FTP-1: Foundation Tactile Policy2026 🔥 DexCompose: Reusing Dex Policies Single Hand2026 🔥 Grasps to Dexterity: Large-Scale Pretraining2026 🔥 Labimus: Dex Manip Chemistry Lab Benchmark2026 🔥 Contact Wrench Guidance from Human Demo2026 🔥 One Demonstration Enough Real-World RL2026 🔥 Current as Touch: Proprioceptive Contact2026 🔥 OmniTacTune: Tactile Residual Adaptation2026 🔥 LAMP: Latent Motion Prior Real-World Dex2026 🔥 T-Rex: Tactile-Reactive Dexterous Manipulation2026 🔥 TouchWorld: Predictive Reactive Tactile FM2026 🔥 AnyDexRT: Calibration-Free Dex Retargeting2026 🔥 DexVerse: Modular Multi-Task Dex Benchmark2026 🔥 GraspGraphNet: Multi-Embodiment Dex Grasp2026 🔥 Pix2Act: Image-Space Equivariant Policies2026 🔥 REGRIND: Minimalist Retargeting RL Recipe2026 🔥 MIDAS Hand: Low-Impedance Anthropomorphic2026 🔥 Handroid: Bridging Dexterous Hand Humanoid2026 🔥 DRL + Demonstrations (DAPG, ADROIT Hand)2017 OpenAI Rubik's Cube: Automatic Domain Randomization2019
🏃T12 敏捷 Locomotion1 深度 + 11 浅入口线索 入门 →
🗂️T13 综述视角0 深度 + 5 浅入口线索 入门 →
T14 抓取 Grasping3 深度 + 3 浅入口线索 入门 →

🧭 快速入口