T14 · 抓取(Grasping):从几何规划到学习到生成
核心问题:怎么让机器人稳定地抓起任意物体——这是 manipulation 的最基础问题,也是当前独立于「灵巧操作(T11)」的一条大线。
状态:🟢 活跃(diffusion 抓取生成 + 6-DoF 是当前前沿)
交叉线索:T11(灵巧操作)、T05(diffusion policy)、T02(数据集)
为什么独立成线:综述 [2507.11840] 明确区分——抓取是几何/运动学问题(找接触点),灵巧操作是动态/多指协调问题(抓起来之后怎么用)。两者技术栈不同。
🎯 你将学到什么
1. 看懂抓取(grasping)作为 manipulation 最基础问题,如何从分析式规划(Dex-Net)→ 真机 RL(QT-Opt)→ 数据驱动判别(GraspNet / AnyGrasp)→ diffusion / flow 生成四代演进
2. 掌握 Dex-Net 的「合成数据 + force-closure metric + 深度网络预测」范式为何是分析式抓取规划的巅峰,以及 QT-Opt 58 万次真机抓取为何是真机 RL 抓取的代表
3. 能解释 GraspNet-1Billion(10 亿抓取候选)为何是抓取的「ImageNet 时刻」,及 AnyGrasp 作为工业级抓取感知的工程意义
4. 理解 diffusion 抓取生成(SE(3)-DiffusionFields / DexDiffuser)相对判别式模型在「对称多解」建模上的优势
5. 学会辨析抓取(T14 几何问题)vs 灵巧操作(T11 动态协调)的边界,以及 DexGraspNet 132 万姿态如何补齐灵巧手抓取数据空白
本页内容
基础解释
一句话直觉
一句话直觉
让机器人稳定抓起任意物体。要回答的是"在哪、以什么姿态抓才不掉"。好比人伸手拿马克杯,先看准把手再下手,而不是盲目一把攥。
从基础理解
是什么·为什么
要解决的问题:给定一个物体,机器人的夹爪或手该在哪、以什么姿态抓,才能稳不掉。
这听起来简单,实际极难。物体形状千变万化,杯子、香蕉、工具、透明物各不一样。还要判抓起来会不会掉、会不会撞到别的东西。
演进脉络:近十年走过四代。
一是几何分析。Dex-Net 用物理公式算每个抓取稳不稳,再让网络从点云预测分数。
二是真机学习。QT-Opt 让夹爪在真机上试了 58 万次,第一次证明大规模真机抓取可行 📎。
三是大数据基准。GraspNet 一次给出 10 亿个抓取标注,成了事实基准 📎。
四是生成式。用扩散模型一次画出多种抓法,不再一个个打分。
方法核心(大白话):抓取本质是"找接触点"。
早期靠物理公式算摩擦,判这把抓得稳不稳。后来让网络从海量合成抓取里学,"长什么样"的抓取通常稳。现在更进一步,用生成模型画出整张抓取分布。一个物体往往有多种抓法,生成式模型能一次列出来。
和灵巧操作的边界:抓取管"抓起来",灵巧操作管"抓起来之后怎么用"。一条完整流程常是先抓取找接触点,再交给灵巧策略做精细动作。
一、这条线索在解决什么
抓取(grasping)要回答:给定一个物体(已知/未知几何),机器人末端(parallel-jaw 夹爪 / 灵巧手 / 吸盘)应该在哪里、以什么姿态抓,才能稳定不掉。
这个问题看似简单,实际极难:
- 几何多样性:杯子、香蕉、工具、透明物、柔性物……几何千变万化
- 稳定性判定:抓起来会不会掉?需要摩擦锥/力闭合分析
- 碰撞约束:抓取姿态不能和环境/物体自身碰撞
- 泛化:训过的物体能抓,没训过的呢?
近十年的演进是:几何分析规划 → 深度学习预测 → 大规模数据驱动 → diffusion/flow 生成。
二、时间线(关键转折)
2010 年代主导的是分析式方法(Dex-Net 系列),用物理几何分析(force-closure、抗扰动 metric)从点云里搜最佳抓取。代表作 Dex-Net 1.0/2.0/3.0(Mahler et al., 2016-2017)。
2017 年第一个分水岭:QT-Opt(Kalashnikov et al., Google, 2018, arxiv:1806.10293)——用大规模 RL + 真机 58 万次尝试让夹爪学会抓取,第一次证明真机大规模 RL 抓取可行。
2018-2020 是大规模数据集时代:GraspNet-1Billion(Fang et al., 2020)提供 10 亿个抓取候选标注,成为 6-DoF 抓取的事实基准。
2022-2023 出现两个方向的突破:
- SE(3)-DiffusionFields(2022, arxiv:2209.03855):用 diffusion 学抓取 cost function
- AnyGrasp(Fang et al., 2023):GraspNet 团队的工业级抓取感知,spatial+temporal 鲁棒
2024 年diffusion 抓取生成成为主流:DexDiffuser、Diffusion-EDMF 等把 diffusion policy 思想用到抓取姿态生成。同时灵巧手抓取(DexGraspNet, 2023)补齐了 132 万 + 灵巧手抓取数据。
三、关键转折深度解析
转折 1 · Dex-Net 系列(2016-2017):分析式抓取规划的巅峰
前作缺陷:早期抓取靠手工规则或简单启发式,泛化差。
核心 idea:Dex-Net(Mahler, UC Berkeley)用物理仿真生成上亿合成抓取,每个标注 force-closure metric(抓取抗扰动能力),再用深度网络从点云预测 metric。Dex-Net 2.0 用 GQ-CNN(Grasp Quality CNN,RSS 2017),Dex-Net 3.0 扩展到吸盘(ICRA 2018)。
为什么是突破:第一次把抓取规划做到「工业级」——合成数据 + 深度网络 + 物理metric。Google 的 grasping 系统大量参考它。
💡 核心洞察:Dex-Net 的工程精髓是「合成数据 + force-closure metric + 深度网络预测」三件套——用物理仿真生成上亿标注把 metric 标准化、再用 GQ-CNN 从点云预测,这一范式把抓取从「启发式规则」升级为「可工业部署的几何规划」,是分析式抓取规划的巅峰。
留下的新问题:合成数据 sim-real gap;只针对 parallel-jaw,灵巧手用不了。
转折 2 · QT-Opt(2018):真机大规模 RL 抓取
前作缺陷:Dex-Net 是「规划式」,需要精确点云。真机点云噪声大、物体未知。
核心 idea:Google 用 off-policy RL(QT-Opt)+ 58 万次真机抓取,让 7-DoF 夹爪从乱堆物体里抓取。不规划,直接学「这个状态下怎么动」。
为什么是突破:第一次证明真机大规模 RL 抓取可行。96% 成功率(7 个 KUKA 机械臂 × 4 个月 × 24/7 累计 580k+ 真机抓取)。是真机大规模 RL 抓取的代表——用真机自我对弈绕过 sim-real gap,与 Dex-Net 的「规划式」形成对偶路线。
💡 核心洞察:QT-Opt 的 96% 成功率是用「4 个月连续抓取 + 58 万次真机磨损」换来的——这一工程选择把抓取从「规划式(需要精确点云)」推向「reactive RL(直接学这个状态下怎么动)」,证明真机大规模 RL 在抓取上能绕过 sim-real gap,但代价是数据成本极高。
留下的新问题:数据成本极高(58 万次真机磨损);只学夹爪,没学灵巧手。
转折 3 · GraspNet-1Billion(2020):6-DoF 抓取基准
前作缺陷:每篇抓取论文用自己的物体集,没法比较。
核心 idea:GraspNet-1Billion(Fang et al., CVPR 2020)提供 88 物体 + 190 场景 / 97,280 RGB-D 帧 + 10 亿抓取候选标注,统一 6-DoF 抓取(夹爪位姿 6 维 + 宽度 = 7-DoF)的评估。GraspNet 用 analytic force-closure(解析力闭合)标注每个抓取的稳定性(score ∈ [0,1])。
为什么是突破:抓取的 ImageNet 时刻。后续 AnyGrasp、Diffusion-EDMF 等都用它训练/评估。
💡 核心洞察:GraspNet-1Billion 是抓取领域的 ImageNet 时刻——88 物体 + 10 亿抓取候选 + analytic force-closure 评分三件套把 6-DoF 抓取评估统一,让后续 AnyGrasp/Diffusion-EDMF 终于有了公共基准,这是抓取从「各家用自己物体集」走向可比较的工程化拐点。
转折 4 · AnyGrasp(2023):工业级抓取感知
核心 idea:GraspNet 团队的商业化版本。给定点云,实时输出稳定的 6-DoF 抓取候选,spatial+temporal 鲁棒(移动相机也能用)。
意义:当前最成熟的开源抓取感知系统之一。很多 manipulation pipeline 直接用 AnyGrasp 出抓取姿态。
转折 5 · Diffusion 抓取生成(2022-2024)
前作缺陷:Dex-Net/AnyGrasp 是「discriminative」(预测每个候选的 quality),对对称多解的抓取分布建模不够。
核心 idea:用 diffusion 模型生成抓取姿态分布。
- SE(3)-DiffusionFields(Urain et al., CoRL 2022):在 SE(3) 空间用 diffusion 学 cost function
- DexDiffuser(Weng et al., 2024, arxiv:2402.02989):灵巧手抓取的 diffusion 生成
- Diffusion-EDMF:把 diffusion 和 GraspNet 结合
意义:抓取从「规划/分类」转向「生成」。和 T05 Diffusion Policy 同源。
💡 核心洞察:diffusion 抓取生成的真正价值在「对称多解」建模——抓取姿态本质是高维多模态分布(同一物体常有多个等价抓法),判别式模型只能挑「最佳」一个,diffusion 能直接采样整个分布;这是「判别 → 生成」范式在抓取上落地的根本动机,与 T05 diffusion policy 同源。
转折 6 · 灵巧手抓取:DexGraspNet(2023)
前作缺陷:Dex-Net/GraspNet 只针对 parallel-jaw 夹爪。灵巧手(Shadow Hand 24 DoF)的抓取空间维度爆炸。
核心 idea:DexGraspNet(Wang et al., ICRA 2023, arxiv:2210.02697)生成 132 万个 Shadow Hand 灵巧手抓取姿态(5,355 物体),用物理优化 + force-closure 仿真标注。
意义:补齐灵巧手抓取的数据空白。是 T11 灵巧操作的数据基础。
2026 最新进展
2026 上半年抓取沿「cross-embodiment 6-DoF 生成 / 大规模抓取预训练迁移到功能性灵巧」两条轴线深化——把「每种夹爪 / 每个任务训一个模型」推到收口:
- GraspGen-X:cross-embodiment 6-DoF 抓取生成(CVPR 2026):GraspGen-X [Han et al., arxiv:2606.00998](NVIDIA Research,CVPR 2026)是 cross-embodiment 6-DoF 抓取模型——用程序化生成的夹爪 + 20 亿抓取样本训练,让扩散模型以夹爪 swept-volume 表示为条件生成 6-DoF 抓取。在仿真与真机均实现对新物体、新场景、新夹爪形态的零样本泛化,超越 prior grasp 生成方法。首次把 6-DoF 抓取生成做到真正 cross-embodiment:用 swept-volume 编码 + 大规模 procedural 夹爪 + 抓取数据,模型对新夹爪形态零样本可用——是 2026 CVPR 抓取基础模型方向的标杆作,对通用机器人抓取具有重要意义。直接回应第七节「灵巧手抓取维度爆炸」「跨本体泛化」开放问题。
- From Grasps to Dexterity:抓取作为功能性灵巧的预训练源:From Grasps to Dexterity [Yuan et al., arxiv:2606.30749](CMU Held 组)把大规模灵巧抓取数据(355k 轨迹)当作 functional dexterity 预训练来源;用「高层手部子目标预测 + 低层目标条件控制」分层 IL 框架,迁移到带工具的功能性操作。把抓取数据从「只学 pick-and-place」扩为「功能性灵巧」预训练源——355k 轨迹是目前最大灵巧抓取预训练之一,为「抓取→灵巧」迁移提供可复用 recipe,打通第四节列出的「抓取 → 灵巧操作」两阶段 pipeline 的端到端桥梁。
📌 关键要点
1. 抓取 vs 灵巧操作是两个层级:抓取是几何 / 运动学问题(找接触点让物体不动)、低频一次性决策;灵巧操作是动态 / 多指协调问题(抓起后怎么用)、高频持续控制——综述明确区分但实际任务中两者交织
2. 四代演进:Dex-Net 分析式(force-closure metric)→ QT-Opt 真机 RL(58 万次尝试 96% 成功率)→ GraspNet / AnyGrasp 数据驱动判别(10 亿候选标注)→ SE(3)-DiffusionFields / DexDiffuser 生成式
3. GraspNet-1Billion(88 物体 + 1.03 十亿 6-DoF grasp 候选 + analytic force-closure 评分)是抓取的 ImageNet 时刻,后续 AnyGrasp / Diffusion-EDMF 都用它训练 / 评估
4. diffusion 抓取生成解决了判别式模型对「对称多解」抓取分布建模不够的问题——抓取姿态本身是高维多模态分布,正好适合 diffusion
5. 当前最大开放问题:未知 / 透明 / 柔性物体抓取失效、灵巧手 24-DoF 抓取空间维度爆炸、抓取 + 后续操作的端到端整合、触觉验证抓取成功——2026 GraspGen-X(cross-embodiment)与 From Grasps to Dexterity(抓取 → 灵巧预训练)是最新收口
四、抓取 vs 灵巧操作的边界(概念辨析)
这是综述 [2507.11840] 强调的关键辨析,也是 T14 和 T11 的分界:
| 维度 | 抓取(Grasping, T14) | 灵巧操作(Dexterous, T11) |
|---|---|---|
| 核心问题 | 找接触点,稳定抓起 | 抓起来之后怎么用(转、捏、工具) |
| 性质 | 几何/运动学 | 动态/多指协调 |
| 频率 | 低频(一次性决策) | 高频(持续控制) |
| 方法 | 规划/分类/生成 | RL/IL/物理控制 |
| 数据 | GraspNet-1Billion、Dex-Net | AMASS、HOI 数据 |
| 代表 | Dex-Net、AnyGrasp、GraspNet | OpenAI Hand、Hora、Visual Dexterity |
实际任务中两者交织:先抓取(T14)找接触点 → 再灵巧操作(T11)做精细动作。一条完整 manipulation pipeline 通常是 AnyGrasp 出抓取姿态 + RL/IL 做后续。
五、抓取方法谱系(按范式)
| 范式 | 代表 | 特点 |
|---|---|---|
| 分析式(force-closure) | Dex-Net 1.0/2.0/3.0 | 物理 metric + 合成数据 |
| 真机 RL | QT-Opt、 Levine hand-eye | 数据贵但真 |
| 数据驱动判别 | GraspNet-1Billion、AnyGrasp | 点云 → 抓取质量评分 |
| 生成式(diffusion/flow) | SE(3)-DiffusionFields、DexDiffuser | 生成抓取分布 |
| 学习 + 优化 | FoundationPose、几种 hybrid | 6-DoF pose 估计 + 抓取 |
六、与其他线索的交叉
- T11 灵巧操作:T14 找接触点,T11 做后续精细动作。两者互补。
- T05 Diffusion Policy:diffusion 抓取生成和 diffusion policy 同源(都是 diffusion 学分布)。
- T02 数据集:GraspNet-1Billion、DexGraspNet 是抓取的数据基石,类比 OpenX 之于 VLA。
- T01 sim-to-real:抓取的合成数据 sim-real gap 是经典问题,Dex-Net 用 synthetic point cloud + analytic metric 缓解,QT-Opt 则用真机数据绕过。
七、当前局限与开放问题
- 未知/透明/柔性物体:点云质量差,抓取规划失效。透明物尤其难。
- sim-real gap on grasping metric:合成标注的 force-closure 和真机稳定性有差距。
- 灵巧手抓取的维度爆炸:24-DoF 抓取空间比夹爪大几个数量级,DexGraspNet 只是开始。
- 抓取 + 后续操作的整合:现在抓取(AnyGrasp)和操作(policy)常是两个独立模块,端到端整合是开放问题。
- 触觉验证抓取成功:没有触觉,抓没抓住只能靠「抬起来看掉不掉」。这是 T11 触觉瓶颈的延伸。
八、涉及里程碑论文
- [Mahler et al., RSS 2017 / ICRA 2018 Workshop, arxiv:1703.09312 / 1709.06670] Dex-Net 2.0 / 3.0 —— 分析式抓取规划巅峰(GQ-CNN + 合成数据 + force-closure metric)
- [Kalashnikov et al., CoRL 2018, arxiv:1806.10293] QT-Opt —— 真机大规模 RL 抓取;详见 P-QTOpt-2018.md
- [Levine et al., IJRR 2018, arxiv:1603.02199] Hand-Eye Coordination —— 早期真机大规模 RL 抓取(800k 尝试,QT-Opt 直接前作)
- [Fang et al., CVPR 2020, arxiv:1912.13470] GraspNet-1Billion —— 6-DoF 抓取基准(88 物体 / 10 亿候选);详见 P-GraspNet-2020.md
- [Fang et al., 2023, arxiv:2212.08333] AnyGrasp —— 工业级抓取感知;详见 P-AnyGrasp-2023.md
- [Urain et al., CoRL 2022, arxiv:2209.03855] SE(3)-DiffusionFields —— diffusion 抓取生成开山
- [Wang et al., ICRA 2023, arxiv:2210.02697] DexGraspNet —— 灵巧手抓取数据集(132 万姿态 / 5,355 物体 / Shadow Hand)
- [Weng et al., 2024, arxiv:2402.02989] DexDiffuser —— 灵巧手 diffusion 抓取
- [Newbury et al., IEEE T-RO 2023] Deep Learning Approaches to Grasp Synthesis: A Review —— 抓取深度学习综述
- [Han et al., CVPR 2026, arxiv:2606.00998] GraspGen-X —— cross-embodiment 6-DoF 抓取生成(20 亿样本 + swept-volume)
九、延伸
- 关联线索:T11 灵巧操作(灵巧操作)、T05 Diffusion Policy 谱系(diffusion 谱系)、T02 数据基础设施(GraspNet 数据基石)
- 本仓库综述:T13 具身 RL 综述(综述揭示 T14 是最大缺口)
- 本仓库概念:C-action-representations.md(抓取姿态作为 action 的一种)
十、关联论文笔记
本线索涉及的核心论文在本仓库已有深度笔记:
- P-GraspNet-2020.md [Fang et al., CVPR 2020, arxiv:1912.13470]——本线索的枢纽节点。88 个物体 + 190 场景 / 97,280 RGB-D 帧 + 1.03 十亿 6-DoF grasp 候选,analytic force-closure 评分(score ∈ [0,1])。baseline = PointNet++ + U-Net,三个 head(approach score / approach vector / collision),多任务 loss。AP / Coverage / Diversity 三 metric 在 seen/similar/novel × single/packed/pile 九个 setting 上报。详细的 7-DoF grasp 表示、评估协议、AP 数字见该笔记。
- P-AnyGrasp-2023.md [Fang et al., arxiv:2212.08333]——GraspNet 团队的工业级抓取感知 / 商业化 SDK。架构 = 稀疏卷积骨干 + 多帧融合(sliding window point cloud fusion)+ 三 head(approach score / direction / width),spatial + temporal 鲁棒让移动相机下抓取候选稳定输出;novel 物体 AP 从 baseline ~48% 推到 60%+。本仓库 PDF 未收录,精确架构细节(是否含 transformer、loss 权重)待核。
- P-QTOpt-2018.md [Kalashnikov et al., CoRL 2018, arxiv:1806.10293]——真机大规模 RL 抓取的开山。off-policy continuous-action Q-learning + CEM(N=64/M=6/2 iter)+ 双 target network(EMA 0.9999 + lag 6000 step);7 KUKA × 4 个月 × 24/7 累计 580k+ 真机抓取(+28k on-policy finetune);off-policy 87% → +on-policy 96%。还涉及自动涌现的 regrasping / pre-grasp / singulation 行为。
papers/P-DexGraspNet-2023.md(待补全)——灵巧手 132 万 grasp(5,355 物体,Shadow Hand),T11 的数据基石。papers/P-SEDiffusionFields-2022.md(待补全)——diffusion 抓取生成开山(CoRL 2022)。
可选复盘:常见误区
澄清:"抓取就是灵巧操作" —— 不是。抓取管"抓起来"(找接触点、判稳定性),是几何运动学问题;灵巧操作管"抓起来之后怎么用"(转、捏、用工具),是动态协调问题。两者技术栈不同。
"抓取就是灵巧操作" —— 不是。抓取管"抓起来"(找接触点、判稳定性),是几何运动学问题;灵巧操作管"抓起来之后怎么用"(转、捏、用工具),是动态协调问题。两者技术栈不同。
一条流程里先抓取再灵巧操作,是接力,不是一回事。
澄清:"生成式抓取已经取代了 Dex-Net 那一代" —— 没完全取代。分析式和数据驱动方法在工业抓取(如 AnyGrasp)里仍是主力;生成式更擅长"一个物体多解"的场景。
"生成式抓取已经取代了 Dex-Net 那一代" —— 没完全取代。分析式和数据驱动方法在工业抓取(如 AnyGrasp)里仍是主力;生成式更擅长"一个物体多解"的场景。
四代方法是并存互补,不是简单的后代替代前代。
澄清:"有了大数据就能抓一切" —— 不能。透明物、柔性物、没见过的物体,现在都还抓不稳;合成标注的稳定性跟真机有差距。
"有了大数据就能抓一切" —— 不能。透明物、柔性物、没见过的物体,现在都还抓不稳;合成标注的稳定性跟真机有差距。
数据扩大了覆盖面,但泛化和仿真到真机的差距仍是开放问题。
可选复盘:检查点
抓取和灵巧操作各自管哪一段?在"拿起杯子喝水"这种任务里,两者怎么接力?
查看参考答案
- 抓取管'抓起来':找接触点、判稳定性,是几何运动学问题。
- 灵巧操作管'抓起来之后怎么用'(转、捏、把杯子送到嘴边等精细动作),是动态协调问题。
- 接力方式:先用抓取找到稳定接触点把杯子抓起来,再交给灵巧操作策略做后续精细动作;是前后衔接,不是同一件事。
四代方法里,每一代相比前代补上了什么短板?为什么说它们今天仍并存互补、而不是后者替掉前者?
查看参考答案
- 第一代(几何分析/Dex-Net):用物理公式算每个候选抓取稳不稳,再让网络从点云打分——核心动作是'逐个评分'。
- 第二代(真机学习/QT-Opt):不规划,让夹爪在真机上反复试错学习——核心动作换成了'真机试错学策略'。
- 第三代(大数据基准/GraspNet):把评分规模化、标准化成 10 亿级共享标注——核心动作是'用统一大数据把评分变成基准'。
- 第四代(生成式/扩散):不再逐个打分,而是用生成模型一次画出多种抓法——核心动作换成'生成分布'。
用"找接触点"这个核心思路,向一个没学过机器人的朋友解释抓取到底在算什么。再举一个你自己的日常类比。
查看参考答案
- 抓取本质是在物体上找'手该放在哪、以什么朝向接触',才能稳不掉。
- 稳定性靠接触点的位置和姿态决定,而不是靠抓得多紧。
一个物体往往不止一种抓法。四代方法里,哪一代最自然地表达"多解"?为什么前几代做不到?
查看参考答案
- 第四代生成式(扩散模型)最自然表达多解:它能一次画出整张抓取分布,列出多种抓法。
- 前三代做不到的原因:几何分析和大数据基准都是'逐个候选打分'(判别式),本质是挑一个最优;真机学习学的是单一策略。判别式框架很难一次表达'多个都行'。
为什么抓取领域需要一个共享的 10 亿级基准?没有它,研究会被什么卡住?
查看参考答案
- 没有共享基准时,每篇论文用自己的物体集,没法横向比较——'超越 SOTA'无从谈起。
- 10 亿级标注把评测统一化、规模化,让所有方法在同一物体集、同一指标下比,比较才有意义。
- 类比:它是抓取领域的'统一考试卷',没有它各家自说自话。
可选复盘:FAQ
Q1:抓取一定要用灵巧手吗?
不一定要。平行夹爪、吸盘、灵巧手都算抓取。研究最多的是夹爪(Dex-Net、GraspNet);灵巧手抓取是另一摊(DexGraspNet)。
Q2:工业上现在最常用哪一套?
AnyGrasp 是当前最成熟的开源抓取感知系统之一。很多操作流程直接拿它出抓取姿态。
Q3:抓取研究现在最大的坑在哪?
三处:未知、透明、柔性物体抓不稳;合成训练和真机稳定性有差距;抓取和后续操作还是两个独立模块,端到端整合还没解决。