深度⏱ ~4 min
枢纽
⭐ 为何重要

大规模通用物体抓取 benchmark(10^9 量级抓取标注),是 grasping 方向的 ImageNet 级数据集。它定义了 grasp detection 的训练-评估标准,被大量后续抓取工作作为基准。

数据集GraspNet-1Billion
输入模态vision
📍 演进位置
建立在
  • Dex-Net 2.0
  • Dex-Net 3.0
催生

论文:Hao-Shu Fang, Chenxi Wang, Minghao Gou, Cewu Lu. GraspNet-1Billion: A Large-Scale Benchmark for General Object Grasping. CVPR 2020, pp. 11444–11453, 上海交通大学 MVIG / John Hopcroft Center. arXiv:1912.13470(arXiv 预印本原题 GraspNet: A Large-Scale Clustered and Densely Annotated Dataset for Object Grasping,CVPR 版扩到 97,280 帧 / 十亿量级抓取并更名)。🌐🌐 · 代码/数据/leaderboard:graspnet.net。

一句话直觉

给抓取研究造一个共享的"大赛场"。

以前每篇论文自家用几个物体自说自话,没法比。

GraspNet 之于抓取,就像 ImageNet 之于图像识别。

大家终于能在同一个十亿量级的考场上同台竞技。

是什么·为什么

要解决的问题:让机械臂抓陌生物体。

到 2019 年,抓取研究有个尴尬:每篇论文用自己的小物体集。

你用你的杯子和笔,我用我的方块和玩具。

方法之间根本没法比,谁好谁坏全凭自报。📎

老办法的硬伤

一是大多数数据集只有俯视图。

抓取只能写成"从上往下、转一个角度",只有四个自由度

可真实抓取里,夹爪可以从各种方向斜着靠近。

俯视图表达不了这种完整位姿。📎

二是六自由度数据极缺。

六自由度指夹爪在三维空间里的完整位姿——位置三个、朝向三个。

以前要么是合成的,要么规模太小。

三是评估不统一。

有的论文用几何启发式打分,有的报真机成功率。

跨论文根本对不上。

GraspNet 的转身:造一个大规模、六自由度、统一评估的考场。

物体有 88 个。

注意:不是 97,280——那是 RGB-D 图像帧数,常被误读成物体数。

190 个人工堆叠场景,近十万张 RGB-D 图像。

对每个物体每个视角,密集采样各种抓取方向。

总共生成十亿量级的抓取候选。📎

方法核心(大白话):分三件事。

这是一篇"造考场"的论文。

方法不是主角,考场本身才是。

第一件是"造数据"。

88 个物体分三路来源。

32 个来自 YCB 数据集。

13 个来自 DexNet 2.0,是对抗性物体,专为难抓取设计。

43 个是团队自采。

把它们随机堆到桌上。

摆成"单物""紧密堆叠""乱堆"三种样子。

用两台深度相机各从两百多个角度拍。

一台 RealSense,一台 Kinect。

得到近十万张 RGB-D 图像。📎

第二件是"标抓取"。

光有图像不够,要标"哪些抓取能成功"。

做法不是人手标。

在物体表面密集采样靠近方向。

每个方向找两指能夹住的角度。

一个物体能采出上百万候选,加起来十亿量级。

但这么多候选里,很多实际抓不住。

所以第三件最关键:"用解析计算判真伪"。

每个候选用 force-closure(力封闭)解析方法算。

算的是:夹爪在这个位姿下能不能靠摩擦力稳住。

能抵抗任意方向外力,就算成功,给正标签。

不能,就判失败,给负标签。

这样每个候选都有"力学上抓不抓得住"的真实标签。

不再是"看起来能夹住"的纸上谈兵。📎

为什么解析评估是关键:以前的评估规模小、也不统一。

GraspNet 直接用解析计算判成败。

论文用的是 analytic force-closure 计算。

它不靠物理引擎跑仿真,也不靠人手标。

解析方法能批量、确定性地处理十亿候选。

这才是十亿规模可行的根本原因。

它让标签真正反映"力学上能不能夹住"。

而且任何形式的抓取位姿都能评。

不必穷举标注 ground-truth。📎

附带的判别模型:论文还顺带给一个 baseline。

看一张场景点云,对每个点预测抓取。

做法是把"靠近方向"和"操作参数"解耦着学。

再加一个 grasp affinity field(抓取亲和力场)提升鲁棒性。

它不是论文主角,主角是考场本身。

它成绩也远没到顶。

三类物体的 AP 都只有两到三成。

这反而留出大量改进空间。

让 leaderboard 持续活跃至今。🌐

你会看到:后续抓取工作几乎都基于这套数据和评估。

同团队 2023 年的 AnyGrasp,在同一考场上大幅提升。

别的团队做扩散抓取、灵巧手抓取,也站在这个考场肩上。🌐

一句话类比:GraspNet 之于抓取,就像 ImageNet 之于图像识别。

都把各自领域从"各家小数据集"推进到"共享大规模考场"。

怎么做

核心机制·四件事叠成一个考场:物体集、场景集、抓取标注、解析评估。📎

物体集(GraspNet-1Billion Object,共 88 个):88 个带高质量三维网格的日常物体,来源三部分:

  • 32 个来自 YCB 数据集(适合抓取的子集)。
  • 13 个来自 DexNet 2.0(专为难抓取设计的"对抗性物体",3D 打印件)。
  • 43 个团队自采

覆盖真实场景的几何多样性,从杯碗到对抗件都有。📎

场景集(97,280 帧 RGB-D / 190 场景):190 个场景,每场景多个物体随机堆叠。

三种堆叠模式:single object(单物)/ packed(紧密堆叠)/ pile(乱堆)。

用两台 RGB-D 相机(Intel RealSense + Kinect)各从 256 个视角采图,共 97,280 帧。

注册到桌面坐标,还原点云 + 物体六自由度位姿标注。📎

抓取标注(十亿量级候选):对每个物体每个视角,用"靠近方向 + 二指夹爪"参数化密集采样。

  • 六自由度表示:旋转矩阵(3×3,夹爪朝向)加夹爪中心位置(三维)。再加一维夹爪宽度,共七自由度。形式化记法见下方深度部分。
  • 采样:物体表面密集采样靠近方向。每个方向用 antipodal sampling 找可能的二指夹持。
  • 总共 1.1 billion+ 候选(约十亿)。📎

解析评估(analytic force-closure)——关键贡献:每个候选用解析的 force-closure 计算判"抓不抓得住"。不是物理引擎仿真

  • 论文原文:"our evaluation system directly reports whether a grasping is successful by analytic computation"。基于 force-closure(力封闭)理论。
  • 判定逻辑:在该位姿下,夹爪两指通过摩擦能否抵抗任意方向的外力/力矩。能抵抗即 force-closure 成立,算成功。
  • 输出 grasp score ∈ [0,1],阈值化得到正/负标签。
  • 优势:可批量、确定性、无需物理仿真逐个跑,能扩展到十亿量级;且能评估任意形式的抓取位姿,不必穷举 ground-truth。

这是 GraspNet 比前作高一个维度的关键,也是"十亿规模"在工程上可行的根本原因。📎

评估协议:给定一帧 RGB-D + 对齐点云,方法输出一批按分数排序的抓取候选。

benchmark 用 analytic force-closure 算每个候选能否成功。

核心 metric 是 AP(Average Precision)。并在不同摩擦系数(如 μ=0.8 / 0.4)下分别报,衡量方法对摩擦假设的鲁棒性。另有 Coverage 衡量方法对每个物体可达抓取集的覆盖比例。🌐

测试集按物体分三类:Seen(见过)/ Similar(同类未见)/ Novel(全新),各 30 个场景;再乘三种堆叠模式。📎[未确认]

常见误区(先抛一个,完整版见末尾):"GraspNet 的十亿抓取都是人手标的?"

——错。十亿候选是几何采样生成的,人标根本来不及。

真正给候选打分的是 analytic force-closure 解析计算。每个候选在力学上算一次能不能夹住,force-closure 成立就给正标签。📎

正确理解:标签由解析计算自动产生,这才是十亿规模可行的原因。

深度

Baseline 网络结构(end-to-end,point cloud 输入):输入是对齐点云。

论文 baseline 是端到端的 grasp pose 预测网络,骨干用 PointNet++ 系列点云特征提取。

原文要点:"we learn approaching direction and operation parameters in a decoupled manner"——把"从哪个方向靠近(approaching direction)"和"操作参数(operation parameters,含夹爪宽度、in-plane 旋转等)"解耦着学。

另外专门设计了一个 grasp affinity field(抓取亲和力场) 来提升鲁棒性。📎

(注:摘要未给精确的 head 划分与 loss 公式;精确网络层数、各 head 维度未核实到,标 [未确认]。)[未确认]

推理流程

  1. 对场景点云提特征。
  2. 对候选点解耦预测 approaching direction + operation parameters。
  3. 用 grasp affinity field / 可抓性打分筛选。
  4. 按 score 排序、做去重(NMS)后输出 top-N。📎[未确认]

关键工程要点

  • View-based sampling:物体表面密集采 approach direction,再 NMS 去重。
  • Collision label:评估/训练时考虑夹爪是否与环境碰撞(官方 repo 评估设 --collision_thresh)。
  • Tolerance label:原始数据集不含 tolerance label,需用 graspnet-baseline repo 的脚本另外生成(官方 README 明示)。🌐

实验结果(论文 baseline,RealSense 相机,"In paper" AP,来自官方 graspnet-baseline README)

SplitSeenSimilarNovel
AP27.5626.1110.55
AP @ μ=0.833.4334.1811.25
AP @ μ=0.416.9514.233.98

Kinect 相机略高(Seen/Similar/Novel AP = 29.88 / 27.84 / 11.51)。🌐

baseline 远未 saturate——这才是 leaderboard 持续活跃至今的原因。

后续 AnyGrasp(2023, T-RO)在同一 benchmark 上把成绩大幅推高,方法换骨干 + 加时序,但评估协议不变——这是 GraspNet 的最大遗产。🌐[未确认]

局限(被后续工作补足)

  1. 只针对 parallel-jaw:灵巧手(Shadow 24-DoF / Allegro 16-DoF)抓取空间维度爆炸,未覆盖。DexGraspNet [Wang 2023] 用类似 pipeline 生成 1.32 亿灵巧手 grasp 补齐。[未确认]
  2. 判别式而非生成式:baseline 是判别式(每候选打分),不能生成多模态 grasp 分布。SE(3)-DiffusionFields / Diffusion-EDMF 改用扩散/流生成。🌐
  3. 物体 set 主要静态/桌面:移动场景、人在环(人手递物)不覆盖。后续 AnyGrasp 部分扩到 moving camera / dynamic grasping。🌐
  4. 解析 score 和真机有 gap:force-closure 是力学理想化模型,和真机成功率仍有差距(具体 gap 数未核实到)。[未确认]
  5. 单帧决策 vs temporal:是单帧 grasp 规划,不建模"抓取过程中物体姿态变化"。后续 dynamic grasping 线补这块。[未确认]

研究者视角

图谱定位:GraspNet-1Billion 是 T14 抓取线索的枢纽节点——6-DoF 抓取的事实基准。📎

后续 AnyGrasp、Diffusion-EDMF、DexGraspNet 全部基于其数据格式与评估协议。

它把抓取从"每篇论文自定物体集"推进到"统一大规模 benchmark",是抓取的"ImageNet 时刻"。

核心遗产(四件)📎

  1. 抓取的 ImageNet 时刻:第一次提供 6-DoF 抓取的统一大规模 benchmark + 评估协议。
  2. 从 2D 抓取推进到 6-DoF:把抓取空间从 4-DoF(位置 2 + 旋转 1 + 宽度 1)扩到 7-DoF,是规划维度升级。
  3. analytic force-closure 评估成为事实标准:用解析力封闭计算判 grasp 成败,可批量、确定性、可扩展到十亿量级,成为后续抓取 benchmark 的默认评估方式。
  4. 数据规模 1B+ 让深度学习可用:之前抓取数据集规模小一到两个数量级,1B+ 候选让判别式深度模型有足够样本。

继承与催生

  • 建立在:PointNet/PointNet++ [Qi 2017]、Dex-Net 2.0/3.0 [Mahler 2017](借其对抗性物体集)、antipodal grasp sampling 与 force-closure 经典理论(Nguyen 1988 等)、Cornell Dataset / Jacquard(前作 2D 抓取集)。📎
  • 同期/后续抓取
  • AnyGrasp [Fang 2023, T-RO]——同团队后续,spatial+temporal 鲁棒。🌐
  • Diffusion-EDMF [2023]——扩散抓取生成和 GraspNet 结合。
  • DexGraspNet [Wang 2023]——灵巧手 1.32 亿 grasp,同 pipeline。
  • SE(3)-DiffusionFields [2022]——扩散在 SE(3) 学 cost。🌐
  • FoundationPose [Wen 2023]——6-DoF 位姿估计 + 抓取联动。

Open problems

  1. 动态抓取:GraspNet 是单帧静态规划。抓取过程中物体姿态变化的在线修正,仍是开放方向。[未确认]
  2. 灵巧手统一基准:DexGraspNet 补了灵巧手数据,但灵巧手抓取的统一评估协议远不如 parallel-jaw 成熟。[未确认]
  3. 解析评估 vs 真机的 gap:force-closure 是理想化模型。如何在 benchmark 里引入真机评估且可复现,开放。[未确认]

常见误区

"十亿抓取都是人手标的" —— 错。十亿候选是几何采样生成,人标根本来不及。真正打分的是 analytic force-closure 解析计算——每个候选在力学上算一次能不能夹住。📎

标签由解析计算自动产生,这是十亿规模可行的原因。

"GraspNet 用 Bullet 物理仿真评估" —— 错(这是常见的误传)。论文原文明言评估直接通过 analytic computation(force-closure 力封闭)判定,不跑 Bullet 仿真逐个抓。📎

解析力封闭计算可批量、确定性、可扩展到十亿量级,是评估协议的核心。

"GraspNet 有九千多个物体" —— 错。这是把 97,280 帧图像数误读成了物体数。物体只有 88 个(32 YCB + 13 DexNet 2.0 + 43 自采)。📎

规模大在"图像帧 × 视角 × 抓取候选"维度,不在物体数。

"几何上能夹住就等于能抓住" —— 错。几何 antipodal 只看两指对不对,但重心偏了、夹的位置太靠边,力学上仍可能不满足 force-closure。📎

GraspNet 用 force-closure 解析计算判真伪,"几何能夹" ≠ "力封闭成立"。

"GraspNet 的 baseline 模型是论文主角" —— 错。主角是考场本身(数据 + 评估协议)。baseline 成绩远未到顶(RealSense Seen/Similar/Novel AP 仅 27.56/26.11/10.55),只是给个起点。🌐

论文贡献是 benchmark,不是 SOTA 模型。

"抓取就是俯视加旋转" —— 错(针对老办法)。那是 4-DoF 的 2D 抓取(Cornell/Jacquard)。GraspNet 把抓取扩到 7-DoF(位置 3 + 旋转 3 + 宽度 1),夹爪能从任意方向斜着靠近。📎

这是规划维度的升级,不只是数据变大。

检查点

Q1

到 2019 年抓取研究有个尴尬:每篇论文用自己的小物体集。这对"方法之间能不能比较"意味着什么?GraspNet 造的东西怎么解决了这个问题?

💡 参考答案

  • 意味着:每个方法在不同物体集上自报成绩,没有共同考场,方法之间根本没法直接比较,谁好谁坏说不清。
  • GraspNet 造了一个共享的大规模考场(统一物体集 + 统一场景 + 统一评估协议),所有方法都在同一套数据和同一个物理裁判上比。
  • 于是方法之间终于可以直接比较,这才是'基准/benchmark'的价值。
Q2

老办法的抓取数据集大多是俯视图。从"自由度"的角度说,俯视图能表达的抓取位姿缺了什么?GraspNet 把抓取扩到了几自由度?

💡 参考答案

  • 俯视图只能表达'从上往下、转一个角度'的抓取,缺了'夹爪从各种方向斜着靠近'的能力——只覆盖了平面里的少数自由度(约 4 自由度)。
  • 真实抓取里夹爪可以从任意三维方向靠近,俯视图表达不了这种完整位姿。
  • GraspNet 把抓取扩到六自由度(位置 3 + 朝向 3),再加一维夹爪宽度,共七自由度。
Q3

十亿量级的抓取候选不可能是人手标的。GraspNet 用什么办法给每个候选打上"抓不抓得住"的真实标签?(提示:不是物理仿真。)为什么用这个办法能扩展到十亿规模?

💡 参考答案

  • 用物理仿真(Bullet)给每个候选打标签:在仿真里真抓一次(夹爪闭合→抬起→晃),物体掉不掉决定分数。
  • 不用几何启发式的原因:几何上'看起来能夹住'(反作用力对)不等于物理上抓得住——重心偏、夹得靠边,一抬就掉。
  • 物理仿真才真正反映'能不能抓住',这是标签可靠的根本原因。
Q4

GraspNet 物体集一共多少个?很多人把这个数字和 97,280 搞混——那个 97,280 是什么?

💡 参考答案

  • 类比要点:ImageNet 之前图像识别各自用小数据集,ImageNet 给了共享大规模考场,整个领域的方法都能直接比较、快速发展。
  • GraspNet 之于抓取同理:之前各自用小物体集自说自话,GraspNet 给了统一的大规模数据 + 统一物理评估,后续抓取工作几乎都基于它训/评。
  • 枢纽节点含义:它是后续工作(AnyGrasp、Diffusion-EDMF、DexGraspNet 等)共同的地基和比较标准。
Q5

用"ImageNet 之于图像识别"或自己举的类比,向没学过机器人的人解释:GraspNet 对抓取研究为什么是"枢纽节点"?

💡 参考答案

  • 两到三成说明任务远没到顶(未饱和),还有大量改进空间。
  • 正因为没到顶,后续研究者有明确的进步余地,可以不断提交新方法到 leaderboard 比拼,让领域持续活跃。
  • 如果一个 baseline 一上来就 99%,这个考场就没意义了——没人能再超过它。低分 baseline 反而是 benchmark 长期活跃的保障。

FAQ

Q1:GraspNet 的十亿抓取候选是怎么来的?

几何采样生成,不是人手标。对每个物体每个视角,在表面密集采靠近方向,每个方向用 antipodal sampling 找二指夹持。每个候选再用 analytic force-closure 解析计算判定能不能夹住。📎

Q2:为什么用 analytic 计算,不用物理仿真或真机?

论文原文:评估系统"directly reports whether a grasping is successful by analytic computation"。解析 force-closure 可批量、确定性地给十亿候选打分,且能评估任意形式的抓取位姿而不必穷举 ground-truth。物理仿真/真机不可复现、不可大规模。📎

Q3:GraspNet 和 AnyGrasp 什么关系?

同一团队(SJTU MVIG)。GraspNet-1Billion(2020, CVPR)是学术基准 + baseline;AnyGrasp(2023, IEEE T-RO)是其后续工作,换骨干、加时序、做成可调用的抓取基础设施,在同一 benchmark 上大幅提升。🌐

Q4:灵巧手能用 GraspNet 吗?

不能。GraspNet 只覆盖 parallel-jaw(二指夹爪)。灵巧手抓取要换 DexGraspNet(1.32 亿灵巧手 grasp,同 pipeline)。[未确认]

Q5:AP 和 Coverage 各衡量什么?

AP 衡量方法输出的 top-N 中能成功(force-closure 成立)的占比,并在不同摩擦系数下分别报,衡量对摩擦假设的鲁棒性;Coverage 衡量方法覆盖每个物体可达抓取集的比例(漏没漏物体)。🌐