枢纽
数据集GraspNet-1Billion
输入模态vision

GraspNet-1Billion:把抓取评估从「各家用自家尺子」变成「共用一把尺子」

Hao-Shu Fang, Chenxi Wang, Minghao Gou, Cewu Lu(上海交大 SJTU)。arXiv:1912.13470(CVPR 2020)。 开源:graspnet.net leaderboard · 数据 ~30 GB · grasping6-DoFbenchmark 线索 T14

🧠 一句话心智模型:抓取领域 2019 年的乱象是「每篇论文用自己的数据集 + 自己的评估指标」——方法之间根本没法比。GraspNet 给了一把统一的尺子:8.7 万真实 RGB-D 帧 + 3.7 亿个 6-DoF grasp 标注 + 一个基于解析力封闭(analytic force-closure)的在线评估器。从此抓取研究从「自家园子」走向「共享大规模 benchmark」——抓取领域的 ImageNet 时刻。

🎯 为什么重要:抓取研究的「ImageNet 时刻」

到 2019 年抓取研究的硬伤,论文 Intro 列得很清楚:

四个硬伤
数据集各自为政:Cornell 240 物体(8K grasp)、Jacquard 5.4 万图(1.1M grasp)、Dex-Net 6.7M grasp——规模差 4 个数量级,方法间不可比;
大多数是 2D 抓取(俯视 + 旋转角),不能表达真实 6-DoF 夹爪位姿(位置 3D + 旋转 SO(3));
评估指标混乱:rectangle metric / antipodal score / force-closure / 真机成功率——同一方法在不同 metric 下排名完全不同;
Cornell 已 saturate 到 99%+——数据集太简单、指标太宽松,没区分度。

论文给的问题:能不能造一个大规模、6-DoF、统一评估的抓取 benchmark? 答案就是 GraspNet-1Billion——真机 RGB-D 数据 + 自动 6-DoF 标注 + 在线 analytic force-closure 评估。

💡 核心思想:真实采集 + 解析标注 + 在线评估

关键洞见:抓取标注无穷多(连续 6-DoF 空间),不能靠人标,也不能纯靠仿真。论文走第三条路——真实采集图像 + 解析计算标注,鱼与熊掌兼得。

① 物体集:88 个高质量 mesh YCB 32 个(标准抓取基准)+ Dex-Net 2.0 13 个(对抗性难抓)+ 自采 43 个(SJTU 扫描) 覆盖 cm–dm 尺度 / shape / texture / material 多样性 ② 真实场景采集 170 个 clustered 场景 每场景 ~10 物体堆叠 机械臂末端 256 视角(球面 1/4) 2 相机:RealSense 435 + Kinect 4 Azure ③ 帧数 = 87,040 RGB-D 170 × 256 × 2 = 87,040 每帧 = 对齐点云 + 6-DoF 物体位姿 首帧人工标 + ArUco + ICP 传播 CVPR 终版扩到 190 场景 / 97,280 帧 ④ 解析 grasp 标注 每物体每视角:球面采 V 个接近方向 × 网格搜 (gripper depth × in-plane rot) × 收 gripper width 到无碰撞 → 总计 370M+ grasp(v2)/ 1B+(CVPR) 比此前最大数据集大 3 个数量级 ⑤ analytic force-closure 评估 不是 Bullet 物理仿真 给定 grasp + mesh + 摩擦 µ → 解析判断 antipodal 力封闭 score s = 1.1 - µ,正负比 ~1:2 在线评估任何 grasp 表示 → 跨方法可比
图 1:GraspNet 数据 + 评估 pipeline(基于 PDF §3)。核心创新在 右下角——analytic force-closure 让评估变成「物理规则计算」,不依赖任何具体 grasp 表示,从此不同方法可以公平比较。

🛠️ 关键设计:从力封闭到 AP 的完整评估协议

grasp score 定义(PDF Eq. 2)

每个 grasp 候选用 antipodal force-closure(Nguyen 1988 经典 metric,论文用 Liang 等 2019 改进版)判「抓不抓得住」。从 $\mu=0.1$ 起以 $\Delta\mu=0.1$ 步长增大,直到 grasp 首次构成 antipodal——越小的 $\mu$ 越稳(摩擦系数低都能夹住 = 真稳):

$$s = 1.1 - \mu, \qquad s\in(0, 1] \tag{PDF Eq. 2}$$

$s=1.0$($\mu=0.1$,极稳)到 $s\to 0$(极易掉)。正/负样本比约 1:2(PDF §3.3 原文 "ratio of positive and negative labels in our dataset is around 1:2")。

评估协议(PDF §3.4)

组件定义
AP(Average Precision)top-N 中能成功执行的 grasp 占比,平均 Precision@k($k=1..50$),按 COCO 风格在 $\mu=0.1..0.5$ 上平均
Coverage对每个物体「可达 grasp 集」中方法覆盖到的比例
Diversity方法输出 grasp 在 6-DoF 空间的多样性
pose-NMS平移 $<1$ cm、旋转 $<5°$、每物体至多 $K=10$ grasp——防止单物体 dominate
数据划分100 train / 70 test(30 seen + 30 similar + 10 novel)→ 测泛化
堆叠模式single / packed(紧密)/ pile(乱堆)× 3 物体类 = 9 setting
🔮 直觉:为什么 analytic force-closure 是关键?
之前的 rectangle metric(IOU > 0.25 + 角度 < 30°)有两个问题:① 只能评 2D 矩形表示,对 6-DoF 无能为力;② 容差太宽——Cornell 已 saturate 到 99%+,没区分度。analytic force-closure 直接用物理规则判——给定夹爪位姿 + 物体 mesh + $\mu$,输出二值 antipodal 标签,对任何 grasp 表示都通用。这才是「跨方法可比」的基础。

📊 结果:解析 score 与真机 96% 对齐

PDF §4(真机实验,Flexiv Rizon 机械臂 + RealSense 435,10 物体每个随机抽 100 grasp):

score $s$真机成功率范围含义
$s=1.0$89% – 98%(均值 ~96%)极稳,低摩擦都能夹
$s=0.5$59% – 68%中等
$s=0.1$5% – 23%临界,高摩擦才夹得住
关键洞察:analytic score 和真机成功率单调对齐——$s=1$ 时真机 ~96%,$s=0.1$ 时真机 ~10%。这是「analytic 评估真能预测真机」的关键证据,也是 GraspNet leaderboard 数字可信的物理基础。但 sim-to-real gap 仍有 5–10%($s=1$ 时真机不到 100%)。

graspnet-baseline 结果(官方 README)

相机Seen APSimilar APNovel AP
RealSense27.5626.1110.55
Kinect29.8827.8411.51

来源:官方 graspnet/graspnet-baseline README,AP 平均 over $\mu\in[0.1,0.5]$。baseline 表现远未 saturate(novel 仅 ~10% AP)——给后续工作留了大量改进空间,也是 leaderboard 持续活跃至今的原因。

🌐 在领域中的位置

Cornell / Jacquard(2D 矩形抓取) Dex-Net 2.0(合成 6-DoF,单物体) GraspNet-1Billion(真实 6-DoF + 多物体 + 统一评估)⭐ AnyGrasp / DexGraspNet / SE(3)-DiffusionFields

GraspNet 是抓取研究的 ImageNet 时刻。它之后,几乎所有 6-DoF 抓取工作都基于它训或评:AnyGrasp(同团队商业化版)、Diffusion-EDMF、DexGraspNet(灵巧手 1.32 亿 grasp,同 pipeline)。关联线索:T14 抓取枢纽、T11 灵巧操作(DexGraspNet 数据基石)、T02 数据集抓取数据基石。

❓ 常见误区

GraspNet 评估用的是物理仿真吗?

不是。论文 §3.3 原文 "our evaluation system directly reports whether a grasping is successful or not by analytic computation"——是解析力封闭计算,基于 Nguyen 1988 经典理论的改进版。给定夹爪位姿 + 物体 mesh + 摩擦系数 $\mu$,直接算是否 antipodal,不需要跑 Bullet 物理仿真。

为什么 grasp 数能到 3.7 亿 / 1B+?

因为是自动解析标注:每物体每视角球面采 V 个接近方向,再在「in-plane rotation × gripper depth」二维网格上搜可行 grasp,自动生成。不需要人标,所以可以无限扩。CVPR 终版扩到 1B+,是此前最大数据集(Dex-Net 6.7M)的 150 倍以上

$\mu$ 是什么?为什么 score 和它相关?

$\mu$ = 摩擦系数。低摩擦下能夹住 = 夹爪对位姿误差容忍度高 = 真稳。所以 $s = 1.1 - \mu$:$\mu=0.1$(极滑)能夹 → $s=1.0$ 满分;$\mu$ 越大(越靠摩擦力硬撑)→ $s$ 越低。PDF 实测 $s=1$ 真机 ~96%,$s=0.1$ 真机 ~10%——验证了 score 物理意义。

GraspNet 是生成式还是判别式方法?

判别式(discriminative)。对每个候选 grasp 打分,挑 top-K。不能生成多模态 grasp 分布——这是它的局限,后续 SE(3)-DiffusionFields / Diffusion-EDMF 用 diffusion 生成补上这块。AnyGrasp 2023 是同团队后续商业化版,换稀疏卷积骨干 + 跨帧跟踪。

它支持灵巧手吗?

不支持。GraspNet 只针对 parallel-jaw 夹爪(7-DoF:位置 3 + 旋转 3 + 宽度 1)。灵巧手(Shadow 24-DoF / Allegro 16-DoF)抓取空间维度爆炸,是 DexGraspNet [Wang 2023] 用类似 pipeline 生成 1.32 亿灵巧手 grasp 补齐的。