GraspNet-1Billion:把抓取评估从「各家用自家尺子」变成「共用一把尺子」
🎯 为什么重要:抓取研究的「ImageNet 时刻」
到 2019 年抓取研究的硬伤,论文 Intro 列得很清楚:
① 数据集各自为政:Cornell 240 物体(8K grasp)、Jacquard 5.4 万图(1.1M grasp)、Dex-Net 6.7M grasp——规模差 4 个数量级,方法间不可比;
② 大多数是 2D 抓取(俯视 + 旋转角),不能表达真实 6-DoF 夹爪位姿(位置 3D + 旋转 SO(3));
③ 评估指标混乱:rectangle metric / antipodal score / force-closure / 真机成功率——同一方法在不同 metric 下排名完全不同;
④ Cornell 已 saturate 到 99%+——数据集太简单、指标太宽松,没区分度。
论文给的问题:能不能造一个大规模、6-DoF、统一评估的抓取 benchmark? 答案就是 GraspNet-1Billion——真机 RGB-D 数据 + 自动 6-DoF 标注 + 在线 analytic force-closure 评估。
💡 核心思想:真实采集 + 解析标注 + 在线评估
关键洞见:抓取标注无穷多(连续 6-DoF 空间),不能靠人标,也不能纯靠仿真。论文走第三条路——真实采集图像 + 解析计算标注,鱼与熊掌兼得。
🛠️ 关键设计:从力封闭到 AP 的完整评估协议
grasp score 定义(PDF Eq. 2)
每个 grasp 候选用 antipodal force-closure(Nguyen 1988 经典 metric,论文用 Liang 等 2019 改进版)判「抓不抓得住」。从 $\mu=0.1$ 起以 $\Delta\mu=0.1$ 步长增大,直到 grasp 首次构成 antipodal——越小的 $\mu$ 越稳(摩擦系数低都能夹住 = 真稳):
$$s = 1.1 - \mu, \qquad s\in(0, 1] \tag{PDF Eq. 2}$$
$s=1.0$($\mu=0.1$,极稳)到 $s\to 0$(极易掉)。正/负样本比约 1:2(PDF §3.3 原文 "ratio of positive and negative labels in our dataset is around 1:2")。
评估协议(PDF §3.4)
| 组件 | 定义 |
|---|---|
| AP(Average Precision) | top-N 中能成功执行的 grasp 占比,平均 Precision@k($k=1..50$),按 COCO 风格在 $\mu=0.1..0.5$ 上平均 |
| Coverage | 对每个物体「可达 grasp 集」中方法覆盖到的比例 |
| Diversity | 方法输出 grasp 在 6-DoF 空间的多样性 |
| pose-NMS | 平移 $<1$ cm、旋转 $<5°$、每物体至多 $K=10$ grasp——防止单物体 dominate |
| 数据划分 | 100 train / 70 test(30 seen + 30 similar + 10 novel)→ 测泛化 |
| 堆叠模式 | single / packed(紧密)/ pile(乱堆)× 3 物体类 = 9 setting |
之前的 rectangle metric(IOU > 0.25 + 角度 < 30°)有两个问题:① 只能评 2D 矩形表示,对 6-DoF 无能为力;② 容差太宽——Cornell 已 saturate 到 99%+,没区分度。analytic force-closure 直接用物理规则判——给定夹爪位姿 + 物体 mesh + $\mu$,输出二值 antipodal 标签,对任何 grasp 表示都通用。这才是「跨方法可比」的基础。
📊 结果:解析 score 与真机 96% 对齐
PDF §4(真机实验,Flexiv Rizon 机械臂 + RealSense 435,10 物体每个随机抽 100 grasp):
| score $s$ | 真机成功率范围 | 含义 |
|---|---|---|
| $s=1.0$ | 89% – 98%(均值 ~96%) | 极稳,低摩擦都能夹 |
| $s=0.5$ | 59% – 68% | 中等 |
| $s=0.1$ | 5% – 23% | 临界,高摩擦才夹得住 |
graspnet-baseline 结果(官方 README)
| 相机 | Seen AP | Similar AP | Novel AP |
|---|---|---|---|
| RealSense | 27.56 | 26.11 | 10.55 |
| Kinect | 29.88 | 27.84 | 11.51 |
🌐 在领域中的位置
GraspNet 是抓取研究的 ImageNet 时刻。它之后,几乎所有 6-DoF 抓取工作都基于它训或评:AnyGrasp(同团队商业化版)、Diffusion-EDMF、DexGraspNet(灵巧手 1.32 亿 grasp,同 pipeline)。关联线索:T14 抓取枢纽、T11 灵巧操作(DexGraspNet 数据基石)、T02 数据集抓取数据基石。
❓ 常见误区
GraspNet 评估用的是物理仿真吗?
不是。论文 §3.3 原文 "our evaluation system directly reports whether a grasping is successful or not by analytic computation"——是解析力封闭计算,基于 Nguyen 1988 经典理论的改进版。给定夹爪位姿 + 物体 mesh + 摩擦系数 $\mu$,直接算是否 antipodal,不需要跑 Bullet 物理仿真。
为什么 grasp 数能到 3.7 亿 / 1B+?
因为是自动解析标注:每物体每视角球面采 V 个接近方向,再在「in-plane rotation × gripper depth」二维网格上搜可行 grasp,自动生成。不需要人标,所以可以无限扩。CVPR 终版扩到 1B+,是此前最大数据集(Dex-Net 6.7M)的 150 倍以上。
$\mu$ 是什么?为什么 score 和它相关?
$\mu$ = 摩擦系数。低摩擦下能夹住 = 夹爪对位姿误差容忍度高 = 真稳。所以 $s = 1.1 - \mu$:$\mu=0.1$(极滑)能夹 → $s=1.0$ 满分;$\mu$ 越大(越靠摩擦力硬撑)→ $s$ 越低。PDF 实测 $s=1$ 真机 ~96%,$s=0.1$ 真机 ~10%——验证了 score 物理意义。
GraspNet 是生成式还是判别式方法?
判别式(discriminative)。对每个候选 grasp 打分,挑 top-K。不能生成多模态 grasp 分布——这是它的局限,后续 SE(3)-DiffusionFields / Diffusion-EDMF 用 diffusion 生成补上这块。AnyGrasp 2023 是同团队后续商业化版,换稀疏卷积骨干 + 跨帧跟踪。
它支持灵巧手吗?
不支持。GraspNet 只针对 parallel-jaw 夹爪(7-DoF:位置 3 + 旋转 3 + 宽度 1)。灵巧手(Shadow 24-DoF / Allegro 16-DoF)抓取空间维度爆炸,是 DexGraspNet [Wang 2023] 用类似 pipeline 生成 1.32 亿灵巧手 grasp 补齐的。