Q1:GraspNet 的十亿抓取候选是怎么来的?
几何采样生成,不是人手标。对每个物体每个视角,在表面密集采靠近方向,每个方向用 antipodal sampling 找二指夹持。每个候选再用 analytic force-closure 解析计算判定能不能夹住。📎
论文:Hao-Shu Fang, Chenxi Wang, Minghao Gou, Cewu Lu. GraspNet-1Billion: A Large-Scale Benchmark for General Object Grasping. CVPR 2020, pp. 11444–11453, 上海交通大学 MVIG / John Hopcroft Center. arXiv:1912.13470(arXiv 预印本原题 GraspNet: A Large-Scale Clustered and Densely Annotated Dataset for Object Grasping,CVPR 版扩到 97,280 帧 / 十亿量级抓取并更名)。🌐🌐 · 代码/数据/leaderboard:graspnet.net。
给抓取研究造一个共享的"大赛场"。
以前每篇论文自家用几个物体自说自话,没法比。
GraspNet 之于抓取,就像 ImageNet 之于图像识别。
大家终于能在同一个十亿量级的考场上同台竞技。
要解决的问题:让机械臂抓陌生物体。
到 2019 年,抓取研究有个尴尬:每篇论文用自己的小物体集。
你用你的杯子和笔,我用我的方块和玩具。
方法之间根本没法比,谁好谁坏全凭自报。📎
老办法的硬伤:
一是大多数数据集只有俯视图。
抓取只能写成"从上往下、转一个角度",只有四个自由度。
可真实抓取里,夹爪可以从各种方向斜着靠近。
俯视图表达不了这种完整位姿。📎
二是六自由度数据极缺。
六自由度指夹爪在三维空间里的完整位姿——位置三个、朝向三个。
以前要么是合成的,要么规模太小。
三是评估不统一。
有的论文用几何启发式打分,有的报真机成功率。
跨论文根本对不上。
GraspNet 的转身:造一个大规模、六自由度、统一评估的考场。
物体有 88 个。
注意:不是 97,280——那是 RGB-D 图像帧数,常被误读成物体数。
190 个人工堆叠场景,近十万张 RGB-D 图像。
对每个物体每个视角,密集采样各种抓取方向。
总共生成十亿量级的抓取候选。📎
方法核心(大白话):分三件事。
这是一篇"造考场"的论文。
方法不是主角,考场本身才是。
第一件是"造数据"。
88 个物体分三路来源。
32 个来自 YCB 数据集。
13 个来自 DexNet 2.0,是对抗性物体,专为难抓取设计。
43 个是团队自采。
把它们随机堆到桌上。
摆成"单物""紧密堆叠""乱堆"三种样子。
用两台深度相机各从两百多个角度拍。
一台 RealSense,一台 Kinect。
得到近十万张 RGB-D 图像。📎
第二件是"标抓取"。
光有图像不够,要标"哪些抓取能成功"。
做法不是人手标。
在物体表面密集采样靠近方向。
每个方向找两指能夹住的角度。
一个物体能采出上百万候选,加起来十亿量级。
但这么多候选里,很多实际抓不住。
所以第三件最关键:"用解析计算判真伪"。
每个候选用 force-closure(力封闭)解析方法算。
算的是:夹爪在这个位姿下能不能靠摩擦力稳住。
能抵抗任意方向外力,就算成功,给正标签。
不能,就判失败,给负标签。
这样每个候选都有"力学上抓不抓得住"的真实标签。
不再是"看起来能夹住"的纸上谈兵。📎
为什么解析评估是关键:以前的评估规模小、也不统一。
GraspNet 直接用解析计算判成败。
论文用的是 analytic force-closure 计算。
它不靠物理引擎跑仿真,也不靠人手标。
解析方法能批量、确定性地处理十亿候选。
这才是十亿规模可行的根本原因。
它让标签真正反映"力学上能不能夹住"。
而且任何形式的抓取位姿都能评。
不必穷举标注 ground-truth。📎
附带的判别模型:论文还顺带给一个 baseline。
看一张场景点云,对每个点预测抓取。
做法是把"靠近方向"和"操作参数"解耦着学。
再加一个 grasp affinity field(抓取亲和力场)提升鲁棒性。
它不是论文主角,主角是考场本身。
它成绩也远没到顶。
三类物体的 AP 都只有两到三成。
这反而留出大量改进空间。
让 leaderboard 持续活跃至今。🌐
你会看到:后续抓取工作几乎都基于这套数据和评估。
同团队 2023 年的 AnyGrasp,在同一考场上大幅提升。
别的团队做扩散抓取、灵巧手抓取,也站在这个考场肩上。🌐
一句话类比:GraspNet 之于抓取,就像 ImageNet 之于图像识别。
都把各自领域从"各家小数据集"推进到"共享大规模考场"。
核心机制·四件事叠成一个考场:物体集、场景集、抓取标注、解析评估。📎
物体集(GraspNet-1Billion Object,共 88 个):88 个带高质量三维网格的日常物体,来源三部分:
覆盖真实场景的几何多样性,从杯碗到对抗件都有。📎
场景集(97,280 帧 RGB-D / 190 场景):190 个场景,每场景多个物体随机堆叠。
三种堆叠模式:single object(单物)/ packed(紧密堆叠)/ pile(乱堆)。
用两台 RGB-D 相机(Intel RealSense + Kinect)各从 256 个视角采图,共 97,280 帧。
注册到桌面坐标,还原点云 + 物体六自由度位姿标注。📎
抓取标注(十亿量级候选):对每个物体每个视角,用"靠近方向 + 二指夹爪"参数化密集采样。
解析评估(analytic force-closure)——关键贡献:每个候选用解析的 force-closure 计算判"抓不抓得住"。不是物理引擎仿真。
这是 GraspNet 比前作高一个维度的关键,也是"十亿规模"在工程上可行的根本原因。📎
评估协议:给定一帧 RGB-D + 对齐点云,方法输出一批按分数排序的抓取候选。
benchmark 用 analytic force-closure 算每个候选能否成功。
核心 metric 是 AP(Average Precision)。并在不同摩擦系数(如 μ=0.8 / 0.4)下分别报,衡量方法对摩擦假设的鲁棒性。另有 Coverage 衡量方法对每个物体可达抓取集的覆盖比例。🌐
测试集按物体分三类:Seen(见过)/ Similar(同类未见)/ Novel(全新),各 30 个场景;再乘三种堆叠模式。📎[未确认]
常见误区(先抛一个,完整版见末尾):"GraspNet 的十亿抓取都是人手标的?"
——错。十亿候选是几何采样生成的,人标根本来不及。
真正给候选打分的是 analytic force-closure 解析计算。每个候选在力学上算一次能不能夹住,force-closure 成立就给正标签。📎
正确理解:标签由解析计算自动产生,这才是十亿规模可行的原因。
Baseline 网络结构(end-to-end,point cloud 输入):输入是对齐点云。
论文 baseline 是端到端的 grasp pose 预测网络,骨干用 PointNet++ 系列点云特征提取。
原文要点:"we learn approaching direction and operation parameters in a decoupled manner"——把"从哪个方向靠近(approaching direction)"和"操作参数(operation parameters,含夹爪宽度、in-plane 旋转等)"解耦着学。
另外专门设计了一个 grasp affinity field(抓取亲和力场) 来提升鲁棒性。📎
(注:摘要未给精确的 head 划分与 loss 公式;精确网络层数、各 head 维度未核实到,标 [未确认]。)[未确认]
推理流程:
关键工程要点:
--collision_thresh)。graspnet-baseline repo 的脚本另外生成(官方 README 明示)。🌐实验结果(论文 baseline,RealSense 相机,"In paper" AP,来自官方 graspnet-baseline README):
| Split | Seen | Similar | Novel |
|---|---|---|---|
| AP | 27.56 | 26.11 | 10.55 |
| AP @ μ=0.8 | 33.43 | 34.18 | 11.25 |
| AP @ μ=0.4 | 16.95 | 14.23 | 3.98 |
Kinect 相机略高(Seen/Similar/Novel AP = 29.88 / 27.84 / 11.51)。🌐
baseline 远未 saturate——这才是 leaderboard 持续活跃至今的原因。
后续 AnyGrasp(2023, T-RO)在同一 benchmark 上把成绩大幅推高,方法换骨干 + 加时序,但评估协议不变——这是 GraspNet 的最大遗产。🌐[未确认]
局限(被后续工作补足):
图谱定位:GraspNet-1Billion 是 T14 抓取线索的枢纽节点——6-DoF 抓取的事实基准。📎
后续 AnyGrasp、Diffusion-EDMF、DexGraspNet 全部基于其数据格式与评估协议。
它把抓取从"每篇论文自定物体集"推进到"统一大规模 benchmark",是抓取的"ImageNet 时刻"。
核心遗产(四件):📎
继承与催生:
Open problems:
"十亿抓取都是人手标的" —— 错。十亿候选是几何采样生成,人标根本来不及。真正打分的是 analytic force-closure 解析计算——每个候选在力学上算一次能不能夹住。📎
标签由解析计算自动产生,这是十亿规模可行的原因。
"GraspNet 用 Bullet 物理仿真评估" —— 错(这是常见的误传)。论文原文明言评估直接通过 analytic computation(force-closure 力封闭)判定,不跑 Bullet 仿真逐个抓。📎
解析力封闭计算可批量、确定性、可扩展到十亿量级,是评估协议的核心。
"GraspNet 有九千多个物体" —— 错。这是把 97,280 帧图像数误读成了物体数。物体只有 88 个(32 YCB + 13 DexNet 2.0 + 43 自采)。📎
规模大在"图像帧 × 视角 × 抓取候选"维度,不在物体数。
"几何上能夹住就等于能抓住" —— 错。几何 antipodal 只看两指对不对,但重心偏了、夹的位置太靠边,力学上仍可能不满足 force-closure。📎
GraspNet 用 force-closure 解析计算判真伪,"几何能夹" ≠ "力封闭成立"。
"GraspNet 的 baseline 模型是论文主角" —— 错。主角是考场本身(数据 + 评估协议)。baseline 成绩远未到顶(RealSense Seen/Similar/Novel AP 仅 27.56/26.11/10.55),只是给个起点。🌐
论文贡献是 benchmark,不是 SOTA 模型。
"抓取就是俯视加旋转" —— 错(针对老办法)。那是 4-DoF 的 2D 抓取(Cornell/Jacquard)。GraspNet 把抓取扩到 7-DoF(位置 3 + 旋转 3 + 宽度 1),夹爪能从任意方向斜着靠近。📎
这是规划维度的升级,不只是数据变大。
到 2019 年抓取研究有个尴尬:每篇论文用自己的小物体集。这对"方法之间能不能比较"意味着什么?GraspNet 造的东西怎么解决了这个问题?
💡 参考答案
老办法的抓取数据集大多是俯视图。从"自由度"的角度说,俯视图能表达的抓取位姿缺了什么?GraspNet 把抓取扩到了几自由度?
💡 参考答案
十亿量级的抓取候选不可能是人手标的。GraspNet 用什么办法给每个候选打上"抓不抓得住"的真实标签?(提示:不是物理仿真。)为什么用这个办法能扩展到十亿规模?
💡 参考答案
GraspNet 物体集一共多少个?很多人把这个数字和 97,280 搞混——那个 97,280 是什么?
💡 参考答案
用"ImageNet 之于图像识别"或自己举的类比,向没学过机器人的人解释:GraspNet 对抓取研究为什么是"枢纽节点"?
💡 参考答案
几何采样生成,不是人手标。对每个物体每个视角,在表面密集采靠近方向,每个方向用 antipodal sampling 找二指夹持。每个候选再用 analytic force-closure 解析计算判定能不能夹住。📎
论文原文:评估系统"directly reports whether a grasping is successful by analytic computation"。解析 force-closure 可批量、确定性地给十亿候选打分,且能评估任意形式的抓取位姿而不必穷举 ground-truth。物理仿真/真机不可复现、不可大规模。📎
同一团队(SJTU MVIG)。GraspNet-1Billion(2020, CVPR)是学术基准 + baseline;AnyGrasp(2023, IEEE T-RO)是其后续工作,换骨干、加时序、做成可调用的抓取基础设施,在同一 benchmark 上大幅提升。🌐
不能。GraspNet 只覆盖 parallel-jaw(二指夹爪)。灵巧手抓取要换 DexGraspNet(1.32 亿灵巧手 grasp,同 pipeline)。[未确认]
AP 衡量方法输出的 top-N 中能成功(force-closure 成立)的占比,并在不同摩擦系数下分别报,衡量对摩擦假设的鲁棒性;Coverage 衡量方法覆盖每个物体可达抓取集的比例(漏没漏物体)。🌐