里程碑
数据集GraspNet-1Billion
上真机
实时
输入模态vision

AnyGrasp:给机器人一只「什么都能抓」的眼睛

Hao-Shu Fang 等(上海交大 MVIG)。arXiv:2212.08333, 2023(IEEE T-RO 2023)。 dexterousgraspingT14 抓取

🧠 一句话心智模型:抓取感知的老办法是「先在点云上采一堆候选抓取,再一个个评分」——又稀疏又慢。AnyGrasp 改成「一眼给整片」:给一帧点云,一次前向直接吐出场景里所有可能的稠密 7-DoF 抓取,还能跨帧做抓取跟踪(时序一致)。在 300+ 没见过的物体上,清框成功率 93.3%,比肩人类。它是 GraspNet 学术线长出来的最成熟抓取系统之一(代码开/权重闭)。

🎯 为什么重要:抓取感知的「工程化」关卡

GraspNet-1Billion(2020)建了 6-DoF 抓取基准,但留下三个工程坑:①「采样-评分」稀疏慢;②只看静态单帧,动态场景抓取会跳变;③仿真训练在真机商用深度相机(±5mm 噪声)下性能掉。AnyGrasp 把这三坑一次填了,做出真机可用的抓取系统。

核心矛盾:真机抓取要「稠密 + 快 + 时序一致 + 抗深度噪声」。学术 baseline(单帧稀疏评分)四条都缺。

💡 核心思想:稠密空间预测 + 时序对应 + 真机数据

点云 (单帧,真机 深度噪声) AnyGrasp 网络 ① 空间:单次前向 稠密 7-DoF 抓取 ② 时序:跨帧对应 稠密抓取 + 跟踪 真机数据训练 抗噪声 机器人抓取 300+ 未见物体 93.3% 清框
图:AnyGrasp——单帧点云一次前向出稠密抓取(空间)+ 跨帧对应(时序)+ 真机数据抗噪 → 真机可用。

🛠️ 关键设计

设计心智为什么必要
稠密 7-DoF 抓取预测(单次前向)不再「采样-评分」,网络直接对整片点云输出所有抓取稠密 + 快(取代慢的稀疏采样)
时序 grasp 对应跨帧把「同一抓取」对应起来,避免跳变动态场景(移相机/移物)下抓取需时序一致
真机数据训练用真机深度(带噪声)而非仿真完美深度训练填 sim-real gap——商用相机(RealSense)下不掉性能
🔮 关键洞察:AnyGrasp 的价值在「把学术 baseline 工程化到真机可用」——稠密、时序一致、抗噪声,三项让抓取感知从「论文」变成「可部署服务」(论文同时发布 grasping library;后续 Anygrasp SDK 的工业采用情况待核)。

📊 结果

维度结果
清框成功率300+ 未见物体上 93.3%(attempt-centric;完成率 99.8%;人类 93.9%)
速度抓取预测 <100ms,整体决策 <200ms(单次前向给稠密抓取)
吞吐单臂 900+ MPPH(mean picks per hour)
动态跨帧 grasp 对应,抓移动物体(水箱中抓机器鱼)
影响论文发布 grasping library;后续商用 SDK(代码开/权重闭)

🌐 在领域中的位置

DexNet(2D/夹爪,几何) GraspNet-1Billion(6-DoF 基准) AnyGrasp(稠密+时序+真机)⭐ Anygrasp SDK(商用抓取后端)

抓取感知「工业化」节点,GraspNet 学术线的真机落地。关联 T14 抓取

❓ 常见误区

AnyGrasp 和 GraspNet 什么关系?

GraspNet-1Billion 是 2020 的数据集+基准(学术);AnyGrasp 是同团队(上交 MVIG)2023 的系统——在 GraspNet 基线上加稠密预测+时序+真机训练,做成可部署的抓取感知。

它开源吗?

代码框架开源、核心权重闭源,以 pip/ROS SDK 形式提供。是「可用但非完全开放」的典型。