AnyGrasp:给机器人一只「什么都能抓」的眼睛
🧠 一句话心智模型:抓取感知的老办法是「先在点云上采一堆候选抓取,再一个个评分」——又稀疏又慢。AnyGrasp 改成「一眼给整片」:给一帧点云,一次前向直接吐出场景里所有可能的稠密 7-DoF 抓取,还能跨帧做抓取跟踪(时序一致)。在 300+ 没见过的物体上,清框成功率 93.3%,比肩人类。它是 GraspNet 学术线长出来的最成熟抓取系统之一(代码开/权重闭)。
🎯 为什么重要:抓取感知的「工程化」关卡
GraspNet-1Billion(2020)建了 6-DoF 抓取基准,但留下三个工程坑:①「采样-评分」稀疏慢;②只看静态单帧,动态场景抓取会跳变;③仿真训练在真机商用深度相机(±5mm 噪声)下性能掉。AnyGrasp 把这三坑一次填了,做出真机可用的抓取系统。
核心矛盾:真机抓取要「稠密 + 快 + 时序一致 + 抗深度噪声」。学术 baseline(单帧稀疏评分)四条都缺。
💡 核心思想:稠密空间预测 + 时序对应 + 真机数据
图:AnyGrasp——单帧点云一次前向出稠密抓取(空间)+ 跨帧对应(时序)+ 真机数据抗噪 → 真机可用。
🛠️ 关键设计
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| 稠密 7-DoF 抓取预测(单次前向) | 不再「采样-评分」,网络直接对整片点云输出所有抓取 | 稠密 + 快(取代慢的稀疏采样) |
| 时序 grasp 对应 | 跨帧把「同一抓取」对应起来,避免跳变 | 动态场景(移相机/移物)下抓取需时序一致 |
| 真机数据训练 | 用真机深度(带噪声)而非仿真完美深度训练 | 填 sim-real gap——商用相机(RealSense)下不掉性能 |
🔮 关键洞察:AnyGrasp 的价值在「把学术 baseline 工程化到真机可用」——稠密、时序一致、抗噪声,三项让抓取感知从「论文」变成「可部署服务」(论文同时发布 grasping library;后续 Anygrasp SDK 的工业采用情况待核)。
📊 结果
| 维度 | 结果 |
|---|---|
| 清框成功率 | 300+ 未见物体上 93.3%(attempt-centric;完成率 99.8%;人类 93.9%) |
| 速度 | 抓取预测 <100ms,整体决策 <200ms(单次前向给稠密抓取) |
| 吞吐 | 单臂 900+ MPPH(mean picks per hour) |
| 动态 | 跨帧 grasp 对应,抓移动物体(水箱中抓机器鱼) |
| 影响 | 论文发布 grasping library;后续商用 SDK(代码开/权重闭) |
🌐 在领域中的位置
DexNet(2D/夹爪,几何)→
GraspNet-1Billion(6-DoF 基准)→
AnyGrasp(稠密+时序+真机)⭐→
Anygrasp SDK(商用抓取后端)
抓取感知「工业化」节点,GraspNet 学术线的真机落地。关联 T14 抓取。
❓ 常见误区
AnyGrasp 和 GraspNet 什么关系?
GraspNet-1Billion 是 2020 的数据集+基准(学术);AnyGrasp 是同团队(上交 MVIG)2023 的系统——在 GraspNet 基线上加稠密预测+时序+真机训练,做成可部署的抓取感知。
它开源吗?
代码框架开源、核心权重闭源,以 pip/ROS SDK 形式提供。是「可用但非完全开放」的典型。