DexCap:穿在身上的「动捕手套」,让机器人学会人类级灵巧手
DexCap 的解法像它的名字一样直接:把一套便携动捕手套 + RGB-D 相机背心穿在人身上,人在真实环境里自然做事,系统同时记下「3D 手部位姿 + 3D 场景点云」。然后通过指尖 IK + 点云 diffusion policy,直接训出机器人策略——不用机器人参与数据采集。
🎯 为什么重要:灵巧手数据的「采集困境」
给一个 16-DoF 灵巧手 + 7-DoF 机械臂(双臂就 ×2)做模仿学习,数据采集是核心瓶颈。两条老路都有硬伤:
DexCap 不是「再做一个视觉动捕」,而是承认视觉方法的物理上限,改用穿戴式传感器融合:SLAM 解决手腕 6-DoF,EMF 解决手指抗遮挡,LiDAR 解决场景 3D ——三个传感器各管一段。
💡 核心思想:3 个穿戴传感器,对齐到同一世界坐标系
🛠️ 四个关键工程设计
| 模块 | 设计 | 为什么必要 |
|---|---|---|
| ① EMF 手套(Rokoko) | 指尖嵌磁传感器,抗视觉遮挡 | 灵巧操作时手-物遮挡极频繁,视觉方法(HaMeR)此时失败;EMF 直接测磁场,看不见也能记位置 |
| ② SLAM 手腕追踪(T265) | 每个手套背侧装 T265(鱼眼 + IMU),SLAM 出 6-DoF 手腕 | IMU 漂移、纯相机不可携;SLAM 自带地图校正长时间漂移,且不需要外置第三视角 |
| ③ LiDAR 背心(L515) | 胸前 RGB-D LiDAR 记 3D 场景,对齐到 SLAM 世界系 | 策略需要 3D 观测;LiDAR 比纯 RGB 更稳,且把人躯干移动「扣掉」,得到稳定场景 |
| ④ 快速校准 | 3D 打印卡槽:采集前 T265 插背心校准(10s),再插手套 | 把校准矩阵转成「常量变换」,之后的所有数据都自动对手套-背心-LiDAR 同步 |
| 算法选择 | 选择 | 原因 |
|---|---|---|
| Retargeting | 指尖 IK:人 5 指尖 → LEAP 4 指尖(弃小指)+ 6-DoF 手腕 | 研究证实指尖是手物接触最频繁区(HO-3D、GRAB、ARCTIC),保指尖位置就保了功能 |
| 观测类型 | 点云(不是 RGB) | 把人躯干移动隔离到世界系;in-the-wild 数据采集时人一直在动,点云可重对齐到固定世界系 |
| 策略头 | Diffusion Policy + Perceiver 编码 | 双臂 ×(7+16) ×d 步 = 高维输出,回归会塌;diffusion 抗多模;Perceiver 比 PointNet 在双臂任务上 +20% |
| 人在环路 | 残差模式(小修)+ 遥操作模式(大改),脚踏板切换 | 策略已学会基本动作时,大部分 rollout 只需小修,残差够用;偶尔需大调时切遥操作 |
人穿戴采集时身体会自然晃动,相机也在动 → RGB 帧的「背景」全在变 → 模型学不动。
点云把它变换到统一世界系后,背景对齐,模型只需关注手物关系。
Diffusion policy 又能扛住「同一场景多种抓法」的多模态——双臂 46 维输出,回归必崩。这个组合不是巧合,是 in-the-wild 数据的必然选择。
📊 关键结果:30 分钟数据,60-72% 成功率
6 个任务(海绵拾取、球收集、擦盘、包装、剪剪刀、泡茶),单任务 30-60 分钟 DexCap 数据。
| 任务 | DexIL(DP-perc) | 对比基线 |
|---|---|---|
| 三任务平均(海绵/球/擦盘) | 0.72 | BC-RNN-img 0.00;DP-img 0.00;DP-point 0.63 |
| 包装(in-the-wild 数据) Subtask / Full | 0.70 / 0.47 | DP-img-mask 0.17 / 0.00;BC-RNN-point 0.33 / 0.23 |
| 包装 + 30 次人在环路 | 0.83 / 0.57 | DP-img-mask + 修正 0.47 / 0.33 |
| 剪剪刀(挑战性工具) | 0.45 Subtask / 0.20 Full | 仅 DexCap 数据时 0/0;人在环路拉起 +45 subtask / +20 full |
| 泡茶(长程多步) | 0.65 Subtask / 0.25 Full | — |
| 采集速度(vs 遥操作) | 3× 快 | 接近自然人手速度 |
| 对未见物体的泛化(包装) | 0.42(人修后) | 仅 DexCap 数据 0.40 |
🌐 在领域中的位置
DexCap 是「可穿戴数据采集」范式的标志性工作,它和 BunnyVisionPro(用 Vision Pro 做便携遥操作)一起,代表了 2024 年「把数据采集从实验室解放出来」的浪潮。算法上它直接采用了 Diffusion Policy 作为动作头,是扩散策略在高维灵巧手场景的代表应用。
❓ 常见误区
DexCap 是遥操作吗?
不是。数据采集阶段机器人完全不参与——人穿戴 DexCap 在真实环境里做事,系统只录数据。训练阶段用录下的 mocap + 点云离线训策略。执行阶段才有机器人在跑。所以它和 DexPilot、Vision Pro 这类「实时遥操作」是不同范式——DexCap 是「离线采集 + 离线训练」,效率 3× 于遥操作。
$4k 的硬件能复刻吗?
能。论文明确说硬件设计是模块化的,不绑定品牌(手套、相机、迷你 PC 都可替换),代码 + 教学视频开源。整机 3.96 磅、续航 40 分钟、校准 < 10 秒。
为什么不用最近很火的 Vision Pro 做手部追踪?
DexCap 是 2024 年初的工作,Vision Pro(2024-02 上市)那时还没普及。后续的 BunnyVisionPro 证实用 Vision Pro 做遥操作可行——但 DexCap 的定位是离线数据采集,Vision Pro 类系统是实时遥操作,两者解决的问题不同。
指尖 IK retargeting 不会失真吗?
会,特别是手指长度比例差异大的任务(论文以剪刀为例:剪刀稳定握持需要手指深插进手柄,但人手与 LEAP 手指长度比例不同,即使指尖位置对齐也无法保证同样的夹持力)。这就是 DexCap 提供「人在环路纠正」的原因——它不是可选项,是必需品的补丁。