枢纽
机器人dexterous hand-arm
上真机
实时
输入模态便携 SLAM(RealSense T265)+ EM 电磁手套 + 3D 场景

DexCap:穿在身上的「动捕手套」,让机器人学会人类级灵巧手

Chen Wang, Haochen Shi, Weizhuo Wang, Ruohan Zhang, Li Fei-Fei, C. Karen Liu(斯坦福)。RSS 2024 / arXiv:2403.07788。 项目页 · 硬件 + 代码全开源(≤$4k) · teleopdexterous manipulation数据采集

🧠 一句话心智模型:要教机器人用灵巧手做事,瓶颈不在算法,在数据——遥操作太慢、视觉动捕怕遮挡。
DexCap 的解法像它的名字一样直接:把一套便携动捕手套 + RGB-D 相机背心穿在人身上,人在真实环境里自然做事,系统同时记下「3D 手部位姿 + 3D 场景点云」。然后通过指尖 IK + 点云 diffusion policy,直接训出机器人策略——不用机器人参与数据采集

🎯 为什么重要:灵巧手数据的「采集困境」

给一个 16-DoF 灵巧手 + 7-DoF 机械臂(双臂就 ×2)做模仿学习,数据采集是核心瓶颈。两条老路都有硬伤:

遥操作机器人 VR/手柄控机械臂 · 真机动作慢 → 慢 · 要硬件 → 贵 · 难规模化 DexCap: 3× 快 纯视觉动捕 单目相机估手 · 2D 投影 → 失 3D · 自遮挡就崩(手碰物时高频) · 第三视角相机 → 不可携 HaMeR 失败案例多 DexCap ✅ 穿戴式混合方案 · EMF 手套抗遮挡 · SLAM 追 6-DoF 手腕 · LiDAR 背心录 3D 场景 · 走到哪采到哪 < $4k、3.96 磅、40min 续航
图 1:三种数据采集范式的取舍。DexCap 用「EMF 手套(抗遮挡)+ SLAM(便携 6-DoF 手腕)+ LiDAR(3D 场景)」绕开了前两者的死穴。
核心洞察:纯视觉 2D 的根本问题是「训练时用固定相机内参,测试时不对齐」;而机器人策略学习需要精确的 3D 信息(6-DoF 手腕 + 3D 指尖)。
DexCap 不是「再做一个视觉动捕」,而是承认视觉方法的物理上限,改用穿戴式传感器融合:SLAM 解决手腕 6-DoF,EMF 解决手指抗遮挡,LiDAR 解决场景 3D ——三个传感器各管一段。

💡 核心思想:3 个穿戴传感器,对齐到同一世界坐标系

NUC +电池 L515 3D 场景点云 EMF 手套 抗遮挡手指 T265 SLAM 手腕 6-DoF DexIL 三步管线: ① 指尖 IK Retargeting 人指尖位置 → 16-DoF LEAP 关节 ② 点云观测变换 RGB-D → 世界坐标系点云 ③ Diffusion Policy Perceiver 编码点云 双臂双 LEAP 策略 46 维动作输出 ④ 人在环路纠正(可选) 脚踏板切换 residual/teleop
图 2:DexCap 硬件(左)+ DexIL 三步管线(右)。人体动作通过指尖 IK 重定向到 LEAP 手,点云作为观测,diffusion policy 学出 46 维动作序列;执行时人可穿戴手套实时纠错。

🛠️ 四个关键工程设计

模块设计为什么必要
① EMF 手套(Rokoko)指尖嵌磁传感器,抗视觉遮挡灵巧操作时手-物遮挡极频繁,视觉方法(HaMeR)此时失败;EMF 直接测磁场,看不见也能记位置
② SLAM 手腕追踪(T265)每个手套背侧装 T265(鱼眼 + IMU),SLAM 出 6-DoF 手腕IMU 漂移、纯相机不可携;SLAM 自带地图校正长时间漂移,且不需要外置第三视角
③ LiDAR 背心(L515)胸前 RGB-D LiDAR 记 3D 场景,对齐到 SLAM 世界系策略需要 3D 观测;LiDAR 比纯 RGB 更稳,且把人躯干移动「扣掉」,得到稳定场景
④ 快速校准3D 打印卡槽:采集前 T265 插背心校准(10s),再插手套把校准矩阵转成「常量变换」,之后的所有数据都自动对手套-背心-LiDAR 同步
算法选择选择原因
Retargeting指尖 IK:人 5 指尖 → LEAP 4 指尖(弃小指)+ 6-DoF 手腕研究证实指尖是手物接触最频繁区(HO-3D、GRAB、ARCTIC),保指尖位置就保了功能
观测类型点云(不是 RGB)把人躯干移动隔离到世界系;in-the-wild 数据采集时人一直在动,点云可重对齐到固定世界系
策略头Diffusion Policy + Perceiver 编码双臂 ×(7+16) ×d 步 = 高维输出,回归会塌;diffusion 抗多模;Perceiver 比 PointNet 在双臂任务上 +20%
人在环路残差模式(小修)+ 遥操作模式(大改),脚踏板切换策略已学会基本动作时,大部分 rollout 只需小修,残差够用;偶尔需大调时切遥操作
🔮 直觉:为什么「点云 + diffusion policy」是 in-the-wild 数据的标配?
人穿戴采集时身体会自然晃动,相机也在动 → RGB 帧的「背景」全在变 → 模型学不动。
点云把它变换到统一世界系后,背景对齐,模型只需关注手物关系。
Diffusion policy 又能扛住「同一场景多种抓法」的多模态——双臂 46 维输出,回归必崩。这个组合不是巧合,是 in-the-wild 数据的必然选择。

📊 关键结果:30 分钟数据,60-72% 成功率

6 个任务(海绵拾取、球收集、擦盘、包装、剪剪刀、泡茶),单任务 30-60 分钟 DexCap 数据。

任务DexIL(DP-perc)对比基线
三任务平均(海绵/球/擦盘)0.72BC-RNN-img 0.00;DP-img 0.00;DP-point 0.63
包装(in-the-wild 数据) Subtask / Full0.70 / 0.47DP-img-mask 0.17 / 0.00;BC-RNN-point 0.33 / 0.23
包装 + 30 次人在环路0.83 / 0.57DP-img-mask + 修正 0.47 / 0.33
剪剪刀(挑战性工具)0.45 Subtask / 0.20 Full仅 DexCap 数据时 0/0;人在环路拉起 +45 subtask / +20 full
泡茶(长程多步)0.65 Subtask / 0.25 Full
采集速度(vs 遥操作)3× 快接近自然人手速度
对未见物体的泛化(包装)0.42(人修后)仅 DexCap 数据 0.40
关键洞察:表格里有一个「反直觉但重要」的结果——图像输入策略(DP-img-mask)在 lab 内固定相机下能学到(包装 0.47),但在 in-the-wild 数据上完全失败(0.00)。这印证了:「可穿戴采集」和「点云观测」是绑定的两个创新——没有点云,穿戴数据没法用。

🌐 在领域中的位置

DexPilot / VR 遥操作(要机器人硬件) DexMV / VideoDex(从人视频学,但 2D) DexCap(便携 3D 动捕 + 点云策略)⭐ BunnyVisionPro / Apple Vision Pro 遥操作

DexCap 是「可穿戴数据采集」范式的标志性工作,它和 BunnyVisionPro(用 Vision Pro 做便携遥操作)一起,代表了 2024 年「把数据采集从实验室解放出来」的浪潮。算法上它直接采用了 Diffusion Policy 作为动作头,是扩散策略在高维灵巧手场景的代表应用。

❓ 常见误区

DexCap 是遥操作吗?

不是。数据采集阶段机器人完全不参与——人穿戴 DexCap 在真实环境里做事,系统只录数据。训练阶段用录下的 mocap + 点云离线训策略。执行阶段才有机器人在跑。所以它和 DexPilot、Vision Pro 这类「实时遥操作」是不同范式——DexCap 是「离线采集 + 离线训练」,效率 3× 于遥操作。

$4k 的硬件能复刻吗?

能。论文明确说硬件设计是模块化的,不绑定品牌(手套、相机、迷你 PC 都可替换),代码 + 教学视频开源。整机 3.96 磅、续航 40 分钟、校准 < 10 秒。

为什么不用最近很火的 Vision Pro 做手部追踪?

DexCap 是 2024 年初的工作,Vision Pro(2024-02 上市)那时还没普及。后续的 BunnyVisionPro 证实用 Vision Pro 做遥操作可行——但 DexCap 的定位是离线数据采集,Vision Pro 类系统是实时遥操作,两者解决的问题不同。

指尖 IK retargeting 不会失真吗?

会,特别是手指长度比例差异大的任务(论文以剪刀为例:剪刀稳定握持需要手指深插进手柄,但人手与 LEAP 手指长度比例不同,即使指尖位置对齐也无法保证同样的夹持力)。这就是 DexCap 提供「人在环路纠正」的原因——它不是可选项,是必需品的补丁。