RealDexUMI:让「数据采集的手」就是「部署的手」
🎯 为什么重要:要的是「可部署的灵巧」,不是「采集到的灵巧」
论文一上来就点破一个被忽视的区分:
论文表 1 把所有现有方案放在一张表上对比,每家都只解决了部分问题:
| 系统 | 驱动 DoF | 重量 | 遥操作复杂度 | 无 retarget | 触觉 | 动作-状态对应 |
|---|---|---|---|---|---|---|
| UMI(夹爪) | 1 | 780 g | 低 | ✓ | ✗ | ✗ |
| DexViTac | 6 | <600 g | 低 | ✗ | ✓ | ✗ |
| DEXOP(外骨骼) | 12/9/7 | >1000 g | 高 | ✓ | ✓ | ✗ |
| DEX-Mouse / Exo-viha | 6 | >1000 g | 高 | ✓ / ✗ | ✓ / ✗ | ✓ |
| DexUMI | 12/6 | 850 g | 中 | ✓ | ✓ | ✗ |
| RealDexUMI | 6 | 680 g | 低 | ✓ | ✓ | ✓ |
「全勾」的唯一一家。它怎么做到的?关键就一句话:用同一个灵巧末端模块(dexterous end-effector module)当采集工具 + 部署工具。
💡 核心思想:共享末端模块 + 等距手套,让采集/部署零缝隙
三个互相支撑的关键设计:
① 掌侧等距(isomorphic)手套——不是 mocap 手套(测人手姿态),而是「机器人手命令接口」:6 个磁编码器 1-DoF 对 1-DoF 线性映射到机器人手驱动关节。按下多少,机器人手闭多少,无需 retargeting、无需人手到机器人手的解算。
② 共享传感——手内相机、指尖触觉阵列在采集时就在机器人手上,所以接触面、视觉视角、触觉信号采集/部署完全一致。
③ 手参考系相对动作——动作标签是 $\Delta T_{t,k} = T_t^{-1} T_{t+k}$(在手坐标系下的相对变换),不绑定世界坐标,策略看到的「往前 5cm」永远是相对工具的,所以同一个 checkpoint 可以换机器人身体跑。
🛠️ 怎么做:硬件 + 数据 + 策略接口三件套
| 组件 | 设计 | 关键决定 |
|---|---|---|
| 灵巧手模块 | 11 DoF(5 指 × 屈伸 + 拇指外展),其中 6 DoF 蜗轮蜗杆驱动;聚碳酸酯一体壳;指尖压阻触觉阵列 | 主动 DoF 控制在 6——既保留灵巧性又让手套 1-DoF 对 1-DoF 直接映射;蜗轮蜗杆自锁省电 |
| 等距遥操作手套 | 6 个 AS5600L 磁绝对编码器;ESP32-S3 通过 I2C 读,USB 串口流式输出 200 Hz 命令;扭簧复位 | 「绝对式」编码器 → 上电即可知道当前位置,无需回零;非接触测量无摩擦 |
| 数据流 | RGB 30 Hz / 触觉 20 Hz / 手状态 100 Hz / 手套命令 200 Hz / 位姿 100 Hz;以 RGB 时间戳为锚做「latest-sample」同步 | 同步策略保守:每个时间步只用「不晚于当前 RGB 帧的最新样本」,避免外推 |
| 策略接口 | 观察 $o_t = (I_t, S_t^\text{tactile}, q_t^\text{hand})$;动作 $a_{t,k}=(\Delta p_{t,k}, \Delta r_{t,k}, u_{t+k}^\text{hand})$ 含相对平移、旋转向量、手命令 | 绝对位姿 不进 观察,只用于构造相对动作标签——避免策略记忆采集坐标系 |
| 策略骨干 | 主实验用 ACT(chunk=20);对比实验用 Diffusion Policy(chunk=32) | 同一份观察/动作接口跑两套骨干,验证接口本身通用 |
| 跨本体部署 | 策略预测的 $\Delta \hat T_{t,k}$ 由机械臂正向运动学实现:$\hat T_{t,k}^\text{target} = \hat T_t \cdot \Delta\hat T_{t,k}$ | 不同机械臂(FR3/RM65/Adam-U)只换 IK 和底层控制,策略权重不动 |
传统方法把「下一个时刻的手状态」当动作标签。问题是:手指已经碰到物体时,「状态」停在当前构型,但操作员还在持续按手套(想继续闭紧)。如果策略只学状态,它学不到「碰到阻力时要继续加力」的纠正信号;如果学命令( glove 实际下达的控制量),就保留了「即使没动也要继续按」的意图。这就是论文 §3.4 强调的 action–state correspondence——消融实验里去掉它,成功率从 88.75% 暴跌到 51.25%。
📊 结果:8 个真机任务平均 88.75%;跨 3 本体零训练迁移
主实验:8 个真机任务 × ACT(每个任务 200 段演示,20 次试验)
| 方法 | Cube | Multi-obj | Plug | Cap | Tea | Drawer | Egg | Biman. | 平均 |
|---|---|---|---|---|---|---|---|---|---|
| RealDexUMI | 1.00 | 1.00 | 0.85 | 1.00 | 0.80 | 0.85 | 0.70 | 0.90 | 88.75% |
| w/o tactile | 0.90 | 1.00 | 0.45 | 0.80 | 0.55 | 0.70 | 0.60 | 0.60 | 70.00% |
| state-as-action | 0.65 | 0.85 | 0.30 | 0.35 | 0.20 | 0.45 | 0.60 | 0.70 | 51.25% |
| 维度 | 数字 | 解读 |
|---|---|---|
| 整体平均成功率 | 88.75%(8 任务 / 160 试次) | 覆盖精细插入、长程多阶段、双臂协作 |
| 初始位姿鲁棒性 | cube 任务 4 种初始姿态 × 5 次 = 20/20 全成功 | 相对动作表征摆脱对世界坐标的依赖 |
| 触觉消融 | −18.75%(88.75 → 70.00) | Plug(0.85→0.45)、Tea(0.80→0.55)——视觉难判接触的任务掉得最狠 |
| action-as-state 消融 | −37.50%(88.75 → 51.25) | Plug(0.85→0.30)、Tea(0.80→0.20)——靠接触维持力的任务全崩 |
| 跨本体(FR3 / RM65 / Adam-U) | Cube: 1.00/1.00/1.00;Drawer: 0.85/0.75/0.80 | 同一 checkpoint,零再训练,共 120 试次 |
| Diffusion Policy 对照 | 平均 63.75%(vs ACT 88.75%) | 同一接口下 DP 不如 ACT,尤其在精细/接触任务——ACT 为主、DP 兼容性验证 |
| 采集时遥操作对比 | cap twisting 10/10、tea picking 4/10(vs AVP / Manus) | RealDexUMI 在两个任务上成功率最高 + 完成时间最短 |
| 数据规模 | 100+ 小时,8 任务每任务 200+ 段 | 即将开源数据集 |
🌐 在领域中的位置
RealDexUMI 是灵巧操作数据采集「去 retargeting 化」的标志性工作。它把 UMI 哲学(末端中心、机器人无关)首次完整延伸到灵巧手——但代价是必须用机器人手本身当采集工具,这就需要等距手套这一关键工程突破。关联线索:与 BunnyVisionPro(视觉遥操作)、ACT/ALOHA(leader-follower 双臂)、DexUMI(人手作为接口)形成对照。
❓ 常见误区
等距手套不就是个「力反馈手套」或「mocap 手套」吗?
不是。mocap 手套测人手姿态(关节角、指尖位置),然后必须 retarget 到机器人手;力反馈手套多了一个反向力反馈通道。RealDexUMI 手套不测人手,它只测操作员「按下机械连杆的程度」,直接生成机器人手命令。它是个「机器人手的命令接口」,本质是个 6 自由度的操纵杆,只是戴在手掌上、用手指按。
共享灵巧手当采集工具,是不是只能采到那只特定手能做的动作?
是的,这是 RealDexUMI 的主动取舍——它放弃了「采集人手能做、机器人手做不了」的动作(反正那些动作部署时也用不上)。换来的是「采集到的 = 能部署的」。论文 §6 也明说,这只手只有 6 个主动 DoF,覆盖不到更高 DoF 手的全部能力,未来工作要扩展。
「相对动作」是不是就换了坐标系,没什么大不了?
形式上简单,但收益巨大。绝对位姿依赖采集时的世界坐标和机器人基坐标系——在野外采集时这俩根本对不上。相对动作 $\Delta T = T_t^{-1}T_{t+k}$ 把动作锚定在手本身,策略只看「相对工具往前 5cm」,跟机器人基座在哪无关。这就是为什么 cube 任务在 4 种初始位姿下 20/20 成功、跨 3 种机械臂零训练迁移能跑通。
为什么 ACT 比 Diffusion Policy 好?是不是 DP 不行?
不能这么下结论。论文明确说 DP 实验是兼容性验证,不是调优后的对比;而且 ACT 在小数据(200 段/任务)+ 双臂协调任务上一直表现强。这只能说明「RealDexUMI 数据在 ACT 和 DP 下都能跑」,不能否定 DP——参考 Diffusion Policy 本身。
这不就是 DexUMI 的升级版吗?关键差别是什么?
DexUMI 用穿戴式人手外骨骼采集——人手直接接触物体,外骨骼信号是状态,仍需经过人手到机器人手的映射,且需要 visual inpainting 对齐观察。RealDexUMI 是机器人手直接接触物体(采集时就用机器人末端),信号是命令,观察天然对齐。这是从「human-as-interface」到「robot-hand-as-interface」的范式转变。