枢纽
机器人Franka FR3/RealMan RM65/PND Adam-U
上真机
物理感知
实时
输入模态vision,tactile,proprioception

RealDexUMI:让「数据采集的手」就是「部署的手」

Chaoyi Xu, Yixuan Jiang, Jiahui Huan 等(北京大学 + BeingBeyond + 北航 + LinkerBot + 清华)。arXiv:2606.06033(2026-06)。 项目页 · teleopdata collectiondexterous manipulationcross-embodiment

🧠 一句话心智模型:灵巧操作数据采集的老大难是——「人手采集的动作」和「机器人手能执行的动作」永远对不齐(retargeting 让精细接触信息丢失)。RealDexUMI 的破法是:采集时就让机器人手本身当工具,操作员戴着手套按一下手指,机器人手就跟着弯一下( palm 侧等距手套,1-DoF 线性映射),采集时拍到的图像/触觉/接触面,和部署时一模一样——「零缝隙(zero-gap)」。

🎯 为什么重要:要的是「可部署的灵巧」,不是「采集到的灵巧」

论文一上来就点破一个被忽视的区分:

核心矛盾captured dexterity(采集到的灵巧)≠ deployable dexterity(可部署的灵巧)。你能不能用 mocap 手套把人手动作完整录下来?能。但机器人手的运动学、接触几何、传感器都跟人手不同——录下来的动作必须 retarget(重定向) 才能让机器人执行,而 retarget 会扭曲精细接触。对灵巧操作来说,毫米级的偏差就决定成败。

论文表 1 把所有现有方案放在一张表上对比,每家都只解决了部分问题:

系统驱动 DoF重量遥操作复杂度无 retarget触觉动作-状态对应
UMI(夹爪)1780 g
DexViTac6<600 g
DEXOP(外骨骼)12/9/7>1000 g
DEX-Mouse / Exo-viha6>1000 g✓ / ✗✓ / ✗
DexUMI12/6850 g
RealDexUMI6680 g

「全勾」的唯一一家。它怎么做到的?关键就一句话:用同一个灵巧末端模块(dexterous end-effector module)当采集工具 + 部署工具

💡 核心思想:共享末端模块 + 等距手套,让采集/部署零缝隙

共享灵巧末端模块 轻量手(11 DoF,6 驱动)+ 手内相机 + 指尖触觉阵列 采集时(operator 戴着) · 手腕戴 6-DoF tracker · 掌侧等距手套:6 个磁编码器 → 线性映射到 6 个手部驱动 DoF · 按手套 → 机器人手立刻跟着动 → 由机器人手真正接触物体 采集到的 = 机器人能执行的 部署时(装到机械臂上) · 同一只手 + 同一相机 + 同一触觉 · 相对动作 ΔT = T_t⁻¹ T_{t+k} → 在「手参考系」下预测运动 · 换机械臂只改 IK + 底层控制 → 策略本身不动 同一 checkpoint 跨本体 图示:模块在两端复用,所以观察、接触、动作天然对齐
图 1:RealDexUMI 的「共享末端模块」设计。同一只灵巧手在采集和部署时使用,消除了 retargeting 和视觉对齐问题。

三个互相支撑的关键设计:
① 掌侧等距(isomorphic)手套——不是 mocap 手套(测人手姿态),而是「机器人手命令接口」:6 个磁编码器 1-DoF 对 1-DoF 线性映射到机器人手驱动关节。按下多少,机器人手闭多少,无需 retargeting、无需人手到机器人手的解算。
② 共享传感——手内相机、指尖触觉阵列在采集时就在机器人手上,所以接触面、视觉视角、触觉信号采集/部署完全一致。
③ 手参考系相对动作——动作标签是 $\Delta T_{t,k} = T_t^{-1} T_{t+k}$(在手坐标系下的相对变换),不绑定世界坐标,策略看到的「往前 5cm」永远是相对工具的,所以同一个 checkpoint 可以换机器人身体跑。

🛠️ 怎么做:硬件 + 数据 + 策略接口三件套

组件设计关键决定
灵巧手模块11 DoF(5 指 × 屈伸 + 拇指外展),其中 6 DoF 蜗轮蜗杆驱动;聚碳酸酯一体壳;指尖压阻触觉阵列主动 DoF 控制在 6——既保留灵巧性又让手套 1-DoF 对 1-DoF 直接映射;蜗轮蜗杆自锁省电
等距遥操作手套6 个 AS5600L 磁绝对编码器;ESP32-S3 通过 I2C 读,USB 串口流式输出 200 Hz 命令;扭簧复位「绝对式」编码器 → 上电即可知道当前位置,无需回零;非接触测量无摩擦
数据流RGB 30 Hz / 触觉 20 Hz / 手状态 100 Hz / 手套命令 200 Hz / 位姿 100 Hz;以 RGB 时间戳为锚做「latest-sample」同步同步策略保守:每个时间步只用「不晚于当前 RGB 帧的最新样本」,避免外推
策略接口观察 $o_t = (I_t, S_t^\text{tactile}, q_t^\text{hand})$;动作 $a_{t,k}=(\Delta p_{t,k}, \Delta r_{t,k}, u_{t+k}^\text{hand})$ 含相对平移、旋转向量、手命令绝对位姿 不进 观察,只用于构造相对动作标签——避免策略记忆采集坐标系
策略骨干主实验用 ACT(chunk=20);对比实验用 Diffusion Policy(chunk=32)同一份观察/动作接口跑两套骨干,验证接口本身通用
跨本体部署策略预测的 $\Delta \hat T_{t,k}$ 由机械臂正向运动学实现:$\hat T_{t,k}^\text{target} = \hat T_t \cdot \Delta\hat T_{t,k}$不同机械臂(FR3/RM65/Adam-U)只换 IK 和底层控制,策略权重不动
🔮 直觉:为什么「action–state correspondence(动作-状态对应)」是隐藏的关键?
传统方法把「下一个时刻的手状态」当动作标签。问题是:手指已经碰到物体时,「状态」停在当前构型,但操作员还在持续按手套(想继续闭紧)。如果策略只学状态,它学不到「碰到阻力时要继续加力」的纠正信号;如果学命令( glove 实际下达的控制量),就保留了「即使没动也要继续按」的意图。这就是论文 §3.4 强调的 action–state correspondence——消融实验里去掉它,成功率从 88.75% 暴跌到 51.25%

📊 结果:8 个真机任务平均 88.75%;跨 3 本体零训练迁移

主实验:8 个真机任务 × ACT(每个任务 200 段演示,20 次试验)

方法CubeMulti-objPlugCapTeaDrawerEggBiman.平均
RealDexUMI1.001.000.851.000.800.850.700.9088.75%
w/o tactile0.901.000.450.800.550.700.600.6070.00%
state-as-action0.650.850.300.350.200.450.600.7051.25%
维度数字解读
整体平均成功率88.75%(8 任务 / 160 试次)覆盖精细插入、长程多阶段、双臂协作
初始位姿鲁棒性cube 任务 4 种初始姿态 × 5 次 = 20/20 全成功相对动作表征摆脱对世界坐标的依赖
触觉消融−18.75%(88.75 → 70.00)Plug(0.85→0.45)、Tea(0.80→0.55)——视觉难判接触的任务掉得最狠
action-as-state 消融−37.50%(88.75 → 51.25)Plug(0.85→0.30)、Tea(0.80→0.20)——靠接触维持力的任务全崩
跨本体(FR3 / RM65 / Adam-U)Cube: 1.00/1.00/1.00;Drawer: 0.85/0.75/0.80同一 checkpoint,零再训练,共 120 试次
Diffusion Policy 对照平均 63.75%(vs ACT 88.75%)同一接口下 DP 不如 ACT,尤其在精细/接触任务——ACT 为主、DP 兼容性验证
采集时遥操作对比cap twisting 10/10、tea picking 4/10(vs AVP / Manus)RealDexUMI 在两个任务上成功率最高 + 完成时间最短
数据规模100+ 小时,8 任务每任务 200+ 段即将开源数据集
关键洞察:RealDexUMI 的胜利不在「单一指标最高」,而在首次同时满足:穿戴轻(680 g)+ 遥操作低复杂度(survey 20 人 16 票「Low」)+ 无 retargeting + 触觉 + 动作-状态对应。这是「数据采集接口」这个层级的范式选择——下游策略(ACT/DP)换什么都受益。

🌐 在领域中的位置

夹爪 + UMI(gripper-only) DexUMI / DexViTac(人手 → 机器人手 retarget) RealDexUMI(共享灵巧手 + 等距手套)⭐ 跨本体 VLA / 灵巧操作通用接口

RealDexUMI 是灵巧操作数据采集「去 retargeting 化」的标志性工作。它把 UMI 哲学(末端中心、机器人无关)首次完整延伸到灵巧手——但代价是必须用机器人手本身当采集工具,这就需要等距手套这一关键工程突破。关联线索:与 BunnyVisionPro(视觉遥操作)、ACT/ALOHA(leader-follower 双臂)、DexUMI(人手作为接口)形成对照。

❓ 常见误区

等距手套不就是个「力反馈手套」或「mocap 手套」吗?

不是。mocap 手套测人手姿态(关节角、指尖位置),然后必须 retarget 到机器人手;力反馈手套多了一个反向力反馈通道。RealDexUMI 手套不测人手,它只测操作员「按下机械连杆的程度」,直接生成机器人手命令。它是个「机器人手的命令接口」,本质是个 6 自由度的操纵杆,只是戴在手掌上、用手指按。

共享灵巧手当采集工具,是不是只能采到那只特定手能做的动作?

是的,这是 RealDexUMI 的主动取舍——它放弃了「采集人手能做、机器人手做不了」的动作(反正那些动作部署时也用不上)。换来的是「采集到的 = 能部署的」。论文 §6 也明说,这只手只有 6 个主动 DoF,覆盖不到更高 DoF 手的全部能力,未来工作要扩展。

「相对动作」是不是就换了坐标系,没什么大不了?

形式上简单,但收益巨大。绝对位姿依赖采集时的世界坐标和机器人基坐标系——在野外采集时这俩根本对不上。相对动作 $\Delta T = T_t^{-1}T_{t+k}$ 把动作锚定在手本身策略只看「相对工具往前 5cm」,跟机器人基座在哪无关。这就是为什么 cube 任务在 4 种初始位姿下 20/20 成功、跨 3 种机械臂零训练迁移能跑通。

为什么 ACT 比 Diffusion Policy 好?是不是 DP 不行?

不能这么下结论。论文明确说 DP 实验是兼容性验证,不是调优后的对比;而且 ACT 在小数据(200 段/任务)+ 双臂协调任务上一直表现强。这只能说明「RealDexUMI 数据在 ACT 和 DP 下都能跑」,不能否定 DP——参考 Diffusion Policy 本身。

这不就是 DexUMI 的升级版吗?关键差别是什么?

DexUMI 用穿戴式人手外骨骼采集——人手直接接触物体,外骨骼信号是状态,仍需经过人手到机器人手的映射,且需要 visual inpainting 对齐观察。RealDexUMI 是机器人手直接接触物体(采集时就用机器人末端),信号是命令,观察天然对齐。这是从「human-as-interface」到「robot-hand-as-interface」的范式转变。